AI Agent学习资料大全:从入门到实战的完整指南

AI Agent学习资料大全:从入门到实战的完整指南

如果你最近开始研究 AI Agent,大概率会遇到一个很现实的问题:不是没有东西学,而是东西实在太多了。

Claude Code、Codex、OpenCode、Gemini CLI、MCP、Skills、RAG、Memory、Multi-Agent、Computer Use、Browser Use……今天刚弄明白 MCP,明天又看到 Skills;刚学会 Claude Code,又有人告诉你应该研究 Multi-Agent。

最后收藏了几百个 GitHub 项目,却始终不知道自己到底应该先学哪个。

最近 GitHub 上有一个很值得收藏的开源项目:awesome-agentic-ai-zh

它做的事情很简单,就是把 AI Agent 这个越来越庞大的知识体系,整理成一张可以真正照着走的学习地图。目前项目已经整理了 240+ AI / Agent 项目、77 个 MCP / Skill、23 个基础动手练习,整个学习体系被划分为 8 个主要阶段、2 条核心学习路线,以及后续不同的专业方向

更重要的是,它没有要求所有人按照同一条路线学习,而是先让你搞清楚一个问题:

你到底是想把 Agent 用好,还是想自己开发 Agent?

这个问题,基本决定了你接下来几个月应该学什么。

一、先搞清楚:AI Agent 到底是什么?

很多人第一次学习 Agent,最大的问题就是一上来开始安装各种框架。其实没必要,第一步应该先把 Agent 最基本的工作逻辑搞明白。

传统 ChatGPT 的工作方式,可以简单理解成:

你提问 → AI 回答。

比如你问:帮我分析一下英伟达最近的投资价值。AI 根据当前上下文、已有知识以及可使用的信息给出回答。

Agent 则更进一步。它面对一个任务时,不只是生成一次答案,而是可以围绕目标连续完成多个步骤:

理解任务 → 拆解任务 → 调用工具 → 获取数据 → 分析结果 → 判断下一步 → 继续执行 → 最终交付。

比如你告诉一个 Agent:帮我研究英伟达最近一个季度的基本面变化,并整理成一份投资研究报告。

一个拥有相应工具和数据访问能力的 Agent,可以继续搜索公司资料、获取财报、阅读财报、提取收入和利润数据、查找相关新闻、分析行业变化、对比竞争对手,最后把这些信息整理成研究报告。

所以理解 Agent 最重要的一点是:

Agent 的价值不只是 AI 更会聊天,而是 AI 开始能够调用工具并连续完成任务。

搞明白这一点以后,再看后面的 Tool Use、MCP、Skills、Memory 和 Multi-Agent,就容易理解很多。

二、学习 AI Agent,千万不要一上来就研究 Multi-Agent

这也是这张学习地图最有价值的地方之一。它没有让你一上来就学习复杂框架,而是把 Agent 学习过程拆成了不同阶段。

整体学习顺序可以理解为:

基础能力 → LLM → Prompt → Tool Use → Agent → MCP / Skills → Memory / RAG → Multi-Agent → Computer Use / Browser Use / Sandbox。 

这里最容易犯的错误就是跳级。

比如 Python 还不会、API 是什么还不知道、JSON 也看不懂,就直接开始研究 AutoGen、CrewAI、LangGraph 和 Multi-Agent。这样学起来一定非常痛苦,而且很容易学几天就放弃。

所以在正式开始之前,应该先确定自己属于哪一种人。

三、路线 A:CLI Power User

第一种其实也是目前占比非常大的一类人。

你并不想成为 Agent 工程师,也没有必要自己从零开发一套 Agent。你真正想做的是:让 Claude Code、Codex、OpenCode、Gemini CLI 这些现成 Agent 帮自己干活。

比如写代码、做网站、写文章、分析资料、处理 Excel、做研究、自动整理文件、调用浏览器、连接 GitHub、处理自己的知识库,或者把日常重复工作交给 AI。

如果你的需求主要是这些,就没必要先花几个月研究 Agent Framework,直接走 Track A:CLI Power User

这条路线官方给出的学习时间大约是 8~10 周

四、第一阶段:把基础补齐

这一部分对应路线图里的 Stage 0:Foundations,建议给自己留出 1~2 周时间。

你不需要因为学习 Agent 就把自己训练成专业程序员,但 Terminal、Git、API、JSON 这些基础概念最好能够看懂,否则后面安装 MCP、配置 Agent 或运行 GitHub 项目时,会经常卡在一些非常基础的问题上。

1. Terminal / CLI

至少要知道终端是什么,知道 cd、ls、mkdir、git clone 这些常用命令大概是干什么的。

不要求背命令,更不要求达到程序员水平。真正的目标只是:以后看到别人让你打开终端输入一条命令时,不会觉得完全陌生。

2. Git 和 GitHub

至少需要理解 Repository、Clone、Commit、Push、Pull、Branch 这些最常见的概念。

原因很简单,现在大量 Agent、MCP Server、Skills 和开源工具都放在 GitHub。未来你安装一个 Skill、部署一个 MCP Server 或研究一个开源 Agent,基本都绕不开 GitHub。

3. API

API 是非常重要的一关。

至少应该理解 API Key、Endpoint、Request、Response、Token 和 JSON 分别是什么意思。

Claude Code 调模型、Agent 调搜索服务、MCP 调外部系统,本质上大量操作都离不开 API。如果连 API Key 是什么都不知道,后面的学习会非常吃力。

4. JSON

JSON 不需要专门学很久。你只需要看到下面这样的东西时,大概知道它是结构化数据:

{
“name”: “Kelvin”,
“task”: “research”,
“model”: “claude”
}

以后配置 MCP、Agent、API 时,你会经常遇到类似内容。

五、第二阶段:搞懂 LLM 到底是怎么工作的

这一部分对应 Stage 1:LLM Basics,普通用户花一周左右理解基本概念就够了。

这一阶段没有必要研究复杂数学公式,重点理解 Token、Context Window、模型、Agent 之间到底是什么关系。

Token 可以简单理解成模型处理文本时使用的基本单位,它会影响上下文长度、API 成本以及部分模型调用方式。

Context Window 则可以简单理解成:AI 一次能够处理多少上下文信息。 后面学习 Memory、RAG、Context Engineering 时,都会继续碰到这个概念。

还有一个非常重要的区别,就是不要把模型和 Agent 混为一谈。

可以粗略理解成:

LLM 是大脑,而 Agent 是大脑 + 工具 + 工作流程 + 执行环境。

Claude、GPT、Gemini 是模型体系,而 Claude Code、Codex 这类产品则进一步把模型放进了能够操作工具、代码和环境的 Agent 工作流中。

六、第三阶段:Prompt Engineering

现在经常有人说 Prompt 已经过时了,其实并不是。进入 Agent 时代以后,Prompt 的作用反而发生了变化。

过去大家研究 Prompt,可能是在研究怎么写一句非常厉害的提示词。现在更重要的是:如何给 Agent 一个清晰的任务、足够的上下文、明确的规则以及最终验收标准。

一个比较实用的 Agent 指令,至少应该考虑四部分:任务、Context、Constraints 和 Output。

比如你可以这样告诉 Agent:

  • 研究某家公司最近一个季度的经营情况。优先使用公司财报和官方公告,所有关键数字需要标注来源,最后生成一份 Markdown 格式的投资研究报告,并单独列出潜在风险。

这种写法已经不只是简单问 AI 一个问题,而是在定义一个完整任务。

七、正式进入路线 A:选择一个 CLI Agent

完成前面的基础学习以后,就可以开始真正使用 Agent。

这里最容易犯的错误,就是 Claude Code、Codex、Gemini CLI、OpenCode 全部安装一遍,然后每天比较哪个更厉害。

其实完全没必要。

先选一个,然后连续使用一周。

比如选择 Claude Code,或者选择 Codex。这一周先不要急着研究复杂的 MCP 和 Multi-Agent,只让它完成真实任务。

你可以让它帮你创建一个网站、读取一个文件夹里的资料、分析一个 GitHub 项目结构、修改程序、整理研究资料,或者根据一批材料生成 Markdown 报告。

这一阶段的核心目标只有一个:

习惯把一个完整任务交给 Agent,而不是只把 Agent 当聊天机器人使用。

八、建立自己的 Agent 工作流

当你能够正常使用 Claude Code 或 Codex 以后,就开始进入真正有价值的阶段:Workflow。

以前使用 AI 的方式可能是打开 ChatGPT、问一个问题、复制答案、粘贴到另一个地方,然后继续问。

Agent 的工作方式应该逐渐变成:你给它一个目标,它读取整个项目和上下文,制定执行计划,然后开始操作,执行完成以后进行检查和修改,最后交付结果。

这时候可以开始学习 CLAUDE.md、AGENTS.md、项目规则、可复用 Prompt、任务拆解以及项目上下文管理。

比如你经常写文章,就可以建立一个自己的内容工作区:

content-workspace/
├── research/
├── draft/
├── images/
├── published/
└── CLAUDE.md

然后在 CLAUDE.md 里规定:

  • 所有文章使用简体中文。先核实事实,再开始写作。技术内容优先查看官方文档。文章避免营销腔和明显 AI 味,完成以后统一输出 Markdown。

以后 Agent 每次进入这个项目,就可以按照相对固定的规则工作。

这时候你才真正从简单的 AI 对话,开始进入 AI 工作流

九、开始学习 MCP、Skills、Plugins 和 Subagents

到了 Stage 5,Agent 的能力会开始出现明显变化。

这也是目前很多人最容易把几个概念混在一起的地方。

MCP 是什么?

MCP 可以先简单理解成:

解决 Agent 怎么连接外部工具和数据的问题。

Agent 本身能力再强,如果访问不到你的 GitHub、Google Drive、数据库、浏览器或者内部业务系统,能够完成的事情依然有限。

通过 MCP,可以让 Agent 与不同的工具和数据源建立标准化连接。

所以初学阶段不需要先研究 MCP 协议底层是怎么实现的。

你只需要先搞明白一件事:

MCP 主要解决 Agent 与外部世界连接的问题。

然后亲手连接一两个自己真正需要的服务,比看十篇 MCP 原理文章更有效。

十、Skills 又是什么?

如果说 MCP 更偏向解决 Agent 能够连接什么,那么 Skill 更接近解决 Agent 应该怎么完成某类任务

比如你可以做一个股票分析 Skill,规定 Agent 每次分析公司时,都按照固定流程执行:先读取财报,再分析收入、利润和现金流,然后检查估值、行业周期和潜在风险,最后按照统一格式生成报告。

这样以后你就不需要每次重新写几十行 Prompt。

从这个角度看,可以简单理解成:

LLM 提供基础智能,Agent 负责执行,MCP 提供外部连接,Skill 提供专业工作方法。

当这几个东西组合起来以后,一个通用 Agent 就开始逐渐变成某个领域的专业 AI 助手。

十一、Subagent 是什么?

当任务越来越复杂以后,一个 Agent 从头做到尾并不一定是最好的方式。

比如让一个 Agent 同时搜索资料、写代码、分析数据、审核结果,任务复杂以后很容易出现上下文混乱。

于是可以把任务拆开:

主 Agent
├── Research Agent
├── Coding Agent
├── Data Agent
└── Review Agent

主 Agent 负责整体协调,不同 Subagent 分别负责自己的任务。

这也是后面理解 Multi-Agent 的基础。

十二、Computer Use、Browser Use 和 Sandbox

这是现在 Agent 发展非常重要的方向。

以前很多 AI 系统主要通过 API 调用外部服务,而现在 Agent 开始进一步获得浏览器、电脑、终端、代码运行环境和 Sandbox 等执行能力。

比如未来一个完整研究任务可能是:Agent 自动打开浏览器查找资料,下载文件,读取数据,运行 Python,生成图表,最后整理成一份报告。

当 Agent 能够真正进入这些执行环境以后,它才开始从一个单纯回答问题的聊天机器人,逐渐变成一个可以完成任务的数字工作者。

十三、如果你只想提高工作效率,学到这里其实已经够了

这一点非常重要,因为很多人学习 AI 最后会产生一种没有必要的焦虑。

看到别人研究 LangGraph,就觉得自己也应该学;看到别人研究 Multi-Agent,又担心自己落后了。

实际上,如果你的目标主要是 AI 写作、AI 编程、AI 研究、AI 办公、数据分析和自动化,那么把 Claude Code 或 Codex、MCP、Skills、Workflow 以及基础的 Computer Use 真正用起来,已经能够解决大量实际问题。

并不是所有人都需要成为 Agent Engineer。

如果现成 Agent 已经能够解决你的问题,就先把它用到极致。

只有当你真正发现现成工具无法满足需求时,再进入路线 B。

十四、路线 B:Agent Builder

如果你的目标不是使用 Agent,而是自己开发 Agent 产品或者 Agent 系统,那么就需要继续进入 Track B。

这条路线会明显更加技术化,学习顺序大致是:

基础 → LLM → Prompt → Tool Use → Agent Framework → MCP / Skills → Memory / RAG → Multi-Agent → Computer Use。
基础 → LLM → 提示 → 工具使用 → 代理框架 → MCP / 技能 → 记忆 / RAG → 多代理 → 计算机使用。

其中真正的分水岭,是 Tool Use。

十五、Tool Use:Agent Builder 真正的起点

你需要开始理解模型为什么会调用工具,以及模型是如何判断什么时候应该调用哪个工具的。

比如你给 AI 提供几个工具:

search_web()
搜索网络()
read_file()
读取文件()
write_file()
run_python()
运行 Python 函数

然后告诉它:帮我研究 Tesla 最近的财务状况。

模型就需要判断什么时候搜索资料、什么时候读取文件、什么时候运行 Python、什么时候继续执行,以及什么时候任务已经完成。

这就是 Tool Use 的核心。

当你真正理解这一层以后,再去研究 Agent Framework,会轻松很多。

十六、Agent Framework:不要同时学五个

进入 Agent Framework 以后,你会看到 LangGraph、AutoGen、CrewAI、OpenAI Agents SDK、PydanticAI 等大量框架。

这里最容易犯的错误还是:全部都学。

正确的方法是选一个框架,做一个真实项目

比如做一个 AI 股票研究 Agent。输入一只股票以后,让 Agent 自动获取公司资料、读取财务数据、分析相关新闻和行业变化、进行估值分析,最后生成研究报告。

真正完成这样一个项目,比同时看五个 Agent Framework 的教程更有价值。

十七、Memory 和 RAG

当 Agent 开始真正工作以后,很快会遇到两个问题:它怎么记住过去的信息?它怎么从大量自己的资料中找到真正相关的内容?

第一个问题对应 Memory

Memory 可以简单理解成让 Agent 保存过去的重要信息,比如用户偏好、历史任务、长期状态或者某些关键上下文。

第二个问题对应 RAG

假设你有 1000 份 PDF、500 篇文章、大量公司财报、行业报告和会议记录,不可能每次提问时把所有内容全部塞进 Prompt。

RAG 的基本逻辑就是:

用户提出问题 → 系统搜索知识库 → 找到相关资料 → 把相关内容放进 Context → LLM 根据资料回答。

所以 RAG 真正解决的是:如何让 AI 从大量外部知识中找到当前真正需要的信息。

十八、Multi-Agent:到这里再学就合理了

学完前面的 Tool Use、Agent Framework、Memory 和 RAG,再进入 Multi-Agent 就会自然很多。

比如你想建立一支 AI 投资研究团队,可以设计 Research Agent 负责搜索资料,Financial Agent 负责财务分析,Industry Agent 负责行业研究,Valuation Agent 负责估值,Risk Agent 专门寻找风险,最后由 Chief Investment Agent 综合所有结果。

这样系统就从一个 Agent,逐渐变成一支能够协作的 AI 团队。

但这里要特别注意:

Multi-Agent 并不是 Agent 越多越好。

如果一个 Agent 就能完成任务,完全没有必要为了 Multi-Agent 而 Multi-Agent。只有任务真的能够拆成多个相对独立、需要不同上下文或者不同专业能力的部分时,多 Agent 才有实际价值。

十九、普通人到底应该选哪条路线?

其实判断方法非常简单。

如果你是产品经理、运营、销售、投资研究人员、内容创作者、创业者、独立开发者或者普通 AI 用户,建议优先走 Track A

先把:

Claude Code / Codex + MCP + Skills + Workflow

真正用起来。

如果以后发现现成 Agent 已经满足不了自己的需求,再进入 Track B,继续学习 Tool Use、Agent Framework、Memory、RAG、Multi-Agent 和 Computer Use。

这样学习效率会高很多。

二十、给普通人的 10 周实战学习计划

如果从今天开始重新学习 AI Agent,我更建议按照下面这个节奏执行,而不是每天追新工具。

第 1 周:基础。 学习 Terminal、Git、GitHub、API 和 JSON。目标不是学编程,而是能够看懂基本命令,并正常运行一些 GitHub 开源项目。

第 2 周:LLM。 搞懂 Token、Context、API、Prompt,以及模型和 Agent 的区别。目标是建立基本认知,不需要研究复杂理论。

第 3 周:CLI Agent。 Claude Code 和 Codex 选择一个作为主力工具,每天至少交给它一个真实任务,不要只做 Demo。

第 4 周:Workflow。 开始学习 CLAUDE.md、AGENTS.md、项目上下文、任务拆解和工作流,建立自己的第一个 AI Workspace。

第 5 周:MCP。 不要一次安装几十个 MCP Server,先连接 1~2 个自己真的会使用的数据源或工具。

第 6 周:Skills。 自己写一个简单 Skill,可以是文章研究 Skill、股票分析 Skill、销售分析 Skill,或者任何与你实际工作相关的 Skill。

第 7 周:Subagent。 找一个复杂任务,把它拆成 2~3 个角色,体验主 Agent 与 Subagent 的协作方式。

第 8 周:Browser / Computer Use。 开始尝试让 Agent 操作浏览器、代码环境或者 Sandbox,把 Agent 从纯文本世界带进真实执行环境。

第 9 周:完整项目。 暂停学习新概念,只做一个真正可以使用的项目,例如 AI 投资研究工作台、AI 内容生产工作台或者 AI 销售助手。

第 10 周:优化。 不再追新工具,而是回头检查自己的整个系统:哪些任务可以自动化?哪些 Prompt 可以变成 Skill?哪些数据应该通过 MCP 接入?哪些工作可以交给 Agent?哪些关键环节必须人工审核?

如果这五个问题能够回答清楚,你已经开始真正理解 Agent 了。

二十一、学习 Agent 最重要的方法:边学边做

不要按照看教程、收藏项目、继续看教程、继续收藏项目的方式学习 Agent。

这种学习方式最大的问题是,看起来每天都在学,实际上自己的工作方式没有发生任何改变。

更有效的方法是:

学一个概念 → 做一个东西 → 遇到问题 → 再学一个概念 → 用新知识解决问题。

学 Prompt,就马上写一个真正会反复使用的 Prompt;学 Claude Code,就马上用它完成一个项目;学 MCP,就马上连接一个自己需要的服务;学 Skill,就马上写一个 Skill;学 RAG,就做一个自己的知识库;学 Multi-Agent,就把一个真实任务拆成两个 Agent。

不要把学会当目标,把做出来当目标。

二十二、 这个AI Agent 真正解决了什么?

我认为 awesome-agentic-ai-zh 最有价值的地方,并不是它收集了 240+ 项目。

GitHub 从来不缺项目,AI 时代更不缺教程。

真正稀缺的是:学习顺序。

它实际上帮我们回答了三个很重要的问题:我现在在哪里?下一步应该学什么?学到什么程度可以先停下来?

尤其是最后一个问题。

并不是所有人都需要成为 Agent Engineer。

未来使用 AI Agent 的能力,大致可以分成三个层次。

第一层是会使用 Agent。能够把 Claude Code、Codex 等 Agent 真正融入自己的工作。

第二层是会配置 Agent。能够使用 MCP、Skills、Memory、Workflow,把通用 Agent 改造成适合自己的 AI 工作系统。

第三层是会构建 Agent。能够开发 Tool Use、Agent Framework、RAG、Multi-Agent、Computer Use 等真正的 Agent 产品和系统。

对于绝大多数普通人来说,先成为第一层,再进入第二层,就已经能够获得非常大的效率提升。

等真正遇到现成工具解决不了的问题,再进入第三层。

这比一开始就扎进各种 Agent Framework,要现实得多。

最后

如果你第一次打开 awesome-agentic-ai-zh,不建议直接冲进那 240+ 个项目里挨个看。

先确定一件事:

你是想把 Agent 用好,还是想自己开发 Agent?

如果只是想把 Claude Code、Codex、MCP、Skills 用好,直接走 Track A

如果最终目标是自己开发 Agent 产品,再走 Track B

如果现在还不知道自己属于哪一种,也很简单:

先走 A。

先让 Agent 真正帮你完成工作。

等你开始遇到现成 Agent 的边界,自然就会知道自己为什么需要学习 Tool Use、RAG、Memory 和 Multi-Agent。

AI Agent 真正值得学习的,不是今天又出现了什么新名词,而是:

你能不能把这些东西组合起来,真正替自己解决问题。

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
教程百科

ComfyUI 从安装入门到精通,Depth 深挖 + 高清放大(清晰度再提一档)

2026-8-20 9:42:26

资讯

毕马威:中国职场 AI应用率高达 93%,半数使用者达到常态化应用水平

2025-5-12 19:12:42

搜索