
如果你最近开始研究 AI Agent,大概率会遇到一个很现实的问题:不是没有东西学,而是东西实在太多了。
Claude Code、Codex、OpenCode、Gemini CLI、MCP、Skills、RAG、Memory、Multi-Agent、Computer Use、Browser Use……今天刚弄明白 MCP,明天又看到 Skills;刚学会 Claude Code,又有人告诉你应该研究 Multi-Agent。
最后收藏了几百个 GitHub 项目,却始终不知道自己到底应该先学哪个。
最近 GitHub 上有一个很值得收藏的开源项目:awesome-agentic-ai-zh。
它做的事情很简单,就是把 AI Agent 这个越来越庞大的知识体系,整理成一张可以真正照着走的学习地图。目前项目已经整理了 240+ AI / Agent 项目、77 个 MCP / Skill、23 个基础动手练习,整个学习体系被划分为 8 个主要阶段、2 条核心学习路线,以及后续不同的专业方向。
更重要的是,它没有要求所有人按照同一条路线学习,而是先让你搞清楚一个问题:
你到底是想把 Agent 用好,还是想自己开发 Agent?
这个问题,基本决定了你接下来几个月应该学什么。
一、先搞清楚:AI Agent 到底是什么?
很多人第一次学习 Agent,最大的问题就是一上来开始安装各种框架。其实没必要,第一步应该先把 Agent 最基本的工作逻辑搞明白。
传统 ChatGPT 的工作方式,可以简单理解成:
你提问 → AI 回答。
比如你问:帮我分析一下英伟达最近的投资价值。AI 根据当前上下文、已有知识以及可使用的信息给出回答。
Agent 则更进一步。它面对一个任务时,不只是生成一次答案,而是可以围绕目标连续完成多个步骤:
理解任务 → 拆解任务 → 调用工具 → 获取数据 → 分析结果 → 判断下一步 → 继续执行 → 最终交付。
比如你告诉一个 Agent:帮我研究英伟达最近一个季度的基本面变化,并整理成一份投资研究报告。
一个拥有相应工具和数据访问能力的 Agent,可以继续搜索公司资料、获取财报、阅读财报、提取收入和利润数据、查找相关新闻、分析行业变化、对比竞争对手,最后把这些信息整理成研究报告。
所以理解 Agent 最重要的一点是:
Agent 的价值不只是 AI 更会聊天,而是 AI 开始能够调用工具并连续完成任务。
搞明白这一点以后,再看后面的 Tool Use、MCP、Skills、Memory 和 Multi-Agent,就容易理解很多。
二、学习 AI Agent,千万不要一上来就研究 Multi-Agent
这也是这张学习地图最有价值的地方之一。它没有让你一上来就学习复杂框架,而是把 Agent 学习过程拆成了不同阶段。
整体学习顺序可以理解为:
基础能力 → LLM → Prompt → Tool Use → Agent → MCP / Skills → Memory / RAG → Multi-Agent → Computer Use / Browser Use / Sandbox。
这里最容易犯的错误就是跳级。
比如 Python 还不会、API 是什么还不知道、JSON 也看不懂,就直接开始研究 AutoGen、CrewAI、LangGraph 和 Multi-Agent。这样学起来一定非常痛苦,而且很容易学几天就放弃。
所以在正式开始之前,应该先确定自己属于哪一种人。
三、路线 A:CLI Power User
第一种其实也是目前占比非常大的一类人。
你并不想成为 Agent 工程师,也没有必要自己从零开发一套 Agent。你真正想做的是:让 Claude Code、Codex、OpenCode、Gemini CLI 这些现成 Agent 帮自己干活。
比如写代码、做网站、写文章、分析资料、处理 Excel、做研究、自动整理文件、调用浏览器、连接 GitHub、处理自己的知识库,或者把日常重复工作交给 AI。
如果你的需求主要是这些,就没必要先花几个月研究 Agent Framework,直接走 Track A:CLI Power User。
这条路线官方给出的学习时间大约是 8~10 周。
四、第一阶段:把基础补齐
这一部分对应路线图里的 Stage 0:Foundations,建议给自己留出 1~2 周时间。
你不需要因为学习 Agent 就把自己训练成专业程序员,但 Terminal、Git、API、JSON 这些基础概念最好能够看懂,否则后面安装 MCP、配置 Agent 或运行 GitHub 项目时,会经常卡在一些非常基础的问题上。
1. Terminal / CLI
至少要知道终端是什么,知道 cd、ls、mkdir、git clone 这些常用命令大概是干什么的。
不要求背命令,更不要求达到程序员水平。真正的目标只是:以后看到别人让你打开终端输入一条命令时,不会觉得完全陌生。
2. Git 和 GitHub
至少需要理解 Repository、Clone、Commit、Push、Pull、Branch 这些最常见的概念。
原因很简单,现在大量 Agent、MCP Server、Skills 和开源工具都放在 GitHub。未来你安装一个 Skill、部署一个 MCP Server 或研究一个开源 Agent,基本都绕不开 GitHub。
3. API
API 是非常重要的一关。
至少应该理解 API Key、Endpoint、Request、Response、Token 和 JSON 分别是什么意思。
Claude Code 调模型、Agent 调搜索服务、MCP 调外部系统,本质上大量操作都离不开 API。如果连 API Key 是什么都不知道,后面的学习会非常吃力。
4. JSON
JSON 不需要专门学很久。你只需要看到下面这样的东西时,大概知道它是结构化数据:
{
“name”: “Kelvin”,
“task”: “research”,
“model”: “claude”
}
以后配置 MCP、Agent、API 时,你会经常遇到类似内容。
五、第二阶段:搞懂 LLM 到底是怎么工作的
这一部分对应 Stage 1:LLM Basics,普通用户花一周左右理解基本概念就够了。
这一阶段没有必要研究复杂数学公式,重点理解 Token、Context Window、模型、Agent 之间到底是什么关系。
Token 可以简单理解成模型处理文本时使用的基本单位,它会影响上下文长度、API 成本以及部分模型调用方式。
Context Window 则可以简单理解成:AI 一次能够处理多少上下文信息。 后面学习 Memory、RAG、Context Engineering 时,都会继续碰到这个概念。
还有一个非常重要的区别,就是不要把模型和 Agent 混为一谈。
可以粗略理解成:
LLM 是大脑,而 Agent 是大脑 + 工具 + 工作流程 + 执行环境。
Claude、GPT、Gemini 是模型体系,而 Claude Code、Codex 这类产品则进一步把模型放进了能够操作工具、代码和环境的 Agent 工作流中。
六、第三阶段:Prompt Engineering
现在经常有人说 Prompt 已经过时了,其实并不是。进入 Agent 时代以后,Prompt 的作用反而发生了变化。
过去大家研究 Prompt,可能是在研究怎么写一句非常厉害的提示词。现在更重要的是:如何给 Agent 一个清晰的任务、足够的上下文、明确的规则以及最终验收标准。
一个比较实用的 Agent 指令,至少应该考虑四部分:任务、Context、Constraints 和 Output。
比如你可以这样告诉 Agent:
- 研究某家公司最近一个季度的经营情况。优先使用公司财报和官方公告,所有关键数字需要标注来源,最后生成一份 Markdown 格式的投资研究报告,并单独列出潜在风险。
这种写法已经不只是简单问 AI 一个问题,而是在定义一个完整任务。
七、正式进入路线 A:选择一个 CLI Agent
完成前面的基础学习以后,就可以开始真正使用 Agent。
这里最容易犯的错误,就是 Claude Code、Codex、Gemini CLI、OpenCode 全部安装一遍,然后每天比较哪个更厉害。
其实完全没必要。
先选一个,然后连续使用一周。
比如选择 Claude Code,或者选择 Codex。这一周先不要急着研究复杂的 MCP 和 Multi-Agent,只让它完成真实任务。
你可以让它帮你创建一个网站、读取一个文件夹里的资料、分析一个 GitHub 项目结构、修改程序、整理研究资料,或者根据一批材料生成 Markdown 报告。
这一阶段的核心目标只有一个:
习惯把一个完整任务交给 Agent,而不是只把 Agent 当聊天机器人使用。
八、建立自己的 Agent 工作流
当你能够正常使用 Claude Code 或 Codex 以后,就开始进入真正有价值的阶段:Workflow。
以前使用 AI 的方式可能是打开 ChatGPT、问一个问题、复制答案、粘贴到另一个地方,然后继续问。
Agent 的工作方式应该逐渐变成:你给它一个目标,它读取整个项目和上下文,制定执行计划,然后开始操作,执行完成以后进行检查和修改,最后交付结果。
这时候可以开始学习 CLAUDE.md、AGENTS.md、项目规则、可复用 Prompt、任务拆解以及项目上下文管理。
比如你经常写文章,就可以建立一个自己的内容工作区:
content-workspace/
├── research/
├── draft/
├── images/
├── published/
└── CLAUDE.md
然后在 CLAUDE.md 里规定:
- 所有文章使用简体中文。先核实事实,再开始写作。技术内容优先查看官方文档。文章避免营销腔和明显 AI 味,完成以后统一输出 Markdown。
以后 Agent 每次进入这个项目,就可以按照相对固定的规则工作。
这时候你才真正从简单的 AI 对话,开始进入 AI 工作流。
九、开始学习 MCP、Skills、Plugins 和 Subagents
到了 Stage 5,Agent 的能力会开始出现明显变化。
这也是目前很多人最容易把几个概念混在一起的地方。
MCP 是什么?
MCP 可以先简单理解成:
解决 Agent 怎么连接外部工具和数据的问题。
Agent 本身能力再强,如果访问不到你的 GitHub、Google Drive、数据库、浏览器或者内部业务系统,能够完成的事情依然有限。
通过 MCP,可以让 Agent 与不同的工具和数据源建立标准化连接。
所以初学阶段不需要先研究 MCP 协议底层是怎么实现的。
你只需要先搞明白一件事:
MCP 主要解决 Agent 与外部世界连接的问题。
然后亲手连接一两个自己真正需要的服务,比看十篇 MCP 原理文章更有效。
十、Skills 又是什么?
如果说 MCP 更偏向解决 Agent 能够连接什么,那么 Skill 更接近解决 Agent 应该怎么完成某类任务。
比如你可以做一个股票分析 Skill,规定 Agent 每次分析公司时,都按照固定流程执行:先读取财报,再分析收入、利润和现金流,然后检查估值、行业周期和潜在风险,最后按照统一格式生成报告。
这样以后你就不需要每次重新写几十行 Prompt。
从这个角度看,可以简单理解成:
LLM 提供基础智能,Agent 负责执行,MCP 提供外部连接,Skill 提供专业工作方法。
当这几个东西组合起来以后,一个通用 Agent 就开始逐渐变成某个领域的专业 AI 助手。
十一、Subagent 是什么?
当任务越来越复杂以后,一个 Agent 从头做到尾并不一定是最好的方式。
比如让一个 Agent 同时搜索资料、写代码、分析数据、审核结果,任务复杂以后很容易出现上下文混乱。
于是可以把任务拆开:
主 Agent
├── Research Agent
├── Coding Agent
├── Data Agent
└── Review Agent
主 Agent 负责整体协调,不同 Subagent 分别负责自己的任务。
这也是后面理解 Multi-Agent 的基础。
十二、Computer Use、Browser Use 和 Sandbox
这是现在 Agent 发展非常重要的方向。
以前很多 AI 系统主要通过 API 调用外部服务,而现在 Agent 开始进一步获得浏览器、电脑、终端、代码运行环境和 Sandbox 等执行能力。
比如未来一个完整研究任务可能是:Agent 自动打开浏览器查找资料,下载文件,读取数据,运行 Python,生成图表,最后整理成一份报告。
当 Agent 能够真正进入这些执行环境以后,它才开始从一个单纯回答问题的聊天机器人,逐渐变成一个可以完成任务的数字工作者。
十三、如果你只想提高工作效率,学到这里其实已经够了
这一点非常重要,因为很多人学习 AI 最后会产生一种没有必要的焦虑。
看到别人研究 LangGraph,就觉得自己也应该学;看到别人研究 Multi-Agent,又担心自己落后了。
实际上,如果你的目标主要是 AI 写作、AI 编程、AI 研究、AI 办公、数据分析和自动化,那么把 Claude Code 或 Codex、MCP、Skills、Workflow 以及基础的 Computer Use 真正用起来,已经能够解决大量实际问题。
并不是所有人都需要成为 Agent Engineer。
如果现成 Agent 已经能够解决你的问题,就先把它用到极致。
只有当你真正发现现成工具无法满足需求时,再进入路线 B。
十四、路线 B:Agent Builder
如果你的目标不是使用 Agent,而是自己开发 Agent 产品或者 Agent 系统,那么就需要继续进入 Track B。
这条路线会明显更加技术化,学习顺序大致是:
基础 → LLM → Prompt → Tool Use → Agent Framework → MCP / Skills → Memory / RAG → Multi-Agent → Computer Use。
基础 → LLM → 提示 → 工具使用 → 代理框架 → MCP / 技能 → 记忆 / RAG → 多代理 → 计算机使用。
其中真正的分水岭,是 Tool Use。
十五、Tool Use:Agent Builder 真正的起点
你需要开始理解模型为什么会调用工具,以及模型是如何判断什么时候应该调用哪个工具的。
比如你给 AI 提供几个工具:
search_web()
搜索网络()
read_file()
读取文件()
write_file()
run_python()
运行 Python 函数
然后告诉它:帮我研究 Tesla 最近的财务状况。
模型就需要判断什么时候搜索资料、什么时候读取文件、什么时候运行 Python、什么时候继续执行,以及什么时候任务已经完成。
这就是 Tool Use 的核心。
当你真正理解这一层以后,再去研究 Agent Framework,会轻松很多。
十六、Agent Framework:不要同时学五个
进入 Agent Framework 以后,你会看到 LangGraph、AutoGen、CrewAI、OpenAI Agents SDK、PydanticAI 等大量框架。
这里最容易犯的错误还是:全部都学。
正确的方法是选一个框架,做一个真实项目。
比如做一个 AI 股票研究 Agent。输入一只股票以后,让 Agent 自动获取公司资料、读取财务数据、分析相关新闻和行业变化、进行估值分析,最后生成研究报告。
真正完成这样一个项目,比同时看五个 Agent Framework 的教程更有价值。
十七、Memory 和 RAG
当 Agent 开始真正工作以后,很快会遇到两个问题:它怎么记住过去的信息?它怎么从大量自己的资料中找到真正相关的内容?
第一个问题对应 Memory。
Memory 可以简单理解成让 Agent 保存过去的重要信息,比如用户偏好、历史任务、长期状态或者某些关键上下文。
第二个问题对应 RAG。
假设你有 1000 份 PDF、500 篇文章、大量公司财报、行业报告和会议记录,不可能每次提问时把所有内容全部塞进 Prompt。
RAG 的基本逻辑就是:
用户提出问题 → 系统搜索知识库 → 找到相关资料 → 把相关内容放进 Context → LLM 根据资料回答。
所以 RAG 真正解决的是:如何让 AI 从大量外部知识中找到当前真正需要的信息。
十八、Multi-Agent:到这里再学就合理了
学完前面的 Tool Use、Agent Framework、Memory 和 RAG,再进入 Multi-Agent 就会自然很多。
比如你想建立一支 AI 投资研究团队,可以设计 Research Agent 负责搜索资料,Financial Agent 负责财务分析,Industry Agent 负责行业研究,Valuation Agent 负责估值,Risk Agent 专门寻找风险,最后由 Chief Investment Agent 综合所有结果。
这样系统就从一个 Agent,逐渐变成一支能够协作的 AI 团队。
但这里要特别注意:
Multi-Agent 并不是 Agent 越多越好。
如果一个 Agent 就能完成任务,完全没有必要为了 Multi-Agent 而 Multi-Agent。只有任务真的能够拆成多个相对独立、需要不同上下文或者不同专业能力的部分时,多 Agent 才有实际价值。
十九、普通人到底应该选哪条路线?
其实判断方法非常简单。
如果你是产品经理、运营、销售、投资研究人员、内容创作者、创业者、独立开发者或者普通 AI 用户,建议优先走 Track A。
先把:
Claude Code / Codex + MCP + Skills + Workflow
真正用起来。
如果以后发现现成 Agent 已经满足不了自己的需求,再进入 Track B,继续学习 Tool Use、Agent Framework、Memory、RAG、Multi-Agent 和 Computer Use。
这样学习效率会高很多。
二十、给普通人的 10 周实战学习计划
如果从今天开始重新学习 AI Agent,我更建议按照下面这个节奏执行,而不是每天追新工具。
第 1 周:基础。 学习 Terminal、Git、GitHub、API 和 JSON。目标不是学编程,而是能够看懂基本命令,并正常运行一些 GitHub 开源项目。
第 2 周:LLM。 搞懂 Token、Context、API、Prompt,以及模型和 Agent 的区别。目标是建立基本认知,不需要研究复杂理论。
第 3 周:CLI Agent。 Claude Code 和 Codex 选择一个作为主力工具,每天至少交给它一个真实任务,不要只做 Demo。
第 4 周:Workflow。 开始学习 CLAUDE.md、AGENTS.md、项目上下文、任务拆解和工作流,建立自己的第一个 AI Workspace。
第 5 周:MCP。 不要一次安装几十个 MCP Server,先连接 1~2 个自己真的会使用的数据源或工具。
第 6 周:Skills。 自己写一个简单 Skill,可以是文章研究 Skill、股票分析 Skill、销售分析 Skill,或者任何与你实际工作相关的 Skill。
第 7 周:Subagent。 找一个复杂任务,把它拆成 2~3 个角色,体验主 Agent 与 Subagent 的协作方式。
第 8 周:Browser / Computer Use。 开始尝试让 Agent 操作浏览器、代码环境或者 Sandbox,把 Agent 从纯文本世界带进真实执行环境。
第 9 周:完整项目。 暂停学习新概念,只做一个真正可以使用的项目,例如 AI 投资研究工作台、AI 内容生产工作台或者 AI 销售助手。
第 10 周:优化。 不再追新工具,而是回头检查自己的整个系统:哪些任务可以自动化?哪些 Prompt 可以变成 Skill?哪些数据应该通过 MCP 接入?哪些工作可以交给 Agent?哪些关键环节必须人工审核?
如果这五个问题能够回答清楚,你已经开始真正理解 Agent 了。
二十一、学习 Agent 最重要的方法:边学边做
不要按照看教程、收藏项目、继续看教程、继续收藏项目的方式学习 Agent。
这种学习方式最大的问题是,看起来每天都在学,实际上自己的工作方式没有发生任何改变。
更有效的方法是:
学一个概念 → 做一个东西 → 遇到问题 → 再学一个概念 → 用新知识解决问题。
学 Prompt,就马上写一个真正会反复使用的 Prompt;学 Claude Code,就马上用它完成一个项目;学 MCP,就马上连接一个自己需要的服务;学 Skill,就马上写一个 Skill;学 RAG,就做一个自己的知识库;学 Multi-Agent,就把一个真实任务拆成两个 Agent。
不要把学会当目标,把做出来当目标。
二十二、 这个AI Agent 真正解决了什么?
我认为 awesome-agentic-ai-zh 最有价值的地方,并不是它收集了 240+ 项目。
GitHub 从来不缺项目,AI 时代更不缺教程。
真正稀缺的是:学习顺序。
它实际上帮我们回答了三个很重要的问题:我现在在哪里?下一步应该学什么?学到什么程度可以先停下来?
尤其是最后一个问题。
并不是所有人都需要成为 Agent Engineer。
未来使用 AI Agent 的能力,大致可以分成三个层次。
第一层是会使用 Agent。能够把 Claude Code、Codex 等 Agent 真正融入自己的工作。
第二层是会配置 Agent。能够使用 MCP、Skills、Memory、Workflow,把通用 Agent 改造成适合自己的 AI 工作系统。
第三层是会构建 Agent。能够开发 Tool Use、Agent Framework、RAG、Multi-Agent、Computer Use 等真正的 Agent 产品和系统。
对于绝大多数普通人来说,先成为第一层,再进入第二层,就已经能够获得非常大的效率提升。
等真正遇到现成工具解决不了的问题,再进入第三层。
这比一开始就扎进各种 Agent Framework,要现实得多。
最后
如果你第一次打开 awesome-agentic-ai-zh,不建议直接冲进那 240+ 个项目里挨个看。
先确定一件事:
你是想把 Agent 用好,还是想自己开发 Agent?
如果只是想把 Claude Code、Codex、MCP、Skills 用好,直接走 Track A。
如果最终目标是自己开发 Agent 产品,再走 Track B。
如果现在还不知道自己属于哪一种,也很简单:
先走 A。
先让 Agent 真正帮你完成工作。
等你开始遇到现成 Agent 的边界,自然就会知道自己为什么需要学习 Tool Use、RAG、Memory 和 Multi-Agent。
AI Agent 真正值得学习的,不是今天又出现了什么新名词,而是:
你能不能把这些东西组合起来,真正替自己解决问题。