关联主题:: Skills、Agent、Commands、Plugins
关联概念:: Skill、Agent、Prompt、SOP、Codex
同级::
下一级::
- 本文仅为小白科普,不做复杂展开。
一、Skill、Agent、Codex分别是什么?
模型 GPT = 人的大脑——>大脑
Codex = 项目经理 + 工作台——>人➕工具
Agent = 不同职责的员工(项目经理手下的员工)——>人
Skill = 员工执行任务时使用的 SOP——>工具
- 这样一区分应该就特别好理解了。
| 概念 | 它更像什么 | 它主要解决什么问题 |
|---|---|---|
| Prompt(提示词) | 我临时交代的一句话 | 这一次想让 AI 做什么 |
| SOP | 写给人看的标准流程 | 人应该按什么步骤做 |
| Skill | 写给 AI 看的工作手册 | AI 遇到这类任务时应该怎么做 |
| Agent | 负责执行任务的 AI 执行者 | 谁来判断、调用工具并把任务推进下去 |
| Codex / Claude Code | 一间带工具的工作室 | 让模型、Agents、Skills 和文件工具协同工作 |
- Prompt 是一次性的指令;
- SOP 是一套流程;
- Skill 是把流程整理成 AI 能识别、能复用的能力包;
- Agent 是拿到目标后,能够自主推进任务的执行者;
- Codex 是承载这一切的工作环境。
1.1 Skill
Skill 更像一份详细 SOP 或操作手册。
Skill = 方法、流程、SOP
举例说明
比如,做饭需要菜谱,具体每一步怎么做,这就是SOP。
你可能也听过另一个东西——提示词,这个更简单,可以理解为指令。
指令是给AI的,但是同一个指令即使给到同一个AI,每次结果可能也是不一样的。比如在chatgpt打开两个不同的对话,同一个指令得到的答案可能是不一样的。
skills不是提示词,但是包含提示词。
还是以做菜为例,skills就是加强版的SOP,包含了厨师、锅碗瓢盆、调味品、食材、锅器具等,这些都打包在一起了。
给任何一个Agent都可以直接调用。输入的内容不同,Skills作为系统,输出的结果都是一样的,是可以复用的流程。
在 Claude Code、Codex 这类工具里,一个 Skill 通常至少有一个 SKILL.md,也可以附带脚本、参考资料、模板和其他资源。
skills包含的内容
一个 Skill 目录通常可以包含:
- SKILL.md:使用条件、处理步骤和输出要求;
- scripts/:需要稳定执行的脚本;
- references/:工作时需要查阅的资料;
- assets/:模板、图片等资源。
这就比一条普通提示词完整得多。
Skill 可以看作是面向 AI 的 SOP,但它不只是 SOP,还把触发条件、上下文、工具、模板和检查规则一起打包了。
- 你在互联网上做的任何操作,只要能描述清楚流程的,都会沉底出SOP,也就是都可以让AI帮你做成SKills,然后调用这个SKills。
SKills的诞生以及官方的解释
Anthropic 官方给出的动机是:通用大模型像一个”从第一性原理现推的 300 IQ 数学天才”,而真实工作需要的往往是”填过几千份税表的老手”的累积经验(accumulated expertise)。通用 Agent 缺的不是推理能力,而是”没人写下来的流程”(procedural knowledge)和组织上下文。于是他们把”指令 + 脚本 + 资源”打包成可被 Agent 按需发现、动态加载的文件夹,这就是 Skills。
时间线(两个关键节点):
- 2025-10-16:随 Claude 发布 Agent Skills,作为产品内能力,覆盖 Claude Apps / Claude Code / API,配套推出官方
skill-creator生成器- 2025-12-18:开源为跨平台开放标准——Agent Skills Specification(V1.0,托管于 agentskills.io),同时放出官方 SDK(Python / TypeScript / Java)和企业级管理能力。48 小时内微软(VS Code/Copilot)、OpenAI(ChatGPT/Codex CLI)跟进;到 2026 年已有 8.5 万+ 公开 Skills、40+ 平台支持。TechCrunch 当时称其为”AI 领域的 Dockerfile”
发布公告(Introducing Agent Skills,2025-10-16):https://www.anthropic.com/news/skills
官方文档(SKILL.md 规范、frontmatter 约束):https://docs.claude.com/en/docs/agents-and-tools/agent-skills/overview
1.2 Agent?
Agent可以翻译成“智能体”。
Agent 可以理解为“带有明确职责的 AI 工作人员”。
- 关键组成:模型(大脑)+ 工具(手)+ agent loop(驱动循环)+ 上下文管理(记忆)。OpenAI 内部把承载这个循环的框架叫 harness。
普通聊天更像是:
你问一句,AI 回答一句。
Agent 更像是:
你交代一个目标,它自己拆步骤、查资料、使用工具、观察结果,必要时继续行动,最后把结果交回来。
一个 Agent 通常会有几样东西:
- 一个明确的角色或目标;
- 一组行为规则;
- 它可以使用的工具和文件权限;
- 完成任务的上下文;
- 把结果汇报回来的方式。
1.3 Codex是什么?
Codex就是Agent。
我觉得最好区分就是,
Agent是不同职责的员工(类比为人);
Codex是项目经理 + 工作台(类比为人+工作平台+环境);
延伸扩展
此外,codex虽然是Agent,但是codex里面也会包含Agent的。
因为本质上,Codex 是一个以 Agent 为中心的 AI 工作台。
你把codex理解为项目经理+工作台,就能理解,具体做事的时候还需要不同的员工,这些不同的员工就是具体一个个Agent。
展开解释
第一层:Codex 是工作环境
- Codex 把模型、对话、文件系统、终端、浏览器、Git 和各种工具放在一起。你在当前对话中交代任务,主 AI 负责理解你的目标、做计划、调用工具和向你汇报。
- 这个主 AI 可以叫“主 Agent”或“根 Agent”。
第二层:Codex 里面可以有子 Agent
- 如果一个任务太复杂,主 Agent 可以把其中一部分交给更专门的子 Agent:
- 让一个 Agent 只负责搜索和阅读;
- 让另一个 Agent 只负责设计方案;
- 让另一个 Agent 只负责修改文件;
- 最后由主 Agent 汇总结果。
子 Agent 并不是又打开了一个完全不同的 Codex。它更像是主 Agent 临时叫来的同事:有自己的工作说明、可用工具和任务边界,完成后把结果汇报回来。
可以用办公室理解
二、几组概念区分
2.1 Skill 和 Agent 到底有什么区别?
最简单的区分方式是:
| 对比 | Skill | Agent |
|---|---|---|
| 本质 | 一套可复用的方法和流程 | 一个能够执行任务的 AI 工作单元 |
| 重点 | 规则、步骤、模板、知识 | 目标、判断、行动、反馈 |
| 状态 | 被调用时提供做事方法 | 接到任务后主动推进 |
| 灵活性 | 通常比较稳定、可复用 | 会根据现场情况调整策略 |
| 是否能使用工具 | 可以规定工具怎么用 | 可以实际调用工具完成任务 |
| 相互关系 | 可以被主 Agent 或子 Agent 使用 | 可以调用一个或多个 Skill |
举个例子。
“把网页整理成 Obsidian 概念卡”是一类稳定、重复的工作,适合写成 Skill。Skill 规定归档模板、命名规则、链接规则和检查步骤。
但如果任务变成:
去我的 Obsidian 里找出所有和这个主题有关的笔记,判断它们之间的关系,提出一个新的知识结构,再告诉我哪些地方存在冲突。
这就更像 Agent 的工作。因为它需要搜索、比较、判断、规划,过程中还可能调用多个 Skill。
2.2 Codex是不是Agent?
是,Codex 本身是一个“AI 编程助手/主智能体系统”,它包含:
可以这样看:
Codex
└── 主 Agent:当前和你对话、理解需求、做总决策
├── Skill:一份操作流程
└── 子 Agent:被派出去完成某类任务的 AI 专员
项目经理(Codex)
├── 搜索专员(Seeker Agent)
├── 记录专员(Scribe Agent)
└── 归档专员(Sorter Agent)
Codex 是总的工作环境,里面可以安排其他 Agent 做具体工作。
cm:把Codex理解为Leader,下面的Agent就是具体做事的员工。
2.3 为什么 Codex 还需要 Agent?
因为不同任务需要不同的职责和权限。
比如你说:
搜索我的知识库,告诉我以前记录过哪些关于 Agent 记忆的内容。
Codex 可以派给 Seeker Agent:
- 只读文件
- 搜索知识库
- 返回来源
- 不修改任何内容
而你说:
把这些笔记整理进正确的文件夹。
Codex 可能派给 Sorter Agent:
- 读取笔记
- 判断分类
- 移动文件
- 更新链接
这样做的好处是:
- 每个 Agent 更专门
- 权限可以分开
- 任务复杂时可以分工
- 一个 Agent 不容易什么都乱做
三、知识延展部分
3.1 Prompt、SOP、Skill:它们是怎么一步步变化的?
这三个概念可以看成同一件事的三个成熟阶段。
第一步:Prompt——临时说一次
你告诉 AI:
帮我总结这篇文章,提取三个重点。
这次对话能完成,但下次你可能还要重新说明格式、步骤和注意事项。
第二步:SOP——把步骤写下来
你把流程固定成:
- 阅读全文;
- 提取主题;
- 提炼三个重点;
- 加上个人理解;
- 保存到指定文件夹。
这样别人也可以照着做,但这份流程原本是写给人看的。
第三步:Skill——让 AI 能稳定复用
你进一步补充:
- 用户说哪些话时触发;
- 输入文件放在哪里;
- 使用哪个模板;
- 什么时候需要查询旧笔记;
- 哪些动作必须先询问;
- 处理完成后如何检查和记录。
这时,SOP 就变成了一个更适合 AI 执行的 Skill。
因此可以记成:
3.2 如何调用Skills?
思路一是:直接使用Skills的名称,调用这个Skill操作;
思路二是:自然语言描述,让Agent识别处理。
整个过程大概是这样:
用户的自然语言需求
→ 主 Agent 理解目标和限制
→ 把大任务拆成几个小任务
→ 根据 Skill 的描述、Agent 的能力和可用工具召回候选
→ 检查哪些是必须做、可以做、不能做
→ 决定调用顺序
→ 执行、检查结果,必要时继续调用下一个能力
举例说明
例如你说:
把这个网页整理成概念卡,放进 Obsidian,并更新索引。
AI 可能会把它拆成:
- 读取和提取网页内容;
- 判断它是否值得形成一个稳定概念;
- 按概念卡模板写入 Obsidian;
- 搜索已有概念,避免重复;
- 更新索引;
- 记录这次操作。
3.3 什么时候该写 Skill,什么时候该做 Agent?
可以用三个问题判断。
如果问题是“这件事以后还会重复做吗?”
会重复,而且步骤相对稳定,就优先写 Skill。
例如:
- 网页归档;
- 音频转写;
- 文章排版;
- 每日日报生成;
- 概念卡创建和索引。
如果问题是“它需要一个角色持续判断和推进吗?”
需要搜索很多材料、自己规划步骤,或者需要独立权限和边界,就适合 Agent。
例如:
- 研究一个复杂主题;
- 在大量笔记中寻找关系;
- 设计一个新项目的知识结构;
- 把一个大任务拆成多个阶段并持续跟进。
如果只是“这次临时帮我做一下”
直接使用 Prompt 就够了,不必把所有事情都做成 Skill 或 Agent。
我现在更愿意把三者的关系理解为:
3.4 Commands和Plugins拓展
至于 Commands 和 Plugins,也可以顺手放到这个框架里:
- Command 像一个按钮,负责让你主动触发某个动作;
- Plugin 像一个安装包,负责把 Skills、Commands、Agents 和其他资源一起分发。
它们解决的是“怎么触发”和“怎么打包”,不是 Skill 和 Agent 本身。