关联主题:: Skills、Agent、Commands、Plugins
关联概念:: SkillAgentPromptSOPCodex
同级::
下一级::

  • 本文仅为小白科普,不做复杂展开

一、Skill、Agent、Codex分别是什么?

  • Skill 是“怎么做:员工指导手册”;Agent 是“谁来做:使用哪个牛马?”;Codex 是“负责理解和调度的主系统:办公室和整套办公设备”。
模型 GPT       = 人的大脑——>大脑
Codex          = 项目经理 + 工作台——>人➕工具
Agent          = 不同职责的员工(项目经理手下的员工)——>人
Skill          = 员工执行任务时使用的 SOP——>工具
  • 这样一区分应该就特别好理解了。
概念它更像什么它主要解决什么问题
Prompt(提示词)我临时交代的一句话这一次想让 AI 做什么
SOP写给人看的标准流程人应该按什么步骤做
Skill写给 AI 看的工作手册AI 遇到这类任务时应该怎么做
Agent负责执行任务的 AI 执行者谁来判断、调用工具并把任务推进下去
Codex / Claude Code一间带工具的工作室让模型、Agents、Skills 和文件工具协同工作
  • Prompt 是一次性的指令;
  • SOP 是一套流程;
  • Skill 是把流程整理成 AI 能识别、能复用的能力包;
  • Agent 是拿到目标后,能够自主推进任务的执行者;
  • Codex 是承载这一切的工作环境。

1.1 Skill

Skill 更像一份详细 SOP 或操作手册。

Skill = 方法、流程、SOP

举例说明

比如,做饭需要菜谱,具体每一步怎么做,这就是SOP。

你可能也听过另一个东西——提示词,这个更简单,可以理解为指令。
指令是给AI的,但是同一个指令即使给到同一个AI,每次结果可能也是不一样的。

比如在chatgpt打开两个不同的对话,同一个指令得到的答案可能是不一样的。

skills不是提示词,但是包含提示词。

还是以做菜为例,skills就是加强版的SOP,包含了厨师、锅碗瓢盆、调味品、食材、锅器具等,这些都打包在一起了。
给任何一个Agent都可以直接调用。

输入的内容不同,Skills作为系统,输出的结果都是一样的,是可以复用的流程。

在 Claude Code、Codex 这类工具里,一个 Skill 通常至少有一个 SKILL.md,也可以附带脚本、参考资料、模板和其他资源。

skills包含的内容

一个 Skill 目录通常可以包含:

  • SKILL.md:使用条件、处理步骤和输出要求;
  • scripts/:需要稳定执行的脚本;
  • references/:工作时需要查阅的资料;
  • assets/:模板、图片等资源。
    这就比一条普通提示词完整得多。

Skill 可以看作是面向 AI 的 SOP,但它不只是 SOP,还把触发条件、上下文、工具、模板和检查规则一起打包了。

  • 你在互联网上做的任何操作,只要能描述清楚流程的,都会沉底出SOP,也就是都可以让AI帮你做成SKills,然后调用这个SKills

SKills的诞生以及官方的解释

Anthropic 官方给出的动机是:通用大模型像一个”从第一性原理现推的 300 IQ 数学天才”,而真实工作需要的往往是”填过几千份税表的老手”的累积经验(accumulated expertise)。通用 Agent 缺的不是推理能力,而是”没人写下来的流程”(procedural knowledge)和组织上下文。于是他们把”指令 + 脚本 + 资源”打包成可被 Agent 按需发现、动态加载的文件夹,这就是 Skills

时间线(两个关键节点):

  • 2025-10-16:随 Claude 发布 Agent Skills,作为产品内能力,覆盖 Claude Apps / Claude Code / API,配套推出官方 skill-creator 生成器
  • 2025-12-18开源为跨平台开放标准——Agent Skills Specification(V1.0,托管于 agentskills.io),同时放出官方 SDK(Python / TypeScript / Java)和企业级管理能力。48 小时内微软(VS Code/Copilot)、OpenAI(ChatGPT/Codex CLI)跟进;到 2026 年已有 8.5 万+ 公开 Skills、40+ 平台支持。TechCrunch 当时称其为”AI 领域的 Dockerfile”

发布公告(Introducing Agent Skills,2025-10-16):https://www.anthropic.com/news/skills
官方文档(SKILL.md 规范、frontmatter 约束):https://docs.claude.com/en/docs/agents-and-tools/agent-skills/overview

1.2 Agent?

Agent可以翻译成“智能体”。
Agent 可以理解为“带有明确职责的 AI 工作人员”。

  • 关键组成:模型(大脑)+ 工具(手)+ agent loop(驱动循环)+ 上下文管理(记忆)。OpenAI 内部把承载这个循环的框架叫 harness

普通聊天更像是:

你问一句,AI 回答一句。

Agent 更像是:

你交代一个目标,它自己拆步骤、查资料、使用工具、观察结果,必要时继续行动,最后把结果交回来。

一个 Agent 通常会有几样东西:

  • 一个明确的角色或目标;
  • 一组行为规则;
  • 它可以使用的工具和文件权限;
  • 完成任务的上下文;
  • 把结果汇报回来的方式。

1.3 Codex是什么?

Codex就是Agent
我觉得最好区分就是,
Agent是不同职责的员工(类比为人);
Codex是项目经理 + 工作台(类比为人+工作平台+环境);

此外,codex虽然是Agent,但是codex里面也会包含Agent的。
因为本质上,Codex 是一个Agent 为中心的 AI 工作台

你把codex理解为项目经理+工作台,就能理解,具体做事的时候还需要不同的员工,这些不同的员工就是具体一个个Agent

展开解释

第一层:Codex 是工作环境

  • Codex 把模型、对话、文件系统、终端、浏览器、Git 和各种工具放在一起。你在当前对话中交代任务,主 AI 负责理解你的目标、做计划、调用工具和向你汇报。
  • 这个主 AI 可以叫“主 Agent”或“根 Agent”。

第二层:Codex 里面可以有子 Agent

  • 如果一个任务太复杂,主 Agent 可以把其中一部分交给更专门的子 Agent:
    • 让一个 Agent 只负责搜索和阅读;
    • 让另一个 Agent 只负责设计方案;
    • 让另一个 Agent 只负责修改文件;
    • 最后由主 Agent 汇总结果。

子 Agent 并不是又打开了一个完全不同的 Codex。它更像是主 Agent 临时叫来的同事:有自己的工作说明、可用工具和任务边界,完成后把结果汇报回来

可以用办公室理解

  • 所以可以用办公室来理解:
  • Codex:办公室和整套办公设备;
  • Agent:负责接待你、拆解任务和协调工作的项目负责人;
  • Agent:被派出去处理具体工作的专业同事;
  • Skill:办公室里的工作手册和标准流程;
  • 模型:所有 Agent 共用的通用智力基础。

二、几组概念区分

2.1 Skill 和 Agent 到底有什么区别?

最简单的区分方式是:

Skill 解决“应该怎么做”,Agent 解决“由谁来做,以及如何把它推进下去”。

对比SkillAgent
本质一套可复用的方法和流程一个能够执行任务的 AI 工作单元
重点规则、步骤、模板、知识目标、判断、行动、反馈
状态被调用时提供做事方法接到任务后主动推进
灵活性通常比较稳定、可复用会根据现场情况调整策略
是否能使用工具可以规定工具怎么用可以实际调用工具完成任务
相互关系可以被主 Agent 或子 Agent 使用可以调用一个或多个 Skill

举个例子。
“把网页整理成 Obsidian 概念卡”是一类稳定、重复的工作,适合写成 SkillSkill 规定归档模板、命名规则、链接规则和检查步骤。

但如果任务变成:

去我的 Obsidian 里找出所有和这个主题有关的笔记,判断它们之间的关系,提出一个新的知识结构,再告诉我哪些地方存在冲突。

这就更像 Agent 的工作。因为它需要搜索、比较、判断、规划,过程中还可能调用多个 Skill

Skill 像“菜谱”,Agent 像“厨师”:

  • 菜谱可以被不同 Agent 使用;
  • Agent 可以同时使用多本菜谱;
  • 菜谱规定基本做法;
  • Agent 要根据手头的食材和现场情况做判断。

2.2 Codex是不是Agent?

是,Codex 本身是一个“AI 编程助手/主智能体系统”,它包含:

  • 一个当前和你对话的主 AI
  • 终端、文件读写等工具
  • 项目规则
  • Skills
  • 可以调用的子 Agent

可以这样看:

Codex
└── 主 Agent:当前和你对话、理解需求、做总决策
    ├── Skill:一份操作流程
    └── 子 Agent:被派出去完成某类任务的 AI 专员

所以 Codex 里面有 Agent,并不矛盾。
就像:

项目经理(Codex)
├── 搜索专员(Seeker Agent)
├── 记录专员(Scribe Agent)
└── 归档专员(Sorter Agent)

Codex 是总的工作环境,里面可以安排其他 Agent 做具体工作。
cm:把Codex理解为Leader,下面的Agent就是具体做事的员工。

2.3 为什么 Codex 还需要 Agent?

因为不同任务需要不同的职责和权限。

比如你说:

搜索我的知识库,告诉我以前记录过哪些关于 Agent 记忆的内容。

Codex 可以派给 Seeker Agent

  • 只读文件
  • 搜索知识库
  • 返回来源
  • 不修改任何内容

而你说:

把这些笔记整理进正确的文件夹。

Codex 可能派给 Sorter Agent

  • 读取笔记
  • 判断分类
  • 移动文件
  • 更新链接

这样做的好处是:

  • 每个 Agent 更专门
  • 权限可以分开
  • 任务复杂时可以分工
  • 一个 Agent 不容易什么都乱做

三、知识延展部分

3.1 Prompt、SOP、Skill:它们是怎么一步步变化的?

这三个概念可以看成同一件事的三个成熟阶段。

第一步:Prompt——临时说一次

你告诉 AI:

帮我总结这篇文章,提取三个重点。

这次对话能完成,但下次你可能还要重新说明格式、步骤和注意事项。

第二步:SOP——把步骤写下来

你把流程固定成:

  1. 阅读全文;
  2. 提取主题;
  3. 提炼三个重点;
  4. 加上个人理解;
  5. 保存到指定文件夹。

这样别人也可以照着做,但这份流程原本是写给人看的。

第三步:Skill——让 AI 能稳定复用

你进一步补充:

  • 用户说哪些话时触发;
  • 输入文件放在哪里;
  • 使用哪个模板;
  • 什么时候需要查询旧笔记;
  • 哪些动作必须先询问;
  • 处理完成后如何检查和记录。

这时,SOP 就变成了一个更适合 AI 执行的 Skill
因此可以记成:

Prompt 是一次交代,SOP 是流程,Skill 是带有触发和执行边界的 AI 工作包。

3.2 如何调用Skills?

思路一是:直接使用Skills的名称,调用这个Skill操作;
思路二是:自然语言描述,让Agent识别处理。

整个过程大概是这样

用户的自然语言需求
→ 主 Agent 理解目标和限制
→ 把大任务拆成几个小任务
→ 根据 Skill 的描述、Agent 的能力和可用工具召回候选
→ 检查哪些是必须做、可以做、不能做
→ 决定调用顺序
→ 执行、检查结果,必要时继续调用下一个能力

3.3 什么时候该写 Skill,什么时候该做 Agent?

可以用三个问题判断。

如果问题是“这件事以后还会重复做吗?”

会重复,而且步骤相对稳定,就优先写 Skill。

例如:

  • 网页归档;
  • 音频转写;
  • 文章排版;
  • 每日日报生成;
  • 概念卡创建和索引。

如果问题是“它需要一个角色持续判断和推进吗?”

需要搜索很多材料、自己规划步骤,或者需要独立权限和边界,就适合 Agent。

例如:

  • 研究一个复杂主题;
  • 在大量笔记中寻找关系;
  • 设计一个新项目的知识结构;
  • 把一个大任务拆成多个阶段并持续跟进。

如果只是“这次临时帮我做一下”

直接使用 Prompt 就够了,不必把所有事情都做成 Skill 或 Agent。
我现在更愿意把三者的关系理解为:

Prompt 负责提出一次需求,Skill 负责提供可复用的方法,Agent 负责在现实环境中把任务完成。

3.4 Commands和Plugins拓展

至于 Commands 和 Plugins,也可以顺手放到这个框架里:

  • Command 像一个按钮,负责让你主动触发某个动作;
  • Plugin 像一个安装包,负责把 SkillsCommandsAgents 和其他资源一起分发。
    它们解决的是“怎么触发”和“怎么打包”,不是 Skill 和 Agent 本身。

相关笔记: