从提问到上线:普通人如何用 AI Agent 放大执行力
一篇面向普通人的 AI Agent 实战笔记,解释大模型原理、线程拆分、Agent、Skill、MCP、Git、模型选择和使用经验。
# 从提问到上线:普通人如何用 AI Agent 放大执行力
> 核心观点:AI 不是替代人,而是放大人的执行力。会用 AI 的关键,不是会写代码,而是会把工作拆清楚、讲清楚、验收清楚。
很多人用 AI,还停留在“问一句,答一句”。这当然有用,但真正能改变工作效率的,是把 AI 当成一个能协助推进任务的 Agent:你给它背景、目标、限制和验收标准,它帮你拆解、执行、检查、记录。
我做个人站的过程就是这个逻辑:先用 GPT 把模糊想法整理成网站定位、页面结构、视觉风格和功能范围,再用 Codex 进入项目现场,读取项目文件,按规则修改、检查、更新记录。最后由人来判断方向、取舍范围、验收结果。
这不是“一句话让 AI 变出网站”,而是一个更实用的流程:人负责判断,AI 放大执行。

## 1. AI 的基础原理:它本质上是在预测下一个 Token
大模型回答问题,可以粗略理解为“根据上下文预测下一个字”。更准确地说,是预测下一个 Token。Token 可以是字、词、数字、符号或代码片段。
这件事很重要,因为它解释了 AI 的几个特点:
1. 它不是全知全能,而是基于当前上下文生成最可能合适的内容。
2. 你给的信息越清楚,它越容易沿着正确方向预测。
3. 你给的信息越乱,它越容易抓错重点。
4. 你没有提供的事实,它可能会猜。
5. 旧对话太长时,关键内容可能被稀释,甚至被挤出上下文。
所以,使用 AI 的第一原则不是“写神奇咒语”,而是管理上下文。
## 2. 为什么长项目要拆线程
很多人把一个项目从头聊到尾,最后发现 AI 越来越不稳。原因很简单:同一个聊天线程里塞了太多历史,模型每次都要在一堆旧信息里判断什么重要、什么已经过时、什么只是中间方案。
我的经验是:长项目不要一直堆在同一个线程里,要按阶段拆。
可以这样拆:
```text
需求澄清线程:只聊目标、用户、范围、优先级
方案设计线程:只聊架构、页面、流程、风险
执行线程:只让 Agent 按明确任务动手
修 bug 线程:只放现象、复现步骤、期望结果
总结线程:只整理变更、经验、文档和下一步
```
每开一个新线程,都带一份“项目交接包”:
```text
项目背景:这是一个什么项目
当前状态:已经完成什么,还缺什么
本次目标:这次只要做什么
限制条件:不能做什么,必须遵守什么
相关文件:需要读哪些资料
验收标准:做到什么算完成
输出格式:我要清单、方案、代码、文章还是 PPT
```
换线程不是为了重新开始,而是为了让 AI 的上下文变干净。

## 3. Agent 的工作原理
模型像大脑,Agent 像一个带工具的工作角色。
普通聊天主要是回答;Agent 可以在授权范围内读文件、调用工具、执行命令、打开浏览器、修改文档、生成图片、导出 PPT、跑检查。它的工作循环通常是:
```text
理解任务 -> 读取上下文 -> 制定步骤 -> 调用工具 -> 检查结果 -> 汇报或继续修正
```
这就是 Codex 有价值的地方。它不是只告诉我“你可以这样改”,而是能进入项目目录,读取 README、PROJECT_CONTEXT、CHANGELOG 和项目 Skill,再按已有规则执行。
但 Agent 也不是自动可靠。它需要权限、工具、上下文和验收标准。没有边界的 Agent,容易把简单问题做复杂;没有验收标准的 Agent,做完了也不知道对不对。
## 4. 几个必须知道的概念
大模型:负责理解、推理、生成内容的核心能力。不同模型擅长的任务不一样,一般来说,参数规模、训练质量和推理能力都会影响模型表现,但不是“体积越大就一定更好”。
Token:AI 处理文字的基本单位。输入越长、输出越长,成本和时间通常越高。
上下文窗口:AI 当前能看到的信息范围。窗口外的信息,它就像没看见。
Prompt:你给 AI 的任务说明。好 Prompt 的本质是好交代。
RAG:让 AI 先从指定资料里检索,再基于资料回答。适合公司知识库、文档问答。
微调:用专门数据训练模型,让它更适合某类任务。多数普通团队一开始不需要,先把 Prompt、知识库和流程做好更划算。
Tool Calling:让模型调用外部工具,比如搜索、查表、读文件、发请求、操作浏览器。
Skill:给 Agent 的专项工作说明。它把某类任务的流程、规则、参考资料和脚本打包起来,让 Codex 更稳定地执行重复工作。OpenAI 文档里也把 Skill 描述为给 Codex 增加特定能力和工作流的方式。Skill 本质就是文档和提示词工程,是提前把一段规则输入给 AI。
MCP:Model Context Protocol,可以理解成 AI 连接外部工具和上下文的标准接口。通过 MCP,Codex 可以访问第三方文档、浏览器、Figma、GitHub 等工具。
Git:版本管理工具。它记录项目每次改了什么,方便回退、比较、协作。
GitHub:托管代码和协作的平台。仓库是项目文件夹,commit 是一次保存记录,branch 是分支,PR 是把分支合并回主线前的审查申请。

## 5. 最好用的提示词公式
我最常用的是这套:
```text
背景 + 目标 + 当前状态 + 限制条件 + 验收标准 + 输出格式 + 不要做什么
```
例子,不要这样问:
```text
帮我做个匿名聊天室。
```
更好的问法是:
```text
我想在个人站加入轻量匿名聊天室。目标是让访客公开留言。
当前网站部署在 Cloudflare Pages,已有 D1 数据库。
第一版只做公开房间、纯文本、随机昵称、本地记住昵称、字数限制、发送冷却和轮询刷新。
不要做私聊、图片上传、多房间和复杂后台。
验收标准是手机和电脑都能发消息,刷新后消息仍存在,用户输入不会执行脚本,界面符合现有 XP 像素风。
请先给方案,再执行最小可用版本,并更新项目文档。
```
AI 不是怕任务难,是怕你让它猜。

## 6. 使用 AI 的实战技巧
第一,先让 AI 反问你。需求不清时,不要急着让它做,先说:“请先指出缺失信息和风险,不要直接执行。”
第二,把大任务拆成小任务。比如“做网站”要拆成结构、视觉、首页、登录、数据库、移动端、部署、文档。每次只让 AI 处理一块。
第三,明确不要做什么。很多跑偏都不是 AI 不会,而是你没说边界。
第四,让 AI 输出验收清单。比如“做完后请列出我应该检查哪些地方”。这会让结果更容易落地。
第五,重要任务先要方案。涉及账号、数据、安全、费用、发布时,不要直接执行,先让 AI 写方案和风险。
第六,反复沉淀项目规则。把长期规则写进 README、PROJECT_CONTEXT、CHANGELOG 或 Skill,不要每次靠口头补充。
第七,经常让 AI 总结交接包。一个线程结束前,让它总结“已完成、未完成、关键决策、下一步、注意事项”,方便开新线程。
## 7. AI 市场现在是什么状态
截至 2026 年 6 月 14 日,AI 模型市场已经非常拥挤,不是一家独大。竞争大概分成几类:
1. 通用闭源旗舰:OpenAI GPT、Anthropic Claude、Google Gemini、xAI Grok。
2. 国内大模型与平台:Qwen/阿里百炼、DeepSeek、智谱 GLM、豆包/火山方舟、Kimi、MiniMax、腾讯混元等。
3. 开放权重生态:Meta Llama、Mistral 等,适合本地部署、私有化和二次开发。
4. 多模态与媒体模型:图像、视频、音频、语音、文档理解正在快速竞争。
5. Agent 平台:不只是模型强弱,还要看工具调用、上下文管理、权限、安全、可观测性和工作流。
主流模型大致可以这样理解:
OpenAI:综合能力强,适合复杂推理、代码、Agent 和工具调用。官方模型文档建议复杂推理和编码从旗舰模型开始,成本和延迟敏感时选小模型。
Claude:长文档、写作、代码和复杂分析很强,适合需要稳重表达和长上下文理解的任务。
Gemini:多模态生态强,文本、图像、语音、视频、实时能力覆盖广,适合 Google 生态和多媒体任务。
DeepSeek:中文和代码场景关注度高,成本、长上下文和工具调用是常见优势点。
Qwen/阿里百炼:国内平台化能力强,模型种类多,文本、图像、音频、视频、向量等覆盖广。
Llama:开放生态重要,适合研究、本地化、私有部署和可控环境。
Mistral:开源和企业模型并行,代码、Agent、文档和多模态方向都有布局。
Grok:xAI 生态模型,偏通用对话、工具调用和 X 相关生态。
GLM、豆包、Kimi、MiniMax、混元:国内常见选择,具体要看中文能力、上下文、价格、接口、合规和所在平台生态。
## 8. 什么是“好模型”
好模型不是排行榜第一,而是适合你的任务。
判断模型好不好,可以看这几项:
1. 准确性:在你的真实问题上是否少犯错。
2. 指令遵循:能不能按格式、边界和角色要求输出。
3. 长上下文:能不能读长文档、长项目、长对话而不乱。
4. 推理能力:能不能拆复杂问题、发现矛盾、给出取舍。
5. 工具调用:能不能稳定使用搜索、文件、代码、浏览器、数据库等工具。
6. 代码能力:能不能读懂项目、少改错、会测试、会解释风险。
7. 中文能力:是否符合中文表达习惯,是否能处理中文业务语境。
8. 成本和速度:高频任务不能只看能力,也要看价格和响应时间。
9. 稳定性:同样任务多试几次,结果是否稳定。
10. 安全与合规:数据是否能进外部模型,是否需要本地或企业方案。
最实用的方法是用自己的任务做小型盲测。选 3 到 5 个真实问题,让不同模型回答,再按准确、可用、格式、速度、成本打分。别只看网上榜单。
## 9. 该怎么选 AI 和 Agent
普通写作、总结、头脑风暴:选你用得顺、表达稳定的通用模型。
长文档分析:优先看上下文长度、引用能力和长文稳定性。
代码项目:选能读项目、会改文件、能跑检查的 Agent,比如 Codex 这类工作流工具。
做 PPT、图片、视频:选有对应插件或多模态能力的工具,不要指望纯聊天模型包办所有视觉细节。注意不同模型支持多模态能力情况不同,比如 DeepSeek 的主流文本模型暂时不适合直接处理图片任务。
公司知识库:优先考虑 RAG、权限、审计和数据安全,而不是一上来微调。
高频低风险任务:可以用便宜快的小模型。
重要决策材料:用强模型,但必须人工复核。
涉及隐私、合同、客户和内部系统:先看公司规则,必要时用企业版、私有化或本地模型。
## 10. 我的经验总结
第一,AI 最能放大的不是懒,而是清晰。你越会表达目标、边界和验收标准,AI 越好用。可以把模糊的需求先交给对话型 AI,然后让它帮你完善。中间不认识的关键词,及时问 AI。尽量让 AI 给你多个可选的执行选项,从中挑选。
第二,Agent 适合执行明确任务,不适合替你决定方向。方向、取舍、责任还是人的。
第三,长项目一定要文档化。项目背景、规则、变更记录、下一步,比一次漂亮输出更重要。要有项目文档,注意事项和 Skill,更新记录文档。每次开新线程。让 AI 读取这些文档就可以。
第四,别迷信单一插件技能,但是 Skill 也不是越多越好,过多 Skill 会导致上下文过长。写作、代码、图片、PPT、知识库、部署,可能需要不同工具组合。
第五,缺信息就标出来。靠谱的 AI 协作不是把空白编满,而是把不确定性暴露出来。