今日概览
今日内容集中在 AI Agent 工程化落地:从目标定义、经验沉淀、范式演进到产品化机制与成本优化,六篇文章构成一条完整的实践链条。方法论占比高,且与团队协作、上下文工程、评测体系直接相关,适合作为工程实践参考沉淀。
今日重点
1. 浪费20亿Token之后,我开源了一个帮自己定义目标的Skill
作者开源 Leader.skill,将模糊需求转化为 Agent 可执行的目标任务书。核心是「目标七问」方法论,强调定义目标时需明确目的、完成态、证据、反作弊、边界、取舍与未知,并引入指挥官意图(Commander’s Intent)——先讲清楚「为什么」和「完成态」,Agent 才能长程自主执行而不跑偏。
值得关注:
- Leader.skill 能把模糊需求转化为清晰的目标任务书,供 Agent 长程执行。
- 目标定义需包含指挥官意图,即明确「为什么」和「完成态」。
- 「目标七问」涵盖目的、完成态、证据、反作弊、边界、取舍、未知七个维度。
- 适用于长程 Agent 任务规划,提升执行效率与可控性。
来源:数字生命卡兹克
2. AI Coding的下一站,不是更会写代码,而是更懂团队
腾讯QQ浏览器团队为解决 AI Coding 经验断层问题,自建团队经验系统:将 AI 对话按主题分组、抽取并经过 Review/Dedup/Merge 三层治理,把过程对话沉淀为高置信经验,实现 AI 带项目语境进场。关键数据:初始方案 90% 候选经验为废料,凸显「过程录像不等于经验」。
值得关注:
- 初始方案 90% 候选经验为废料,过程录像并不等于经验。
- 按语义、位置、行为三个认知镜头定义「不易直接发现」的经验价值标准。
- Review/Dedup/Merge 三层治理分别负责拦垃圾、去重、历史合并,使最终入库率达 80%。
- 沉淀后的经验让 AI 以团队历史语境进场,而非每次从零理解项目。
来源:腾讯技术工程
3. 对Loop Engineering的思考
文章基于控制论原理梳理 AI 编程范式从 Prompt、Context、Harness 到 Loop、Graph 的演进脉络,主张设计自动化循环代替反复提示,把人从流程中解放出来,并给出 TDD、证据链、预算思维等落地方法。负反馈机制是 Loop Engineering 的理论基础。
值得关注:
- Loop Engineering 主张设计循环代替反复提示,把人从流程中解放出来。
- AI 编程范式从 Prompt、Context、Harness 逐步演进到 Loop 和 Graph。
- 控制论的负反馈机制是 Loop Engineering 的理论基础。
- 落地方法包括 TDD、证据链、预算思维等实践抓手。
来源:腾讯云开发者
4. 模型好不好用,谁说了算?从榜单崇拜到自建评测
文章剖析大模型评测的演变与局限:MMLU 等固定考卷因模型背题和刷分失去区分度,HLE 应运而生但同样面临淘汰;Chatbot Arena 真人盲测也会被模型针对人类偏好优化;SWE-bench 等真实任务评测更贴近实际,但未必符合你的业务场景。建议用自身真实难题构建测试集评测模型,该数据集还能兼作 few-shot 使用。
值得关注:
- MMLU 等固定考卷因模型背题和刷分失去区分度,HLE 也面临同样命运。
- Chatbot Arena 通过真人盲测排名,但模型会针对人类偏好优化导致评测失真。
- SWE-bench 等真实任务评测更贴近实际,但未必符合具体业务场景。
- 用自身真实难题构建测试集,既能评测模型,又能兼作 few-shot 使用。
来源:阿里云开发者
5. 腾讯WorkBuddy实践:如何把Agent做成可用产品
文章从产品视角拆解 WorkBuddy 将 Agent 做成可用产品的实践:模型能力只是起点,通过上下文工程、Harness 工程和 Loop 工程组织上下文、约束执行、形成反馈闭环,才能让 Agent 稳定可控地完成真实任务。
值得关注:
- Agent 能力不只取决于模型强弱,工具接入、上下文组织、权限边界、结果验证等产品机制同样关键。
- Context Engineering 通过写入、选择、检索、压缩、隔离五类动作控制模型看到的信息。
- Harness Engineering 通过前馈、反馈、权限、验证、编排和可观测性提升 Agent 执行可靠性。
来源:腾讯技术工程
6. Token降本50%:Harness工作流的成本优化实践
腾讯云开发者团队对 AI Agent 全流程开发工作流做 token 成本优化:用 AgentLens 按链路与会话聚合 token 消耗,定位系统提示词、工具返回信息、历史消息为成本大头;依据三条上下文原则实施十项改造(渐进式披露、CLI 替代 MCP、代码图谱等),预估全流程降本 50%-65%。
值得关注:
- 使用 AgentLens 按链路与会话聚合 token 消耗,定位系统提示词、工具返回信息、历史消息是成本大头。
- 围绕三条上下文原则实施十项改造,包括渐进式披露、CLI 替代 MCP、代码图谱、稳定前缀、工具并行化等。
- 将 SKILL.md 的条件性内容与步骤详情外置到 references 资源层,按需 read_file 加载,初始 context 可减少约 90%。
来源:腾讯云开发者
趋势观察
- Agent 工程从「写代码」走向「定义与沉淀」 — 目标定义(Leader.skill)、经验沉淀(团队经验系统)都在回答同一个问题:如何让 Agent 在长程任务中不跑偏、有语境。输入质量决定输出质量。
- Loop Engineering 成为范式讨论焦点 — 从 Harness 到 Loop 再到 Graph,AI 编程的演进方向是设计自动化循环而非堆更多提示,控制论视角提供了理论基础。
- 评测去魅与自建评测兴起 — 公开榜单在背题与针对性优化下逐渐失真,用自身真实业务难题构建测试集成为更可靠的模型选择方式。
- 上下文成本成为工程优化主战场 — AgentLens 定位 + 渐进式披露 + 按需加载,token 成本优化的手法正在从经验走向工具化、数据化。