今日概览

今日内容围绕 Agent 工程与 AI 落地展开:腾讯云从 harness 删减 61% 反思什么会被模型内化,爱奇艺实践开发事件驱动的自动化协同,腾讯云拆解 FDE 12 项核心能力,数字生命卡兹克分享公平模型排行榜的方法论并实测 OpenAI 开源的 Codex Security,得物则从零构建 Coding Agent Violin 揭示 Agent 的本质。

今日重点

1. 模型越来越强,harness 该留下什么?

文章源自腾讯云开发者团队对部门 harness 框架的一次彻底重构:根指令删掉 61%、skills 砍掉 40%、agent 从 10 个减到 6 个。几乎同时,Anthropic 删掉了 Claude Code 系统提示词的 80% 以上而评测无损,OpenAI 也独立收敛到同一个方向——减法。核心观点是:为旧模型写的指令在新模型上会主动造成质量损失,冗余指令会"缩小模型的搜索空间",从模型可选的方案里剪掉一部分。

值得关注:

  • Anthropic 删掉打磨一年多的 Claude Code 系统提示词 80%,编码评测没有可测量损失。
  • OpenAI 指出旧 prompt 常过度规定流程:每一条路径规定都在剪掉模型可选的方案。
  • 官方建议是"删除而不是改写":如显式验证指令会导致 over-verification,删除可减少浪费 token 且不损质量。
  • 补模型能力缺口的组件会随模型变强而过期;组织特有的验收标准、授权边界与人的责任永远不会被内化。
  • 团队自建 harness 的真正价值在于沉淀这些 L2/L3 层内容,而非复用开源通用指令。

来源:腾讯云开发者

2. 海外 SKILL 实践:基于开发事件驱动的自动化协同提效!

爱奇艺海外技术团队以本地原生开发动作为可信事件,附加本地持久化存储每个开发任务周期的关键信息,在一个开发窗口内将开发事件集成转化为多系统管理操作,自动化串联 PMS、飞书、GitLab、CI/CD、PaaS 与 Release Management,形成从建分支到上线收口的全周期闭环。人只负责范围、Reviewer、合并与发布等关键环节确认。

值得关注:

  • 设计转变:从"开发者人工逐步操作"转向"研发在本地交互命令",高确定性事件由智能代理负责跨系统编排。
  • 开发信号利用:创建 feature 分支、commit/push、merge、Tag 等本地行为作为可信事件源。
  • 六层架构:本地开发行为为事件源,Hooks 与统一 CLI 为入口,策略编排层负责映射/状态机/AI/确认/幂等。
  • 提交说明自动携带 PMS 单号,PMS 状态随阶段动作变化,代码、工单、文档形成链路。
  • 它不替代 PMS、GitLab 或交付平台,而是在开发者所在的 IDE/Agent 窗口中统一承接意图、补齐上下文、触发下游接力。

来源:爱奇艺技术产品团队

3. 我花了 54 个小时,做了一个可能更公平的 AI 大模型排行榜

作者基于"筛选信源,而不是筛选信息本身"的理念,聚合 10 个自己信任的排行榜,用 Bradley-Terry 模型和先验机制计算共识分,开发出 AIHOT 模型榜。过程中发现简单的取平均数完全不可行:同样第 5 名在 10 个模型的榜和 200 个模型的榜里含金量天差地别,领先幅度也各不相同,需要补贝叶斯知识才能处理。

值得关注:

  • 简单平均的缺陷:榜单规模不同、领先幅度不同,名次不可直接比较。
  • 采用 Bradley-Terry 模型 + 先验机制计算共识分,公开规则与数据。
  • 首批聚合 10 个可信评测来源,后续可持续扩充。
  • 每个模型可进入详情页查看各来源的评分与排行。
  • 网址免费开放:https://aihot.virxact.com/leaderboard

来源:数字生命卡兹克

4. OpenAI 开源 Codex Security:Vibe Coding 安全神器

OpenAI 将安全扫描插件 Codex Security 开源(最早可追溯到 2025 年 10 月的 Aardvark),可接入 Claude Code、Kimi Code、Trae 等任意 Agent,自动扫描代码漏洞、追踪攻击路径、构建威胁模型、生成补丁。最新升级支持通过 OpenRouter 和 Fireworks 调用第三方模型做底层安全分析。作者在真实项目上扫描出 21 个安全问题,建议 Vibe Coding 产品上线前定期扫描。

值得关注:

  • Codex Security 由 GPT 驱动的 Agentic Security Researcher 演进而来,会自己读代码、找漏洞、验证风险、提修复方案。
  • 支持深度扫描、攻击路径追踪、威胁模型构建、漏洞验证和补丁生成。
  • 已开源为外部 Agent 可调用的开放工具,不局限于 Codex 生态。
  • 底层模型可通过 OpenRouter/Fireworks 替换为任意第三方模型。
  • 实测真实项目扫描出 21 个安全问题,Vibe Coding 产品上线前应定期扫描。

来源:数字生命卡兹克

5. 实战从零开始构建一个 Coding Agent:Violin

得物技术作者从零构建了 Coding Agent Violin:引擎用 Zig 实现(性能与内存可控),客户端用 Python(生态快速搭建 UI),两者通过 TCP + JSON line 协议通信。架构深度借鉴 Pi 的三层分离(模型适配层/内核层/产品层)与 EventBus 事件驱动。文章分层拆解 Agent Loop、模型适配、工具系统、会话管理、Lua 插件与网络协议,核心结论是:Agent 不过是"问模型、调工具"的循环。

值得关注:

  • 不同模型 API 对工具调用、推理内容、缓存、错误的表达不同,适配层统一为 Message、Tool、AssistantMessageEvent。
  • Agent Loop 是一切的核心,工具系统是 Agent 的"手和脚"。
  • 各层通过接口或网络协议解耦,不同层可用不同语言实现,Server 不关心 Client 语言。
  • 读懂 Pi 的架构就理解现代 AI coding agent 的核心设计模式;读懂 coding agent 就掌握理解其他 agent 的钥匙。
  • 产品层负责"麻烦但关键"的事:把 Agent Loop 变成每天能用的开发工具。

来源:得物技术

6. 一文读懂:FDE 的 12 项核心能力

文章基于国内大模型 toB 市场公开行情与政企交付一线实践,把 FDE(前线部署工程师)核心能力整理为四阶段 × 12 项的培养清单,并按中国 toB 的真实约束校准:招投标、账期、免费 POC、需求蔓延、数据不出域、信创合规。每项能力回答三个问题:防止什么事故、具体怎么练、达到什么程度算过关。核心观点是中国 toB 市场缺的不是驻场的人,而是能把 AI 项目"交付成、验收掉、回款回、复制开"的人。

值得关注:

  • 2025 年国内大模型中标项目 7539 个、金额约 295 亿元,数量同比增长 396%,需求在爆炸。
  • 采购主力是央国企和政府:数量占比超六成、金额占比约一半;政务、教科、通信、能源、金融、交通、医疗是七大赛道。
  • 国内头部企业 FDE 年薪约 30 万–80 万人民币,是少数逆势起价的岗位族。
  • 四个中国特色变量:私有化与数据不出域是默认项、招投标与账期决定现金流、免费 POC 与需求蔓延、信创合规。
  • 榜单头部厂商的共同点是在细分行业形成"可复制的解决方案",与第 12 项能力直接呼应。

来源:腾讯云开发者

趋势观察

  1. Agent 工程进入"减法"阶段 — Anthropic 删 80% 系统提示词、腾讯云删 61% harness 指令都证明:模型变强后冗余指令从浪费变成净损失,harness 的价值从"补模型短板"转向"沉淀组织特有的验收标准与责任边界"。
  2. 开发流程被"事件驱动"重塑 — 爱奇艺以本地开发行为为可信事件源,自动串联 PMS/GitLab/CI/CD,人只留关键确认环节;本地开发信号正在成为研发协同自动化的新入口。
  3. Agent 的本质被反复验证 — Violin 从零构建揭示 Agent 只是"问模型、调工具"的循环;Codex Security 开源说明安全能力正从封闭生态变成任意 Agent 可调用的开放工具,Vibe Coding 的安全问题开始有标准解法。