今日概览
今日五篇集中回答 Agent 工程化的三个问题:多智能体怎么组队(爱奇艺 Agent Team、得物 Plan 模式)、AI 编码怎么变成可靠流程(Agentic Harness Workflow)、Agent 怎么持续变强(自进化全景图)。另有一篇把工单处理压缩 9 倍的实战。
今日重点
1. 大数据技术专家是如何练成的:大数据助手 Agent Team 实践
爱奇艺大数据体系涉及 20 多个服务,排查"Spark 为什么失败"“Flink 为什么重启"这类问题要读上下文、查平台数据、检索日志告警、分析指标,且问题出现在哪层不代表根因在哪层,需要多领域对齐时间线和证据。团队曾固化规则工作流,但真实故障信息不完整、路径要随中间结果调整,于是转向 Agent Team。
值得关注:
- 架构:一个 Coordinator(指挥者)+ 多个 Service Agent(技术专家),覆盖调度、批计算、实时计算、机器学习、数据湖、数据分析六个领域的 Agent。
- 不是把所有能力塞进一个全能 Agent,而是让每个 Service Agent 维护自己的专业知识和工具边界,需要时围绕同一问题协同。
- 实例:Flink 写 StarRocks 失败 → Flink Agent 确认异常在下游写入,提取超时证据 → Coordinator 带着时间窗口和节点线索转交 StarRocks Agent。
- 目标是让常规信息收集、证据关联和初步判断自动化,人把精力集中在真正需要决策的环节。
来源:爱奇艺技术
2. 2 分钟到 20 秒!AI Agent 让工单处理可提效 9 倍
操作人员面对待处理工单要在 2 个系统间切换、逐一查看 7-10 个模块、手动比对后凭经验判断,熟练坐席也要 2-3 分钟。团队用 AI Agent 重构为:一次请求触发跨系统多模块并发取数 → 规则引擎 + LLM 双通道标签评估 → 分层决策引擎输出带 Trace 的结论 → AI Agent 生成自然语言总结与建议,压到 20-40 秒。
值得关注:
- 三大挑战:并发取数与隐性依赖(全串行太慢、全并发拿空参数)、判断逻辑结构化表达(需求模糊 + “数据缺失"与"条件不满足"要区分)、结论可读可追溯。
- 五条工程准则:配置即代码、数据缺失单独标记、决策留完整记录、降级策略显式声明、实时推送与持久回放并行——可独立拆用。
- SSE 流式推送让坐席等待期间可并行处理多个工单,进一步摊薄单工单时间。
- 核心体会:可解释性不是锦上添花,而是人机协作的基础;机器给建议,人负责决策。
来源:腾讯云开发者
3. Agentic Harness Workflow 框架:把 AI Coding 变成工程化流程
作者自研 Agentic Harness Workflow:不造更聪明的 Agent,而是给 AI 编程套一副工程框架。把一次开发拆成需求澄清、方案设计、编码实现、审查验收、提交归档等阶段,每阶段交给只干一件事的子代理,主代理统一调度把关,关键节点留人拍板;配合状态落盘,中断、换人、换工具都能无痛续跑。
值得关注:
- 直面上线痛点:上下文膨胀与结果漂移、跳过必要工程步骤、过程不可恢复、自动化缺少人工门禁。
- 生命周期:init → specify → plan → tasks → test-plan → plan-review → implement → code-quality → e2e-run → human-acceptance → commit-push → archive;implement/code-quality/e2e-run 是自动执行区,其余阶段完成后停下等确认。
- CLAUDE.md 承担两件事:框架入口 + 项目知识库。
- 自曝遗留问题:未建立线上可观测性日志与监控——只能回答"单个需求怎么走完”,无法观测某阶段执行是否正确。
来源:豆包MarsCode
4. Agent 如何自己变强?从 Skill 到模型权重的进化全景图
AliExpress 梳理 Agent 自进化(Self-Evolution):传统基础模型受限于"一次训练、静态部署”,自进化让 AI 像生物一样通过持续交互获取反馈、积累经验、重构自身。核心是建立"执行→反馈→优化改进→再执行"闭环,且进化对象不只模型参数,还涵盖 Prompt、Skill、记忆、工作流等非参数组件。
值得关注:
- 两个核心问题:进化什么(Agent 系统层 vs 模型参数层)、如何进化。
- Trace2Skill:批量分析多条 Agent 执行轨迹,把成功与失败经验归纳为可泛化 Skill——并行多智能体补丁提议 + 无冲突整合。实测 122B 模型生成 200 条(50+ 轮次)轨迹不到两小时。
- EvoSkill:“执行→提案→构建→验证"闭环,由 Executor/Proposer 等专用子智能体协同、互相验证。
- 关键约束:自进化需通过验证与评估控制方向,避免过拟合和性能退化。
来源:阿里云开发者
5. 企业级 MultiAgent 落地:Plan 模式与主子 Agent 协作|得物技术
得物基于 AgentScope Java 构建企业级 MultiAgent 平台,提供统一的模型调用、工具接入、任务编排、流式输出与运行追踪。本文聚焦复杂任务如何规划、如何拆给专业 Agent、服务之间如何协作。
值得关注:
- 为什么需要 Plan:纯 ReAct 循环会遇到"后面才发现前置不完整"“过程藏在 Prompt 里无法审计"“Token 难预估"“失败缺稳定恢复路径”。Plan-and-Execute 把"要做什么"和"怎么做"拆开,让计划成为有状态、可持久化、可被前端观察的运行对象。
- Plan 生命周期:模型动态 create_plan/activate_subtask/finish_subtask/finish_plan;每轮注入 Hint 软约束(框架负责硬约束,如同一时刻只允许一个任务进行);每次状态变化立即序列化、重连后幂等恢复;SSE 推送结构化事件(CHAT/PROCESSING/ERROR)让过程可见。
- 主子 Agent 用声明式配置,A2A 协议实现跨服务 Agent Teams。
- 企业级保障:多租户全链路隔离、双模式认证、多层调用树追踪、异常保护四道防线。
- 结论:能否进入生产取决于计划是否持久化、状态是否可见、取消能否传递、权限能否跨服务保持、失败是否有清晰边界。
来源:得物技术
趋势观察
- 多智能体从"能协作"走向"可治理” — 爱奇艺 Agent Team 的领域边界划分、得物的 Plan 持久化与 SSETrace,重点都从"多智能体能不能协作"转到"跨域协作怎么可审计、可恢复、可隔离”。
- 工程框架的价值在"防漂移” — Agentic Harness Workflow 的固定流水线 + 人工门禁,和工单系统的"可解释 Trace",都是同一件事:用结构约束概率性输出。
- 自进化成为独立研究分支 — Trace2Skill、EvoSkill、SkillRL 等机制密集出现,进化对象从参数扩展到 Skill/记忆/工作流,但共识是必须用验证与评估守住方向。