今日概览

今日内容覆盖四个方向:真实生活场景的 Agent 评测揭示能力短板、AI 在生活细节中的实用玩法、视频生成模型的代际升级、以及模型定价战背后的 AI 自主优化。其中评测基准与 AI 自我优化两条线对工程实践最有参考价值。

今日重点

1. 把最强模型丢进真实生活一个月,没有一个及格

小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench 两个真实生活场景基准,用旅行、理财等长程任务测试 AI 助理。结果显示七个最强模型均未及格,普遍缺乏主动性、持久化和长程一致性,能力短板明显。

值得关注:

  • VibeLifeBench 用带时钟的模拟世界测试 AI 助理,包含 200 个生活任务和 12,261 条加权检查。
  • 七个最强模型在 VibeLifeBench 中得分仅 0.21-0.33,主动性和长程一致性是最弱环节。
  • VibeSearchBench 中所有模型均未拿到用户模拟器的 [DONE] 信号,主动澄清意图能力严重不足。

来源:小红书技术REDtech

2. 鹅厂员工有哪些小众的 AI 玩法?

文章汇集了鹅厂员工分享的多种小众 AI 玩法,涵盖修电动车、找失物、解读体检报告、规划旅游等日常场景,展现了 AI 解决琐碎问题的能力,并鼓励读者分享自己的用法。

值得关注:

  • AI 可辅助修理电动车,通过拍照视频获得解决方案并动手修复。
  • 用 AI 解读体检报告,将难懂指标转化为健康行动建议。
  • AI 根据旅游笔记和个人需求自动生成完整旅行计划。

来源:腾讯技术工程

3. Seedance 2.5 发布:一镜成片

字节跳动 Seed 团队发布新一代视频生成模型 Seedance 2.5,将单次生成时长提升至 30 秒并支持多轮延长,强化长叙事、多模态参考和精准编辑能力。目前已在即梦 AI、豆包专业版等平台上线,API 服务将登陆火山方舟。

值得关注:

  • Seedance 2.5 单次生成时长从 15 秒提升至 30 秒,并支持多轮延长生成数分钟连贯视频。
  • 多模态参考能力升级,单次最多支持 30 张图片、10 段视频和 10 段音频作为参考素材。
  • 新增时间戳控制,可对指定片段进行定向编辑,支持绿幕编辑、视角与运镜编辑等。

来源:赛博禅心

4. OpenAI 突然杀疯!GPT 5.6 系列价格最高暴降 80%

OpenAI 宣布 GPT-5.6 系列全面降价,其中 Luna 价格暴降 80%,Terra 下调 20%,自动批准功能成本降至十分之一。同时 Sol 推出快速模式,速度提升 2.5 倍。此次降价得益于 AI 自主优化底层内核,使运行成本降低 20%、token 生成效率提升 15%。

值得关注:

  • GPT-5.6 系列全面降价,Luna 降 80%,Terra 降 20%。
  • Sol 推出快速模式,速度最高提升 2.5 倍,价格为标准模式两倍。
  • 自动批准功能成本降至原来的十分之一,使用 Luna 提前拦截高风险操作。
  • 降价的关键在于 AI 自主优化底层内核:运行成本降 20%、token 生成效率提升 15%。

来源:AI寒武纪

趋势观察

  1. 真实生活场景成为 Agent 能力试金石 — VibeLifeBench 揭示:即使最强模型,在主动性、持久化、长程一致性上仍大面积不及格,这比传统 benchmark 更接近真实使用体验。
  2. AI 自我优化开始反哺商业成本 — GPT-5.6 降价不是简单的价格战,而是 AI 自主优化底层内核带来的真实成本下降,这条路径可能改变模型定价逻辑。
  3. 视频生成走向"长叙事 + 精准编辑" — Seedance 2.5 把单次生成拉到 30 秒并支持多模态参考与时间戳编辑,从"生成片段"走向"创作连贯作品"。
  4. AI 实用主义渗透日常生活 — 修车、体检报告、旅行规划等场景说明,AI 的价值不只在写代码,更在解决具体生活问题。