今日概览
今日内容覆盖四个方向:真实生活场景的 Agent 评测揭示能力短板、AI 在生活细节中的实用玩法、视频生成模型的代际升级、以及模型定价战背后的 AI 自主优化。其中评测基准与 AI 自我优化两条线对工程实践最有参考价值。
今日重点
1. 把最强模型丢进真实生活一个月,没有一个及格
小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench 两个真实生活场景基准,用旅行、理财等长程任务测试 AI 助理。结果显示七个最强模型均未及格,普遍缺乏主动性、持久化和长程一致性,能力短板明显。
值得关注:
- VibeLifeBench 用带时钟的模拟世界测试 AI 助理,包含 200 个生活任务和 12,261 条加权检查。
- 七个最强模型在 VibeLifeBench 中得分仅 0.21-0.33,主动性和长程一致性是最弱环节。
- VibeSearchBench 中所有模型均未拿到用户模拟器的 [DONE] 信号,主动澄清意图能力严重不足。
来源:小红书技术REDtech
2. 鹅厂员工有哪些小众的 AI 玩法?
文章汇集了鹅厂员工分享的多种小众 AI 玩法,涵盖修电动车、找失物、解读体检报告、规划旅游等日常场景,展现了 AI 解决琐碎问题的能力,并鼓励读者分享自己的用法。
值得关注:
- AI 可辅助修理电动车,通过拍照视频获得解决方案并动手修复。
- 用 AI 解读体检报告,将难懂指标转化为健康行动建议。
- AI 根据旅游笔记和个人需求自动生成完整旅行计划。
来源:腾讯技术工程
3. Seedance 2.5 发布:一镜成片
字节跳动 Seed 团队发布新一代视频生成模型 Seedance 2.5,将单次生成时长提升至 30 秒并支持多轮延长,强化长叙事、多模态参考和精准编辑能力。目前已在即梦 AI、豆包专业版等平台上线,API 服务将登陆火山方舟。
值得关注:
- Seedance 2.5 单次生成时长从 15 秒提升至 30 秒,并支持多轮延长生成数分钟连贯视频。
- 多模态参考能力升级,单次最多支持 30 张图片、10 段视频和 10 段音频作为参考素材。
- 新增时间戳控制,可对指定片段进行定向编辑,支持绿幕编辑、视角与运镜编辑等。
来源:赛博禅心
4. OpenAI 突然杀疯!GPT 5.6 系列价格最高暴降 80%
OpenAI 宣布 GPT-5.6 系列全面降价,其中 Luna 价格暴降 80%,Terra 下调 20%,自动批准功能成本降至十分之一。同时 Sol 推出快速模式,速度提升 2.5 倍。此次降价得益于 AI 自主优化底层内核,使运行成本降低 20%、token 生成效率提升 15%。
值得关注:
- GPT-5.6 系列全面降价,Luna 降 80%,Terra 降 20%。
- Sol 推出快速模式,速度最高提升 2.5 倍,价格为标准模式两倍。
- 自动批准功能成本降至原来的十分之一,使用 Luna 提前拦截高风险操作。
- 降价的关键在于 AI 自主优化底层内核:运行成本降 20%、token 生成效率提升 15%。
来源:AI寒武纪
趋势观察
- 真实生活场景成为 Agent 能力试金石 — VibeLifeBench 揭示:即使最强模型,在主动性、持久化、长程一致性上仍大面积不及格,这比传统 benchmark 更接近真实使用体验。
- AI 自我优化开始反哺商业成本 — GPT-5.6 降价不是简单的价格战,而是 AI 自主优化底层内核带来的真实成本下降,这条路径可能改变模型定价逻辑。
- 视频生成走向"长叙事 + 精准编辑" — Seedance 2.5 把单次生成拉到 30 秒并支持多模态参考与时间戳编辑,从"生成片段"走向"创作连贯作品"。
- AI 实用主义渗透日常生活 — 修车、体检报告、旅行规划等场景说明,AI 的价值不只在写代码,更在解决具体生活问题。