🔥 今日头条:2026 智能体元年:token 消耗超人类 5 倍,人类沦为 AI 的“少数用户”
a16z 最新数据宣告了一个历史性转折点的到来:2026年正式确立为“智能体之年”。目前智能体消耗的 token 量已经达到人类用户的 5 倍,且自 2 月以来狂飙 14 倍。回看一年前,周处理 10B token 还是行业大奖,如今已是基操。当 AI 不再只是回答问题的工具,而是化身自主干活的主体,整个人类社会的生产力和工作负载形态正在被彻底重构。
🚀 行业速递 Top 10
- 北京人形机器人百米9.39秒超越博尔特
来自北京的人形机器人以纯自主模式在百米赛跑中跑出 9.39 秒的成绩,正式超越博尔特在 2009 年创造的 9.58 秒人类纪录。这不仅是一场竞技的胜利,更标志着具身智能在无人类操控下的自主运动控制取得了突破性进展。
- 开源模型反超:Vercel AI Gateway 权重占比创新高
开源生态迎来高光时刻。Vercel AI Gateway 数据显示,开源权重 token 占比从两个月前的 28.4% 飙升至 62%,首次实现对闭源模型(38%)的大幅反超,预示着绝大多数 AI 工作负载正加速向开源靠拢。
- 英伟达自研编码框架满分通过 ARC-AGI-3
英伟达构建的用于优化 CUDA GPU 内核的编码框架,在 ARC-AGI-3 的 25 个公开游戏中取得 100% 的满分成绩(解决全部 183 个关卡),展示了智能体在底层硬件与内核优化上的恐怖实力。
- Inherent 发布 Faraday 智能体,称复现科学论文超越大厂
伦敦 AI 实验室 Inherent 推出基于 270 亿参数 Qwen 3.6 的智能体 Faraday。通过强化学习训练,该智能体在独立复现科学论文结论的任务上,击败了 Claude Opus 4.8 和 GPT-5.5。
- 微软发布 Thinkingbox:智能体可靠性沙盒基准
微软推出专门针对真实业务流程中智能体可靠性的沙盒环境 Thinkingbox,内含涵盖零售、汽车保险等领域的 507 个策略条件工作流基准。测试显示当前最强模型的单次通过率(pass@1)为 65.36%。
- 斯坦福研究:AI智能体辩论会加剧群体“右倾”与漂移
斯坦福大学研究发现,让多达 32 个不同人格的 AI 智能体相互辩论能提升其确定性。但在政治议题测试中,4 个模型中有 3 个出现了明显的右倾趋势,研究建议系统必须追踪群体漂移方向,而非盲目看重分数提升。
- Anthropic 承认 Opus 5 表现“尖刺”,正全力改进
面对用户对 Claude Opus 5 表现不佳和体验变笨的广泛批评,Anthropic 官方坦言其为“尖刺型”模型,与一贯的稳定风格不符。官方确认改进已是最高优先级,并澄清 Claude Code 中的数值映射问题并非性能降级。
- 神秘模型 Ox Alpha 性能曝光,DeepSWE 测试媲美 GPT-5.6
神秘模型 Ox Alpha 在 DeepSWE 测试中取得约 63% 的成绩,表现与 GPT-5.6 Sol mid 相当。外界猜测其可能为能在本地运行的 GLM-5.3 Flash,虽然代码质量高但速度偏慢。
- MCP 核心路线图更新:聚焦智能体消息原语与 HTTP 传输
模型上下文协议(MCP)发布新路线图,重点推进 Tasks 扩展规范、统一 HTTP 原生传输以覆盖本地服务器,并通过 DPoP 和 Workload Identity Federation 强化企业级智能体身份安全。
- AI 不是均衡器:大模型时代强者恒强
行业专家发文指出,AI 并不会消除人与人之间的差距,它本质上是一个“放大器”。虽然人人都能用上顶级的编码助手和 ChatGPT,但优秀的人能够利用它们实现更恐怖的指数级复利增长。