🔥 今日头条:Kimi K3 傲视发布:开源性能逼平 Claude 与 GPT 旗舰,中美差距缩至两个月
月之暗面正式推出 Kimi K3,直接在全球大模型界引发了地震。在极其严苛的 DeepSWE 真实代码修改测试中,K3 狂揽 69 分杀进前三,与 Claude Fable 和 GPT-5.6 Sol 两个顶级闭源巨头并列!硅谷不得不承认,中国开源模型的迭代速度已将中美代差从原本的 9 个月生生拽到了 2 个月。更可怕的是其定价:百万 Token 输入仅 3 美元。这场工程效率与算力消耗的极限对决中,中国实验室正以极高资本效率实现弯道超车!
🚀 行业速递 Top 10
- Claude Code 额度限额提升 50% 政策再度延长一个月
Anthropic 宣布将原定到期的 Pro、Max、Team 等用户的 Claude Code 每周限额提升 50% 政策延期至 8 月 19 日。这一策略在开发者群体中广受好评,若热度持续,该政策有望转为常态化,进一步降低高端模型的使用门槛。
- 腾讯 WorkBuddy 月活达 885 万,打造中国版办公 Codex
腾讯云办公 AI 智能体平台 WorkBuddy 月活已飙升至 885 万,成为国内最大的同类产品。其核心优势在于为非技术人员提供预设工作流,免去理解提示词的痛苦。相比之下,OpenAI 旗下的 Codex 与 ChatGPT Work 周活合计刚超 800 万。
- NVIDIA 发布 DeepStream 9.1,新增 13 项智能体技能
英伟达推出 DeepStream 9.1,引入了 13 项 agentic skills。支持用户通过自然语言构建多摄像头视觉管线。其核心技能 MV3DT 能将多视角检测投影到统一 3D 坐标系,实现全局一致性追踪,并支持自动摄像头参量标定。
- DeepMind 与 Isomorphic Labs 联合公布生物防御最新研究方案
Google DeepMind 携手 Isomorphic Labs 详解其在“生物弹性”(Bioresilience)领域的最新部署。项目致力于利用 AI 的深度预测能力,提前发现和防御潜在的生物安全及公共卫生风险,推动数字化生物安全建设。
- 前沿 AI 实验室研究员因网络敌意被迫停止公开写作
OpenAI 研究员 Dean Ball 等人表示,由于在 X 等平台上分享学术洞察时,频繁遭受针对其雇主的恶意攻击与偏见干扰,他们已无法进行正常的实时公开写作。学界对此深感遗憾,担忧顶尖人才的集体失声会削弱公众讨论的深度。
- 开源工具 ProofAgent-Harness 问世,多维度评估智能体可靠性
DAIR.AI 推出开源评估工具 ProofAgent-Harness,通过角色清晰度、注入防护、Token 效率等七项标准对 AI 智能体上下文质量进行评分。研究表明,上下文工程质量是智能体抗幻觉与防操纵能力的独立领先指标。
- 作家 Dave Eggers 炮轰 OpenAI:ChatGPT 对教师而言是灾难
知名作家 Dave Eggers 在应 Sam Altman 邀请向 200 名 OpenAI 员工演讲时,直言 ChatGPT 对教育工作者造成了“灾难性”的影响,并严厉指责科技公司在无形中给一线教师群体带来了巨大的生存和职业伦理压力。
- 手把手教你配置备用 Mac,让 Claude Code 物理掌控安全无忧
一篇在开发者社区大火的实操指南详细介绍了如何配置一台备用 Mac,使其成为能够被 Claude Code 通过 “Computer Use” 完整控制的常开机器。该方案通过 SSH 物理隔离主设备,完美规避了 AI 控制主系统时的隐私与数据风险。
- xAI 下周发布 Grok CLI 重大更新,加码开发者生态
埃隆·马斯克旗下的 xAI 透露下周将针对其命令行工具 Grok CLI 发布重大更新。市场普遍猜测,xAI 正在加快打通终端命令行与云端大模型的通道,旨在为开发者提供更轻量、更高频的终端智能体生态。
- François Chollet 痛批:模型指令执行力飙升,但决策力长期停滞
AI 领域泰斗级人物 François Chollet 指出,当前 AI 行业存在有趣的脱节:模型精准执行已知指令的能力(指令遵循)提升极快,但在面对指令未覆盖的模糊边缘情况时,模型做出合理常识性决策的能力却处于长期停滞状态。