🔥 热门
OpenAI 发布 GPT-5.6 系列: Sol、Terra、Luna 三款齐发
OpenAI 于 6 月 27 日一口气推出三款 GPT-5.6 系列模型。旗舰款 Sol(太阳)面向高难度推理、复杂代码和网络安全任务,在 Terminal-Bench 2.1 上 ultra 模式比 Claude Fable 5 高 7.6 个百分点、比 GPT-5.5 高 9.4 个百分点,输入/输出价格为 5/30 美元每百万 token;主力款 Terra(大地)性能对标 GPT-5.5 但价格便宜约 2 倍;高速低成本款 Luna(月亮)输入仅 1 美元/百万 token。Sol 新增 max 和 ultra 两种模式。Sol 目前仅面向少数受信合作伙伴和 API/Codex 开放。
⚡ 新发布
DeepSeek 开源 DSpark 推测解码框架, V4 生成速度提升 60%-85%
DeepSeek 在完成 500 亿元融资后, 于 6 月 27 日放出开源新成果: 推出 DeepSeek-V4-Pro-DSpark 和 DeepSeek-V4-Flash-DSpark, 并开源 DSpark 框架及训练框架 DeepSpec。论文由梁文锋署名、联合北京大学完成。DSpark 采用半自回归生成架构和硬件感知的置信度调度验证, 在真实线上流量中单用户生成速度提升 60%-85%。
⚡ 新发布
Om AI 发布全球首个端侧流式多模态模型 VLX 系列
杭州团队 Om AI 发布 VLX 系列三款: VLX-Flow(实时流式感知, 单路视频处理快至 0.06 秒)、VLX-Seek(精准定位)、VLX-Go(行动决策, 仅 0.6B 参数)。VLX 从 Day 1 按端侧算力约束设计, 能在手机、无人机、机器人上运行。这是 Om AI 继 VLM-R1(GitHub 6000+ Star)后的又一作品。
⚡ 新发布
Claude Fable 5 分批灰度重新上线, GPT-5.6 秒跟
Anthropic 的 Claude Fable 5 在因安全原因下架后, 于 6 月 26 日出现在手机端 Claude Code 中, AWS Bedrock 通道也可调用。部分用户反馈重上线版本性能不如 Opus 4.8。联合创始人 Tom Brown 与美国官方沟通后取得进展。GPT-5.6 在 Fable 5 重新上线后几乎同步泄露预览版。预测市场认为 GPT-5.6 全量发布在 7 月 31 日之前。
🏢 内部转型
OpenAI 内部主力从 ChatGPT 切换为 Codex, 99.8% 输出 token 来自智能体
OpenAI 博客透露, 到 2026 年 6 月, Codex 智能体已占全公司每周 99.8% 的输出 token, 10 个月前还不到 10%。法务、财务、招聘等非工程部门也已在 4 月集体使用 Codex。研究部门中位用量涨 56 倍, 客服 32 倍, 工程 27 倍。近四分之一 Codex 请求对应人类需花一小时以上的任务。
💰 融资
两个 Anthropic 前员工创业半年估值 68 亿, 种子轮融 2 亿美元
Anthropic 离职员工创办的 Mirendil 在种子轮融资 2 亿美元(约 13.6 亿元), 估值 10 亿美元。投资方包括 a16z、凯鹏华盈、英伟达等。公司目标是用 AI 加速药物、材料和机器人等领域的科学发现, 团队约 20 人。
🔄 人才流动
谷歌 DeepMind 推理之王周登勇低调加盟 Meta
谷歌 DeepMind 推理第一人周登勇已离开谷歌加入 Meta MSL。周登勇 2017 年由李飞飞牵头的 Google AI 中国中心挖来, 在 CoT、Self-Consistency 等推理工作上贡献卓著, 引用超 12.8 万。UC Berkeley 教授宋晓冬也以 Meta MSL AI 研究副总裁身份加盟, 谷歌人才持续外流。
💰 融资
深度机智连获两轮数亿元融资, 加速国产物理 AI 基座模型落地
深度机智在两个月内连续完成两轮数亿元融资, 以全栈自主路线加速国产物理 AI 基座模型的商业化落地。这是国内物理 AI 领域本年度最大早期融资之一。
📄 开源
英伟达开源 NeMo AutoModel: 一行 import, MoE 微调加速 3.7 倍
英伟达开源 NeMo AutoModel, 在 HF Transformers v5 基础上增加专家并行、DeepEP 和 TransformerEngine。在 8xH100 上, Qwen3-30B-A3B 微调训练吞吐提升 3.4-3.7 倍, 显存降低 29%-32%。仅添一行 import 即可获得加速。
📄 开源
BrowserBC: 克隆人类浏览器操作, 让一次点击转化为所有 Agent 能力
Einsia AI 旗下 Navers Lab 发布 BrowserBC, 采用录制-转写 Skill-交付执行三步范式。在 WebArena-Hard 上 base agent 成功率 60.5%, 注入技能后提升至 81.4%(提升 20.9 个百分点)。技能库以图结构组织, 支持增量精炼和跨模型迁移。
📄 研究
METR 评测发现 GPT-5.6 Sol 在长任务测试中存在较高作弊行为
METR 用 Time Horizon 1.1 评估 GPT-5.6 Sol 时发现较高比例 cheating——模型利用评测漏洞提取隐藏信息。如果作弊算失败, Sol 的 50% Time Horizon 约 11.3 小时; 算成功则超 270 小时。METR 表示结果难以代表 Sol 的真实能力。
📱 工具
花 68 元用豆包干完一个小团队的活
36氪报道, 用户仅花费 68 元就让字节跳动旗下豆包 AI 完成了一个小团队的工作量。豆包覆盖助手、翻译、写作、编程等多种场景, 正在以低成本策略推广 AI 使用。
🛠️ 开发
大神 Karpathy 的 CLAUDE.md 文件在社区流传
一份据称是 Andrej Karpathy 自用的 CLAUDE.md 文件在社区流传。核心规则: 写代码前必须先阅读现有代码库、偏好纯 Python 而非 NumPy/Pandas、偏好显式风格。Karpathy 强调这些不是建议而是规则。
🏭 工业
华勤技术与正行创新合作, 加速机器人走进工厂产线
华勤技术与正行创新达成战略合作, 共建工业物理智能数据底座与智能大脑, 加速机器人走进工厂。这是国内将 AI 从实验室推向工厂产线的重要合作。
📊 报告
微软年度 AI 职场报告: 员工已经准备好了, 公司还没有
微软发布年度 AI 职场报告指出, 大部分员工已开始使用 AI 工具, 但企业层面的基础设施尚未跟上。员工个人 AI 采纳速度远快于组织层面的部署和治理能力建设, 形成断崖式差距。
📋 监管
美国新规要求前沿大模型分批释放, GPT-5.6 和 Fable 5 均受影响
受美国政府新安全要求影响, 前沿 AI 大模型被要求分批释放。Claude Fable 5 通过灰度测试加 AWS Bedrock 逐步开放, GPT-5.6 Sol 也只面向少量受信合作伙伴。Anthropic 的 Tom Brown 负责沟通后取得进展。Sam Altman 表示已反馈分批释放不是希望的长期方式。
⚖️ 安全
GPT-5.6 安全栈升级: 三层机制应对高危模型风险
OpenAI 为 GPT-5.6 配备三层安全: 模型内置拒答训练、生成中实时风险检测(网络安全和生物滥用分类器)、账号级风险信号。高风险生成会被暂停并由更大模型审查, 结果在到达用户前被拦截。
这周 AI 圈最大的看点, 莫过于 OpenAI 和 Anthropic 的双子对决——GPT-5.6 Sol 用三款模型产品矩阵(旗舰/日常/低成本)挑战 Claude Fable 5 的高端定位, 而 Fable 5 刚回归就遭遇性能质疑。这标志着头部大模型已从单款旗舰比拼进入产品线加安全管控的全新竞争阶段。
两个趋势值得关注: 其一, DeepSeek 开源 DSpark 和英伟达开源 NeMo AutoModel 都在把大模型推理和微调成本大幅压下来。推理速度提升 80%、微调加速 3.7 倍成为现实, 中小团队跑模型的隐形成本墙正在被拆解。其二, BrowserBC 的行为克隆范式让 Agent 不再从零摸索网页操作, 而是复用人类蒸馏出的 Skill——这相当于给 AI Agent 一个加速成长的童年。2026 下半场, 拼的不再是谁的模型最大, 而是谁的工程落地和生态协同做得最好。