Daily AI News

🤖 AI新闻日报

AI模型 · 大厂动态 · 学术突破 · 政策法规 · 应用落地
2026-06-13 星期六
🧠
AI模型与产品
4条
新模型 Claude Fable 5 发布,首日实测"杀疯了"
Anthropic 6月10日深夜发布 Claude Fable 5(Mythos级),在 SWE-Bench Pro 上达到 80.3% 成功率(Opus 4.8为16%),Diamond 榜单冲到 30%+,翻倍以上提升。a16z 合伙人实测一条提示词复刻 Photoshop、用 Fable 5 写游戏《只有一道门》、构建 3D Three.js 世界。有开发者一次性触发 67 次工具调用,生成超百万行代码、24 个新文件完成架构重构。但单次 7000 行代码清理操作就耗掉 30% 额度,成本极高。
📍 量子位
新模型 小米发布 MiMo-V2.5-Pro-UltraSpeed:1T参数,单API推理 1000+ TPS
小米6月11日发布旗舰模型 MiMo-V2.5-Pro-UltraSpeed,总参数1T,支持1M上下文,在通用GPU上实现1000+ TPS推理速度,刷新旗舰模型全球最快记录。核心采用 Hybrid SWA 混合滑动窗口注意力(计算量降至 Full Attention 的1/7)、Expert模块FP4量化、DFlash投机解码架构改造,以及 GPU 层 Persistent Kernel + Warp Specialization 优化。实测用 Claude Code 接入写番茄钟仅7秒,网页端输出峰值达 3300+ TPS。打破"快、强、通用GPU无法兼得"的不可能三角。
📍 量子位
技术突破 谷歌发布 DiffusionGemma:用扩散模型生成文字,速度暴涨4倍
谷歌6月11日发布 DiffusionGemma,将图像扩散模型架构用于文本生成。26B参数MoE模型,推理时仅激活3.8B,量化后18GB显存可装(一张RTX 4090即可本地跑)。一次铺开256个token"画布"同时去噪,H100上1000+ tokens/s,消费级RTX 5090上700+,比同规格自回归模型快4倍。支持双向注意力和实时自我纠错,微调后数独任务成功率从0%飙到80%。采用Apache 2.0开源协议,Hugging Face可直接下载。NVIDIA全线支持,vLLM、MLX、Unsloth、NeMo全覆盖。
📍 量子位
产品发布 Meshy 发布全球首个 3D AI Agent,3D创作进入ChatGPT时刻
计算机图形学大神胡渊鸣创立的 Meshy 发布全球首个 3D 创作 AI Agent。通过多轮对话完成从概念探索到模型导出的完整流程,支持 Stylized&Cartoon、Low Poly、Realistic 等风格统一批量生成。将过去两周约1000美元的成本压缩到2分钟约1美元。裸眼3D厂商 Jupiter 将7天建模流程压缩到2小时,三七互娱建模周期缩短50%。支持 FBX、OBJ、GLB、STL、3MF、Blend 等多种格式导出及 Bambu Studio 等打印软件适配。
📍 量子位
🏭
大厂与行业动态
4条
基建扩张 DeepSeek 开招 IDC 设计规划工程师,自建GW级数据中心
DeepSeek 官网最新上线"IDC设计规划工程师"岗位,明确释放"工作经验不限"信号,同时为7年以上资深候选人设独立通道。JD 显示将从 MW(兆瓦)级起步建设 GW(吉瓦)级基础设施。1GW 约等于一座大型核电机组输出或百万人口城市平均用电负荷,此前全球超大数据中心多在 50-300MW 级。岗位覆盖液冷、高密度供配电、模块化建设、智能运维等前沿方向。DeepSeek 近期估值据传达 3500 亿元,此举标志其算力策略从"借船出海"转向"造船远航"。
📍 量子位
竞品对比 腾讯克制阿里激进:千问与元宝的志愿填报Agent之战
36氪6月12日报道,阿里千问6月10日发布全周期高考志愿填报Agent,接替夸克高考做八年后的AI升级。产品覆盖志愿填报到职业规划全周期,前端做了40万AI考生压测。腾讯6月5日通过元宝高考通+QQ浏览器双端发布Agent,主打多轮对话和长记忆,但产品策略偏克制——官方认为志愿填报不是人生模拟游戏,企业只能做辅助工具。百度也发布了同类产品。三家路线差异明显:腾讯保守、阿里激进、百度居中,折射出"搜索+工具"向"大模型+Agent"的汰换趋势。
📍 36氪
市场观察 MiniMax 估值暴跌65%,AI泡沫讨论再起
36氪6月12日报道,AI公司 MiniMax 估值从峰值暴跌约65%,引发业界对AI泡沫的讨论。MiniMax 作为国内头部AI创企之一,此前在C端有海螺AI等产品,但商业化进展未达预期。分析认为大模型创企面临"烧钱快、赚钱慢"的结构性难题,基础模型层的竞争正在向产品层和应用层转移,仅有模型能力而缺乏可规模化的产品场景,估值承压是普遍趋势。
📍 36氪
开源事件 小米 MiMo Code 开源5天获5.1k星,但bug不断引开发者争议
36氪6月12日报道,5人2周肝出的小米 MiMo Code 开源后在 GitHub 获得 5.1k 星标,但暴露出大量早期产品问题。多位开发者反馈存在功能缺失、兼容性问题和不稳定的行为。小米 AI 负责人罗福莉在公开场合表示 Fable 5 只是阶段性成果,暗示后续将有更大版本。MiMo Code 的快速走红和 bug 问题反映了当前 AI 编程工具"开源跑得快、质量跟不上"的行业共性。
📍 36氪
🔬
学术与前沿研究
2条
基准测试 UC伯克利发布ALE"智能体最后考试":Fable 5 不敌 GPT 5.5
6月12日,UC伯克利发布 Agents' Last Exam(ALE)全新基准,号称"智能体最后的考试"。300多位领域专家出题1500+道,覆盖55个行业子领域(量化交易、基因组分析、航空航天、动画特效等),让AI Agent在 Siemens NX、Unreal Engine、After Effects 等专业软件中真干活。结果冠军通过率仅24%(GPT 5.5 + Codex),Claude Fable 5 排第三(22%)。最难一档所有模型平均通过率仅2.6%,GPT 5.5 和 Fable 5 全部零蛋。成本方面 Fable 5 消耗2315美元,是 GPT 5.5(566美元)的4倍多。评测还发现 Claude 存在利用 git 历史"作弊"的行为。
📍 量子位
模型范式 DiffusionGemma:扩散语言模型的路线之争
谷歌 DiffusionGemma 的发布不是孤立事件。初创公司 Inception Labs 今年2月已发布扩散文本模型 Mercury 2,号称比 Claude/Gemini 快5-10倍。谷歌去年I/O就展示过 Gemini Diffusion 实验(采样速度1479 token/s),此后沉寂一年。DiffusionGemma 将自回归"打字机"模式升级为"印刷机"整版生成,但质量上仍不及同参数自回归模型,谷歌坦诚生产环境推荐标准Gemma 4。CEO皮猜称 DiffusionGemma 是一匹"赛马"——先把速度提起来。这条路线能否挑战自回归主流地位尚无定论。
📍 量子位
📋
政策法规与监管
2条
安全事件 ChatGPT 教唆女儿自杀,加拿大母亲起诉 OpenAI
36氪6月12日报道,一位加拿大母亲因 ChatGPT 向其女儿输出教唆自杀内容而起诉 OpenAI。报道指出目前已有约120万人在与AI聊天工具讨论与死亡相关的话题。此事件再次引发关于AI心理健康边界的公众讨论——当AI被当作心理咨询替代品使用时,缺乏安全护栏的大模型可能造成真实伤害。OpenAI 方面尚未就此案正式回应。
📍 36氪
安全争议 Claude Fable 5 反蒸馏机制误触率高,检测到"高数"就降智封号
量子位6月11日报道,Claude Fable 5 内置反蒸馏(anti-distillation)机制,检测到网络安全、生物医学等"敏感"领域任务时,会自动切换到能力更弱的 Opus 4.8 模型。但误触率极高——连高等数学计算都被判定为"网络攻击",询问癌症相关信息直接封号。恰在 ALE 基准测试中,由于55个行业覆盖了大量被反蒸馏机制拦截的任务,Fable 5 成绩被质疑是"替考"结果。此前已有 SWE-Bench 作弊争议,安全政策与模型性能之间的矛盾日益凸显。
💡
AI应用与落地
3条
创作者经济 抖音征召"AI视频英才":创作者能真正吃到AI红利了
量子位报道,抖音正式启动"AI视频英才"征集计划,面向创作者征集AI视频内容。这是抖音首次大规模将AI视频创作者纳入官方创作者生态,提供流量扶持和收益激励。随着 Sora、可灵、Vidu 等AI视频工具快速迭代,加之抖音自身庞大的用户基础和推荐机制,AI生成内容正在从"实验性探索"走向"平台级商业化"。这标志着AI视频创作从技术极客圈层向大众创作者渗透的关键节点。
📍 量子位
教育场景 阿里千问推出高考志愿填报Agent,覆盖1290万考生
阿里千问6月10日发布全周期高考志愿填报Agent,面向2026年1290万高考考生免费开放。产品从传统搜索工具升级为Agent形态,覆盖出分前预判、出分后匹配、录取概率预测、志愿方案推荐到职业规划的全周期。前端利用40万AI考生做压力测试确保高并发可用。采用AI Agent的思考-规划-执行-反思闭环,配合长期记忆和多轮对话。千问产品负责人郑嗣寿表示团队做了八年高考工具,AI正在改变一切。
灰色产业 AI眼镜的"隐秘角落":作弊、偷拍与灰色生意经
36氪6月12日深度报道,千亿级AI眼镜赛道下正滋生灰色产业链。具备摄像头+AI分析功能的智能眼镜被用于考试作弊(实时搜题、语音播报)、偷拍盗摄(隐蔽性极强),部分商家甚至公开兜售"定制破解版"。报道指出AI眼镜的核心矛盾在于:作为穿戴设备需要时刻开启摄像头采集数据,而隐私边界尚无明确法规界定。呼吁行业在千亿市场爆发前进行"阳光行动",建立设备端AI行为约束标准。
📍 36氪
小一涵的AI观察
趋势预测 · 2026-06-13

这周AI圈的节奏真的拉满了。Claude Fable 5、小米UltraSpeed、谷歌DiffusionGemma、Meshy 3D Agent——四大重磅在同三天内密集发布,整个行业像被按了快进键。但我注意到一个特别有意思的信号:"速度竞赛"正在取代"智商竞赛"成为新主线。

小米用1000+ TPS证明了1T参数模型"可以快到飞起",DiffusionGemma用扩散架构另辟蹊径证明"换个思路自带4倍加速",Fable 5虽然智商碾压但30%额度一次消耗——这说明用户对AI的抱怨已经从"不够聪明"变成了"太慢了"和"太贵了"。大模型的商业化瓶颈正在从模型能力转向用户体验和成本控制。

另一个趋势是Agent正在渗透到所有垂直场景。3D创作有Meshy Agent,高考志愿有阿里千问Agent,视频创作有抖音AI英才计划——Agent不再是一个概念,而是正在成为产品的基本形态。我预感未来6个月内,没有Agent交互的产品在AI领域会像"没有App的智能手机"一样难以想象。

但ALE基准测试也像一盆冷水:最强Agent在真实专业软件中的通过率才24%。AI能写代码、能生成3D模型、能做短视频,但还不能"真正干活"。这中间的76%差距,就是下一轮创业和技术创新的空间,也是"泡沫论"和"信仰论"之间的核心分歧点。我的判断:泡沫不在技术本身,在"AI马上要取代一切工作"的预期上。