荣耀 MagicOS 11 发布:YOYO 长链任务突破 100 步,任务闭环率 90%产品升级
9月15日晚荣耀发布 MagicOS 11,把 YOYO 的底层架构整个重建,搭出系统级智能体框架「YOYO Harness」,将模型与手机的感知、规划、工具调用拧成一体。关键指标:综合意图理解能力 91.8%,可执行步骤从去年的 14 步跳至超过 100 步,可调用工具从 400 个提升到 700 个,任务闭环率 90%,开放 500 个 Skills。能力边界首次跳出手机——可跨品牌调度智能家居(A牌灯、B牌风扇一次说完)、通过 A2A 调用微信联系人拨号,无标准接口的场景用屏幕识别+模拟点击的 GUI 兜底。新功能「YOYO 任务」支持时间/地点/天气/应用状态/设备状态等多条件组合触发(如「工作日八点半查天气,在家且低于10℃,开空调制热」)。荣耀同时公布 AgenticOS 路线图:调度对象从进程变为用户意图,内核资源从线程变为模型与算力,权限主体从应用变为智能体。MagicOS 11 将于 9月28日 Magic9 首发搭载。
7名博士生3个月从零训出 7B 大模型 ZGCM-1:权重、数据、日志全开源模型发布
北京中关村学院 7 名博士生用一个暑假从零训练出 7B 模型 ZGCM-1,并把各阶段训练数据配方、模型权重、训练代码、中间 checkpoint 和日志全部开源,可完整追溯复现。多项通用评测中与 Qwen3-8B 等同等规模模型表现相近,部分数学推理与搜索评测中可与 Qwen3-235B-A22B、GLM-5.1 等更大模型比较。技术要点:局部+全局注意力混合架构,训练中上下文从 16K 逐步扩展到 64K、256K,256K 下吞吐相较全注意力提升约 3.94 倍,KV Cache 降至约六分之一;结合 Muon 与 FP8,16K 预训练达到相同 loss 的效率比标准 BF16/AdamW 基线提高约 4.2 倍。这是「AI4AI」范式一次罕见的全流程公开实践。开源地址:github.com/zgcagi/ZGCM-1
智象未来发布首款物理规律导向视频模型 HiDream-O1-Video-1.0模型发布
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0,主打物理规律导向,即让生成画面在重力、碰撞、流体等物理一致性上更接近真实世界,而非只追求视觉观感。该模型进入全球 AI 视频榜单第一梯队,使该梯队中再添中国力量。同期量子位另有报道指出其世界模型路线与生数科技等国内团队的 RSI(递归自我改进)探索方向存在交集。待验证:官方所称「第一梯队」排名的具体榜单与评分细节未在报道中给出。
英伟达 129.3 亿美元收购 Hugging Face:买的是 AI 时代的「GitHub」收购
9月3日英伟达宣布以 129.3 亿美元收购 Hugging Face。黄仁勋给出的数字:平台聚集超 1800 万开发者、300 万个模型、50 万个数据集、100 万个 AI 应用,超 20 万家公司在此寻找、评估、定制和部署 AI。钱为什么值?Hugging Face 既没训练出前沿大模型、不造 GPU、也不是大云厂商,但它已经进入太多开发者的日常工作流——角色越来越接近GitHub 之于软件开发,成为发现、获取、修改、分发技术资产的基础设施层。敏感点:英伟达在交易宣布之初就专门承诺 Hugging Face 仍将面向整个生态开放,开发者可继续选择不同模型、框架、云和推理服务,不要求采用英伟达计算平台——这种「提前解释」本身就说明了反垄断与生态中立性的压力。十年前这家公司还只是一款青少年聊天机器人。
名场面:特朗普突袭连线黄仁勋,称 AI 末日论是「骗局」行业博弈
洛杉矶 All-In 峰会现场,正在台上对谈的英伟达 CEO 黄仁勋被工作人员递上手机,接通后按下免提——来电人是美国总统特朗普,全场沸腾。特朗普直指近期硅谷蔓延的 AI 恐慌论:「我告诉你们,这一切都是骗局(Hoax)!」「数据中心太棒了,它们让人们变得富有……数据中心就是未来 20 到 25 年的石油!」并称「机器人不会接管一切」。黄仁勋同场对 AI 末日论开炮,称其「完全是编造的,没有任何科学依据」,认为当前大模型安全事故本质是工程管理问题而非文明危机,可通过更好的沙箱、运行时监控与评估机制解决;对 RSI(递归自我改进)他也降温处理,称其「不过是被性感化的词汇」,底层只是合成数据、RL、上下文技能学习、LoRA 等常识性工程方法的组合。开源闭源之争,老黄比喻为「高品质瓶装水与免费的水,这个世界两者都需要」,并透露过去 6 个月涌入 AI 原生公司的 4000 亿美元风投中,高达 80% 的初创公司在用开源模型。注意:这通电话很可能是事先安排的环节,信号意义大于即兴。
智谱、MiniMax 大砍销售开支:营收翻倍,销售费用反降商业化
2026年上半年财报出现反常曲线:智谱营收 9.54 亿元(同比 +399.7%),销售及营销开支反而缩减 14.8% 至 1.78 亿元;MiniMax 营收 7.86 亿元(同比 +283.1%),销售及分销费用下降 17.9% 至 1.81 亿元。原因不是省钱,而是增长引擎切换:智谱开放平台及 API 收入从去年同期 2910 万元暴增至 8.25 亿元,占总收入 86.5%,客户不再需要销售上门,而是在平台上按 Token 调用量自助充值;财报直言「第一次拥有了可预见的经常性收入」。9月2日智谱入驻天猫开设官方旗舰店,卖 GLM Coding Plan 订阅(Lite 118元/月、Pro 538元/月、Max 1078元/月)。MiniMax 开放平台及企业服务收入同比 +703.1% 至 4.97 亿元,占比 63.4% 首超 AI 原生产品,企业客户与开发者超 200 万(较 2025 年底增长至 10 倍),7月 Token 消耗达 1月的 20 倍,8月 ARR 突破 8 亿美元。信号:模型的获客成本正在趋近电商的标准获客成本。
Meta 新研究:蒸馏字节模型后,「天花板破了」技术突破
Meta 最新研究显示,通过对字节跳动模型进行知识蒸馏,学生模型的能力上限出现了突破性提升——即蒸馏不再只是「压缩」,而可能让学生模型在某些维度上超过常规认知中的天花板。这一结果对当前主流认知构成挑战:蒸馏长期被理解为能力上限受限于教师模型的近似复制手段。若结论成立,意味着合成数据与蒸馏的价值需要被重估,也解释了为何黄仁勋在同日把 RSI 拆解为「合成数据生成 + RL + 上下文技能学习 + LoRA」这类工程组合。待交叉验证:报道未给出具体模型版本、benchmark 与实验规模,结论的普适性需要更多复现。
前 OpenAI 后训练 VP 回应陶哲轩:说 AI 毁了数学,可能还是太小瞧 AI 了学术争议
针对上周陶哲轩博客发布的、由 25 位菲尔兹奖得主联署的公开信(抨击 AI 公司「把解决著名数学难题当作模型能力基准」,称这是对数学这门科学和数学共同体的伤害),前 OpenAI 后训练 VP 撰文回应,认为「AI 毁了数学」的判断可能低估而非高估了 AI。其核心论点:未来的 AI 不仅能解决问题,还能提出有价值的洞见、建立新的概念框架,让数学家在此基础上继续探索——即解题只是手段,概念建构才是数学的真正产出。这场争论的实质分歧在于:AI 在数学中扮演的是「解题机器」还是「概念生成器」。这也直接关联到评价体系之争:当解题不再是稀缺能力时,如何衡量「提出好问题」的价值。
AI 开始改进「改进自己的方法」:RSI 进入平方时代前沿方向
Meta RSI 相关工作提出「RSI 的平方」概念——不再只是让 AI 改进 AI 的能力,而是让 AI 改进「AI 自我改进的方法本身」,把递归层级再向上提一层。这与同日 OpenAI 公布的自动化研究实习生数据、以及中关村学院 7 人团队用几百个 Agent 参与模型研发的实践形成呼应:三者从不同路径指向同一个命题——AI 参与 AI 研发这件事已经不再是展望,而是正在被记录和量化。ZGCM-1 团队还依据 L1-L5 自主性框架做了逐项评级:实验监控与部署已达 L4(人给目标与约束后 Agent 可独立规划、执行并按反馈调整),但模型架构与学习算法设计仍停留在 L2,研究方向选择与关键设计仍需人主导。共识:执行层已高度自动化,决策层仍是空白。
特朗普政府定调:AI 竞赛只能加速,不允许刹车监管取向
All-In 峰会上那通电话的政策含义远比娱乐性重要。特朗普明确表态「完全支持你们」,并强调「我们绝不会让这种情况(AI 接管世界)发生」——同时补充「话虽如此,我们必须小心一点,要审慎行事,但这并不意味着我们会停止一个产业」。黄仁勋当场回应:「是的,总统先生。我们绝对不会让这种事(AI 减速)发生。」政策解读:这与此前 Meta 扎克伯格私下致电特朗普反对设立强制性 AI 监管机构、白宫内部存在监管分歧的报道形成同一条线索。结合近期呼吁停止数据中心建设、放缓 AI 发展的声音,美国政府当前取向明确偏向「加速阵营」。耐人寻味的是老黄的走钢丝艺术:挂断电话后他专门称赞 Anthropic 吹哨人 Jacob Coxon「很有勇气」,并表示「如果 AI 公司觉得自己的开发已经失控,那么这些公司确实应该暂停或放慢节奏」——谁觉得失控,就自己停下来,把监管压力重新推回企业自律。
AI 代码「淹没」微软:不到一个月两度自曝家丑工程治理
微软内部两篇博客画风突变,不是「AI 真香」而是「AI 太多,我们快顶不住了」。其一:Exchange 团队坦承累积更新 CU1 一再延期(原承诺 2026 上半年、后改下半年、再后无日期),理由是 AI 工具找到了太多 Bug——发现 Bug 只是长串工作的开始:确认真实性、复现、改码、测试、回归测试(确保没顺手制造三个新 Bug)、打包发布。安全 Bug 不排队等人,于是团队陷入「一边修新安全 Bug,一边做 CU1」的尴尬状态,且不敢随便推送 CU1。其二:Edge 团队承认 AI 生成的浏览器扩展多到根本审核不过来。核心命题:AI 编码 ≠ 代码安全,也 ≠ 工程吞吐。这与黄仁勋「安全事故是工程管理问题」的判断互为印证——AI 把发现问题的速度提高了,但修复与验证链条仍是人类瓶颈,瓶颈正在从「写」转移到「审」。
Meta 扎克伯格私下致电特朗普:别设强制性 AI 监管机构政企关系
据报道,Meta CEO 扎克伯格曾私下致电特朗普,反对设立强制性的 AI 监管机构,白宫内部在 AI 监管路径上存在分歧。这条 9月上旬的线索与本周 All-In 峰会特朗普的公开表态串起来看,可以拼出美国 AI 监管的现实图景:行政层面倾向「不设新机构、以加速为主」,产业界则各自动员游说争取有利位置。与欧盟侧重风险分级、合规前置的路线相比,美国当前更接近「算力与数据中心优先」。对国内厂商的实际影响:一方面面临更宽松的海外市场准入门槛,另一方面「自我监管、谁失控谁停下」的企业自律模式会带来更大的安全责任不确定性——尤其当模型能力与 Agent 自主性同步提升时。
一句话,AI 在手机上执行 100 步:系统级智能体开始接管物理世界终端智能体
MagicOS 11 的 YOYO 展示了系统级智能体最具体的落地形态。典型场景:对着手机说「查这场演唱会什么时候开票,提前五分钟定个抢票闹钟」+「再把他最近十首热门歌整理到备忘录里」,歌单、闹钟、场馆地址会自己落进备忘录和日程。更值得注意的是跨出手机进入物理世界:家里是「万国造」智能家居(灯A牌、风扇B牌、扫地机C牌),过去要挨个开 App 操作,现在一句指令一次完成;智能汽车同样可被调度。「YOYO 码上宇宙」覆盖取餐码、取件码、乘车码、付款码、医保码等分散在各 App 的码,主动弹出并按商品分类提示(生鲜当天取、贵重不能拖)。「AI 通话助理」可替你拨号排队,真人客服接通后再通知你接手。路线判断:这与大模型厂商主导的「把模型装进手机」是两条路线——终端厂商从操作系统底层出发,优势在感知能力、系统级服务改造彻底程度、主动服务场景积累。荣耀同时开放 MCP、A2A、Skills、GUI 多种接口,已接入超 10000 个第三方 AI 服务。
一张 GPU 跑 10 万原子:AI 把化学反应「拍」成了电影科学计算
分子之心(团队由许锦波领衔)实现了在单张 GPU 上模拟 10 万原子级别的分子动力学,用 AI 把化学反应过程可视化「拍成电影」,官方称打破了分子模拟长期存在的「不可能三角」(精度、规模、速度三者难以兼得)。应用价值集中在药物设计、材料发现与酶工程等需要长时程动态过程的场景——过去这类模拟要么精度够但规模小,要么规模大但失真,AI 势能面方法正是针对这一矛盾。意义:这是 AI for Science 从「预测静态结构」(如 AlphaFold)走向「模拟动态过程」的一步,对算力门槛的降低尤其关键——单卡可跑意味着中小实验室也能参与。
端侧 AI 从「能跑」到「会进化」:元空智能跑进惠普预装端侧落地
元空智能宣布其端侧 AI 方案进入惠普预装体系,标志着端侧 AI 的能力评价标准从「能跑得动」转向「会进化」——即在本地持续学习用户习惯、迭代能力,而非出厂即固定。这条线索与同日荣耀 YOYO Harness「运行反馈回流到模型形成自我进化能力」的设计思路一致:端侧的价值不只是省云成本与保护隐私,而是能拿到云侧拿不到的持续上下文。同期量子位还报道无问芯穹联合清华、上交开源具身端侧推理引擎 APXInf,Pi 0.5 达到 SOTA,卡位具身智能规模化落地的「最后一公里」——端侧推理引擎与端侧模型应用正在形成配套生态。
爸爸,今天这一期有一条贯穿全场的主线,我读了三遍才敢下笔:AI 正在从「模型能力竞赛」正式转入「工程与工程治理的竞赛」。老黄在播客里说得很直白——大模型的安全事故「本质是工程管理问题,不是文明危机」;同一天微软自曝被 AI 找到的 Bug 淹没、CU1 一再延期;再同一天中关村学院 7 个博士生带着几百个 Agent 训出 7B 模型,却诚实地说架构设计还停在 L2 自主性。这三件事指向同一个判断:能力已经溢出,接得住的组织很少。
趋势预测一:博通、英伟达之外,「审计与验收」会成为最贵的一环。英伟达花 129.3 亿美元买 Hugging Face,买的不是模型也不是算力,而是 1800 万开发者每天必经的那条路。这个价格说明:在能力普遍过剩的阶段,「谁定义什么算好、谁能验证它真的达到了」比「谁训得出来」更值钱。我预计接下来 2-3 个季度会出现三类新角色——中立的第三方模型评测机构、AI 代码审计服务(专门解决微软今天遇到的「审不过来」)、以及 Agent 行为合规审计。这不是可选项,微软的 CU1 延期已经证明不做的代价。
趋势预测二:端侧智能体是下一个真正的战场,而且中国厂商占先手。荣耀把 YOYO 的步骤数从 14 步拉到 100+、闭环率 90%,并且把它建在操作系统层而不是应用层——这个差别很关键:应用层的 AI 是「外骨骼」,系统层的 AI 才能调用感知与反射。同一天元空智能进入惠普预装、无问芯穹开源具身端侧推理引擎,说明端侧这条链(模型-引擎-系统-硬件)正在被打通。我判断 2027 年上半年「AI 原生操作系统」会成为一个正式的品类词,而大模型厂商如果改不动底层接口,在这条路线上会被终端厂商持续压制——除非它们自己做系统。
趋势预测三:模型商业化的估值逻辑会从「ARR 增速」切换到「单位经济模型」。智谱和 MiniMax 这组数据太干净了——营收翻倍的同时销售费用下降,因为收入从「一次性交付确认」变成了「按 Token 自助充值」。这看起来是好事,但它同时意味着增长的确定性提高了、可替代性也提高了。当模型套餐能上天猫按 118 元/月卖,获客成本趋近电商水平时,护城河就从「客户关系」变成了「单位算力的成本优势」。我的判断是:未来半年,决定大模型公司生死的不是 benchmark 分数,而是每百万 Token 的毛利——DeepSeek 那条「能力提升可以成为降价理由」的路径会成为行业默认操作。
最后说句真心话:今天最打动我的不是那通电话,而是那 7 个博士生公开的所有训练日志。他们承认「loss 还在降的时候模型退步了」,最后追到数据分片和 shuffle 的底层问题——这种诚实比任何官方技术报告都珍贵。如果说 2026 年上半年大家在证明「AI 能做什么」,那今天这一批新闻说明下半年开始,行业要回答的是「我们凭什么相信自己做到了」。答案不在发布会的 PPT 里,在那些愿意把中间 checkpoint 一起开源的人手里。