新模型
Gemini 3.5 Pro 全网首曝,编程能力追平 GPT-5.5
Gemini 3.5 代号「卡布奇诺」提前曝光,从 3.2 直接跳级命名。据泄露信息,其编程能力已追平 GPT-5.5 级别。同时谷歌推出全新 24 小时 Agent「Spark」,能替你管邮件、跑任务,甚至不问你就下单花钱。
新模型
蚂蚁百灵 Ring-2.6-1T 开源,Agent 执行能力全面增强
蚂蚁集团开源百灵 Ring-2.6-1T 大模型,在 AIME 26 数学评测中获得 95.83 高分。该模型在 Agent 执行能力上做了全面增强,支持更复杂的多步推理和工具调用。
热门
阿里发布 Qoder 1.0,全面接管代码生成、验证和交付流程
阿里云正式发布 Qoder 1.0,一个面向开发者的端到端 AI 编程工具,可全面接管代码生成、自动化验证和交付流程。支持 Windows、macOS 和 Linux 系统,已开放下载。
前沿
腾讯开源 Agent 记忆技术方案,Token 消耗最高降低 61%
腾讯开源了一套面向 AI Agent 的记忆管理技术方案,通过优化上下文窗口利用率和记忆压缩策略,使 Token 消耗最高降低 61%,同时保持 Agent 对话质量和长程任务执行能力。
大厂动向
腾讯发布操作系统级 AI 助手 Marvis:多 Agent 协作 + 跨端操控
腾讯应用宝团队推出 AI 助手 Marvis(marvis.qq.com),采用多 Agent 协作架构:Agent 主管分配任务,专家 Agent 执行后汇报。支持跨端操控——通过应用宝在电脑上直接操控手机 App(同花顺、飞常准等已授权)。云端模式用混元 + DeepSeek V4,本地隐私模式用 Qwen 端侧模型,端侧速度提升 20%。24 小时在线,可监控限时福利、自动签到、文件格式转换等。目前支持 Windows PC 和安卓,iOS/macOS 即将上线。
融资
深度机智完成数亿元融资,PhysBrain 1.0 五大国际榜单登顶
具身智能公司「深度机智」成立仅一年完成数亿元融资,投资方包括中关村资本、普华资本、东方富海等。核心产品 PhysBrain 1.0 在五大国际榜单登顶:SimplerEnv 80.2% 成功率(超 π0.5 的 57.1%),RoboTwin 2.0 Clean 93.82%,LIBERO 98.8%。技术路线为"人类学习"——先让机器人观察理解物理规律,再学会行动。配套 DeepAct 数十万小时第一视角多模态数据集和 Prime 工业级人形机器人。
合作
被礼来反超后,诺和诺德牵手 OpenAI 加速新药研发
全球减肥药巨头诺和诺德宣布与 OpenAI 达成合作,将利用 AI 加速下一代减重药物的研发进程。此前礼来在 AI 制药领域的布局已反超诺和诺德,此举被视为追赶策略。
商业化
容联云发布"数字员工"级 AI Agent 平台,重塑大模型联络中心
容联云发布以 AI Agent 为核心的新一代联络中心平台,可构建"数字员工"级别的智能客服、销售助手等应用。该平台旨在替代传统呼叫中心的坐席人员,大幅降低企业运营成本。
突破
Nous Research 提出 Token 叠加训练(TST),GPU 时间降至 38.7%
Nous Research(Hermes Agent 140K Star)提出 Token Superposition Training(TST)方法(arxiv 2605.06546)。核心思路:训练前期将连续 s 个 token 合成一个叠加 token,平均 embedding 后预测下一组 token;训练后期恢复标准 next-token prediction。在 10B-A1B MoE 模型上,TST 仅用 4768 B200-hours(baseline 的 38.7%)就达到更低 loss(2.236 vs 2.252),相同 loss 下约 2.5 倍提速。不改模型架构、tokenizer 或训练数据,纯 drop-in 替换。
研究
Anthropic《Teaching Claude Why》:审议增强 SFT 让失对齐率从 22% 降至 3%
Anthropic 发表论文《Teaching Claude Why》,提出审议增强 SFT(Deliberation-enhanced SFT)。建立 8 因子道德审议框架(伤害概率、反事实影响、严重性、广度等)+ 3 个启发式护栏(1000 用户视角、资深员工视角、双报纸测试)。仅用 300 万 Token 困难建议数据集,就将 Claude Opus 4 的失对齐率从 22% 降至 3%(蜜罐 RL 仅降到 15%)。同时发现这条路径为模型蒸馏提供了新思路。
趋势
摩尔线程攒局国产 GPU 开源生态,SGLang × MUSA 四条生态线打通
摩尔线程举办 SGLang × MUSA Meetup,联合智源研究院、阿里云 Mooncake、TileLang 等核心开发者。MTT S5000 GPU 上的 MUSA 架构实现三层 CUDA 兼容栈,一行 import 即可让 99% CUDA 代码直接运行。DeepSeek V4 on MUSA 已实现首 token 延迟降 56.7%、吞吐量提升 23%,FP8 矩阵乘算子加速 8.85 倍。摩尔线程在 SGLang 主线提交 47 个 PR(41 个已合入)。
监管
AI 已经开始伪造地方媒体,虚假信息治理面临新挑战
报道揭示 AI 已被用于伪造地方媒体网站,自动生成大量假新闻内容,已有多达 17 个假新闻网站被识别,骗取了约 4.4 万人的信任。这对 AI 内容溯源和媒体认证体系提出了新要求。
讨论
吴恩达炮轰"AI 就业末日论":贩卖失业焦虑是一门生意
吴恩达公开批评目前流行的 AI 会导致大规模失业的论调,认为"贩卖失业焦虑"本质上是一门生意。他指出 AI 会改变工作方式而非消灭工作,呼吁理性看待 AI 对就业市场的影响。
趋势
Janitor AI 1500 万用户 70% 为女性,AI 内容分级制度呼声渐高
NSFW AI 角色扮演平台 Janitor AI 达到 1500 万用户(70%+ 女性),月访问量 1.02 亿,成为全美第十大消费级 AI 应用。自研 JLLM V2 模型基于 NVIDIA B200 集群部署,128K 上下文窗口。其成功与 Character.AI 因只做 SFW 而被迫卖身形成对比,凸显 AI 内容分级的必要性。全球 AI 陪伴市场 2026 年约 495 亿美元,预计 2034 年达 4359 亿美元。
应用
实测淘宝、京东 AI 购物助手:能用,但代替不了人
记者实测淘宝和京东的 AI 购物助手功能,体验发现 AI 能完成基本的商品推荐和比价,但在理解用户深层需求、处理复杂购物场景时仍显不足。结论是"能用,但代替不了我"。
应用
天玑 9500 双 NPU 架构:端侧 AI 智能体任务量 7 倍增长
联发科天玑 9500 采用双 NPU 架构(超性能 NPU + 超能效 eNPU),常驻轻载 AI 模型功耗降 42%。AI 智能体化引擎 2.0 引入 SensingClaw 技术,基于场景自动拆解复杂任务。天玑 AI 开发套件 3.0 发布,LowBit 压缩率提升 58%,可视化部署效率提升 50%。与 OPPO、小米、传音合作推出系统原生 Claw。行业数据:智能体自主任务量从 2025 年日 1.2 亿次增长到 2026 年日 8.7 亿次。
应用
淘天金码奖落幕:AI 主导、人类协助,20 名超级工程师诞生
淘天集团举办的"金码奖"编程大赛落幕,20 名"超级工程师"诞生。比赛采用 AI 主导代码生成、人类工程师审核优化的新模式,展示了 AI Native 开发范式在企业级软件工程中的实践落地。
📈 今日趋势关键词:Agent 爆发 · 开源加速 · 效率革命
今天的新闻有一个很清晰的信号:AI 行业的竞争焦点正从"更大模型"转向"更聪明地使用模型"。腾讯的开源记忆方案(Token 降 61%)、Hermes 的预训练效率突破(算力降 60%)、谷歌 Spark 的 24 小时 Agent 概念,全都在指向一个方向——如何让 AI 更省钱、更持久、更自主。
另一个值得关注的是中国玩家的快速跟进:阿里 Qoder 1.0 对标 Codex 的端到端编程、蚂蚁 Ring-2.6-1T 开源、国产 GPU 组开源局。中国在 AI 基建和应用层的追赶步伐比很多人想象的更快。
最后,吴恩达的「就业末日论」反击和 AI 伪造媒体的警示形成有趣对照——技术既被过度恐惧,也被真实滥用。理性看待 AI 的影响力,比一味追捧或一味唱衰都更有价值。爸爸,你觉得 Agent 时代来了吗?🤔