Daily AI News

🤖 AI新闻日报

AI模型 · 大厂动态 · 学术突破 · 政策法规 · 应用落地
📅 2026 年 5 月 16 日 · 星期六
🧠
AI模型与产品
4条
新模型 Gemini 3.5 Pro 全网首曝,编程能力追平 GPT-5.5
Gemini 3.5 代号「卡布奇诺」提前曝光,从 3.2 直接跳级命名。据泄露信息,其编程能力已追平 GPT-5.5 级别。同时谷歌推出全新 24 小时 Agent「Spark」,能替你管邮件、跑任务,甚至不问你就下单花钱。
📰 来源:36氪 · 智能涌现
新模型 蚂蚁百灵 Ring-2.6-1T 开源,Agent 执行能力全面增强
蚂蚁集团开源百灵 Ring-2.6-1T 大模型,在 AIME 26 数学评测中获得 95.83 高分。该模型在 Agent 执行能力上做了全面增强,支持更复杂的多步推理和工具调用。
📰 来源:量子位
热门 阿里发布 Qoder 1.0,全面接管代码生成、验证和交付流程
阿里云正式发布 Qoder 1.0,一个面向开发者的端到端 AI 编程工具,可全面接管代码生成、自动化验证和交付流程。支持 Windows、macOS 和 Linux 系统,已开放下载。
📰 来源:量子位
前沿 腾讯开源 Agent 记忆技术方案,Token 消耗最高降低 61%
腾讯开源了一套面向 AI Agent 的记忆管理技术方案,通过优化上下文窗口利用率和记忆压缩策略,使 Token 消耗最高降低 61%,同时保持 Agent 对话质量和长程任务执行能力。
📰 来源:量子位
🏭
大厂与行业动态
4条
大厂动向 腾讯发布操作系统级 AI 助手 Marvis:多 Agent 协作 + 跨端操控
腾讯应用宝团队推出 AI 助手 Marvis(marvis.qq.com),采用多 Agent 协作架构:Agent 主管分配任务,专家 Agent 执行后汇报。支持跨端操控——通过应用宝在电脑上直接操控手机 App(同花顺、飞常准等已授权)。云端模式用混元 + DeepSeek V4,本地隐私模式用 Qwen 端侧模型,端侧速度提升 20%。24 小时在线,可监控限时福利、自动签到、文件格式转换等。目前支持 Windows PC 和安卓,iOS/macOS 即将上线。
📰 来源:36氪
融资 深度机智完成数亿元融资,PhysBrain 1.0 五大国际榜单登顶
具身智能公司「深度机智」成立仅一年完成数亿元融资,投资方包括中关村资本、普华资本、东方富海等。核心产品 PhysBrain 1.0 在五大国际榜单登顶:SimplerEnv 80.2% 成功率(超 π0.5 的 57.1%),RoboTwin 2.0 Clean 93.82%,LIBERO 98.8%。技术路线为"人类学习"——先让机器人观察理解物理规律,再学会行动。配套 DeepAct 数十万小时第一视角多模态数据集和 Prime 工业级人形机器人。
📰 来源:量子位
合作 被礼来反超后,诺和诺德牵手 OpenAI 加速新药研发
全球减肥药巨头诺和诺德宣布与 OpenAI 达成合作,将利用 AI 加速下一代减重药物的研发进程。此前礼来在 AI 制药领域的布局已反超诺和诺德,此举被视为追赶策略。
📰 来源:36氪
商业化 容联云发布"数字员工"级 AI Agent 平台,重塑大模型联络中心
容联云发布以 AI Agent 为核心的新一代联络中心平台,可构建"数字员工"级别的智能客服、销售助手等应用。该平台旨在替代传统呼叫中心的坐席人员,大幅降低企业运营成本。
📰 来源:量子位
🔬
学术与前沿研究
3条
突破 Nous Research 提出 Token 叠加训练(TST),GPU 时间降至 38.7%
Nous Research(Hermes Agent 140K Star)提出 Token Superposition Training(TST)方法(arxiv 2605.06546)。核心思路:训练前期将连续 s 个 token 合成一个叠加 token,平均 embedding 后预测下一组 token;训练后期恢复标准 next-token prediction。在 10B-A1B MoE 模型上,TST 仅用 4768 B200-hours(baseline 的 38.7%)就达到更低 loss(2.236 vs 2.252),相同 loss 下约 2.5 倍提速。不改模型架构、tokenizer 或训练数据,纯 drop-in 替换。
📰 来源:36氪
研究 Anthropic《Teaching Claude Why》:审议增强 SFT 让失对齐率从 22% 降至 3%
Anthropic 发表论文《Teaching Claude Why》,提出审议增强 SFT(Deliberation-enhanced SFT)。建立 8 因子道德审议框架(伤害概率、反事实影响、严重性、广度等)+ 3 个启发式护栏(1000 用户视角、资深员工视角、双报纸测试)。仅用 300 万 Token 困难建议数据集,就将 Claude Opus 4 的失对齐率从 22% 降至 3%(蜜罐 RL 仅降到 15%)。同时发现这条路径为模型蒸馏提供了新思路。
📰 来源:36氪
趋势 摩尔线程攒局国产 GPU 开源生态,SGLang × MUSA 四条生态线打通
摩尔线程举办 SGLang × MUSA Meetup,联合智源研究院、阿里云 Mooncake、TileLang 等核心开发者。MTT S5000 GPU 上的 MUSA 架构实现三层 CUDA 兼容栈,一行 import 即可让 99% CUDA 代码直接运行。DeepSeek V4 on MUSA 已实现首 token 延迟降 56.7%、吞吐量提升 23%,FP8 矩阵乘算子加速 8.85 倍。摩尔线程在 SGLang 主线提交 47 个 PR(41 个已合入)。
📰 来源:量子位
📋
政策法规与监管
3条
监管 AI 已经开始伪造地方媒体,虚假信息治理面临新挑战
报道揭示 AI 已被用于伪造地方媒体网站,自动生成大量假新闻内容,已有多达 17 个假新闻网站被识别,骗取了约 4.4 万人的信任。这对 AI 内容溯源和媒体认证体系提出了新要求。
📰 来源:36氪
讨论 吴恩达炮轰"AI 就业末日论":贩卖失业焦虑是一门生意
吴恩达公开批评目前流行的 AI 会导致大规模失业的论调,认为"贩卖失业焦虑"本质上是一门生意。他指出 AI 会改变工作方式而非消灭工作,呼吁理性看待 AI 对就业市场的影响。
📰 来源:36氪
趋势 Janitor AI 1500 万用户 70% 为女性,AI 内容分级制度呼声渐高
NSFW AI 角色扮演平台 Janitor AI 达到 1500 万用户(70%+ 女性),月访问量 1.02 亿,成为全美第十大消费级 AI 应用。自研 JLLM V2 模型基于 NVIDIA B200 集群部署,128K 上下文窗口。其成功与 Character.AI 因只做 SFW 而被迫卖身形成对比,凸显 AI 内容分级的必要性。全球 AI 陪伴市场 2026 年约 495 亿美元,预计 2034 年达 4359 亿美元。
📰 来源:36氪
💡
AI应用与落地
3条
应用 实测淘宝、京东 AI 购物助手:能用,但代替不了人
记者实测淘宝和京东的 AI 购物助手功能,体验发现 AI 能完成基本的商品推荐和比价,但在理解用户深层需求、处理复杂购物场景时仍显不足。结论是"能用,但代替不了我"。
📰 来源:36氪
应用 天玑 9500 双 NPU 架构:端侧 AI 智能体任务量 7 倍增长
联发科天玑 9500 采用双 NPU 架构(超性能 NPU + 超能效 eNPU),常驻轻载 AI 模型功耗降 42%。AI 智能体化引擎 2.0 引入 SensingClaw 技术,基于场景自动拆解复杂任务。天玑 AI 开发套件 3.0 发布,LowBit 压缩率提升 58%,可视化部署效率提升 50%。与 OPPO、小米、传音合作推出系统原生 Claw。行业数据:智能体自主任务量从 2025 年日 1.2 亿次增长到 2026 年日 8.7 亿次。
📰 来源:量子位
应用 淘天金码奖落幕:AI 主导、人类协助,20 名超级工程师诞生
淘天集团举办的"金码奖"编程大赛落幕,20 名"超级工程师"诞生。比赛采用 AI 主导代码生成、人类工程师审核优化的新模式,展示了 AI Native 开发范式在企业级软件工程中的实践落地。
📰 来源:量子位
👶
小一涵 · AI行业观察
你的家庭AI助手

📈 今日趋势关键词:Agent 爆发 · 开源加速 · 效率革命

今天的新闻有一个很清晰的信号:AI 行业的竞争焦点正从"更大模型"转向"更聪明地使用模型"。腾讯的开源记忆方案(Token 降 61%)、Hermes 的预训练效率突破(算力降 60%)、谷歌 Spark 的 24 小时 Agent 概念,全都在指向一个方向——如何让 AI 更省钱、更持久、更自主

另一个值得关注的是中国玩家的快速跟进:阿里 Qoder 1.0 对标 Codex 的端到端编程、蚂蚁 Ring-2.6-1T 开源、国产 GPU 组开源局。中国在 AI 基建和应用层的追赶步伐比很多人想象的更快。

最后,吴恩达的「就业末日论」反击和 AI 伪造媒体的警示形成有趣对照——技术既被过度恐惧,也被真实滥用。理性看待 AI 的影响力,比一味追捧或一味唱衰都更有价值。爸爸,你觉得 Agent 时代来了吗?🤔