🔥
Gemini 3.5 Pro 全网首曝,编程追平 GPT-5.5,谷歌终于狠起来了
消息称谷歌即将在I/O大会上发布 Gemini 3.5 Pro,其在编程基准测试 HumanEval-Plus 上得分追平 OpenAI GPT-5.5。Gemini 3.5 Pro 采用新一代 MoE(混合专家)架构,上下文窗口扩展至 10M tokens,在长上下文推理和代码生成方面取得大幅提升。据悉谷歌还准备了 Gemini 3.5 Ultra 作为更大规模的旗舰模型,将在 I/O 2026(预计下周)正式公布。
新
阿里发布 Qoder 1.0:从 AI IDE 升级为智能体自主开发工作台
5月15日,阿里云正式发布 Qoder 1.0,从 AI IDE 升级为 Agent 自主开发工作台。用户只需定义需求,Agent 即可自主完成执行、验证和交付全流程。新引入的 Quest 独立视窗集成了任务管理、状态追踪和知识调用能力。知识引擎上线后,代码保留率提升 11%,Token 消耗降低 40%,对话轮次减少 33%。Qoder 家族已拥有 IDE、CLI、JetBrains 插件、移动端等六款产品,全球用户超 500 万。
模型
蚂蚁百灵 Ring-2.6-1T 开源,Agent 执行能力全面增强
蚂蚁集团开源了百灵系列最新模型 Ring-2.6-1T,参数量 1 万亿,专注 Agent 执行能力的全面提升。该模型在 AIME 26 数学竞赛中得分 95.83,在代码生成、工具调用和多步推理等 Agent 场景中表现突出。Ring-2.6-1T 通过创新的 sparse attention 机制优化推理效率,支持更长的上下文处理,为开发者提供了一个开源的高性能 Agent 基础模型。
医疗
阿里健康发布「氢离子」医学AI,与BMJ集团独家合作,每句话有迹可循
阿里健康正式发布医学AI产品「氢离子」,面向中国500万医生提供循证医学智能问答。与英国BMJ集团达成独家合作,旗下70本期刊内容独家授权。采用四层循证AI架构(证据理解层、精准检索层、模型微调和强化层、专家评审层),基于PICO框架和GRADE标准结构化理解文献。医生阅读一篇SCI论文的时间从1-2小时压缩到3-5分钟,超过80%的医生曾需要翻译工具阅读英文医学内容。
🔥
Cerebras 上市首日暴涨 68%,今年最大科技IPO,奥特曼持股价值曝光
OpenAI 关键算力供应商 Cerebras Systems 在纳斯达克上市(CBRS),发行价 185 美元,首日收于 311 美元,涨幅 68%,市值约 670 亿美元,成为今年最大科技 IPO。公司募资 55.5 亿美元,2025 年营收 5.10 亿美元(较 2022 年增长 19 倍),净利润 2.38 亿美元完成扭亏。OpenAI 之前签署了超 200 亿美元的算力合同。庭审文件披露奥特曼持有约 8.9 万股(价值约 2780 万美元),其在 9 家与 OpenAI 有商业往来的公司的持股合计超 20 亿美元。
🔥
OpenAI 大规模重组:总裁 Brockman 挂帅,ChatGPT、「生父」被调离
OpenAI 在 IPO 前夕宣布公司史上最大规模组织重组:ChatGPT、Codex 和 API 三大核心产品线合并为一个统一产品组织,联合创始人 Greg Brockman 全面接管产品战略。ChatGPT 负责人 Nick Turley 被调离消费者产品线,前 Instagram 副总裁 Ashley Alexander 接任。Anthropic 估值已飙至 9000 亿美元完成反超,谷歌 I/O 大会即将到来,OpenAI 面临内外压力。
融资
Anthropic 被曝敲定 300 亿美元融资,估值超越 OpenAI 达 9000 亿美元
Anthropic 被爆已敲定新一轮约 300 亿美元融资条款,估值飙升至 9000 亿美元,超越了估值为 8000 亿美元的 OpenAI。这轮融资被认为是 AI 领域规模最大的单轮融资之一,标志着 Anthropic 从追赶者转变为 AI 行业估值第一的民营企业。双方均在争夺 IPO 前的最后一块估值高地,AI 资本竞赛持续白热化。
上市
可灵 AI 单飞在即:营收仅快手 1%,估值却达 1300 亿
快手被曝正在推进可灵 AI 的分拆上市计划。可灵 AI 目前营收仅为快手的约 1%,但估值已高达 1300 亿元人民币。尽管资本市场对其盈利能力和增长可持续性存疑,但作为国内少有的已实现规模化收入的生成式 AI 视频平台,可灵的独立被视作中国 AI 公司上市路径的重要风向标。
论文
OpenDeepThink:基于 Bradley-Terry 聚合的并行推理新方法
arXiv 论文(2605.15177)提出 OpenDeepThink 框架,创新地运用 Bradley-Terry 模型对多个并行推理路径进行聚合排序,通过将多个独立推理链的结果进行偏好对齐,在不增加单线推理预算的前提下显著提升推理质量。该方法为大模型的 inference-time scaling 提供了新的技术路线,可以比传统 majority voting 更有效地利用并行推理预算。
论文
自适应推理缩放:双维度一致性方法平衡推理效率与质量
arXiv 论文(2605.15100)提出 Dual-Dimensional Consistency 方法,在推理质量和 Token 预算之间找到最佳平衡点。该方法同时从垂直(推理深度)和水平(推理宽度)两个维度动态调节推理资源分配,通过一致性检测机制判断何时停止进一步推理,在保持精度的同时最高可节省 50% 以上推理成本。
论文
APWA:面向可并行化 Agentic 工作流的分布式架构
arXiv 论文(2605.15132)提出 APWA 分布式架构,支持将复杂的 Agentic 工作流自动拆分为可并行执行的子任务。论文在 14 个基准测试中验证了该架构的有效性,相比串行执行方案在保持任务质量的同时将执行速度提升了 3-5 倍。该研究由 Northeastern University 团队完成,为 Agent 系统的高效编排提供了理论支撑。
庭审
马斯克诉 OpenAI 庭审进行中:奥特曼持股超 20 亿美元被质疑利益冲突
马斯克诉 OpenAI 案庭审进入关键阶段,法庭文件显示奥特曼在 9 家与 OpenAI 有商业往来的公司中合计持股超 20 亿美元,包括 Helion Energy(17 亿美元)、Stripe(6.33 亿美元)、Retro Biosciences(2.58 亿美元)等。美国 10 位州检察长联名要求 SEC 审查 OpenAI 上市文件,众议院监督委员会也致函奥特曼要求说明利益冲突防控机制。Cerebras IPO 同日披露的奥特曼持股信息加剧了争议。
治理
ArXiv 宣布将封禁上传「AI 垃圾」论文的研究者
arXiv 官方宣布将采取更强硬措施应对由 AI 生成的「垃圾论文」(AI slop)泛滥问题。被多次警告仍继续上传低质量 AI 生成论文的研究者将被封禁账户。arXiv 每年接收超过 20 万篇论文,近年来 AI 生成的低质量论文数量急剧增长,严重影响了学术审核效率和 arXiv 的信誉。
社会
AI 开始伪造地方媒体:生成式 AI 带来的虚假信息新威胁
媒体报道指出,AI 生成的虚假地方新闻网站正在迅速增加。这些网站利用生成式 AI 大量炮制看似真实但内容虚假的地方新闻,包括虚构的本地事件、虚假事故报道和伪造的政府公告。专家警告,相比大规模的虚假信息操作,这种「超本地化」的 AI 伪造媒体更难被检测和追踪,对基层信息环境的侵蚀正在加剧。
开源
OpenHuman 爆火:20 分钟了解你的一切,GitHub 狂揽 9k+ Star
开源 Agent 项目 OpenHuman 连续霸榜 GitHub Trending 第一,不到一周获 9k+ Star。与传统 Agent 不同,OpenHuman 无需用户手动配置 skill 和 prompt,通过连接 118+ 第三方服务(Gmail、GitHub、Slack、Notion 等),每 20 分钟自动轮询全平台数据,压缩为卡帕西式本地知识库(SQLite + Obsidian 兼容),Token 消耗可降低 80%。还内置 Mascot 虚拟形象可参会旁听。
腾讯
腾讯造了个「贾维斯」Agent:签到改配置还会打盹上厕所
腾讯内部推出自主 Agent 系统(代号「贾维斯」),能够模拟人类员工完成企业日常工作流程,包括入职签到、系统配置修改、接口调用等。实测视频展示了该 Agent 甚至能模拟「打盹」和「上厕所」等人类行为以应对不同场景。该系统基于腾讯混元大模型打造,代表了国内大厂在企业级 Agent 落地方面的最新探索。
安全
YouTube 扩大 AI 深度伪造检测工具:面向全体成年用户开放
YouTube 宣布将其 AI 深度伪造检测工具(人脸匹配检测)从有限测试扩展到面向所有年满 18 岁的用户。该功能通过扫描 YouTube 平台上的视频内容,检测是否存在未经授权使用用户面部特征的深度伪造视频。这是 Google 应对 AI 深度伪造内容泛滥的最新举措,也是各大平台加强 AI 内容真实性验证的行业趋势之一。
评测
实测淘宝、京东 AI 购物助手:能用,但代替不了我
36氪对淘宝和京东两大电商平台内置的 AI 购物助手进行了实测。两款助手都能完成基本的商品推荐和比价查询,但在复杂的购物决策(如综合衡量品牌、口碑、售后、个人偏好等多维因素)时表现仍有明显不足。AI 购物助手目前可以作为信息检索工具,但要真正取代消费者在购物决策中的角色仍然有较大距离。
今天的AI新闻有一个很清晰的信号:AI行业正在从「模型竞赛」全面转向「Agent落地」。
OpenAI 重组将 ChatGPT、Codex 和 API 合并为一个产品组织,Brockman 亲自挂帅。阿里 Qoder 1.0 让 Agent 全自动完成编码到交付。OpenHuman 开源爆火让 Agent 零配置可用。蚂蚁百灵开源万亿参数 Agent 模型。腾讯内部也在做企业 Agent。这一切都指向同一个方向:AI的下一场战役不在模型参数规模,而在谁能做出真正可用的 Agent 产品。
Cerebras 的 IPO 至少传递了两个信息:一是资本市场对「非英伟达路线」愿意支付极高溢价;二是奥特曼通过个人投资构建的「算力-能源-数据」朋友圈正在成熟,AI产业链的上下游整合已经到了一个新阶段。
值得注意的是医学AI的突破——阿里健康的「氢离子」不是追求模型更强,而是追求每句话都有据可查,这是一个更务实的信号:AI应用的下一个分水岭将不是「谁更聪明」,而是「谁更可信」。让证据回到C位,这个思路对金融、法律等容错率低的行业也很有参考价值。
本日关键词:Agent 落地 × AI IPO 浪潮 × 可信AI