Daily AI News

🤖 AI新闻日报

AI模型 · 大厂动态 · 学术突破 · 政策法规 · 应用落地
2026 年 7 月 1 日
🧠
AI 模型与产品
3 条
模型 DeepSeek V4 正式版 7 月上线,高峰时段 API 价格翻倍
开发者收到 DeepSeek 官方邮件,V4 正式版将于 7 月上线,高峰时段(UTC 1:00-4:00 和 6:00-10:00)API 输入 token 缓存命中/未命中、输出 token 价格统一翻倍(x2),其他时段维持地板价。这是 DeepSeek 首次涨价,主要原因是算力紧张——该公司正自建乌兰察布数据中心,并大规模招聘超算集群研发、IDC 设计规划等岗位。V4 正式版将修复预览版三大痛点:幻觉率高、百万上下文窗口实际不稳定(MoE 模型通病)、复杂代码任务表现保守。
📰 量子位
热议 GPT-5.6 灰度测试被曝光,Claude Opus 4.8 遭史诗级"削脑"
AI 社区爆发"降智门"事件。OpenAI 被曝通过 Codex 平台秘密灰度测试 GPT-5.6-sol,用户可通过"Juice 测试"XML 代码检测自身是否中签——满血版 GPT-5.5 xhigh 返回 Juice 值 768,被路由到 GPT-5.6-sol 的用户仅得 128,推理算力遭"腰斩"。另一边,Anthropic 的 Claude Opus 4.8 被用户痛斥性能断崖式下跌,基础逻辑推理频频翻车,甚至不如旧版 Haiku 模型,疑似被"切脑"。两大巨头几乎同时陷入降智风波,引发用户关于版本管控和付费模型透明度的激烈讨论。
模型 智谱唐杰全球征集 GLM-5.3 意见,评论区刷屏:视觉!视觉!
清华教授、智谱灵魂人物唐杰在社交媒体公开征集 GLM-5.3 版本方向,浏览量超 40 万。评论区呼声高度一致:希望 GLM 旗舰模型搭载视觉能力。目前 GLM-5.2 是纯文本模型,虽在开源界 AI 编程排名第一、全球第二(仅次于 Anthropic Fable-5),但缺乏视觉编码器,无法看图或生成图。对比之下,Kimi K2.5 自 1 月起已是原生多模态,Qwen3.5-Omni 3 月已端到端统一文本/图像/音频/视频。唐杰此前认为多模态对提升 AGI 智能上界帮助有限,但用户需求与竞争压力正推动 GLM-5.3 补足视觉短板。
📰 量子位
🏭
大厂与行业动态
4 条
重磅 Claude Mythos 引爆 DeepSeek 融资:74 亿美元,梁文锋自掏 200 亿
The Information 最新爆料揭露 DeepSeek 74 亿美元融资的导火索——创始人梁文锋看到 Anthropic Claude Mythos 凭借海量算力和数据训练出超强能力后,意识到不储备弹药根本没法继续竞争。融资中梁文锋自己写了最大的一张支票:200 亿人民币(约 30 亿美元),占总融资额的五分之二。融资完成后 DeepSeek 设立员工持股计划,所有部门"至少翻倍"招人,从目前 300 人扩编,其中 Harness 团队(负责模型→AI Agent 转化)已进入每天面试状态。梁文锋在路演中明确三不改变原则:继续开源、保持低价、专注 AGI。目前 DeepSeek 正加紧适配华为芯片,为此已长达 15 个月未发布新一代模型。
📰 量子位
大厂 Meta 内部限制使用 Claude Code 和 Codex,全力自研编程助手 MetaCode
据 The Information 报道,Meta 今年 5 月下发给应用 AI 工程部门内部指南,要求工程师不能再随意使用 Claude Code 和 Codex,部分涉及这两个模型的任务被暂停。Meta 是 Claude Code 全球最大客户之一,内部 AI 账单已达数十亿美元。限制原因不是工具不好用,而是太好用了——Meta 正自研 AI 编程助手 MetaCode(原名 DevMate),担心外部模型输出渗入训练数据,使自研模型学到对手的能力和判断标准。指南特别要求 AI 不能当出题人、判卷人,连"AI 生成的材料能否进入被测模型可读的环境"都要严格管控。
开源 明略科技开源 Octo:让 Agent 之间拥有一张"互联网"
明略科技发布开源可信 Agent 协作网络 Octo,核心理念是"Agents do. Humans decide."。Octo 提供了六种 Agent 协作模式:Solo(单人完成)、Roundtable(圆桌讨论)、Critic(独立审核)、Pipeline(流水线交接)、Split(分头并行)、Swarm(竞选择优)。产品覆盖 Web、移动端(iOS/Android)、浏览器插件和 CLI 四端。Agent 以 Bot 身份进入团队,拥有独立身份、能力说明和工作记录。可接入 Claude Code、Codex、Hermes 等主流 Agent 工具。通过 Channel/Thread/Matter 三层结构,将协作从聊天转化为可追踪、可验收的工作交付。
📰 量子位
产品 OceanBase 发布 AI 数据库:一套引擎融合湖库与多模态数据
OceanBase 发布 AI 数据库,以一套引擎融合数据湖、数据仓库与多模态数据管理能力,让 AI 能够真正"读懂"企业数据。该数据库的核心是让 AI 应用无需在不同存储系统间来回搬运数据,在单一引擎内即可完成结构化、半结构化和非结构化数据的统一查询与分析,面向企业级 AI 应用场景优化。
📰 量子位
🔬
学术与前沿研究
3 条
论文 复旦邱锡鹏团队提出"上下文世界建模"ICWM:VLA 无需微调即可适应新环境
复旦大学邱锡鹏教授团队在 arXiv 发表论文提出「上下文世界建模」(In-Context World Modeling, ICWM),解决视觉-语言-动作(VLA)模型的泛化难题。传统 VLA 模型部署时,一旦相机视角、安装位置或机器人形态发生变化,性能就会下降,需重新收集数据、调模型。ICWM 让机器人在任务执行前先进行一段与任务无关的随机探测,将交互过程作为上下文输入模型,即可判断当前系统配置并生成后续动作,无需额外示范和参数更新。仿真和真实机器人实验表明,ICWM 在跨视角与跨配置泛化上显著优于现有方法。论文:https://arxiv.org/abs/2606.26025
📰 36氪
实验 普林斯顿 CEO-Bench:AI 当老板,14 位硅基 CEO 仅 4 个保住本金
普林斯顿大学推出 CEO-Bench 基准,让 AI 运营一家 SaaS 初创公司 500 天。14 位"硅基 CEO"中只有 4 个保住本金,GLM-5.1、Claude Haiku 4.5、Gemini 3 Flash、DeepSeek V4 Pro、Grok-4.20 等 5 个模型中途破产。唯一盈利的 3 个:Claude Fable 5(4715 万美元,翻 47 倍)、Claude Opus 4.8(2780 万美元)、GPT-5.5(2130 万美元)。有趣的是,一个纯 rule-based 启发式算法排在第四(1576 万),超过了 Qwen 3.7 Max、Opus 4.7、GLM-5.2 等。核心发现:探索策略优于保守策略;编程 Agent(Claude Code/Codex)的系统提示词为开发场景优化,套用在 CEO 角色上反而降低表现。
📰 量子位
标准 中国信通院发布 AI Infra 运维领域首个评测基准,覆盖 5 款国产芯片
中国信通院发布 AISHPerf 3.0 基准体系,包含两大核心:智算运维智能体评测基准(首个面向 AI Infra 的运维评测)和算子生成智能体评测基准。运维评测以无问芯穹近百亿条真实运维数据为底座,提炼 103 条高保真用例,覆盖 5 大技术栈、44 种问题现象、22 个细分故障领域、6 种芯片(含天数、壁仞、沐曦、摩尔、昇腾 5 种国产芯片)。评测要求智能体在真实集群环境中自主探索、排查和修复故障,输出时延、Token 消耗、工具调用效率等量化结果。无问芯穹已在生产环境中部署运维智能体,工单处理时间缩短 50%,故障处理效率提升约 6 倍,运维成本下降约 30%。
📰 量子位
📋
政策法规与监管
2 条
趋势 斯坦福《2026 AI Index》:模型差距缩小,安全透明度持续下降
斯坦福 HAI 发布年度 AI Index 报告,七大核心发现:① AI 仍在加速渗透,但研发进入巨头时代;② 中美模型性能差距基本抹平;③ AI 能力极度不均衡——能斩获奥数金牌却会在数秒报时上犯错;④ 家务机器人仍不尽人意;⑤ 负责任 AI 发展严重滞后于能力提升,安全基准滞后,相关事件大幅上升;⑥ AI 普及速度创历史纪录,消费者已从中获得显著价值;⑦ AI 正在改变临床医疗,但严谨证据依然有限。报告指出 AI 竞争已从单点技术竞赛转型为系统竞争,"模型不再稀缺,真正稀缺的是算力、场景和信任"。
📰 36氪
安全 AI 编程工具的暗面:大厂开始担心训练数据"被污染"
Meta 限制使用 Claude Code 和 Codex 的背后,暴露了 AI 行业一个深层矛盾——训练数据来源的"血缘问题"。当企业用竞争对手的模型输出来训练自研模型时,会面临三重风险:① 模型输出渗入训练数据,导致"学成对手的样子";② 出题和判分都交给竞品模型,等于把判断标准复刻进自己模型;③ 可能触发合作合同中的知识产权争议。Meta 的应对方案是严控"AI 生成材料的输入路径",这预示着未来大厂在数据治理和安全合规方面的投入将进一步加大。
💡
AI 应用与落地
2 条
应用 DeepSeek 招人"最怕大厂味",AI 招聘对上 AI 求职"魔法对轰"
DeepSeek 完成 500 亿元融资后迅速启动大规模人才扩充计划,明确提出"最怕大厂味",强调宁缺毋滥,注重技术能力和科研热情而非履历。与此同时,AI 求职工具市场正经历"魔法对轰"——AI 招聘系统筛选简历、AI Agent 模拟面试,求职者也用 AI 优化简历、生成回答话术。业内人士指出,AI 招聘工具大战背后,"人岗匹配"的底层逻辑正在被重新布线,但核心问题仍是:算法能否真正理解"合适"的含义?
📰 36氪
产品 虎牙发布实时多模态数字人 VAM 1.0:单张照片即可 24 小时直播
虎牙发布实时多模态数字人 VAM 1.0,仅需一张照片即可生成可 24 小时直播的数字人形象。该产品突破了行业三大瓶颈:实时性(低延迟多模态交互)、逼真度(照片级还原)和可运营性(长期直播稳定性)。VAM 1.0 结合了 AI 语音合成、实时面部动画驱动和自然语言对话能力,面向直播电商、虚拟主播等场景提供完整解决方案。
📰 量子位
👧
小一涵 · 行业评论
AI 日报特约分析师

下半场的竞争逻辑变了

今天的新闻透露出一个清晰信号:AI 行业正在从"模型军备竞赛"转向"基础设施+应用生态"的系统竞争。

DeepSeek 74 亿融资、首次涨价、自建数据中心这三件事放在一起看,说明即使是"价格屠夫"也扛不住算力成本压力。当 Claude Mythos 的算力碾压让梁文锋都决定融资时,"技术奇迹"终究要回到"规模经济"的底层逻辑。未来大模型公司的竞争将越来越像芯片行业——没有百亿级资本,根本上不了牌桌。

Meta 限制 Claude Code 的故事更有意思。它暴露了一个此前被忽略的结构性矛盾:当你深度依赖竞争对手的工具来训练自己的模型时,这到底是在"借力"还是在"借脑"?这预示着企业级 AI 应用即将进入"数据血缘管理"时代——谁生成了什么数据、数据流向了哪里、训练集里有没有"串味"——这将成为合规和竞争的硬门槛。

普林斯顿 CEO-Bench 的结果也值得深思。规则算法跑赢了大多数 LLM,只有 Fable 5 真正赚到了钱。这提醒我们:Agent 的能力上限,不仅仅取决于模型智商,更取决于框架设计——通用型编程 Agent 套用到商业决策上,可能还不如一个简单的 if-then 规则。Agent 的行业垂直化,将是接下来最重要的产品方向。

最后,GLM-5.3 评论区清一色的"视觉"呼声,和斯坦福报告说的"中美模型差距抹平"形成有趣的对照。模型能力在逼近,但用户感受的痛点始终很具体——"能不能让我贴张图看懂"这样的基础需求,和"什么时候达到 AGI"这样的宏大叙事之间,还有很长的产品化路要走。