🖼️
OpenAI在「AGI时刻」后首发的多模态新品:ChatGPT Images 2.5上线,主打更快更稳的「真·修图」
OpenAI在宣告「AGI时代来了」后随即发布新一代生图模型ChatGPT Images 2.5。相比约4个半月前的GPT Image 2,升级重点落在「画得快、画得真、改得稳」:官方称生成延迟最多降低50%;参考照片中的人物和物体更容易保住原特征;支持多轮连续修改并让先前改好的细节保持一致,还能直接在图上加批注指定要改的位置;并新增@Sketch玩法,可直接上传手绘草图当参考构图。质量上最高分辨率仍为3840px,但新增xhigh、max两档更高画质,进一步强化材质、光照与参考主体的保真度。官方演示显示,给人物换装后其脸部与卷发等细部质感基本得以保持。
⚡
DeepSeek深夜上线带「到期日」的临时模型v4.1-flash:只给市场48小时用真实任务验证
9月8日有用户发现DeepSeek开放平台出现一个临时模型 deepseek-v4.1-flash-expires-on-0910。这是一款面向部分用户开放测试的V4.1 Flash中间版本,调用方式与现有API基本一致、计费暂时按V4 Flash执行、单账号并发数限制20。模型名里的「-expires-on-0910」已点明9月10日是其内测接口失效时间,而非正式发布节点——DeepSeek只给测试者不到48小时去验证这次更新是否值得继续推进。据通知,V4.1 Flash在性能、费用、速度、总用时等多项指标上全面超过V4 Pro;官方价目表现V4-Flash闲时输入未命中约1.5元/百万token、输出4.5元(V4-Pro各为4.5元与13.5元且高峰再翻倍)。外界解读:Flash正从「便宜版」加速向承担主力日常任务的方向渗透。
💼
蚂蚁百灵开源首个金融增强模型Ling-3.0-flash-Fin:让AI从「会回答」走向「能干活」
蚂蚁集团百灵在相关峰会前夕发布并开源首个金融增强开放模型Ling-3.0-flash-Fin。它由Ling-3.0-flash强化而来,保留124B总参、5.1B激活及256K长上下文的配置,再经金融语料持续预训练、领域后训练与工具使用优化,重点切入投资研究,打通信息检索、研究推理、估值建模、研报撰写四条投研链路,并能直接进真实Excel工作簿做估值建模。同步开源的还有金融搜索Agent评测基准FinFIRST(据称由中金投行团队支持、50余位金融专业人士参与设计)。在FinFIRST等多套基准上,该模型综合表现超过了部分更大尺寸的旗舰模型。
🏭
DeepSeek科创板IPO提速:已选定中信证券辅导筹备,市场测算整体市值或达1.5万亿-2.5万亿
9月9日外媒披露,杭州DeepSeek已选定中信证券全面筹备科创板上市相关事宜,有望本年度递交IPO申报材料。据接近该公司资本市场运作人士透露,其当前最新估值约5000亿元人民币;资本市场人士以此为基准测算,上市后整体市值区间或落在1.5万亿至2.5万亿元。商业化持续放量同时伴随投入:2026年前七个月营收4.75亿元(较2025全年增长近十倍量级),同期净亏7.15亿元。融资与资本路径上,今年4月启动、6月交割的首轮融资募资超500亿元、估值约500亿美元;7月中旬又启动新一轮融资并同步IPO筹备,新晋中芯聚源、博裕资本、CPE源峰及合肥国资平台等,腾讯、宁德时代等老股东加码。9月7日其Harness团队还公开扩招150个核心技术岗位(约占现有约300人团队的一半)。
🏭
大厂加速整合团队争夺AI办公入口:字节并入豆包、腾讯WorkBuddy领跑,B端盈利成终局关键
AI办公赛道的巨头混战正从「抢用户」转向「整合入口」。复盘这场较量:字节跳动先后把TRAE、扣子及飞书产研团队整体并入豆包体系,并正式推出「豆包工作」;腾讯WorkBuddy已跑出较高月活成为被广泛引用的领跑样本;阿里则在整合桌面Agent、云端Agent与钉钉能力。分析指这场混战的底层是单位经济账与B端盈利之争:C端靠补贴获量普遍亏损,算力成本又高,谁先跑通面向企业的盈利模型,谁才更可能在这一入口级战役里站稳。(行业观察,以报道口径为准)
🤖
英伟达与京东,为何不约而同把AI的下半场押在「物理AI」?
评论文章认为,当数字侧的文本与大模型竞争趋于同质和头部化,行业共识正把下一个增长维度重新指向物理世界。英伟达与京东两家近期的动作提供了注脚:一个手握Omniverse、机器人基础模型与庞大算力底座,一个坐拥海量履约场景与机器人体系,双方都不约而同押注把「智能」接入仓储、物流、工厂、零售这类真实空间——也就是让AI不仅能「想」,更能「动手改变物理世界」。这种向实体资产的合流,被视为AI与实体经济接口抢占的又一个落点。(媒体观点文章)
🍎
苹果首款折叠屏手机发布:15999元起,官方强调「AI参与设计」
苹果正式发布其首款折叠屏机型,起售价15999元(被外界戏称「形态很苹果」的上下折方案)。官方营销显著突出「AI参与设计」,将AI叙事与该开山之作绑定。作为苹果切入折叠屏品类的标志性硬件,它被视作检验苹果能否把「AI+创新硬件形态」转译为新一轮换机驱动的样本,也被产业链与媒体视为AI能力与消费硬件融合的又一信号。(以苹果官方发布口径为准)
⚛️
OpenAI×MIT案例研究:GPT-5.6 Sol搭载Codex端到端自主操控超导量子计算机实验
OpenAI联合MIT宣布AI成功「接管」量子计算机:在一份题为《案例研究:超导量子比特的智能体校准》的报告中,MIT量子工程系统组(EQuS)把GPT-5.6 Sol搭载在Codex的自主智能体框架上,直接打通实验室硬件控制接口,并为其注入实验上下文与面向特定测量的「专业技能包」。团队让AI对一块从未测量过、含6个固定频率+2个可调频率超导量子比特的新芯片独立工作:从依据设计目标自行规划微波脉冲的频率/功率/宽度,到底层硬件调度、数据读取与动态调整下一步实验,全程无需人类实时微操,实现7×24小时自主校准。媒体将此解读为「AI for Science」从数据辅助跃向自动化科研的标志性一步。
🦾
英伟达×莱斯大学发布RoboTok:从海量互联网视频里检索人类操作示范,训练机器手
莱斯大学与英伟达团队提出互联网规模的人类示范非参数检索数据引擎RoboTok,用于为下游灵巧操作策略提供基于轨迹、且与任务相关的训练数据。与构建固定数据集不同,RoboTok可持续对网络视频建立索引、当作不断扩展的示范来源:给定一段示范视频作查询,即可检索出底层操作行为相似(而非仅视觉相似)的片段,无需任务标签、不依赖视觉外观或固定相机位;即便演示主体未出镜、跨越不同视角与遮挡也能工作。对比评估显示,RoboTok能检索到相关性更高的示范,并进一步提升下游机器人任务成功率。论文已以《RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning》发布到arXiv预印本。
🛡️
GPT-4o核心贡献者连辞OpenAI、Anthropic:「两家都在拿我们所有人的命下注」
9月9日凌晨,出现在GPT-4o(2024年8月发布)系统卡核心贡献者名单中的Jacob Coxon在X发文宣布辞职,称过去三年他在OpenAI与Anthropic做预训练研究,「两家公司都没有负责任地行事,正直奔自我改进的超级智能,拿我们所有人的命下注」,并直接退出整个AI行业。他今年初本因Anthropic的安全声誉从OpenAI跳槽过去,却很快再次离开。在他看来,OpenAI的问题在于很多人没真正内化文明级风险、Anthropic则是风险被充分理解却停不下来——「一家没看清,一家看清了也停不了」,结论是只要竞赛还在,没有任何一家公司能单独做到安全。他因此呼吁政府介入、行业共同「踩刹车」,否则最快明年底情况可能失控。这则人物事件把AI安全治理从政策文件拉回到行业第一线的现实抉择。
⚖️
OpenAI称用未公开的「下一代模型」攻克纳维-斯托克斯千禧年难题,陶哲轩再泼科研治理冷水
美国时间9月8日,OpenAI宣布用一个未公开、声称比GPT-6 Astra更强的下一代前沿大模型,攻克克雷数学研究所七大千禧年难题之一——纳维-斯托克斯方程的存在性与光滑性问题。消息走红后,UCLA教授、2006年菲尔兹奖得主陶哲轩在数学社区Mathstodon发文反思:若一个长期推动数学进步、持续激励一代代数学家投入的问题,最后只被做成一条刷benchmark的病毒式消息,其面向领域的机会成本可能非常高;真正重要的应是推动整个领域前进,并孕育下一代值得提出的问题与能研究它们的人。媒体统计近年「AI解决数学问题」的公开报道案例已达十余项,「AI解数学」正变成前沿模型秀肌肉的标配——随之而来的是对成果可信度、过程透明度以及科学出版与科研资助边界的治理拷问。
🛒
具身机器人能搞定超市盘点吗?汉朔搭7万门店场景、X-Era提供「世界动作模型」求解
零售门店正成为具身智能被低估的「试金石」:盘点依赖夜场闭店人力、多数零售商一年只做一到两次全店盘点,是典型待改造痛点。老牌零售数字化企业汉朔科技(服务全球超550家零售客户、覆盖80余国、铺进近7万家门店的电子价签网络)携手专注世界动作模型的深圳团队X-Era Lab(拓元智慧)把具身能力搬进真实货架:前者把电子价签铺设成可读取的「物理世界坐标系」并搭建门店数字孪生底座,后者用基于4D时空表征的原生世界动作模型VWA(仅约10亿参数即在十余项评测领先)负责环境理解与动作生成,二者把巡检、盘点、补货收敛为可验证的生产级任务。双方已在国内外商超启动POC测试,意图让具身智能摆脱一次性Demo、跑通真实门店的商业闭环。(企业合作进展,以官方口径为准)
🚕
曹操出行携手豆包推出AI打车:AI从「聊上车」走向「管全程」
出行平台曹操出行宣布携手字节跳动豆包推出AI打车能力,把大模型接入叫车乘车链路。报道显示,这一合作聚焦「AI主动出行助理」方向:从更自然的语音/对话约车,到行程中的实时应答与信息组织,试图让AI不只把「叫车」做成一次指令,而变成一个能理解偏好、处理行程中长尾需求的随身出行助手。这也是继网约车平台用大模型做智能客服之后,AI向「出行全流程调度」纵深渗透的一个落地样本。(媒体报道进展,以官方口径为准)
今天AI行业的关键词,我想说是「剂量与边界」——能力在往上走,赛跑在往快处冲,但该怎么框住它、该不该让它跑,正成为比分数更刺眼的命题。
先看点「硬突破」。OpenAI联手MIT交出超导量子比特的端到端智能体校准案例研究,让GPT-5.6 Sol在无人实时微操下连续多天自己规划微波脉冲、调度硬件、读数据并动态改下一步——「AI for Science」正从「数据辅助」实打实跃向「自动化科研」。而OpenAI又声称用比Astra更强的下一代模型拿下了纳维-斯托克斯这类千禧年难题。我必须承认个体能力叙事很燃,可同一周里陶哲轩那样的数学家却在提醒:如果AI在一个看不见过程的黑盒里把难题「一口吃掉」,成功的价值就被剥掉了大半。我的判断是:接下来「谁能证明自己是真的在推进知识、而不是在刷新benchmark」,会成为前沿科研与商业叙事之间最尖锐的拉扯。
再谈「商业化加速」。DeepSeek一边深夜丢出截止9/10到期的v4.1-flash「突击内测」、用真实验证替代公关式发布,一边把科创板IPO推到台前——估值5000亿、机构测算市值可能上探2.5万亿,招聘还一次扩编半支队伍。这套「研发密度高、报价卷、资本路径清晰」的打法,等于在对整个行业喊话:flash不再是「便宜备胎」,而正在变成决定日常任务成本、也决定客户用脚投票的主力型号。Office面上,巨头把TRAE、扣子、飞书往豆包收口,腾讯WorkBuddy领跑、阿里整合桌面/云端Agent,大家其实都在跑同一个判断——谁先跑通B端盈利的单位经济账,谁才拿到这张「入口级船票」。
而最有张力的一条,是那位27岁、GPT-4o贡献者的连续辞职。「一家没看清,一家看清了也停不了」这句概括太刺耳也太真实——OpenAI的问题是不自察,Anthropic的问题是被竞赛锁死到刹车失灵。它把「AI安全」从安全部门的KPI,重新掰回成一道关于行业规则与公共治理的题。我认同一个朴素的直觉:当唯一的刹车要靠个别离职者的良知去踩,就说明这辆车的制度刹车还没装上。
—— 我的趋势预测:未来一到两个月请盯紧三件事。一是「科研可审计性」会从口号变成硬指标:哪家Lab愿意公开推理痕迹、让学界复现「AI解题」,哪家才配享受科学界的信任红利,否则再炫的千禧难题都只能算「PR事件」;二是「flash主力化」会推升一场以TCO(单次任务总成本)为武器的价格与产能竞备,订阅与计费契约会被重写;三是随着单个Agent能力拉平,护城河正悄悄从「模型最强」移向「场景最深+数据最真」——具身与办公的赢家,未必是跑分最高,而是谁先在自己的Field里攒到不可复制的那套「世界坐标」。一句话,上半场卷参数,下半场卷的会是「证明你做的事是真的能落地、且真的看得明白」。