国庆七天,AI 圈出了六件大事
国庆七天,AI圈没一天消停
假期第一天凌晨,我手机里同时躺着三条发布消息。Anthropic 9 月 28 日发的 Sonnet 5.5,OpenAI 9 月 30 日的 DevDay,还有 Google 10 月 1 日凌晨的 Gemini 4 Argon。到第三天,我自己服务器上那个智能体框架也更新了。
我把这七天的消息按时间顺序捋了一遍。先说事,末尾说判断。
发布会从 9 月 28 日就排上了

Sonnet 5.5 是 Claude 5.5 系列的第二款,9 月 22 日先出的是旗舰 Opus 5.5。真正让我坐直的是 Terminal-Bench 4.0 那张表。Sonnet 5.5 拿了 70.6%,自家旗舰 Opus 5.5 是 66.4%,再上一代的 Sonnet 5 只有 10.3%。
中档型号把旗舰按在身下,价格还是旗舰的一半。
有第三方提醒这对比要小心,Opus 那边跑的推理档位是 Xhigh,两边可能不一致。我觉得这提醒有道理,具体差多少我说不准。
9 月 30 日凌晨,OpenAI 在旧金山办 DevDay,整场五十几分钟,念了二十多项更新。头一个是 Dots,一个常驻的智能体,由 GPT-6 Astra 驱动,在云端有一台自己的电脑和浏览器,能连四千多个应用,全天候干活,也可以从 ChatGPT、Slack 或者 Teams 里使唤它。企业和教育版默认是关着的,要管理员手动打开。
第二个是 GPT-6.1 Sol。OSWorld 2.0 那个电脑操作测试里,它比上一版 GPT-6 Sol 高 7 个百分点,离 Astra 只差 2.1 个点。价格我拉了个表,单位是美元,按每百万 token 算。
两家旗舰,撞在同一个价格上。
北京时间 10 月 1 日凌晨轮到 Google。Gemini 4 Argon 被官方说成目前最强,但暂时不公开卖,只通过一个叫 Fairwind 的计划交给可信的网络防御者,还得等美国政府审批。单次输出上限提到 100 万 token,上一代是 64K。它主打长周期任务。
Deepseek Harness 那条我听进去了
10 月 3 日,DeepSeek Harness 更新,强化了插件化和跨平台能力,还塞进去一个实验性的 Claude Code Mods 兼容层。
背景得补一句。Harness 8 月 14 日开源,口号是「一切皆插件」。Anthropic 那边刚在 Claude Code 新版里加了 Mods,开发者写一段 TypeScript 函数挂到事件流上,就能观察甚至改写工具调用。
10 月 4 日,Harness 负责人崔添翼回应,说兼容层还在 alpha 阶段,做它的目的是验证 Claude Code Mods 给的扩展能力能不能被 Harness 那套架构覆盖住。
这条我读得最细,因为我服务器上跑过它。装了快两个月,这两天刚卸掉。原因跟它好不好用无关,我一个月也用不上几回,那几十兆常驻内存不如留给博客和后端。卸载前我看了一眼,峰值内存到过两百兆。
我卸它跟这条新闻没关系。
但这条新闻让我看清一件事,接口是谁定的,人就往谁那边走。对手定的接口有价值,就先承认它、接过来,用户也顺着过来了。智能体框架的事实标准之争,从这条兼容层开始摆到台面上。
欧洲那个大家伙,和 Anthropic 的收尾

10 月 6 日,法国 Mistral 开放 Mistral Large 4 公测,昵称 Le Chonk,法语定冠词叠英语网络俚语,调侃它块头大。1.05 万亿总参数,每次只激活约 490 亿,原生多模态,100 万 token 上下文。
真正值得等的是 10 月 27 日。那天放模型权重,许可证怎么写才是关键。开放权重意味着参数能下载、能本地部署、能自己改,对数据敏感的单位就吃这一套,网络安全部门和政府还会拿到专门版本。欧洲在闭源巨头之外,卖的其实是数据主权。
长假末尾一天,Anthropic 发了 Haiku 5.5,5.5 系列里最便宜最快的轻量款。旗舰、中档、轻量三档到这算凑齐了。路透社的说法很直接,这是在计划中的上市之前把产品线铺开。
上市那件事,多家投资方预计 10 月挂牌,估值 2 万亿美元起步,有投资人给到 3 万亿。如果按 2 万亿落地,会超过 SpaceX 6 月那次的 1.77 万亿,成为史上最大 IPO。到今天我没看到正式挂牌的消息。
两盆冷水
10 月 3 日,OpenAI 安全系统团队负责人大卫·罗宾逊辞职,在《大西洋月刊》上投书,标题大意是我离开 OpenAI 是因为它的文化坏了。他说自己负责过安全报告和系统卡,也认同其他近期离职同事的看法,做这项技术的公司远远不够小心。OpenAI 证实他上周就已经离开。
放在 DevDay 那套发布节奏后面看,这封信不好读。同一周里,一家公司既发布了最能干活的智能体,又失去了写安全报告的人。
另一件落在 Meta 头上。10 月 1 日,《Inc.》专栏作者杰森·阿滕说 Muse 在他没许可的情况下读了他的私信,Meta 通信副总裁安迪·斯通在 X 上反驳,说 Mac 版 Muse 的消息整合要用户同时打开好几层权限才会生效。谁说得对,我没有办法验证。
Muse 上线三周就登顶美区免费榜,日活做到 ChatGPT 同期的近三倍。用的人是真多,麻烦也是真多。
国内那两条线
有报道说腾讯要让元宝杀进个人智能体,跑在用户专属的云虚拟机上,等于给 Agent 配了一台专用电脑,24 小时干活。是推倒重来还是嵌进元宝现有的产品里,腾讯还没亮牌。我留意这条,因为它和 Dots、Muse 抢的是同一个位置。
另一条是国内内容侧的账。DataEye 的数据,2026 上半年全网新增 AI 短剧 22.19 万部,播放量破亿的只有 1055 部,破亿率 0.47%。98.7% 的新剧上线半年内没摸到盈亏线,平均 77 部里回本一部。9 月 1 日《微短剧发展管理办法》施行,AI 微短剧按投资额分三类监管。产量和收益差得太远,监管跟上得也快。
我留下来的三个印象
第一个是位置在换。从 Dots 到 Muse 再到元宝,产品形态正从「你问它答」挪到「它在云上有台电脑,替你盯着事」。比的东西也跟着换了,从跑分换成生态和信任。
第二个是价格塌下来的速度快过我的预期。GPT-6.1 Sol 用五分之一的价格逼近 Astra,Sonnet 5.5 半价反超自家旗舰,Haiku 5.5 主打最便宜最快,Mistral 拿开放权重换部署自由。发布会每开一场,模型层能赚的钱就薄一层,钱开始往订阅档位、应用市场和垂直场景跑。只靠模型本身赚大钱的故事,快讲不下去了。
至于安全,它可能是里面最贵的。Gemini 4 Argon 把安全做在前头,分级投放;罗宾逊辞职和 Muse 的风波,风险漏在后头。模型能力的差距在缩小,谁更值得托付这件事,会同时影响监管态度、企业采购和资本愿意给的钱。
一个问题
我现在想的是另一件事。如果明年这个时候,你的云上真的有一台不关机的电脑,替你收邮件、盯价格、改代码,你会把哪些事交给它,哪些事死活不给?
我现在的答案挺保守的。也许过一年回头看,会觉得这份保守有点好笑。


