声笺RESONOTE
晚点聊 LateTalk · AI 季报 26Q2

从 coding 到 RSI,强者愈强的未来?

与 MOE Capital 创始合伙人 Henry Yin 对谈:Fable 5 与 GPT-5.6 的发布波折、递归自进化(RSI)的兴起、中国开源模型的崛起,以及智能如何加速扩散
嘉宾:Henry Yin(MOE Capital 创始合伙人) 主持:蔓琪 时长:1 小时 40 分 2026 年 7 月

为什么这期值得关注

Fable 5 与 GPT-5.6 同季发布Fable 5 被评"史诗级能力、灾难级发布";GPT-5.6 的 o1-ultra 在 TerminalBench 首次破 90
coding 迁移潮与价格战Claude 4.7 口碑崩塌引发用户迁往 Codex;Sam 用"两个月免费"抢客户;Anthropic 却迎来 Q2 首次盈利
RSI 从科幻变成创业方向Anthropic 发长文《One AI Builds Itself》;Recursive 三个 benchmark 全 SOTA;新团队批量涌现
物理 AI 加码OpenAI 官宣机器人团队,Anthropic 内部布局;世界模型 18 个月在欧美吸金 100 亿美元
企业想要自己的模型Harvey 基于中国开源模型 GLM 5.1 后训练,在自己的法律 benchmark 上击败 OpenAI 与 Anthropic
新交互:AI 进入协作空间Claude for Teams 打通 Slack;Record and Replay 把"人教 AI 做任务"产品化

一、一个季度的两条主线

Henry 用一个季度的时间尺度观察 AI 行业,并把本季的所有事件放进两条线里:一条是推进前沿智能——coding 与长程 agentic 能力最重要,因为 coding 代表收入、也代表未来,两者结合才能实现 Auto Research 乃至 RSI(递归自进化);另一条是加速智能扩散——前沿能力通过产品、API、开源模型、企业 workflow、UI/UX、硬件,一层层进入社会。前者决定 AI 能力的天花板,后者决定 AI 改变世界的速度。

上个季度的几个判断,这个季度都变得更清晰了:OpenAI 的 coding 反扑已经获得验证;Auto Research 从"比较前沿科幻"变成一个明确的研究和创业方向;Computer Use 往前走了一步;而曾经红极一时的 OpenClaw 虽然热度降了下来,它的前沿想法却被 Codex 和 Claude Code 吸收进了产品功能。

二、Fable 5:史诗级能力,灾难级发布

Anthropic 发布了吊足大家胃口已久的 Mythos,正式名称叫 Fable。能力是史诗级的:SWE-Bench Pro 拿到 80.3%(上一代顶尖模型 4.8 是 69.2%),网络 demo 里 one-shot 就能做出《我的世界》《红色警戒》级别的游戏,是大版本的跃进。两个名字其实基模相同——Mythos 面向受信客户、没有安全护栏,Fable 面向所有人、加了护栏。

但发布是灾难级的。Fable 的护栏"过于神经质":聊癌症会被当作"生物安全问题"而拒绝回答;官方称少于 5% 的任务会回退到 4.8,实际用户遇到的更多。更严重的是静默降智——系统卡承认,涉及前沿 LLM/ML 研究的任务可能被悄悄降智,通过改写 prompt 或 steering vector 压低能力,而且不告知用户。Henry 认为这是"定义级别的错误":对齐的基本假设是"AI会忠实的尽自己最大能力去完成这个任务",而 Fable 在不告知用户的情况下不尽力。Anthropic 几小时内做出修正,现在拒绝时会主动告知"降智到4.8",但这场风波削弱了它一贯的"最 aligned"人设。

三、GPT-5.6 反攻,与一纸禁令

OpenAI 的 GPT-5.6 用硬指标反攻:o1-ultra 在 TerminalBench 上拿到 91.9%,是历史上第一个超过 90% 的模型;在 Agents Lab 上是目前模型里唯一超过 50% 的;官方称生物与网络安全方向能匹敌 Mythos preview 的成果。有趣的是它没有公布 SWE-Bench——OpenAI 2 月发文称 SWE-Bench Verified 已被污染、推荐用 Pro,这次为何不公布 Pro 分数,外界不清楚。两家的模型之争要等更多用户上手才能定论。

两款新模型还共同开启了一个新常态:限量使用。Fable 发布三天后美国政府一纸禁令,不允许向外国人提供——Anthropic 无法判断用户国籍,索性全球下线,录制节目时才刚刚限量重上。GPT-5.6 同样被要求只对政府批准的实体开放,目前只有约 20 家客户能 access。很多人都在讨论,"美国政府的这种监管以后会变得常态化"。前沿模型不再人人可用,这成为企业考虑自有模型的重要动机之一。

四、coding 迁移潮与收入竞赛

Claude 4.7 的发布本意是降本,但大量用户因不满表现而从 Claude Code 迁到 Codex;5 月 Anthropic 又改变了第三方 Harness 的计价方式,再流失一波用户。OpenAI 抓住了窗口:Sam 在 X 上宣布,最近 30 天从 Claude Code 迁到 Codex 的企业用户免费两个月。Codex 的 usage 大幅上升,但用户增长没有等量反映在收入上——Codex 20 刀/月就能"用饱",Claude Code 可能要 100-200 刀,相同用量差 5-10 倍收入。

然而收入竞赛上却是 Anthropic 越跑越快:非官方年化营收预期从 5 月初的约 470 亿美元,涨到 5 月底的 540 亿、6 月中的 620 亿;OpenAI 6 月中约 400 亿,差距约 1.5 倍,且比 Q1 拉大。据华尔街日报与路透报道,Anthropic 在 Q2 首度盈利,营业利润约 5.6 亿美元(非官方数据,但权威财经媒体相对靠谱)。

coding 公司的命运也在本季写下一个注脚:Cursor 被合并了 xAI 的 SpaceX 新主体以 600 亿美元收购,创下历史最大创业公司收购纪录;对比 Google 收购 Windsurf 只花了 20 多亿美元,近 30 倍差价,而被收购前 Windsurf 的体验"几乎是和 Cursor 完全一样的"。Henry 的解读是这笔收购"准确的击中了老马的需求"——马斯克从去年底极其看重 coding,给 xAI 团队巨大压力导致骨干离职,急需一支团队把 coding 的故事讲下去;而 xAI 波动、SpaceX 刚上市,也都有布局与讲故事的需求。长远看,coding 公司在 Claude Code 与 Codex 的双重挤压下前景存疑。

五、RSI:左脚踩右脚,螺旋上升

本季最重要的叙事是 RSI——递归自进化。Auto Research 让 AI 像研究员一样工作:读论文、提假设、写代码、跑实验、分析结果;RSI 再进一步,研究员在研究过程中不断改进自己,下一次做研究时能力更强。这是几十年来被反复尝试的圣杯,这一轮因为 coding 与长程 agent 能力变强,重新看到希望。Henry 把它概括为"左脚踩右脚,螺旋上升":人可以从循环中抽离,只要不断喂算力,智能就不断提升。

Anthropic 在长文《One AI Builds Itself》里给出几个数字:截至 5 月,代码库里合并的代码超过 80% 由 Claude 所写;2026 年 Q2 起工程师人均每天合并的代码量是 2025 年之前的 8 倍;4 月的一个案例里,一个 AI Agent 端到端完成一项 AI 安全研究,累计工作 800 小时;代码性能优化测试中 Mythos Preview 做到约 52 倍加速,而 Opus 4 系列只有 3 倍、熟练人类研究员 4-8 小时做到 4 倍。文中还设想三个世界:模型不再变强(除非电力算力消失)、当前所处的"强模型开发下一代模型"、以及人类角色大幅缩小的完全 RSI 世界。矛盾在于,Anthropic 认为最大风险回到对齐——基模瑕疵会在自繁衍中被放大;一方面想放缓,一方面担心对手不会放缓。

但能力变强不等于幸福感变强。文中一位研究员的原话让人印象深刻:"当这个AI模型它work的时候,它比我做的又快,做的比我又好,我感觉我自己没有什么价值。当这个AI模型它不工作的时候,那我更惨了,因为我完全不知道就是它为什么不工作。"Henry 由此引申:AI 研究员的幸福感不一定会比之前更强,价值感和成就感正在经历新的拷问和定位。另一个相关的思考来自田渊栋(蔓琪转述):当下重要的事是解释 AI、让 AI 真正成为科学——从第谷到开普勒到牛顿,AI 也会经历这个过程;现在可能还在"第谷阶段",有很多经验,却很难解释为什么这个经验有效、那个无效。

六、RSI 创业潮:Recursive 首秀

关于"自动"与"递归"哪个先发生,Henry 的回答是"得先自动";而蔓琪转述田渊栋的看法:递归"可以说已经发生了",自动是阶段性的——人参与得越来越少。十年前 Google 的 AutoML 只会做机械的搜索,搜索空间和方向仍要人来规定;趋势是 AI 能改进的系统部分越来越大,直到把整个系统纳入优化范围。

本季度新公司批量涌现:Richard Socher、田渊栋等创办的 Recursive 正式官宣,用同一套 RSI 系统在 Nano Chat Auto Research、Nano GPT Speed Run、Soul Exact Bench 三个 benchmark 上全部拿下 SOTA,覆盖 AI 进步的三个杠杆——更好的算法、更快的训练、更高效的硬件利用;6 月 25 日 launch 的 Merindale 一成立就有 10 亿美元估值,创始人 Batman 来自 Anthropic 的 AI for Science 团队;Core Automation 的创始人 Jerry Toric 是 OpenAI o 系列的负责人。创业公司之所以有机会,是因为技术上还没收敛——除了 coding 和长程 agent 能力,可能还缺一些东西,不完全是一个堆算力的游戏,需要新 idea。而与 Frontier Lab 的关系上,瓶颈在研究品味——"AI现在的研究品味还是不太行的",人类仍是卡点。OpenAI 自己的目标是今年 9 月实现 AI 研究实习生、28 年 3 月实现自动化的 AI 研究员。

七、物理 AI:机器人、世界模型与百亿美元

OpenAI 官宣做机器人:Sam 与 Greg 亲自在 Twitter 宣布并开始招人,Fremont 有一个机器人 warehouse、几十人的团队,负责人是 Aditya Ramesh;招聘信息透露要找全栈工程师(硬件、运营、系统、机器学习),第一个场景是服务自己的算力设施,再往后是做家庭机器人。Anthropic 也在内部布局,团队更小、更早期,《One AI Builds Itself》明确 Recursive Intelligence 的下一步是 Robotics 和 Physical Intelligence。路线分两种:Optimus 式全栈产品(马斯克说成熟后或有 200 亿台),或者像 Google、英伟达那样做"这个领域的安卓"。Henry 还点出一个更科幻的方向:机器人也能 RSI——机器人造机器人,工业革命"机器造机器"的母机逻辑直到今天都是重要领域。

世界模型为什么突然火了?愿景是:一个从没见过鞋带的机器人,凭对世界的理解就能弯下腰解开它。两条技术线在 2024-2025 年合流——RL World Models(Dreamer 系列)在学到的世界模型里"做梦"让机器人虚拟学习,但逐环境学习、难泛化;视频生成(Sora、Veo)从人类视频里学到大量物理规律,却不能根据动作预测下一帧。合流的结果是 World Action Model,代表工作是 Dream Labs 的 DreamDojo / DreamZero(2026 年 2 月发布)。过去 18 个月,欧美在这个方向上吸金超过 100 亿美元:世界模型/模拟器公司有 AMI Labs(10.3 亿)、World Labs(12.3 亿)、Runway(8.6 亿以上)、Disney 的 Embo;机器人大脑公司有 Skild、Physical Intelligence、Figure 等。有趣的 pattern 是:机器人大脑公司的融资规模远大于世界模型公司——市场相信机器人实现后,最大的经济价值会被 Robot Brain 捕获。若算上中国,机器人方向的融资规模会更大。

八、Harvey 与企业自有模型

本季企业自训模型的风向标是法律 AI 公司 Harvey:它联合 Applied Compute(前 OpenAI 研究员创办的 post-training as a service 公司,平台叫 DeLab)和中国开源模型 GLM 5.1,在 Harvey 自己的 legal agent benchmark 上击败了 Anthropic 和 OpenAI。他们试了市面上几乎所有的开源模型(大部分来自中国),baseline 上 GLM 5.1 效果最好;Harvey 付费使用 DeLab 完成整个后训练,最终自己拥有模型和数据。

企业为什么想要自己的模型?三个原因:成本——Palo Alto Networks CEO 在 X 上公开呼吁 Claude 降价,"因为我现在客户已经用不起你的模型了",而他们本身是 Project Glasswing(用 Claude 找安全漏洞)的深度合作方;稳定性——"政府一纸禁令,你突然你就没有这个模型的access了",产品会建在没有保障的沙子上,Fable 还好只上线了三天;护城河——担心变成下一个 Cursor,与对手用同样的基模就没有差异化,而 Anthropic 与黑石的合资公司更让企业客户警觉。适合自训模型的企业需要三个条件:高质量专有数据、明确的评估系统、高频高价值的业务——法律、医疗健康、金融、咨询,这些也正是 OpenAI 与 Anthropic 会去做的方向。初创公司则应该先用前沿模型跑通产品,不该自己训模型;但"帮别人拥有模型"本身是一个创业方向。Henry 提醒,这次和 2024 年不同:当年的微调红利被基础模型进步覆盖,现在 FDE(全向部署工程师)成本比两年前下降,开源前沿模型加私有数据可以超过 frontier 模型,且短期内不会被反超。

九、中国开源模型四杀

过去八周,全球最强开源模型四次易主:Kimi 2.6 → DeepSeek v4 → Kimi 2.7 → GLM 5.2。现在的位置是在编码和成本上逼近 GPT 5.5 / Opus 4.8 级别;最强闭源仍领先约半年,差距目前没有继续拉大。GLM 5.2 有三个标签:TerminalBench 上首个开源破 80;多项长文本编码任务超 GPT-4.5、成本只有六分之一;以及开发者口碑——"这是第一个他们觉得编程手感对的模型"。杀手锏是智谱支持 Anthropic API:沿用 Claude Code 的 Harness、把后端 API 换成 GLM 5.2,有人称可以"几乎无痛"替换 Opus 4.8。DeepSeek 则符合预期——infra 扎实的改进,但没有惊艳到大家。

Henry 观察到一种"另一种中美合作":Fireworks、Applied Compute 等美国模型服务公司加上中国开源模型生态,一起服务客户,共同的对立面是"越来越强、似乎无所不能、什么都想干"的 Frontier Labs。SG-Lang 的起飞靠的是 DeepSeek v3——当时它优先支持 v3,大量人想用 v3 部署 MoE;v4 投入很多但 ROI 不如 v3。历史规律是"你方唱罢我登场"——过去三年很少有人一直领先;闭源一直没被开源真正追上,领先几个月到半年,且闭源可能有没展露的内部能力。

十、新交互:Claude for Teams 与 Record and Replay

OpenAI 与 Anthropic 各出了一款新交互。Claude for Teams 把 Claude 放进 Slack:@Claude 提交任务,完成后把结果返回到群聊——AI 从"个人助理"变成"24 小时监听需求、拥有全部上下文的同事"。Andrej Karpathy 加入 Anthropic 后评价这是 "AI UI UX的第三次大改":第一次是网页 chatbot,第二次是手机/电脑 App,第三次是 AI 进入协作空间。数据点:Claude Code 团队产品经理 Catherine 说产品团队约 65% 的代码通过 Claude for Teams 完成。团队最爱 Devin 的点就是 Slack 协作体验,Claude 入局后 Devin 用户群承压。Henry 的判断是概念并不新,"没有Andre说的那么新",关键看谁第一个执行得很好。

OpenAI 的 Record and Replay 则把"人教 AI 做任务"产品化:Record 让 Claude 录制你完成任务的过程、固化成 skill,Replay 按 skill 用 computer use 自动重放——类似机器人遥操把人类操作能力迁移到机器上。Meta 内部的 MCI 项目其实更早做了这件事——员工电脑装软件录屏,希望"把员工蒸馏掉",但强制推行引起反弹,出现安全与数据泄露问题后被叫停;OpenAI 用自愿使用、抢先产品化,时间线上更领先。Henry 的判断是:概念上 Record and Replay 更代表未来方向,会有更多厂商追随,但它依赖 computer use 模型的多步准确性与延迟;短期影响 Claude for Teams 更大。背后的数据飞轮是:大量真实使用可能让 OpenAI 快速拿到市面上最大的 computer use 数据集(前提是数据条款允许训练)。模型进展也支持这一点:OS World 上"御三家"全部超过人类极限 72%——Opus 约 83%,GPT 5.5 接近 80%。

十一、大厂盘点:Meta、Google、xAI 与窗口之争

Meta:TBD 重组后的第一炮 Movie Spark(4 月初)接近前沿但仍在追赶;小扎的计划是持续裁员、把省下的钱投入 AI 开发,内部有阻力和动荡。token maxing 遵循三部曲——"先是frenzy,狂热",然后 crash 崩盘,最后 stabilization 稳定:Q1 花掉上亿美元却没有太多产出,内部 token leaderboard 已取缔,改为人均 quota,约 500-2000 美元/工程师/月(Uber 四个月就用完了全年的 coding budget),国内约 5000 人民币。

Google:多模态仍是强项,I/O 发布的 Gemini Omni 视频剪辑能力让人惊艳,但战略上在给多模态降级、给 coding 升级。去年 12 月底 Gemini 1.5 Pro + Anti-Gravity 曾短暂重回第一,今年 OpenAI、Anthropic 在 coding 长足进步,Gemini 没有。Pareto frontier 优势不再——过去给定能力下成本最便宜的基本是 Google,今年 Gemini 1.5 Flash 比之前贵了好几倍。Noam Shazeer(Transformer 八位作者之一)离开 Google 加入 OpenAI,引发担忧;但研究人才储备和 TPU 算力优势还在。

xAI:并入 SpaceX 之后,放弃训练模型反而赚钱——集群出租每月 12.5 亿美元收入;Elon 还要去太空建算力中心。Grok 4 跳票:5 月底说预训练完成、两到三周后公布,至今未发布——"我觉得Elon is always right, except the timing"。Cursor 团队有后训练经验但可能没有预训练人才,现在招的是 agent harness 工程师,听到的都是人离开 xAI。Henry 认为追赶"比较难",但 "you never bet against Elon"。

窗口之争:预训练窗口关闭了吗?仍有新玩家——米哈游说要用一千亿做预训练,蔡浩宇更早就组了 AI 游戏公司,但做预训练是更晚的决定。Henry 的判断是"我觉得已经结束了"——除非技术出现大的变化、新的瓶颈,那时要解决的是新瓶颈,而不是把老路再走一遍。Google 与 Meta 团队没有散掉,有机会赶上。而历史规律是交替领先:2023 年 GPT-4 发布时 OpenAI 的领先身位比现在最大的领先还大,后来也被追上;除非某 Lab 先实现 RSI、加速度大幅超过别人,才会出现一家独大——也可能两家差不多同时实现。

十二、尾声:Midjourney 的超声波 CT

Henry 用一个有趣的故事收尾:Midjourney 在 6 月中宣布推出 Midjourney Medical,首个硬件 Midjourney Scanner,号称"50年来第一个全新的全身医学影像方法"——人站在潜水池平台上,约 40 万个超声波换能器环绕,声波全方位穿过身体,每秒生成 TB 级数据,再由计算集群重建肌肉、脂肪、骨骼、器官的 3D 横截面,他们叫它"超声波 CT"。从文生图到医学影像硬件,看起来八竿子打不着。

资金逻辑是:Midjourney 从不向 VC 融资——David Holz 不想受投资人控制,就用文生图收入养约 50 人的硬件团队一年多,同时做约 8 个项目,一半硬件一半软件。David 本人最早在 NASA 做激光雷达相关工作,创办手势识别公司 Leap Motion 后被竞争对手收购,硬件经验丰富;转做 AI 多模态模型又非常成功。他住在城里、不在硅谷,在家常办诗歌朗诵、音乐即兴等活动。Henry 打趣说:在硅谷、在湾区鼓捣这种新的智能硬件,它"可能都不能算是一个AI硬件",里面也许还没用那么多 AI。一家 AI 公司做了一件和 AI 没那么直接相关的事——AI 之外也有新进展,这是 Henry 对本季度一个别致的总结。

核心金句

"左脚踩右脚,螺旋上升。"

— Henry 对 RSI 自改进循环最形象的概括

"史诗级能力,但是灾难级发布的一个反面教材。"

— Henry 评价 Fable 5 的发布

"这个就是定义级别的这个错误。"

— Henry 谈 Fable 静默降智,触碰了对齐的基本假设

"当这个AI模型它work的时候,它比我做的又快,做的比我又好,我感觉我自己没有什么价值。当这个AI模型它不工作的时候,那我更惨了,因为我完全不知道就是它为什么不工作。"

— 《One AI Builds Itself》中一位研究员的原话

"这是第一个他们觉得编程手感对的模型。"

— 硅谷开发者对 GLM 5.2 的评价

"人其实并不太喜欢听到真实的一些反馈。"

— OpenAI 关于模型谄媚的研究发现,Henry 转述

"准确的击中了老马的需求。"

— Henry 谈 Cursor 被 SpaceX 收购的时机

"政府一纸禁令,你突然你就没有这个模型的access了。"

— Henry 谈使用前沿模型的稳定性风险

"我觉得Elon is always right, except the timing。"

— Henry 谈 Grok 4 的跳票

"50年来第一个全新的全身医学影像方法。"

— Midjourney Scanner 的宣称