“我们的继任者,正是我们亲手创造出来的AI。”9月17日,智谱创始人、首席科学家唐杰在X平台发表长文,并转发智谱技术博客,披露GLM团队在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践:由GLM-5.3驱动的Infra Agent完成了GLM-5.3-Flash推理基础设施的设计、调试与优化——模型开始反向改进承载自己运行的系统。这是国内大模型厂商首次公开跑进生产环境的RSI案例。
时点耐人寻味。就在前一天,智谱刚在分析师电话会上披露,约50亿美元再融资中约60%的净额(约235亿港元)将投入下一代GLM基础模型和“完全自训练”体系;昨日,智谱又正式GLM-5.3-FlashX,其新版本推理速度最高可达200tokens/s,是GLM-5.3-Flash速度的5倍,定价提升至原版的2.5倍。大洋彼岸的Anthropic则公开了内部衡量AI自我改进速度的三大指标。战略叙事、工程实践、产品提价、监管仪表盘在48小时内密集落地——RSI这条曾被视作科幻概念的赛道,这一周同时进入了中国公司的生产环境、价目表和美国公司的披露清单。

两周3倍:模型给自己建了一套推理系统
所谓递归自我改进,指的是AI系统不再只是被动运行的工具,而是开始参与改进自身——从写代码、调优承载自己的系统,到终极形态:自主设计并训练出自己的“继任者”。它被头部实验室视为通往AGI的关键一跃,逻辑很现实:人类研究员的扩张是线性的,而一旦模型开始参与研发自己的下一代,迭代速度就具备了复利式加速的可能。商业含义同样直接——AI研发效率和推理成本,正是大模型公司眼下最烧钱的两项支出;谁先让模型把这两项成本打下来,谁的商业闭环就先跑通。
据智谱方面对《科创板日报》记者介绍,这次实践的硬指标是:Infra Agent在超过10万张国产芯片组成的集群上,从零搭建了一套完整的生产级推理服务,不到两周将端到端吞吐提升至初始基线的3倍,硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平,并支持1M上下文窗口与多模态请求。
据官方博客,此前没人成功部署过如此大规模的国产卡集群——芯片内存容量和带宽受限、生态不成熟、算子不完备,许多文档基本靠猜。做成这件事的不是一支团队,而是GLM-5.3驱动的Infra Agent。GLM-5.3-Flash的全部线上推理,目前都运行在这套系统之上。
系统已经受真实流量检验:GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode与OpenRouter上线,一周内成为双平台调用量最大的模型,6天Token调用量超过62万亿。技术栈上,团队实施了以算力换带宽、以通信换显存等定制化方案,并引入EPD(Encode–Prefill–Decode)分离式架构。
值得记录的是这次实践的含RSI量:Agent不再只是生成代码,而是围绕推理系统完成了完整工程闭环——根据测试、Trace、Benchmark等稠密反馈自主提出性能假设、定位精度缺陷、修改底层代码、执行分层测试并持续迭代。GLM团队同时划清了边界:系统尚未达到完全自主设计和训练下一代模型的阶段,但RSI的早期形态已经出现——模型建设推理系统,系统再反过来支撑模型运行。
这次披露并非孤立事件,而是智谱半年来层层递进的一步。今年7月,创始人唐杰在内部信《巨浪已来》中提出摸高计划,将完全自训练列为核心方向;8月31日业绩会上,智谱管理层首次为下一代模型定调:从预训练、中训练到后训练全流程让模型自己训练自己,核心特征是自净化——“最大的问题是这个模型能自己判断什么时候停止、什么时候纠正自己,而不是简单地把模型训练大”。
一位大模型业内人士告诉《科创板日报》记者,对智谱而言,RSI的商业含义同样直接:推理系统的吞吐与单Token成本,正是其算力经济账里80%理论推理毛利的前提。模型把自己的推理成本打下来,等于给智谱那笔300亿算力投入、400亿年收益的测算补上了一个自我强化的变量。
涨价与降本,正在这家公司身上同步发生。昨日上线的GLM-5.3-FlashX定价为GLM-5.3-Flash的2.5倍,据《科创板日报》记者统计,这已是智谱年内至少第六次提价。一边用RSI把推理成本打下来,一边把更快的服务卖出更高的价格,两个动作指向同一本账:把推理生意的毛利做厚。
RSI全球牌桌:头部实验室竞速透明化,中国厂商落地真实生产环境
RSI已是全球头部实验室公开竞逐的下一个高地,而Anthropic在本周拿出了迄今最激进的一次透明化动作。9月12日,CEO阿莫迪发表长文《We Must Pace the Frontier》,单方面承诺引入拥有员工级权限的独立第三方评估员进驻公司,并呼吁前沿实验室给AI发展定速——递归自我改进被其列为需要全球协调限速的对象。
9月18日,Anthropic在官网发布《理解前沿实验室中AI发展速度的衡量指标》,首次向外界公开三项内部指标:其构建的“研发自动化指数”显示,截至8月,Claude在26%的AI研发工作中处于主导地位、超过90%的研发工作有AI深度参与,但没有任何环节实现完全自主;在其最常用的内部平台上,任意时刻约有3万个AI智能体在执行研发与工程任务,这些智能体的全部动作100%经过在线监控系统,被拦截的比例为0.002%,约合每4.7万次动作拦截一次;算力分配上,投向AI研发的算力中约6%用于安全研究。
OpenAI则选择了把时间表公开。9月6日,其官方博客宣布按期达成去年秋天设立的“自动化AI研究实习生”目标:研究部门每投入1个人工工作日,对应3.1个智能体工作日;下一个节点是2028年3月前实现“自动化AI研究员”。OpenAI同时承认,以RSI方式实现这一目标的路径,尚不清楚如何安全实现。
放回国内坐标,《科创板日报》记者注意到,智谱这次披露的意义在于“生产环境”四个字:此前国内厂商关于自我改进的表述多停留在论文与规划层面,GLM是第一个把RSI早期形态放到真实流量下检验并公开细节的。竞争逻辑也在此切换——当AI开始参与自身系统的构建,AI研发效率本身成了竞争对象:谁先让模型参与构建下一代模型,谁的迭代速度就获得复利。
国内牌桌上,大厂中,腾讯混元7月发布研究智能体Hyra-1.0,将递归自我改进能力引入自身研发工具栈;字节 Seed 团队也在推进 Seed-for-Seed 的 AI4AI 探索,把 AI 自动数据合成、评测、框架调优逐步融入模型研发流水线;阿里5月发布的Qwen3.7-Max,曾在自研真武M890芯片上连续自主工作35小时、完成1158次工具调用——没有挂RSI的名字,做的是同类的事。
海外对照组更能说明赛道热度:据统计,半年内RSI相关初创融资已超过10亿美元——由OpenAI前研究副总裁等人创立、田渊栋加盟的Recursive估值已达46.5亿美元;Anthropic离职研究员6月创立的Mirendil,种子轮即获2亿美元。竞争逻辑也在此切换:当AI开始参与自身系统的构建,AI研发效率本身成了竞争对象——谁先让模型参与构建下一代模型,谁的迭代速度就获得复利。
对于这次披露,北京计算机学会AI专委会秘书长、北京大学特聘研究员张有鱼对《科创板日报》记者表示,智谱此次实践的价值不在于3倍吞吐这个数字本身,而在于验证了Agent可以在缺乏文档、生态不成熟的国产硬件环境里完成长链条工程任务。这解决的是国产算力最头痛的可用性问题——卡买到了没人会调,现在模型自己会调了。但他同时提醒,目前的RSI仍局限于“有稠密反馈、可自动验”的工程场景。此外,Infra Agent优化的是推理系统工程,不是模型架构与训练方法的自我设计。离完整意义上的RSI,即模型自主设计并训练出继任者,中间还隔着整个行业都还没跨过去的一步。
(文章来源:财联社)
