← 返回内容列表

GPT-5.6 递归自我改进:AI 开始自己训练自己的范式转移

GPT-5.6 递归自我改进:AI 开始自己训练自己的范式转移

OpenAI于2026年7月9日全面开放GPT-5.6系列模型,最引人注目的不是Sol的编程跑分或Luna的低价,而是一句被大多数人忽略的技术声明:最小的Luna是由旗舰版Sol自主完成后训练的。AI不再只是被训练的客体,它开始自己带徒弟了。

2026年7月9日,OpenAI正式向全球用户全面开放GPT-5.6全系列模型。三款模型分别被命名为旗舰版Sol、均衡版Terra和轻量版Luna

在这场信息量巨大的发布中,绝大多数人的注意力被两件事吸走:Sol在编程基准测试Terminal-Bench 2.1中狂揽91.9%的得分,将Anthropic的Claude Fable 5甩开超过8个百分点;以及Luna的输入价格低至每百万token仅1美元,直接掀翻了硅谷的定价体系。

但在技术圈的最深处,真正引发地震的是一句被大多数人忽略的轻描淡写——

OpenAI在技术文档中提到,全家桶里最小的Luna是由老大哥Sol自主完成后训练的。具体而言,Sol自己寻找可用GPU、确定训练配置、编写启动脚本并确认任务执行,全程无需人类工程师干预。

图1:递归自我改进循环

图1:GPT-5.6递归自我改进循环——Sol自主完成从找GPU到训练Luna的全流程

什么是"AI训练AI"

要理解这句话的含金量,必须先回顾大模型训练的传统模式。在GPT-4和GPT-5时代,训练一个顶级大模型本质上是一个高度依赖人类智慧的手工作坊:

  1. 人类研究员从互联网上筛选和清洗数万亿token的训练数据
  2. 设计预训练架构,调整数千个超参数
  3. 通过RLHF让模型对齐人类偏好,需要成千上万标注员打分
  4. 设计评测基准,反复调试确保模型不变傻或失控

在这个链条中,AI只是被训练的客体,人类研究员是绝对的主体。人力成本在整体训练成本中的占比高达30%至40%。人类研究员的精力、判断力和创造力,成了模型进化的天花板。

图2:训练范式对比

图2:传统训练流程(左)与AI自主训练流程(右)的对比

递归自我改进的颠覆性

GPT-5.6的模式彻底改写了这个链条。Sol不仅是一个模型,更是一个"研究员"。它能够:

  • 自主寻找GPU:Sol分析可用计算资源,选择最优GPU集群
  • 确定训练配置:自主设定学习率、批大小、训练步数等超参数
  • 编写启动脚本:生成完整的训练代码和启动流程
  • 确认任务执行:监控训练过程,处理异常

这意味着过去必须由人类研究员主导的数据清洗、奖励模型设计、knowledge distillation和超参搜索,现在可以由旗舰模型自己独立完成。

飞轮开始转动

AI safety领域,这个概念有一个令人不安的学名——递归自我改进recursive self-improvement)。当AI强大到能够自主重构、测试甚至微调自己的下一代模型时,那个被未来学家预言了数十年的飞轮,终于开始转动了。

这不是一次常规的版本迭代,而是一次范式转移paradigm shift)的公开宣告。模型进化的瓶颈从"人类研究员的认知极限"转移到了"算力和数据的物理极限"。

当然,递归自我改进的增长并非无限指数。GPU算力供给、高质量训练数据耗尽、芯片制造极限等物理约束最终会使增长趋于饱和。但即便如此,从人类主导到AI自主的范式转变,已经足以重塑整个AI产业的竞争格局。

行业连锁反应

GPT-5.6的发布也引发了行业连锁反应。谷歌选择对Gemini 3.5 Pro进行全量重训而非增量微调,认为旧基座的历史噪声已成为能力天花板。DeepSeek通过speculative decoding将推理速度提升85%。OpenAI的Sol则通过多智能体调度(Ultra模式)让模型学会"指挥"而非"单干"。

2026年的AI行业,正在经历从"更大模型"到"更聪明训练"的转折点。递归自我改进,或许就是这个转折点上最重要的注脚。

关联推荐

评论 (0)

加载评论中…

GPT-5.6 递归自我改进:AI 开始自己训练自己的范式转移 | 必学必会