如果不按 Token 计费,那以后 AI 怎么收钱?
作者丨 高允毅
编辑丨岑 峰
GPT-6(内部代号 Astra) 发布在即,一份来自《The Information》的独家爆料,提前泄露了 OpenAI 最新的技术底牌。 这一次的核心升级,是一套名为 “循环深度” 的架构级革新,它正在颠覆我们熟知的推理模式。 过去,大模型想解难题,会吐出一长串“思维链”;而 “循环深度”直接让模型在内部的循环块里反复思考,然后给出最优解 ,这充分释放了模型的推理潜力,还节省了思维链中间文本带来的显存占用与带宽成本。 同时,这也带来新的安全问题。过去,“思维链”就像是 AI 的“心流日记”。
虽然OpenAI 的 o1 等模型已经隐藏了思维链,但那只是产品层面的“不可见”,后台数据依然有迹可循。 这一次, OpenAI 从架构层面把思维链“黑盒化” ,连 Open AI 首席科学家 Jakub Pachocki 都开始担忧,不希望因为《The Information》的报道,倒逼行业冲向 “不可监控状态” 的无序军备竞赛。 这还是一种深刻的 “去文本化” 的技术变革。对于AI而言,先将思考转化为线性、离散的人类语言文字,再重新解码识别的交流方式,其实是一种低效的“计算中介”。 如今的大模型,正在试图抛弃人类语言,直接在“思想维度”里完成计算了。 当 AI 不再依赖输出文字来思考时,那座完全建立在 “Token” 计费之上的庞大 AI 商业帝国,根基开始松动了。
01
循环深度,
当推理发生在“隐藏空间”
在切入循环深度这一技术话题时,一个值得关注的点是,为什么大模型既没增加参数,也没增加数据,仅仅在内部“多算了几轮”,性能就变强了呢? 传统 Transformer 的计算逻辑,像一条固定长度的单向流水线。从第一层开始输入Token,每生成一个新词,背后的算力都必须把所有物理层从头到尾地走一遍。
这些层数是固定的,如果遇到简单的问题,走完所有层会造成算力的浪费。如果遇到难题,层数不够用,只能基于浅层理解 “硬凑” 答案。 为了弥补这一短板,行业想出了思维链(CoT)的办法,让模型把中间步骤写出来,再读回去接着算,相当于临时“加长”了思考深度。
但本质上模型的层数没变,算力没有花在真正的“核心思考”上,又被浪费在生成、解析中间文字上。 而循环深度技术的核心逻辑是把核心运算层做成一个可循环的 “转盘”,同一个数据可以反复经过同一组参数层,原地迭代打磨,直到推导充分了再输出。 这样, “计算长度”变成了“计算深度”问题,算力的重心也从 “生成思考过程”,花到了 “真思考” 上,其效率提升是十分惊人的。
早在2025年,学界有一篇论文《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》,亲自验证了这种思路的效果:一个仅 35 亿参数的小模型,通过内部循环 32 次,仅用相当于 500 亿参数模型的计算负载,在数理逻辑和代码任务上的表现就足以逼近甚至超越传统稠密大模型。 而且因为模型内部反复调用的都是同一套核心计算引擎,无论它在潜空间里把同一个数据反复运算多少遍,它都可以在同一块显卡内存空间里直接复用,让推理阶段的硬件显存开销成功实现了“封顶”。 这种技术正在和混合专家架构(MoE)走向深度融合,成为行业探索新方向: Recurrent MoE 。 传统 MoE 里每个专家单次传播只激活一次,本质是 “用空间换广度”;接入循环深度后,同一个向量每轮迭代都能重新路由到不同专家,同一个专家可以被反复调用打磨细节,变成 “用时间换深度”,把参数的潜力榨到极致。 它不再用长篇大论的思维链(CoT)来凑字数,而是将所有的算力倾注在了看不见的纯逻辑推演中。 这是全行业 “去 文 本化” 的一个缩影。大模型的核心思考,正在从人类看得懂的 “文字空间”,彻底搬进了看不见的高维 “向量空间”。 对大模型来说,把高维语义压缩成一串线性的文字,再重新解码成向量去计算,本身就是个充满信息损耗的低效路径。
循环深度让所有逻辑推演、路径排查、方案验证,全部以数学形式在连续潜空间里完成,这远比语言符号更准确高效。 尽管循环深度还没在商业大模型里大规模落地,但业内纷纷展开探索,从 OpenAI Astra 的核心技术,到 Meta 内部探索的 “连续思维链”,再到大厂关注的 “椰子项目(COCONUT)”,都是这一套思路的延伸。
02
模型之间还要靠文字聊天吗
既然模型内部思考不用Token,那模型间的协作还需要文字沟通吗? 今早在 X 上爆火的俄罗斯初创模型公司 Mostik,正好给出了答案,用一种新的 AI 通信范式, 把人类语言从操作系统降级为显示驱动。 在传统的多模型协作中,模型与模型之间的沟通如下,模型 A 算出了答案,先翻译成人类语言,然后模型 B 再破解这些语言,读取 Token。这种方式较为低效,成本也高。 Mostik 直接取消了“文本中转”这一环,为模型间搭了一座“桥”,而这座桥可以理解为 “机器心灵感应 ” 。 具体而言, 他们训练了一个轻量的桥接矩阵,把大模型理解问题后的高维隐状态,直接投影进小模型的输入潜空间 。
整个过程不生成任何一个 Token,两个原模型的权重也完全不用微调,信息在纯向量层面上畅通无阻。 这种思考来自一种数学的思维,其创始人 Sasha Malysheva 带领一众数学博士,联手 2010 年菲尔兹奖得主 Stanislav Smirnov, 发现不同模型的潜空间,存在天然共通的语义流形 。 虽然对齐全量权重是艰难的事情,但为模型间搭一座小桥,却足以让语义互通。而且这种方式是一种高精度的完整还原,不改动任何一个原模型的权重。
这让它体积极小、训练成本极低。 在实验中,他们尝试把GLM-5.2(753B)和Qwen-3.5(4B)搭了一个桥,昂贵的云端大模型在关键难题上动脑后,然后把产出结果传给端侧小模型执行。结果混合系统的推理成本仅为GLM-5.2的二十分之一,跑出了相当于顶级模型近 80% 的准确率。 在极其严苛的 ARC-AGI 排行榜上,这个“拼凑”的轻量化方案一举斩获了第一名,得分远超同期测试的传统前沿大模型。 前谷歌DeepMind科学家卡尔·图尔斯对此赞不绝口,“桥”的出现,释放了模型协作间的效率。
"大模型动脑+小模型执行",用极低成本逼近单体大模型。 模型之间正在彻底脱离人类语言,建立起一个属于机器自身的、纯粹由高维流形连接的协同网状世界。
03
被刺穿的 Token 经济
从种种苗头而言,本质是 AI 计算正在转向潜空间 。 “循环深度”挖掘的是时间维度,它让单个模型在潜空间里纵向迭代,把思考拉深;“潜空间桥接”拓展的则是空间维度,它让多个模型横向组网,把能力拼宽。 一个向内挖深,一个向外连片。两者交织,正在编织一张看不见的、纯高维向量的二维计算网。 我们可以预测未来会出现一种场景, 大模型先在内部循环数十轮完成高阶推理,直接将最终潜空间通过桥接分发给多个端侧小模型并行执行。
多个专家模型各自独立循环,通过桥接实时同步中间状态,群体智能在向量层面直接涌现。 再往深处看,是Token经济的地基。 今天整个AI产业的商业闭环,建立在一个等式上:计算等于Token。API按Token计价,模型收入等于Token消耗量乘以单价,思维链也按输出Token收费,是推理模型毛利的重要来源。 再往上,各大硅谷科技巨头今年联合指引的、高达 7500 亿美元的 AI 基础设施资本开支,锚定的正是Token消耗量的增长曲线。 循环深度和潜空间桥接,恰好在这个等式的两端各切了一刀。 在思考环节,循环深度让模型想几十轮、输出一行字,计费按输出 Token 算,成本却按真实算力算,收入和成本开始脱钩;在协作环节,Agent工作流里,大模型写给小模型看的中间文本,原本是纯开销。
Mostik直连后,模型间往返的文本传输费,从大头变成零。 按Token计费的API需要新的计量单位,可能是真实计算量,可能是循环次数,也可能是按结果定价。 当 AI 彻底抛弃了语言这个“中介”,它们在高维向量空间里跳动的每一个逻辑脉冲,都将永远超出人类的理解范畴。 这是一把双刃剑: 未来,我们或许能得到所有问题的正确答案,但我们也可能永远失去对“为什么”的解释权。 参考链接:https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns?rc=gznj9j https://www.wired.com/story/russian-startup-mostik-ai-models-communication/
上车,雷峰网带你看遍全球 AI 顶会精华
可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈
扫描上方二维码 或点击 「 阅读原文 」 关注专区。
