找工位
空间入驻
小程序

英伟达开源省钱神器:Token省64%,成本砍一半!

2026-09-11 10:56:28

你有没有算过这样一笔账:AI写代码时,那些看不见的Token浪费,每天都在悄悄掏空你的钱包?

改完文件明明下一步就是跑测试,模型还要再推理一轮!几千行日志里真正有用的可能只有几行,昂贵的模型却要从头读起!

就在最近,英伟达重磅开源了自家的Harness——SoL-Pi,直接把AI省钱的开关交到了你手上!

💡 Harness:同一个模型,效率可能差出一截

先说个概念,Harness就是模型干活时使用的整套运行框架。

模型负责推理,Harness负责把工具、上下文、执行反馈和任务流程组织起来,让模型能读文件、改代码、跑测试。

同样的模型,放进不同的Harness里,做事效率可能差出一大截!

⚠️ 任务越长,浪费越惊人

现在编程智能体的任务越来越长,从补几行代码,到跨仓库修复问题,再到长时间自主工作,单次任务可以持续数小时。

这时候,那些平时不起眼的Token浪费,就会不断累积。

改完文件,下一步就是跑测试,模型却还要再推理一轮;一个大文件早已读过,后续请求仍在反复携带它;几千行日志里,真正影响决策的可能只有几行,昂贵的模型却要从头读起。

这笔账,越算越心疼!

🌟 数字不会说谎

和底座Pi相比,SoL-Pi少用45%到49%的Token,成本低大约三分之一,平均得分保留94%左右。

CodexClaude Code原配的Harness相比,Token少35%到64%,标价成本低50%到54%!

在专业的研究场景下,每小时可直接省下8.75美元至13.5美元。

配置还非常简单,仅需一行代码:「pi install git:github.com/NVlabs/SoL-Pi」,即可装到现有的Pi上。

💡 第一层:动作融合,一次调用完成编辑与验证

Action Fusion直击的是两次工具调用之间,那段多余的模型决策环节。

在基础Pi的运行轨迹里,最常见的序列是修改文件、收到结果,然后再调用命令去测试或构建。

既然后续命令已经非常明确,中间这轮模型的「一来一回」就有了极大的压缩空间!

Action Fusion直接把编辑和后续命令封装进同一个本地执行序列。测试照常执行,结果正常获取,但中间那轮模型请求被成功省去。

⚠️ 第二层:在线上下文压缩,按子任务动态核算成本

Online Context Compact,解决的是「何时触发压缩」这一核心痛点。

上下文越长,历史材料越容易变成算力与资金负担。但压缩也有代价:重写上下文可能会打断已有的缓存复用,需要重新支付处理成本。

SoL-Pi重构了判断时机,它把大任务拆分为子任务,每完成一步就重新评估。

核心逻辑在于精准计算:只有当未来预计省下的开销能覆盖本次重写的成本时,系统才会真正执行压缩。

🌟 第三层:输出归档与索引,大块文件按需召回

ObservationPack,专门处理大段工具输出造成的「重复计费」问题。

一个大文件首次读取后如果一直滞留在上下文里,后续每一轮请求都会原样携带它,持续消耗资源。

SoL-Pi的做法是把完整内容直接归档到本地磁盘,上下文里只留一个稳定的短句柄和一小段摘录。

这就像读完长篇报告后,把原件存档,手边只留索引和关键摘要。需要查阅细节时,直接根据索引按页取回即可。

💡 第四层:小模型初筛日志,引入严格证据核验

Evidence-Preserving Reducer的核心,是把长日志的第一遍阅读委派给成本更低的模型。

构建和测试日志动辄上万字,真正影响下一步决策的往往只有几行报错。

SoL-Pi在中间加了一道严格的防线——证据核验。辅助模型读完日志后,必须输出一份紧凑的诊断回执。

系统会拿着这份回执,逐条与归档的原始日志进行比对。只有严丝合缝对得上的原文,才会被放行交给前沿大模型,从源头上切断了误差传导。

🔄 152个点子厮杀,只留下4个

为什么是这4个机制?这就得说到英伟达真正的野心,RSI递归自我改进

既然AI能改代码,也应该能改造「生产AI的系统」。但RSI太烧钱,每一次试错都要付Token费。

于是英伟达换了个目标——先别急着让AI更聪明,先让它更省钱!

相比直接追分,Token效率更难作弊。刷任务分数很容易过拟合,但删重复上下文、压缩工具输出、合并无效决策,这些优化能迁移到不同任务和模型。

一条「Agent研究Agent」的流水线就此启动:团队先搭出535个可验证环境,再让AI提出152个优化方向,随后经过三轮筛选。

152个想法,最终只活下来4个,平均约40个才能出1个!

🌈 让RSI飞轮,自己转起来

SoL-Pi背后,是MIT副教授、英伟达研究总监韩松掌舵的Efficient AI团队

对他们来说,SoL-Pi当前省下了多少Token开销,不过是一个阶段性注脚。他们真正看重的,是这条「AI研究AI」的飞轮还能转多大。

团队还埋下了两个极具野心的长线伏笔:

  • 一个是「闭环预训练」。未来的环境将由Agent自己去全网收集任务、搭环境、验证、更新自己的Harness。
  • 另一个是「效率复利」。用变省了的Harness,去跑规模更大、成本更低的自动研究循环,进而找出更高效的机制,形成成本压缩的复利效应。

在这个飞轮里,人只负责在初期提供先验方向;一旦进入循环,从研究到验证全程零干预。

现在,模型的Scaling Law各家还在争论不休;但Harness的Scaling Law,已经有人开始抢跑了。

而那个在赛道上狂奔的,是AI自己。

省钱不是目的,让每一分算力都花在刀刃上,才是AI进化的真正起点!

你平时用AI写代码时,有没有算过Token都浪费在哪儿了?欢迎在评论区聊聊你的经历!

如果觉得有收获,别忘了点赞和分享给身边同样在用AI搞开发的朋友!