新智元报道 OpenAI之后,老黄也出手了! 终于,英伟达重磅开源了自家的Harness——SoL-Pi。 它把Pi作为底盘,基于此重造了一套Harness效率增强层,让AI实现自我迭代、优化。 在这套严苛的自动化流水线中,AI自己也当上了研究员。 它们观察Agent怎么干活,找出哪些步骤在白白烧Token,提出方案、修改bug,再把方案送进测试。 AI的整个搜索从152个候选方向开始,最终留下了四大杀手级架构机制。 实测结果,令人咋舌—— Token消耗最高省64%,API调用成本骤降50%-54%。 GitHub传送门:https://github.com/NVlabs/SoL-Pi 在专业的研究场景下,每小时可直接省下8.75美元至13.5美元。英伟达,把AI省钱的开关开源了。 配置非常简单,仅需一行代码:「pi install git:github.com/NVlabs/SoL-Pi」,即可装到现有的Pi上。 Codex狂飙代码 一半Token却在空转 在让AI递归改进自己之前,能不能先让它把自我改进的账单打下来? Harness,模型干活时使用的整套运行框架,是当下最好的解。 模型负责推理,Harness负责把工具、上下文、执行反馈和任务流程组织起来,让模型能够读文件、改代码、跑测试,并根据结果继续行动。 同一个模型,放进不同的Harness里,做事效率可能差出一截。 当前的问题在于,编程智能体的任务越来越长。 从补几行代码,到跨仓库修复问题,再到长时间自主工作,单次任务可以持续数小时。 这时候,一些平时不起眼的Token浪费,会不断累积。 改完文件,明明下一步就是跑测试,模型还要再推理一轮。一个大文件早已读过,后续请求仍在反复携带它。 几千行日志里,真正影响决策的可能只有几行,昂贵的模型却要从头读起。 递归自我改进(RSI),同样绕不开这笔开销。AI每尝试改进一次系统,都要花Token。失败的方案,也照样收费。 SoL-Pi的出现,要解决的就是这件事。 最终结果显示,和底座Pi相比,SoL-Pi少用45%到49%的token,成本低大约三分之一,平均得分保留94%左右。 和Codex、Claude Code原配的harness相比,token少35%到64%,标价成本低50%到54%。 这么惊艳的表现,SoL-Pi是如何做到的?这就不得不详细拆解下,它的核心四大机制了。 AI卷自己进化,四个大招来了 英伟达的流水线最终留下了四个机制,刀刀避开主干,专治重复劳动。 第一层:动作融合,一次调用完成编辑与验证 Action Fusion直击的是两次工具调用之间,那段多余的模型决策环节。 在基础Pi的运行轨迹里,最常见的序列是修改文件、收到结果,然后再调用命令去测试或者构建。 既然后续命令已经非常明确,中间这轮模型的「一来一回」就有了极大的压缩空间。 动作融合将一次编辑及其后续命令保留在一个本地序列中,省去了中间的模型决策环节 Action Fusion直接把编辑和后续命令封装进同一个本地执行序列。 Harness在底层完成修改、运行命令,再把合并后的结果一次性返回。测试照常执行,结果正常获取,但中间那轮模型请求被成功省去。 这相当于把两次分散的请求,合并为了一次高效的闭环操作。 第二层:在线上下文压缩,按子任务动态核算成本 Online Context Compact,解决的是「何时触发压缩」这一核心痛点。 上下文越长,历史材料越容易变成算力与资金负担。 但压缩也是有代价的:重写上下文可能会打断已有的KV-cache复用,需要重新支付处理成本。 因此过早压缩未必省钱,过去的策略往往是把压缩动作尽量推迟。 在线上下文压缩将已完成的子任务视为潜在的压缩点,然后等待后续请求能够偿还重写成本时再执行 SoL-Pi重构了判断时机,它把大任务拆分为子任务,每完成一步,就重新进行评估。 其核心逻辑在于精准计算:只有当「未来预计省下的开销」能够覆盖「本次重写的成本」时,系统才会真正执行压缩操作。 第三层:输出归档与索引,大块文件按需召回 ObservationPack,专门处理大段工具输出造成的「重复计费」问题。 一个大文件或一份超长结果,首次读取后如果一直滞留在上下文里,后续每一轮请求都会原样携带它,持续消耗缓存资源。 ObservationPack用稳定的句柄取代了重复的完整输出,同时保留原始内容以便分页召回 SoL-Pi的做法是把完整内容直接归档到本地磁盘,上下文里只留一个稳定的短句柄和一小段摘录。 这就像读完长篇报告后,直接把原件存档,手边只留索引和关键摘要。模型需要查阅细节时,直接根据索引按页取回即可。 第四层:小模型初筛日志,引入严格的证据核验机制 Evidence-Preserving Reducer的核心,是把长日志的第