跳到主要内容
洞察
Above

TrueForge:AI 智能体真正难的从来不是模型

TrueFoundry 的 TrueForge 是一套开源智能体运行时,声称比 Claude Managed Agents 最多降低 75% 成本。智能体框架究竟做什么、基准测试真正说明了什么,以及为什么这对开放模型是好消息。

作者 Adam Maguire Wilson约 13 分钟读完
本页目录

问一屋子工程师,构建 AI 智能体最难的是什么,大多数人会说模型。再问一屋子真正把智能体发布到生产环境的人,你会得到另一张清单:重启后还能活着的会话;不会泄露到沙箱里的工具凭据;凌晨 2 点依然真的能工作的人工批准步骤;以及不会悄悄把预算烧成十倍的上下文窗口。模型是一个下午就能换掉的部分。真正吃掉一个季度的,是它周围那套机器。

TrueFoundry 在 8 月 19 日开源的,就是这套机器。TrueForge 是一个智能体框架,也就是围绕模型运行循环的运行时层:规划、调用工具、把结果反馈给模型、再重复,同时一路管理会话、沙箱、审批和上下文。它的发布主张,是成为 Anthropic Claude Managed Agents 的厂商中立替代方案,并把运营成本压到大约一半。更有意思的是,支撑这条宣传语的基准测试,真正扛主要工作的是一个中国开放模型。我读了代码仓库、发布文章和相关报道。下面看看哪些说法经得住推敲。

关键要点 - TrueForge 是 TrueFoundry 发布、采用 MIT 许可证的智能体框架:核心服务器负责运行智能体循环,外部提供 HTTP API 和 TypeScript SDK,并带可嵌入聊天 UI。模型提供商不限,MCP 服务器不限,基础设施也由你自己选。 - 标题基准是:在一组 14 项企业任务评估中,TrueForge 使用同一模型时,任务完成率与 Claude Managed Agents 基本一致,成本约低 30%;把模型从 Opus 4.8 换成 GLM-5.2 后,成本约低 75%。这是 TrueFoundry 自己运行的基准,没有独立验证。 - 运行时免费,真正的商业模式是它下面的网关。TrueFoundry 销售治理层,包括预算、速率限制、审计和可观测性,每次模型和工具调用都可以经由这一层路由。 - 对开放模型来说,这反而是更重要的故事:中立智能体框架意味着谁能以最低成本完成任务,谁就能拿到工作负载,而现在这场竞争越来越多地出现中国实验室。 - 本地模式只有一个进程、SQLite,而且默认没有登录。把它当成快速试用方式,不要当成生产部署。

发生了什么

8 月 19 日,TrueFoundry 以 MIT 许可证发布 TrueForge。TrueFoundry 是一家 2021 年成立于旧金山的 AI 基础设施初创公司,创始团队来自 Meta。VentureBeat和 InfoWorld在同一周都报道了发布消息,代码仓库几天内突破 1,800 个星标。关键事实如下:

  • 这套框架运行完整智能体执行循环,包括模型调用、MCP 工具、技能、沙箱代码执行、人工审批、上下文管理和会话状态,并从头到尾以流式方式传递结果。

  • 对外有三种使用方式:自带聊天 UI、HTTP API 加 TypeScript SDK(@truefoundry/trueforge-sdk),以及用于嵌入自有产品界面的 UI SDK(@truefoundry/trueforge-ui)。

  • 模型通过 YAML 目录配置,支持 OpenAI、Anthropic、Gemini 等二十多个提供商,也支持任何兼容 OpenAI API 的端点。技能是 git 管理的 SKILL.md 包,采用 Claude Code 推广开的同一约定。

  • 有两种运行形态:本地模式是单进程加 SQLite,通过 npx @truefoundry/trueforge 启动;团队使用的托管模式则是 Postgres 加 Redis,可用 Docker Compose 或 Helm 部署。

  • 对不想自行运行的团队,TrueFoundry 也提供按用量付费的托管版本。NetApp 和 Automatiq 被列为早期用户,此外还有 TrueFoundry 自己的内部助手。

TrueForge 是 TrueFoundry 于 2026 年 8 月 19 日发布的开源 MIT 智能体框架。它负责运行智能体循环,包括模型调用、MCP 工具、沙箱执行、审批、上下文管理和会话状态,并通过聊天 UI、带 TypeScript SDK 的 HTTP API,以及可嵌入 UI 对外提供能力,见 TrueFoundry 发布公告。

为什么智能体框架才是值得争夺的一层

做一个智能体演示很容易。让五十个智能体在生产环境里稳定运行就不是了,而两者之间的差距,几乎全部是智能体框架的工作。模型会推理,但它本身不会行动:不会打开文件、不会调用 API、不会记得三轮前自己说了什么,也不会在删错数据表之前主动停下来。必须有人写代码,让所有这些事情不断重复地发生,而且要安全、可预测、成本可控。

直到最近,你基本只有两种选择。第一,自己构建智能体框架,意味着花几个月接管道,然后从维护产品变成维护运行时。第二,从模型提供商租一套。Claude Managed Agents 就属于后者,由 Anthropic 替你运行循环,费用包括 Claude token,再加每运行会话小时 0.08 美元,并按毫秒计费。第二种方便,但结构上很别扭。当运行时、工具和计费都属于同一家厂商,你的路线图最终也会属于它。

这也是为什么上下文工程能力比模型列表更重要。TrueForge 带子智能体、延迟工具加载,也就是工具定义需要时才载入,不是每次提示都塞进去、大结果卸载和上下文压缩,都是防止长时间智能体任务被自己历史记录淹没的办法。这些不是锦上添花。在 TrueFoundry 的基准里,同一批任务、同一个模型,它的配置每次运行使用 380 万 token,而 Claude Managed Agents 使用 1000 万。即使对这个数字保留怀疑,方向仍然是对的:智能体成本的大头往往是上下文浪费,而上下文处理正是智能体框架的工作。这也是为什么我一直告诉客户,在智能体架构里真正值得问的通常不是“哪个模型”,而是“模型外面包了什么”。

智能体框架负责模型本身处理不了的生产问题:会话、工具凭据、沙箱、审批和不断增长的上下文。在 TrueFoundry 的基准测试中,相同任务下 TrueForge 每次运行使用 380 万 token,而 Claude Managed Agents 为 1000 万。TrueFoundry 将差异归因于上下文压缩和延迟工具加载。

基准测试,认真拆开看

所有标题都在写 75%,所以最好把它拆开,因为它其实是两个数字穿了一件外套。

TrueFoundry 使用 DevRev 的 Enterprise-Bench 测试,共 14 个任务,覆盖模拟 CRM、问题跟踪和文档系统。先看同一任务、同一工具、同一模型:

  • TrueForge 运行 Anthropic Opus 4.8,大约完成 14 个任务中的 11 个,平均每次运行 8.50 美元。

  • Claude Managed Agents 运行同一个 Opus 4.8,完成任务数量大致相同,平均每次运行 11.80 美元。

  • TrueForge 运行智谱开放权重模型 GLM-5.2,同样完成约 11 个任务,平均每次运行 2.90 美元。

所以更诚实的拆法是:使用同一个模型比较智能体框架,成本大约降低 30%,主要来自托管服务溢价,以及上面提到的 token 减少。跳到 75%,还同时更换了模型,从 Opus 4.8 换成 GLM-5.2。正如一篇很敏锐的分析指出,这个比较一次改变了两个变量,因此它告诉我们的,可能更多是开放模型走到了多远,而不是 TrueForge 自身有多神。这从某种意义上反而就是 TrueFoundry 真正的论点:如果智能体框架是中立的,你就有自由拿走模型切换带来的那部分节省。

还要补两个限定条件。基准由 TrueFoundry 自己运行,没有在更大规模生产工作负载中得到独立验证。而 14 个任务样本很小,只要三个任务的随机波动,就可能让一周看起来很好或很差。因此更适合把这些数字当作厂商报告,而不是审计结果。

DevRev Enterprise-Bench 评估平均每次运行成本柱状图。TrueForge 加 Opus 4.8 平均 8.50 美元,Claude Managed Agents 加 Opus 4.8 平均 11.80 美元,TrueForge 加 GLM-5.2 平均 2.90 美元。三种配置都完成约 14 个任务中的 11 个。

同一项评估,三种配置。30% 的节省来自智能体框架之间的差异;75% 的节省主要来自更换模型。这些都是厂商自报数据,可根据代码仓库中的 benchmark 目录复现。

在 TrueFoundry 自行运行的 DevRev Enterprise-Bench 基准里,TrueForge 与 Claude Managed Agents 都完成约 14 个任务中的 11 个。使用同一 Opus 4.8 模型时,每次运行分别为 8.50 美元和 11.80 美元,约低 30%;换成 GLM-5.2 后为 2.90 美元,约低 75%,见发布公告。结果尚未独立验证,而且 75% 这个数字同时改变了智能体框架和模型两个变量。

商业模式和许可证不是一回事

把运行时免费送出去,销售它下面那一层。开源智能体框架是完整的,也确实免费,但 TrueForge 被设计为把每次模型调用和 MCP 交互都路由通过 TrueFoundry 的 AI Gateway,而预算、速率限制、护栏、访问策略和可观测性都在那里。这才是商业产品,另外还包括给不想自己运行 Postgres 的团队提供的按用量付费托管版本。

我并不是把这当成批评。很多优秀的开源基础设施都采用类似交换方式,团队的 Meta 背景也很明显。创始人的主张是,只要平台设计正确,控制权和便利并不矛盾,而免费提供智能体框架,正是把自己的控制层铺到所有人智能体下面的方法。NetApp 平台工程高级总监 Robert Rubin 把 TrueFoundry 描述为“IT 中央平台,智能体应用和智能体都通过这里路由”,这几乎就是公司希望占据的准确位置。作为买方,要知道自己究竟在哪一层做了承诺。智能体框架可以分叉,网关则是订阅。

竞争名单越来越拥挤,这也反过来证明这个类别是真的:专有端有 Anthropic 托管运行时,框架领域有 LangChain Deep Agents,DeepSeek 自己采用 MIT 许可证的智能体框架仍在开发者预览,现在又有 TrueForge 冲着通用生产用途而来。当三个大洲在一年里都发布同一层软件,这一层通常已经成为承重结构。

TrueForge 本身采用 MIT 许可证免费,但它被设计为让模型和 MCP 流量经由 TrueFoundry 商业 AI Gateway 路由,预算执行、速率限制和可观测性都在这一层销售。根据发布报道,首发点名的早期用户包括 NetApp 和 Automatiq。

这对开放模型意味着什么

这里有一个角度,我觉得西方报道普遍低估了。绑定某一模型家族的托管运行时,本质上是那个模型家族的护城河。中立运行时则会拉平竞争:经由 TrueForge 路由的每个工作负载,GLM-5.2、Qwen、DeepSeek 或 Kimi 都能按“每个完成任务的成本”竞争,而不是靠品牌竞争。75% 那个数字之所以存在,就是因为一个中国开放权重模型以 Opus 四分之一左右的价格完成了企业任务。一年前,“便宜模型完成了差不多同样多的任务”这句话还很难面不改色地写出来。

这是我在杭州观察了一段时间的模式:开放权重实验室不需要在所有维度上打败前沿模型,只需要接近到足够让上一层不再在乎底层究竟是哪一个模型。中立智能体框架恰恰就是这一层,而现在它已经以开源形式出现,并且附带治理故事。如果你正在判断中国开放模型是否已经适合真实工作负载,我在给客户使用的风险框架里更完整地讨论过这个问题。短版结论是:“智能体框架只把它当成另一个端点”已经拿掉了一个过去还算像样的不测试理由。

现在可以做什么

如果你正在构建或运行智能体,可以按顺序做三件事。

  1. 今天: 在自己的机器上运行 npx @truefoundry/trueforge,接入一个模型和一个 MCP 服务器。本地模式是 SQLite 上的单进程,是我见过理解“智能体框架到底做什么”成本最低的方式之一。只让它跑在 localhost 上。默认没有登录,文档也明确说本地模式不是面向互联网的部署方式。

  2. 本周: 选一个你已经在运行的智能体工作负载,记录 token 成本和完成率,再在自己的任务上复刻基准测试的比较方式。仓库里的 benchmark/ 目录就是为这个准备的。只有你自己的数字重要。包括这次在内,厂商基准在你重跑之前都属于营销材料。

  3. 本月: 如果你现在正在支付托管运行时费用,先按真实账单计算仅由智能体框架带来的 30% 节省,然后单独测试开放模型能否在同一任务上达到质量门槛。两个独立决定,用两张独立表格。如果你还在更早阶段,正在选择第一套技术栈,那么在承诺任何运行时之前,先看自建还是采购以及自托管的取舍。

常见问题

什么是智能体框架?

它是把语言模型变成真正可工作的智能体的运行时层。它围绕模型运行循环,也就是规划、调用工具、把结果反馈回来、重复执行,并负责模型本身无法处理的所有事情:会话持久化、工具凭据、沙箱执行、人工审批,以及在长任务中控制上下文窗口。TrueForge、Claude Managed Agents 和 LangChain Deep Agents 都属于智能体框架,只是底层模型的可替换程度不同。

TrueForge 免费吗?

智能体框架本身采用 MIT 许可证,可以免费使用,包括商业使用。你仍需支付模型、沙箱提供商,目前是 Daytona,以及自己的基础设施费用。TrueFoundry 销售可选治理层,也就是带预算、速率限制、审计和可观测性的 AI Gateway,同时提供面向不想自托管团队的按用量付费托管版本。

TrueForge 和 Claude Managed Agents 相比怎样?

Claude Managed Agents 完全由 Anthropic 托管,费用是 Claude token 加每运行会话小时 0.08 美元,而且只支持 Claude。TrueForge 可以自托管,也可以由 TrueFoundry 托管,模型中立,运行时本身免费。TrueFoundry 自己的基准显示,在同一模型上任务完成率相当时,TrueForge 成本约低 30%。代价是你需要自己承担更多运营,而这份基准也是厂商自己的,不是独立结果。

TrueForge 能使用 GLM、Qwen 等中国开放模型吗?

可以。它支持任何兼容 OpenAI API 的端点,而且发布基准最醒目的数字,就是把 TrueForge 与 GLM-5.2 配在一起得到的。75% 成本降低来自这个组合,因此这个数字对开放模型价格竞争力的说明,至少和它对智能体框架的说明一样多。

最后的判断

TrueForge 只有一个月大,基准是自己跑的,现在还没人应该把工资系统交给它。但它的形态是对的:智能体框架正在成为技术栈里独立的一层,这一层迟早都会出现一个开源、中立的选项,而它发布时的成本计算竟然需要依靠一个中国开放模型才能做出最醒目的数字,这其实是关于智能体经济走向最安静、也最值得注意的信号。接下来一个季度,真正该看的,是有没有独立团队复现这些成本主张。这会决定它只是一次发布,还是一次真正的变化。

如果你正在梳理智能体框架应该放在自己技术栈的哪个位置,这也是我经常和客户讨论的问题。欢迎联系我。

来源

  • TrueFoundry,《TrueForge:Claude Managed Agents 的开源替代方案》:https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (发布于 2026 年 8 月 18 日,检索于 2026 年 8 月 29 日)

  • TrueFoundry,TrueForge 项目仓库:https://github.com/truefoundry/trueforge (检索于 2026 年 8 月 29 日)

  • TrueFoundry Docs,《TrueFoundry 在 TrueForge 之上增加了什么》:https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (检索于 2026 年 8 月 29 日)

  • VentureBeat,《TrueFoundry 开源 AI 智能体框架 TrueForge 声称任务完成成本低 30% 至 75%》:https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (发布于 2026 年 8 月 19 日,检索于 2026 年 8 月 29 日)

  • InfoWorld,《TrueFoundry 推出开源 AI 智能体框架,声称成本最多降低 75%》:https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (发布于 2026 年 8 月 20 日,检索于 2026 年 8 月 29 日)

  • Superpower Daily,《TrueFoundry 免费送出智能体运行时,销售下面那一层》:https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (发布于 2026 年 8 月 20 日,检索于 2026 年 8 月 29 日)

  • Business Wire,《TrueFoundry 发布 TrueForge》新闻稿:https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (发布于 2026 年 8 月 19 日,检索于 2026 年 8 月 29 日)

继续阅读

Agent Field Notes

获取下一期。

为需要真正运行这些系统的人,解释 Agent Harness、运行时、安全与治理。

是否正面临类似的决策?

我们为面临重大智能体系统决策的团队提供架构审查、治理评估和版本固定的框架评估。

关于作者

Adam Maguire Wilson

创始人,AI 智能体系统独立顾问。

adam.mw