본문으로 건너뛰기
인사이트
Above

TrueForge: AI 에이전트에서 어려운 부분은 모델이 아니다

TrueFoundry의 TrueForge는 Claude Managed Agents보다 비용이 최대 75% 낮다고 주장하는 오픈소스 에이전트 런타임이다. 하니스가 실제로 무엇을 하는지, 벤치마크가 정말 보여주는 것이 무엇인지, 그리고 왜 오픈 모델에 좋은 소식인지 살펴본다.

작성자 Adam Maguire Wilson읽기 15분
이 페이지에서

엔지니어들이 모인 방에서 AI 에이전트를 만들 때 뭐가 어렵냐고 물으면 대부분 모델이라고 답한다. 실제로 하나를 프로덕션에 내보낸 엔지니어들에게 물으면 목록이 달라진다. 재시작 후에도 살아남는 세션, 샌드박스로 새지 않는 도구 자격 증명, 새벽 2시에도 제대로 작동하는 사람 승인 단계, 예산의 10배를 조용히 먹지 않는 컨텍스트 창이 나온다. 모델은 오후 한 번이면 바꿀 수 있는 부분이다. 그 주변의 장치가 분기 전체를 먹는다.

TrueFoundry가 8월 19일 오픈소스로 공개한 것이 바로 그 장치다. TrueForge는 에이전트 하니스다. 모델 주변에서 계획하고, 도구를 호출하고, 결과를 다시 넣고, 반복하는 루프를 실행하면서 세션, 샌드박스, 승인, 컨텍스트를 관리하는 런타임 계층이다. 출시 주장은 Anthropic의 Claude Managed Agents에 비해 운영비가 대략 절반인 벤더 중립 대안이라는 것이다. 그 주장을 뒷받침하는 벤치마크에서 중국 오픈 모델이 큰 역할을 하는데, 나는 그 부분이 가장 흥미롭다. 저장소와 발표 글, 관련 보도를 읽었다. 무엇이 설득력 있는지 보자.

핵심 요점 - TrueForge는 TrueFoundry가 MIT 라이선스로 공개한 에이전트 하니스다. 에이전트 루프를 실행하는 코어 서버, TypeScript SDK가 있는 HTTP API, 임베드 가능한 채팅 UI로 구성된다. 모델 제공자는 무엇이든, MCP 서버도 무엇이든, 인프라도 직접 선택할 수 있다. - 대표 벤치마크는 14개 작업으로 구성된 엔터프라이즈 평가에서 TrueForge가 같은 모델 기준 Claude Managed Agents와 비슷한 작업 완료율을 보이면서 비용은 약 30% 낮았고, Opus 4.8 대신 GLM-5.2를 쓰면 약 75% 낮았다는 것이다. TrueFoundry 자체 벤치마크이며 독립 검증은 없다. - 런타임은 무료지만 사업은 그 아래의 게이트웨이다. TrueFoundry는 모든 모델과 도구 호출이 통과하는 거버넌스 계층, 즉 예산, 속도 제한, 감사, 관찰 가능성을 판매한다. - 오픈 모델에는 이쪽이 더 중요한 이야기다. 중립 하니스에서는 작업을 끝내는 가장 싼 모델이 워크로드를 가져간다. 지금 그 경쟁에는 중국 연구소가 점점 더 깊이 들어오고 있다. - 로컬 모드는 SQLite와 로그인 없는 단일 프로세스다. 감을 잡아보는 용도로만 쓰고 그 이상으로 취급하지 말자.

무슨 일이 있었나

8월 19일, 2021년 전 Meta 엔지니어들이 설립한 샌프란시스코 AI 인프라 스타트업 TrueFoundry가 TrueForge를 MIT 라이선스로 공개했다. 같은 주 VentureBeat와 InfoWorld에 출시 기사가 나왔고 저장소는 며칠 만에 별 1,800개를 넘었다. 핵심 사실은 다음과 같다.

  • 하니스는 전체 에이전트 실행 루프를 돌린다. 모델 호출, MCP 도구, 스킬, 샌드박스 코드 실행, 사람 승인, 컨텍스트 관리, 세션 상태를 처음부터 끝까지 스트리밍한다.

  • 세 가지 방식으로 노출된다. 번들 채팅 UI, TypeScript SDK(@truefoundry/trueforge-sdk)가 있는 HTTP API, 자체 제품 안에 인터페이스를 넣기 위한 임베드 UI SDK(@truefoundry/trueforge-ui)다.

  • 모델은 YAML 카탈로그로 가져온다. OpenAI, Anthropic, Gemini와 20여 개 제공자를 지원하고 OpenAI 호환 엔드포인트라면 무엇이든 붙일 수 있다. 스킬은 git 기반 SKILL.md 팩으로, Claude Code가 대중화한 같은 규약을 사용한다.

  • 두 가지 형태로 실행된다. 로컬 모드는 단일 프로세스와 SQLite이며 npx @truefoundry/trueforge로 시작한다. 팀용 호스팅 모드는 Postgres와 Redis를 사용하고 Docker Compose 또는 Helm으로 배포한다.

  • 직접 운영하고 싶지 않은 팀을 위해 TrueFoundry가 사용량 기반 호스팅 버전도 제공한다. NetApp과 Automatiq가 초기 사용자로 이름을 올렸고 TrueFoundry의 자체 내부 어시스턴트도 사용 사례에 포함된다.

TrueForge는 TrueFoundry가 2026년 8월 19일 공개한 오픈소스(MIT) 에이전트 하니스다. 모델 호출, MCP 도구, 샌드박스 실행, 승인, 컨텍스트 관리, 세션 상태로 구성된 에이전트 루프를 실행하고 채팅 UI, TypeScript SDK가 있는 HTTP API, 임베드 UI로 제공된다. TrueFoundry 발표에 따른 내용이다.

왜 경쟁할 가치가 있는 계층이 하니스인가

에이전트 데모를 만드는 것은 쉽다. 50개를 프로덕션에서 운영하는 것은 쉽지 않다. 둘 사이의 차이는 전부 하니스 작업이다. 모델은 추론하지만 행동할 수 없다. 파일을 열지도, API를 호출하지도, 세 턴 전에 한 말을 스스로 기억하지도, 잘못된 테이블을 삭제하기 전에 스스로 멈추지도 않는다. 누군가의 코드가 그 모든 일을 반복적으로, 안전하게, 예측 가능한 비용으로 수행해야 한다.

최근까지 선택지는 두 가지였다. 하니스를 직접 만들거나, 몇 달 동안 배관을 만들고 이제 제품이 아니라 런타임까지 유지보수하는 길이다. 아니면 모델 제공자에게 빌리는 방법이다. Claude Managed Agents가 그런 제품이다. Anthropic이 루프를 대신 운영하고 Claude 토큰 비용에 실행 중 세션 시간당 0.08달러를 더해 밀리초 단위로 청구한다. 두 번째는 편하지만 구조적으로 불편하다. 런타임, 도구, 과금이 한 벤더 소유가 되는 순간 로드맵도 그 벤더 소유가 된다.

그래서 모델 목록보다 컨텍스트 엔지니어링 기능이 중요하다. TrueForge는 서브에이전트, 지연 도구 로딩(모든 프롬프트에 도구 정의를 넣는 대신 필요할 때 로드), 큰 결과 오프로딩, 컨텍스트 압축을 제공한다. 장시간 실행되는 에이전트가 자기 이력에 빠져 죽지 않게 하는 기법들이다. 사치가 아니다. TrueFoundry 벤치마크에서 같은 작업과 같은 모델을 기준으로 TrueForge 구성은 실행당 380만 토큰을 사용했고 Claude Managed Agents는 1,000만 토큰을 사용했다. 숫자에 소금을 한 꼬집 뿌려 받아들여도 방향은 맞다. 에이전트 비용의 상당 부분은 컨텍스트 낭비이고, 컨텍스트 처리는 하니스의 일이다. 그래서 나는 에이전트형 아키텍처에서 고객에게 어떤 모델을 쓰느냐보다 무엇이 모델을 감싸느냐가 더 흥미로운 질문이라고 말한다.

에이전트 하니스는 모델이 처리하지 못하는 프로덕션 문제인 세션, 도구 자격 증명, 샌드박스, 승인, 컨텍스트 증가를 맡는다. TrueFoundry 벤치마크에서 동일 작업 기준 TrueForge는 실행당 380만 토큰, Claude Managed Agents는 1,000만 토큰을 사용했으며, TrueFoundry는 차이를 컨텍스트 압축과 지연 도구 로딩의 결과라고 설명한다.

벤치마크, 조심해서 읽기

어디서나 보이는 헤드라인 숫자는 75%다. 뜯어보자. 사실은 두 숫자가 트렌치코트 하나를 같이 입고 있는 셈이다.

TrueFoundry는 모의 CRM, 이슈 추적, 문서 시스템을 아우르는 14개 작업 평가인 DevRev의 Enterprise-Bench를 사용했다. 같은 작업, 같은 도구, 같은 모델로 비교하면 다음과 같다.

  • Anthropic의 Opus 4.8을 실행한 TrueForge는 14개 중 약 11개 작업을 완료했고 실행당 평균 비용은 8.50달러였다.

  • 같은 Opus 4.8을 실행한 Claude Managed Agents도 비슷한 수의 작업을 완료했고 실행당 비용은 11.80달러였다.

  • Zhipu의 오픈 가중치 모델 GLM-5.2를 실행한 TrueForge도 다시 비슷한 수의 작업을 완료했고 실행당 비용은 2.90달러였다.

정직하게 분해하면 이렇다. 같은 모델에서 하니스 대 하니스 비교는 약 30% 절감이다. 대부분 관리형 서비스 마진과 위에서 말한 토큰 감소가 만든다. 75%로 뛰는 것은 모델도 Opus 4.8에서 GLM-5.2로 바꿨을 때다. 한 날카로운 분석이 지적했듯 이 비교는 한 번에 변수 두 개를 바꾼다. TrueForge 자체보다 오픈 모델이 얼마나 따라왔는지를 더 많이 보여준다. 어쩌면 그것이 TrueFoundry의 진짜 주장이다. 하니스가 중립이면 그 절감 효과를 자유롭게 가져갈 수 있다는 얘기다.

주의점은 두 가지 더 있다. 벤치마크는 TrueFoundry가 직접 수행했고 더 큰 프로덕션 워크로드에서 독립 검증되지 않았다. 그리고 14개 작업은 작은 표본이다. 작업 세 개의 흔들림만으로 좋은 주와 나쁜 주가 갈린다. 숫자는 감사된 값이 아니라 보고된 값으로 보자.

DevRev Enterprise-Bench 평가의 실행당 평균 비용 막대그래프. TrueForge와 Opus 4.8은 평균 8.50달러, Claude Managed Agents와 Opus 4.8은 11.80달러, TrueForge와 GLM-5.2는 2.90달러였고 세 구성 모두 14개 작업 중 약 11개를 완료했다.

같은 평가, 세 가지 구성. 30% 절감은 하니스 대 하니스 비교이고 75% 절감은 대부분 모델 교체에서 나온다. 벤더가 보고한 수치이며 저장소의 벤치마크 디렉터리에서 재현할 수 있다.

TrueFoundry가 DevRev Enterprise-Bench에서 직접 실행한 벤치마크에서 TrueForge와 Claude Managed Agents는 모두 14개 중 약 11개 작업을 완료했다. 같은 Opus 4.8 모델 기준 실행당 8.50달러 대 11.80달러로 약 30% 낮았고, GLM-5.2를 쓰면 실행당 2.90달러로 약 75% 낮았다. 발표에 따른 내용이다. 결과는 독립 검증되지 않았으며 75% 수치는 하니스와 모델을 동시에 바꾼다.

사업 모델은 라이선스와 다르다

런타임은 무료로 주고 그 아래 계층을 판다. 오픈소스 하니스는 완전하고 실제로 무료지만, TrueForge는 모든 모델 호출과 MCP 상호작용을 TrueFoundry의 AI Gateway로 라우팅하도록 설계돼 있다. 예산, 속도 제한, 가드레일, 접근 정책, 관찰 가능성이 있는 곳이 게이트웨이다. 이것이 상용 제품이고, Postgres를 직접 운영하고 싶지 않은 팀을 위한 사용량 기반 호스팅 등급도 있다.

비판하려는 말은 아니다. 좋은 오픈소스 인프라에서 흔히 보는 거래이고 Meta 출신 창업자들의 배경과도 어울린다. 창업자들의 주장은 플랫폼이 제대로 설계되면 통제와 편의가 반대말일 필요가 없다는 것이다. 하니스를 무료로 주는 것은 모든 사람의 에이전트 아래에 자사의 통제 계층을 놓는 방법이다. NetApp의 플랫폼 엔지니어링 수석 디렉터 Robert Rubin은 TrueFoundry를 “에이전트형 앱과 에이전트가 라우팅되는 IT의 중앙 플랫폼”이라고 표현했다. 회사가 정확히 차지하고 싶은 위치다. 구매자라면 어느 계층에 실제로 종속되는지 알 필요가 있다. 하니스는 포크할 수 있다. 게이트웨이는 구독이다.

경쟁군도 붐비고 있다. 범주가 실제라는 뜻이다. 독점 영역에는 Anthropic의 관리형 런타임, 프레임워크 쪽에는 LangChain의 Deep Agents, 아직 개발자 프리뷰인 DeepSeek 자체 MIT 라이선스 하니스, 그리고 일반적인 프로덕션 사용을 노리는 TrueForge가 있다. 세 대륙이 1년 안에 같은 소프트웨어 계층을 내놓는다면 그 계층은 구조를 받치고 있는 것이다.

TrueForge 자체는 MIT 라이선스로 무료지만 모델과 MCP 트래픽을 TrueFoundry의 상용 AI Gateway로 라우팅하도록 설계됐고, 그곳에서 예산 집행, 속도 제한, 관찰 가능성을 판매한다. 출시 당시 명시된 초기 사용자는 NetApp과 Automatiq다. 출시 보도에 따른 내용이다.

오픈 모델에 의미하는 것

서구권 보도에서 과소평가됐다고 생각하는 각도는 이것이다. 한 모델 계열에 묶인 관리형 런타임은 그 계열의 해자다. 중립 런타임은 평준화 장치다. TrueForge를 통과하는 모든 워크로드에서는 GLM-5.2, Qwen, DeepSeek, Kimi가 브랜드가 아니라 완료된 작업당 비용으로 이길 수 있다. 75%라는 숫자가 존재하는 이유는 중국 오픈 가중치 모델이 Opus 가격의 4분의 1 정도로 엔터프라이즈 작업을 끝냈기 때문이다. 1년 전만 해도 “싼 모델이 거의 같은 수의 작업을 완료했다”는 문장을 진지하게 쓰기 어려웠다.

이것은 내가 Hangzhou에서 한동안 보고 있던 패턴이다. 오픈 가중치 연구소가 모든 영역에서 최첨단을 이길 필요는 없다. 위 계층이 아래에 어떤 모델이 있는지 신경 쓰지 않을 만큼 가까워지면 된다. 중립 하니스가 바로 그 계층이고, 이제 거버넌스 이야기를 갖춘 오픈소스로 나왔다. 중국 오픈 모델이 실제 워크로드에 준비됐는지 판단 중이라면, 그 계산은 내가 고객과 쓰는 위험 프레임워크에 더 자세히 정리해 두었다. 짧게 말하면 “하니스가 그냥 또 하나의 엔드포인트로 취급한다”는 사실은 테스트하지 않을 핑계 하나를 없앤다.

지금 무엇을 해야 하나

에이전트를 만들거나 운영한다면 세 가지를 이 순서대로 하자.

  1. 오늘: 자신의 기계에서 npx @truefoundry/trueforge를 실행하고 모델 하나와 MCP 서버 하나를 연결하라. 로컬 모드는 SQLite 기반 단일 프로세스이므로 하니스가 실제로 무엇을 하는지 감을 잡는 가장 싼 방법 중 하나다. localhost 안에만 두라. 기본적으로 로그인이 없고 문서도 로컬 모드는 인터넷에 노출하는 구성이 아니라고 분명히 말한다.

  2. 이번 주: 이미 운영 중인 에이전트 워크로드 하나를 골라 토큰 비용과 완료율을 기록한 뒤 자신의 작업에서 벤치마크와 같은 형태로 재현해 보라. 저장소의 benchmark/ 디렉터리가 정확히 그 용도다. 중요한 숫자는 자신의 숫자뿐이다. 이 벤치마크를 포함해 벤더 벤치마크는 직접 다시 돌리기 전까지 마케팅이다.

  3. 이번 달: 관리형 런타임 가격을 내고 있다면 실제 청구액에 30% 하니스 단독 절감 가정을 대입해 보고, 별도로 같은 작업에서 오픈 모델이 품질 기준을 넘는지 시험하라. 서로 독립된 결정 두 개이고 스프레드시트도 두 개다. 아직 첫 스택을 고르는 초기 단계라면 어떤 런타임에도 먼저 묶이기 전에 구축 대 구매와 셀프 호스팅 트레이드오프부터 보라.

자주 묻는 질문

에이전트 하니스란 무엇인가?

언어 모델을 실제로 일하는 에이전트로 바꾸는 런타임 계층이다. 모델 주변에서 계획, 도구 호출, 결과 재입력, 반복 루프를 돌리고 모델이 스스로 할 수 없는 것을 맡는다. 세션 지속성, 도구 자격 증명, 샌드박스 실행, 사람 승인, 긴 작업에서 컨텍스트 창을 통제하는 일이 포함된다. TrueForge, Claude Managed Agents, LangChain의 Deep Agents는 모두 하니스이며 아래 모델은 정도의 차이는 있지만 교체할 수 있다.

TrueForge는 무료인가?

하니스 자체는 MIT 라이선스이며 상업적 사용을 포함해 무료다. 여전히 비용이 드는 것은 모델, 샌드박스 제공자(현재 Daytona), 자체 인프라다. TrueFoundry는 선택형 거버넌스 계층인 AI Gateway를 판매한다. 예산, 속도 제한, 감사, 관찰 가능성이 포함되며 셀프 호스팅하고 싶지 않은 팀을 위한 사용량 기반 호스팅 버전도 제공한다.

TrueForge와 Claude Managed Agents는 어떻게 다른가?

Claude Managed Agents는 Anthropic이 완전히 관리하고 Claude 토큰에 실행 중 세션 시간당 0.08달러를 추가로 청구하며 Claude 전용이다. TrueForge는 셀프 호스팅이 가능하고 TrueFoundry가 호스팅할 수도 있으며, 모델 중립적이고 런타임 자체는 무료다. TrueFoundry 자체 벤치마크에서는 같은 모델에서 작업 완료율을 맞추면서 약 30% 낮은 비용을 보였다. 대가는 직접 운영해야 할 부분이 더 많다는 것이고, 벤치마크도 독립기관이 아니라 벤더 자신이 수행했다.

TrueForge가 GLM이나 Qwen 같은 중국 오픈 모델을 사용할 수 있나?

그렇다. OpenAI 호환 엔드포인트라면 무엇이든 지원하며 출시 벤치마크의 대표 수치도 GLM-5.2와 조합해서 나왔다. 75% 비용 절감은 그 조합에서 나온다. 따라서 이 숫자는 하니스만큼이나 오픈 모델 가격에 관한 이야기다.

결론

TrueForge는 나온 지 한 달 된 제품이고 벤치마크도 자사 것이므로 지금 당장 급여 시스템을 연결할 사람은 없어야 한다. 하지만 형태는 맞다. 하니스는 스택의 독립 계층이 되고 있고, 그 계층에는 언젠가 오픈소스 중립 선택지가 나올 수밖에 없었다. 그리고 출시 계산에서 헤드라인 숫자를 만들기 위해 중국 오픈 모델에 기대고 있다는 사실은 에이전트 경제가 어디로 가는지 조용히 보여주는 신호다. 다음 분기에 비용 주장에 대한 독립 재현이 나오는지 보라. 그것이 단순한 출시와 실제 변화의 차이다.

자신의 에이전트 스택에서 하니스가 어디에 놓여야 하는지 고민하고 있다면, 나는 이런 주제를 고객과 정기적으로 논의한다. 연락해 달라.

출처

  • TrueFoundry, “TrueForge: Claude Managed Agents의 오픈소스 대안”: https://www.truefoundry.com/blog/engineering/trueforge-open-source-agent-harness/ (2026년 8월 18일 게시, 2026년 8월 29일 확인)

  • TrueFoundry, TrueForge 저장소: https://github.com/truefoundry/trueforge (2026년 8월 29일 확인)

  • TrueFoundry Docs, “TrueFoundry가 TrueForge 위에 추가하는 것”: https://www.truefoundry.com/docs/agent-platform/agent-harness/what-truefoundry-adds (2026년 8월 29일 확인)

  • VentureBeat, “TrueFoundry의 오픈소스 AI 에이전트 하니스 TrueForge, 작업 완료 비용 30%-75% 절감 주장”: https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents (2026년 8월 19일 게시, 2026년 8월 29일 확인)

  • InfoWorld, “TrueFoundry, 오픈소스 AI 에이전트 하니스 공개, 최대 75% 비용 절감 주장”: https://www.infoworld.com/article/4211969/truefoundry-debuts-open-source-ai-agent-harness-claiming-up-to-75-lower-costs.html (2026년 8월 20일 게시, 2026년 8월 29일 확인)

  • Superpower Daily, “TrueFoundry, 아래 계층을 팔기 위해 에이전트 런타임을 무료로 공개”: https://www.superpowerdaily.com/posts/truefoundry-gives-away-its-agent-runtime-to-sell-the-layer-beneath-it (2026년 8월 20일 게시, 2026년 8월 29일 확인)

  • Business Wire, “TrueFoundry, TrueForge 출시”(보도자료): https://finance.yahoo.com/technology/ai/articles/truefoundry-launches-trueforge-open-source-120000790.html (2026년 8월 19일 게시, 2026년 8월 29일 확인)

계속 읽기

Agent Field Notes

다음 호를 받아보세요

에이전트 하네스, 런타임, 보안, 거버넌스를 실제 운영 담당자를 위해 설명합니다.

이와 같은 결정을 앞두고 계신가요?

에이전트 시스템에 대한 중요한 결정을 내리는 팀을 위해 아키텍처 검토, 거버넌스 평가, 버전 고정 프레임워크 평가를 수행합니다.

저자 소개

Adam Maguire Wilson

창립자 겸 AI 에이전트 시스템 독립 자문가

adam.mw