DeepSeek Harness는 Claude Code 킬러가 아니다. 그보다 더 흥미로운 존재다.
DeepSeek의 오픈 소스 에이전트 하네스가 출시 첫 주에 GitHub 스타 168,000개를 돌파했다. 직접 설치하고, 저장소를 읽고, 실행해 봤다. 무엇이 실제로 확인되는지 정리했다.

DeepSeek Harness는 Claude Code 킬러가 아니다. 그보다 더 흥미로운 존재다.
README는 한 줄 설치를 약속한다. npx @deepseek-ai/dsh web을 입력하면 바로 시작이다. 내 컴퓨터에서는 그 한 줄이 16분 걸렸고, npx 캐시에 수백 개의 패키지를 끌어왔으며, 다음에 실행했을 때 재해석(resolve)에 또 10분이 걸렸다. 이걸 DeepSeek 탓으로 돌리지는 않는다. 이 이야기를 꺼내는 이유는, 한 줄짜리 약속과 16분짜리 현실 사이의 간극이야말로 DeepSeek Harness 전체 이야기의 축소판이기 때문이다. 8월 13일에 출시된 이 도구는 정말로 흥미롭고, 정말로 거칠며, 널리 오해받고 있다.
오해는 이렇게 생겼다. DeepSeek가 Claude Code 경쟁작을 만들었다는 것이다. 대부분의 출시 보도가 집어든 프레임이고, 그 이유는 이해한다. 겉모습도 그렇고, 움직임도 그렇고, 일부는 문자 그대로 그런 도구로 작성됐다. 하지만 틀린 프레임이다. 일주일 동안 저장소를 읽고, 직접 실행하고, 다른 사람들이 이 도구에 대해 내세운 주장들을 확인해 본 뒤 내린 결론은, 진짜 이야기는 한 단계 위에 있다는 것이다.
핵심 요약
DeepSeek Harness(dsh)는 MIT 라이선스의 에이전틱 코딩 하네스로, 2026년 8월 13일 개발자 프리뷰로 공개됐다. 첫 주에 GitHub 스타 168,000개와 npm 다운로드 552,000건을 넘겼다."모든 것이 플러그인"이라는 주장은 문자 그대로 사실이다. 모델 어댑터, 도구, 에이전트 루프 자체가 모두 교체 가능하며, AI 밖에서 4년간 프로덕션 이력을 쌓은 프레임워크 위에 만들어졌다.토큰을 많이 쓴다는 지적은 사실이며 여러 검증으로 뒷받침된다. 다만 99%에 가까운 캐시 적중률이 청구서를 누그러뜨린다. 일상 도구가 아니라 만지작거려 보는 프리뷰로 대하라.전략적 움직임이 도구 자체보다 더 중요하다. 모델 연구소가 하네스 계층을 공짜로 풀고 있으며, 이는 Claude Code의 기능 목록이 아니라 구독형 하네스라는 비즈니스 모델을 겨냥한 한 수다.
시작하기 전에 방법론부터 밝혀 둔다. 아래의 저장소, 설치, 실행에 관한 내용은 모두 이번 주에 직접 확인한 것이다. 다른 사람의 테스트에 의존하는 부분에서는 그렇다고 밝히고 이름을 댄다.
DeepSeek가 실제로 내놓은 것은 무엇인가?
2026년 8월 20일 기준으로 저장소는 생긴 지 일주일이며 스타 168,325개에 올라 있고, npm 패키지는 8월 12~18일 주간에 552,210회 다운로드됐다. 자체 문서가 예고 없이 호환성을 깰 것이라 경고하는 개발자 프리뷰치고는 큰 숫자다. 그것으로 살 수 있는 것은 로컬 에이전트 하네스다. dsh web을 실행하면 3080번 포트에서 브라우저 인터페이스가 열리고, 워크스페이스를 지정하고, 모델과 모드를 고른 뒤 일을 시키면 된다.
내가 가장 의미심장하다고 보는 세부 사항은 내부에 있다. 이것은 API를 얇게 감싼 래퍼가 아니다. 소스에서 빌드한 내 체크아웃에는 워크스페이스 패키지 226개, read-only부터 danger-full-access까지의 샌드박스 모드를 갖춘 권한 시스템, 그리고 네 가지 에이전트 프리셋이 있다. Standard는 완전한 코딩 에이전트이고, PTC는 모델이 프로그램 하나를 작성해 실행하게 하며, Minimal은 도구 두 개만 싣고, 자가 확장형 Creator 모드에는 이를 셸 접근으로 취급하라는 헤더 주석이 달려 있다.
가장 놀라운 점은 따로 있다. 공식 플러그인 패키지가 하네스로 하여금 Claude Code와 Codex를 하위 에이전트로 호출하게 해 준다는 것이다. DeepSeek의 하네스는 기꺼이 하위 작업을 소위 경쟁사들에게 위임한다. 그리고 모든 세션은 전체 시스템 프롬프트, 모든 도구 호출, 모든 토큰 수를 기록하는 추가 전용 로그에 기록된다. 내 테스트 실행은 열 단계짜리 작업에서 250개의 이벤트를 남겼고, 전부 사후에 검사할 수 있었다.
실용적인 경고 하나. 5월에 출시된 프로토콜 어댑터로, 역시 deepseek-harness라는 이름의 무관한 서드파티 프로젝트가 있다. 찾아볼 때는 deepseek-ai 조직의 것을 찾아야 한다. 다른 하나는 악의적인 것은 아니고 그냥 헷갈리는 이름일 뿐이다.
DeepSeek Harness는 2026년 8월 13일 개발자 프리뷰로 공개된 MIT 라이선스 에이전틱 코딩 하네스다. GitHub 저장소는 일주일 만에 스타 168,000개를 넘겼고, 이 도구는 Claude Code와 Codex와 경쟁만 하는 것이 아니라 둘을 하위 에이전트로 오케스트레이션할 수 있다.
이 프레임워크는 챗봇 생태계에서 왔다
영어권 보도가 거의 놓친 부분이 여기 있다. DeepSeek는 하네스의 플러그인 아키텍처를 처음부터 만들지 않았다. 2022년부터 수천 개의 커뮤니티 플러그인을 가진 챗봇 프레임워크 Koishi 아래에서 프로덕션 환경에 있던 MIT 라이선스 TypeScript 플러그인 프레임워크 Cordis 위에 만들어졌다. Cordis의 창시자인 Yifan Shi는 출시와 함께 DeepSeek가 공개한 논문의 제1저자이며, 저자 소속란에는 베이징대학이 올라 있다. 논문은 자체 호스팅 프리프린트로, 88페이지이며, 정직하게도 초안(draft)이라고 표기돼 있다. Cordis 저장소 자체는 내가 8월 20일에 확인했을 때 스타 6,465개였다.
논문이 형식화한 아이디어는 '시공간적 합성성(spatiotemporal composability)'이라는 어려운 이름을 갖고 있지만, 의미는 단순하다. 시간적: 시스템의 어느 부분이든 런타임에 언로드할 수 있고, 그 부분이 한 일은 깨끗하게 되돌려진다. 공간적: 각 부분은 무엇에 의존하는지 선언하고, 그 의존성이 오고 가는 것에 맞춰 깨어나거나 종료된다. 논문은 로드와 언로드의 순서가 결과에 영향을 주지 않으며, 시스템이 순서와 무관하게 같은 상태로 수렴함을 증명한다. 이미 해결된 문제처럼 들린다면, 그렇지 않다. 논문이 동기로 든 통계는, 가장 인기 있는 VSCode 확장 100개 중 87개가 에디터를 재시작하지 않고는 언로드할 수 없다는 것이다.
"모든 것이 플러그인"이 마케팅인지 메커니즘인지 알고 싶어서 해석된(resolved) 설정을 통째로 덤프해 봤다. 메커니즘이었다. 기본 웹 프로필은 24개의 YAML 패치 계층에 걸쳐 135개의 플러그인 행을 합성하며, 각각에는 어느 패키지가 기여했는지 주석이 달려 있다. 모델 어댑터, 도구 레지스트리, 세션 로그, 에이전트 루프. 전부 플러그인이고, 전부 되돌릴 수 있다. 저장소는 또한 CI에서 모든 소스 파일에 100% 테스트 커버리지를 요구하는데, 일주일 된 프리뷰치고는 우스울 정도로 엄격한 기준이다.
DeepSeek Harness는 Koishi 챗봇 생태계에서 2022년부터 프로덕션에 있던 플러그인 프레임워크 Cordis 위에서 동작하며, 베이징대학과 DeepSeek의 88페이지 프리프린트로 형식화됐다. 핵심 보장은 이것이다. 어떤 컴포넌트든 런타임에 로드하거나 언로드할 수 있고, 시스템은 순서와 무관하게 같은 상태로 수렴한다.
경쟁사의 도구로 만들어졌다
이제 어색하고 재미있는 부분이다. 코드 포렌식 글(winzheng.com, 단일 출처지만 스크립트를 재현할 수 있다고 주장한다)이 커밋 이력을 훑어서, 처음 12,293개 커밋 중 1,760개가 codex/ 브랜치 접두사를 달고 있고, 열한 번째 커밋 제목이 "fix issues found in the second round of Codex review"이며, AGENTS.md를 가리키는 CLAUDE.md 심볼릭 링크가 첫 커밋부터 존재했다는 사실을 찾아냈다. 쉽게 말해 DeepSeek 팀은 OpenAI의 Codex와 Anthropic의 Claude Code를 루프 안에 넣고 하네스를 대대적으로 만들었다.
나는 이걸 스캔들이 아니라 유쾌한 일로 분류하고 싶다. 내가 아는 진지한 엔지니어링 팀은 이제 전부 이런 도구로 만들고 있고, DeepSeek도 분명 그렇다. 같은 보고서는 더 자극적인 소문, 즉 하네스가 유출된 Claude Code 소스에서 따온 것이라는 이야기도 확인했는데, 문자열이 전혀 겹치지 않는다는 결론을 내렸다. 그 소문이 한바탕 돌았기 때문에 말할 가치가 있다. 포렌식이 실제로 보여 주는 것은 소문보다 더 흥미롭다. 모델은 상품이고 그 주변의 루프가 제품이라는 연구소의 확신이, 자사 소프트웨어를 만드는 방식에까지 미치고 있다는 것이다.
정직함을 위한 노트 하나 더. 이 하네스는 영어권 보도가 언급하지 않은 부분에서 중국어 우선이다. 프리셋 메타데이터 파일은 중국어로 먼저 작성됐고, 출하된 UI 문자열 일부는 중국어로만 돼 있다. DeepSeek가 초기 채택자로 누구를 기대하는지 보여 주는 작고 구체적인 신호를 찾는다면, 바로 그것이다.
직접 실행해 봤다
하네스에 대한 글만 읽어서는 한계가 있으니, 실제 작업을 돌려 봤다. DeepSeek API 키 대신 7개 이상 연구소의 16개 모델 카탈로그로 라우팅되는 OpenCode Go 구독 키를 썼다. 그 선택은 우연이었지만 전체 테스트에서 가장 교훈적인 부분이 됐다. DeepSeek 자체 API 근처에도 가지 않고 DeepSeek의 V4 Flash 모델에서 DeepSeek의 하네스를 실행한 것이다. 아키텍처가 약속하는 프로바이더 교체는 이론이 아니다. YAML 파일 하나와 환경 변수 하나다.
작업은 이랬다. 항저우, 런던, 뉴욕의 현재 시각을 보여 주는 단일 페이지 사이트를 만들고 검증하기. 실행은 2분 8초, 10단계, 9번의 도구 호출이 걸렸고, 입력의 91%를 캐시에서 제공받은 채 약 108,000토큰을 태웠다. 에이전트는 환경을 탐색하고, 페이지를 작성하고, 자기 JavaScript를 추출해 node로 문법 검사를 하고, 자기 검증 스크립트의 반올림 버그를 잡아내고, 고치고, 검사를 다시 실행했다. 나는 그 뒤 출력을 독립적으로 검증했다. 런던이 현재 영국 서머타임이고 뉴욕이 EDT라는 사실을 포함해 시간대 계산이 정확했다. 작은 작업, 정확한 결과, 완전한 로그.
거친 면도 실재한다. 소스 체크아웃에서 실행하면 문서에 없는 방식으로 작업 디렉터리에 민감하다. 헤드리스 모드는 토큰 요약을 출력하지 않아서 세션 로그에서 손으로 숫자를 계산해야 했다. 그리고 시스템 프롬프트는 모델에게 자신이 deepseek-v4-flash라고 알려 줬는데, 내가 설정한 라우트 이름이 그래서다. 누군가 다른 모델을 프록시해서 에이전트가 잘못된 정체성을 갖기 전까지는 괜찮다. 전부 프리뷰 수준의 문제들이다.
2026년 8월 20일 직접 수행한 테스트에서 DeepSeek Harness는 검증된 단일 페이지 빌드를 10단계에 걸쳐 2분 8초 만에 완료했다. DeepSeek 자체 API가 아닌 서드파티 OpenCode Go 모델 키를 통해 실행됐으며, 약 108,000토큰을 사용하고 캐시 읽기 비율은 91%였다.
정직한 청구서
하네스에 대한 가장 강한 비판은 토큰을 태운다는 것이고, 그 비판은 유효하다. Julian Goldie의 AI Success Lab은 출시 주간에 같은 원페이지 사이트를 Claude Code와 비교 측정했다. DeepSeek 스택은 Claude Code의 48,000토큰에 대해 약 483,000토큰을 썼지만, 완료 시간은 Claude Code의 30분 이상에 비해 11분이었고 비용은 대략 5센트였다. 코드 리뷰 작업에 대한 한 Reddit 사용자의 나란히 비교도 같은 모양을 발견했고, 그는 후속 글에서 dsh 설정을 전혀 튜닝하지 않았다고 인정했다.
|
테스트 |
토큰 |
시간 |
비고 |
|---|---|---|---|
|
원페이지 사이트, dsh + V4 Pro (AI Success Lab) |
~483,000 |
11분 |
~$0.05, 캐시 비중 높음 |
|
원페이지 사이트, Claude Code(동일 작업) |
~48,000 |
30분 이상 |
품질 점수 더 높음, 9/10 대 7/10 |
|
코드 리뷰, dsh 무보정 (Reddit) |
500,000 |
n/a |
캐시 적중률 70% |
|
코드 리뷰, OpenCode(동일 작업) |
~70,000 |
n/a |
캐시 적중률 95% |
|
시계 빌드, 내 실행(8월 20일) |
~108,000 |
2분 8초 |
캐시 읽기 91%, 출력 검증 완료 |
경제성을 구해 주는 것은 캐시다. 2주간의 클로즈드 베타 접근권을 가졌던 중국 매체 QbitAI의 테스터들은 약 99%의 캐시 적중률을 측정했고, 내 실행도 91%였다. 캐시된 입력은 거의 공짜이므로, 무서운 토큰 숫자는 작은 청구서로 바뀐다.
신뢰성은 더 연약한 배꼽이다. AtlasCloud가 ISS 추적기 빌드를 세 번 다시 실행했다(참고: 벤더 블로그이며 자사 호스팅 엔드포인트를 대상으로 실행했다). 세 번 중 두 번에서 하네스는 "Done"을 출력했지만 브라우저의 페이지는 실제로는 망가져 있었다. 내 시계 작업은 깨끗하게 검증됐지만, 내 시계 작업은 하찮은 것이기도 했다. 데모는 데모로 취급하라.
DeepSeek Harness는 토큰을 많이 쓰지만 캐시 비중이 크다. 2026년 8월의 독립 테스트들은 동일 작업에서 Claude Code의 대략 10배에 달하는 토큰 소비를 보여 주지만, 99%에 가까운 캐시 적중률과 백만 캐시 입력 토큰당 $0.007~$0.014라는 DeepSeek 공식 가격이 이를 상쇄한다.
DeepSeek Harness 비용은 얼마인가?
가격에는 날짜 표시가 필요하다. 출시 주간 보도 상당수가 이미 틀렸기 때문이다. 8월 16일, DeepSeek는 API를 피크/오프피크 가격제로 옮겼다. 8월 20일 기준 공식 가격 페이지는 V4 Flash를 시간대에 따라 백만 입력 토큰당 $0.22~$0.44, 백만 출력 토큰당 $0.66~$1.32로 표시하고 있으며, 캐시 적중은 $0.007~$0.014다. Pro는 그 세 배다. 어떤 리뷰가 고정 $0.14 가격을 말한다면, 그것은 6월의 이야기다. 이 숫자들이 왜 낮게 유지되는지에 대한 긴 버전은 중국의 AI 가격 전쟁이 작동하는 방식에 있다.
두 모델 사이에서 초기 합의는 내 직감과 일치한다. 일상 작업에는 Flash, 문제가 정말 어려울 때는 Pro다. 다른 후보들과 저울질하고 있다면, Qwen vs DeepSeek vs Llama에 계속 갱신 중인 비교를 올려 두고 있다.
DeepSeek Harness는 실행해도 안전한가?
언제나처럼 배포 전제부터 밝히자. 하네스는 로컬에서 실행되고 모델 라우트는 당신이 고르기 때문에, 데이터 상주 문제는 하네스 자체가 아니라 어떤 프로바이더를 가리키느냐의 문제다. 내 테스트는 프롬프트를 DeepSeek가 아닌 OpenCode Go의 서버로 보냈다. 진짜 주의 사항 두 가지가 남는다. 저장소의 메모는 기본으로 비활성화돼 있지만 활성화하면 마스킹 규칙 없이 전송되는 텔레메트리를 설명한다. 그리고 플러그인은 당신의 권한으로 인프로세스로 실행되므로, 플러그인 생태계는 공급망 문제다. 애초에 DeepSeek가 기업용으로 안전한가와 같은 모양의 문제다. 아직 독립적인 보안 감사를 한 사람은 없다.
이 움직임이 의미하는 것
출시를 위한 DeepSeek의 제품 페이지는 이번 명제를 네 단어로 적고 있다. Agent equals Model plus Harness(에이전트는 모델 더하기 하네스다). 모델은 토큰을 예측하고, 하네스는 어떤 도구를 갖는지, 언제 멈추는지, 무엇을 기억하는지를 결정한다. VentureBeat의 출시 보도는 날카로운 프레이밍을 했다. 프론티어 모델의 능력이 수렴하면, 에이전트가 워크플로 전체에서 어떻게 추론하고 상태를 유지하는지를 통제하는 계층이 모델 자체보다 훨씬 교체하기 어려워진다. 그렇다면 연구소가 왜 그 계층을 MIT로 공짜로 푸는가 하는 질문이 생긴다.
비싼 것을 공짜로 푸는 것이 DeepSeek가 하는 일이기 때문이다. 오픈 웨이트로 모델 계층에 그렇게 했고, 중국 오픈 웨이트 생태계 필드 가이드가 그 이야기의 긴 버전이다. 하네스는 한 단계 위로 박힌 같은 쐐기다. 그리고 한 소스 코드 리뷰어가 인용한 36Kr 논평은 조용한 부분을 노골적으로 말했다. 이것은 Claude Code의 기능 목록을 겨냥한 것이 아니라, 유료 제품으로서의 하네스를 겨냥한 것이라고. 이 베팅이 통할지는 DeepSeek가 통제할 수 없는 무언가, 즉 낯선 사람들이 실제로 플러그인을 만들지에 달려 있다. 내가 지켜볼 숫자는 스타가 아니라 그것이다.
그러니 써 봐야 할까? 만지작거리는 걸 좋아한다면, 그렇다. 설치는 무겁지만 소스 빌드는 깔끔하고, 이렇게 규율 잡힌 코드베이스를 읽는 데는 진짜 즐거움이 있다. 모델을 자체 호스팅하거나 규모의 비용이 중요하다면, 그렇다. 프로바이더 설정이 이번 연습의 요점이다. 안정적인 일상 도구가 필요하다면, 아니다. 저장소는 파괴적 변경을 문서로 약속했고, 그 말을 지킬 것이다.
DeepSeek Harness는 단순한 도구가 아니라 전략적 출시다. 하네스 계층에 MIT 라이선스를 적용하고 "Agent = Model + Harness"를 선언함으로써, DeepSeek는 하네스가 상품이어야 한다고 주장하고 있다. 오픈 웨이트로 모델 계층에 박았던 것과 같은 쐐기다.
자주 묻는 질문
셸 접근 권한이 있는 DeepSeek Harness를 실행해도 안전한가?
하네스는 로컬에서 실행되므로 질문은 둘로 갈라진다. 프롬프트는 당신이 설정한 모델 프로바이더로 가고, 내장 샌드박스는 읽기 전용에서 시작해 그 위에 워크스페이스 쓰기와 전체 접근 모드가 있다. 더 날카로운 위험은 플러그인이다. 당신의 권한으로 인프로세스로 실행되며, 일주일 된 플러그인 생태계에는 아직 독립 감사가 없다.
DeepSeek Harness가 정말로 Claude Code와 Codex를 호출할 수 있는가?
그렇다. 그리고 이것은 보도의 주장이 아니라 저장소에서 확인된다. subagent-claude-code와 subagent-codex라는 선택적 플러그인 패키지가 공식 Claude Agent SDK와 Codex의 app-server를 구동한다. 그 도구들이 설치되고 인증돼 있어야 하는 건 여전하다. 하네스는 구독이 아니라 오케스트레이션을 제공한다.
DeepSeek Harness에는 Flash와 Pro 중 무엇을 써야 하는가?
대부분의 작업에는 Flash다. 초기 독립 테스트는 어느 쪽이든 동일 작업에서 Claude Code의 대략 10배 토큰 사용량을 보여 주므로, 경제성이 성립하는 곳은 더 싼 모델이다. 2026년 8월 20일 기준 DeepSeek 공식 가격은 Flash 출력을 Pro 가격의 3분의 1로 책정했다. 추가 추론이 정말로 필요한 문제를 위해 Pro를 아껴 두라.
결론
DeepSeek Harness는 거칠고, 규율 잡혔고, 진정으로 새로운 공학의 산물인데, 대부분의 출시 보도는 그것을 틀린 것으로 묘사했다. Claude Code를 능가하려는 것이 아니다. 모델 위의 계층은 무료여야 한다고 선언하는 모델 연구소의 선언이며, 그 선언을 4년 된 챗봇 프레임워크 부품과 경쟁사의 코딩 도구로 만들어냈다. 그 선언이 자리 잡을지는 플러그인 저자들에게 달렸고, 판단까지는 몇 달이 걸릴 것이다. 그동안 이것은 내가 올해 한 설치 중 가장 교훈적인 16분짜리 설치다.
중국 모델이나 에이전트 도구를 실제 프로젝트에 두고 저울질하고 있다면, 문의해 주세요.
출처 (모두 2026-08-20에 확인):
- DeepSeek AI, deepseek-harness 저장소, GitHub, 2026년 8월 13일 생성.
- DeepSeek, Harness 제품 페이지.
- DeepSeek AI, API 가격 및 API 업데이트 로그.
- Shi, Zhang and Cui, A Programming Paradigm for Spatiotemporal Composability, 2026년 8월 13일 프리프린트 초안; Cordis 저장소.
- VentureBeat, DeepSeek Harness, Claude Code의 오픈 소스 경쟁작으로 출시, 2026년 8월 14일.
- MindStudio, DeepSeek Harness 실사용 후기, 2026년 8월.
- Data Science in Your Pocket (Medium), DeepSeek Harness란 무엇인가?, 2026년 8월.
- QbitAI, DeepSeek Harness 실사용 리뷰, 2026년 8월 14일 (중국어; 36Kr에 전재됨).
- AtlasCloud, DeepSeek Harness 리뷰: ISS 추적기 세 번 재실행, 2026년 8월 18일 (벤더 블로그; 자사 엔드포인트 대상 실행).
- AI Success Lab (Julian Goldie), DeepSeek Harness vs Claude Code 실측, 2026년 출시 주간 (페이지에 날짜 표시 없음).
- winzheng.com, DeepSeek Harness 코드 포렌식, ~2026년 8월 16일 (페이지에 날짜 표시 없음).
- justin3go, DeepSeek Harness 소스 코드 리뷰, 2026년 8월 15일.
- OpenCode, Go 구독 문서.
- Hacker News 토론, 2026년 8월 13일; r/LocalLLaMA 출시 스레드 및 토큰 A/B 댓글.