Ir para o conteúdo
Arquivo
Por Harness the Agents

DeepSeek Harness não é um matador do Claude Code. É algo mais interessante.

O harness de agentes open-source da DeepSeek passou de 168,000 estrelas no GitHub na primeira semana. Eu o instalei, li o repositório e o executei. Aqui está o que se sustenta.

The DeepSeek Harness wordmark beside the DeepSeek whale logo, in blue on a white background with faint circuit-board traces.

DeepSeek Harness não é um matador do Claude Code. É algo mais interessante.

O README promete uma instalação em uma linha. Digite npx @deepseek-ai/dsh web e pronto. Na minha máquina, essa única linha levou dezesseis minutos, puxou centenas de pacotes para o cache do npx e levou mais dez minutos para resolver tudo de novo na próxima vez que o executei. Não culpo a DeepSeek por isso. Menciono porque a distância entre a promessa de uma linha e a realidade de dezesseis minutos é a história inteira do DeepSeek Harness em miniatura. O que foi lançado em 13 de agosto é genuinamente interessante, genuinamente cru e amplamente mal interpretado.

A má interpretação é a seguinte: a DeepSeek construiu um concorrente do Claude Code. É o enquadramento que a maior parte da cobertura do lançamento adotou, e eu entendo o motivo. Parece um, anda como um, e partes dele foram literalmente escritas por um. Mas é o enquadramento errado e, depois de uma semana lendo o repositório, executando a ferramenta e verificando as alegações que outras pessoas fizeram sobre ela, acho que a história real está uma camada acima.

Principais conclusões

DeepSeek Harness (dsh) é um harness de programação agêntica sob licença MIT, em prévia para desenvolvedores, lançado em 13 de agosto de 2026. Passou de 168,000 estrelas no GitHub e 552,000 downloads no npm na primeira semana.Sua alegação de que "tudo é um plugin" é literalmente verdade. O adaptador de modelo, as ferramentas e o próprio loop do agente são todos substituíveis, construídos sobre um framework com quatro anos de história em produção fora da IA.A fome por tokens é real e corroborada, mas taxas de acerto de cache próximas de 99% suavizam a conta. Trate-o como uma prévia para quem gosta de mexer nas coisas, não como ferramenta de uso diário.O movimento estratégico importa mais do que a ferramenta: um laboratório de modelos está dando de graça a camada do harness, e isso é um tiro no modelo de negócio do harness como assinatura, não na lista de recursos do Claude Code.

Uma nota sobre método antes de começarmos. Tudo abaixo sobre o repositório, a instalação e a execução é em primeira mão, desta semana. Onde dependo de testes de outras pessoas, eu digo isso e as nomeio.

O que a DeepSeek realmente lançou?

Até 20 de agosto de 2026, o repositório tem uma semana de vida, está com 168,325 estrelas, e o pacote npm foi baixado 552,210 vezes na semana de 12 a 18 de agosto. São números grandes para uma prévia de desenvolvedor que a própria documentação avisa que quebrará compatibilidade sem aviso prévio. O que eles compraram é um harness de agentes local: você executa dsh web, uma interface de navegador abre na porta 3080, você a aponta para um workspace, escolhe um modelo e um modo, e deixa trabalhar.

O detalhe que acho mais revelador é o que está dentro. Isso não é um invólucro fino em volta de uma API. O checkout que compilei a partir do código-fonte tem 226 pacotes de workspace, um sistema de permissões com modos de sandbox que vão de read-only a danger-full-access, e quatro presets de agente. Standard é o agente de código completo, PTC faz o modelo escrever um programa e executá-lo, Minimal vem com duas ferramentas, e o modo Creator, autoextensível, traz um comentário de cabeçalho dizendo para tratá-lo como acesso ao shell.

O mais notável de tudo: pacotes oficiais de plugins permitem que o harness chame Claude Code e Codex como subagentes. O harness da DeepSeek delega alegremente uma subtarefa aos seus supostos rivais. E cada sessão é gravada em um log de anexação contínua que registra o system prompt completo, cada chamada de ferramenta e cada contagem de tokens. Meu próprio teste produziu 250 eventos para uma tarefa de dez passos, tudo inspecionável depois.

Um aviso prático. Existe um projeto de terceiros sem relação, também chamado deepseek-harness, um adaptador de protocolo lançado em maio. Se você for procurar, o que você quer é a organização deepseek-ai. O outro não é malicioso, só tem um nome confuso.

DeepSeek Harness é um harness de programação agêntica sob licença MIT, lançado em prévia para desenvolvedores em 13 de agosto de 2026. O repositório no GitHub passou de 168,000 estrelas em uma semana, e a ferramenta consegue orquestrar Claude Code e Codex como subagentes, em vez de apenas competir com eles.

O framework veio de um ecossistema de chatbot

Aqui está a parte que quase nenhuma cobertura em inglês percebeu. A DeepSeek não construiu a arquitetura de plugins do harness do zero. Ela é construída sobre o Cordis, um framework de plugins em TypeScript sob licença MIT que está em produção desde 2022 por baixo do Koishi, um framework de chatbot com milhares de plugins da comunidade. O criador do Cordis, Yifan Shi, é o primeiro autor de o artigo que a DeepSeek publicou junto com o lançamento, com afiliação à Universidade de Pequim na assinatura. O artigo é um preprint auto-hospedado, 88 páginas, honestamente rotulado como rascunho. O repositório do Cordis em si tinha 6,465 estrelas quando verifiquei em 20 de agosto.

A ideia que ele formaliza tem um nome intimidador, componibilidade espaço-temporal, e um significado simples. Temporal: qualquer parte do sistema pode ser descarregada em tempo de execução, e tudo o que ela fez é desfeito de forma limpa. Espacial: as partes declaram do que dependem e acordam ou desligam conforme essas dependências vêm e vão. O artigo prova que a ordem em que você carrega e descarrega as coisas não importa; o sistema converge para o mesmo estado de qualquer jeito. Se isso soa como um problema resolvido, não é. A estatística que motiva o artigo é que 87 das 100 extensões mais populares do VSCode não podem ser descarregadas sem reiniciar o editor.

Eu queria saber se "tudo é um plugin" era marketing ou mecanismo, então despejei a configuração resolvida. É mecanismo. O perfil web padrão compõe 135 linhas de plugins em 24 camadas de patches YAML, cada uma anotada com qual pacote a contribuiu. O adaptador de modelo, o registro de ferramentas, o log de sessão, o loop do agente: tudo plugins, tudo reversível. O repositório também exige 100% de cobertura de testes em CI para cada arquivo-fonte, o que é uma régua quase comicamente rigorosa para uma prévia de uma semana.

DeepSeek Harness roda sobre o Cordis, um framework de plugins em produção desde 2022 no ecossistema do chatbot Koishi, formalizado em um preprint de 88 páginas da Universidade de Pequim e da DeepSeek. Sua garantia central: qualquer componente pode ser carregado ou descarregado em tempo de execução e o sistema converge para o mesmo estado, independentemente da ordem.

Foi construído com as ferramentas dos rivais

Agora a parte constrangedora e engraçada. Uma análise forense de código (winzheng.com, uma fonte única, embora afirme que seus scripts são reproduzíveis) percorreu o histórico de commits e descobriu que 1,760 dos primeiros 12,293 commits carregam o prefixo de branch codex/, que o décimo primeiro commit se intitula "fix issues found in the second round of Codex review", e que um symlink CLAUDE.md apontando para AGENTS.md existia desde o primeiro commit. Em termos simples: a equipe da DeepSeek construiu o harness com o Codex da OpenAI e o Claude Code da Anthropic pesadamente no loop.

Eu arquivaria isso como encantador, não como escandaloso. Toda equipe séria de engenharia que conheço hoje constrói com essas ferramentas, e a DeepSeek claramente também constrói. O mesmo relatório também verificou o rumor mais apimentado, de que o harness teria sido copiado de código-fonte vazado do Claude Code, e não encontrou sobreposição de strings alguma. Vale dizer, porque esse rumor circulou bastante. O que a forense realmente mostra é mais interessante do que o rumor: a convicção do laboratório de que o modelo é a commodity e o loop ao redor dele é o produto se estende a como ele constrói seu próprio software.

Mais uma nota de honestidade. O harness é voltado primeiro ao público chinês em aspectos que a cobertura em inglês não mencionou. Os arquivos de metadados dos presets são escritos primeiro em chinês, e algumas strings da interface distribuída existem apenas em chinês. Se você quer um sinal pequeno e concreto de quem a DeepSeek espera que sejam seus primeiros adotantes, é esse.

Eu mesmo o executei

Ler sobre um harness só leva até certo ponto, então executei uma tarefa real. Em vez de uma chave de API da DeepSeek, usei uma chave de assinatura do OpenCode Go, que roteia por um catálogo de dezesseis modelos de sete ou mais laboratórios. Essa escolha foi acidental e acabou sendo a parte mais instrutiva do teste inteiro: executei o harness da DeepSeek no modelo V4 Flash da DeepSeek sem chegar perto da API da própria DeepSeek. A troca de provedor que a arquitetura promete não é teórica. É um arquivo YAML e uma variável de ambiente.

A tarefa: construir um site de página única mostrando relógios ao vivo para Hangzhou, Londres e Nova York, e depois verificá-lo. A execução levou 2 minutos e 8 segundos, 10 passos e 9 chamadas de ferramenta, queimando cerca de 108,000 tokens com 91% da entrada servida a partir do cache. O agente sondou o ambiente, escreveu a página, extraiu o próprio JavaScript e verificou a sintaxe com o node, pegou um bug de arredondamento no próprio script de verificação, corrigiu e rodou a checagem de novo. Depois verifiquei a saída de forma independente: a matemática de fuso horário estava certa, incluindo o fato de que Londres está atualmente no horário de verão britânico e Nova York em EDT. Tarefa pequena, resultado correto, log completo.

As arestas brutas também são reais. Lançar a partir de um checkout do código-fonte é frágil em relação ao seu diretório de trabalho de formas que a documentação não menciona. O modo headless não imprime resumo de tokens; calculei os números à mão a partir do log de sessão. E o system prompt disse ao modelo que ele era deepseek-v4-flash porque esse era o nome da minha rota configurada, o que é aceitável até alguém redirecionar um modelo diferente e o agente desenvolver um falso senso de identidade. Coisa de prévia, tudo isso.

Em um teste em primeira mão em 20 de agosto de 2026, o DeepSeek Harness completou uma construção verificada de página única em 2 minutos e 8 segundos ao longo de 10 passos, usando cerca de 108,000 tokens com uma taxa de leitura de cache de 91%, rodando através de uma chave de modelo do OpenCode Go, de terceiros, em vez da API da própria DeepSeek.

A conta honesta

A crítica mais forte ao harness é que ele queima tokens, e a crítica se sustenta. O AI Success Lab de Julian Goldie o cronometrou contra o Claude Code no mesmo site de uma página na semana de lançamento: a pilha da DeepSeek usou cerca de 483,000 tokens contra 48,000 do Claude Code, embora tenha terminado em 11 minutos contra mais de 30 do Claude Code e custado aproximadamente cinco centavos. Um comparativo lado a lado de um usuário do Reddit em tarefas de revisão de código encontrou o mesmo formato, e o acompanhamento dele admite que ele não tinha ajustado a configuração do dsh de forma alguma.

Teste

Tokens

Tempo

Observações

Site de uma página, dsh + V4 Pro (AI Success Lab)

~483,000

11 min

~$0.05, com muito cache

Site de uma página, Claude Code (mesma tarefa)

~48,000

30+ min

Pontuou mais alto em qualidade, 9/10 contra 7/10

Revisão de código, dsh sem ajustes (Reddit)

500,000

n/a

Taxa de acerto de cache de 70%

Revisão de código, OpenCode (mesmas tarefas)

~70,000

n/a

Taxa de acerto de cache de 95%

Construção do relógio, minha execução (20 de agosto)

~108,000

2 min 8 s

91% de leitura de cache, saída verificada

O que resgata a economia é o cache. Testadores do QbitAI, um veículo chinês com duas semanas de acesso ao beta fechado, mediram taxas de acerto de cache em torno de 99%, e a minha própria execução ficou em 91%. Entrada cacheada é quase de graça, então as contagens assustadoras de tokens se traduzem em contas pequenas.

A confiabilidade é o ponto mais fraco. A AtlasCloud refez a construção do rastreador da ISS da cobertura de lançamento três vezes (transparência: um blog de fornecedor, rodando contra seu próprio endpoint hospedado), e em duas das três execuções o harness imprimiu "Done" enquanto a página no navegador estava, na verdade, quebrada. Minha tarefa do relógio verificou sem problemas, mas minha tarefa do relógio também era trivial. Trate as demos como demos.

DeepSeek Harness é faminto por tokens, mas pesado em cache: testes independentes de agosto de 2026 mostram cerca de dez vezes o consumo de tokens do Claude Code em tarefas idênticas, compensado por taxas de acerto de cache próximas de 99% e pelo preço oficial da DeepSeek de $0.007 a $0.014 por milhão de tokens de entrada cacheados.

Quanto custa o DeepSeek Harness?

Preços precisam de carimbo de data, porque boa parte da cobertura da semana de lançamento já está errada. Em 16 de agosto, a DeepSeek moveu sua API para preços de pico e fora de pico. Até 20 de agosto, a página oficial de preços lista o V4 Flash a $0.22 a $0.44 por milhão de tokens de entrada dependendo da hora, $0.66 a $1.32 por milhão de saída, com acertos de cache a $0.007 a $0.014. O Pro custa o triplo disso. Se uma resenha te citar preços fixos de $0.14, ela está citando junho. A versão longa de por que esses números permanecem baixos está em como funciona a guerra de preços da IA na China.

Entre os dois modelos, o consenso inicial combina com o meu instinto: Flash para o trabalho do dia a dia, Pro quando o problema é genuinamente difícil. Se você está pesando os dois contra o resto do campo, mantenho uma comparação contínua em Qwen vs DeepSeek vs Llama.

É seguro executar o DeepSeek Harness?

Declare a premissa de implantação primeiro, como sempre. O harness roda localmente e você escolhe a rota do modelo, então a questão de residência de dados é sobre a qual provedor você o aponta, não sobre o harness em si; meu teste enviou prompts para os servidores do OpenCode Go, não da DeepSeek. Duas cautelas reais permanecem. As próprias notas do repositório descrevem telemetria que vem desativada por padrão mas que, se ativada, é enviada sem regras de redação. E plugins executam em processo com as suas permissões, então o ecossistema de plugins é uma questão de cadeia de suprimentos, o mesmo formato de pergunta que se o DeepSeek é seguro para empresas em primeiro lugar. Ninguém fez uma auditoria de segurança independente ainda.

O que o movimento significa

A própria página de produto da DeepSeek para o lançamento declara a tese em quatro palavras: Agente é igual a Modelo mais Harness. O modelo prevê tokens; o harness decide quais ferramentas ele recebe, quando para e o que lembra. A cobertura de lançamento da VentureBeat teve o enquadramento afiado: uma vez que os modelos de fronteira convergem em capacidade, a camada que controla como um agente raciocina e persiste ao longo de um fluxo de trabalho se torna muito mais difícil de substituir do que o próprio modelo. O que levanta a questão de por que um laboratório daria essa camada de graça sob licença MIT.

Porque dar de graça a coisa cara é o que a DeepSeek faz. Fez isso com a camada do modelo com pesos abertos, e o guia de campo do ecossistema de pesos abertos da China é a versão longa dessa história. O harness é a mesma cunha cravada uma camada acima, e o comentário do 36Kr citado por um revisor de código-fonte disse a parte silenciosa em voz alta: isso não é um tiro na lista de recursos do Claude Code, é um tiro no harness como produto pago. Se a aposta vai dar certo depende de algo que a DeepSeek não controla, que é se estranhos realmente vão construir plugins. Esse é o número que eu observaria, não as estrelas.

Então, você deveria experimentar? Se você gosta de mexer nas coisas, sim. A instalação é pesada, mas a compilação a partir do código-fonte é limpa, e há um prazer real em ler uma base de código tão disciplinada. Se você hospeda modelos por conta própria ou se importa com custo em escala, sim, com a configuração de provedor como o ponto do exercício. Se você precisa de uma ferramenta estável para o dia a dia, não. O repositório promete mudanças quebradiças por escrito, e está falando sério.

DeepSeek Harness é um lançamento estratégico, não apenas uma ferramenta: ao licenciar a camada do harness sob MIT e declarar "Agent = Model + Harness", a DeepSeek está argumentando que o harness deveria ser uma commodity, a mesma cunha que cravou antes na camada do modelo com pesos abertos.

Perguntas frequentes

É seguro executar o DeepSeek Harness com acesso ao shell?

O harness roda localmente, então a pergunta se divide em duas. Seus prompts vão para qualquer provedor de modelo que você configurar, e o sandbox embutido começa em somente leitura, com os modos de escrita no workspace e acesso total acima dele. O risco mais afiado são os plugins: eles rodam em processo com as suas permissões, e o ecossistema de plugins de uma semana ainda não tem auditoria independente.

O DeepSeek Harness pode mesmo chamar o Claude Code e o Codex?

Sim, e isso está confirmado no repositório, não apenas alegado na cobertura. Pacotes de plugins opcionais chamados subagent-claude-code e subagent-codex dirigem o Claude Agent SDK oficial e o app-server do Codex. Você ainda precisa dessas ferramentas instaladas e autenticadas; o harness fornece a orquestração, não as assinaturas.

Devo usar Flash ou Pro com o DeepSeek Harness?

Flash para a maior parte do trabalho. Testes independentes iniciais mostram cerca de dez vezes o uso de tokens do Claude Code em tarefas idênticas de qualquer forma, então o modelo mais barato é onde a economia funciona. Até 20 de agosto de 2026, o preço oficial da DeepSeek coloca a saída do Flash a um terço do preço do Pro. Reserve o Pro para problemas que genuinamente precisam do raciocínio extra.

A linha de fundo

DeepSeek Harness é uma peça de engenharia crua, disciplinada e genuinamente inovadora que a maior parte da cobertura de lançamento descreveu como a coisa errada. Ele não está tentando superar o Claude Code no jogo dele. É um laboratório de modelos declarando que a camada acima do modelo deveria ser gratuita, e construindo essa declaração a partir de peças de um framework de chatbot de quatro anos e das próprias ferramentas de código dos rivais. Se essa declaração vai pegar depende dos autores de plugins, e eles levarão meses para julgar. Enquanto isso, é a instalação de dezesseis minutos mais instrutiva que fiz este ano.

Se você está pesando modelos chineses ou ferramentas de agentes para algo real, entre em contato.

Fontes (todas consultadas em 2026-08-20):