Aller au contenu
Archives
Par Harness the Agents

DeepSeek Harness n'est pas un tueur de Claude Code. C'est quelque chose de plus intéressant.

Le harness d'agent open source de DeepSeek a dépassé les 168,000 étoiles GitHub en une semaine. Je l'ai installé, j'ai lu le dépôt et je l'ai exécuté moi-même. Voici ce qui tient la route.

The DeepSeek Harness wordmark beside the DeepSeek whale logo, in blue on a white background with faint circuit-board traces.

DeepSeek Harness n'est pas un tueur de Claude Code. C'est quelque chose de plus intéressant.

Le README promet une installation en une ligne. Tapez npx @deepseek-ai/dsh web, et vous y êtes. Sur ma machine, cette unique ligne a pris seize minutes, aspiré des centaines de packages dans le cache npx, puis réclamé encore dix minutes pour tout résoudre de nouveau à l'exécution suivante. Je n'en veux pas à DeepSeek. Je le mentionne parce que l'écart entre la promesse d'une ligne et la réalité des seize minutes, c'est toute l'histoire de DeepSeek Harness en miniature. Ce qui a été livré le 13 août est réellement intéressant, réellement brut, et largement mal lu.

Le malentendu se présente ainsi : DeepSeek aurait construit un concurrent de Claude Code. C'est l'angle qu'a choisi la plupart des articles de lancement, et je comprends pourquoi. Ça y ressemble, ça s'y comporte pareil, et certaines parties ont été, au sens propre, écrites par un Claude Code. Mais c'est le mauvais angle, et après une semaine passée à lire le dépôt, à faire tourner la bête et à vérifier les affirmations des autres, je pense que la vraie histoire se situe un niveau au-dessus.

Points clés

DeepSeek Harness (dsh) est un harness de coding agentique sous licence MIT, publié en developer preview le 13 août 2026. Il a dépassé les 168,000 étoiles GitHub et les 552,000 téléchargements npm en sa première semaine.Son affirmation « tout est un plugin » est littéralement vraie. L'adaptateur de modèle, les outils et la boucle d'agent elle-même sont tous interchangeables, construits sur un framework qui a quatre ans de production hors de l'IA derrière lui.L'appétit en tokens est réel et corroboré, mais des taux de hits en cache proches de 99% adoucissent la facture. Considérez-le comme une preview pour bidouilleurs, pas comme un outil de tous les jours.Le geste stratégique compte plus que l'outil : un laboratoire de modèles donne gratuitement la couche harness, et c'est un coup porté au modèle économique du harness par abonnement, pas à la liste de fonctionnalités de Claude Code.

Un mot sur la méthode avant de commencer. Tout ce qui suit concernant le dépôt, l'installation et l'exécution est de première main, daté de cette semaine. Quand je m'appuie sur les tests d'autres personnes, je le dis et je les nomme.

Qu'est-ce que DeepSeek a réellement livré ?

Au 20 août 2026, le dépôt a une semaine, affiche 168,325 étoiles, et le package npm a été téléchargé 552,210 fois dans la semaine du 12-18 août. Ce sont de gros chiffres pour une developer preview dont la propre documentation prévient qu'elle cassera la compatibilité sans prévenir. Ce qu'ils ont livré, c'est un harness d'agent local : vous lancez dsh web, une interface navigateur s'ouvre sur le port 3080, vous la pointez vers un workspace, vous choisissez un modèle et un mode, et vous la laissez travailler.

Le détail que je trouve le plus révélateur, c'est ce qu'il y a dedans. Ce n'est pas une fine enveloppe autour d'une API. Le checkout que j'ai compilé depuis les sources compte 226 packages dans le workspace, un système de permissions avec des modes sandbox allant de read-only à danger-full-access, et quatre presets d'agent. Standard est l'agent de coding complet, PTC fait écrire un programme au modèle puis l'exécute, Minimal livre deux outils, et le mode Creator, auto-extensible, porte un commentaire d'en-tête vous invitant à le traiter comme un accès shell.

Le plus remarquable : des packages de plugins officiels permettent au harness d'appeler Claude Code et Codex comme sous-agents. Le harness de DeepSeek délègue volontiers une sous-tâche à ses rivaux supposés. Et chaque session est écrite dans un journal en ajout seul qui enregistre le system prompt complet, chaque appel d'outil et chaque compte de tokens. Mon propre test a produit 250 événements pour une tâche en dix étapes, tous inspectables après coup.

Un avertissement pratique. Il existe un projet tiers sans rapport qui s'appelle lui aussi deepseek-harness, un adaptateur de protocole publié en mai. Si vous cherchez, c'est l'organisation deepseek-ai qu'il vous faut. L'autre n'est pas malveillant, juste nommé de façon déroutante.

DeepSeek Harness est un harness de coding agentique sous licence MIT, publié en developer preview le 13 août 2026. Le dépôt GitHub a dépassé les 168,000 étoiles en une semaine, et l'outil peut orchestrer Claude Code et Codex comme sous-agents plutôt que de se contenter de leur faire concurrence.

Le framework vient d'un écosystème de chatbot

Voici la partie que presque aucun article anglophone n'a relevée. DeepSeek n'a pas construit l'architecture de plugins du harness à partir de rien. Elle repose sur Cordis, un framework de plugins TypeScript sous licence MIT qui tourne en production depuis 2022 sous Koishi, un framework de chatbot doté de milliers de plugins communautaires. Le créateur de Cordis, Yifan Shi, est le premier auteur de l'article que DeepSeek a publié avec la sortie, avec une affiliation à l'université de Pékin sur la signature. L'article est une prépublication auto-hébergée de 88 pages, honnêtement étiquetée comme un brouillon. Le dépôt Cordis lui-même affichait 6,465 étoiles quand j'ai vérifié le 20 août.

L'idée qu'il formalise porte un nom intimidant, la composabilité spatiotemporelle, et un sens très simple. Temporel : n'importe quelle partie du système peut être déchargée à chaud, et tout ce qu'elle a fait est proprement défait. Spatial : les parties déclarent leurs dépendances et se réveillent ou s'éteignent au gré de l'arrivée et du départ de ces dépendances. L'article prouve que l'ordre dans lequel on charge et décharge les choses n'a pas d'importance ; le système converge vers le même état dans tous les cas. Si ça ressemble à un problème résolu, ce n'en est pas un. La statistique qui motive l'article, c'est que 87 des 100 extensions VSCode les plus populaires ne peuvent pas être déchargées sans redémarrer l'éditeur.

Je voulais savoir si « tout est un plugin » relevait du marketing ou du mécanisme, alors j'ai dumpé la configuration résolue. C'est du mécanisme. Le profil web par défaut compose 135 lignes de plugins réparties sur 24 couches de patchs YAML, chacune annotée avec le package qui l'a apportée. L'adaptateur de modèle, le registre d'outils, le journal de session, la boucle d'agent : tous des plugins, tous réversibles. Le dépôt impose aussi à chaque fichier source une couverture de tests de 100% en CI, ce qui est une barre presque comiquement stricte pour une preview d'une semaine.

DeepSeek Harness tourne sur Cordis, un framework de plugins en production depuis 2022 dans l'écosystème du chatbot Koishi, formalisé dans une prépublication de 88 pages signée par l'université de Pékin et DeepSeek. Sa garantie centrale : tout composant peut être chargé ou déchargé à chaud et le système converge vers le même état quel que soit l'ordre.

Il a été construit avec les outils de ses rivaux

Passons au passage gênant et drôle. Une analyse de forensic de code (winzheng.com, une source unique, même si elle affirme que ses scripts sont reproductibles) a parcouru l'historique des commits et trouvé que 1,760 des 12,293 premiers commits portent un préfixe de branche codex/, que le onzième commit s'intitule "fix issues found in the second round of Codex review", et qu'un lien symbolique CLAUDE.md pointant vers AGENTS.md existait dès le tout premier commit. En clair : l'équipe de DeepSeek a massivement construit le harness avec Codex d'OpenAI et Claude Code d'Anthropic dans la boucle.

Je rangerais ça dans la catégorie réjouissant plutôt que scandaleux. Toutes les équipes d'ingénierie sérieuses que je connais construisent désormais avec ces outils, et DeepSeek le fait manifestement aussi. Le même rapport a aussi vérifié la rumeur plus croustillante, selon laquelle le harness aurait été repris d'un code source de Claude Code ayant fuité, et n'a trouvé aucun recouvrement de chaînes de caractères. Ça vaut la peine de le dire, parce que cette rumeur a fait le tour du web. Ce que le forensic montre réellement est plus intéressant que la rumeur : la conviction du laboratoire, selon laquelle le modèle est la commodité et la boucle autour de lui le produit, s'étend jusqu'à la façon dont il construit ses propres logiciels.

Encore une note d'honnêteté. Le harness est pensé pour la Chine d'abord, dans des endroits que les articles anglophones n'ont pas mentionnés. Les fichiers de métadonnées des presets sont écrits en chinois d'abord, et certaines chaînes de l'interface livrée n'existent qu'en chinois. Si vous voulez un petit signe concret du public auquel DeepSeek s'attend pour ses premiers utilisateurs, le voilà.

Je l'ai fait tourner moi-même

Lire des choses sur un harness ne mène pas très loin, alors j'ai lancé une vraie tâche. Plutôt qu'une clé d'API DeepSeek, j'ai utilisé une clé d'abonnement OpenCode Go, qui passe par un catalogue de seize modèles issus de sept laboratoires ou plus. Ce choix était accidentel et il s'est révélé être la partie la plus instructive de tout le test : j'ai fait tourner le harness de DeepSeek sur le modèle V4 Flash de DeepSeek sans jamais approcher l'API de DeepSeek elle-même. Le changement de fournisseur que promet l'architecture n'est pas théorique. C'est un fichier YAML et une variable d'environnement.

La tâche : construire un site d'une page affichant des horloges en direct pour Hangzhou, Londres et New York, puis le vérifier. L'exécution a pris 2 minutes 8 secondes, 10 étapes et 9 appels d'outils, brûlant environ 108,000 tokens avec 91% des entrées servies depuis le cache. L'agent a sondé l'environnement, écrit la page, extrait son propre JavaScript et vérifié sa syntaxe avec node, repéré un bug d'arrondi dans son propre script de vérification, corrigé ce bug, puis relancé la vérification. J'ai ensuite vérifié le résultat indépendamment : les calculs de fuseaux horaires étaient justes, y compris le fait que Londres est actuellement en British Summer Time et New York en EDT. Petite tâche, résultat correct, journal complet.

Les aspérités sont réelles elles aussi. Le lancement depuis un checkout source est fragile quant à votre répertoire de travail, d'une façon que la documentation ne mentionne pas. Le mode headless n'affiche aucun résumé de tokens ; j'ai calculé les chiffres à la main à partir du journal de session. Et le system prompt a annoncé au modèle qu'il était deepseek-v4-flash parce que c'est le nom de ma route configurée, ce qui ne pose pas de problème jusqu'au jour où quelqu'un proxifie un autre modèle et que l'agent développe un faux sentiment d'identité. Du niveau preview, tout ça.

Lors d'un test de première main le 20 août 2026, DeepSeek Harness a mené à bien la construction vérifiée d'une page unique en 2 minutes 8 secondes sur 10 étapes, en consommant environ 108,000 tokens avec un taux de lecture depuis le cache de 91%, via une clé de modèle OpenCode Go tierce plutôt que l'API de DeepSeek elle-même.

La facture honnête

La critique la plus forte contre le harness, c'est qu'il brûle des tokens, et la critique tient la route. L'AI Success Lab de Julian Goldie l'a chronométré face à Claude Code sur le même site d'une page pendant la semaine de lancement : la pile DeepSeek a consommé environ 483,000 tokens contre 48,000 pour Claude Code, même si elle a fini en 11 minutes contre plus de 30 pour Claude Code, pour un coût d'environ cinq cents. La comparaison côte à côte d'un utilisateur de Reddit sur des tâches de revue de code a trouvé la même silhouette, et son message de suivi admet qu'il n'avait pas du tout réglé la config de dsh.

Test

Tokens

Durée

Remarques

Site d'une page, dsh + V4 Pro (AI Success Lab)

~483,000

11 min

~$0.05, usage intensif du cache

Site d'une page, Claude Code (même tâche)

~48,000

30+ min

Meilleur score en qualité, 9/10 contre 7/10

Revue de code, dsh non réglé (Reddit)

500,000

n/a

70% de hits en cache

Revue de code, OpenCode (mêmes tâches)

~70,000

n/a

95% de hits en cache

Construction des horloges, mon test (20 août)

~108,000

2 min 8 s

91% de lecture cache, résultat vérifié

Ce qui sauve l'économie de l'affaire, c'est le cache. Des testeurs de QbitAI, un média chinois qui a eu deux semaines d'accès à la bêta fermée, ont mesuré des taux de hits en cache autour de 99%, et mon propre test s'est établi à 91%. Les entrées en cache sont quasi gratuites, donc les comptes de tokens effrayants se traduisent en petites factures.

La fiabilité est le ventre mou. AtlasCloud a relancé la construction du tracker ISS issue de la couverture de lancement, trois fois (transparence : un blog de fournisseur, tournant contre son propre endpoint hébergé), et dans deux des trois exécutions le harness a affiché "Done" alors que la page dans le navigateur était en fait cassée. Ma tâche d'horloges s'est vérifiée proprement, mais ma tâche d'horloges était aussi triviale. Traitez les démos comme des démos.

DeepSeek Harness est avide de tokens mais massif en cache : des tests indépendants menés en août 2026 montrent environ dix fois la consommation de tokens de Claude Code sur des tâches identiques, compensée par des taux de hits en cache proches de 99% et par la tarification officielle de DeepSeek de $0.007 à $0.014 par million de tokens d'entrée en cache.

Combien coûte DeepSeek Harness ?

La tarification a besoin d'un horodatage, car une bonne partie de la couverture de la semaine de lancement est déjà fausse. Le 16 août, DeepSeek a fait passer son API à une tarification en heures pleines et heures creuses. Au 20 août, la page officielle des tarifs liste V4 Flash entre $0.22 et $0.44 par million de tokens d'entrée selon l'heure, entre $0.66 et $1.32 par million en sortie, avec les hits en cache entre $0.007 et $0.014. Pro coûte le triple. Si un article vous cite des prix fixes à $0.14, il cite le mois de juin. La version longue des raisons pour lesquelles ces chiffres restent bas se trouve dans comment fonctionne la guerre des prix de l'IA en Chine.

Entre les deux modèles, le consensus initial rejoint mon instinct : Flash pour le travail quotidien, Pro quand le problème est réellement dur. Si vous les comparez au reste du paysage, je tiens une comparaison à jour dans Qwen vs DeepSeek vs Llama.

Peut-on exécuter DeepSeek Harness en sécurité ?

Énonçons d'abord l'hypothèse de déploiement, comme toujours. Le harness tourne en local et c'est vous qui choisissez la route du modèle, donc la question de résidence des données porte sur le fournisseur vers lequel vous le pointez, pas sur le harness lui-même ; mon test a envoyé les prompts vers les serveurs d'OpenCode Go, pas vers ceux de DeepSeek. Deux vraies précautions subsistent. Les notes du dépôt décrivent une télémétrie désactivée par défaut mais qui, si on l'active, part sans aucune règle d'anonymisation. Et les plugins s'exécutent dans le processus avec vos permissions, donc l'écosystème de plugins est une question de chaîne d'approvisionnement, la même forme de question que la sécurité de DeepSeek en entreprise au départ. Personne n'a encore mené d'audit de sécurité indépendant.

Ce que signifie ce geste

La propre page produit de DeepSeek pour cette sortie énonce la thèse en quatre mots : Agent equals Model plus Harness. Le modèle prédit des tokens ; le harness décide quels outils il reçoit, quand il s'arrête et ce qu'il retient. La couverture de lancement de VentureBeat a trouvé la formulation juste : une fois que les modèles de frontière convergent en capacité, la couche qui contrôle la façon dont un agent raisonne et persiste à travers un flux de travail devient bien plus difficile à remplacer que le modèle lui-même. Ce qui soulève la question de savoir pourquoi un laboratoire donnerait cette couche sous licence MIT.

Parce que donner la chose coûteuse, c'est ce que fait DeepSeek. Il l'a fait pour la couche modèle avec les poids ouverts, et le guide de terrain de l'écosystème chinois des poids ouverts est la version longue de cette histoire. Le harness est le même coin enfoncé un niveau plus haut, et le commentaire de 36Kr cité par un relecteur du code source a dit la partie silencieuse tout haut : ce n'est pas un coup porté à la liste de fonctionnalités de Claude Code, c'est un coup porté au harness comme produit payant. Que le pari paie ou non dépend de quelque chose que DeepSeek ne contrôle pas, à savoir si des inconnus construisent réellement des plugins. C'est le chiffre que je surveillerais, pas les étoiles.

Alors, faut-il l'essayer ? Si vous bidouillez, oui. L'installation est lourde mais la compilation depuis les sources est propre, et il y a un vrai plaisir à lire une base de code aussi disciplinée. Si vous auto-hébergez des modèles ou que les coûts à l'échelle vous importent, oui, avec la config du fournisseur comme objet de l'exercice. Si vous avez besoin d'un outil stable au quotidien, non. Le dépôt promet des changements cassants par écrit, et il le pense.

DeepSeek Harness est une sortie stratégique, pas seulement un outil : en plaçant la couche harness sous licence MIT et en déclarant "Agent = Model + Harness", DeepSeek soutient que le harness devrait être une commodité, le même coin qu'il avait déjà enfoncé dans la couche modèle avec les poids ouverts.

Questions fréquentes

DeepSeek Harness est-il sûr à utiliser avec un accès shell ?

Le harness tourne en local, donc la question se scinde en deux. Vos prompts partent vers le fournisseur de modèle que vous configurez, et le sandbox intégré démarre en lecture seule avec les modes écriture dans le workspace et accès complet au-dessus. Le risque le plus pointu, ce sont les plugins : ils tournent dans le processus avec vos permissions, et l'écosystème de plugins d'une semaine n'a pas encore fait l'objet d'un audit indépendant.

DeepSeek Harness peut-il vraiment appeler Claude Code et Codex ?

Oui, et c'est confirmé dans le dépôt, pas seulement affirmé dans les articles. Des packages de plugins optionnels nommés subagent-claude-code et subagent-codex pilotent le Claude Agent SDK officiel et l'app-server de Codex. Il vous faut toujours ces outils installés et authentifiés ; le harness fournit l'orchestration, pas les abonnements.

Faut-il utiliser Flash ou Pro avec DeepSeek Harness ?

Flash pour l'essentiel du travail. Les premiers tests indépendants montrent dans les deux cas environ dix fois la consommation de tokens de Claude Code sur des tâches identiques, donc c'est avec le modèle le moins cher que l'économie fonctionne. Au 20 août 2026, la tarification officielle de DeepSeek place la sortie de Flash au tiers du prix de Pro. Réservez Pro aux problèmes qui ont réellement besoin du raisonnement supplémentaire.

En résumé

DeepSeek Harness est un morceau d'ingénierie brut, discipliné et réellement inédit, que la plupart des articles de lancement ont décrit comme autre chose. Il ne cherche pas à faire mieux que Claude Code à son propre jeu. C'est un laboratoire de modèles qui déclare que la couche au-dessus du modèle devrait être gratuite, et qui construit cette déclaration à partir de pièces d'un framework de chatbot âgé de quatre ans et des propres outils de coding de ses rivaux. Que cette déclaration tienne ou non dépend des auteurs de plugins, et il faudra des mois pour en juger. En attendant, c'est l'installation de seize minutes la plus instructive que j'aie faite cette année.

Si vous évaluez des modèles chinois ou de l'outillage d'agents pour un vrai projet, contactez-moi.

Sources (toutes consultées le 2026-08-20) :