Zum Inhalt springen
Archiv
Von Harness the Agents

DeepSeek Harness ist kein Claude-Code-Killer. Es ist etwas Interessanteres.

DeepSeeks quelloffenes Agenten-Harness knackte in seiner ersten Woche 168,000 GitHub-Sterne. Ich habe es installiert, das Repo gelesen und selbst laufen lassen. Hier ist, was Bestand hat.

The DeepSeek Harness wordmark beside the DeepSeek whale logo, in blue on a white background with faint circuit-board traces.

DeepSeek Harness ist kein Claude-Code-Killer. Es ist etwas Interessanteres.

Das README verspricht eine Installation mit einer Zeile. npx @deepseek-ai/dsh web eintippen, und man ist drin. Auf meinem Rechner dauerte diese eine Zeile sechzehn Minuten, zog Hunderte Pakete in den npx-Cache und brauchte beim nächsten Start weitere zehn Minuten zum erneuten Auflösen. Ich nehme das DeepSeek nicht übel. Ich erwähne es, weil die Kluft zwischen dem Ein-Zeilen-Versprechen und der Sechzehn-Minuten-Realität die ganze Geschichte von DeepSeek Harness im Kleinen ist. Was am 13. August erschien, ist wirklich interessant, wirklich unausgegoren und wird breit falsch gelesen.

Die Fehllesart geht so: DeepSeek hat einen Claude-Code-Konkurrenten gebaut. Das ist der Rahmen, den die meiste Launch-Berichterstattung gewählt hat, und ich verstehe warum. Es sieht so aus wie einer, es läuft so wie einer, und Teile davon wurden ganz wörtlich von einem geschrieben. Aber es ist der falsche Rahmen, und nach einer Woche Repository-Lektüre, praktischem Ausprobieren und dem Nachprüfen der Behauptungen anderer Leute glaube ich: Die eigentliche Geschichte liegt eine Ebene höher.

Wichtigste Erkenntnisse

DeepSeek Harness (dsh) ist ein MIT-lizenziertes Agentic-Coding-Harness in der Developer Preview, veröffentlicht am 13. August 2026. Es knackte in der ersten Woche 168,000 GitHub-Sterne und 552,000 npm-Downloads.Das Versprechen "alles ist ein Plugin" ist wörtlich wahr. Der Modelladapter, die Werkzeuge und die Agentenschleife selbst sind alle austauschbar, gebaut auf einem Framework mit vier Jahren Produktionsgeschichte außerhalb der KI.Der Token-Hunger ist real und bestätigt, aber Cache-Trefferquoten nahe 99% mildern die Rechnung. Behandle es als Preview für Tüftler, nicht als tägliches Arbeitswerkzeug.Der strategische Schachzug wiegt schwerer als das Werkzeug: Ein Modelllabor verschenkt die Harness-Ebene, und das ist ein Angriff auf das Geschäftsmodell Harness-per-Abonnement, nicht auf die Feature-Liste von Claude Code.

Ein Wort zur Methode, bevor wir anfangen. Alles Folgende über das Repository, die Installation und den Testlauf stammt aus erster Hand von dieser Woche. Wo ich mich auf Tests anderer stütze, sage ich das und nenne sie beim Namen.

Was hat DeepSeek eigentlich ausgeliefert?

Stand 20. August 2026 ist das Repository eine Woche alt, steht bei 168,325 Sternen, und das npm-Paket wurde in der Woche vom 12. bis 18. August 552,210-mal heruntergeladen. Das sind große Zahlen für eine Developer Preview, vor deren unangekündigten Kompatibilitätsbrüchen die eigene Dokumentation warnt. Was man dafür bekommt, ist ein lokales Agenten-Harness: Man startet dsh web, eine Browser-Oberfläche öffnet sich auf Port 3080, man zeigt sie auf einen Workspace, wählt Modell und Modus und lässt sie arbeiten.

Das Detail, das ich am aufschlussreichsten finde, steckt im Inneren. Dies ist kein dünner Mantel um eine API. Der Checkout, den ich aus dem Quellcode gebaut habe, enthält 226 Workspace-Pakete, ein Berechtigungssystem mit Sandbox-Modi von read-only bis danger-full-access und vier Agenten-Voreinstellungen. Standard ist der volle Coding-Agent, PTC lässt das Modell ein einziges Programm schreiben und ausführen, Minimal liefert zwei Werkzeuge, und der sich selbst erweiternde Creator-Modus trägt einen Kopfkommentar, der einem rät, ihn wie Shell-Zugriff zu behandeln.

Am bemerkenswertesten: Offizielle Plugin-Pakete lassen das Harness Claude Code und Codex als Sub-Agenten aufrufen. DeepSeeks Harness delegiert fröhlich Teilaufgaben an seine vermeintlichen Rivalen. Und jede Sitzung wird in ein Append-only-Log geschrieben, das den vollständigen Systemprompt, jeden Werkzeugaufruf und jede Tokenzahl festhält. Mein eigener Testlauf erzeugte 250 Ereignisse für eine Aufgabe mit zehn Schritten, alles im Nachhinein einsehbar.

Eine praktische Warnung. Es gibt ein nicht verwandtes Drittanbieter-Projekt, das ebenfalls deepseek-harness heißt, ein Protokolladapter, der bereits im Mai erschien. Wer sucht, will die Organisation deepseek-ai. Das andere ist nicht bösartig, nur verwirrend benannt.

DeepSeek Harness ist ein MIT-lizenziertes Agentic-Coding-Harness, das am 13. August 2026 als Developer Preview erschien. Das GitHub-Repository knackte innerhalb einer Woche 168,000 Sterne, und das Werkzeug kann Claude Code und Codex als Sub-Agenten orchestrieren, statt nur mit ihnen zu konkurrieren.

Das Framework stammt aus einem Chatbot-Ökosystem

Hier ist der Teil, den fast die gesamte englischsprachige Berichterstattung übersehen hat. DeepSeek hat die Plugin-Architektur des Harness nicht von Grund auf neu gebaut. Sie basiert auf Cordis, einem MIT-lizenzierten TypeScript-Plugin-Framework, das seit 2022 unterhalb von Koishi in Produktion läuft, einem Chatbot-Framework mit Tausenden Community-Plugins. Cordis' Schöpfer, Yifan Shi, ist Erstautor des Papers, das DeepSeek zusammen mit dem Release veröffentlichte, mit einer Peking-Universität-Zugehörigkeit in der Autorenzeile. Das Paper ist ein selbst gehosteter Preprint, 88 Seiten, ehrlich als Entwurf gekennzeichnet. Das Cordis-Repository selbst stand bei 6,465 Sternen, als ich am 20. August nachsah.

Die Idee, die es formalisiert, hat einen abschreckenden Namen, raumzeitliche Komponierbarkeit, und eine schlichte Bedeutung. Zeitlich: Jeder Teil des Systems kann zur Laufzeit entladen werden, und alles, was er getan hat, wird sauber rückgängig gemacht. Räumlich: Teile deklarieren, wovon sie abhängen, und wachen auf oder fahren herunter, wenn diese Abhängigkeiten kommen und gehen. Das Paper beweist, dass die Reihenfolge, in der man Dinge lädt und entlädt, keine Rolle spielt; das System konvergiert unabhängig davon zum selben Zustand. Falls das nach einem gelösten Problem klingt: Ist es nicht. Die Motivationsstatistik des Papers lautet, dass 87 der 100 beliebtesten VSCode-Erweiterungen nicht entladen werden können, ohne den Editor neu zu starten.

Ich wollte wissen, ob "alles ist ein Plugin" Marketing oder Mechanismus ist, also habe ich die aufgelöste Konfiguration ausgegeben. Es ist Mechanismus. Das Standard-Webprofil setzt 135 Plugin-Zeilen über 24 YAML-Patch-Ebenen zusammen, jede einzelne mit dem Vermerk, welches Paket sie beigesteuert hat. Der Modelladapter, die Werkzeugregistrierung, das Sitzungslog, die Agentenschleife: alles Plugins, alles umkehrbar. Das Repo erzwingt außerdem in der CI für jede Quelldatei 100% Testabdeckung, eine fast komisch strenge Messlatte für eine eine Woche alte Preview.

DeepSeek Harness läuft auf Cordis, einem Plugin-Framework, das seit 2022 im Koishi-Chatbot-Ökosystem in Produktion ist und in einem 88-seitigen Preprint der Peking-Universität und DeepSeek formalisiert wurde. Seine zentrale Garantie: Jede Komponente kann zur Laufzeit geladen oder entladen werden, und das System konvergiert unabhängig von der Reihenfolge zum selben Zustand.

Es wurde mit den Werkzeugen seiner Rivalen gebaut

Jetzt der unbequeme, komische Teil. Eine Code-Forensik-Analyse (winzheng.com, eine einzelne Quelle, wenngleich sie behauptet, ihre Skripte seien reproduzierbar) ist die Commit-Historie durchgegangen und fand, dass 1,760 der ersten 12,293 Commits ein codex/-Branch-Präfix tragen, dass der elfte Commit den Titel "fix issues found in the second round of Codex review" trägt, und dass ein CLAUDE.md-Symlink auf AGENTS.md vom allerersten Commit an existierte. In klaren Worten: DeepSeeks Team hat das Harness massiv mit OpenAIs Codex und Anthropics Claude Code in der Schleife gebaut.

Ich verorte das unter entzückend, nicht unter skandalös. Jedes ernsthafte Engineering-Team, das ich kenne, baut inzwischen mit diesen Werkzeugen, und DeepSeek tut das offenkundig auch. Derselbe Bericht prüfte auch das pikantere Gerücht, das Harness sei aus geleaktem Claude-Code-Quellcode übernommen worden, und fand keinerlei String-Übereinstimmungen. Der Vollständigkeit halber, denn dieses Gerücht machte die Runde. Was die Forensik tatsächlich zeigt, ist interessanter als das Gerücht: Die Überzeugung des Labors, dass das Modell die Ware ist und die Schleife darum das Produkt, erstreckt sich bis auf die Art, wie es seine eigene Software baut.

Noch eine Ehrlichkeitsnotiz. Das Harness ist an Stellen, die die englische Berichterstattung nicht erwähnt hat, chinesisch geprägt. Die Metadatendateien der Voreinstellungen sind zuerst auf Chinesisch geschrieben, und manche ausgelieferten UI-Strings gibt es nur auf Chinesisch. Wenn du ein kleines, konkretes Zeichen dafür suchst, wen DeepSeek als frühe Anwender erwartet: das ist es.

Ich habe es selbst laufen lassen

Über ein Harness zu lesen bringt einen nur so weit, also habe ich eine echte Aufgabe laufen lassen. Statt eines DeepSeek-API-Schlüssels nutzte ich einen OpenCode Go-Abonnementschlüssel, der über einen Katalog von sechzehn Modellen aus sieben oder mehr Laboren routet. Diese Wahl war Zufall und erwies sich als der lehrreichste Teil des ganzen Tests: Ich ließ DeepSeeks Harness auf DeepSeeks V4-Flash-Modell laufen, ohne DeepSeeks eigener API auch nur nahezukommen. Der Anbieterwechsel, den die Architektur verspricht, ist nicht theoretisch. Es ist eine YAML-Datei und eine Umgebungsvariable.

Die Aufgabe: eine Single-Page-Site bauen, die Live-Uhren für Hangzhou, London und New York zeigt, und sie anschließend verifizieren. Der Lauf dauerte 2 Minuten und 8 Sekunden, 10 Schritte und 9 Werkzeugaufrufe, verbrannte etwa 108,000 Tokens und bediente 91% der Eingabe aus dem Cache. Der Agent sondierte die Umgebung, schrieb die Seite, extrahiert sein eigenes JavaScript und prüfte die Syntax mit node, entdeckte einen Rundungsfehler in seinem eigenen Verifikationsskript, behob ihn und ließ die Prüfung erneut laufen. Danach verifizierte ich das Ergebnis unabhängig: Die Zeitzonenrechnung stimmte, einschließlich der Tatsache, dass London derzeit in der British Summer Time liegt und New York auf EDT. Kleine Aufgabe, korrektes Ergebnis, vollständiges Log.

Die rauen Kanten sind ebenfalls real. Der Start aus einem Quell-Checkout ist heikel, was das Arbeitsverzeichnis angeht, auf eine Weise, die die Doku nicht erwähnt. Der Headless-Modus gibt keine Token-Zusammenfassung aus; ich habe die Zahlen von Hand aus dem Sitzungslog errechnet. Und der Systemprompt sagte dem Modell, es sei deepseek-v4-flash, weil meine konfigurierte Route so hieß, was in Ordnung ist, bis jemand ein anderes Modell dahinterlegt und der Agent ein falsches Identitätsgefühl entwickelt. Alles Preview-Niveau.

In einem Selbsttest am 20. August 2026 erledigte DeepSeek Harness einen verifizierten Single-Page-Build in 2 Minuten und 8 Sekunden über 10 Schritte, mit rund 108,000 Tokens bei einer Cache-Lesequote von 91%, betrieben über einen OpenCode-Go-Modellschlüssel eines Drittanbieters statt über DeepSeeks eigene API.

Die ehrliche Rechnung

Die schärfste Kritik am Harness lautet, dass er Tokens verbrennt, und die Kritik hat Bestand. Julian Goldies AI Success Lab stoppte ihn in der Launch-Woche gegen Claude Code bei derselben Ein-Seiten-Site: Der DeepSeek-Stack verbrauchte etwa 483,000 Tokens gegenüber Claude Codes 48,000, war allerdings in 11 Minuten fertig gegenüber Claude Codes 30-plus und kostete ungefähr fünf Cent. Der direkte Vergleich eines Reddit-Nutzers bei Code-Review-Aufgaben ergab dasselbe Bild, und sein Nachtrag gibt zu, dass er die dsh-Konfiguration überhaupt nicht angepasst hatte.

Test

Tokens

Zeit

Hinweise

Ein-Seiten-Site, dsh + V4 Pro (AI Success Lab)

~483,000

11 min

~$0.05, cachelastig

Ein-Seiten-Site, Claude Code (gleiche Aufgabe)

~48,000

30+ min

Qualitativ besser bewertet, 9/10 vs 7/10

Code-Review, dsh unangepasst (Reddit)

500,000

k. A.

70% Cache-Trefferquote

Code-Review, OpenCode (gleiche Aufgaben)

~70,000

k. A.

95% Cache-Trefferquote

Uhren-Build, mein Lauf (20. August)

~108,000

2 min 8 s

91% Cache-Lesequote, Ergebnis verifiziert

Was die Wirtschaftlichkeit rettet, ist der Cache. Tester von QbitAI, einem chinesischen Medium mit zwei Wochen Closed-Beta-Zugang, maßen Cache-Trefferquoten um 99%, und mein eigener Lauf lag bei 91%. Gecachte Eingabe ist nahezu kostenlos, also übersetzen sich die beängstigenden Tokenzahlen in kleine Rechnungen.

Die Zuverlässigkeit ist der weichere Unterbauch. AtlasCloud ließ den ISS-Tracker-Build aus der Launch-Berichterstattung dreimal erneut laufen (Offenlegung: ein Anbieter-Blog, der gegen seinen eigenen gehosteten Endpunkt lief), und in zwei der drei Läufe meldete das Harness "Done", während die Seite im Browser tatsächlich kaputt war. Meine Uhrenaufgabe verifizierte sauber, aber meine Uhrenaufgabe war auch trivial. Behandle die Demos als Demos.

DeepSeek Harness ist tokenhungrig, aber cachelastig: Unabhängige Tests im August 2026 zeigen bei identischen Aufgaben ungefähr den zehnfachen Tokenverbrauch von Claude Code, ausgeglichen durch Cache-Trefferquoten nahe 99% und DeepSeeks offizielle Preise von $0.007 bis $0.014 pro Million gecachter Eingabetokens.

Was kostet DeepSeek Harness?

Preise brauchen einen Datumsstempel, denn ein Gutteil der Launch-Wochen-Berichterstattung ist bereits falsch. Am 16. August stellte DeepSeek seine API auf Peak- und Off-Peak-Preise um. Stand 20. August führt die offizielle Preisseite V4 Flash mit $0.22 bis $0.44 pro Million Eingabetokens je nach Tageszeit, $0.66 bis $1.32 pro Million Ausgabetokens, mit Cache-Treffern bei $0.007 bis $0.014. Pro läuft zum Dreifachen davon. Wenn dir ein Testbericht pauschale $0.14-Preise nennt, zitiert er den Juni. Die längere Version, warum diese Zahlen niedrig bleiben, steht in wie Chinas KI-Preiskrieg funktioniert.

Zwischen den beiden Modellen entspricht der frühe Konsens meinem Instinkt: Flash für die Alltagsarbeit, Pro, wenn das Problem wirklich schwer ist. Wenn du sie gegen den Rest des Feldes abwägst, führe ich einen fortlaufenden Vergleich in Qwen vs DeepSeek vs Llama.

Ist DeepSeek Harness sicher im Betrieb?

Zuerst die Deployment-Annahme klären, wie immer. Das Harness läuft lokal, und du wählst die Modellroute, also betrifft die Frage der Datenresidenz den Anbieter, auf den du es zeigen lässt, nicht das Harness selbst; mein Test schickte Prompts an die Server von OpenCode Go, nicht an die von DeepSeek. Zwei echte Vorsichtshinweise bleiben. Die eigenen Notizen des Repos beschreiben Telemetrie, die standardmäßig deaktiviert ist, aber, falls aktiviert, ohne jede Schwärzungsregel ausgeliefert wird. Und Plugins laufen im Prozess mit deinen Berechtigungen, also ist das Plugin-Ökosystem eine Lieferkettenfrage, dieselbe Art von Frage wie ob DeepSeek für Unternehmen sicher ist überhaupt. Ein unabhängiges Sicherheitsaudit hat bislang niemand durchgeführt.

Was dieser Schritt bedeutet

DeepSeeks eigene Produktseite zum Release bringt die These in vier Worten auf den Punkt: Agent gleich Modell plus Harness. Das Modell sagt Tokens voraus; das Harness entscheidet, welche Werkzeuge es bekommt, wann es stoppt und was es sich merkt. VentureBeats Launch-Bericht hatte die scharfe Einordnung: Sobald Frontier-Modelle in der Leistungsfähigkeit konvergieren, wird die Ebene, die steuert, wie ein Agent über einen Workflow hinweg denkt und Kontext behält, viel schwerer zu ersetzen als das Modell selbst. Was die Frage aufwirft, warum ein Labor diese Ebene unter MIT verschenken sollte.

Weil das Verschenken des teuren Teils genau das ist, was DeepSeek tut. Es hat das mit der Modellebene über offene Gewichte getan, und der Feldguide zu Chinas Open-Weight-Ökosystem ist die lange Version dieser Geschichte. Das Harness ist derselbe Keil, eine Ebene höher eingetrieben, und der 36Kr-Kommentar, den ein Quellcode-Gutachter zitierte, sagte den leisen Teil laut: Dies ist kein Schuss auf die Feature-Liste von Claude Code, es ist ein Schuss auf das Harness als kostenpflichtiges Produkt. Ob die Wette aufgeht, hängt von etwas ab, das DeepSeek nicht kontrollieren kann, nämlich davon, ob Fremde tatsächlich Plugins bauen. Das ist die Zahl, die ich beobachten würde, nicht die Sterne.

Also, solltest du es ausprobieren? Wenn du tüftelst, ja. Die Installation ist schwer, aber der Quellbuild ist sauber, und es ist ein echtes Vergnügen, eine so disziplinierte Codebasis zu lesen. Wenn du Modelle selbst hostest oder Kosten im Maßstab wichtig sind, ja, wobei die Anbieterkonfiguration der Sinn der Übung ist. Wenn du ein stabiles tägliches Arbeitswerkzeug brauchst, nein. Das Repo verspricht Breaking Changes schriftlich, und es meint es ernst.

DeepSeek Harness ist ein strategisches Release, nicht nur ein Werkzeug: Indem DeepSeek die Harness-Ebene unter MIT lizenziert und "Agent = Model + Harness" erklärt, argumentiert es, das Harness solle eine Commodity sein, derselbe Keil, den es zuvor mit offenen Gewichten durch die Modellebene getrieben hat.

Häufig gestellte Fragen

Ist DeepSeek Harness mit Shell-Zugriff sicher im Betrieb?

Das Harness läuft lokal, also zerfällt die Frage in zwei Teile. Deine Prompts gehen an den Modellanbieter, den du konfigurierst, und die eingebaute Sandbox beginnt bei read-only, mit workspace-write- und full-access-Modi darüber. Das schärfere Risiko sind Plugins: Sie laufen im Prozess mit deinen Berechtigungen, und das eine Woche alte Plugin-Ökosystem hat noch kein unabhängiges Audit.

Kann DeepSeek Harness wirklich Claude Code und Codex aufrufen?

Ja, und das ist im Repository bestätigt, nicht nur in der Berichterstattung behauptet. Optionale Plugin-Pakete namens subagent-claude-code und subagent-codex steuern das offizielle Claude Agent SDK und Codex' App-Server. Du brauchst diese Werkzeuge weiterhin installiert und authentifiziert; das Harness liefert die Orchestrierung, nicht die Abonnements.

Sollte ich Flash oder Pro mit DeepSeek Harness nutzen?

Flash für die meiste Arbeit. Frühe unabhängige Tests zeigen bei identischen Aufgaben in beiden Fällen ungefähr den zehnfachen Tokenverbrauch von Claude Code, also ist das günstigere Modell der Ort, wo die Wirtschaftlichkeit funktioniert. Stand 20. August 2026 liegt die Flash-Ausgabe nach DeepSeeks offiziellen Preisen bei einem Drittel des Pro-Preises. Hebe Pro für Probleme auf, die das zusätzliche Reasoning wirklich brauchen.

Das Fazit

DeepSeek Harness ist ein raues, diszipliniertes, wirklich neuartiges Stück Ingenieurskunst, das die meiste Launch-Berichterstattung als das Falsche beschrieb. Es versucht nicht, Claude Code zu über-Clauden. Es ist ein Modelllabor, das erklärt, die Ebene über dem Modell solle frei sein, und diese Erklärung aus vier Jahre alten Chatbot-Framework-Teilen und den Coding-Werkzeugen der eigenen Rivalen baut. Ob diese Erklärung hält, hängt von den Plugin-Autoren ab, und deren Urteil wird Monate brauchen. Bis dahin ist es die lehrreichste Sechzehn-Minuten-Installation, die ich dieses Jahr gemacht habe.

Wenn du chinesische Modelle oder Agenten-Werkzeuge für etwas Ernsthaftes abwägst, melde dich gern.

Quellen (alle abgerufen am 2026-08-20):