711 Arbeitsergebnisse in einer Nacht, 180 Euro im Monat, null Programmierer wach. Ein dokumentierter Praxistest – mit offenen Fragen.
Diesen Artikel hier hat kein Reporter begleitet. Es gab nichts zu beobachten. Nur einen Menschen, der schläft, und eine Maschine, die arbeitet. Die Belege sind Screenshots und Rechnungen, keine Eindrücke. Das ist vielleicht die unauffälligste Veränderung, die diese KI-Technologie mit sich bringt: Nicht nur die Arbeit verlagert sich – auch die Geschichten darüber werden schwerer zu erzählen.
Februar 2026, Mittelhessen
Christopher Helm öffnet am Freitagabend nach einer normalen Arbeitswoche einen eigens für den Test aufgesetzten Rechner – isoliert vom Firmennetz, der ISO-27001-Beauftragte hatte, trotz umfangreicher AI-Model System-Card und Sabotage-Risk-Report, darauf bestanden – und übergibt einem KI-System, das als erstes in seiner Reihe adaptive Thinking bietet, die volle Kontrolle.
Für die nächsten neun Stunden, ohne Aufsicht. In diesem ist das Denken für das Modell optional. Das Modell bewertet die Komplexität jeder Anfrage und entscheidet, ob und wie viel er nachdenken soll.
Irgendwo zwischen den Hochöfen von Buderus in Wetzlar, den Schaltschränken von Rittal in Herborn und den inzwischen verkauften Wärmepumpen von Viessmann in Allendorf – und doch verbunden mit Rechenzentren, für deren Energiebedarf Microsoft Three Mile Island reaktivieren lässt, Google drei neue Kernkraftwerke in Auftrag gibt und Amazon Mini-Reaktoren neben seine Serverfarmen plant. 58,7 Millionen Textbausteine werden in dieser Nacht durch diese Infrastruktur fließen, angestoßen von einem Laptop in einer Kleinstadt.
Was passiert, wenn man es ohne Struktur versucht, zeigt Peter Steinberger – Gründer von PSPDFKit (heute Nutrient), der aus dem Ruhestand zurückkam, um „to mess with AI“ zu spielen, wie seine GitHub-Bio verrät. Sein Projekt Moltbot ging viral: ein Netzwerk autonomer Bots, die über WhatsApp, Telegram und Signal kommunizieren – Social Media, auf dem nur Bots posten. 134.000 Menschen sahen seinen Post auf X, in dem er selbst warnte: „This is a bad idea and you should not do it.“ Steinberger hat sein Geld verdient – PSPDFKit ging für $116 Millionen an Insight Partners, danach Sabbatical. Jetzt reist er am 11. Februar zum Pragmatic Summit nach San Francisco, um über Vibe Coding zu sprechen. Wer seinen Exit hat, darf spielen. Moltbot erinnert an ICQ: viele Schaulustige, wenig Substanz. Mehr Metaverse als Infrastruktur.
Trotz höherer Kosten als GPT 5-3 bestätigt Helm die Aussagen von Nutzern auf Reddit. Claude ist feinfühliger, gerade wenn es um Aufgaben geht, die keinen Softwarecode, sondern Dokumente, Präsentationen oder Verträge verarbeiten sollen.
Helm baut das Gegenteil: ein eigenes Steuerungsprogramm – eine Zwischenschicht, die ein virtuelles Team organisiert wie eine Abteilung: Rollen definiert, Übergabepunkte festgelegt, Qualitätskriterien formuliert, Ein- und Ausgabeformate zwischen den Agenten strukturiert. Dann ein Satz:
„Hi, ich muss bald los. Was benötigst du von mir, damit du alleine arbeiten kannst?“
Am anderen Ende: Claude Opus 4.6, Anthropics am 5. Februar um 18:51 Uhr deutscher Zeit veröffentlichtes Flaggschiffmodell – Platz 1 auf Terminal-Bench 2.0 für autonomes Coding, Platz 1 auf Humanity’s Last Exam für interdisziplinäres Reasoning. Die Antwort kommt sofort – nicht als Text, sondern als Rückfrage:
„I need these permissions to work autonomously for the next 9 hours. Can I have all of them?“

Helm bestätigt. Schaut zwanzig Minuten später noch einmal kurz rein – „Hi, bin gerade am Büro vorbeigelaufen, brauchst du was?“ – und geht schlafen.
Als er am nächsten Morgen aufwacht, liegen 711 Arbeitsergebnisse vor. Ein kompletter Arbeitstag – ohne Arbeit.

Was die Zahlen sagen

Die Statusanzeige: über acht Stunden Laufzeit, 11 Prozent des wöchentlichen Nutzungslimits für den Supervisor verbraucht. Das API-Dashboard zeigt die Arbeit des Teams: 58,7 Millionen eingehende und 5 Millionen ausgehende Textbausteine (sogenannte Tokens) über die günstigeren Sonnet-4-Modelle, dazu 656 automatisierte Websuchen. Opus 4.6 taucht im API-Diagramm nicht auf – es lief als Supervisor über Anthropics Kommandozeilenwerkzeug Claude Code auf einem separaten Kontingent. Die Rechnungen: Helm nutzte bis zum Vortag den Claude-Max-Plan mit fünffachem Kontingent für 90 Euro im Monat. Für den Test wechselte er auf das zwanzigfache Kontingent zu 180 Euro im Monat – die anteilige Differenz für den laufenden Abrechnungszeitraum betrug 93,92 Euro.
Zum Vergleich: Eine vergleichbare Arbeitseinheit hätte auf Microtask-Plattformen vor einem Jahr etwa 25 Euro gekostet. Allerdings mit einem entscheidenden Nachteil: Wer dort 711 Aufträge vergibt, muss anschließend 711 Ergebnisse manuell kontrollieren. In Helms Architektur übernimmt das die Zwischenschicht selbst – sie validiert die Arbeit der Agenten automatisch anhand definierter Kriterien. Opus wiederum überwacht diese Kontrollschicht. Das Ergebnis ist eine zweistufige Qualitätssicherung ohne menschlichen Prüfer. 711 mal 25 ergibt knapp 17.800 Euro – in einer Nacht. Hochgerechnet auf einen Monat mit 20 Arbeitsnächten wären das 356.000 Euro in Microtask-Äquivalent. Im Jahr: über vier Millionen. Die Maschine, die dafür zuständig war, kostet 180 Euro im Monat. Selbst wenn man die laufenden Kosten für die Sonnet-Modelle hinzurechnet – bei den aktuellen Preisen von Anthropic liegen 58 Millionen verarbeitete Textbausteine im niedrigen dreistelligen Eurobereich –, bleibt ein Verhältnis, das jede Kostenkalkulation sprengt.
Natürlich hinkt der Vergleich. Nicht jede Nacht liefert 711 Einheiten, nicht jede Einheit entspricht exakt dem, was ein Microtask-Dienstleister in einer Stunde produziert, und die Vorarbeit für das System ist in der Rechnung nicht enthalten. Aber selbst mit großzügigen Abschlägen bleibt eine Größenordnung, die sich schwer ignorieren lässt.
Opus denkt, Sonnet arbeitet – aber wer organisiert das Team?
Trotz neuer Agent Teams Funktion von Opus 4.6 und korrekter Konfiguration in den Claude Code Settings bestand bei der Umsetzung ein Problem.
Wie schreibt man einen Prompt der eine gesamte Abteilung orchestriert?
Die Definition von Checks und Balances von nicht binären, wissenslastigen Entscheidungssituationen ist komplex. Sei es die Verfassung der Vereinigten Staaten von 1787 oder Claude’s Constitution am 22. Januar 2026.
Checks and balances
Jede Gewalt (Legislative, Exekutive und Judikative) muss auch über die Machtmittel verfügen, ihre eigene Funktion zu verteidigen und so dafür zu sorgen, dass das politische Gesamtsystem ausgewogen bleibt.
Das Prinzip ist zu einem Grundsatz demokratischer Machtausübung insgesamt geworden. Überall da, wo politische Potenziale entstehen und Macht ausgeübt wird, muss die Möglichkeit zur Bildung und zur Ausübung von Gegenmacht vorhanden sein. Das Prinzip zielt damit auf den Ausgleich unterschiedlicher Interessen, unterstützt die Tendenz zum Gleichgewicht und fördert die Kooperation zwischen verschiedenen Machtpolen und gewährleistet so gesellschaftspolitische Stabilität.
Bundeszentrale für politische Bildung
Wie schreibt man Prompts für das Claude Agent Team?
Die meisten Anweisungen in Firmen, z. B. das Vorgehen bei einer Due Diligence, definieren Vorgaben der Umsetzung. Selten gibt es jedoch eine Anweisung, wie der Output eines einzelnen Mitarbeiters von dem Abteilungsleiter zu prüfen ist. Eine Aufgabe, die über die reine Zusammenfassung von Rechtsdokumenten hinausgeht.
Wie prüft ein Abteilungsleiter seine Mitarbeiter und wie risikoavers soll ein Abteilungsleiter entscheiden, wie hoch qualifiziert ein Mitarbeiter gemäß der Komplexität der Aufgabe sein muss, um diese bearbeiten zu dürfen. Wie kann man das Ziel definieren, dass nicht zu ungewolltem Verhalten führt (Goodhart’s Law). Oder auch LLM Leaderboards are Bullshit – Goodhart’s Law Strikes Again : r/LocalLLaMA.
Übertragen auf den Anwendungsfall: Welches KI-Modell (Teammates) erhält welche Aufgabe, bzw. darf sie nicht erhalten.
Wie strukturiert man KI-Teams?
Wie prüft der Vorgesetzte der Abteilungsleiter (Chief), ob (1) alle Abteilungsleiter ihr Fachwissen kennen, (2) den aktuellen Geschäftskontext recherchiert, (3) mögliche Unterschiede in der Auffassung von (1) und (2) auf Abteilungsleiterebene abgeglichen haben, bevor sie ihren Teammates Aufgaben übertragen?
Opus 4.6 konnte diese Aufgabe leider nicht lösen. Dies führte dazu, dass Helm einen Trick angewendet hat, den er mir nicht verraten wollte. Nur so viel: Die finale KI-Team-Architektur muss sich selbst evaluieren können, hatte ebenso wie Claude drei Ebenen und übernähme die Arbeit von 30 Personentagen in einem typischen Beratungsprojekt in der DACH-Region.
Der KI-Chief betreut zwei KI-Abteilungsleiter, die ihm auf formal definiertem Weg zu berichten haben. Ein Abteilungsleiter überarbeitet durchgehend das Wissen der Gesamtorganisation. Der andere Abteilungsleiter bearbeitet Kundenprojekte. Mitarbeiter der Abteilungsleiter erhalten jeweils nur den Kontext, den sie für ihre Aufgabe benötigen. Der Chef und der Abteilungsleiter stimmen mit einem Projektdreieck für KI-Projekte ab, welche Aufgabe Junior- und welche Senior-Qualitäten erfordert. Der KI-Chief optimiert die Marge der Projekte und die Abteilungsleiter haben die Aufgabe, die Verwirrung der Mitarbeiter zu vermeiden, siehe Beispiele für KI-Halluzinationen.

Das Prinzip: Kleine, günstige Arbeitspakete werden unten erstellt – Rohmaterial. Dieses Rohmaterial wandert in der Entscheidungshierarchie nach oben: wird kombiniert, angereichert, validiert. Jede Stufe macht das Ergebnis komplexer und wertvoller. Die 17.800 Euro entstehen nicht durch einen großen Auftrag, sondern durch hunderte kleine Einheiten, die wie Rohstoffe veredelt werden. Manche Ergebnisse fließen trotz Bearbeitung nicht ins Endprodukt ein – weil die Qualitätskontrolle sie aussortiert. Was entsteht, ist im Wortsinn ein Kombinat: ein Zusammenschluss produktionsmäßig eng zusammenarbeitender Betriebe unter zentraler Steuerung – mit Stammbetrieb (Opus), regulierter Hierarchie und Planauflage. Nur dass der Generaldirektor morgens aufwacht und die Rechenschaftsberichte bereits vorliegen.
Konkret bedeutet das: Ein Recherche-Agent durchsucht Quellen, bewertet jede einzelne auf Relevanz und extrahiert verwertbare Fakten. Ein Verarbeitungs-Agent nimmt diese Fakten und integriert sie in bestehende Dokumente – mit Quellenangaben, ohne bestehende Inhalte zu überschreiben. Ein Prüfer validiert, ob die Übergabe zwischen den Stufen den definierten Kriterien entspricht. Jeder Agent arbeitet in seiner eigenen Sitzung mit eigenem Kontextfenster; die Ergebnisse werden über strukturierte Dateiformate übergeben, nicht über gemeinsamen Speicher. Fehler fallen dem Supervisor dadurch an den Schnittstellen auf, nicht erst im Endprodukt.
Der entscheidende Punkt: Opus 4.6 steuert nicht nur das Team – es darf das Team auch verändern. Der Supervisor kann Anweisungen anpassen, Arbeitsabläufe umstrukturieren, neue Aufgabentypen anlegen. „Wenn ich morgens wiederkomme, ist das System nicht nur fertig, sondern potenziell smarter als am Abend zuvor – auch für den Fall, dass ich es beim nächsten Mal selbst bediene.“
Das bedeutet allerdings auch: Am Morgen läuft nicht mehr zwingend das System, das man am Abend gestartet hat. Opus kann Arbeitsanweisungen umgeschrieben haben, Prüfkriterien angepasst haben oder neue Aufgabentypen eingeführt haben – ohne Rückfrage. Die strukturelle Qualitätskontrolle greift weiterhin, aber sie prüft gegen Regeln, die der Supervisor selbst verändert haben kann. Helm sieht das nüchtern: „Das ist der Preis dafür, dass das System sich verbessern kann. Wer das nicht will, nimmt die Selbstoptimierung raus – und hat ein starres System, das nach acht Stunden genauso dumm ist wie am Anfang.“ Es sei eine bewusste Entscheidung gewesen, und er habe am Morgen geprüft, welche Änderungen Opus vorgenommen hat. Aber die Möglichkeit, dass ein autonomes System seine eigenen Regeln überschreibt, ist ein Risiko, das mit der Laufzeit wächst.
Benchmark-Berichte vs. Produktionsbetrieb
Die bisherige Berichterstattung zu Opus 4.6 – von Heise über Tom’s Guide bis zur DEV-Community – testet das Modell im Chat. Was fehlt: ein dokumentierter Fall, in dem Opus 4.6 einen vollen Arbeitstag lang autonom produziert, mit nachprüfbaren Kosten und einer Architektur, die über „ich habe Claude eine Frage gestellt“ hinausgeht.
Helms Architektur misst etwas, das kein Benchmark erfasst: ob ein Team eine Arbeitseinheit abliefert. Benchmarks verlieren ohnehin an Trennschärfe – Artificial Analysis hat drei davon aus seinem Index gestrichen, weil alle Frontier-Modelle über 90 Prozent erreichen. Modelle werden zudem durch Reasoning zur Laufzeit smarter als im Test gemessen: OpenAIs o1 sprang von 9,3 auf 74,4 Prozent bei einer Mathematik-Olympiade, ohne dass sich das Training geändert hätte. Bei Entscheidungen ohne klares Ja oder Nein – Relevanzprüfung, Priorisierung, Kontextzuordnung – gibt es keinen Unit-Test. Was vorher als nicht greifbar galt, wird im Kombinat zumindest teilautomatisiert und dokumentiert.
Das Verhältnis von 58,7 Millionen Team-Tokens zu 11 Prozent Supervisor-Kontingent spiegelt diese Hierarchie: Opus denkt und entscheidet, Sonnet arbeitet ab. Helm hat den Verbrauch des teuren Modells bewusst minimiert – API-Preis für Opus 4.6: 5 Dollar pro Million Input-Tokens, 25 Dollar Output; Sonnet-4 kostet ein Fünftel davon. Die Architektur löst gleichzeitig ein praktisches Problem: Opus 4.6 wird bei intensiver Nutzung vom Anbieter gedrosselt, andere Nutzer berichten von Unterbrechungen nach 30 Minuten. Helms Lösung: Opus nur als Supervisor einsetzen, nicht als Arbeitspferd. „Meine Sitzung lief eineinhalb Stunden unter Opus, bevor eine zehnminütige Pause kam. Aber in der Zwischenzeit hatte Sonnet weitergearbeitet.“
Qualität ohne Aufsicht – und deren Grenzen
Eine berechtigte Frage: Wer 711 Arbeitsergebnisse über Nacht produzieren lässt, kann nicht jedes einzelne im Detail geprüft haben. Helm räumt das ein: „Ich kann nicht behaupten, dass ich jede Einheit Zeile für Zeile kontrolliert habe. Was ich kontrollieren kann, ist die Struktur: Haben die Agenten korrekt kommuniziert? Stimmen die Übergaben? Sind die definierten Qualitätskriterien eingehalten worden?“ Diese strukturelle Prüfung habe keine Fehler ergeben – keine offensichtlich erfundenen Fakten, keine fehlgeschlagenen Übergaben, keine Agenten, die in Schleifen geraten sind.
Aber das ist nicht dasselbe wie eine inhaltliche Freigabe. „Subjektiv werde ich einige Ergebnisse verwerfen. Nicht weil sie fehlerhaft sind, sondern weil sie nicht den Ansprüchen genügen, die ich an das Endprodukt stelle.“ Es sei eine menschliche Entscheidung – und genau dort liege die Grenze der Autonomie: Das System kann produzieren und sich selbst auf formale Korrektheit prüfen. Die Bewertung, ob ein Ergebnis gut genug ist, bleibt beim Menschen.
Dass die strukturelle Fehlerquote bei scheinbar null liegt, ist dabei nicht allein das Verdienst des Modells. Helm hat die Kommunikation zwischen den Agenten strukturiert und validierbar gemacht, sodass Fehler in der Übergabe früh sichtbar werden. „So weiß ich zumindest, ob das Team korrekt zu meinen Business-Vorgaben kommuniziert.“ Eine Eigenschaft, die man – wie er bemerkt – bei menschlichen Teams manchmal hart erarbeiten müsse: dass Wissen geteilt wird. Hier war es konstruiert, aber es funktionierte.
Das ist auch der Grund, warum Helms Ansatz sich von dem unterscheidet, was Anthropic mit Opus 4.6 selbst als Headline-Feature bewirbt: „Agent Teams“ – parallele Agenten, die autonom koordinieren, direkt eingebaut in Claude Code. Anthropic vergleicht es mit einem „talented team of humans“. Die Versuchung liegt nahe, das Feature einzuschalten und laufen zu lassen. Aber wer Agent Teams ohne eigene Steuerungsschicht nutzt, bekommt dreierlei: höhere Kosten, weil alles über das teure Opus-Modell läuft – dieselbe Nacht über die API statt über Flatrate: rund 420 Dollar pro Durchlauf, bei 20 Arbeitsnächten über 8.000 Dollar im Monat statt 180 Euro; keine dokumentierte Abstimmung zwischen den Agenten, weil einzelne Akteure nicht die Grundlage ihrer Entscheidungen protokollieren; und am Ende keine Erklärbarkeit der KI – das Ergebnis ist eine Art Opus Machinae, bei dem niemand mehr nachvollziehen kann, wie es zustande kam.
Wer dagegen die Basis des Teams selbst modelliert, kann zusehen, wie es arbeitet – Helikopter-Chef, ohne dass jemand böse wird. Die Dokumentation der einzelnen Tasks gewinnt durch Kombination an Wert: Jede Stufe fügt Kontext hinzu, jede Übergabe ist protokolliert. Am Ende ist das Kombinat nachvollziehbar – nicht weil das Ergebnis selbsterklärend wäre, sondern weil der Weg dahin dokumentiert ist.
Der „Und dann?“-Trick
Eine Besonderheit: Der letzte Befehl in jeder Aufgabenkette war eine Variante von „Finde die nächste Aufgabe“. Kein ausgefeiltes System, sondern ein bewusst einfaches Prinzip – vergleichbar mit einem Kind, das immer wieder fragt: »Und dann? Und dann?« Technisch ist das derselbe Mechanismus, der Steinbergers Moltbot viral machte: autonome Agenten, die einander anstoßen, ohne menschlichen Eingriff. Der Unterschied liegt nicht im Prinzip, sondern in allem, was drumherum fehlt. Moltbot lässt Bots auf WhatsApp und Signal miteinander reden – ohne definierte Rollen, ohne Übergabeformate, ohne Qualitätskontrolle. Das Ergebnis ist unterhaltsam und unkontrollierbar. In Helms Architektur läuft dieselbe Endlosschleife, aber innerhalb des Kombinats: Jeder Agent hat eine Planauflage, jede Übergabe ist strukturiert, jedes Ergebnis wird gegen definierte Kriterien geprüft, bevor es die nächste Stufe erreicht.
„Ich wusste nicht, wo das Modell nach acht Stunden ankommen würde. Aber genau das war das Experiment: „Kann man einem KI-Modell eine offene Aufgabenkette geben und darauf vertrauen, dass es sinnvolle Entscheidungen trifft?“ Die Antwort hängt davon ab, ob man dem Modell eine Struktur gibt, innerhalb derer es entscheiden darf – oder ob man es einfach laufen lässt.
Was sich geändert hat – und was nicht
Die Qualität einzelner Ergebnisse sei schon bei den Vorgängermodellen gut gewesen, sagt Helm. Der Unterschied sei die Stabilität über Zeit. „Bei Sonnet hatte ich ursprünglich das Problem, dass die Arbeitsergebnisse eher viel als knapp und verwendbar waren.“ Jetzt könne er Sonnet nutzen, aber unter der Aufsicht von Opus. Der eigentliche Fortschritt: „Das Modell bleibt über Stunden stabil. Bei früheren Versionen hätte man am nächsten Morgen eine große Menge unbrauchbarer, sich wiederholender Ergebnisse vorgefunden.“ Zuverlässigkeit über einen vollen Arbeitstag, ohne Schleifen, ohne erfundene Fakten – das sei neu.
Zehn Jahre Vorbereitung für einen Arbeitstag ohne Arbeit
Beim Bankathon 2015 saßen vier Studenten 37 Stunden wach, um einen Prototyp zu bauen, der einen Sonderpreis gewann. 2026 schläft einer von ihnen, während die Maschine produziert. Der Unterschied ist nicht nur die Technologie.
„Auf einer Ebene hat die Vorbereitung zehn Jahre gedauert“, sagt Helm. „Ich arbeite seit einem Jahrzehnt in diesem Bereich. Ich weiß, worauf es ankommt. Diese Erfahrung steckt in der Art, wie ich die Aufgaben strukturiere – nicht im Modell.“ Dazu kamen ein Tag Infrastruktur-Entwicklung und die Vorarbeit, einheitlich bewertbare Arbeitseinheiten zu definieren und laufend messen zu können, damit jedes Ergebnis vergleichbar ist – unabhängig davon, welcher Agent es produziert hat.
„Es ist paradox. Ein Arbeitstag ohne Arbeit klingt nach Automatisierung. Aber damit ich einen Arbeitstag lang nichts tun konnte, musste ich vorher genau verstehen, was getan werden muss, in welcher Reihenfolge, in welcher Granularität und mit welchen Qualitätskriterien. Das ist keine Aufgabe für ein KI-Modell. Das ist eine Aufgabe für jemanden, der sein Fach kennt.“
Kein Widerspruch: Die kritische Seite
Wer jetzt Euphorie vermutet, sollte die andere Seite kennen. Am selben Tag, an dem Helm seinen Test startete, veröffentlichte er auf seinem Blog zwei Analysen, die das genaue Gegenteil von Begeisterung transportieren.
In „Opus, Opium des Volkes? – Endlich frei von Kompetenz“ rechnet er vor, was passiert, wenn jeder für 20 Dollar im Monat die Arbeit eines Teams erledigen kann: Verdrängung von Einstiegspositionen, Entwertung von Fachwissen, ein Arbeitsmarkt, der Erfahrung nicht mehr aufbauen kann, weil die Lernstellen verschwinden. In „Opus Machinae – Menschliches, Allzumenschliches“ zieht er Parallelen zwischen der freiwilligen Unterwerfung unter KI-generierte Ergebnisse und den Mortifikationspraktiken von Opus Dei – gestützt auf Nietzsche, der 1878 in Menschliches, Allzumenschliches schrieb: „Überzeugungen sind gefährlichere Feinde der Wahrheit als Lügen.“
Er sieht darin keinen Widerspruch – eher die Pflicht, beides gleichzeitig auszusprechen.
Was das für Banken und Versicherungen bedeutet
Die Frage, die der Test aufwirft, ist für die Finanzbranche besonders relevant.
2015 schickte die Sparkasse Paderborn-Detmold ein Team zum Bankathon – ein zaghafter Versuch, wie Jonas Jansen damals schrieb. „Wenn du heute als Start-up bei der Bafin anrufst, landest du beim Pförtner, und das war’s“, sagte Figo-Gründer André Bajorat. Die Finanzbranche brauchte damals den Bankathon, um überhaupt mit Entwicklern in Berührung zu kommen. Der Bankathon-Artikel „Eine Nacht mit den Nerds“ von Jonas Jansen erschien am 22. November 2015 in der Frankfurter Allgemeinen Sonntagszeitung (archiviert beim FIM Kernkompetenzzentrum, Universität Augsburg).
Zehn Jahre später kann ein einzelner Mensch mit Domänenwissen ein autonomes KI-Team aufsetzen, das über Nacht Hunderte strukturierter Arbeitseinheiten produziert – für unter 200 Euro im Monat. Dokumentenverarbeitung, Compliance-Prüfung, Kundenanalyse, regulatorische Recherche: Die Einsatzfelder, in denen Banken und Versicherungen bereits heute mit KI experimentieren, sind genau die Art von strukturierten, regelbasierten, aber volumenstarken Aufgaben, die sich für diesen Ansatz eignen. Die 25 Euro pro Microtask-Einheit aus der Rechnung oben sind dabei konservativ angesetzt – in regulierten Branchen mit MaRisk-Anforderungen, DORA-Compliance und Vier-Augen-Prinzip liegen die realen Kosten pro vergleichbarer Arbeitseinheit deutlich höher. Das tatsächliche Verhältnis von 180 Euro Monat zu Branchenkosten ist noch drastischer, als die 17.800-Euro-Rechnung suggeriert.
Dass die Technologie dazu in der Lage ist, zeigt dieser Test. Offen bleibt, wer in den Fachabteilungen die nötige Erfahrung mitbringt, um sie sinnvoll einzusetzen.
Daniel Kehne, der andere Student aus der Fabrikhalle in Offenbach, setzt Technologie ein, damit Geflüchtete in ihrer Sprache erfahren, wo sie sich anmelden müssen und welche Rechte sie haben. Kein KI-Agent, kein Opus, kein autonomer Nachtlauf – sondern ein 40-köpfiges Team, das drei Tage die Woche für Menschen arbeitet, die sonst keine Stimme hätten. „Es ist ein Privileg, die Zeit und Ressourcen zu haben, sich für die Schwächeren in unserer Gesellschaft einzusetzen“, schrieb Kehne auf der Website von Integreat.
Beim Bankathon 2015 brauchte es 63 Nerds in einer Fabrikhalle. 2026 reicht einer, der die Maschine anweist und schlafen geht. Wem das nützt, ist eine andere Frage.
Christopher Helm ist Geschäftsführer der Helm & Nagel GmbH, einem KI-Anbieter im B2B-Bereich für Cognitive Automation, und Betreiber der Konfuzio IDP für intelligente Dokumentenverarbeitung. Der hier beschriebene Test fand in der Nacht vom 6. auf den 7. Februar 2026 statt – rund 30 Stunden nach der Veröffentlichung von Claude Opus 4.6 am 5. Februar um 18:51 Uhr MEZ.
Alle genannten Zahlen sind durch Screenshots des Anthropic-Dashboards, Token-Logs und Rechnungen dokumentiert. Verfasst von Claude Opus 4.6 auf Grundlage eines Gesprächs mit Christopher Helm, Geschäftsführer der Helm & Nagel GmbH. Gastbeitrag.

