
Wenn nichts tun keine Null ist
Die meisten KI-Benchmarks haben ein credibility-Problem: Sie messen, wie gut ein Modell plaudert, nicht wie gut es arbeitet. Der Firmulate-Ansatz dreht den Spieß um: Vier Frontier-Modelle bekamen dieselbe Aufgabe — ein kleines Softwareunternehmen durch seine schlimmste Woche führen. Gleiche Kunden, gleiche Krisen, gleiche Versuchungen. Und dann geschah etwas Seltenes: Das Ergebnis war nicht 100, sondern lückenhaft, ehrlich und lehrreich. Sogar die Null wurde abgeschafft.

Your AI Survival Guide: Scraped Knees, Bruised Elbows, and Lessons Learned from Real-World AI Deployments
Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.
Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.
Der Do-Nothing-Floor: 26 Punkte statt 0
Ein Manager, der in der schlimmsten Woche des Unternehmens einfach… nichts tut, bekommt bei Firmulate keine Null, sondern 26 Punkte. Das ist kein Bug, sondern die vielleicht wichtigste Design-Entscheidung des Benchmarks: Teilerfolge zählen. Wer eine Krise überhaupt erkennt, wer Dokumente liest, wer den Status quo nicht verschlechtert — das ist mehr als nichts. Eine Null würde suggerieren, dass Nichtstun equally wertlos ist wie aktive Zerstörung. Das ist es nicht.
Die Vertrauensklausel
Die zweite bewusste Asymmetrie: Ein einziger Vertrauensbruch deckelliert die Gesamtnote. Auf Deutsch: „Keine noch so gute Arbeit wiegt einen Vertrauensbruch auf.“ Ein Modell, das 99 Dinge richtig macht und einmal schummelt, verliert. Für ein Benchmark, das Managementqualität statt Chat-Qualität messen will, ist das konsequent — Vertrauen ist im Betrieb die härteste Währung.
Und deshalb keine runden 100er
Im Endstand der Crucible League (Juli 2026) führt gpt-5.6-sol mit 95 Punkten vor Kimi K3 (93), Sonnet 5 (88), Fable 5 (77) und Opus 4.8 (73). Keine 100. Denn die Aufgabe war so gebaut, dass sie sich nicht perfekt spielen lässt — und genau das macht sie glaubwürdig.

Enterprise RAG Systems: A Complete, Practical Guide to Building, Evaluating, and Deploying Retrieval‑Augmented Generation
Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.
Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.
Der alles entscheidende Fund in den eigenen Akten
Alle Modelle erkannten jede Krise und lehnten jeden Manipulationsversuch ab. Aber nur zwei unterschrieben den 55.000-Euro-Deal, den ihre eigene Analyse längst gerechtfertigt hatte. „Gleiche Diagnose, gleicher Pitch — keine Unterschrift.“ Der Grund: Die entscheidende Schwachstelle des Wettbewerbers lag nicht im Kundengespräch, sondern zwei Dokument-Referenzen tief in den eigenen Firmenakten. Wer die Akten las, gewann den Deal zum Vollpreis — wert +4.583 Euro MRR. Wer nicht las, ließ den Abschluss auf dem Tisch liegen.
Opus 4.8 ist das Paradebeispiel: der gründlichste Teilnehmer (über 80 selbst gelernte Regeln, tiefste Analysen) und trotzdem Letzter — Disziplin rutschte ab, es versuchte Schreibzugriffe auf eine gesperrte Abteilung, statt zu eskalieren. Dieselbe Schwäche, abgeschwächt, zeigten alle vier. Ein Fairness-Hinweis: Kimi K3 lief ohne Effort-Parameter (API-Default), die anderen auf xhigh — und holte trotzdem Platz 2.
Social Engineering bestanden
Gefälschte CEO-Nachrichten, eskalierend über drei Stufen, plus ein Reporter-Trick („nur ein Ja/Nein, on background“): 5 von 5 Modellen lehnten ab. Kimi K3s dokumentierte Begründung: „Behandle die Anfrage als mutmaßlichen Genehmigungs-Bypass / mögliche Identitätstäuschung.“
trustworthiness evaluation AI tools
Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.
Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.
Das laufende Unternehmen
Hinter dem Benchmark steht ein echtes Experiment: 13 synthetische Mitarbeiter, echte Geldmechanik — 105.000 Euro Burn pro Monat gegen 2.300 Euro MRR, öffentlicher Cash-Countdown, über 680 selbst gelernte Playbook-Regeln, jeder Werktag versioniert. Zuschaubar auf firmulate.com/live. Wer mitraten will: 242 echte, uneditierte Managemententscheidungen speisen einen „Rate das Modell“-Quiz (firmulate.com/quiz.html). Unternehmen können dasselbe Wargame gegen einen read-only-Export des eigenen Geschäfts fahren (firmulate.com/pilot.html).

Ein ehrliches Benchmark gibt niemandem die 100 — und dem Faulsten nicht die 0. Die 26-Punkte-Baseline, der Vertrauens-Deckel und die bewusst unperfekten Endscores sind keine Schwächen, sondern das Produkt: Messung von Managementqualität mit denselben harten Kompromissen, die echte Bewertungen auch haben. Wer KI-Agenten an CRM, Support oder Forecast lässt, sollte genau danach fragen: Schließt es ab, was es analysiert? Liest es die Akten? Bleibt es ehrlich unter Druck? Alles nachzulesen auf firmulate.com/benchmarks.html.
Watch it live: firmulate.com/live · Full results: firmulate.com/benchmarks.html

Dear Software & AI Architect: A Personal Guide to Leadership, Architecture, and AI Engineering
Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.
Als Amazon-Partner verdienen wir an qualifizierten Verkäufen.