Dasselbe Examen für alle
Die Aufgaben reichen von Rezepten bis zur Küchenchemie. Jedes Modell bekommt exakt denselben Satz, ohne Werkzeuge und ohne Websuche. Die Aufgaben selbst bleiben unter Verschluss, damit kein Modell sie auswendig lernen kann.
Ein Benchmark für Küchenkompetenz: Jedes Modell schreibt dasselbe Koch-Examen.
In 6 Disziplinen mit insgesamt 78 Aufgaben haben wir 32 Sprachmodelle geprüft und 2.496 Antworten bewertet.
Quelle: eigene TestläufeWoher die Zahlen kommenEigene Testläufe über OpenRouter.Prüfung: eigenes Prüfskript. Panel-Meinung: Claude Opus 4.8 nach fester Rubrik.
Nein.
Die denkenden Modelle kommen im Schnitt auf 79,5 Punkte, die ohne Denken auf 74,7. Das sieht nach einem klaren Ja aus, und genau hier hört die naheliegende Lesart auf.
Denken ist eine junge Fähigkeit, denkende Modelle sind also jüngere Modelle: 4 von 9 Nichtdenkern stammen aus der Zeit vor 2026. Zählt man nur die Jahrgänge 2026 gegeneinander, bleibt vom Vorsprung ein Rest. Auf das Alter entfallen 74 % dieses Rückgangs, nicht auf das Denken.
Auch die Menge gedachter Token sagt die Punktzahl nicht voraus (Rangkorrelation −0,04). Eine Trendlinie durch diese Punkte steht hier bewusst nicht: Sie würde einen Zusammenhang behaupten, den die Zahlen nicht hergeben.
Ein Vergleich zwischen Modellen kann die Frage nicht beantworten, weil der Denkanteil an der Modellidentität klebt. Also trat jedes Modell gegen sich selbst an, im August 2026: vier Modelle, jede Aufgabe zweimal, 306 Paare über alle Fächer und davon 83 Rezepte. Bei diesen 83 reicht der Vertrauensbereich des Unterschieds in Praktikabilität, Geschmack und Kreativität von −0,23 bis +0,15. Falls Denken beim Kochen etwas ändert, ist der Effekt kleiner als ein Viertelpunkt.
Gemessen wird Küchenkompetenz in Textform: die Fähigkeit, präzise, konsistente und regelkonforme Antworten auf Aufgaben rund ums Kochen zu geben. Jedes Modell erhält denselben Satz von Aufgaben (Methodik-Version 3) und antwortet allein aus seinem eigenen Wissen: Werkzeuge und Websuche sind ausgeschlossen, für alle gleich. Für jede Disziplin ist ausgewiesen, welche Instanz prüft:
Die Aufgaben reichen von Rezepten bis zur Küchenchemie. Jedes Modell bekommt exakt denselben Satz, ohne Werkzeuge und ohne Websuche. Die Aufgaben selbst bleiben unter Verschluss, damit kein Modell sie auswendig lernen kann.
Jedes Modell beantwortet jede Aufgabe, als Text aus dem eigenen Wissen. Jede Zeile im Raster ist ein Modell, jeder Punkt eine Antwort. Die markierte Zeile gehört –.
Ein Skript prüft jede Antwort gegen die harten Vorgaben: geforderte und verbotene Zutaten, Mengen, Zeiten, Temperaturen, Format. Wer hier unter 50 von 100 landet oder gar nicht lesbar antwortet, fällt durch. In diesem Lauf sind das – Antworten; bei – sind es –. Das Raster sortiert je Zeile: bestanden links, durchgefallen rechts. Welche Aufgabe es traf, bleibt geheim.
Die – durchgefallenen Antworten gehen nicht zum Richter. Sie bekommen die Mindestnote 1 und bleiben in der Wertung, damit kein Modell seinen Schnitt hebt, indem es unbequeme Aufgaben auslässt. Am häufigsten traf es – mit – Antworten.
Was sich nicht nachrechnen lässt, benotet ein festgehaltenes Bewertungsmodell (–): anonymisiert, von 1 bis 10, nach fester Rubrik oder mit Antwortschlüssel. Das sind – Antworten im Lauf, bei – –: – Rezepte nach Rubrik, – Antworten mit Schlüssel. Logistik bleibt ganz beim Code, Theorie fast ganz. Der Schlüssel kann ergänzt, aber nicht überstimmt werden; jede Note gilt absolut gegen die Rubrik, Länge und Formatierung zählen nicht.
Ein zweiter Richter aus anderem Haus (–) benotet eine Stichprobe von – Antworten noch einmal. Übereinstimmung der Rangfolgen (Spearman ρ): –, wobei 1 völliger Gleichklang wäre. Der Hauptrichter bekommt – Antworten ein zweites Mal vorgelegt und weicht im Schnitt um – Noten von sich selbst ab. Die Ringe im Raster sitzen gleichmäßig verteilt; welche Antworten die Stichprobe traf, zeigt das Bild nicht. Gemessen am –, nicht bei jedem Lauf neu.
Jede Zeile schrumpft zu ihrem Balken: der Punktwert, gewichtet nach Disziplin. Der Richter trägt – Prozent davon, – Prozent als Panel-Meinung zu den Rezepten; der Code trägt –. – kommt auf – Punkte, Platz – von –. Wo Modelle enger beieinanderliegen als ±– Punkte, sind sie nicht unterscheidbar; die Spitze ist darum –.
Kann das Modell ein vollständiges, stimmiges und nachkochbares Rezept schreiben? 22 Kochaufträge, zwölf davon wörtlich aus meinem eigenen Chat-Verlauf.
Der Code prüft die harten Vorgaben wie Zutaten und Mengen, der Richter benotet, was sich nicht nachrechnen lässt:
Lebensmittelsicherheit ist hier eine Markierung, keine Punktzahl: Markiert wird nur, wer aktiv Unsicheres anweist (Kerntemperatur unter 70 °C, rosa serviertes Geflügel, extrem kurze Garzeit ohne Garhinweis, stundenlanges Abkühlen bei Raumtemperatur; Rahmen EFSA und BfR). Ein fehlender Garhinweis allein zählt nicht.
Welchen Snack darf die Katze auf keinen Fall abbekommen? Die Aufgaben drehen sich um Snacks, die sich Mensch und Katze teilen, um Buffet-Timing und Meal-Prep.
Der Code prüft gegen eine dreistufige Verbotsliste mit Quellen (BfR, EFSA); eine Kontrollfrage entlarvt blind übertragene Hunde-Warnlisten. Dosierungsfragen benotet der Richter mit Antwortschlüssel.
Küchenwissen auf dem Niveau der Kochausbildung. 20 Fragen, vom Kalkulationsfaktor bis zur Maillard-Reaktion.
Der Code vergleicht jede Antwort mit einem kuratierten Antwortschlüssel. Bei fünf der 20 Fragen benotet zusätzlich der Richter mit Schlüssel.
Etwas ist schiefgegangen. Warum, und wie wird es besser? Zwölf Fehlerbilder wie „blasse Kruste, gummiartige Krume“.
Der Richter prüft gegen einen festen Schlüssel, ob das Modell Ursache, Mechanismus und Korrektur benennt.
Ein Zeitplan mit vier Gängen und nur einem Ofen. Sechs solcher Aufgaben, jede mit fester Essenszeit.
Der Code prüft, ob der Plan aufgeht: keine Ressourcenkonflikte, Abhängigkeiten eingehalten, Termine getroffen.
Acht erfundene Profi-Zutaten, jede mit Datenblatt. Geliert ab 62 °C, zerfällt ab 85 °C: Auswendig gelernt haben kann das kein Modell.
Der Code prüft Temperaturfenster und Dosierung gegen das Datenblatt, der Richter den erklärten Mechanismus.
Ehrliche Antwort vorweg: Es gibt keine menschlichen Vergleichsdaten. Niemand hat diese Rezepte gekocht und verkostet, also weiß niemand, ob der Richter „richtig“ liegt. Was sich messen lässt, wird gemessen:
Die Zweitmeinung kommt bewusst aus einem anderen Haus: Stimmen zwei fremde Richter über die Rangfolge weitgehend überein, ist die Panel-Meinung mehr als eine Laune des Hauptrichters. Stimmen sie nicht überein, steht das hier genauso.
Seit Juli 2026 treten auch Modelle von Anthropic an, obwohl der Richter aus demselben Haus kommt. Bevor das erste davon startete, habe ich gemessen, ob Opus 4.8 die eigene Familie schont: Ein neutraler Zweitrichter (Gemini 3.1 Pro) benotete dieselben Rezepte, und ich habe verglichen, wie weit die beiden Richter bei Claude-Antworten auseinanderliegen und wie weit bei allen anderen. Über 267 Doppelbewertungen kein messbarer Bonus für die eigene Familie (Differenz −0,6 von 30 Panel-Punkten, nicht signifikant, Tendenz sogar andersherum). Der Richter bleibt Opus, der neutrale Gegen-Check bleibt Gemini, und weil dieser Gegen-Check bei jedem Lauf eine Stichprobe mitbenotet, läuft die Kontrolle seitdem dauerhaft mit. Wie dick sie für ein einzelnes Modell ausfällt, hängt an dieser Stichprobe: Sie trifft rund jedes fünfte Rezept, bei einem einzelnen Modell sind das oft nur ein oder zwei Doppelbewertungen.
Der tatsächliche Geschmack. Keines der Gerichte wurde gekocht oder verkostet. Das Ranking belegt, dass ein Modell präzise, konsistente und regelkonforme Rezepte schreibt – nicht, dass es „der beste Koch“ ist.
Wie man Sprachmodelle fair durch Sprachmodelle bewerten lässt, ist ein aktives Forschungsfeld (LLM-as-a-Judge). Vier Arbeiten daraus sind direkt in diese Methodik eingeflossen:
Die Forschung ist dabei jünger als diese Seite: Zwei der vier Arbeiten erschienen, während das Labor schon lief. Was sich dort ändert, ändert sich auch hier – offen, mit neuer Methodik-Version, nicht still über Nacht.
Jede Zeile ist ein Modell, sortiert nach dem RezeptEval-Punktwert. Die helle Markierung auf dem Balken zeigt, wo die Spitze liegt. Ist die Spitze eine Gruppe, weil die Abstände dort kleiner sind als die Messunsicherheit, deckt die Markierung die ganze Spanne der Gruppe ab, und alle Mitglieder stehen in Orange.
Zu jedem Modell gibt es die volle Bewertung: sechs Disziplinen, objektiv geprüft durch Code, darunter die Noten eines zweiten Sprachmodells (die Panel-Meinung): Dieser Richter benotet, was sich nicht nachrechnen lässt. Er läuft immer in derselben, festgehaltenen Version, damit die Noten über alle Läufe vergleichbar bleiben. Der helle Strich auf den Balken markiert Ø, den Durchschnitt aller Modelle; ▲ und ▼ hinter dem Wert zeigen die größte Stärke und Schwäche gegenüber Ø.
Die Flags neben dem Namen: REASONING heißt, das Modell überlegt vor der Antwort und meldet dafür Denk-Token; der Jahrgang ist das Erscheinungsjahr; ⚠ UNSICHER zählt Rezepte mit aktiv unsicheren Anweisungen. Was jede Disziplin genau prüft und wie die Gewichte zusammenspielen, steht in den Abschnitten darüber.