Echtzeit als Anwendungsfall: Wenn das Frame-Budget die Architektur bestimmt
Spiele, Handel und Sprachagenten haben ein gemeinsames Problem: Die Entscheidung muss in ein Zeitfenster passen, das ein Token-für-Token-Modell nicht einhalten kann.
Dass TypeSafe zur Demonstration ein Modell Doom spielen lässt, wirkt auf den ersten Blick wie Effekthascherei. Es ist aber das sauberste Argument der ganzen Ankündigung, weil es eine Eigenschaft sichtbar macht, die sich nicht wegoptimieren lässt: ein festes Zeitbudget.
Dieser Beitrag sammelt die Anwendungsfälle, bei denen Latenz nicht Komfort ist, sondern Bedingung, und beschreibt, woran sie bisher gescheitert sind.
01. Warum Doom das bessere Argument ist als der Benchmark
Ein Spiel liefert die Bedingungen, die ein Benchmark verschweigt. Der Aktionsraum ist fest und klein. Der Zustand ist vollständig beschreibbar. Und es gibt ein hartes Zeitfenster, in dem geantwortet sein muss, sonst ist die Antwort wertlos, egal wie gut sie ist.
Genau an dieser Stelle scheitert ein Token-für-Token-Modell nicht an Intelligenz, sondern an Verfahren. Der Nachweis ist deshalb keine Spielerei: Wer zeigt, dass eine Entscheidung in ein Frame-Budget passt, hat gezeigt, dass sie auch in ein Zahlungsvorgang-Budget passt.
02. Die Spiele-Projekte als Belastungstest
Die Community hat das schnell durchdekliniert. typesafe-snake lässt den Code die legalen Züge erzeugen und das Modell einen davon je Tick wählen. jev-plays-pokemon-red läuft auf einem Emulator und ruft das Modell nur an Verzweigungen auf, mit Brier-Scores auf den eigenen Vorhersagen als Qualitätsmaß. Dazu kommen Mario-, Drohnen- und Fahr-Demos, mehrere davon in unter einer Stunde gebaut.
Der Blitzschach-Test ist die klarste Zahl aus dieser Gruppe. Jev antwortete in rund 2,6 Sekunden je Zug, während Vergleichsmodelle 6 bis 15 Sekunden brauchten und aus gewonnener Stellung auf Zeit verloren. Die Zugqualität war nicht der entscheidende Faktor, die Einhaltung des Budgets war es.
03. Handel, Sprachagenten und Browser-Automatisierung
Dieselbe Eigenschaft trägt Anwendungen ohne Spielcharakter. jev-trader baut eine Marktentscheidungsschleife im Sub-Sekunden-Bereich und dokumentiert Trocken- und Echtbetrieb getrennt. QuantDinger setzt das Modell als Vorprüfung vor einen Einstieg und blockiert abgelehnte Aufträge, mit protokolliertem Rückfallpfad.
Bei Sprachagenten geht es um die Entscheidung, ob unterbrochen werden darf und wann eine Antwort beginnt. Das muss im Rhythmus eines Gesprächs passieren, also deutlich unter einer Sekunde. Browser-Automatisierung hat dasselbe Profil: Welches Element ist gemeint, aus einer sichtbaren Menge, sofort. Für gesprochene Navigation werden rund 0,0002 US-Dollar je Entscheidung bei etwa 300 Millisekunden berichtet.
04. Was das für gewöhnliche Systeme bedeutet
Die meisten B2B-Systeme haben kein Frame-Budget, aber sie haben Budgets, die niemand aufgeschrieben hat. Ein Zahlungsvorgang darf nicht auf eine Betrugsbewertung warten. Eine Suchanfrage darf nicht auf die Neusortierung ihrer Treffer warten. Ein Assistent, der drei Sekunden braucht, wird nicht benutzt, egal wie gut die Antwort ist.
Diese Budgets waren bisher der Grund, warum Prüfungen weggelassen wurden. Fällt die Begründung weg, fällt auch der Grund weg. Wie sich ein Antwortzeitbudget für einen KI-Assistenten überhaupt aufteilt, haben wir in Antwortzeit eines KI-Assistenten beschrieben.
05. Die harten Grenzen im Echtzeitbetrieb
Ein Auswahlaufruf trägt bis zu 255 Optionen, eine Skala 2 bis 10 Stufen. Die Ratengrenzen liegen bei rund 250.000 Tokens je Sekunde und 1.200 Anfragen je Minute und sind laut Anbieter dynamisch. Für eine Schleife, die zehnmal je Sekunde entscheidet, ist die Anfragegrenze und nicht die Latenz der bindende Faktor.
Und es bleibt bei Text. Kein Bild, kein Audio, kein Video. Wer einen Spielzustand oder eine Kameraszene bewerten lassen will, muss sie vorher in eine Zustandsbeschreibung übersetzen. Diese Übersetzung ist die eigentliche Ingenieursarbeit, nicht der Modellaufruf.

