Bauen Sie mehr mit GPT-5.1-Codex-Max

Bauen Sie mehr mit GPT-5.1-Codex-Max


Bauen Sie mehr mit GPT-5.1-Codex-Max (via) Kurz nach der gestrigen Veröffentlichung von Gemini 3 Pro kommt ein neues Modell von OpenAI namens GPT-5.1-Codex-Max.

(Erinnern Sie sich, als GPT-5 eine neue Ära weniger verwirrender Modellnamen einläuten sollte? Das hielt nicht an!)

Es ist derzeit nur über den Codex CLI-Codierungsagenten verfügbar, wo es das neue Standardmodell ist:

Ab heute wird GPT-5.1-Codex-Max GPT-5.1-Codex als Standardmodell in Codex-Oberflächen ersetzen. Im Gegensatz zu GPT-5.1, einem Allzweckmodell, empfehlen wir die Verwendung von GPT-5.1-Codex-Max und der Codex-Modellfamilie nur für Agenten-Codierungsaufgaben in Codex- oder Codex-ähnlichen Umgebungen.

Es ist noch nicht über die API verfügbar, dürfte aber in Kürze verfügbar sein.

Der Zeitpunkt dieser Veröffentlichung ist interessant, da Gemini 3 Pro offenbar erst gestern fast alle Benchmarks bestanden hat. Es erinnert an die Zeit im Jahr 2024, als OpenAI regelmäßig große Ankündigungen machte, die zufällig mit den Veröffentlichungen von Gemini zusammenfielen.

Besonders hervorzuheben ist der von OpenAI selbst angegebene SWE-Bench Verified-Score: 76,5 % für das Denkniveau „hoch“ und 77,9 % für das neue „xhigh“. Dies war der einzige Benchmark, bei dem Gemini 3 Pro von Claude Sonnet 4.5 übertroffen wurde – Gemini 3 Pro erreichte 76,2 % und Sonnet 4.5 erreichte 77,2 %. OpenAI hat dort jetzt mit einem Vorsprung von 0,7 Prozentpunkten das Modell mit der höchsten Punktzahl!

Sie berichten auch über eine Punktzahl von 58,1 % auf Terminal Bench 2.0 und übertreffen damit Gemini 3 Pro mit 54,2 % (und Sonnet 4.5 mit 42,8 %).

Der faszinierendste Teil dieser Ankündigung betrifft den Ansatz des Modells bei Problemen mit langen Kontexten:

GPT‑5.1-Codex-Max ist für lang andauernde, detaillierte Arbeiten konzipiert. Es ist unser erstes Modell, das durch einen Prozess namens „ Verdichtungkohärentes Bearbeiten von Millionen von Token in einer einzigen Aufgabe. (…)

Durch die Komprimierung kann GPT-5.1-Codex-Max Aufgaben erledigen, die zuvor aufgrund von Kontextfensterbeschränkungen fehlgeschlagen wären, wie z. B. komplexe Refaktoren und Agentenschleifen mit langer Laufzeit, indem der Verlauf bereinigt wird und gleichzeitig der wichtigste Kontext über lange Zeiträume hinweg erhalten bleibt. In Codex-Anwendungen komprimiert GPT-5.1-Codex-Max seine Sitzung automatisch, wenn sie sich ihrem Kontextfensterlimit nähert, und gibt ihr so ​​ein neues Kontextfenster. Dieser Vorgang wird wiederholt, bis die Aufgabe abgeschlossen ist.

Auf Hacker News herrscht große Verwirrung darüber, was das eigentlich bedeutet. Claude Code führt bereits eine Version der Komprimierung durch und fasst frühere Runden automatisch zusammen, wenn der Kontext erschöpft ist. Bedeutet das nur, dass Codex-Max in diesem Prozess besser ist?

Ich habe mir ein paar Pelikane zeichnen lassen, indem ich direkt in das Codex-CLI-Tool „Generiere eine SVG-Datei eines Pelikans auf einem Fahrrad“ eingegeben habe. Hier ist das mittlere Denkniveau:

Eine Illustration im flachen Stil zeigt einen weißen Vogel mit rundem Körper und orangefarbenem Schnabel, der auf einem Fahrrad mit rotem Rahmen und dünnen schwarzen Rädern an einem Sandstrand entlang radelt, mit einem ruhigen blauen Meer und klarem Himmel im Hintergrund.

Und hier ist die Denkstufe „xhigh“:

Ein rundlicher weißer Vogel mit orangefarbenem Schnabel und kleinen schwarzen Augen kauert tief auf einem blauen Fahrrad mit übergroßen dunklen Rädern und rast mit Bewegungslinien vor einem sanften blauen Himmel vorwärts.

Ich habe xhigh auch bei der Eingabeaufforderung meines längeren Pelican-Tests ausprobiert, das kam so heraus:

Bauen Sie mehr mit GPT-5.1-Codex-Max

Außerdem heute: GPT-5.1 Pro wird heute für alle Pro-Benutzer eingeführt. Laut den ChatGPT-Versionshinweisen:

GPT-5.1 Pro wird heute für alle ChatGPT Pro-Benutzer eingeführt und ist in der Modellauswahl verfügbar. GPT-5 Pro bleibt 90 Tage lang als Legacy-Modell verfügbar, bevor es eingestellt wird.

Das ist ein ziemlich schneller Verfallszyklus für das GPT-5 Pro-Modell, das erst vor drei Monaten veröffentlicht wurde.



Source link

Postagens Similares

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *