OpenAI GPT-5 stößt am ersten Tag auf gemischte Bewertungen

- OpenAI startete GPT-5 nach monatelangem Hype und versprach große Sprünge beim logischen Denken, beim Codieren und bei der Geschwindigkeit.
- Die ersten Bewertungen sind gemischt: Einige loben die Fähigkeiten, andere weisen auf Fehler in Mathematik, Rechtschreibung und Schlussfolgerungen hin.
- Nutzer haben sich gegen die reduzierte Transparenz und den Verlust älterer Modelle wie GPT-4o gewehrt.
OpenAI-Chef Sam Altman hatte GPT-5 seit Monaten angepriesen. Er behauptete, es handele sich um ein fortschrittliches Modell – intelligenter, schneller und in der Lage, auf einem „Promotionsniveau“ zu denken. Das Unternehmen positionierte diesen Start als einen großen Schritt nach vorn für ChatGPT – einen, der zu Verbesserungen der Intelligenz bei der Codeerstellung, beim logischen Denken und bei der Genauigkeit führen sollte.
Aber die frühen Reaktionen zeichnen ein verworreneres Bild. Entwickler lobten das Modell für sein Verständnis komplexer Prompts und die Ausgabe gut strukturierter Codes. Der frühe Tester Simon Willison beschrieb GPT-5 als „kompetent“ und „gelegentlich beeindruckend“, aber nicht als einen großen Sprung gegenüber GPT-4. Andere waren weniger begeistert.
Mehrere Beiträge in den sozialen Medien wandten sich schnell gegen zahlreiche faktische Fehler, schwache mathematische Fähigkeiten und – in einigen Fällen – sogar grundlegende Rechtschreibfehler. Noah Giansiracusa, ein Mathematikprofessor an der Bentley University, nannte die Veröffentlichung „enttäuschend“ und merkte an, dass die betreffenden Updates „marginaler waren, als ich gehofft hätte.“
Ein Teil der Verwirrung resultierte aus der Architektur des Modells. GPT-5 würde einen „Autoswitcher“ für die verschiedenen Modellgrößen, je nach Aufgabe, enthalten. Dies spart Rechenleistung und bedeutet, dass man nicht immer mit dem vollständigen GPT-5 interagiert, was viele Nutzer verwirrte. Nachdem das System eine Frage falsch beantwortet hatte, wies der Agent, mit dem es arbeitete, es an, „härter nachzudenken“, wie viele „b“-Buchstaben im Wort „blueberry“ enthalten sind. Nach diesem Feedback gab es die richtige Antwort, als es abgefragt wurde.
Nutzer wehren sich – und OpenAI reagiert
Die Frustration könnte bis Freitag auf Reddit und X übergreifen. Während einige Nutzer es hassten, dass sie nicht wussten, wer oder welches Modell den Text erzeugt hatte, empfanden viele es als einen Rückschritt, und GPT-5 ersetzte alte Favoriten, denen sie vertrauten. Einige sagten, die Qualität habe nachgelassen, das Schreiben sei nicht so gut wie GPT-4.5, was Sie zustimmend erwähnten, und einige kreative und technische Aspekte fühlten sich schlechter an.
Dieser Chat führte dazu, dass der CEO von OpenAI an einer Reddit-„Ask Me Anything“-Veranstaltung teilnahm, um die Gegenwehr zu adressieren. Er sagte, ein Fehler im Autoswitcher habe dazu geführt, dass GPT-5 am ersten Tag unter seinem vollen Potenzial lief. Er versprach, bei zukünftigen Modellübergängen transparenter zu sein: „Ab heute sollte GPT-5 zunehmend intelligenter wirken.“ OpenAI versprach auch, frühere Modelle wie GPT-4o für diejenigen wieder einzusetzen, die einen entsprechenden Wunsch geäußert hatten, um die lautstärksten Kritiker zu beschwichtigen.
Dass es so schnell handeln musste, unterstreicht, wie hoch die Einsatzhöhe war. Heute befindet sich OpenAI in einem rasenden Wettlauf mit Wettbewerbern wie Anthropic, Google DeepMind und sogar Elon Musks xAI. Bei dieser ganzen Konkurrenz kann ein kleiner Fehler dazu führen, dass Ihr Wettbewerber Ihnen einen Schritt voraus ist.
Der Wettbewerb im KI-Rennen verschärft sich
Trotz dieser Unterschiede war die Aufnahme von GPT-5 lauwarm, aber das hinderte es nicht daran, auf LMArena, einer nutzergeführten Rangliste für Trainingsmodelle, auf den ersten Platz zu gelangen. Während es nicht das war, was wir heute als programmierbar betrachten würden, war es extrem schnell und ausdruckstark und unterstützte große, komplexe Abfragen. Andere Benchmarks zeigten jedoch eine andere, herausforderndere Problemlandschaft. Grok 4 von Musk’ xAI schnitt bei ARC-AGI-2 (einem Satz von Tests für fortgeschrittenes logisches Denken) so hoch ab, dass es die Vorherrschaft von OpenAI ernsthaft herausforderte.
Einige Branchenanalysten spekulieren, dass es mindestens einen Tag dauern wird, bis die Auswirkungen von GPT-5 vollständig verstanden sind, ähnlich wie bei früheren Durchbrüchen des Unternehmens, wie GPT-3. GPT-5 und GPT-4 stießen vor Verbesserungen in Updates und anderen Anwendungsfällen auf erheblichen Widerstand. Das Modell hat das Potenzial, erfolgreich zu sein (oder zu scheitern), abhängig davon, wie nützlich es für den täglichen Arbeitsablauf der Menschen ist, und es gibt weltweit fast 700 Millionen wöchentliche ChatGPT-Nutzer.
In den Worten des Wharton-Professors Ethan Mollick: „GPT-5 macht einfach Dinge, manchmal erstaunliche Dinge, manchmal rätselhafte Dinge, völlig eigenständig. Das ist es, was es so faszinierend macht. Es ist immer noch ein technokratischer, leicht unheimlicher Ansatz, Dinge wie diese als Teil der öffentlichen Gesundheitssphäre „interessant“ zu nennen.“
Wenn Sie dies lesen, sind Sie bereits einen Schritt voraus. Bleiben Sie mit unserem Newsletter auf dem Laufenden.

Nellius Irene
Nellius ist Absolventin der Betriebswirtschaftslehre und Informatik mit fünf Jahren Erfahrung in der Kryptowährungsbranche. Sie hat zudem Bitcoin Dada absolviert. Nellius hat bereits für führende Medienpublikationen wie BanklessTimes, Cryptobasic und Riseup Media geschrieben.
















