Wenn Engineering-Teams AI-Coding-Tools bewerten, ist die Rechnung immer komplex: Roh-Benchmark-Scores werden selten direkt in tägliche Produktivität übersetzt, und Preismodelle können theoretische Vorteile vor dem Ende eines Sprint-Zyklus aushöhlen. Cursors Anysphere – mit einem Wert von 29,3 Milliarden Dollar – setzt darauf, dass sein neues Composer 2 diese Spannung mit einer Kombination aus verbesserter Benchmark-Leistung und einem Preismodell auflösen kann, das aggressiv genug ist, um die gesamte Konversation neu zu definieren. Ob es erfolgreich ist, hängt von Faktoren ab, die weit über eine einzelne Launch-Ankündigung hinausgehen.
Der Cursor Composer 2 Leistungs-Kosten-Vergleich, den jeder Engineering-Lead durchführen sollte

Die Schlagzeile ist schwer zu ignorieren. Laut Cursor kostet Composer 2 ungefähr 86% weniger als sein Vorgänger, Composer 1.5, von Februar. Eingabe-Tokens werden mit 0,50 $ pro Million berechnet, Ausgabe-Tokens mit 2,50 $ pro Million und zwischengespeicherte Lesevorgänge fallen auf 0,20 $ pro Million Token. Für Teams, die hochvolumige Agent-Workflows ausführen, sind diese Zahlen wichtiger als fast jeder Benchmark. Die schnellere Standard-Variante, Composer 2 Fast, wird als Standard-Erfahrung ausgeliefert, was bedeutet, dass der Kostenvorteil den Benutzern sofort ohne Konfiguration zugutekommt.
Auf der Benchmark-Seite behauptet Cursor einen Terminal-Bench-2.0-Score von 61,7 für Composer 2, der ihn über Anthropic Sonnet 4.5 und bemerkenswerterweise über Claude Opus 4.6 stellt – ein Ergebnis, das in der gesamten Entwickler-Community Aufmerksamkeit erregte. Die Benchmarks, die Cursor misst, umfassen SWE-Bench Multilingual und Terminal-Bench 2.0, das letztere wird vom Laude-Institut verwaltet und über das Harbor-Evaluierungsframework durchgeführt. Jedes Modell-Agenten-Paar führt fünf Iterationen pro Aufgabe durch, und die Bewertung verwendet den Claude-Code-Harnisch für Anthropic-Modelle und den Simple-Codex-Harnisch für OpenAI-Modelle – ein methodischer Detail, der wichtig ist, wenn Ergebnisse zwischen Anbietern verglichen werden. Cursor weist auch darauf hin, dass Anthropic-Tokens etwa 15% kleiner sind als Composer- und GPT-Modell-Tokens, was die Token-pro-Sekunde-Zahlen beeinflusst und bei jeder direkten TPS-Vergleichsuntersuchung berücksichtigt werden sollte.
Das Modell unterstützt ein Kontextfenster von 200.000 Token, was es für langfristige Agent-Coding-Aufgaben eher als einfache Autovervollständigung positioniert. Cursors Preis für Endbenutzer bleibt bei 20 $ pro Monat für den Pro-Plan und 40 $ pro Benutzer pro Monat für den Teams-Plan, mit einer Mindestmonatsnutzung von 20 $ für individuelle Pläne. Laut Cursor waren die Nutzungsbeschränkungen für Composer 1.5 bereits dreimal höher als die des ursprünglichen Composer 1, und das neue Modell verlängert diese Entwicklung weiter. Der Plattform-Snapshot, der am 18. März 2026 aufgenommen wurde, informierte die Verkehrs- und Nutzungsdaten, die in Cursors Launch-Materialien zitiert werden.
Wo Composer 2 Schwächen zeigt – und was Cursor dagegen unternimmt
Cursor behauptet nicht, dass Composer 2 das Feld bedingungslos anführt. Laut dem Unternehmen hält GPT-5.4 immer noch die Spitzenposition auf Terminal-Bench 2.0, was bedeutet, dass Teams, die Spitzen-Benchmark-Leistung priorisieren, diesen Abstand immer noch abwägen müssen. Composer 2 ist auch kein breit verteiltes eigenständiges Modell – es operiert innerhalb der Cursor-Plattform, was bedeutet, dass seine Vorteile nur für Teams verfügbar sind, die bereits an dieses Ökosystem gebunden sind. Entwickler, die es gegen Frontier-Modelle von OpenAI, Anthropic und Google bewerten, sollten die Benchmark-Ergebnisse als plattform-spezifisch und nicht universell übertragbar behandeln.
Es gibt auch architektonische Einschränkungen, die verstanden werden sollten. Cursor erkennt an, dass die Verstärkungs-Lernmethoden, die zur Erreichung des Leistungs-Preis-Gleichgewichts verwendet werden, dazu führen können, dass das Modell während lang laufender Aufgaben wichtige Informationen verliert. Das Unternehmens-Minderungsansatz verlässt sich auf Zusammenfassungsstrategien, aber das zugrunde liegende Risiko – verringerte Effektivität in verlängerten Agent-Sitzungen – bleibt eine reale Überlegung für Teams, die an komplexen, mehrsitzigen Codebasen arbeiten. Geschwindigkeit ist eine weitere Variable: Cursor weist darauf hin, dass die Leistung je nach Anbieter-Kapazität und Änderungen über die Zeit schwanken kann. Die verbesserten Nutzungs-Sichtbarkeitstools, die jetzt in die Plattform integriert sind, sind teilweise dazu gedacht, Teams dabei zu helfen, diese Schwankungen zu verfolgen und zu verwalten.
Der Terminal-Bench-2.0-Benchmark selbst wirft offene Fragen zu Voreingenommenheit und Allgemeingültigkeit auf. Die Agent-Coding-Aufgaben, die er misst, stellen möglicherweise nicht die gesamte Breite realer Software-Arbeit dar, und seine potenziellen Anwendungen in Branchen jenseits der AI-Forschung bleiben weitgehend unerforscht. Was er bietet, ist ein standardisierter Vergleichspunkt – etwas, das das Feld bisher gefehlt hat – und das Harbor-Evaluierungsframework des Laude-Instituts gibt ihm zumindest einen Grad an Drittanbieter-Struktur. Dennoch sollten Teams jeden einzelnen Benchmark als einen Datenpunkt und nicht als Urteil behandeln, insbesondere wenn das Modell in Frage auf eine bestimmte Plattform und Werkzeugkette optimiert ist.
Der wettbewerbliche Hintergrund: Claude Code, Kimi K2.5 und ein Markt, der sich schneller bewegt als jeder einzelne Launch
Der AI-Coding-Markt, den Cursor navigiert, hat die Zeiträume dramatisch komprimiert. Wie die WSJ kürzlich formulierte, rast der AI-Sprint auf eine Welt zu, in der jeder persönliche Assistenten erstellen kann, die alles von Executive-Präsentationen bis hin zu March-Madness-Brackets verwalten können – und AI-Tools wie Claude Code, Cursor und OpenAIs Codex können nun Software auf einer Skala schreiben und debuggen, die völlig neue Einnahmequellen freisetzt. Diese Beschleunigung schafft sowohl Chancen als auch Druck für Cursor gleichzeitig.
Der Druck ist in der Art und Weise sichtbar, wie Branchenbeobachter die Position des Unternehmens darstellen. Fortune berichtete, dass einige Beobachter glauben, Claude Code, das von Anthropics erheblichen finanziellen Ressourcen unterstützt wird – auf 380 Milliarden Dollar geschätzt – könnte Cursor verdrängen. “Das Besondere an diesem Markt ist, dass sich Dinge so schnell ändern”, sagte ein VC, der in einen Cursor-Wettbewerber investiert hat. Diese Volatilität wirkt in beide Richtungen: Der gleiche Tempo, der etablierte Unternehmen bedroht, kann auch die Ausführungsgeschwindigkeit belohnen, und Cursor hat sich auf Preise schneller bewegt, als die meisten erwartet haben.
Cursors Verteidiger betonen seinen Vorsprung. “Sie waren das erste und größte Produkt im Coding-AI-Bereich“, sagte ein Cursor-Investor gegenüber Fortune. CEO Michael Truell, erst wenige Jahre nach seinem Abschluss am MIT, baute die Plattform in einen Referenzpunkt für AI-gestützte Entwicklung aus, bevor die meisten Wettbewerber etwas Vergleichbares ausgeliefert hatten. Aber das Wettbewerbsfeld hat sich erheblich erweitert. Neben Claude Code und OpenAIs Codex ist das chinesische Open-Source-Modell Kimi K2.5 in das Gespräch gekommen, und Frontier-Modelle von Opus 4.5 und Opus 4.6 bleiben aktive Vergleiche im Benchmark-Landschaft. Zach Lloyd, CEO und Gründer des Coding-Wettbewerbers Warp, bot eine präzise Einschätzung: “Ich glaube nicht an die ‘Cursor ist tot’-Memes, aber ‘Die IDE ist tot’ ist real.“ Diese Darstellung – Plattform über Editor – mag die wichtigere strategische Frage sein, die Cursor beantworten muss.
Ein Hinweis auf den Hardware-Kontext, in dem Entwickler diese Tools ausführen: Notebookcheck fand kürzlich heraus, dass Apples M5-Max im MacBook Pro 16 etwa 15% besser abschneidet als im MacBook Pro 14 – eine Lücke, die durch thermische Einschränkungen verursacht wird, die zu schwankender CPU- und instabiler GPU-Leistung im kleineren Gehäuse führten, selbst im High-Power-Modus. Die 40-Kern-GPU-Konfiguration zeigt ihr volles Potenzial nur im größeren Gehäuse. Für Entwickler, die lokale Inferenz oder latenzsensitive Agent-Workflows ausführen, ist die Hardware-Obergrenze wichtig, neben dem Modell-Preis.
Offene Fragen für Teams, die Cursors Plattform-Wette bewerten
Der Launch von Composer 2 wirft mehrere Fragen auf, die Engineering-Führer und Unternehmenskäufer beantworten müssen, bevor sie sich für die Plattform entscheiden. Der Wechsel von Autovervollständigung zu Agenten, den Cursor verfolgt, ist real und beschleunigt – aber es ist auch eine Richtung, die jeder große Modellanbieter gleichzeitig verfolgt. Wird Cursors integrierte Plattform, Team-Steuerung und enge Werkzeugkette-Integration ausreichen, um ihre Position zu rechtfertigen, sobald diese Anbieter ihre eigenen eng gekoppelten Agenten-Erfahrungen ausliefern?
Der Terminal-Bench-2.0-Benchmark wird sich selbst weiterentwickeln. Wie sich die Bewertungsmethode über die Zeit ändert – und wie sich dies auf relative Rankings für Composer 2, Sonnet 4.5, GPT-5.4 und Modelle wie Kimi K2.5 auswirkt – bleibt abzuwarten. Die potenziellen Anwendungen des Benchmarks jenseits der AI-Coding-Forschung sind auch unzureichend erforscht; seine reale Aufgabenstruktur könnte sich als nützlich für die Bewertung von Agenten in benachbarten Bereichen erweisen, obwohl diese Arbeit noch nicht systematisch durchgeführt wurde. Forscher und Modell-Entwickler, die das Harbor-Evaluierungsframework verwenden, sind gut positioniert, um das neueste Modell in kontrollierten Evaluierungen zu testen, aber die Übersetzung dieser Ergebnisse in Produktions-Entscheidungen für Engineering-Teams ist eine andere Übung.
Die Nutzungsökonomie wird sich auch unterschiedlich über Team-Größen hinweg abspielen. Die erhöhten Nutzungsbeschränkungen und der Teams-Preis von 40 $ pro Benutzer machen die Mathematik relativ einfach für kleine Engineering-Teams, aber Unternehmenskäufer werden verstehen wollen, wie die Nutzungs-Sichtbarkeitstools – jetzt klarer in der Plattform dargestellt – mit der Abrechnung im großen Maßstab interagieren. Wie der verbesserte Kosten-Intelligenz-Tradeoff von Composer 2 Cursors Umsatz-Traektorie beeinflusst und ob er den adressierbaren Markt erweitert oder einfach bestehende Kunden umpreist, wird sich in den nächsten Quartalen klären.
Last Updated on März 23, 2026 8:32 p.m. by Laszlo Szabo / NowadAIs | Published on März 23, 2026 by Laszlo Szabo / NowadAIs


