ai-powered-markdown-translatorArtikel mit gpt-5.6-sol vom Französischen ins Deutsche übersetzt.
Am Dienstag, dem 22. September, bringen Anthropic und OpenAI im Abstand von weniger als zwei Stunden jeweils ein Frontier-Modell auf den Markt: Claude Opus 5.5, das bei 40 % niedrigeren Betriebskosten als Opus 5 auf dem Niveau von Fable 5.1 liegen soll, sowie GPT-6 Sol und GPT-6 Luna, deren API-Preise gegenüber dem Aktionspreis von GPT-5.6 halbiert werden. Beide Modellfamilien sind noch am selben Tag in GitHub Copilot, Devin und Perplexity verfügbar, während Claude Code 2.1.280 die Tarife Pro und Team Standard von Sonnet auf Opus umstellt. Codex CLI 0.156.0, erhöhte Nutzungslimits bei Anthropic und eine Reihe von Veröffentlichungen von NVIDIA runden den Tag ab.
Anthropic bringt Claude Opus 5.5 auf den Markt, das erste Modell der Claude-5.5-Familie
22. September — Anthropic bringt Claude Opus 5.5 (claude-opus-5-5) auf den Markt, das erste Modell seiner neuen Claude-5.5-Familie; Sonnet 5.5 und Haiku 5.5 sollen „in den kommenden Wochen“ folgen. Es ist ab heute über die Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud und Microsoft Foundry verfügbar und wird in Claude Code zum Standardmodell der kostenpflichtigen Tarife. Kontextfenster mit einer Million Tokens, maximale Ausgabe von 128.000 Tokens, verlässlicher Wissensstand bis Juni 2026.
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
🇩🇪 Hier ist Claude Opus 5.5, das erste Modell unserer neuen Claude-5.5-Familie. Bei den meisten Aufgaben arbeitet es auf dem Niveau von Claude Fable 5.1 und verursacht 40 % niedrigere Betriebskosten als Opus 5. — @claudeai auf X
Anthropic zufolge werden diese 40 % „mit den Standardeinstellungen“ bei typischen Workloads gemessen und ergeben sich aus niedrigeren Preisen und weniger Tokens pro Aufgabe. Die Preise sinken um 20 % (4 Dollar für die Eingabe und 20 Dollar für die Ausgabe je Million Tokens, gegenüber 5 beziehungsweise 25 Dollar bei Opus 5) und um 60 % für Cache-Lesevorgänge (0,20 Dollar). Die Ausgabe wird mehr als 30 % schneller generiert, und ein schneller Modus (fast mode) verspricht in einer Forschungsvorschau bis zu 2,5-fache Geschwindigkeit für 8 beziehungsweise 40 Dollar.
| Benchmark (Zahlen von Anthropic) | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 Main | 54,4 % | 50,3 % | 53,3 % |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1542 |
| OSWorld 2.0 | 81,8 % | 80,7 % | — |
| AutomationBench | 40,0 % | 31,4 % | 41,4 % |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 64,6 % |
Opus 5.5 übernimmt die Führung beim agentischen Programmieren, bei Büroarbeit und der Computernutzung, doch GPT-6 Astra liegt bei AutomationBench und Terminal-Bench-Science weiterhin vorn. Anthropic weist darauf hin, dass seine Ergebnisse mit aktivierten Produktions-Schutzmechanismen gemessen wurden, was sie wahrscheinlich niedriger ausfallen lässt, und hält die Abstände in Benchmarks inzwischen für „einen weniger verlässlichen Anhaltspunkt“: In der Praxis sei der Abstand zu Fable 5.1 geringer, als diese Zahlen vermuten lassen. Es ist das erste Opus, das mit Schutzmechanismen der Klasse von Fable 5.1 für Cybersicherheit, Biologie und Destillation veröffentlicht wird (die meisten Cyber-Aufgaben werden auf Opus 4.8 umgeleitet), und Anthropic räumt ein, dass es häufig zu vermuten scheint, evaluiert zu werden.
Für Entwickler erfordert die Migration einige Anpassungen: Adaptives Denken kann nicht mehr deaktiviert werden, eine erzwungene Werkzeugauswahl (tool_choice bis any oder tool) gibt einen Fehler 400 zurück, und der standardmäßige Aufwand wechselt zu medium (gegenüber high bei Opus 5). Text, der zwischen zwei Werkzeugaufrufen geschrieben wird, erscheint nun wieder in Denkblöcken, die bei der Standardanzeige leer sind.
🔗 Vorstellung von Claude Opus 5.5 · Neuerungen von Opus 5.5 für die API
Claude Code 2.1.280 führt Opus 5.5 ein und stellt Pro und Team Standard auf Opus um
22. September — Claude Code 2.1.280 wird um 16:38 Uhr UTC veröffentlicht, sieben Minuten nach der Ankündigung von Opus 5.5. Eine Version 2.1.279 gab es nicht: Das CHANGELOG springt direkt von Version 2.1.278 vom 19. September zu dieser Version mit 114 Einträgen.
Die sichtbarste Änderung betrifft das Modell. Opus 5.5 wird zum standardmäßigen Opus-Modell, und die Tarife Pro und Team Standard wechseln standardmäßig von Sonnet zu Opus, wie es bei Max, Team Premium und Enterprise bereits der Fall war. Aufwandstufen, die gespeichert wurden, bevor /effort modellspezifisch wurde, gelten nicht mehr für neue Modelle wie Opus 5.5, die mit ihrer jeweiligen Standardeinstellung starten; Opus 4.7, Opus 4.8 und Fable 5 erzwingen ihrerseits beim Start nicht mehr einen höheren Aufwand als die ausgewählte Einstellung.
Bei der Sicherheit wird ein Schreibvorgang über einen symbolischen Link nun anhand seines tatsächlichen Ziels bewertet: Die Autorisierungsanfrage nennt den Ort, an dem er endet, und acceptEdits, Autorisierungsregeln sowie der Auto-Modus genehmigen keine Schreibvorgänge mehr, deren Ziel außerhalb des Verzeichnisbaums liegt. Der Auto-Modus lehnt Aktionen nicht mehr ohne Pause in einer Schleife ab, wenn eine Sicherheitsprüfung keine Antwort liefert: Neue Versuche werden zeitlich gestaffelt, und der Durchlauf endet nach zehn aufeinanderfolgenden Ablehnungen. Plugin-Marketplaces, die einen reservierten Namen nachahmen, werden abgelehnt, und mit der Variable CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH lässt sich die Obergrenze von 2.048 Zeichen für Beschreibungen von MCP-Werkzeugen ändern.
Der Rest betrifft den Bedienkomfort: Eine einzelne Taste y oder n bestätigt oder schließt einen Dialog nicht mehr (stattdessen werden Eingabe und Escape verwendet), zweimaliges Drücken von Strg+C in einem Dialog beendet Claude Code nicht mehr, zwei Unterbrechungen des Prompt-Cache werden behoben, und die VS-Code-Erweiterung erhält sechs typisierte Befehle (/status, /sandbox, /chrome, /export, /skills, /plan).
| Eintragskategorie im CHANGELOG | Anzahl der Einträge |
|---|---|
| Fehlerbehebungen (Fixed) | 69 |
| Verbesserungen (Improved) | 21 |
| Ergänzungen (Added) | 12 |
| Änderungen (Changed) | 10 |
| Rücknahme und Entfernung | 2 |
| Gesamt | 114 |
Zwei Leitfäden für die Arbeit mit Opus 5.5
22. September — Anthropic veröffentlicht außerdem zwei von Addy Osmani verfasste Leitfäden. Der erste, „Was eine Aufgabe mit Opus 5.5 kostet“ (What a task costs on Opus 5.5), erinnert daran, dass zwei Modelle mit demselben Preis pro Token bei derselben Aufgabe sehr unterschiedliche Kosten verursachen können, da bei jedem Durchlauf die gesamte Unterhaltung erneut übertragen wird. Seine als auf öffentlichen Preisen basierende Veranschaulichungen präsentierten Beispiele: 2,8 Millionen Eingabe-Tokens kosten ohne Cache 11,20 Dollar und 1,62 Dollar, wenn 90 % aus dem Cache gelesen werden, und ein Ausgabe-Token kostet 100-mal so viel wie ein Cache-Lesevorgang. Für den Alltag empfiehlt er den Aufwand medium, high, wenn medium nicht weiterkommt, und anschließend Fable 5.1, falls Opus 5.5 zweimal am selben Problem scheitert. Dabei ist zu beachten, dass ein Wechsel des Aufwands oder Modells den Cache leert (bei einem Abonnement bleibt er eine Stunde bestehen, mit einem API-Schlüssel standardmäßig fünf Minuten). Bei einem internen Benchmark mit 44 Support-Tickets senkte der Wechsel von Opus 4.8 zu Opus 5.5 mit niedrigem Aufwand die Kosten um etwa 18 %, und /claude-api prompt-audit sparte weitere 9 %.
Der zweite Leitfaden auf claude.dev empfiehlt, zunächst zu definieren, was „fertig“ bedeutet, und das Modell dann arbeiten zu lassen sowie Anweisungen wie „Denk gründlich nach“ zu entfernen, da das Modell vor jeder Antwort nachdenkt. Er erläutert außerdem den Wechsel zu einem älteren Modell, wenn eine Nachricht von den Schutzmechanismen markiert wird; dieses Verhalten lässt sich in den Anwendungen oder in /config einstellen.
🔗 Was eine Aufgabe mit Opus 5.5 kostet · Opus 5.5 optimal nutzen
OpenAI bringt GPT-6 Sol und GPT-6 Luna auf den Markt, 50 % günstiger als der Aktionspreis von GPT-5.6
22. September — Weniger als zwei Stunden nach Anthropic erweitert OpenAI die GPT-6-Familie um GPT-6 Sol und GPT-6 Luna, die mit ähnlichen Methoden wie GPT-6 Astra trainiert wurden, das laut dem Unternehmen weiterhin sein bestes Modell ist. Sol richtet sich an komplexe Programmieraufgaben und agentische Workflows, Luna an gezielte Aufgaben mit hohem Volumen; sie folgen auf GPT-5.6 Sol und GPT-5.6 Luna.
We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.
🇩🇪 Wir haben außerdem Caching und Inferenz effizienter gestaltet und geben diese Einsparungen direkt an Sie weiter: 50 % niedrigere API-Preise für Sol und Luna gegenüber dem Aktionspreis von GPT-5.6. — @OpenAI auf X
| Tarifart (je Million Tokens) | GPT-6 Sol | GPT-6 Luna | Genannter GPT-5.6-Tarif (Sol / Luna) |
|---|---|---|---|
| Eingabe | 2 Dollar | 0,10 Dollar | 4 Dollar / 0,20 Dollar |
| Eingabe aus dem Cache | 0,20 Dollar | 0,01 Dollar | nicht angegeben |
| Ausgabe | 10 Dollar | 0,50 Dollar | 20 Dollar / 1,20 Dollar |
Beide Modelle akzeptieren einen Kontext von 1.050.000 Tokens und erzeugen bis zu 128.000 Tokens; bei mehr als 272.000 Eingabe-Tokens wird für die gesamte Anfrage der doppelte Eingabepreis und der 1,5-fache Ausgabepreis berechnet.
In den Benchmarks von OpenAI, die Sol mit Claude-Modellen vor Opus 5.5 vergleichen, erreicht Sol bei AutomationBench mit dem Aufwand xhigh 33,2 % zu Kosten von 0,27 Dollar pro Aufgabe und liegt damit vor Claude Opus 5 mit dem Aufwand max (26,9 % bei 11,1-mal höheren Kosten) und GPT-6 Astra mit dem Aufwand low (30,3 %). Bei DeepSWE v1.1 erreicht es 68,8 % und liegt damit 1,1 Punkte hinter dem Bestwert von Claude Fable 5, während die Kosten pro Aufgabe etwa 80 % niedriger sind; Luna erreicht dort 66,6 %. Die Ergebnisse der Wettbewerber stammen aus öffentlichen Berichten. Beim Alignment sinkt die gemessene Täuschungsrate bei Programmieraufgaben, die zu unehrlichem Verhalten verleiten sollen, für Sol auf 1,3 %, gegenüber 10,4 % bei GPT-5.6 Sol.
Beide Modelle kommen für Abonnenten der Tarife Plus, Pro, Business, Enterprise und Edu zu ChatGPT Work und Codex, wobei die Einführung schrittweise erfolgt (in Enterprise ist eine Aktivierung durch den Administrator erforderlich); Free und Go können Luna in der Desktop-Anwendung verwenden, und die Modelle werden in Chat noch nicht angeboten. In der API heißen sie gpt-6-sol und gpt-6-luna und sind über Responses und Chat Completions verfügbar.
🔗 Vorstellung von GPT-6 Sol und Luna
Ein neu konzipiertes Prompt-Caching für GPT-6
22. September — Der begleitende Beitrag zur Veröffentlichung, „Besseres Prompt-Caching für GPT-6“, beschreibt das neue Cache-System der Modellfamilie: standardmäßig höhere Trefferquoten, ein Rabatt von bis zu 90 % auf Eingabe-Tokens aus dem Cache für geeignete gemeinsame Präfixe, die innerhalb von 30 Minuten wiederverwendet werden, sowie Cache-Schreibvorgänge zum 1,25-Fachen des Eingabepreises. Entwickler erhalten ein Prompt-Caching-Dashboard, explizite Cache-Unterbrechungspunkte (explicit cache breakpoints) zum Festlegen wiederzuverwendender Präfixe, das Vorwärmen des Cache (prewarming) beim Start einer Anwendung und ein configuration_update, mit dem sich der Reasoning-Aufwand von einer Antwort zur nächsten ändern lässt, ohne den Cache zu unterbrechen. GitHub gibt durch seinen Produktdirektor Mario Rodriguez an, den Anteil der erneut zu verarbeitenden Prompt-Tokens um mehr als 50 % reduziert zu haben; Strawberry Browser meldet 20 % niedrigere Kosten.
🔗 Besseres Prompt-Caching für GPT-6
Noch am selben Tag in den Werkzeugen: GitHub Copilot, Devin, Perplexity, Cursor und v0
22. September — Opus 5.5 und die beiden neuen GPT-6-Modelle ließen nicht lange auf sich warten: Innerhalb weniger Stunden wurden sie von den wichtigsten Programmier- und Recherchewerkzeugen hinzugefügt, häufig zusammen mit eigenen Messwerten.
GitHub Copilot führt Opus 5.5, GPT-6 Sol und GPT-6 Luna ein
GitHub fügt die drei Modelle am Tag ihrer Veröffentlichung auf zehn Plattformen hinzu: VS Code, Visual Studio, Copilot CLI, dem Coding-Agenten, der GitHub-Copilot-Anwendung, github.com, GitHub Mobile, JetBrains, Xcode und Eclipse. Alle werden nutzungsabhängig zum öffentlichen Tarif des Anbieters ohne Multiplikator für Premium-Anfragen abgerechnet; Jahresabonnenten, die bei der früheren Abrechnung nach Anfragen geblieben sind, erhalten sie nicht. Keines der Modelle ist bislang in der automatischen Auswahl (Auto) enthalten.
| Modell in Copilot | Verfügbare Tarife | Eingabe und Ausgabe je Million Tokens |
|---|---|---|
| Claude Opus 5.5 | Pro+, Max, Business, Enterprise (nicht Pro) | 4 und 20 Dollar |
| GPT-6 Sol | Pro+, Max, Business, Enterprise | 2 und 10 Dollar, danach 4 und 15 ab mehr als 272.000 Tokens |
| GPT-6 Luna | Pro, Pro+, Max, Business, Enterprise | 0,10 und 0,50 Dollar, danach 0,20 und 0,75 ab mehr als 272.000 Tokens |
Luna ist damit das einzige GPT-6-Modell, das mit Copilot Pro zugänglich ist, während Opus 5.5 dort nicht verfügbar ist. Laut ersten Tests von GitHub löst Opus 5.5 Aufgaben auf dem Niveau von Claude Opus 5 mit deutlich weniger Schritten und Tokens. GitHub weist außerdem darauf hin, dass Opus 5.5 seine Textausgaben mit einem Wasserzeichen (watermark) versieht, das laut GitHub weder Bedeutung, Qualität, Lesbarkeit, Anzahl der Tokens noch Kosten beeinflusst.
🔗 Claude Opus 5.5 in GitHub Copilot · GPT-6 Sol und GPT-6 Luna in GitHub Copilot
Devin reiht die Neuzugänge bei FrontierCode 1.1 ein
Cognition stellt Claude Opus 5.5 am Tag seiner Veröffentlichung in Devin Desktop und Devin CLI bereit und setzt es in der Extended-Variante seines Benchmarks FrontierCode 1.1 mit 65,3 % auf den ersten Platz, vor Claude Fable 5 (64,9 %) und GPT-6 Astra (64,5 %), und das für weniger als ein Zehntel der Kosten pro Aufgabe von Fable 5. Diese 65,3 % sind nicht mit den von Anthropic veröffentlichten 54,4 % vergleichbar, die mit der Main-Variante gemessen wurden. Siebenundvierzig Minuten später folgen GPT-6 Sol und Luna: Sol erreicht mit 60,7 % gegenüber 60,6 % nahezu das Ergebnis von GPT-5.6 Sol, bei 61 % geringeren Kosten pro Aufgabe und rund 17 % weniger gelesenem Kontext; Luna (56,1 %) bleibt unter 0,10 Dollar pro Aufgabe und ist laut Cognition damit das günstigste Modell der Rangliste.
Am Vortag, dem 21. September am Nachmittag (Pazifikzeit), hatte Cognition Grok 4.7 bereitgestellt und mit 59,4 % bewertet, unter Grok 4.6 (61,3 %): Bei schwierigen Back-End-Aufgaben in Java, Go und Ruby ist es solide, neigt jedoch dazu, den Umfang zu überschreiten (over-scope), mit größeren Diffs, als die Aufgabe erfordert. v0 stellte Grok 4.7 unmittelbar danach bereit, mit 40 % Rabatt bis zum 27. September, ohne anzugeben, worauf dieser gewährt wird.
| Bewertetes Modell | FrontierCode-1.1-Extended-Ergebnis |
|---|---|
| Claude Opus 5.5 | 65,3 % |
| Claude Fable 5 | 64,9 % |
| GPT-6 Astra | 64,5 % |
| Claude Fable 5.1 | 63,6 % |
| SWE-2 | 62,5 % |
| Grok 4.6 | 61,3 % |
| GPT-6 Sol | 60,7 % |
| GPT-5.6 Sol | 60,6 % |
| Grok 4.7 | 59,4 % |
| Gemini 3.7 Flash | 56,3 % |
| GPT-6 Luna | 56,1 % |
Fett hervorgehoben sind die Modelle, die am 21. und 22. September zu Devin hinzugefügt wurden. Von Cognition veröffentlichte Ergebnisse für die Extended-Variante.
🔗 Opus 5.5 in Devin · GPT-6 Sol und Luna in Devin · Grok 4.7 in Devin · Grok 4.7 in v0
Perplexity: Opus 5.5 und GPT-6 Sol in Computer, vier Modelle in der Agent API
Perplexity bindet beide Neuerscheinungen an den am 17. September in Computer, seinem mehrstufigen Agenten, eingeführten Regler für den Rechenaufwand an. Claude Opus 5.5 wird zur Standard-Stufe: Bei WANDR, Perplexitys internem Benchmark für Kosten und Leistung, erreicht es 0,610 bei 4,13 Dollar pro Aufgabe, knapp mehr als Claude Fable 5.1 bei 67,6 % geringeren Kosten pro Aufgabe. GPT-6 Sol, das ebenfalls in der Perplexity-App verfügbar ist, wird zur Standardoption der Light-Stufe. In beiden Mitteilungen wird weder angegeben, welche Tarife betroffen sind, noch welche Modelle ersetzt wurden.
Für Entwickler fügt ein lediglich auf September 2026 datierter Eintrag im API-Changelog der Agent API openai/gpt-6-sol, openai/gpt-6-luna, anthropic/claude-opus-5-5 und xai/grok-4.7 hinzu, ohne Preisangaben im Eintrag.
🔗 Opus 5.5 in Computer · GPT-6 Sol in Computer · Changelog der Perplexity API
Cursor und v0 stellen Opus 5.5 bereit
Cursor präsentiert es als das neue beste Modell im CursorBench, mit 57,8 % bei maximalem Rechenaufwand (Max) und 40 % geringeren Kosten pro Aufgabe als Opus 5: Es handelt sich um die Zahlen von Anthropic, einschließlich der Angabe zum Rechenaufwand. v0 stellt es ohne nähere Preisangaben bereit.
🔗 Cursor auf X · v0 auf X
Anthropic erhöht die Fünf-Stunden-Limits und bietet bis zum 22. Oktober eine Zurücksetzung an
22. September — Mit Opus 5.5 erhöht Anthropic die über fünf Stunden berechneten Limits der Pro-, Max-, Team- und Enterprise-Tarife mit nutzerbasierter Lizenzierung (seat-based). Der Account @ClaudeDevs beziffert die Erhöhung für Claude Code: Ab heute steigen die Limits für fünfstündige Sitzungen um 20 %. Abonnenten erhalten außerdem eine Zurücksetzung ihres Limits, die sie als Reserve aufbewahren und zu einem Zeitpunkt ihrer Wahl auslösen können: Sie steht für Pro, Max und Team unter Einstellungen → Nutzung (Settings → Usage) zur Verfügung und kann bis zum 22. Oktober eingesetzt werden.
Hinzu kommt der Preiseffekt: In Claude Code wird Opus 5.5 zum Standardmodell der kostenpflichtigen Tarife und lässt die Fünf-Stunden- und Wochenlimits aufgrund seines niedrigeren Preises gegenüber Opus 5 „25 % weiter reichen“. Der am selben Tag veröffentlichte Kostenleitfaden stellt klar, dass die Preissenkung auf die Limits einschließlich zwischengespeicherten Kontexts übertragen wird, die zusätzliche Senkung des Preises für Cache-Lesevorgänge jedoch nur die API betrifft.
🔗 @ClaudeDevs auf X · Zurücksetzung und Limits
Codex CLI 0.156.0 aktiviert Sprache und Worktrees standardmäßig
22. September — Codex CLI 0.156.0 wurde um 19:51 Uhr UTC veröffentlicht und ist die erste stabile Version seit 0.155.1 vom 18. September; ihr vollständiges Changelog führt 525 Pull Requests seit 0.155.0 auf. Sie führt zwei in 0.155 noch experimentelle Funktionen allgemein ein: Sprachunterhaltungen mit integrierten Audio-Engines für Linux und Windows sowie Worktrees, die das Agent Command Center als Sitzungen öffnen kann, wobei Aufgaben nach Status gefiltert werden.
| Neuerung der Version | Befehl oder Einstellung | Vorheriger Stand in Codex CLI |
|---|---|---|
| Sprachunterhaltungen standardmäßig | F8, /voice settings | /voice experimentell (0.155.0, 17. September) |
| Worktrees standardmäßig | Agent Command Center | seit 0.154.0 experimentell (9. September) |
| Vollbildoberfläche | /tui, beim nächsten Start | keiner |
| Analytics-Dashboard | /usage | Analytics der Desktop-App (18. September) |
| Lokaler Hintergrundserver | /daemon, --no-daemon | keiner |
Die Vollbildoberfläche bietet eine Suche im Transkript, Auswahl mit der Maus und Kopieren per Rechtsklick; außerdem kommen sechs integrierte Themes hinzu, und Antworten zeigen Mermaid-Diagramme und Gleichungen direkt an. Die Version schließt zudem mehrere Lücken bei der Sandbox-Isolierung (eingehender Datenverkehr unter Windows, Unix-Sockets des App-Servers, verändernde fcntl unter macOS). Die Versionshinweise erwähnen GPT-6 nicht: Sol und Luna werden mit /model oder --model ausgewählt.
Code-Agenten im Terminal: Vibe CLI, Qwen Code und Amp
Vibe CLI 2.25.6 und 2.25.7
22. September — Mistral veröffentlicht Vibe CLI 2.25.7 mit sechs Fehlerbehebungen, einen Tag nach einer im CHANGELOG auf den 21. September datierten Version 2.25.6, die jedoch nie als GitHub-Release veröffentlicht wurde und den Großteil der Neuerungen enthält (1 Ergänzung, 3 Änderungen, 17 Fehlerbehebungen). Mit der Option --experimental-harness lassen sich Bilder auch dann anhängen, wenn das aktive Modell sie nicht lesen kann: Ein visionsfähiges Modell desselben Anbieters beschreibt sie für den Agenten, und mit dem Schlüssel vision_model in config.toml lässt sich ein anderes Modell erzwingen. Die so beschriebenen Bildschirmaufnahmen enthalten einen Layout-Vertrag (layout contract), damit der Agent den Bildschirm rekonstruieren kann.
Im Bereich Sicherheit werden ohne Genehmigung ausgeführte Git-Befehle gehärtet: Sichere Fetches übernehmen keine Pfadüberschreibungen mehr aus der Git-Konfiguration, ein nicht vertrauenswürdiger Checkout kann weder den SSH-Client noch Hooks auswählen, und riskante Optionen oder in schreibgeschützte Befehle eingeschleuste Shell-Umleitungen erfordern eine Genehmigung. Version 2.25.7 macht /teleport schließlich für Vibe- und Workspace-API-Schlüssel verfügbar, einschließlich kostenloser Konten.
🔗 Vibe CLI v2.25.7 · CHANGELOG von Vibe CLI
Qwen Code v0.24.4
22. September — Einen Tag nach v0.24.3 erscheint Qwen Code v0.24.4 mit 13 Funktionen und 15 Fehlerbehebungen, ohne Breaking Changes. Der Server qwen serve öffnet nun entfernte Workspaces über SSH, ohne einen Daemon auf dem Zielrechner zu installieren, und die mit v0.24.0 unter Linux eingeführte bubblewrap-Sandbox (bwrap) wird auf der Ausführungsebene jedes einzelnen Tools angewendet. In der Web Shell ist die Kopplung per QR-Code nun standardmäßig verfügbar, wenn der authentifizierte Server nicht nur auf der Loopback-Schnittstelle lauscht; dabei kommen Einladungen zur einmaligen Verwendung zum Einsatz, die nach 60 Sekunden ablaufen, und Bearbeitungs-Diffs werden vor der Genehmigung angezeigt. Für Java werden verwaltete Tool-Ausführungen über JDBC in der Datenbank gespeichert. Eine auf zwei Fehlerbehebungen beschränkte v0.24.5-preview.0 folgte noch am selben Tag.
Amp-Runner erstellen Git-Worktrees
22. September — Fünf Tage nachdem ein Runner mehrere Verzeichnisse bereitstellen konnte, bringt Amp ihm das Erstellen von Git-Worktrees bei. Im Auswahlmenü bietet jedes bereitgestellte Repository die Option New Worktree: Man drückt Tab, benennt den Branch, und der Thread startet in einem neuen, neben dem Repository erstellten Checkout (~/code/amp ergibt ~/code/amp-fix-flaky-login-test), ohne den Haupt-Checkout zu verändern. Eine eigene Aktion archiviert anschließend den Thread und löscht Worktree und Branch. Die Runner können außerdem die auf ampcode.com konfigurierten Geheimnisse und Umgebungsvariablen (Secrets & Env Vars) empfangen: Die standardmäßig deaktivierte Option wird mit --amp-env aktiviert, und eine geänderte Variable gilt ohne Neustart oder SSH für den nächsten Thread.
Bewertungen durch Dritte: OpenAI legt seine Regeln fest, das britische AISI veröffentlicht seine Ergebnisse
22. September — Am selben Tag befassen sich zwei Veröffentlichungen mit der Bewertung von Modellen durch Organisationen außerhalb der Labore.
OpenAI: vier Prioritäten und sieben Grundsätze für unabhängige Prüfer
Der von Lama Ahmad verfasste Beitrag verpflichtet OpenAI dazu, unabhängigen privaten oder gemeinnützigen Prüfern einen umfassenden Zugang zu Training, Bewertung und Bereitstellung seiner Modelle zu gewähren, damit sie seine Annahmen hinterfragen, übersehene Risiken erkennen und seine Schutzmaßnahmen selbst beurteilen können. Diese Bewertungen, die sich von der Zusammenarbeit mit Regierungen unterscheiden, würden einige Wochen bis mehrere Monate dauern und wären nicht an eine Veröffentlichung gebunden.
| Schwerpunktbereich | Was untersucht wird |
|---|---|
| Sicherheitsnachweise (safety cases) | Die Argumentation, die zeigt, dass die Risiken eines Modells vom Training bis zur externen Bereitstellung beherrscht werden |
| Kritische Schutzmaßnahmen | Widerstandsfähigkeit gegen Jailbreaks, Cyberabwehr, Monitore für Fehlausrichtung, Zuverlässigkeit der Überwachung der Gedankenkette |
| Preparedness Framework | Fähigkeitstests (chemische und biologische Risiken, Cybersicherheit, Selbstverbesserung der KI) und Alignment |
| Vorfälle von Fehlausrichtung | Unabhängige Untersuchungen kritischer Vorfälle, wobei der Hugging-Face-Vorfall vom Juli als Beispiel genannt wird |
Sieben Grundsätze bilden den Rahmen: ein vereinbarter Umfang und vorab dokumentierte Behauptungen, verhältnismäßiger Zugang, eine transparente Methode, Fachkompetenz und Unabhängigkeit (offengelegte Interessenkonflikte), Sicherheit und Vertraulichkeit, umsetzbare Erkenntnisse mit einer Frist zur Behebung vor der Veröffentlichung sowie eine verantwortungsvolle Veröffentlichung mit geregelten Schwärzungen. OpenAI gibt an, mit mehreren Organisationen zu sprechen, nennt jedoch keine davon.
🔗 Prioritäten und Grundsätze für wirksame Bewertungen durch Dritte
Das UK AI Security Institute veröffentlicht seine mit EvalEval verifizierten Ergebnisse
Die EvalEval Coalition gibt im Hugging-Face-Blog bekannt, dass das UK AI Security Institute (AISI), die britische öffentliche Einrichtung zur Untersuchung der Risiken fortgeschrittener KI, seine Bewertungsergebnisse nun zusammen mit ihrem Kontext und ihrer Konfiguration in den Evaluation Cards, der offenen Plattform von EvalEval, im gemeinsamen Format Every Eval Ever veröffentlicht. Die erste Veröffentlichung umfasst fünf Benchmarks (HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro und Terminal-Bench 2.0), die mit sechs Modellen gemessen wurden: Claude Opus 4, 4.5 und 4.6 sowie GPT-5, GPT-5.2 und GPT-5.4, ergänzt um zwei Cyberbewertungen. Im Mittelpunkt steht die Reproduzierbarkeit: Verifizierte und zusammen mit ihrer Konfiguration veröffentlichte Referenzwerte helfen zu verstehen, warum zwei scheinbar vergleichbare Ergebnisse voneinander abweichen.
🔗 Wie UK AISI und EvalEval Benchmark-Ergebnisse reproduzierbar machen
ChatGPT verfolgt den Experian-Kredit-Score in den Vereinigten Staaten
21. September — Eine neue Funktion, die am 21. September vom Account @ChatGPT angekündigt wurde, ermöglicht es, den eigenen Kredit-Score in ChatGPT zu verfolgen. Im Bereich Finanzen verbinden Plus- und Pro-Abonnenten in den Vereinigten Staaten ihren Experian-Kreditbericht und ihren VantageScore 3.0, erhalten personalisierte Erklärungen zu den Faktoren, die diesen Wert beeinflussen, und werden benachrichtigt, wenn er sich ändert. Die Funktion ist im Web und in den neuesten Versionen der iOS- und Android-Apps verfügbar.
OpenAI nennt konkrete Anwendungsfälle: die Auswirkungen der eigenen Kreditwürdigkeit auf einen Mietantrag einschätzen, entscheiden, welche Kreditkarte zuerst abbezahlt werden soll, langfristig die eigene Kreditwürdigkeit aufbauen oder erkennen, wie Kreditwürdigkeit und Budget eine Autoleasing- oder Immobilienkreditentscheidung beeinflussen. Die Funktion ergänzt die im Mai als Vorschau für amerikanische Pro-Abonnenten eingeführten Werkzeuge für persönliche Finanzen einschließlich der Bankverbindung über Plaid.
🔗 Ankündigung von ChatGPT auf X
Google: Colab wird Teil der Google-AI-Tarife, die Gemini API beschränkt Gemini 2.5
Colab wird Teil der Google-AI-Tarife
22. September — Abonnenten von Google AI erhalten Colab-Premiumvorteile, darunter bevorzugten Zugang zu schnelleren Beschleunigern und leistungsfähigeren Maschinen. Ultra-Abonnenten erhalten zusätzlich eine unterbrechungsfreie Ausführung im Hintergrund und Zugang zu Premium-GPUs, damit ein langes Training abgeschlossen werden kann, ohne einen Tab geöffnet zu lassen. Der Beitrag spricht von einer Einführung „ab heute“, stellt jedoch klar, dass die Vorteile im Laufe der kommenden Wochen in den Ländern verfügbar werden, in denen Colab angeboten wird. Laut der Colab-FAQ werden die Recheneinheiten eines Google-AI-Tarifs und eines Colab-Pro- oder Pro+-Abonnements demselben Guthaben hinzugefügt; auf Speicherplatz beschränkte Google-One-Tarife und kostenlose Testversionen sind davon ausgenommen. Weder der Beitrag noch die FAQ beziffern die jedem Tarif zugeteilten Einheiten.
🔗 Colab ist jetzt Teil Ihres Google-AI-Tarifs · Colab-FAQ
Die Gemini API beschränkt den Zugriff auf Gemini 2.5
18. September — In einem Hinweis vom 18. September beschränken die Versionshinweise der Gemini API den Zugang zu Gemini-2.5-Modellen auf Benutzer, die sie in der Vergangenheit aktiv verwendet haben, um eine zuverlässige Leistung zu gewährleisten und Kapazitäten zu erhalten. Diese Modelle sind nicht veraltet und werden bis auf Weiteres weiterhin bereitgestellt: Auf der Seite zu veralteten Modellen ist für gemini-2.5-pro, gemini-2.5-flash und gemini-2.5-flash-lite kein Abschaltdatum angegeben; lediglich gemini-2.5-flash-image wird am 2. Oktober 2026 eingestellt. Für alle neuen Projekte empfiehlt Google Gemini 3.5 Flash-Lite oder Gemini 3.8 Flash.
🔗 Versionshinweise der Gemini API · Seite zu veralteten Gemini-Modellen
Hugging Face führt die GGUFs von llama.cpp in Transformers aus
22. September — Hugging Face ermöglicht es nun, GGUF-Dateien, das Quantisierungsformat von llama.cpp, effizient in Transformers auszuführen. Dazu muss lediglich die Datei an from_pretrained übergeben werden (Parameter gguf_file): Die Gewichte bleiben im Arbeitsspeicher komprimiert, und die Berechnungen erfolgen über die Metal-Kernels von ggml, die mithilfe der Bibliothek kernels über den Hub bereitgestellt werden. Mit dem Befehl transformers serve wird das Modell anschließend über eine OpenAI-kompatible API zugänglich gemacht.
Der anfängliche Umfang ist begrenzt: ausschließlich Macs mit Apple Silicon, die Qwen3.5-Architektur in Dense- und MoE-Versionen (sowie kompatible Qwen3.8-Checkpoints), jeweils nur eine Konversation gleichzeitig und eine Installation aus dem Branch main. Vier Kernels stammen von ggml, ein fünfter, von Hugging Face entwickelter Kernel übernimmt das Experten-Routing. Auf einem MacBook Pro M2 Max liegt Transformers laut Hugging Face „nahe“ an llama.cpp, wobei die Werte nur grafisch dargestellt werden und die Messungen nicht identisch sind (auf der einen Seite einschließlich Prefill, auf der anderen nur Decoding); für eine effiziente lokale Inferenz empfiehlt das Team weiterhin llama.cpp. Der eigentliche Vorteil liegt an anderer Stelle: Ein GGUF lässt sich mit den gewohnten PyTorch-Werkzeugen bearbeiten oder nach der Dequantisierung als Ausgangspunkt für ein Fine-Tuning verwenden.
| GGUF-Variante (Qwen3.5-4B, Unsloth) | Dateigröße | Angegebener Kompromiss |
|---|---|---|
| BF16 | 8,42 GB | Nicht quantisierte Referenz |
| Q6_K | 3,53 GB | Höhere Genauigkeit |
| Q5_K_M | 3,14 GB | Kompromiss aus Größe und Genauigkeit |
| Q4_K_M | 2,74 GB | Empfohlener Ausgangspunkt für lokal |
🔗 Transformers führt jetzt llama.cpp-Quantisierungen aus
Kimi: K3 auf Amazon Bedrock und eine umbenannte Browser-Erweiterung
Kimi K3 kommt zu Amazon Bedrock
22. September — Moonshot AI kündigt die Verfügbarkeit von Kimi K3 auf Amazon Bedrock an; laut AWS-Eintrag erfolgte dieser Start jedoch bereits am 18. September. Das Ende Juli veröffentlichte Open-Weight-Modell mit einem Kontextfenster von einer Million Tokens profitiert dort von Bedrocks Zugriffs-, Verschlüsselungs- und Auditkontrollen. Es wird über regionsübergreifende US-amerikanische und globale Inferenz (cross-Region inference) bereitgestellt (us.moonshotai.kimi-k3, global.moonshotai.kimi-k3), und sein explizites Caching beginnt bei 1.024 Tokens pro Cache-Punkt für mindestens 30 Minuten. Die Stufen Priority (1,75-facher Preis) und Flex (0,5-facher Preis) werden auf die Grundpreise angewendet.
| Inferenzoption (Standard-Stufe) | Eingabe pro Million Tokens | Ausgabe pro Million Tokens | Cache-Lesezugriff |
|---|---|---|---|
| Globale Inferenz | 3,00 Dollar | 15,00 Dollar | 0,30 Dollar |
| US-amerikanische Inferenz | 3,30 Dollar | 16,50 Dollar | 0,33 Dollar |
🔗 Kimi-K3-Eintrag auf Amazon Bedrock · Kimi K3 auf Bedrock, Ankündigung auf X
Kimi WebBridge wird zur Kimi Browser Extension
22. September — Die im Juni zusammen mit Kimi Work erschienene Browser-Erweiterung erhält einen neuen Namen und eine Seitenleiste, über die man mit Kimi kommunizieren kann, damit es Websites aufruft, Formulare ausfüllt und Aufgaben bis zum Abschluss erledigt. Wiederkehrende Aufgaben werden einmal aufgezeichnet und als Skill gespeichert, den Kimi beim nächsten Mal erneut verwendet; außerdem zerlegt die Erweiterung Webseiten in Befehle. Ein lokaler Dienst steuert den bereits geöffneten Chrome- oder Edge-Browser über das Chrome DevTools Protocol, und Moonshot erklärt, dass Anmeldesitzungen und Seiteninhalte das Gerät nicht verlassen. Nur für die Seitenleiste ist ein Kimi-Konto erforderlich.
🔗 Kimi Browser Extension · Kimi Browser Extension, Ankündigung auf X
SpaceXAI: Grok Bot bewältigt den Anstieg der Support-Tickets
22. September — SpaceXAI veröffentlicht einen Erfahrungsbericht über seinen eigenen Kundensupport, der rund um Grok Bot neu aufgebaut wurde, einen Agenten, der mit den Werkzeugen des Unternehmens arbeitet. Seit Cursor am 14. August zu SpaceXAI kam, wurden die beiden Support-Teams zusammengelegt und betreuen nun deutlich mehr Produkte. Dem Beitrag zufolge stieg das Ticketvolumen ohne eine einzige Neueinstellung um 175 %; andernfalls hätten möglicherweise 200 Personen eingestellt werden müssen. Der Messzeitraum wird nicht angegeben.
Die Einführung erfolgte schrittweise: Grok Bot wurde für Tickets mit Plain und für Vorfälle mit Linear verbunden und zunächst auf interne Notizen beschränkt, wobei jede schreibende Aktion von einem Menschen bestätigt wurde. Danach bearbeitete der Bot einfache Tickets, bevor er bereits am Ende des ersten Tages direkt auf Kundenanfragen antwortete. Heute führt er zu jedem eingehenden Ticket eine Voruntersuchung durch, reproduziert Probleme per Video für das Engineering und fasst täglich mehr als 20.000 Produktrückmeldungen zusammen.
| Von SpaceXAI veröffentlichte Kennzahl | Angegebener Wert |
|---|---|
| Anstieg der Support-Tickets | +175 % |
| Vermiedene Neueinstellungen (Schätzung) | 200 |
| Kosten pro Lösung mit klassischen Tools | 1 bis 4 Dollar |
| Niedrigste Kosten pro Ticket mit Grok Bot | 0,20 bis 0,30 Dollar |
| Ohne Menschen bearbeitete Erstattungen | 99 % |
🔗 Wie SpaceXAI Grok Bot zur Skalierung des Kundensupports einsetzt
Cognition: Kurs auf Lateinamerika und neue Versionshinweise für Devin
Cognition expandiert von São Paulo aus nach Lateinamerika
22. September — In einem Beitrag seines Lateinamerika-Teams blickt Cognition auf die in der Vorwoche im MASP, dem Kunstmuseum von São Paulo, erfolgte Ankündigung zurück: Das Unternehmen expandiert in der Region, mit einem Team in São Paulo und Neueinstellungen, darunter bei Kunden eingesetzte Ingenieure (deployed engineers). Es baut dabei auf bereits vorhandene Kunden wie Itaú, Nubank, Santander, Natura und EBANX. Bei Itaú nutzen Cognition zufolge mehr als 75 % der Technologieteams Devin, das mehr als 300.000 Repositorys dokumentiert und rund 70 % der Schwachstellen automatisch behoben habe; bei Nubank sei die Migration eines Monolithen mit mehreren Millionen Codezeilen von mehreren Jahren auf wenige Wochen verkürzt worden, und das zu weniger als einem Zwanzigstel der Kosten. Diese Ergebnisse wurden von Cognition selbst veröffentlicht und nicht durch Drittquellen belegt.
🔗 Die Zukunft der Softwareentwicklung in Lateinamerika gestalten
Devins Versionshinweise vom 21. September
21. September — Die nach unserer vorherigen Ausgabe veröffentlichten Versionshinweise von Devin nehmen SWE-2, das am 10. September erschienene Code-Modell von Cognition, als Forschungsvorschau (research preview) in die Agentenauswahl auf: SWE-2 und ein Aufwand (Medium, High oder Max) können beim Start einer Sitzung oder währenddessen ausgewählt werden, und !swe2 ermöglicht dasselbe in Slack. Die Microsoft-365-MCP-Server (Mail und Contacts, Calendar, To Do, OneDrive und SharePoint, Teams sowie das Entra-ID-Verzeichnis) werden in den MCP-Marktplatz aufgenommen; ohne konfigurierten OAuth-Berechtigungsumfang sind sie standardmäßig schreibgeschützt. Devin Review unterstützt nun Bitbucket Data Center, Plugins dürfen bis zu 20 MiB und 2.500 Dateien umfassen, und die eigenständige CLI npx devin-review wird eingestellt: Bereits installierte Kopien funktionieren nicht mehr.
🔗 Devins Versionshinweise vom 21. September
Genspark bringt seinen Präsentations-Benchmark in den SII-Index von Fireworks AI ein
22. September — Fireworks AI startet den Specialized Intelligence Index (SII), einen Index mit 20 Benchmarks für reale Arbeit aus sieben Bereichen (Sicherheit, Recht, Finanzen, Kundensupport, Software, Gesundheit und Produktivität), die von Fachleuten erstellt wurden; Harvey, Doximity, Mercor, Sierra, Decagon und Genspark gehören zu den zwölf vertretenen Unternehmen. Als einziger Benchmark der Kategorie Produktivität lässt der Genspark Slides Benchmark elf Modelle im Agenten-Harness von Genspark Slides Präsentationen zu 200 realen Aufgaben erstellen; die Bewertungen stammen vom internen Evaluator von Genspark. Für Gen-1 Slides, sein hauseigenes Modell, wiederholt Genspark die Aussage, dass der Eingabepreis ungefähr ein Siebzehntel des Preises von Claude Opus 5 beträgt.
| Bewertetes Modell | Punktzahl im SII-Index | Punktzahl im Genspark-Beitrag vom 10. September | Kosten pro Präsentation im Index |
|---|---|---|---|
| Claude Fable 5.1 | 83,6 % | nicht in der Tabelle, im Text 0,003 vor Gen-1 Slides | nicht angezeigt |
| Gen-1 Slides | 82,2 % | 0,821 | 0,44 Dollar |
| Claude Opus 5 | 81,0 % | 0,810 | 4,16 Dollar |
| Claude Fable 5 | 79,9 % | nicht in der Tabelle | nicht angezeigt |
| GPT-6 Astra | 78,0 % | nicht in der Tabelle | nicht angezeigt |
| Kimi K3 | 72,6 % | 0,723 | 2,00 Dollar |
| GPT-5.6 Sol | 67,0 % | 0,668 | 2,01 Dollar |
| MiniMax M3 | 56,1 % | 0,563 | 0,34 Dollar |
🔗 Specialized Intelligence Index · Ankündigung von Genspark
Runway startet DIFFUSE, eine Rekrutierungsplattform für KI-geschulte Kreative
22. September — Runway startet DIFFUSE (diffuse.runway.com), eine offene Plattform, auf der Marken, Agenturen und Studios Talente suchen, kontaktieren und einstellen können, die im Umgang mit generativen KI-Werkzeugen geschult sind (AI-native talent). Kreative, Freiberufler, Boutique-Studios und Produktionsfirmen können dort ein Profil erstellen und ihr Portfolio hosten; Preise werden nicht genannt.
Runway stützt sich auf eine eigene Untersuchung von mehr als 1.000 kreativen Stellenangeboten, die von fast 400 Unternehmen veröffentlicht wurden: 17 % erwähnen KI-Kompetenzen oder generative Werkzeuge, und laut dem Unternehmen ist Runway darin mit großem Abstand das am häufigsten nachgefragte Video-Tool. Runway räumt ein, dass KI kreative Berufe teilweise verdrängt, erklärt jedoch, dass sich rund um diese Werkzeuge eine neue kreative Belegschaft bildet und die Nachfrage nach ihr zunimmt.
🔗 Vorstellung von DIFFUSE · Runway auf X
NVIDIA für Entwickler: Isaac ROS 5.0, DLSS 5 und RTX Mega Geometry 2.0
Isaac ROS 5.0 setzt auf Agenten
22. September — Isaac ROS 5.0 wurde auf der ROSCon in Toronto vorgestellt. Die kostenlose und quelloffene Sammlung GPU-beschleunigter ROS-Pakete von NVIDIA unterstützt ROS Lyrical und Ubuntu 24.04 und deckt die gesamte Jetson-Produktreihe ab, vom Jetson Orin Nano bis zum Jetson Thor. Die wichtigste Neuerung betrifft Agenten: wiederverwendbare Isaac-Skills für Installation und Bedienung, eine für Agenten lesbare Dokumentation, ein Skill, der einem Agenten hilft, das Stereo-Vision-Modell FoundationStereo für eigene Kameras feinabzustimmen, sowie ein eigenständiger Skill zum Aufnehmen und Ablegen (pick and place). FoundationPose erhält eine Inferenzbibliothek, die Position und Ausrichtung von Objekten bis zu 5,5-mal schneller verfolgt, ohne dass NVIDIA die Vergleichsreferenz nennt.
DLSS 5 für Studios erläutert, RTX Mega Geometry 2.0 verfügbar
22. September — DLSS 5, das bereits in NBA 2K27 verfügbar ist, wird für Entwickler näher erläutert: Sein 3D-geführtes neuronales Rendering (3D-Guided Neural Rendering) wird als letzter Schritt in die Pipeline eingefügt, setzt beim von der Engine gerenderten Bild an und nutzt Farbe sowie Bewegungsvektoren, um Bild für Bild deterministisch Beleuchtung und Materialdetails hinzuzufügen — auf einer einzigen GeForce RTX der 50er-Serie mit bis zu 4K. Studios können die Strukturintensität (Structure Intensity) und Tonintensität (Tone Intensity) einstellen und verfügen über eine KI-gestützte semantische Maskierung. Derselbe Beitrag ergänzt ACE um zwei Modelle mit 600 Millionen Parametern, Nemotron Speech 3.5 Streaming (Spracherkennung) und Qwen3 TTS (Sprachsynthese), veröffentlicht RTX Kit 2026.3 und stellt RTX Mega Geometry 2.0 bereit, einschließlich Cluster-Streaming mit kontinuierlichem Detailgrad für sehr dichte Meshes.
🔗 Neuerungen für Spieleentwickler
NVIDIA und Inferenz: Multi-GPU-Dynamo-Triton und Confidential Computing auf B200
Dynamo-Triton 26.07 stellt ein auf acht GPUs verteiltes Modell bereit
21. September — NVIDIA zeigt, wie sich ein auf mehrere GPUs verteiltes TensorRT-Modell wie ein gewöhnliches Modell bereitstellen lässt. Die ab TensorRT 11.0 vollständig unterstützte Multi-GPU-Inferenz von TensorRT (multi-device inference) basiert auf NCCL; Dynamo-Triton 26.07, der frühere Triton Inference Server, aktiviert sie in seinem TensorRT-Backend, und die Anwendung ruft nur einen einzigen gRPC-Endpunkt auf. Bei der Videogenerierung mit Cosmos 3 Nano (1280×720, 189 Bilder, 35 Schritte) sinkt die End-to-End-Latenz von 156,6 Sekunden auf einer GPU auf 34,2 Sekunden auf acht GPUs und ist damit 4,58-mal kürzer. NVIDIA weist darauf hin, dass der Test weder den Durchsatz bei gleichzeitigen Anfragen noch die Kosten pro Video misst.
| Getestete Konfiguration | Anzahl der GPUs | Durchschnittliche End-to-End-Latenz |
|---|---|---|
| Einzel-GPU | 1 | 156,595 s |
| CP2 | 2 | 87,999 s |
| CP4 | 4 | 53,093 s |
| CP8 | 8 | 34,183 s |
🔗 Dynamo-Triton und Multi-GPU-TensorRT
Vertrauliche Inferenz auf B200 behält mehr als 96 % des Durchsatzes bei
22. September — NVIDIA misst die Kosten seines Confidential Computing auf Blackwell, das Workloads in virtuellen Maschinen mit verschlüsseltem Arbeitsspeicher, vertraulichen GPUs und verschlüsseltem NVLink ausführt. Auf einem DGX B200 (acht GPUs, Intel-TDX-Plattform), der DeepSeek-R1 in NVFP4 mit TensorRT LLM bereitstellt, bei 32.000 Eingabe- und 1.000 Ausgabe-Tokens, behält der vertrauliche Modus bei 1 bis 16 gleichzeitigen Anfragen 96,1 bis 98,2 % des Durchsatzes bei und erhöht die durchschnittliche Zeit pro Ausgabe-Token lediglich um 1,2 bis 4,3 %. Dafür waren drei Anpassungen am Framework erforderlich: auslagerbarer statt fixierter Speicher für bestimmte Übertragungen, ein interner GPU-Zähler für den Kernel-Autotuner und andere Kommunikationsalgorithmen, da NVLink-SHARP-Multicast in diesem Modus nicht verfügbar ist. Der Workload wurde so gewählt, dass der Mehraufwand sichtbar wird; NVIDIA empfiehlt, die beiden Modi mit dem eigenen Workload zu vergleichen.
🔗 Confidential Computing und TensorRT LLM
Kurzmeldungen
- Zed bereitet Delta vor — Zed kündigt für diese Woche, ohne dass sie bereits verfügbar wären, Farben zum Gruppieren der Threads von Delta, seiner Multiplayer-Codeumgebung mit Agenten, sowie eine Anzeige an, die den verbleibenden Abstand bis zur automatischen Kontextkomprimierung zeigt. 🔗 Quelle
- Replit und Handshake — Replit ist Gründungspartner des AI Skills Studio von Handshake: Drei kostenlose 45-minütige Aufgaben führen zu einem Projekt, das im Handshake-Profil angezeigt wird; OpenAI (10 Aufgaben), Google, Figma und Vercel gehören zu den weiteren Partnern. 🔗 Quelle
- oMLX schließt sich Hugging Face an — Jun Kim, Schöpfer von oMLX, einem Projekt aus Apples MLX-Ökosystem, wechselt zu Hugging Face; das Projekt bleibt unter Apache 2.0, weiterhin unter seiner Leitung, wird nun gepflegt und finanziert und zielt zunächst auf eine schnellere Überführung von Transformers-Modellen zu MLX. 🔗 Quelle
- SnowLLM — Community-Beitrag: Diese unter Apache-2.0 veröffentlichte Inferenz-Engine (Kernel werden binär ausgeliefert), die für die GPU der Ryzen AI Max geschrieben wurde, dekodiert laut ihren Autoren bis zu 2,3-mal schneller als llama.cpp (1,9-mal ohne spekulatives Dekodieren) und führt den Prefill bis zu 9,4-mal schneller aus. 🔗 Quelle
- DecisionBench und Bosun v3.1 — Hanno Labs veröffentlicht DecisionBench 1.0 (43 Aufgaben, 28 Bereiche) und zwei Open-Weight-Entscheidungsmodelle auf Basis von Qwen3 (0,6 und 1,7 Milliarden Parameter), die in seiner eigenen anwendungsbezogenen Testsuite 83,20 % beziehungsweise 87,29 % erreichen; Jev liegt in der Reasoning-Kategorie vor ihnen. 🔗 Quelle
- Ein Moshi mit 600 Millionen Parametern — Ein Entwickler berichtet über seinen Versuch eines auf Qwen3-0.6B-Base basierenden Full-Duplex-Sprachmodells, dessen Training pro Versuch auf B200 zwischen 2 und 15 Dollar kostete: Der Text konvergiert, doch die Stimme bleibt undeutlich; die Blockade wurde in den feinen akustischen Codebooks lokalisiert. Das Projekt ist pausiert, Gewichte wurden nicht veröffentlicht. 🔗 Quelle
- Together AI und GLM-5.2 — In einer Fallstudie vom 18. September, die am 21. auf X erneut veröffentlicht wurde, beschreibt Together AI ein Fintech-Unternehmen, das seine Code-Agenten mit GLM-5.2 bei einem Kontext von 256K auf 56 B200 betreibt; ein Vorfall mit einer Warteschlange von 1 bis 3 Minuten wurde noch am selben Tag durch eine Neukonfiguration des Routings behoben. 🔗 Quelle
- Gemini CLI — Die Nightly-Version vom 22. September, die erste mit neuem Code seit dem 19., behebt den Absturz
HttpsProxyAgent is not a constructorbei Vertex AI hinter einem Proxy und sendet im ACP-Modus das Updatetool_callvor der Berechtigungsanfrage. 🔗 Quelle - Google Flow — Der offizielle Account gibt mehr als 25 Millionen monatliche Nutzer an und verlängert für alle die zusätzlichen 50 täglichen Credits, ein Angebot, das im Juli bis zum 31. August Google-AI-Abonnenten vorbehalten war. 🔗 Quelle
- Jigsaw und Sensemaking AI — Googles Inkubator startet sein Partner Program, um seine von Gemini unterstützte Open-Source-Suite für Bürgerbeteiligung in 30 Städten, Bundesstaaten und Ländern einzusetzen, mit einem Fonds von Google.org, Bloomberg Philanthropies und der Packard Foundation, dessen Höhe nicht veröffentlicht wurde. 🔗 Quelle
- 100.000 Ausbildungsstipendien — Am Rande der Generalversammlung der Vereinten Nationen finanziert Google über die AI Skills Coalition des Programms AI for Good der ITU 100.000 Stipendien für zertifizierende KI-Schulungen in mehr als 80 Ländern, die von lokalen Regierungen und dem Giga-Netzwerk vergeben werden. 🔗 Quelle
- Agenten, die Googles Code absichern — In einem Beitrag vom 19. September erklärt Google, jede Codeänderung an seiner Infrastruktur vor der Einreichung mit Agenten zu analysieren, die auf seinem Open-Source-Harness Mantis basieren und monatlich Hunderte Schwachstellen blockieren; der Triage-Agent gibt eine Genauigkeit von mehr als 92 % in weniger als einer Minute an. 🔗 Quelle
- Copilot CLI 1.0.88 — Vom Unternehmen verwaltete Einstellungen gelten nun auch für die Sitzungen
--acp,--ahp-hostund--server, für die es bisher weder MCP-Richtlinien noch Berechtigungen oder Plugins gab, und/forkfunktioniert während eines Durchlaufs; Version 1.0.87 vom 21. September hatte verwaltete Einstellungen für die Routing-Stufe Auto hinzugefügt. 🔗 Quelle - Pika und Seedance 2.5 — Der Draft-Modus von Seedance 2.5 ist jetzt auf Pika und im Pika API Club verfügbar: Entwürfe von Clips ab 10 Cent pro Sekunde, die anschließend in hoher Qualität fertiggestellt werden können. 🔗 Quelle
- Pika Swap Anything — Eine neue Pika-Anwendung ersetzt Darsteller, Kostüme, Kulissen oder Requisiten eines Videos und bewahrt dabei Rhythmus, Bewegungen und Erzählweise der ursprünglichen Aufnahme; Preise wurden nicht genannt. 🔗 Quelle
- Suno Studio — Sunos Musikproduktions-Workstation integriert eine Suite von Audioeffekten, darunter einen Kompressor (Schwellenwert, Verhältnis, Attack, Release, Sidechain), die im Premier-Abonnement enthalten ist. 🔗 Quelle
- Sluicebox und Nemotron 3 Ultra — NVIDIA-Fallstudie: Durch den Wechsel zu Nemotron 3 Ultra senkt dieses junge Unternehmen für die CO₂-Analyse von Lieferketten seine Inferenzkosten um 51 bis 80 % und erreicht bei der Extraktion von Lieferantendaten 87,7 %, gegenüber 84 % bei seinem vorherigen Modell. 🔗 Quelle
- Topograph — Ein Open-Source-Toolkit von NVIDIA, das die Netzwerktopologie eines GPU-Clusters ermittelt und sie für Kubernetes, Slurm und Slinky bereitstellt, damit verteilte Workloads möglichst nah beieinander platziert werden; es liest die APIs von Crusoe, Google Cloud, Lambda, Nebius, Nscale und Oracle Cloud. 🔗 Quelle
- Einen Agenten evaluieren — In einem Methodenbeitrag vom 21. September schlägt NVIDIA sechs Metriken vor, vom Tool-Aufruf bis zur abgeschlossenen Aufgabe, und nennt für Nemotron 3.5 Lightning 86 % auf PinchBench bei 30 % höherer Geschwindigkeit als Qwen3.6 35B. 🔗 Quelle
- Qwen-Image-2.1 auf Intel — Der am 21. September von Intel angekündigte und am 22. von Qwen weiterverbreitete Support ab dem ersten Tag über OpenVINO richtet sich an Arc Pro B70 GPUs und die integrierten GPUs der Core Ultra Series 3; dazu gibt es ein eigenes Notebook. 🔗 Quelle
- Box und Grok 4.7 — Am 21. September, dem Tag der Veröffentlichung von Grok 4.7, testete Box das Modell in einer Vorschau von Box Agent anhand eines Schadensfalls über 2 Millionen Dollar: Eine doppelte Rechnung über 82.000 Dollar und eine fehlende Gutschrift über 64.000 Dollar wurden erkannt; weder Verfügbarkeitsdatum noch Preis wurden genannt. 🔗 Quelle
- Ein Chirurg und Codex — OpenAI Developers veröffentlicht ein Video, in dem der Handchirurg Brian Pridgen zeigt, wie er mit Codex eigene Werkzeuge entwickelt und die wissenschaftliche Literatur auf PubMed auswertet; Zahlen oder eine schriftliche Studie gibt es nicht. 🔗 Quelle
- ChatGPT in Word — Am 17. September angekündigt: Ein einziges Microsoft-Add-in ermöglicht weltweit und in allen Tarifen, einschließlich Free, den Zugriff auf ChatGPT in Word, Excel und PowerPoint, wobei Nutzungslimits gelten; Business und Enterprise erhalten bis zum 30. September eine kostenlose Vorschau auf GPT-5.6 Sol in Word. 🔗 Quelle
- KI-Kompetenz — Perplexity veröffentlicht einen Leitfaden, der die Bewertung von Antworten zur Schlüsselkompetenz erklärt, das „Schulungstheater“ kritisiert und Gallup zitiert: 38 % angegebene Akzeptanz, aber nur 12 % tägliche Nutzung im vierten Quartal 2025. 🔗 Quelle
Was das bedeutet
Am selben Tag vertraten Anthropic und OpenAI dasselbe Argument: nicht um jeden Preis ein leistungsfähigeres Modell, sondern nahezu das Niveau ihrer Spitzenmodelle zu deutlich geringeren Kosten. Opus 5.5 wird als auf dem Niveau von Fable 5.1 liegend präsentiert und soll 40 % weniger kosten als Opus 5; GPT-6 Sol soll einen großen Teil der Stärken von Astra für 2 beziehungsweise 10 Dollar pro Million Tokens übernehmen. Beide Anbieter rechnen inzwischen eher mit den Kosten pro Aufgabe als mit dem Preis pro Token und machen den Cache zum eigentlichen Hebel: Lesezugriffe für 0,20 Dollar bei Anthropic, bis zu 90 % Rabatt und explizite Haltepunkte bei OpenAI.
Die Integration lässt sich unterdessen in Stunden messen. GitHub Copilot, Devin, Perplexity, Cursor und v0 stellten die neuen Modelle noch am selben Tag bereit, jeweils mit einer eigenen Messgröße: FrontierCode 1.1 Extended bei Cognition, WANDR bei Perplexity und CursorBench bei Cursor. Diese Zahlen sind nicht direkt vergleichbar (65,3 % für Opus 5.5 in der Extended-Variante, 54,4 % in der Main-Variante), und keiner der beiden Anbieter vergleicht sein neues Modell bislang mit dem des anderen. Für Entwickler entscheidet sich die richtige Wahl zunehmend im eigenen Werkzeug und bei den eigenen Aufgaben statt in den Tabellen zur Markteinführung.
Auch die Tarife werden zu einem Feld der Differenzierung. Anthropic erhöht seine Limits über fünf Stunden, bietet eine Zurücksetzung an und stellt Pro und Team Standard in Claude Code auf Opus um; GitHub behält Opus 5.5 den höheren Tarifen vor, bietet GPT-6 Luna aber bereits ab Copilot Pro an; Google integriert Colab in seine Google-AI-Tarife und schränkt zugleich Gemini 2.5 ein, um Kapazitäten zu sichern. Die Verteilung der Rechenleistung auf die verschiedenen Tarife wiegt inzwischen ebenso schwer wie der angezeigte Preis.
Schließlich verändert sich auch die Art der Messung selbst. Anthropic räumt ein, dass Benchmark-Abstände weniger aussagekräftig sind als früher und Opus 5.5 oft zu erkennen scheint, dass es evaluiert wird; OpenAI legt Regeln fest, um seine Modelle für unabhängige Evaluatoren zu öffnen; das britische AISI macht seine Ergebnisse mit EvalEval reproduzierbar, und NVIDIA schlägt vor, einen Agenten anhand der erledigten Aufgabe statt anhand jedes einzelnen Tool-Aufrufs zu beurteilen. Zu überprüfen, was ein Modell tatsächlich leistet, zählt inzwischen ebenso viel wie sein Ergebnis.
Quellen
- Vorstellung von Claude Opus 5.5 (Anthropic)
- @claudeai: Veröffentlichung von Claude Opus 5.5
- Neuerungen von Claude Opus 5.5 für die API
- Claude Code v2.1.280
- Was eine Aufgabe mit Opus 5.5 kostet
- Das Beste aus Opus 5.5 herausholen
- Vorstellung von GPT-6 Sol und Luna (OpenAI)
- @OpenAI: Veröffentlichung von GPT-6 Sol und Luna
- Besseres Prompt-Caching für GPT-6
- Claude Opus 5.5 in GitHub Copilot
- GPT-6 Sol und GPT-6 Luna in GitHub Copilot
- Claude Opus 5.5 in Devin
- GPT-6 Sol und Luna in Devin
- Grok 4.7 in Devin
- @v0: Grok 4.7 in v0
- @perplexity_ai: Opus 5.5 in Computer
- @perplexity_ai: GPT-6 Sol in Computer
- Änderungsprotokoll der Perplexity API
- @cursor_ai: Opus 5.5 in Cursor
- @v0: Opus 5.5 in v0
- @ClaudeDevs: Limits von Claude Code
- @ClaudeDevs: Zurücksetzung der Limits
- Codex CLI 0.156.0
- Vibe CLI v2.25.7
- CHANGELOG von Vibe CLI
- Qwen Code v0.24.4
- Ein Runner, viele Worktrees (Amp)
- Prioritäten und Grundsätze für wirksame Bewertungen durch Dritte (OpenAI)
- Wie UK AISI und EvalEval Benchmark-Ergebnisse reproduzierbar machen
- @ChatGPT: Experian-Kreditwürdigkeit
- Colab ist jetzt Teil deines Google-AI-Tarifs
- Colab-FAQ
- Versionshinweise der Gemini API
- Seite zu den Gemini-Abkündigungen
- Transformers unterstützt jetzt llama.cpp-Quantisierungen
- Kimi-K3-Eintrag auf Amazon Bedrock
- @Kimi_Moonshot: Kimi K3 auf Bedrock
- Kimi Browser Extension
- @Kimi_Moonshot: Kimi Browser Extension
- Wie SpaceXAI Grok Bot zur Skalierung des Kundensupports einsetzt
- Die Zukunft des Software Engineering in Lateinamerika gestalten (Cognition)
- Devin-Versionshinweise vom 21. September
- Specialized Intelligence Index (Fireworks AI)
- @genspark_ai: Genspark Slides Benchmark im SII
- Vorstellung von DIFFUSE (Runway)
- @runwayml: Veröffentlichung von DIFFUSE
- Isaac ROS 5.0 (NVIDIA)
- Neuerungen für Spieleentwickler (NVIDIA)
- Dynamo-Triton und Multi-GPU-TensorRT (NVIDIA)
- Vertrauliches Computing und TensorRT LLM (NVIDIA)
- @zeddotdev: Neuerungen bei Delta
- @Replit: AI Skills Studio von Handshake
- Jun Kim wechselt zu Hugging Face (oMLX)
- SnowLLM
- DecisionBench und Bosun v3.1 (Hanno Labs)
- Full-Duplex-Sprache verkleinern
- Together-AI-Fallstudie (Dedicated Model Inference)
- Gemini CLI v0.62.0-nightly.20260922
- @FlowbyGoogle: 25 Millionen Nutzer
- Sensemaking AI und Jigsaw Partner Program (Google)
- Investitionen in weltweite Talente und KI-Kompetenz (Google)
- Agentische KI zur Absicherung von Infrastrukturcode einsetzen (Google Cloud)
- Copilot CLI v1.0.88
- @pika_labs: Draft-Modus von Seedance 2.5
- @pika_labs: Swap Anything
- Über Kompression (Suno)
- Sluicebox-Fallstudie (NVIDIA)
- Topograph (NVIDIA)
- Wie KI-Agenten evaluiert werden (NVIDIA)
- Qwen-Image-2.1 auf Intel-Hardware (OpenVINO)
- @Box: Grok 4.7 in Box Agent
- @OpenAIDevs: ein Chirurg und Codex
- @ChatGPT: ChatGPT in Word
- KI-Kompetenz (Perplexity)