ai-powered-markdown-translatorArtikel, der mit gpt-5.6-sol aus dem Französischen ins Deutsche übersetzt wurde.
An diesem Freitag nähern sich die Agentenwerkzeuge gemeinsamen Formaten an: Claude Code liest nun AGENTS.md, wenn ein Projekt keine CLAUDE.md besitzt, Antigravity fügt den Katalog der Subagenten in den System-Prompt seiner Markdown-Agenten ein, Codex schlüsselt seinen Verbrauch nach Subagent auf und MiniMax stellt den Code seines Terminal-Agenten bereit. Der Rest des Tages lässt sich auf zwei Modellveröffentlichungen – Qwen3.8-Omni-Flash und Grok Voice Transcribe 2.0 – sowie eine ungewöhnliche Partnerschaft reduzieren: Anthropic holt Evaluatoren von Accenture in das eigene Unternehmen.
Claude Code liest AGENTS.md, isoliert Subagenten und entfernt TaskOutput
18. September — Innerhalb von zwanzig Stunden erschienen drei Versionen von Claude Code: 2.1.275 am 17. September um 22:33 Uhr UTC, 2.1.276 am 18. um 02:12 Uhr UTC und 2.1.277 am 18. um 18:06 Uhr UTC.
Die strukturell wichtigste Neuerung steht in einer einzigen Zeile der Version 2.1.277. In einem Projekt ohne CLAUDE.md liest Claude Code AGENTS.md, die Anweisungsdatei, die sich bei mehreren Code-Agenten auf dem Markt zu einer gemeinsamen Konvention entwickelt hat. Die Einstellung lässt sich in /config unter „Project instructions“ ändern. Die Funktion ist auf Bedrock, Vertex und Foundry noch nicht verfügbar.
Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)
🇩🇪 Unterstützung für AGENTS.md hinzugefügt: In einem Projekt ohne CLAUDE.md liest Claude Code stattdessen AGENTS.md; die Einstellung lässt sich unter „Project instructions“ in /config ändern (noch nicht auf Bedrock, Vertex oder Foundry). — Claude-Code-CHANGELOG, anthropics/claude-code
Zwei weitere Änderungen derselben Version betreffen die Sicherheit des Kontexts. Ergebnisse von Subagenten werden unter einer Überschrift an den Hauptagenten zurückgegeben, die sie als solche kennzeichnet, damit ein von einem Subagenten zurückgegebener Text nicht als Anweisung der Sitzung erscheinen kann; außerdem werden unsichtbare Unicode-Formatierungszeichen aus Prompts entfernt, wobei die bereinigte Version vor dem Senden angezeigt wird. Version 2.1.277 entfernt zudem das veraltete Werkzeug TaskOutput: Claude liest die Ausgabedatei einer Hintergrundaufgabe nun mit Read.
Version 2.1.275 fügt eine Taste zum sofortigen Senden (ctrl+enter) hinzu, die den laufenden Turn unterbricht und alle Nachrichten in der Warteschlange auf einmal versendet, sowie die Synchronisierung der im claude.ai-Konto aktivierten Skills und Plugins mit dem Terminal. Im Bereich der Lieferkette werden aus npm stammende Plugins per npm pack --ignore-scripts mit Integritätsprüfung abgerufen, wodurch die Installationsskripte eines Pakets nicht ausgeführt werden können. Version 2.1.276, die weniger als vier Stunden später veröffentlicht wurde, behebt lediglich eine Regression dieser Version: einen 400-Fehler, durch den alle Anfragen hinter einem Proxy fehlschlugen.
| Versionsnummer | Veröffentlichung (UTC) | Wichtigste Inhalte |
|---|---|---|
| 2.1.275 | 17.09. um 22:33 Uhr | Sofortiges Senden, Synchronisierung der claude.ai-Skills, npm --ignore-scripts |
| 2.1.276 | 18.09. um 02:12 Uhr | Einzelne Korrektur: 400-Fehler hinter einem Proxy |
| 2.1.277 | 18.09. um 18:06 Uhr | Unterstützung für AGENTS.md, Isolierung der Subagenten, Entfernung von TaskOutput |
Qwen3.8-Omni-Flash, das erste agentische Omni-Modal-Modell von Qwen
18. September — Qwen veröffentlicht Qwen3.8-Omni-Flash, das als sein erstes rund um agentische Fähigkeiten entwickeltes Omni-Modal-Modell vorgestellt wird. Im Mittelpunkt steht nicht länger das Verstehen multimodaler Inhalte, sondern deren Nutzung: Inhalte verstehen, die Aufgabe planen, sie mit Werkzeugen ausführen und das Ergebnis liefern. Das Modell akzeptiert Text, Bilder, Audio und Video in einem Kontextfenster von einer Million Tokens.
Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!
🇩🇪 Hier ist Qwen3.8-Omni-Flash, das erste Omni-Modal-Modell von Qwen, das rund um agentische Fähigkeiten entwickelt wurde. — @Alibaba_Qwen auf X
Bei den 29 von Qwen ausgewählten Evaluierungen steigt die durchschnittliche Punktzahl gegenüber Qwen3.5-Omni-Plus um mehr als 25 %, wobei sich die Verbesserungen auf Audio-Video-Agenten konzentrieren. Die Mehrsprechererkennung verzeichnet die stärkste Veränderung.
| Ausgewählte Evaluierung | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71,0 | 34,5 | 58,9 |
| UniClawBench | 69,6 | 67,1 | 69,0 |
| AgenticVBench | 36,8 | 14,5 | 45,0 |
| OmniVideoBench | 63,4 | 53,8 | 65,2 |
| StreamingBench | 80,8 | 57,1 | 79,9 |
| AliMeeting DER / cpWER (niedriger ist besser) | 3,4 / 17,2 | 88,1 / 89,6 | 72,6 / 53,1 |
Der originellste Aspekt ist die agentische Wahrnehmung bei langen Videos. Statt eine Aufnahme von Anfang bis Ende zu verarbeiten, geht das Modell von der gestellten Frage aus, entscheidet selbst, was es ansehen und anhören muss, und lokalisiert die Information in aufeinanderfolgenden Durchläufen vom Groben zum Feinen. Bei OmniVideoBench erhöht dieser Modus die Genauigkeit von 63,4 auf 67,8 und senkt zugleich den Verbrauch von 145 736 auf 79 117 Tokens pro Anfrage, also um rund 45,7 % weniger – eine Zahl, die der offizielle Beitrag selbst nennt.
Auch die Preisgestaltung folgt diesem Trend: Nach der Methodik von Qwen sinkt der Preis pro Stunde Audioeingabe gegenüber Qwen3.5-Omni-Plus um mehr als 98 %. Gleichzeitig werden zwei Komponenten bereitgestellt: Qwen-MM-Plugins, das mit den Harnesses Codex, Claude Code, Qwen Code und Gemini CLI kompatibel ist, sowie Qwen-Live Harness für Echtzeitinteraktionen. Eine Realtime-Variante ist für kontinuierliche Interaktionen mit niedriger Latenz vorgesehen und liefert das erste Token nach 591 bis 981 Millisekunden.
🔗 Qwen-Beitrag zu Qwen3.8-Omni-Flash
Codex CLI 0.155.0 führt Sprachunterhaltungen experimentell ein
17. September — OpenAI veröffentlicht Codex CLI 0.155.0, die erste stabile Version seit 0.154.0 vom 10. September, installierbar über npm install -g @openai/codex@0.155.0. Damit erscheint der bislang fehlende Changelog-Eintrag zu dem am Vortag auf X angekündigten Sprachagenten: Die Funktion heißt /voice, bietet Live-Transkription und Mikrofonsteuerung und bleibt experimentell – sie ist nur in unterstützten Builds (supported builds) verfügbar und muss über /experimental aktiviert werden.
Der Rest der Version ist unauffälliger, aber unmittelbar nützlicher. Die Terminaloberfläche erhält Live-Zusammenfassungen der Schlussfolgerungen in der Statuszeile sowie einen Abschlusszeitstempel nach jedem erfolgreichen Turn. In der Agentenübersicht können Aufgaben ausgeblendet, archiviert und gelöscht werden; zudem werden Eigentumsdetails zu Worktrees angezeigt und vor dem Löschen sauberer verwalteter Worktrees eine Bestätigung verlangt. Auf kompatiblen Macs lassen sich MCP-Anfragen lokaler TUI-Sitzungen per Touch ID bestätigen. Amazon Bedrock kann seine AWS-Anmeldedaten aus konfigurierten Befehlen beziehen, einschließlich Caching, Aktualisierung bei Ablauf und Wiederaufnahme nach fehlgeschlagener Authentifizierung.
Mehrere Korrekturen betreffen die Sicherheit: Das Ausbrechen von Windows-Prozessen aus eingeschränkten WSL-Sandboxes wird blockiert, vermittelte Shell-Snapshots werden gegen die Offenlegung von Anmeldedaten gehärtet, und ein Kontowechsel macht Fernsteuerungssitzungen, zwischengespeicherte WebSocket-Zustände und Modellkataloge ungültig, die zur vorherigen Identität gehören.
| Neuerung der Version | Details |
|---|---|
/voice | Live-Transkription und Mikrofonsteuerung, experimentell über /experimental |
| Terminaloberfläche | Zusammenfassungen der Schlussfolgerungen in der Statuszeile, Abschlusszeitstempel |
| Agentenübersicht | Ausblenden, Archivieren und Löschen von Aufgaben, Eigentümerschaft der Worktrees |
| Touch ID | Bestätigung von MCP-Anfragen in lokalen Sitzungen auf kompatiblen Macs |
| Amazon Bedrock | Per Befehl bezogene AWS-Anmeldedaten mit Cache und Aktualisierung |
🔗 Versionshinweise zu Codex CLI 0.155.0
Codex schlüsselt seinen Verbrauch nach Aufgabe, Subagent und Unterhaltung auf
18. September — OpenAI Developers kündigt eine detaillierte Verbrauchsübersicht in Codex an: Das Werkzeug zeigt, wie Aufgaben, Subagenten und einzelne Unterhaltungen zur Gesamtnutzung beitragen. Die Informationen befinden sich in der Desktop-App für persönliche Konten und Business-Konten unter Einstellungen und anschließend Usage & billing beziehungsweise bei berechtigten Enterprise-Konten unter Usage; dafür muss die App auf dem neuesten Stand sein. Die Ankündigung wird weder von einem Blogbeitrag noch von einem Changelog-Eintrag begleitet.
Die Granularität ist der entscheidende Punkt. Bislang ließ sich bei einem ausgeschöpften Kontingent nicht erkennen, woher der Verbrauch stammte; eine Aufschlüsselung nach Subagent zeigt, welche Delegation Kosten verursacht, sodass sie überarbeitet werden kann. Sie ist das buchhalterische Gegenstück zur zunehmenden Verbreitung von Subagenten in Code-Harnesses.
🔗 Ankündigung von OpenAI Developers auf X
Grok Voice Transcribe 2.0, die Spracherkennung von SpaceXAI zum unveränderten Preis
18. September — SpaceXAI kündigt Grok Voice Transcribe 2.0 an, sein neues Spracherkennungsmodell (speech-to-text), das bei gleichem Preis als doppelt so präzise wie Version 1.0 beschrieben wird. Das Modell basiert auf der Audio-Grundlage, die bereits Grok Voice antreibt. Dieses verarbeitet nach Angaben des Unternehmens täglich Zehntausende Kundensupportanrufe und transkribiert Millionen Stunden Videokommentar.
Das zentrale Argument bezieht sich auf reale statt auf unter Laborbedingungen aufgezeichnete Audiodaten: instabile Telefonleitungen, konkurrierende Stimmen, regionale Akzente sowie laut diktierte Telefonnummern und E-Mail-Adressen. SpaceXAI beansprucht unter 32 Streaming-Modellen den ersten Platz bei der Genauigkeit in der öffentlichen Rangliste von Artificial Analysis und stützt sich auf vier interne, aus dem Produktionsverkehr gewonnene Datensätze – 8-kHz-Telefonie, Unterhaltungen mit Grok, diktierte Identifikatoren und kurze Sprachbefehle in 19 Sprachen.
Die deutlichste Verbesserung betrifft die Mehrsprachigkeit. Bei den kurzen Sätzen, die am wenigsten Kontext zur Erkennung der Sprache bieten, sinkt die Wortfehlerrate von 20,6 % auf 6,8 %. Das Modell erkennt die Sprache automatisch und folgt Sprachwechseln während der Aufnahme in einem einzigen Durchlauf.
| Gemessene Metrik | Angegebener Wert |
|---|---|
| Beanspruchte Genauigkeit gegenüber Transcribe 1.0 | doppelt so hoch |
| Rangliste von Artificial Analysis (Streaming) | 1. von 32 Modellen |
| Fehlerrate bei kurzen Sätzen (1.0 → 2.0) | 20,6 % → 6,8 % |
| Preis für Stapelverarbeitung | 0,10 Dollar pro Audiostunde |
| Preis für Streaming | 0,20 Dollar pro Audiostunde |
| Unabhängig transkribierte Kanäle | bis zu 8 |
| Fachbegriffe pro Anfrage | bis zu 100 |
Das Modell unterstützt Stapelverarbeitung und Streaming, Zeitstempel auf Wortebene mit Konfidenzwert, Sprechertrennung (diarization) ohne Aufpreis und die Erkennung des Endes eines Redebeitrags. Bestehende API-Integrationen erhalten die höhere Genauigkeit ohne Codeänderung. Grok Voice Transcribe 2.0 wird demnächst zum Standardmodell der API, und Version 1.0 wird in den kommenden Wochen als veraltet eingestuft: Wer sie weiterverwenden möchte, muss grok-voice-transcribe-1.0 festschreiben.
🔗 Ankündigung von Grok Voice Transcribe 2.0
Anthropic holt Evaluatoren von Accenture in das Unternehmen
18. September — Anthropic kündigt eine Partnerschaft mit Accenture zur unabhängigen Evaluierung von Frontier-Modellen an, die als wichtiger Schritt zur Umsetzung der Zusage seines CEO dargestellt wird, eingebettete Evaluatoren (embedded) aufzunehmen. Die Arbeit übernimmt Faculty, die auf KI spezialisierte Tochtergesellschaft von Accenture; sie umfasst die Evaluierung und das Red-Teaming von Modellen, Alignment-Evaluierungen sowie Tests der Schutzmechanismen.
Die Abgrenzung zu externen Evaluatoren ist ausdrücklich: Ein eingebetteter Evaluator arbeitet innerhalb des KI-Unternehmens und erhält einen Zugang, der mit dem eines Mitarbeiters vergleichbar ist. Er kann Modelle während ihres Trainings beobachten, die Entscheidungen zu ihrer Entwicklung und Bereitstellung verfolgen, direkt mit Beschäftigten sprechen, die Einhaltung von Sicherheitszusagen überprüfen, Vorfälle melden und eine fundiertere Beschreibung von Nutzen und Risiken veröffentlichen. Anthropic stellt klar, dass diese Regelung seine Verantwortung nicht mindert, sondern sie besser überprüfbar macht.
Die Ankündigung ist ungewöhnlich offen hinsichtlich dessen, was noch nicht existiert. Es gibt weder einen Standard dafür, auf welche Informationen ein eingebetteter Evaluator zugreifen sollte, noch dafür, wie er seine Erkenntnisse veröffentlichen sollte, noch ein etabliertes System zur Finanzierung unabhängiger Evaluierungen. Anthropic ist der Ansicht, dass diese Finanzierung langfristig aus gemeinsamen oder öffentlichen Mitteln stammen sollte; da es einen solchen Mechanismus derzeit nicht gibt, finanziert das Unternehmen die Arbeit von Accenture direkt – die sichtbarste Einschränkung dieser Konstruktion.
| Bestandteil der Partnerschaft | Angegebener Wert |
|---|---|
| Ausführende Einheit | Faculty, KI-Tochtergesellschaft von Accenture |
| Investition | Mindestens 1 Milliarde Dollar je Partei über fünf Jahre |
| Abgedeckter Bereich | Evaluierung, Red-Teaming, Alignment, Schutzmechanismen |
| Zugriffsniveau | Mit dem eines Mitarbeiters vergleichbar |
| Finanzierung | Direkt durch Anthropic, mangels gemeinsamer Fonds |
| Exklusivität | Keine, auf beiden Seiten |
Anthropic gibt außerdem an, mit METR und weiteren gemeinnützigen Evaluatoren darüber zu sprechen, Elemente eingebetteter Evaluierungen mit deren eigenen Finanzmitteln zu erproben, und kündigt für die kommenden Wochen weitere Partner an.
🔗 Anthropic-Ankündigung zur eingebetteten Evaluierung
Antigravity: drei Versionen in zwei Tagen rund um benutzerdefinierte Agents
Google hat unmittelbar nacheinander zwei Versionen seiner CLI und eine Version der Antigravity-Anwendung veröffentlicht. Alle drei behandeln dasselbe Thema aus drei Blickwinkeln: was ein benutzerdefinierter Agent weiß, was er ablehnen kann und wie lange er unbeaufsichtigt laufen kann. Sie setzen eine dichte Reihe fort, die am 11. September begann und deren Versionen 1.2.1 bis 1.2.4 hier nicht aufgeführt werden.
CLI 1.2.6 führt eine sitzungsgebundene Remote Control ein und hebt die Fünf-Minuten-Grenze auf
18. September — Acht Tage nach 1.2.0, mit der die CLI zu einem persistenten Systemdienst wurde, schlägt Google mit einer zweiten, wesentlich schlankeren Form von Remote Control die entgegengesetzte Richtung ein: eine auf die Sitzung beschränkte Verbindung (session-scoped), die beim Start mit dem Flag --remote-control oder während des Betriebs mit dem Befehl /remote-control geöffnet wird. Die Eingabe von /remote-control off oder das Schließen der Sitzung baut den Tunnel ab und entfernt das Gerät aus der Liste. Während 1.2.0 auf einen Daemon abzielte, der die Sitzung überdauert, verfolgt 1.2.6 das Gegenteil.
Die zweite Änderung betrifft den Modus ohne Benutzeroberfläche (headless): Das standardmäßige Zeitlimit für -p-/--prompt-Ausführungen steigt von fünf Minuten auf unbegrenzt, sofern --print-timeout nicht ausdrücklich angegeben wird. Die dritte Änderung strukturiert die Fehlerberichterstattung: Bei einem Agent- oder API-Fehler schreibt die CLI eine JSON-Zeile AGY_ERROR: {...} in die Fehlerausgabe, die den kanonischen Status, den HTTP- oder gRPC-Code, die Wiederholbarkeit und eine Fehlerkennung enthält; zugleich ändert sich der Exit-Code von 1 auf 3. Ein Orchestrierungsskript kann dadurch einen vorübergehenden Netzwerkausfall von einem endgültigen Fehler unterscheiden, ohne Freitext analysieren zu müssen.
CLI 1.2.5 gibt Markdown-Agents endlich das Verzeichnis ihrer Sub-Agents
17. September — Bislang konnte ein in Markdown definierter benutzerdefinierter Agent invoke_subagent in seinen Tools deklarieren, ohne jemals zu wissen, welche Sub-Agents existierten: Er besaß das Tool, aber nicht das Verzeichnis. Die CLI fügt seinem System-Prompt nun automatisch den Katalog der verfügbaren Sub-Agents und deren Gebrauchsanleitung hinzu, wodurch die Delegation tatsächlich funktioniert.
Bei der Wortwahl im Changelog ist Vorsicht geboten: Es handelt sich um eine Ergänzung des Kontexts durch das Produkt selbst, nicht um eine Sicherheitslücke oder einen Bugfix. Die zweite Verbesserung bewahrt den ausdrücklich vergebenen Namen einer in den Hintergrund geschickten Aufgabe, der zwischen Benachrichtigungen und Aufgabenlisten verloren ging. Die fünf Korrekturen betreffen die Bereinigung ungültig gewordener Kennungen, die Exit-Codes unterbrochener Befehle und Denkrahmen, die eingefroren blieben.
Antigravity 2.15.0 lässt benutzerdefinierte Agents standardmäßige Prompts und Tools deaktivieren
18. September — Drei Tage nach 2.14.0 veröffentlicht die Anwendung 7 Verbesserungen und 16 Korrekturen. Die wichtigste Änderung gibt benutzerdefinierten Agents die Kontrolle über ihren eigenen Kontext: Sie können standardmäßige Prompt-Abschnitte und Tools deaktivieren und anschließend nur diejenigen wieder einführen, die sie benötigen. Bei einem spezialisierten Agent reduziert das den vorgegebenen System-Prompt entsprechend.
Der Rest betrifft Navigation und Persistenz: Page Up, Page Down, Home und End scrollen durch eine Unterhaltung, Escape verlässt das Eingabefeld und der ausgewählte benutzerdefinierte Agent bleibt nach dem Neuladen gespeichert. Zwei Korrekturen betreffen die Datenintegrität: Gespeicherte Einstellungen und die Projektliste konnten überschrieben werden, wenn die Anwendung ihre Statusdatei nicht lesen konnte, und in den Berechtigungseinstellungen sammelten sich Duplikate an, durch die die Unterhaltungsdateien anwuchsen.
GitHub Copilot: ein Sentry-Canvas, sechs entfernte Modelle und Metriken nach Anpassung
Drei Changelog-Einträge innerhalb von zwei Tagen zeigen dieselbe Priorität: messen, was Teams tatsächlich mit Copilot tun, und bereinigen, was sie nicht mehr verwenden.
Die Zusammenfassung vom 14. September hebt zwei neue Bausteine hervor
18. September — GitHub veröffentlicht seine wöchentliche Copilot-Zusammenfassung für die Woche vom 14. September. Der Großteil der Übersicht greift Einträge auf, die bereits nach und nach im Changelog erschienen waren; nur zwei Elemente waren zuvor nie separat angekündigt worden. Das erste ist das Sentry-Canvas in der Copilot-Anwendung, das einen Produktionsabsturzbericht mit einer Korrektur verbindet, ohne dass die Anwendung verlassen werden muss: Es zeigt Fehler, Stack-Traces (stack traces) und Kontext an und ermöglicht anschließend, die Ursache zu untersuchen, eine Korrektur zu validieren und eine Pull Request vorzubereiten. Nach Jira Anfang September ist dies die erste Integration eines Tools zur Fehlerüberwachung in die Canvases.
Das zweite ist die Agents-Welle von VS Code 1.138. Im Agents-Fenster lässt sich ein Agent in einem lokalen Dev Container mit den Tools und Abhängigkeiten des Projekts ausführen — schrittweise Einführung, Docker erforderlich. Inaktive Sitzungen können automatisch als abgeschlossen markiert werden, sobald alle zugehörigen Pull Requests zusammengeführt wurden, mit optionaler Löschung nach einer Übergangsfrist; die Funktion befindet sich in der Vorschau und muss ausdrücklich aktiviert werden. Schließlich kann eine Pull Request direkt aus einer Agent-Host-Sitzung erstellt werden.
🔗 Wöchentliche Copilot-Zusammenfassung
Sechs Modelle verschwinden am 19. Oktober von allen Copilot-Oberflächen
18. September — GitHub kündigt an, am 19. Oktober 2026 sechs Modelle von sämtlichen Copilot-Oberflächen zu entfernen — Copilot Chat, Inline-Bearbeitungen, Ask- und Agent-Modi sowie Codevervollständigungen. Es ist die zweite im September angekündigte Ausmusterungswelle.
| Entferntes Modell | Datum der Entfernung | Vorgeschlagene Alternative |
|---|---|---|
| Gemini 3.7 Flash | 19/10/2026 | Gemini 3.8 Flash |
| GPT-5.5 | 19/10/2026 | GPT-5.6 Sol |
| GPT-5.4 | 19/10/2026 | GPT-5.6 Sol |
| GPT-5.4 mini | 19/10/2026 | GPT-5.6 Luna |
| GPT-5 mini | 19/10/2026 | GPT-5.6 Luna |
| Grok 4.5 | 19/10/2026 | Grok 4.6 |
Wenn die standardmäßige Modellaktivierung gilt, werden die Alternativen für Copilot-Enterprise- und -Business-Kunden automatisch aktiviert, sofern ein Administrator nicht den globalen Standardwert deaktiviert oder das betreffende Modell ausdrücklich blockiert hat; in diesem Fall lässt sich der Zugriff über die Modellrichtlinien in den Einstellungen wieder freigeben. Zum Entfernen der Modelle ist keine Aktion erforderlich.
🔗 Ankündigung zur Ausmusterung der Copilot-Modelle
Die Metrik-API erfasst Skills, Agents, MCP-Server und Plugins der CLI
17. September — Die API für Copilot-Nutzungsmetriken deckt nun fünf Kategorien agentischer CLI-Anpassungen ab: Skills, benutzerdefinierte Agents, MCP-Server, Slash Commands und Plugins. Die Tabellen totals_by_skill, totals_by_custom_agent, totals_by_mcp, totals_by_slash_cmd und totals_by_plugin führen jeweils die fünf aktivsten Elemente mit ihrer interaction_count auf, während die Felder distinct_*_use_count die Vielfalt der über diese Top fünf hinaus verwendeten Elemente erfassen.
Zwei Feinheiten verhindern Fehlinterpretationen. Bei MCP-Servern erhöht sich der Zähler nur, wenn die CLI versucht, eine Verbindung herzustellen oder wiederherzustellen — unabhängig von Erfolg oder Misserfolg —, nicht bei jedem Tool-Aufruf über eine bestehende Verbindung. Plugin-Metriken zählen ausschließlich Aufrufe von Skills, die mit einem Plugin verknüpft sind: Sie bilden eine Teilmenge der Skill-Gesamtwerte und dürfen nicht zu diesen addiert werden. Aus Datenschutzgründen werden nur von GitHub bereitgestellte Namen angezeigt; von Kunden definierte Namen werden unter other zusammengefasst.
🔗 Agentische CLI-Anpassungen in der Metrik-API
Coding-Agents im Terminal: MiniMax öffnet seinen, Mistral stabilisiert sein Harness
Zwei Ankündigungen von zwei nicht miteinander verbundenen Akteuren, am selben Tag und im selben Markt: Der im Terminal arbeitende Coding-Agent wird zum Standard, und die Differenzierung verlagert sich auf die Lizenz und die Stabilität des Harness.
MiniMax veröffentlicht den Code der MiniMax Code CLI unter der MIT-Lizenz
18. September — MiniMax veröffentlicht den Quellcode seines Coding-Agents für das Terminal in Version 0.4.12. Das Tool wird unter dem Namen mcode installiert und bietet drei Einstiegspunkte: eine interaktive Terminaloberfläche, einen Modus ohne Benutzeroberfläche (mcode exec) für Shell-Skripte, Continuous Integration und Evaluierungen sowie einen ACP-Modus für Editoren, die mit dem Agent Client Protocol kompatibel sind. Es liest die Dateien eines Projekts, prüft Unterschiede und führt Shell-Befehle sowie Tests aus, unter einem Berechtigungs- und Sandbox-Regime.
Die Wahl des Modells bleibt offen: auf der einen Seite ein MiniMax-Konto und dessen Token Plan, auf der anderen ein Drittanbieter, sofern dieser ein mit OpenAI oder Anthropic kompatibles API-Format bereitstellt. Hinzu kommen eine integrierte Suche, multimodale Tools, das MCP-Protokoll, Sub-Agents und ein Plugin-System. Der Originalcode wird standardmäßig unter der MIT-Lizenz veröffentlicht. Das Repository umfasst die TUI, die CLI ohne Benutzeroberfläche und den ACP-Modus, nicht jedoch die Desktop-Anwendung, deren Fehlerverfolgung es dennoch beherbergt; Codebeiträge werden derzeit nur von Mitwirkenden des Repositorys angenommen.
Das Unified Harness von Vibe CLI verlässt den experimentellen Status
18. September — Mistral veröffentlicht Vibe CLI 2.25.5, sechs Tage nach 2.25.4. Die strukturelle Änderung steht in einer einzigen Zeile der Versionshinweise: Das Unified Harness ist nicht mehr als „experimental“ gekennzeichnet, und --legacy-harness dient nun als dokumentierter Ausweg zurück zum alten Python-Harness. Nach einer Reihe von Korrekturversionen, die sich auf die Sicherheit von Shell-Genehmigungen konzentrierten, wird das neue Harness bewusst zum Standard — das ist die entscheidende Information, nicht die Versionsnummer.
Die Umstellung geht mit dem Aufholen funktionaler Gleichwertigkeit einher: Das Unified Harness fügt nun den aktuellen Git-Branch, den Repository-Status und die jüngsten Commits in die Systemanweisungen ein; Hooks werden endlich innerhalb von Sub-Agents ausgeführt, statt stillschweigend ignoriert zu werden; und Anbieter, die ohne Umgebungsvariable für einen API-Schlüssel konfiguriert sind — lokale oder selbst gehostete Server — funktionieren wieder. Die Härtung der Berechtigungen wird fortgesetzt: Shell-Genehmigungen werden nicht mehr auf ein anderes Programm oder eine andere Umgebung ausgeweitet, Aufrufe von MCP-Tools halten sich nun an das Berechtigungssystem, statt es zu umgehen, und smart approve setzt sich nicht länger über die Regeln des Benutzers hinweg.
🔗 Versionshinweise zu Vibe CLI 2.25.5
ChatGPT-Plugins unterstützen mehrere Konten gleichzeitig
18. September — Die Unterstützung mehrerer Konten hält bei den meisten ChatGPT-Plugins Einzug. Damit lassen sich ein persönliches Konto, ein geschäftliches Konto und Konten für Nebenprojekte verknüpfen und der jeweilige Kontext in dieselbe Unterhaltung einbringen. Die Konten werden über das Plugin-Verzeichnis auf chatgpt.com/plugins verbunden.
Die Ankündigung des Kontos OpenAI Developers greift eine eine Stunde zuvor veröffentlichte Nachricht von Max Stoiber auf. Für Plugin-Entwickler ist nichts zu tun: Die Funktion wird automatisch und ohne Änderungen aktiviert. Wer weiter gehen möchte, kann seinem MCP-Server ein Tool profile hinzufügen, damit ChatGPT die verbundenen Konten kennzeichnen kann — dies ist die einzige konkrete Aktion, die von ihnen erwartet wird. Die um 18:10 Uhr Pariser Zeit veröffentlichte Ankündigung wird weder von einem Blogbeitrag noch von einem Changelog-Eintrag begleitet.
Der anvisierte Anwendungsfall ist ein Entwickler, der seine Identitäten nach Arbeitgeber oder Projekt trennt und bislang die Verbindung wechseln musste, um den Kontext zu ändern.
🔗 Ankündigung mehrerer Konten auf X
🔗 Ursprüngliche Nachricht von Max Stoiber
Genspark ergänzt die Plus- und Pro-Tarife um ein wöchentliches Guthaben
18. September — Genspark ändert die Vorteile seiner Plus- und Pro-Abonnements, indem es ein wöchentliches Guthaben hinzufügt, ohne den Preis der Tarife zu ändern. Dieses Guthaben kommt jede Woche zusätzlich zum bereits gebuchten Kontingent hinzu und deckt die Nutzung im Standard-Modus über sämtliche Agents und Tools der Plattform hinweg ab: Super Agent, AI Chat, AI Image, AI Slides, AI Sheets, AI Docs und Deep Research.
Eine zweite Nachricht im selben Thread erläutert die Funktionsweise für AI Chat und AI Image. Bei bestehenden Abonnenten wird das Guthaben zu ihrem bereits verfügbaren Kontingent hinzugefügt, und bis zum 31. Dezember 2026 können alle Modelle von AI Chat und AI Image ohne Guthabenkosten genutzt werden, einschließlich Spitzenmodellen wie Opus; für Personen, die ab dem 18. September ein Abonnement abschließen, sind die Basismodelle (core models) von AI Chat und AI Image kostenlos. Genspark stellt klar, dass diese Änderungen weder für Team- noch für Enterprise-Tarife gelten, und verweist für Einzelheiten zu den Bedingungen auf sein Hilfezentrum.
Google Research: was AlphaGenome Atlas hervorgebracht hat und Simulationen, die sich selbst testen
Zwei Forschungsveröffentlichungen am selben Tag mit einer Gemeinsamkeit: In beiden Fällen wird nicht das Modell gezeigt, sondern das, was Dritte daraus gewonnen haben, oder das, was die Validierungsschleife an seiner Stelle überprüft.
AlphaGenome Atlas liefert die ersten Ergebnisse seiner Partner
17. September — Neun Tage nach der Veröffentlichung von AlphaGenome Atlas, der prädiktiven Karte der 9 Milliarden möglichen Substitutionen in der menschlichen DNA, hebt Google DeepMind einen Thread hervor, der drei Kooperationen erläutert.
| Wissenschaftlicher Partner | Berichtetes Ergebnis |
|---|---|
| Stowers Institute | Mehr als 2.500 regulatorische Motive kartiert |
| University of Exeter / UK Biobank | Mehr als 54.000 Teilnehmende analysiert, über 22 % höhere Erkennung seltener genetischer Signale |
| Broad Institute | Kritische Mutation des DNM1-Gens identifiziert, anschließend im Labor bestätigt und validiert |
Regulatorische Motive sind DNA-Sequenzen, die wie Schalter und Regler auf die Genaktivität wirken. Die in Exeter durchgeführte Arbeit identifizierte außerdem neue Varianten, die die Menge von PLA2G7 beeinflussen, einem mit der Stoffwechselgesundheit verbundenen Protein. Der Fall des Broad Institute ist der konkreteste der drei: Angesichts einer riesigen Liste möglicher Mutationen bei ungeklärten seltenen Krankheiten dient Atlas dazu, die richtige zu bestimmen, die anschließend im Labor bestätigt wird. Das Ganze beschränkt sich allerdings auf einen Thread auf X, ohne ausführlichen Blogbeitrag oder zugehörige Veröffentlichung.
🔗 AlphaGenome-Atlas-Thread auf X
Generierte Lernsimulationen, anschließend von einem Agenten in Chrome getestet
17. September — Gal Elidan und Yael Haramaty veröffentlichen ein Experiment, das generative Benutzeroberflächen (generative UI) auf die Erstellung von Lernsimulationen anwendet. Die Lehrkraft behält die Initiative: Sie schlägt das Thema vor, Google generiert eine Reihe editierbarer Lernziele, die ihrer Zustimmung bedürfen und als Grundlage für die Generierung dienen. Jede interaktive Anwendung ist in Stufen mit zunehmendem Schwierigkeitsgrad gegliedert und bietet einen Werkzeugkasten, schrittweise Hinweise und ausführliche Lösungen.
Das interessanteste Element ist die Selbstkorrekturschleife. Die Generierung wird anhand pädagogischer, mechanischer und gestalterischer Kriterien überprüft, wobei einige Bewertungen agentenbasiert erfolgen: Der Lösbarkeitstest öffnet eine Chrome-Instanz und bedient die Simulation wie ein Benutzer, wobei er auch gegnerische Aktionen versucht, etwa Regler auf ihre Extremwerte zu schieben. Die Schleife wird wiederholt, bis alle Kriterien erfüllt sind, allerdings auf Kosten einer längeren Generierungszeit. Google veröffentlicht mehr als 30 interaktive STEM-Anwendungen auf Englisch; eine Sammlung von 40 Anwendungen wurde von britischen Lehrkräften bewertet, und eine Studie mit 12 US-amerikanischen Lehrkräften ergab eine durchschnittliche Bewertung von 8 von 10 Punkten.
🔗 Google-Research-Beitrag über interaktive Lernanwendungen
Claude beschleunigt mehr als 30 Biologiemodelle und finanziert einen Proteinwettbewerb
17. September — Anthropic veröffentlicht einen Beitrag darüber, wie Claude in knapp vier Wochen die Inferenz von mehr als 30 von Biologen verwendeten Open-Source-Modellen optimiert hat — darunter Strukturvorhersage, Proteindesign sowie Protein- und Genom-Sprachmodelle — und dabei im Durchschnitt eine etwa vierfache Beschleunigung erzielte. Der gesamte Code wird als Open Source veröffentlicht.
Der technische Kern betrifft dreieckige Aufmerksamkeit und dreieckige Multiplikation, deren Zeit- wie Speicherkomplexität kubisch ist. Claude entwickelte FlashPairformer, eine Reihe von Kernels, die den Branchenstandard bei der Aufmerksamkeit um das 2,7- bis 2,9-Fache übertreffen. Ein „Big“ genannter Speichersparmodus ermöglicht es, Systeme mit mehr als 10.000 Tokens auf einem einzigen GPU-Knoten präzise zu falten, während das von AlphaFold3 vorhergesagte 40S-Ribosom 7.663 Tokens umfasste. Ebenso bedeutsam ist die Methode: Die Arbeit wurde von zwei technischen Mitarbeitern ohne vorherige Erfahrung in der Inferenzoptimierung betreut.
Anthropic ist schließlich gemeinsam mit Adaptyv Bio Co-Sponsor eines Proteindesign-Wettbewerbs zu fünf schwierigen Aufgaben, bei dem mehr als 5.000 Designs aus der Community experimentell validiert werden; als Preise stehen Claude-Guthaben im Wert von bis zu 1 Million US-Dollar sowie von Modal bereitgestellte Rechenleistung im Wert von 250.000 US-Dollar zur Verfügung.
Offene Modelle und Labore: Muse kommt auf den Mac, Sakana stellt seine Frontier-Gruppe vor
Meta bringt seinen Agenten Muse auf macOS
18. September — Meta führt Muse auf dem Mac ein, wie in der Nacht vom 17. auf den 18. September angekündigt wurde. Der Account @AIatMeta verbreitet einen Beitrag, der einen persönlichen Agenten beschreibt, der jeweils mit ausdrücklicher Zustimmung des Benutzers direkt auf dessen Computer handeln kann. Drei Anwendungsfälle werden genannt: den Download-Ordner aufräumen, eine verlorene Datei wiederfinden sowie Nachrichten und Notizen zusammenfassen.
Die Ankündigung erweitert die Einführung von Muse vom 8. September, einem von Muse Spark 1.3 angetriebenen Agenten, der bislang auf iOS, Android, im Web und auf WhatsApp verfügbar war. Mit dem Sprung auf den Mac erreicht diese Produktart eine neue Stufe: Der Agent arbeitet nicht mehr in seiner eigenen Sandbox, sondern mit den persönlichen Dateien des Benutzers. Meta macht weder Angaben zum Preis noch zu den verfügbaren Ländern oder den Systemanforderungen, und die Bereitstellung wird von keinem Mac-spezifischen Sicherheitsdokument begleitet — auf dem Blog ai.meta.com wurde seit dem 27. Juli nichts mehr veröffentlicht.
Sakana AI stellt die Frontier Intelligence Group und ihre Haltung zum Paradigma vor
18. September — Sakana AI gibt die Existenz der Frontier Intelligence Group (FIG) bekannt, eines internen Kollektivs, das seit den Anfängen des Unternehmens gewachsen ist. Ausgangspunkt ist eine Frage von Llion Jones, dem technischen Leiter von Sakana AI und einem der Erfinder des Transformer: Reicht es aus, die Transformer-Architektur mit immer mehr Daten und Rechenleistung zu vergrößern, um bis zur AGI zu gelangen? Die Antwort des Labors lautet Nein.
Darin liegt die eigentliche Neuigkeit, mehr als im begleitenden Katalog der Arbeiten. Der Beitrag listet die Probleme auf, die das derzeitige Paradigma nicht gelöst hat — Modelle, die mit Überzeugung falsche Informationen erzeugen, angesichts wirklich neuer Situationen versagen und viel Energie verbrauchen — und stellt ihnen die biologische Intelligenz gegenüber, die kontinuierlich lernt und mit erheblich weniger Daten generalisiert. Die Gruppe gibt sich fünf Grundsätze, darunter die Freiheit, ohne Druck durch Benchmark-Ergebnisse zu scheitern. Unter den vorgestellten Arbeiten gehen die gemeinsam mit NVIDIA entwickelten Sparse Transformer von einer gemessenen Feststellung aus — mehr als 95 % der Neuronen einer Feed-Forward-Schicht bleiben bei der Verarbeitung eines Wortes inaktiv — und haben ein TwELL genanntes Datenformat hervorgebracht, das auf der ICML 2026 angenommen wurde.
🔗 Beitrag von Sakana AI über die Frontier Intelligence Group
Generative Videos: Runway vereinheitlicht seine Guthaben, Pika veröffentlicht seine erste Anwendung
Runway macht seine Guthaben zwischen der Webanwendung und Runway Dev übertragbar
18. September — Runway beseitigt die Trennung zwischen seinen beiden Produkten: Gekaufte Guthaben können nun gleichermaßen in der Webanwendung und in Runway Dev, dem Angebot für Entwickler, genutzt werden. Bisher verfügten beide Bereiche über getrennte Guthabenbestände und Verträge, und es gab keinen zentralen Ort, um den Verbrauch projektübergreifend zu verfolgen.
Vier Punkte begleiten die Änderung: ein zentral erworbener gemeinsamer Guthabenbestand auf einer einzigen Rechnung, ein nahtloser Weg von der Erstellung eines Workflows in der Webanwendung bis zu seiner Bereitstellung per API, erweiterter Support für Runway Dev mit Zugang zu Applied AI Architects sowie eine neu gestaltete Analyseansicht für Arbeitsbereiche, über die Administratoren Guthaben zwischen Web- und Dev-Arbeitsbereichen übertragen können. Zwei kommerzielle Angebote gelten bis zum 31. Dezember 2026: Neue Unternehmen erhalten bei Vertragsabschluss 10 % zusätzliche Guthaben, was nach der von Runway angegebenen Umrechnung mindestens 130 Minuten Video oder 12.000 Bildern entspricht; bestehende Kunden erhalten im Gegenzug für eine Empfehlung an den Produktverantwortlichen für KI-Anwendungen 5.000 Guthaben sowie einen Tag mit einem Applied AI Architect.
🔗 Runway-Beitrag über die vereinheitlichte Preisgestaltung
Pika startet Product Ad: vom Produktfoto zum Werbevideo
18. September — Einen Tag nach der Vorstellung seiner neuen Kreativplattform veröffentlicht Pika deren erste Anwendung: Product Ad. Die Anwendung verwendet ein oder mehrere Produktbilder, kombiniert sie mit einem schriftlichen Briefing und erstellt daraus ein Video, das als marktreif präsentiert wird.
| Generierungsparameter | Angebotener Wert |
|---|---|
| Verfügbare Dauern | 6 s, 15 s, 30 s, 60 s, 2 min |
| Ausgabeformat | 16:9 |
| Erwartete Eingabe | Produktbilder und schriftliches Briefing |
| Zugang | Kontoerstellung erforderlich |
Pika veröffentlicht die Ankündigung unter Verweis auf die eigene Mitteilung vom Vortag über die Neugestaltung der Plattform. Damit wird Product Ad als Teil einer erwarteten Reihe von Anwendungen und nicht als isolierte Funktion positioniert. Es wird kein Modell genannt und kein Preis mitgeteilt.
NVIDIA veröffentlicht AIPerf, den Nachfolger von GenAI-Perf zur Messung der Inferenz im großen Maßstab
18. September — NVIDIA stellt AIPerf vor, sein Werkzeug zur Leistungsmessung generativer Inferenz, das als Nachfolger von GenAI-Perf bezeichnet und von Grund auf neu geschrieben wurde. Die Ausgangslage ist vertraut: Sobald ein Modell bereitgestellt ist, wird die Frage „Ist es schnell?“ häufig mit curl-Befehlen oder einem improvisierten Lastgenerator beantwortet, die Zahlen liefern, denen man nicht vertrauen kann.
Der Bruch liegt in der Architektur. Während die meisten Werkzeuge in einem einzigen Prozess laufen und bei steigender Parallelität an die globale Sperre des Python-Interpreters stoßen, verteilt AIPerf die Arbeit: Arbeitsprozesse erzeugen die Last, separate Dienste verarbeiten die Ergebnisse, und das Ganze wird über ZMQ koordiniert. Das Ziel ist ausdrücklich, dass der Messclient niemals selbst zum Engpass wird.
| Berichtete Kennzahl | Was sie misst |
|---|---|
| Time to First Token | Zeit zwischen dem Senden der Anfrage und dem ersten Token |
| Inter-Token Latency | Zeit zwischen zwei aufeinanderfolgenden Tokens bei der Generierung |
| Anfragelatenz | Ende-zu-Ende-Zeit der vollständigen Antwort |
| Durchsatz der Ausgabe-Tokens | Pro Sekunde über alle Anfragen hinweg erzeugte Tokens |
| Berichtete Perzentile | p25, p50, p75, p90, p95, p99 |
| Arten von Endpunkten | mehr als 15 |
Das Werkzeug kann zudem Aufzeichnungen realen Datenverkehrs in den Formaten Mooncake, Baseten und WEKA wiedergeben. Der Artikel betont vor allem den Nutzen von Verteilungen: Ein Server, dessen durchschnittliche Zeit bis zum ersten Token gesund erscheint, dessen p99 jedoch stark ansteigt, bleibt in der aggregierten Betrachtung unauffällig und scheitert im Produktivbetrieb.
Mistral weist die Behauptung eines unbefugten Zugriffs auf seine Systeme zurück
18. September — Mistral veröffentlicht um 05:48 Uhr UTC eine kurze Mitteilung auf seinem X-Account als Reaktion auf die Behauptung eines unbefugten Zugriffs auf seine Systeme. Das Unternehmen erklärt, eine gründliche Untersuchung durchgeführt und keine Belege für diese Behauptung gefunden zu haben, und bestätigt, dass seine Systeme nicht kompromittiert wurden.
We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.
🇩🇪 Uns ist eine Behauptung bekannt, wonach unbefugt auf unsere Systeme zugegriffen worden sei. Nach einer gründlichen Untersuchung haben wir keine Belege gefunden, die diese Behauptung stützen, und können bestätigen, dass unsere Systeme nicht kompromittiert wurden. — @MistralAI auf X
Die Mitteilung nennt weder den Urheber der Behauptung noch deren Datum oder Art und enthält keine Einzelheiten zum Umfang der Untersuchung. Hier wird ausschließlich die Position von Mistral wiedergegeben: Die ursprüngliche Behauptung konnte nicht eingesehen werden. Die Mitteilung ist im betrachteten Zeitraum der meistgesehene Beitrag des Accounts, und auf der Website des Unternehmens wurde keine ergänzende Veröffentlichung gefunden.
Kurzmeldungen
- Balyasny Asset Management erläutert, wie es Claude Fable 5 einsetzt — das Unternehmen, das rund 38 Milliarden Dollar verwaltet, verkürzt die Erstanalyse einer Fusionsarbitrage von drei bis fünf Tagen auf weniger als einen Tag; dabei arbeitet ein Agent etwa 30 Minuten lang, gefolgt von einer menschlichen Prüfung. 🔗 Quelle
- Codex CLI 0.155.1 deaktiviert Reasoning-Zusammenfassungen wieder standardmäßig — ein einzelner Fix am Tag nach 0.155.0: Ihre standardmäßige Aktivierung führte dazu, dass Anbieter, die sie nicht unterstützen, Anfragen ablehnten. 🔗 Quelle
- Gemini CLI setzt nach einem Tag Pause seine Nightly-Reihe fort — vier Änderungen am 18. September, darunter die Beibehaltung des OAuth-Refresh-Tokens bei einer Erneuerung und eine nun idempotente Löschung von Anmeldedaten; die Kanäle stable und preview bleiben unverändert. 🔗 Quelle
- Kimi Code 2.0.1 beschleunigt den Start und die Wiederaufnahme von Sitzungen — eine Fehlerbehebungsversion 32 Stunden nach 2.0.0: Komprimierung des Sitzungsindex, schnellere Wiederaufnahme bei langen Verläufen, Einlesen des API-Schlüssels aus einer benannten Umgebungsvariable und begrenzte Datei-Watcher. 🔗 Quelle
- Qwen Code erscheint als Vorabversion v0.24.1 mit einem Playwright-Browser-SDK — dies ist keine stabile Version; sie führt eine integrierte Browsersteuerung mit Chrome-Native-Messaging-Relay sowie die Ausführung von Sub-Agenten in Containern ein. 🔗 Quelle
- Zed veröffentlicht die stabile Version 1.20.2 mit nur zwei Fehlerbehebungen — bei Zahlungsfehlern von Drittanbietern für Modelle wird nicht mehr anstelle der ursprünglichen Meldung eine Aufforderung zum Wechsel zu Zed Pro angezeigt, und zwei Snippet-Erweiterungen für dieselbe Sprache heben sich nicht mehr gegenseitig auf. 🔗 Quelle
- Replit behauptet, der Free Mode sei „30-mal“ großzügiger, ohne eine Referenz zu veröffentlichen — lediglich ein Tweet ohne Link oder Changelog, der nicht angibt, womit dieser Faktor verglichen wird: als Behauptung von Replit zu verstehen, nicht als Messwert. 🔗 Quelle
- Das Copilot-Impact-Dashboard schlüsselt das Engagement nach Funktion auf — sieben Oberflächen über 28 Tage, mit einer Unterscheidung zwischen aktiver und passiver Code-Review und einer Population der Einführungsphase, die nun anhand eines gleitenden Zeitfensters berechnet wird. 🔗 Quelle
- GitHub plant einen Einführungslivestream zum Copilot SDK in sechs Sprachen — Sitzungen, Tools, MCP-Server und Streaming-Ereignisse, mit eigenen Sessions für .NET und Java, ohne Vorkenntnisse. 🔗 Quelle
- Runway Ruby bewahrt den Alphakanal bei der HDR-Konvertierung — die Konvertierung von Rohmaterial in HDR erhält die Transparenz in einem einzigen Schritt; weder Preis noch Abonnementstufe wurden angegeben. 🔗 Quelle
- MiniMax tritt dem Singtel AI Pass für das singapurische SkillsFuture-Programm bei — MiniMax H3, MiniMax Agent und MiniMax Audio werden Teil des Angebots, das sich an berechtigte Lernende in mehr als 200 von der SWDA unterstützten KI-Kursen richtet; weder Betrag noch Zeitplan wurden genannt. 🔗 Quelle
- VC-Attention beschleunigt die Attention von MiniMax-H3 ohne erneutes Training — MiniMax verweist auf die Arbeit von Nunchux AI zu einer Attention mit niedriger Präzision, die auf das bestehende Modell angewendet werden kann; Nunchux AI gibt gegenüber FlashAttention-4 eine 1,6-fache Beschleunigung auf B200 und eine 1,5-fache auf B300 an. 🔗 Quelle
- Wan3.0 belegt in der Videokategorie der OpenArt Arena den zweiten Platz — Alibaba hebt 30-sekündige Einstellungen, natives Audio und die Unterstützung beliebiger Referenzen hervor; Platzierung in einer Rangliste eines Drittanbieters, ohne Produktneuheit. 🔗 Quelle
- Synthesia eröffnet seinen US-Hauptsitz in New York — eine Unternehmensmeldung ohne Angaben zu Produkt, Personalstärke oder Investitionszeitplan, zwei Tage nach der allgemeinen Verfügbarkeit seiner Interactive Avatar API. 🔗 Quelle
- Grok Imagine beziffert die Kosten einer vollständig mit KI produzierten Pilotfolge — das Studio von PJaccetturo gibt für die Pilotfolge seines Wettbewerbs Odyssée neun Arbeitstage, 3.627 generierte Bilder, 3.043 generierte Videos und Generierungskosten von 2.677 Dollar an. 🔗 Quelle
- BananaMind 2 Pro nähert sich SmolLM2 mit zwanzigmal weniger Tokens an — ein Modell mit 139 Millionen Parametern, das auf 100 Milliarden Tokens und einer RTX 5070 Ti trainiert wurde, erreicht bei HellaSwag 42,78 % gegenüber 43,22 für SmolLM2-135M, das auf 2.000 Milliarden Tokens trainiert wurde. 🔗 Quelle
- Optimum-Intel v2.2.0 und OpenVINO GenAI 2026.4.0 erweitern den Export auf Intel-Hardware — Hugging Face und Intel veröffentlichen gemeinsame Versionen für Intel-Prozessoren, -Grafikkarten und -NPUs, wobei Mistral 3 nun exportiert werden kann. 🔗 Quelle
- AmberTrace Labs misst die Reasoning-Treue von Olmo 3 unter RL mit überprüfbarer Belohnung — bei den vom Training ausgeschlossenen Sonden steigt die Treue von 0,238 auf 0,262: eine positive Entwicklung statt einer Verschlechterung, mit veröffentlichten Checkpoints. 🔗 Quelle
- Together AI beansprucht bei DeepSeek V4.1 Flash die beste Zeit bis zum ersten Token — das Unternehmen gibt die Messung eines Drittanbieters für vorgewärmte Anfragen wieder, ohne Methode oder Wert zu veröffentlichen: eine Behauptung, kein überprüfbares Ergebnis. 🔗 Quelle
- Google Flow begleitet zwei Kreative bei der New York Fashion Week — maßgeschneiderte Tools, die gemeinsam mit Jane Wade und Sergio Hudson entwickelt wurden; eine Anwendungsdemonstration ohne neues Modell oder bereitgestellte Funktion. 🔗 Quelle
- Die Google AI Educator Series kann auf Hochschulleistungspunkte angerechnet werden — die Kurse der Weiterbildung können nun für Hochschul- oder Fortbildungsleistungspunkte angerechnet werden. 🔗 Quelle
Was das bedeutet
Der Tag macht vor allem eines deutlich: Code-Agenten hören auf, geschlossene Produkte zu sein, und beginnen, ihre Formate gemeinsam zu nutzen. Claude Code liest AGENTS.md, wenn ein Projekt keine CLAUDE.md besitzt — das heißt, Anthropic akzeptiert eine andernorts definierte Anweisungsdatei, damit dasselbe Repository mehreren Tools dienen kann. Am selben Tag fügt Antigravity den Katalog der verfügbaren Sub-Agenten in den System-Prompt seiner Markdown-Agenten ein, Vibe CLI führt Hooks endlich innerhalb von Sub-Agenten aus, Codex schlüsselt seine Abrechnung nach Sub-Agent auf und Qwen Code führt seine Sub-Agenten in Containern aus. Die Delegation zwischen Agenten war ein Konfigurationsversprechen; nun wird sie zu einem Mechanismus, der dokumentiert, isoliert und abgerechnet werden muss. Claude Code führt diese Logik des Misstrauens sogar konsequent zu Ende, indem es Ergebnisse von Sub-Agenten mit einem eigenen Header kennzeichnet, damit zurückgemeldeter Text sich nicht als Anweisung ausgeben kann.
Der Markt für Terminal-Agenten wird unterdessen zusehends zum Standardgeschäft. MiniMax veröffentlicht seinen Agenten unter der MIT-Lizenz mit TUI, Headless-Modus, ACP und freier Modellwahl; Mistral entfernt das Etikett „experimentell“ von seinem Unified Harness und dokumentiert --legacy-harness als Ausweg; Kimi Code veröffentlicht 32 Stunden nach seiner Hauptversion eine Leistungsverbesserung. Wenn vier Anbieter dasselbe Objekt mit denselben Einstiegspunkten anbieten, verlagert sich die Differenzierung: Entscheidend werden Lizenz, Stabilität des Harness und Berechtigungsregime — und genau darauf zielen die Änderungen des Tages sowohl bei Mistral als auch bei Anthropic.
Bei den Modellen geht die Entwicklung dahin, dass Audio und Video agentenbasiert statt beschreibend werden. Qwen3.8-Omni-Flash versucht nicht mehr, ein Video zu beschreiben, sondern darin eine Antwort zu finden: Ausgehend von der Frage gewinnt es 4,4 Punkte auf OmniVideoBench und verbraucht dabei 45,7 % weniger Tokens — Leistung und Einsparung weisen in dieselbe Richtung, was selten ist. Demgegenüber setzt Grok Voice Transcribe 2.0 nicht auf eine Labordemonstration, sondern auf realen Datenverkehr: Die Fehlerrate bei kurzen Sätzen sinkt von 20,6 % auf 6,8 %, während der Preis unverändert bleibt. Beide Ankündigungen laufen auf dasselbe hinaus: Der Wert entsteht nicht mehr durch die unterstützte Modalität, sondern durch das, was das Modell zu verarbeiten entscheidet.
Bleibt die Frage, was die Labore überprüfen lassen. Anthropic bezahlt Accenture dafür, Evaluatoren innerhalb des eigenen Unternehmens einzusetzen, mit Mitarbeiterzugang — und räumt in derselben Ankündigung ein, dass es weder Standards dafür gibt, worauf ein solcher Evaluator zugreifen sollte, noch dafür, wie seine Feststellungen veröffentlicht werden sollten oder wer ihn finanzieren sollte. Das ist ebenso ein Eingeständnis wie eine Maßnahme. Daneben sind die überzeugendsten Belege des Tages jene, die ein Dritter reproduzieren kann: die Ergebnisse von Exeter und dem Stowers Institute zum AlphaGenome Atlas, der als Open Source veröffentlichte Code zur biomolekularen Optimierung und die Checkpoints von AmberTrace Labs. Auch das Gegenteil ist deutlich zu erkennen: Replit nennt ohne Referenz den Faktor 30, Together AI gibt eine Rangliste ohne Methode wieder, Mistral weist eine Behauptung zurück, die niemand lesen konnte. AIPerf kommt in diesem Umfeld genau zur rechten Zeit — ein Messwerkzeug, das zunächst einräumt, dass häufig der Messende selbst das Problem ist.
Quellen
- Claude Code, Versionshinweise 2.1.277
- CHANGELOG von Claude Code
- Qwen, Beitrag zu Qwen3.8-Omni-Flash
- Alibaba Qwen auf X, Ankündigung des Modells
- Codex CLI, Versionshinweise 0.155.0
- OpenAI Developers auf X, detaillierte Verbrauchsangaben in Codex
- SpaceXAI, Grok Voice Transcribe 2.0
- Anthropic, eingebettete Evaluierung mit Accenture
- Changelog von Antigravity
- GitHub, wöchentlicher Copilot-Rückblick vom 14. September
- GitHub, Einstellung von sechs Copilot-Modellen
- GitHub, agentenbasierte CLI-Anpassungen in der Metrics API
- MiniMax auf X, Open-Source-Veröffentlichung von MiniMax Code CLI
- Vibe CLI, Versionshinweise 2.25.5
- OpenAI Developers auf X, Plugins für mehrere Konten
- Max Stoiber auf X, der ursprüngliche Beitrag zu mehreren Konten
- Genspark auf X, das wöchentliche Plus- und Pro-Guthaben
- Google DeepMind auf X, Ergebnisse der Partner des AlphaGenome Atlas
- Google Research, pädagogische interaktive Inhalte über eine generative Benutzeroberfläche
- Anthropic Research, Claude und biomolekulare Modellierung
- Meta AI auf X, Muse für Mac
- Sakana AI, die Frontier Intelligence Group
- Runway, einheitliche Preisgestaltung
- Pika auf X, Einführung von Product Ad
- NVIDIA, Messung großskaliger Inferenz mit AIPerf
- Mistral AI auf X, Dementi vom 18. September