Suchen

Grok 4.7 erscheint noch am selben Tag in Cursor und Copilot, OpenAI enthüllt mehr als 100 gelöste Mathematikprobleme, Googlebook vorbestellbar

ai-powered-markdown-translator

Artikel, der mit gpt-5.6-sol vom Französischen ins Deutsche übersetzt wurde.

Projekt auf GitHub ansehen ↗

Am Montag, dem 21. September, gehört der Tag xAI: Grok 4.7 erscheint und ist noch am selben Tag in Cursor und GitHub Copilot verfügbar, ohne Verzögerung zwischen der Ankündigung des Modells und seiner Einführung in den Tools. OpenAI nutzt denselben Tag, um bekannt zu geben, dass ein seit dem 28. August trainiertes internes Modell mehr als hundert offene Mathematikprobleme gelöst hat, und um nach einer von 27 Fields-Medaillenträgern unterzeichneten Erklärung eine Beratungsgruppe aus Mathematikern einzusetzen. Google startet die Vorbestellungen für das Googlebook, ElevenLabs rückt einen Schnittagenten ins Zentrum seines Videoeditors und Hugging Face veröffentlicht seine 3- bis 30-mal schnellere Tokenisierungsbibliothek neu.


Grok 4.7 erscheint bei xAI und kommt noch am selben Tag zu Cursor und GitHub Copilot

21. September — xAI veröffentlicht Grok 4.7, sein leistungsfähigstes Modell für Code und Wissensarbeit. Das Basismodell ist größer als das von Grok 4.6, und seine Phase des bestärkenden Lernens (reinforcement learning) wurde mit einer Mischung von Aufgaben verlängert, deren Gewichtung auf mehrstündigen Problemen liegt. xAI erwartet davon ein Modell, das seine eigene Arbeit besser überprüft und lange Kontexte besser bewältigt.

Die Zahlen zeichnen eher ein gemischtes Profil als ein Bild der Dominanz. Der Preis bleibt hingegen unverändert: 2 Dollar pro Million Input-Tokens und 6 Dollar für den Output, wie bei Grok 4.6, also die Hälfte des Input-Preises von GPT-5.6 Sol und ein Fünftel von Fable 5.1. Auf diesem Preis-Leistungs-Verhältnis beruht das Argument.

Veröffentlichte MessgrößeGrok 4.7 (xHigh)Grok 4.6 (High)GPT-5.6 Sol (Max)Fable 5.1 (Max)
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
EEBench (Elektrotechnik)64,0 %53,0 %39,4 %56,4 %
Input-Preis (Dollar / Mio. Tokens)22410
Output-Preis (Dollar / Mio. Tokens)662050

Die API stellt grok-4.7 mit einem Kontext von 500.000 Tokens und vier Stufen des Reasoning-Aufwands bereit, von low bis xhigh; bei mehr als 200.000 Prompt-Tokens verdoppelt sich der Preis. xAI hebt außerdem einen vollständig neuen Satz von Schutzmaßnahmen hervor: Platz eins im Biosicherheits-Benchmark von LatchBio mit 62,4 % und lediglich 3,3 % durchgelassene riskante Cyber-Prompts mit doppeltem Verwendungszweck in HackerBench v0.3.

Bei zwei Integratoren erfolgt die Einführung sofort. Cursor bietet das Modell vom ersten Tag an – eine Folge der Übernahme von Anysphere durch SpaceX, die am 14. August abgeschlossen wurde. Das Modell bleibt das von xAI: Der am selben Tag im Cursor-Blog veröffentlichte Beitrag besteht aus einem Satz und verweist auf die vollständige Ankündigung auf x.ai. xAI selbst stellt CursorBench 4.0 heraus, den Benchmark von Cursor für lang laufende Aufgaben, bei dem Grok 4.7 bei unverändertem Preis 46,3 % erreicht. GitHub Copilot führt es seinerseits auf allen seinen Oberflächen ein, von VS Code bis Xcode, für Tarife von Pro bis Enterprise. Die Abrechnung verdient dabei Aufmerksamkeit: Grok 4.7 fällt nicht unter das System der Anfragemultiplikatoren und wird nutzungsabhängig zum öffentlichen Preis des Anbieters abgerechnet. Da ein neues Modell standardmäßig aktiviert wird, ist zur Kostenkontrolle eine Änderung der Modellrichtlinie erforderlich; bloßes Nichtstun genügt nicht.

🔗 Grok 4.7 — xAI 🔗 Grok 4.7 ist jetzt in GitHub Copilot verfügbar


OpenAI setzt eine Beratungsgruppe aus Mathematikern ein und enthüllt mehr als hundert gelöste offene Probleme

21. September — OpenAI gibt bekannt, mit einer unabhängigen Beratungsgruppe aus neun Mathematikern zusammenzuarbeiten, die sich selbst zusammengeschlossen hat und am Institute for Advanced Study in Princeton angesiedelt ist. Der Kontext wiegt schwerer als die Ankündigung.

On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.

🇩🇪 Am 28. August begannen wir mit dem Training eines neuen internen Modells. Neben der Lösung des Millennium-Problems der Navier-Stokes-Gleichungen hat dieses Modell inzwischen mehr als 100 seit Langem offene Probleme aus den meisten Bereichen der Mathematik gelöst. — OpenAI, Beratungsgruppe für Mathematik und künstliche Intelligenz

Das Modell wird öffentlich nicht benannt, und OpenAI schreibt, dass das Tempo dieser Fortschritte seine eigenen Mathematiker überrascht habe. Diese Beschleunigung löste eine direkte Reaktion aus: Am 11. September wurde eine Erklärung mit dem Titel „Eine schwerwiegende Fehlorientierung der KI in der Mathematik“ mit einer Zenodo-DOI und den Unterschriften von 27 Fields-Medaillenträgern veröffentlicht, darunter Terence Tao, Peter Scholze und Cédric Villani. Ihr Argument lautet nicht, dass die Modelle Fehler machen. Die Lösung eines großen Problems war stets ein Zeichen für ein neues Verständnis, das anschließend von der Fachgemeinschaft weiterentwickelt wurde, bis es vermittelbar war; die Unterzeichner befürchten, dass eine massenhafte Produktion wahrer oder falscher Aussagen diesen Nährboden zerstören könnte, anstatt ihn zu bereichern, und dass solche voreiligen Ankündigungen keine Zeit für eine ordnungsgemäße Ausarbeitung ließen.

Die Ausgestaltung setzt deutlich auf Unabhängigkeit: Die Gruppe kann unaufgefordert Stellungnahmen abgeben, die Auswirkungen von OpenAI auf die Mathematik öffentlich kommentieren und ihre Zusammensetzung ohne Zustimmung des Unternehmens ändern; ihre Mitglieder werden von ihm nicht bezahlt. Allerdings bleibt der Satz, den OpenAI ans Ende desselben Absatzes stellt: Die Gruppe wird das Unternehmen nicht zum Tempo seiner internen Fortschritte beraten. Ihr Aufgabenbereich umfasst somit die Veröffentlichung der Ergebnisse, nicht deren Erzeugung – also alles außer dem, was den Protest ausgelöst hat. Martin Hairer wiederum steht auf beiden Listen: als Unterzeichner der Erklärung und als Mitglied der Gruppe.

🔗 Eine schwerwiegende Fehlorientierung der KI in der Mathematik


Googlebook, die rund um Gemini entwickelte Laptop-Reihe von Google

21. September — Google startet die Vorbestellungen für das Googlebook, das das Unternehmen als eigenständige Kategorie präsentiert: der Android-Technologie-Stack, von ChromeOS übernommene Desktop-Grundlagen und das alles rund um Gemini konzipiert. Fünf Modelle erscheinen gleichzeitig, hergestellt von Acer, ASUS, Dell, HP und Lenovo, zu Preisen ab 899 Dollar. Die Auslieferungen beginnen am 4. Oktober in den Vereinigten Staaten und am 5. Oktober in Kanada, im Vereinigten Königreich, in Irland, Frankreich, Deutschland und Australien.

Angekündigtes MerkmalWert
Einstiegspreis899 Dollar
ProzessorenIntel Core Ultra Series 3 oder Snapdragon X Elite
NPUmehr als 45 TOPS
Arbeitsspeicher16 GB standardmäßig, bis zu 32 GB
Akkulaufzeitbis zu 14 Std. bei Video, 16 Std. beim Surfen im Web
SoftwareunterstützungUpdates für bis zu 10 Jahre

Drei Gemini-Funktionen sind speziell auf das Gerät zugeschnitten. Magic Pointer, das durch Schütteln des Cursors ausgelöst wird, bringt Gemini zu dem auf dem Bildschirm angezeigten Element – etwa um eine verdächtige E-Mail zu analysieren oder mehrere Bilder zu kombinieren – und Google stellt klar, dass es nur auf Anforderung aktiviert wird und deaktiviert werden kann. Rambler verwandelt ein unzusammenhängendes Diktat in strukturierten Text mit Überschriften und Aufgabenlisten, auch wenn mitten im Satz die Sprache gewechselt wird. Create My Widget erzeugt Desktop-Widgets aus einer natürlichsprachlichen Beschreibung.

Für Entwickler wird jedes Gerät mit Antigravity, Googles Plattform für Entwicklungsagenten, sowie mit einer isolierten Linux-Umgebung samt vollwertigem Terminal ausgeliefert – die Dokumentation nennt ausdrücklich die Möglichkeit, darin Claude Code oder Antigravity CLI auszuführen. Diese Isolierung beruht auf einem als Level 5 zertifizierten pKVM-Hypervisor, den Google als Branchenneuheit präsentiert, ergänzt durch den hardwarebasierten Titan-Vertrauensanker. Die Kontinuität mit dem Android-Smartphone erledigt den Rest: Eine auf dem Mobilgerät begonnene Aufgabe lässt sich fortsetzen, mobile Apps werden in ein Desktop-Fenster gestreamt. Jedes Googlebook umfasst zwölf Monate Google AI Pro mit 5 TB Speicher, drei Monate YouTube Premium und Photoshop sowie ein Jahr GeForce NOW.

🔗 Vorbestellungen für das Googlebook


ElevenLabs integriert einen Schnittagenten in Studio 4.0

21. September — ElevenLabs veröffentlicht Studio 4.0 in ElevenCreative, das Update seines Videoeditors. Der Leitgedanke lässt sich in einem Satz zusammenfassen: Alles geschieht am selben Ort. Video-, Bild-, Sprach-, Musik- und Soundeffektgenerierung werden direkt aus dem Projekt heraus gestartet, alle Modelle von ElevenCreative lassen sich aufrufen, ohne den Editor zu verlassen, und Schnitt, Untertitelung und anschließender Export erfolgen in derselben Oberfläche. Eine Einstellung lässt sich überarbeiten, ohne die vollständige Generierung erneut zu starten, und Untertitel können wie jeder andere Clip auf der Timeline bearbeitet werden.

Die grundlegendste Neuerung ist Studio Agent, ein KI-Co-Editor, der in jedem Projekt verfügbar ist.

Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.

🇩🇪 Studio Agent ist Ihr KI-Co-Editor, der in jedes Projekt integriert ist. Beschreiben Sie die gewünschte Änderung, und er führt den Schnitt aus. Greifen Sie ein und setzen Sie Ihre Schnitte, wann immer Sie möchten, und übergeben Sie die Timeline anschließend wieder an den Agenten.@ElevenLabs auf X

Dieses Hin und Her unterscheidet das Tool von einer undurchsichtigen Generierung: Der Editor übernimmt die Kontrolle, wann immer er will, und übergibt die Timeline anschließend zurück. Diese wurde zudem für Projekte mit mehreren Szenen und Spuren neu aufgebaut – Werbekampagnen, Tutorials, Kurzformatserien – mit Zoom bis auf Einzelbildebene, Einrasten der Clips und dem Verschieben einer Clipgruppe, ohne dass der Rest die Synchronisierung verliert. Teamkommentare werden direkt an einem bestimmten Clip oder Asset angebracht, statt sich über separate Threads zu verteilen.

Für die Nachverfolgung ist anzumerken: Zum Zeitpunkt des Scans existierte die Ankündigung nur auf X, in einem Thread aus sechs Beiträgen. Der Blog von ElevenLabs endete mit dem Beitrag vom 10. September und das Changelog der Dokumentation mit dem Eintrag vom 14. September.

🔗 Studio 4.0 in ElevenCreative


Hugging Face veröffentlicht tokenizers v1, bei identischen IDs 3- bis 30-mal schneller

21. September — Hugging Face veröffentlicht den Release Candidate von tokenizers v1, der Rust-Bibliothek, die Text in Zahlenfolgen umwandelt, bevor ein Modell ihn liest. Die Ausgangslage ist einfach: Die Tokenisierung war nie der Engpass in Machine-Learning-Pipelines, doch das Gleichgewicht verschiebt sich, je schneller die Modelle werden, und eine GPU, die auf ihre CPU wartet, ist eine untätige GPU.

MetrikGemessener Wert
Beschleunigung der Kodierung gegenüber v0.23, ein Thread3- bis 30-mal
TestsystemApple M4 Max
Unteres und oberes Ende der Spannet5-base und gpt2
Skalierung auf acht Worker76 % der linearen Skalierung
Erzeugte Token-IDsidentisch mit v0.23
Installation des Release Candidatecargo add tokenizers --pre

Die selbst auferlegte Vorgabe des Teams ist interessanter als die Leistungssteigerungen selbst: v1 erzeugt exakt dieselben Token-IDs wie v0.23, API, Vokabular und Fusionsränge (merge ranks) bleiben unverändert, und die Bibliothek bleibt allgemein einsetzbar, statt sich auf BPE zu spezialisieren. Für das Update ist daher nichts weiter erforderlich, als die installierte Version zu ändern.

Sechs Änderungen machen den Großteil der Arbeit aus, und die ungewöhnlichste heißt bitcannon. Der reguläre Ausdruck, der den Text in Pre-Tokens zerlegt, ist ein fester Parameter, der mit dem Tokenizer ausgeliefert wird: Es gibt keinen Grund, ihn bei jeder Kodierung von einer generischen Engine interpretieren zu lassen. Hugging Face schreibt die Zerlegungsfunktion daher von Hand und lässt sie mit SIMD auf Bitströmen arbeiten, wobei pro Registeroperation 64 Byte verarbeitet werden. Der Nachteil wird bewusst in Kauf genommen: Nur erkannte Muster (GPT-2, cl100k, o200k, Tekken, DeepSeek) profitieren davon, alle anderen verwenden weiterhin den Regex-Pfad – was die Spanne zwischen 3 und 30 erklärt. Hinzu kommen eine Fusionsschleife ohne Allokationen oder Verzweigungen, ein thread-lokaler Wort-Cache und native Parallelität. Die ausschließlich für Inferenz vorgesehenen C- und C++-Bindings für ExecuTorch und llama.cpp sind noch vor Version 1.0.0 angekündigt.

🔗 tokenizers v1: gemessene Kodierung, Dekodierung und Skalierung


Devin Cloud kommt ins Terminal, mit SSH-Zugriff auf die Maschine des Agenten

21. September — Cognition bringt Devin Cloud ins Terminal: devin --cloud oder /cloud aus einer laufenden Sitzung erstellt, steuert und setzt eine Cloud-Sitzung fort, ohne das CLI zu verlassen. Der Mechanismus beruht auf einem symmetrischen Befehl: /handoff überträgt die laufende Aufgabe auf Devins virtuelle Maschine – Mac, Linux oder Windows – und geht, wenn er aus der Cloud ausgeführt wird, den umgekehrten Weg, indem er den Branch des Pull Requests abruft. Cloud-Sitzungen bleiben auch nach dem Schließen des Terminals bestehen, in dem sie gestartet wurden.

And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.

🇩🇪 Und verbinden Sie sich zum ersten Mal per SSH mit Devins dedizierter virtueller Maschine, um die Arbeit anschließend mit /handoff auf Ihr eigenes Gerät zurückzuholen.@cognition auf X

devin ssh eröffnet vollständigen Zugriff auf die vom Agenten eingerichtete Umgebung: Code ändern, einen Entwicklungsserver starten, Ports weiterleiten und Dateien mit scp zurückholen. Die Ausführungsumgebung ist keine Blackbox mehr. SWE-2-Sitzungen sind in Devin Cloud bis zum 8. Oktober kostenlos.

🔗 Devin Cloud in Ihrem Terminal


Qwen Code v0.24.3 instrumentiert seine Web Shell und persistiert Sitzungen über JDBC

21. September — Qwen Code erscheint einen Tag nach v0.24.2 in Version v0.24.3: einunddreißig Pull Requests, keine inkompatiblen Änderungen. Der Großteil der sichtbaren Arbeit betrifft die Web Shell, deren Ausführungsergebnisse nicht mehr als Rohtext, sondern als Struktur vorliegen, die Befehl, Ausgabe, Ausführungsdetails und verstrichene Zeit voneinander trennt. Ein standardmäßig deaktivierter trajectory-Tab zeigt die Dauer pro Durchlauf, die Zeit bis zum ersten Token, die Anzahl der Tokens und die Dauer jedes Tool-Aufrufs an.

Der weniger sichtbare Teil ist vermutlich der strukturell bedeutendere. Die Runtime erhält eine JDBC-Persistenz für ihre Bindungen und Sitzungen, wodurch sich der Zustand zwischen mehreren Broker-Prozessen teilen und die Eigentümerschaft einer Sitzung nach einem Neustart beibehalten lässt. Die Tools der Runtime werden außerdem über bwrap mit einer unveränderlichen Workspace-Richtlinie geroutet – die direkte Fortsetzung der am Vortag eingeführten Sandbox, deren Konfiguration weiterhin nicht zugänglich ist. Am selben Tag enthält das TypeScript SDK v0.1.14 diese CLI, und Qwen Code Desktop v0.24.3 folgt.

🔗 Versionshinweise zu Qwen Code v0.24.3


Hugging Face veröffentlicht relore, ein Repository-Gedächtnis für Coding-Agenten

21. September — Hugging Face veröffentlicht relore unter der Apache-2.0-Lizenz, ein Tool, das einem Coding-Agenten das Gedächtnis eines Repositorys verleiht. Ausgangspunkt ist ein Vorfall: Für das am 8. September eröffnete Transformers-Ticket #48630 waren bereits zwei Korrekturen vorgeschlagen worden, als der Continuous-Integration-Agent des Unternehmens im Begriff war, eine dritte zu schreiben. Die Informationen befanden sich vollständig auf GitHub, waren jedoch über Tickets, Pull Requests und Kommentare verteilt, die vom ursprünglichen Ticket aus nicht sichtbar waren.

relore indexiert diesen Verlauf und hält fest, wer was gesagt hat: Eine Entscheidung eines Maintainers hat nicht denselben Stellenwert wie die Hypothese eines Contributors, und maschinell erzeugte Inhalte werden standardmäßig ausgeschlossen. Neben dem Index wird ein Arbeitsklon gepflegt, über dieselbe HTTP API bereitgestellt, und die Anfragen werden lokal verarbeitet – nur die Aufnahme der Daten kontaktiert GitHub. Die Befehle folgen: inflight listet Threads auf, die vorgeben, ein Ticket zu schließen, search --trust authoritative brachte PR #39847 als Ursprung der Regression ans Licht, why geht von einer Codezeile aus, um die zugehörigen Review-Kommentare zu finden. Bei einem Praxistest berichtete der Agent, dass defs ihm mit 5 % der Tokens einen besseren Überblick über eine Datei verschaffte als deren vollständige Lektüre.

🔗 relore, Repository-Gedächtnis für Coding-Agenten


Perplexity trainiert Computer anhand der Fehler seiner Nutzer nach und ergänzt Videofunktionen

21. September — Perplexity Research erläutert, wie das Unternehmen das Modell seines Computer-Agenten – GLM 5.2, wie der Artikel nebenbei verrät – anhand realer Sitzungen seiner Nutzer nachtrainiert. Synthetische Umgebungen erzeugen kontrollierte und leicht überprüfbare Aufgaben; reale Sitzungen liefern zwei Signale, die sie nicht erzeugen: Korrekturen durch den Nutzer und von den Tools zurückgegebene Fehler. Sitzungen mit personenbezogenen Daten sowie Sitzungen von Nutzern, die dem Training widersprochen haben, werden vor jeder Stichprobenziehung ausgeschlossen.

Jeder Durchlauf wird anschließend auf eine von drei Arten behandelt: Nachahmung mittels Kreuzentropie für fehlerfreie Durchläufe erfolgreicher Sitzungen, Korrektur mittels Kullback-Leibler-Divergenz für fehlerhafte Durchläufe mit einem gültigen Hinweis oder bloße Beibehaltung im Kontext. Derselbe Gewichtssatz fungiert als Lehrer und Schüler, doch nur der Lehrer sieht den Hinweis. Drei automatische Prüfer schlagen die verantwortlichen Durchläufe vor, und mindestens zwei müssen übereinstimmen, da der letzte Durchlauf vor der Beschwerde nur in etwa der Hälfte der Fälle die tatsächliche Ursache ist.

Tool-FehlerrateGemessener Wert
Offline, ursprüngliches GLM 5.22,79 %
Offline, nur Rejection Sampling1,35 %
Offline, mit Self-Distillation0,87 %
Online, zwischen zwei Checkpoints2,24 % und dann 1,77 %, also relativ 21,2 % weniger

Die Autoren erklären ausdrücklich, was diese Zahlen nicht belegen: Die offline verglichenen Checkpoints wurden nicht mit denselben Daten trainiert, die Ergebnisse je Aufgabe bleiben durchwachsen, und die Unzufriedenheit der Nutzer verändert sich in A/B-Tests mit rund hunderttausend Nutzern pro Gruppe nicht signifikant: 2,58 % gegenüber 2,54 %.

Am selben Tag erhält Computer eine Videogenerierung, die zwei Drittanbieter-Modellen anvertraut wird: MiniMax H3 und ByteDance Seedance 2.5. Ob Kampagnenclip, Produktdemonstration oder Visual für soziale Medien – das fertige Video erscheint im selben Thread wie die für dieselbe Anfrage erzeugten Texte und Bilder. Verfügbar für Pro- und Max-Abonnenten, ohne Hinweis auf kostenlosen Zugang oder eine Bereitstellung über die API.

🔗 Aus realen Fehlern lernen 🔗 Perplexity Computer und die Videomodelle


Gemini Notebook führt Live Chat und Interactive Learning Overviews allgemein ein

21. September — Gemini Notebook hat am selben Tag zwei Meilensteine bei der Einführung erreicht. Live Chat erreicht 100 % der Ultra-Abonnenten auf Mobilgeräten: Sprachkonversationen in Echtzeit mit einem Notebook in rund 100 Sprachen, gestützt auf die neuesten Audiomodelle von Google und mit einer nahezu vollständig freihändigen Schritt-für-Schritt-Anleitung. Einige Stunden später endet die schrittweise Einführung der Interactive Learning Overviews, sodass sie allen Nutzern ohne Abonnementvoraussetzung zugänglich sind; unter Reports vereinen sie Quellenzusammenfassungen und Studio-Artefakte in einem einzigen interaktiven Bereich.

Beide Funktionen waren am 15. September in der Ankündigung der neuen Lerntools vorgestellt worden. Die Mitteilungen vom 21. fügen keine Funktion hinzu: Sie bestätigen die tatsächliche Verfügbarkeit – vollständig für die erste und für alle zugänglich für die zweite.

🔗 Live Chat zu 100 % eingeführt 🔗 Interactive Learning Overviews für alle geöffnet


Google.org stellt 4 Millionen US-Dollar für die KI-Fortbildung von Lehrkräften bereit

21. September — Google.org stellt Digital Promise 4 Millionen US-Dollar zur Verfügung, angekündigt in New York am Rande der Generalversammlung der Vereinten Nationen. Die Finanzierung erweitert die Google AI Educator Series, eine kostenlose, bereits früher im Jahr angekündigte Fortbildung für die 6 Millionen Lehrkräfte an Grundschulen, weiterführenden Schulen und Hochschulen in den Vereinigten Staaten. Sie wurde gemeinsam mit ISTE nach einem Ansatz entwickelt, bei dem Lehrkräfte andere Lehrkräfte schulen, konzentriert sich auf übertragbare Kompetenzen statt auf ein bestimmtes Produkt und besteht aus frei einteilbaren Modulen, die durch digitale Badges zertifiziert werden.

Digital Promise ist in drei Bereichen tätig: bei der Anpassung der Fortbildung an staatliche Bildungsbehörden und Schulbezirke, bei Partnerschaften mit Netzwerken von Community Colleges für Lehrkräfte im grundständigen Studium sowie bei einer zweijährigen Untersuchung dazu, was Lehrkräften im Hochschulbereich tatsächlich hilft, deren Ergebnisse in einem kostenlosen öffentlichen Leitfaden veröffentlicht werden.

🔗 Google.org und Digital Promise


Runway erweitert seine Workflows um Compositing, Transparenz und Tiefenkarten

21. September — Runway erweitert seine Workflows, die in seiner Anwendung zusammengestellten Abfolgen von Operationen, um fünf auf die Postproduktion ausgerichtete Bausteine: Compositing, Alpha, HDR, Depth Map und RGB Depth. Das Argument wird in der Ankündigung in einem Satz zusammengefasst: einen größeren Teil der eigenen Produktionskette (Pipeline) an einem Ort aufbauen, ohne zwischen zwei Schritten zu einem anderen Tool wechseln zu müssen. Compositing und die Verwaltung des Alphakanals dienen dem Zusammenfügen mehrerer Bildebenen; Tiefenkarten werden in ihren beiden Formen als geometrisches Signal verwendet, um Effekte zu steuern, die von der Entfernung zur Kamera abhängen. Die Ankündigung erfolgte auf X mit einer 31-sekündigen Demonstration; zum Zeitpunkt des Scans gab es keinen entsprechenden Beitrag auf der Nachrichtenseite von Runway.

🔗 Erweiterte Workflows in Runway


NVIDIA startet DSX Ready, ein Qualifizierungsprogramm für die Stromversorgung und Kühlung von KI-Fabriken

21. September — NVIDIA startet DSX Ready, ein Programm, das Produkte von Partnern anhand der Anforderungen seiner DSX-Referenzarchitektur für KI-Fabriken qualifiziert. Die Ausgangslage ist ganz praktisch: Stromversorgung, Kühlung, Wasser, Standort und Stromnetz bestimmen heute, was ein Betreiber tatsächlich bereitstellen kann, und eine Ausrüstung, die nicht auf den Rest des Designs abgestimmt ist, verwandelt Rechenkapazität nicht in nutzbare Leistung.

Qualifizierte KategoriePartner zum StartQualifizierungsverfahren
BatteriespeicherHitachi Energy, LG Energy Solution, TeslaTests durch den Partner, Prüfung und Freigabe durch NVIDIA
KühlmittelverteilungseinheitenLG Electronics, LiquidStack, VertivSelbstqualifizierungs-Suite

NVIDIA setzt eine ausdrückliche Grenze dafür, was das Label bedeutet: Eine erfolgreiche Qualifizierung ersetzt nicht das Engineering auf Standortebene und beinhaltet keinerlei Garantie für dessen Stabilität. Weitere Kategorien für Infrastruktur und Software sollen schrittweise hinzukommen.

🔗 NVIDIA DSX Ready


NVIDIA behandelt die Sicherheit von Agenten Schicht für Schicht als Engineering-Problem

21. September — NVIDIA veröffentlicht eine Stellungnahme zur Sicherheit agentischer Systeme: Sie sei ein Engineering-Problem und erfordere daher definierte Anforderungen, durchsetzbare Kontrollen, benannte Verantwortliche und Nachweise dafür, dass die Schutzmaßnahmen greifen. Der Stack wird in drei Ebenen zerlegt – Modelle stellen die Fähigkeiten bereit, Harnesses organisieren Kontext, Tools und Workflows, und die Ausführungsumgebung stellt die Infrastruktur bereit, in der die Aktionen stattfinden –, wobei jede Ebene ihre eigenen Kontrollen trägt.

Das gewählte Beispiel ist anschaulich: Ein Agent aktualisiert einen Kundendatensatz, stößt in einem angehängten Dokument auf bösartige Anweisungen und versucht, die Daten an ein nicht autorisiertes Ziel zu exportieren. NVIDIA erwartet dann eine Netzwerkrichtlinie, die die Übertragung blockiert, sowie geschützte Protokolle, die den versuchten Tool-Aufruf, die Autorisierungsentscheidung und das Ergebnis festhalten. Das Recht, einen Datensatz zu aktualisieren, erstreckt sich nicht auf das Recht, ihn zu exportieren, und ein Agent kann Zugriff anfordern, ohne ihn sich jemals selbst gewähren zu können. Bei den Tools setzt OpenShell die Richtlinien außerhalb der Reichweite des Agenten durch; Cisco setzt DefenseClaw darüber ein, und JFrog überprüft die Skills, auf die ein Agent zugreift.

Am selben Tag überträgt ein zweiter Beitrag dieselbe Argumentation auf Physical AI und verknüpft sie mit der Halos-Grundlage; er erscheint unten in den Kurzmeldungen zusammen mit seinen beiden Marktprognosen.

🔗 Absicherung des Agent-Stacks


Earth-2 assimiliert lokale Beobachtungen, um Wettervorhersagen zu aktualisieren

21. September — NVIDIA veröffentlicht ein Tutorial zu den KI-gestützten Datenassimilations-Tools von Earth-2 für Branchen, die bereits über eigene Messdaten verfügen: Wind- und Solarparks, lokale Radare und Sensoren sowie Satellitenbeobachtungen. Die erste Technik, SDA, wird auf Diffusionsmodelle wie CorrDiff und StormCast angewendet: Bei jedem Entrauschungsschritt vergleicht sie das Zwischenergebnis mit den Beobachtungen und steuert den nächsten Schritt, ohne erneutes Training.

Gemessene TechnikAbdeckung und AuflösungIm Beispiel angegebener Gewinn
CorrDiff-SDAEuropa, von 0,25 Grad auf 2,2 kmWind-RMSE an ausgeschlossenen Stationen um 54 % gesenkt
StormCast-SDAKontinentale USA, 3 km, mit HRRR initialisiertWind-RMSE über sechs Zeitschritte um 7,2 % gesenkt
HealDAGlobal, HEALPix-Raster mit 1 GradGlobaler Atmosphärenzustand in wenigen Sekunden geschätzt

Der Nutzen ist vor allem operativer Natur: Numerische Analysen erfordern erhebliche Rechenzeit und werden zu festen Zeiten ausgegeben, während SDA fortlaufend Beobachtungen integriert und die Lücke bis zur aktuellen Uhrzeit schließt. HealDA wiederum behandelt jeden Datenstrom als Punktwolke in Raum und Zeit, die auf dem Zielraster aggregiert und anschließend durch ein als Vision Transformer ausgelegtes Backbone-Netzwerk (Backbone) geleitet wird.

🔗 Datenassimilation in Earth-2


Multiverse Computing beschneidet Blöcke wie ein Ising-Spin-Glas und gewinnt 23 MMLU-Punkte

21. September — Ganze Transformer-Blöcke zu entfernen ist eine der kostengünstigsten Möglichkeiten, ein großes Sprachmodell zu beschleunigen, und zugleich eine der brutalsten: Das Modell wird buchstäblich kürzer, doch das Entfernen der falschen Blöcke lässt es zusammenbrechen. Multiverse Computing argumentiert, dass die Fragestellung falsch sei. Bestehende Methoden bewerten jeden Block isoliert – magnitude, sensitivity, block influence –, was die Autoren als Mean-Field-Ansatz bezeichnen, obwohl die Auswirkung der Entfernung eines Blocks davon abhängt, welche anderen Blöcke gleichzeitig entfernt werden.

Die Auswahl wird damit zu einem binären Optimierungsproblem unter Nebenbedingungen, das auf ein Ising-Spin-Glas abgebildet wird: ein ungeordnetes Spinsystem mit All-to-all-Wechselwirkungen und einer festen Anzahl nach oben ausgerichteter Spins. Der praktische Nutzen lässt sich in einem Satz zusammenfassen: Die Energie dieses Systems ist ein kostengünstiger Ersatzwert für den Score, den das beschnittene Modell erreichen wird, wodurch sich sehr viele Kandidatenkonfigurationen einstufen lassen, ohne eine einzige davon anhand von Benchmarks zu bewerten. Bei einer Komprimierung von Llama-3.3-70B-Instruct um 50 % beanspruchen die Autoren einen Gewinn von fast 23 Prozentpunkten bei MMLU gegenüber der besten konkurrierenden Methode.

🔗 LLMs beschneiden wie ein Physiker


Kurzmeldungen

NVIDIA veröffentlichte am 21. September sieben Blogbeiträge und Meldungen: Drei werden weiter oben behandelt, die vier übrigen sind hier aufgeführt, ohne technische Ankündigung.

  • NVIDIA fordert Sicherheit auf jeder Ebene für physische KI — Positionsbeitrag, gestützt auf zwei Marktprognosen: Laut ABI Research werden bis 2035 49 Millionen autonome Fahrzeuge der Stufen 3 bis 5 installiert sein, und laut Omdia werden zwischen 2026 und 2035 rund 60 Millionen Industrieroboter eingesetzt. Vier Sicherheitsanforderungen werden dabei mit der NVIDIA-Halos-Grundlage verknüpft. 🔗 Quelle
  • NVIDIA hebt die Skalierung des ägyptischen KI-Ökosystems hervor — Empfang im Grand Egyptian Museum mit einer Eröffnungsrede von Paolo Guglielmini, Vice President EMEA. Der Vorspann weist vor allem darauf hin, dass KI-Fabriken in Südafrika, Marokko und Nigeria in Betrieb gehen. 🔗 Quelle
  • NVIDIA stellt fünf Unternehmen vor, die KI für kohlenstoffarme Energien einsetzen — zur New York Climate Week veröffentlichter Überblick, von der Beschleunigung der Kernfusion bis zur Wiederverwendung recycelter Batterien aus Elektrofahrzeugen. ThinkLabs AI entwickelt dafür auf CUDA digitale Zwillinge und Agents, um die Fristen für Netzanschlüsse zu verkürzen. 🔗 Quelle
  • NVIDIA gibt die Gewinner der Golden Tickets für die GTC Berlin bekannt — sechs von einer Jury ausgewählte Gewinner für die Konferenz vom 20. bis 22. Oktober 2026. Keine technischen Inhalte. 🔗 Quelle
  • Qwen-Image-2.1 wird vom ersten Tag an von vLLM, SGLang, ComfyUI und Hugging Face bereitgestellt — SGLang-Diffusion führt das Modell mit CPU-Offloading auf einer einzelnen RTX 4090 mit 24 GB aus und erzeugt ein Bild mit 1024 mal 1024 Pixeln in 18,7 Sekunden bei einer Speichernutzung von 22,7 GiB. vLLM beschreibt es als Diffusion Transformer mit 7,1 Milliarden Parametern in Verbindung mit Qwen3-VL-8B. 🔗 Quelle
  • OpenAI Academy ergänzt vier Lernpfade — Build with AI, Lead AI Adoption, AI for Educators und AI for College Students kommen zu Apply AI at Work hinzu. Jeder Kurs endet mit einer Prüfung, für die ein Abzeichen vergeben wird; der Entwicklerpfad trennt die Steuerung von Codex von der Entwicklung auf der API. 🔗 Quelle
  • Runway veranstaltet in San Francisco einen Hackathon rund um seine API — eintägige Veranstaltung am 30. September im Masonic am Rande des Runway AI Summit, um einen Agent, eine Anwendung oder einen kreativen Workflow zu entwickeln, ohne Präsentationsunterlagen oder Freigabeprozess. 🔗 Quelle
  • HeyGen hebt Code2Video hervor, einen gemeinsam mit Google DeepMind und Kaggle entwickelten Benchmark — gemessen wird eine andere Frage als die Qualität des Codes: ob dieser Code ein Video erzeugt, das sehenswert ist. Veröffentlicht als Kommentar zu einer Meldung über den auf Codegenerierung basierenden agentischen Video-Stack. 🔗 Quelle
  • Suno demonstriert Soundeffekte, die durch eine einfache Beschreibung angewendet werden — einminütige Vorführung, von warmer Sättigung bis zu einer experimentelleren Wiedergabe. Weder Funktionsname noch betroffener Tarif noch zugehöriger Blogbeitrag: eher eine Produktpräsentation als eine Markteinführung. 🔗 Quelle
  • Live-Demonstration von Gemini für Einkäufe auf Discord — angekündigte Sitzung für Dienstag, den 22. September, um 11 Uhr PT auf dem offiziellen Discord-Server, zur Vorbereitung eines Kaufs, zum Vergleich von Optionen und zur Suche anhand eines Fotos. Keine neue Funktion. 🔗 Quelle
  • Together AI und Ollama kündigen eine Sitzung über offene Coding-Agents an — Parth Sareen von Ollama und Zain Hasan von Together AI werden eine Sitzung darüber leiten, wie auf offenen Modellen basierende Coding-Agents in Produktion gebracht werden. Weder Datum noch Ort werden in der Meldung genannt. 🔗 Quelle
  • Die Gewichte zweier abgebrochener Trainingsläufe von Boris-2 werden offengelegt — beim ersten stagnierte der Loss nach 30 Milliarden Tokens bei 3,100, verursacht durch eine Inkompatibilität zwischen Muon- und AdamW-Gradienten; der zweite wurde nach etwa 7 Milliarden Tokens gestoppt. Ein Bericht über Fehlschläge, der aufschlussreicher ist als die Modelle selbst. 🔗 Quelle
  • Ein vorregistriertes Protokoll gegen den Richtungsbias von Judge-Modellen — die Hypothese lautet, dass Fehler bei narrativen Texten eher zur ausdrücklichen Benennung einer Emotion als zu ihrer impliziten Kodierung tendieren. Das Protokoll wird vor jeglicher Datenerhebung veröffentlicht, einschließlich des Ergebnisses, das zur Verwerfung des Konstrukts führen würde, und eines vom Autor offengelegten Interessenkonflikts. 🔗 Quelle
  • Eine Reproduktion von Jev mit offenen Bausteinen verfehlt das Ergebnis um 0,6 Punkte — ein Nutzer, der angibt, nicht programmieren zu können, überträgt Claude Code einen Tag lang Experimente, um Jev auf offenen, ausschließlich auf CPUs laufenden Stacks nachzubauen. Acht gescheiterte Ansätze, die er für aufschlussreicher hält als den erfolgreichen. 🔗 Quelle
  • Jevini trennt den Entwurf von der Ausführung einer Entscheidung — ein großes Reasoning-Modell entwirft einen versionierten Graphen typisierter Bewertungen, den ein kleines Entscheidungsmodell für jede neue Situation ausführt. Werbeinhalte des Anbieters, die entsprechend zu behandeln sind. 🔗 Quelle
  • Cohere pflegt seine Markenkommunikation, ohne Produktankündigung — eine Meldung vom 20. September setzt die Kampagne AI for Empowerment fort, indem sie die dem Mitgründer Aidan Gomez zugeschriebene Absicht neu formuliert; zwei Beiträge vom 21. erzählen vom Weg des Unternehmens zum studentischen Hackathon Hack The North in Waterloo. Weder Modell noch Funktion noch Preis. 🔗 Kampagne · 🔗 Hackathon

Was das bedeutet

Der Tag null wird zur Norm für die Bereitstellung. Grok 4.7 wartet nicht: Das Modell ist am Tag seiner Ankündigung in Cursor und GitHub Copilot verfügbar, und Qwen-Image-2.1 wurde unmittelbar nach seiner Veröffentlichung von vLLM, SGLang, ComfyUI und Hugging Face bereitgestellt. Die Zeit zwischen der Veröffentlichung eines Modells und seiner Verfügbarkeit in alltäglichen Werkzeugen, die früher in Wochen gemessen wurde, nähert sich null — bei Cursor, weil der Anbieter und das Labor seit dem 14. August zum selben Konzern gehören, anderswo, weil die Integration vor der Ankündigung vorbereitet wird. Die interessante Frage ist nicht mehr, wann ein Modell verfügbar sein wird, sondern was es nach seiner Einführung kosten wird.

Genau das verändert die Abrechnungsposition von Copilot. Grok 4.7 verlässt dort das System der Anfrage-Multiplikatoren und wird nutzungsabhängig zum öffentlichen Tarif von xAI abgerechnet. In Verbindung mit der automatischen Aktivierung neuer Modelle verlagert dies eine Kostenentscheidung in die Plattformverwaltung: Nichts zu tun bedeutet, einen Ausgabenposten zu eröffnen, der an die Preisliste eines Drittanbieters gekoppelt ist. Bei xAI ist das Argument spiegelbildlich — dieselben 2 Dollar für die Eingabe wie bei Grok 4.6, echte Verbesserungen bei Terminal-Bench, aber bei langen Coding-Aufgaben einen Platz hinter Fable 5.1: Verkauft wird hier ein Preis-Leistungs-Verhältnis, kein erster Platz.

Bei den Agents erzählen drei voneinander entfernte Ankündigungen von demselben Wandel: Die Ausführungsumgebung ist keine Blackbox mehr. devin ssh öffnet die virtuelle Maschine des Agents für eine interaktive Sitzung, relore gibt dem Agent die Erinnerung an frühere Entscheidungen eines Repositorys statt nur den gegenwärtigen Zustand des Codes, Perplexity trainiert sein Modell gezielt anhand genau der Interaktionen nach, bei denen es für seine Nutzer versagt hat, und Qwen Code leitet seine Tools über bwrap. NVIDIA liefert den theoretischen Rahmen für diese Entwicklung, indem es postuliert, dass die Sicherheit eines Agents Schicht für Schicht und außerhalb seiner Reichweite gewährleistet werden muss, mit Logs, die als Nachweis dienen. Der überprüfbare Agent und der eingeschränkte Agent sind zwei Seiten desselben Bedürfnisses.

Offen bleibt die Frage, die OpenAIs Ankündigung aufwirft, ohne sie zu behandeln. Ein internes Modell, das in weniger als einem Monat mehr als hundert offene Probleme löst, hat eine institutionelle Reaktion hervorgebracht — eine unabhängige, unbezahlte und in ihren Stellungnahmen freie Beratergruppe —, deren Mandat das Tempo der internen Fortschritte ausdrücklich ausschließt, also genau den Gegenstand des Protests der 27 Fields-Medaillenträger. Der Kontrast zum übrigen Tagesgeschehen ist aufschlussreich: Während über das Tempo spektakulärer Ergebnisse diskutiert wird, erreicht eine Tokenisierungsbibliothek eine drei- bis dreißigfache Beschleunigung bei der Garantie identischer IDs, und eine Kompressionsmethode übernimmt Ansätze aus Spingläsern, um bei 50 % Kompression 23 MMLU-Punkte zu gewinnen. Diese Arbeit macht keine Schlagzeilen, entscheidet aber darüber, was die Inferenz von morgen kosten wird.


Quellen