Suchen

Muse erhält auf der Meta Connect 2026 eine Stimme und einen Avatar, die Cloud-Sitzungen von Claude Code verlassen die Vorschauphase, Perplexity startet Fast Search

ai-powered-markdown-translator

Artikel mit gpt-6-sol aus dem Französischen ins Deutsche übersetzt.

Projekt auf GitHub ansehen ↗

Auf der Meta Connect 2026 gibt Meta seinem persönlichen Agenten Muse eine Echtzeitstimme und einen Video-Avatar, kündigt Muse für seine Brillen an und macht die Meta Model API allgemein verfügbar. Die Cloud-Sitzungen von Claude Code verlassen die Vorschauphase; Abonnenten erhalten ein einmaliges Guthaben. Perplexity startet Fast Search auf Basis von Photon, einer hauseigenen, in Rust geschriebenen Suchmaschine. Bezeichnend für den Moment: Meta und Google bringen im Abstand weniger Stunden Video-Avatare auf den Markt, die in Echtzeit sprechen.


Meta Connect 2026: Muse spricht, Meta erneuert seine Brillen

23. September — Meta eröffnete die Meta Connect 2026 mit einer Keynote um 16 Uhr PT (1 Uhr morgens am 24. September in Paris), in deren Mittelpunkt der am 8. September gestartete persönliche Agent Muse stand. Muse erhält einen Echtzeit-Sprachmodus: Man kann sich länger mit ihm unterhalten, während er im Hintergrund arbeitet, und seine Stimme durch eine Beschreibung gestalten (schneller, langsamer, mit einem bestimmten Akzent). Außerdem bekommt er ein animiertes Gesicht, Muse Realtime Avatar, das weiter unten näher beschrieben wird. Auf dem Mac ist die Computersteuerung (computer use) verfügbar: Mit Erlaubnis des Nutzers bedient Muse jede beliebige Anwendung und arbeitet auch während dessen Abwesenheit weiter.

Neuerung bei MuseAngekündigte Verfügbarkeit
Echtzeit-Sprachmodus, anpassbare StimmeAuf der Connect vorgestellt, ohne Termin
Computer use in Muse für MacVerfügbar
Muse auf KI-Brillen„In den kommenden Monaten“
Muse Charm, Gerät im TaschenformatDezember, laut Mark Zuckerberg
Eigene E-Mail-Adresse für MuseAngekündigt, ohne Termin

Auf den Brillen wird man Muse beim Namen rufen können, um etwas mit dem zu tun, was man gerade betrachtet, etwa einem Produkt im Regal oder einem Plakat. Muse Charm soll laut Zuckerberg an einen Schlüsselbund passen und über ein Echtzeit-Sprachmodell verfügen; die offizielle Zusammenfassung verspricht lediglich weitere Informationen bis zum Jahresende.

Einen Tag nachdem @Muse Shopify, PayPal, Expedia und Instacart angekündigt hatte, nennt Meta die vollständige Liste der Konnektoren: Walmart, Best Buy, American Eagle Outfitters, DICK’S Sporting Goods, Fanatics, Gap, Michael Kors, Sephora, Ulta und Wayfair für Einkäufe, Shop Pay und PayPal zum Bezahlen, Instacart, Expedia weiterhin „bald“ sowie Notion, Granola, GitHub und Box für die Arbeit. GitHub erläuterte seinen Konnektor noch am selben Abend: Pull Requests prüfen, Issues und Benachrichtigungen verfolgen und Kommentare schreiben, ohne den Agenten zu verlassen. Angaben zu Tarif oder Ländern machte GitHub nicht. Auch Meta nennt für diese Neuerungen weder Preise noch Länder.

🔗 Zusammenfassung von Meta · Beitrag von Mark Zuckerberg · GitHub-Konnektor für Muse

Brillen: Ray-Ban Meta Audio, Gen 3, Meta VR Glasses und Ray-Ban Display in Frankreich

23. September — Meta erneuert auch sein Brillensortiment und kündigt bis zum Jahresende mehr als 100 Modelle an. Die Ray-Ban Meta Audio bilden eine neue Kategorie ohne Kamera: 43 g Gewicht, bis zu 12 Stunden Akkulaufzeit und weitere 48 Stunden mit dem Etui. Die Ray-Ban Meta der dritten Generation bieten eine Stunde mehr Akkulaufzeit (9 Stunden), eine Aktionstaste und sechs Mikrofone. Die Meta Ray-Ban Display, eine Brille mit Bildschirm, kommt nach Frankreich: Nach Großbritannien und Kanada beginnen dort die Vorbestellungen schrittweise, ebenso wie in Italien und Deutschland. Verfügbar sein soll sie ab dem 13. Oktober.

Angekündigtes GerätEinstiegspreisAngekündigte Verfügbarkeit
Ray-Ban Meta Audio349 DollarVorbestellung, Versand ab 13. Oktober
Ray-Ban Meta (Gen 3)449 DollarVerfügbar ab 23. September
Meta Ray-Ban DisplayNicht angegebenFrankreich, Italien, Deutschland: 13. Oktober
Meta VR Glasses (etwa 100 g)1.299,99 DollarFrühjahr 2027

🔗 Ankündigung von Meta


Meta Model API allgemein verfügbar, Muse Spark 1.3 bei Oracle und Google Cloud, Replit für Meta-Geräte

24. September — Der zweite Tag der Meta Connect richtete sich an Entwickler. Die wichtigste Ankündigung: Die Meta Model API, die Zugang zu den Muse-Modellen bietet, ist weltweit allgemein verfügbar, mit Support und Compliance-Zusicherungen für Unternehmen. Muse Spark 1.3 ist jetzt auf der Oracle Cloud AI Platform verfügbar und geht bei Google Cloud in eine private Vorschauphase; laut Meta sind dies zwei neue bevorzugte Cloud-Partner.

Das Datenblatt von Google Cloud (Gemini Enterprise Agent Platform) nennt die Bedingungen: Modell meta/muse-spark-1.3 in der Vorschauphase, Zugang auf Anfrage, ein Kontextfenster von 1 Million Tokens, ausschließlich Text als Ein- und Ausgabe, MCP-kompatible Tool-Aufrufe sowie Unterstützung für Funktionsaufrufe, strukturierte Ausgaben und Reasoning. Batch-Vorhersagen und reservierter Durchsatz werden nicht unterstützt; außerdem gibt es nur einen globalen Endpunkt. Zum Zeitpunkt unserer Prüfung war auf der Preisseite noch kein Preis angegeben.

Ankündigung für EntwicklerAngekündigter Status
Meta Model APIWeltweit allgemein verfügbar
Muse Spark 1.3 auf Oracle CloudVerfügbar
Muse Spark 1.3 auf Google CloudPrivate Vorschauphase
Muse CodeKommt für Windows
Wearables Device Access Toolkit 1.0Nach einem Jahr Vorschauphase gestartet
WebMCP und Meta AI ConnectorsVorschauphase für Entwickler
Meta Global AI Developer Hackathon1 Million Dollar, Termine nicht angekündigt

Muse Code, Metas Coding-Agent für das Terminal, hat am 31. August die Betaphase auf macOS und Linux verlassen und kommt nun für Windows. Ash Jhaveri (laut seiner X-Biografie „VP AI & Hardware Ecosystems“) wiederholt, dass die Gewichte von Muse Spark 1.2 „bald“ kommen sollen – ein Versprechen, das seit dem 10. August wiederholt wird, weiterhin ohne Termin. Bei den Brillen ermöglicht WebMCP Meta AI, nur die Funktionen aufzurufen, die eine Webanwendung ausdrücklich freigibt.

🔗 Meta Connect 2026: Zusammenfassung für Entwickler · Muse Spark 1.3 auf Google Cloud

Replit entwickelt für Metas Headsets und Brillen

24. September — Auf der Meta Connect kündigte Replit einen Weg zu Metas Geräten an: Man beschreibt eine Anwendung in Alltagssprache, Replit Agent schreibt den Code und zeigt eine Vorschau im Browser; anschließend öffnet sich die Anwendung oder das Web-Erlebnis auf einem Meta Quest-Headset, einer Meta Ray-Ban Display oder einer Meta VR Glasses, ohne dass ein Tool installiert werden muss. Drei Wege werden beschrieben: Expo (Erstellen, Paketieren und Bereitstellen) oder der Browser für Meta Quest und die VR Glasses sowie eine Simulation in Replit mit anschließender Web-Bereitstellung für die Ray-Ban Display. Bei Muse weichen die Formulierungen voneinander ab: Die Replit-Seite bezeichnet einen Replit-Konnektor im Meta-Agenten als „demnächst verfügbar“, ohne Termin, während ein am selben Tag veröffentlichter Beitrag von Replit behauptet, Muse könne bereits Anwendungen in Replit erstellen. Preise werden nicht genannt.

🔗 Replit × Meta Connect 2026 · Muse in Replit, laut @Replit


Claude Code: Cloud-Sitzungen verlassen die Vorschauphase, Projects läuft lokal

23. September — Die Cloud-Sitzungen von Claude Code verlassen die Forschungsvorschau (research preview), wie @ClaudeDevs in einem um 21:23 Uhr UTC veröffentlichten Thread ankündigte. Eine Cloud-Sitzung läuft auf der Infrastruktur von Anthropic: Die Arbeit geht weiter, selbst wenn der Laptop geschlossen ist.

Cloud sessions are officially available and out of research preview! They let you keep Claude Code working, even when your laptop is closed.

🇩🇪 Cloud-Sitzungen sind jetzt offiziell verfügbar und haben die Forschungsvorschau verlassen! Damit kann Claude Code weiterarbeiten, selbst wenn Ihr Laptop geschlossen ist. — @ClaudeDevs auf X

Damit Abonnenten sie ausprobieren können, gewährt Anthropic bestehenden Abonnenten ein einmaliges Guthaben, das getrennt von den Nutzungslimits gilt:

Bedingung für das GuthabenVeröffentlichte Einzelheit
Betrag bei Pro100 Dollar
Betrag bei Max250 Dollar
FristBis zum 7. Oktober einlösen
EinlösungLink in der Ankündigung oder CLI-Befehl /claim-credit
VoraussetzungenVerknüpftes GitHub-Konto, es gelten Bedingungen
GeltungsbereichEin Guthaben pro Konto, ausschließlich für Cloud-Sitzungen
Einstiegspunkteclaude.ai/code, Code-Tab der mobilen App, Desktop-App, claude --cloud

Auf Nachfragen stellte @ClaudeDevs am 24. September um 01:57 Uhr UTC klar, dass Cloud-Sitzungen wie die übrige Nutzung von Claude Code auf das Pro- oder Max-Abo angerechnet werden: Das optionale Guthaben wird lediglich zuerst verbraucht. Die Dokumentation bestätigt dieses Modell: Die Durchsatzlimits werden mit der gesamten Claude-Nutzung des Kontos geteilt, parallele Aufgaben verbrauchen entsprechend mehr davon, und die virtuelle Maschine wird nicht gesondert berechnet. Cloud-Sitzungen stehen Nutzern von Pro, Max und Team sowie Enterprise-Nutzern mit Premium- oder Chat + Claude Code-Plätzen offen. Das Klonen und Pull Requests laufen über GitHub; ein GitLab- oder Bitbucket-Repository kann mit CCR_FORCE_BUNDLE=1 als lokales Bundle übertragen werden.

🔗 Dokumentation der Cloud-Sitzungen · Klarstellung von @ClaudeDevs zum Abo

Projects führt seine Threads lokal aus

23. September — Anderthalb Stunden später (22:49 Uhr UTC) kündigte @ClaudeDevs lokale Unterstützung für Projects in Claude Code an, das am 17. September als Beta für Pro und Max gestartet war: Die Threads eines Projekts können nun auf dem Rechner des Nutzers laufen. Bislang war jeder Thread eine Cloud-Sitzung auf einem eigenen Branch. Für Arbeiten, die nur lokal erreichbare Tools benötigen (eine lokale Datenbank, einen Emulator oder eine API hinter einem VPN), empfahl die Dokumentation eine lokale Sitzung außerhalb des Projekts. Anthropic gibt außerdem an, Projects für weitere Pro- und Max-Abonnenten auf der Warteliste zu öffnen; die Migration der Nutzer älterer Claude-Projekte läuft noch. Die Ankündigung ist der Dokumentation voraus: Am Abend des 24. September stand auf der Projects-Seite noch, dass lokale Sitzungen nicht Teil eines Projekts sein können. Der Tweet erklärt nicht, über welche Oberfläche sich diese Threads starten lassen.

🔗 Ankündigung von @ClaudeDevs · Dokumentation von Projects


Perplexity: Fast Search und Photon

24. September — Perplexity ergänzt seine Search API um den schnellen Modus Fast Search, der über den Parameter search_type: "fast" aktiviert wird, und stellt die zugrunde liegende Engine vor: Photon, ein in Rust geschriebener Dienst für Retrieval und Ranking (retrieval and ranking). Er ersetzt die Open-Source-Engine, die das Unternehmen zuvor angepasst hatte, und verarbeitet jetzt sämtliche Suchanfragen von Perplexity.

Fast Search runs on Photon, our new Rust-based retrieval and ranking service that we built with a small team of engineers and hundreds of agents.

🇩🇪 Fast Search basiert auf Photon, unserem neuen, in Rust geschriebenen Dienst für Retrieval und Ranking, den wir mit einem kleinen Team von Ingenieuren und Hunderten von Agenten entwickelt haben. — @perplexity_ai auf X

VergleichskriteriumStandardsucheFast Search
Search API, 1.000 Anfragen5 Dollar1 Dollar
Tool web_search der Agent API, 1.000 Aufrufe (ohne Tokens)2,50 Dollar1 Dollar
Ergebnis bei 3.554 Aufgaben aus sechs agentischen Benchmarks64,0 %64,3 %
Geschätzte Kosten für Modell und Suche bei diesen Aufgaben187,60 Dollar59,73 Dollar
Latenz eines Aufrufs, Median und 95. Perzentil (Eigenangabe)Nicht veröffentlicht160 ms und 230 ms

Perplexity nimmt den Kompromiss bewusst in Kauf: Bei internen Tests mit seltenen Suchanfragen sinkt die Relevanz um 0,24 Punkte und die Wahrscheinlichkeit, dass eine Antwort verfügbar ist, um etwa 3 Punkte. Das Unternehmen empfiehlt Fast Search für alltägliche agentische Aufgaben und die Standardsuche für schwierige oder mehrdeutige Fragen. Der Blogbeitrag weist darauf hin, dass der Latenzvergleich mit anderen APIs auf Angaben der jeweiligen Anbieter beruht und kein kontrollierter Test durchgeführt wurde. Bei der Search API muss die Validierung der Python- und TypeScript-SDKs derzeit umgangen werden. Im Produktivbetrieb sank die interne p99-Latenz der Engine durch Photon von etwa 800 auf 65 ms, bei rund 20 % weniger Maschinen.

🔗 Photon: Building a Retrieval and Ranking Engine From Scratch · Dokumentation von Fast Search


Echtzeit-Video-Avatare: Meta und Google im Abstand weniger Stunden

Meta und Google haben im Abstand weniger Stunden denselben Produkttyp auf den Markt gebracht: einen Video-Avatar, der in Echtzeit zuhört, spricht und reagiert und auf einem Sprachmodell basiert.

Muse Realtime Avatar

23. September — Meta Superintelligence Labs erläutert Muse Realtime Avatar, das Gesicht von Muse. Ausgehend von einem Referenzbild (Porträt, Ganzkörperillustration, Tier oder Alltagsgegenstand) animiert das Modell eine Figur live, einschließlich Mimik, Handgesten und Körperbewegungen. Ein einziger Strom von Sprachtokens, erzeugt vom Sprachmodell Muse Realtime Voice, steuert Ton und Bild und hält so Stimme und Lippen synchron. Durch Destillation sinkt der Rechenaufwand von 120 auf 2 Auswertungen pro Segment.

Von Meta genannte KennzahlGenannter Wert
Hochkantvideo448x768, 25 Bilder/s
Latenz der Sprach- und VideoantwortEtwa 870 ms
Gleichzeitige Sitzungen pro GB20012
Präferenz gegenüber Runway Characters78 % gegenüber 22 %
Präferenz gegenüber HeyGen LiveAvatar88 % gegenüber 12 %

Diese Präferenzen stammen aus einer von Meta durchgeführten Bewertung durch Menschen. Meta merkt an, dass der Unterschied im Auftreten gegenüber Runway statistisch nicht signifikant ist. Jedes Video trägt das unsichtbare Wasserzeichen Meta Video Seal.

🔗 Bringing Your Muse to Life

Gemini 3.8 Live mit Live Avatar

24. September — Neun Tage nach Gemini 3.8 Live gibt Google seinem Sprachdialogmodell ein Gesicht: Der Avatar hört zu, sieht, was der Nutzer ihm zeigt (per Kamera oder Bildschirmfreigabe), und antwortet mit synchronisierter Stimme und Video. Er ist in Gemini Enterprise allgemein verfügbar und für Entwickler über die Live API der Agentenplattform zugänglich, mit Endpunkten in den USA und der Europäischen Union; Gemini 3.8 Live Extended Thinking bleibt in der privaten Vorschau. Der Avatar spricht 97 Sprachen und ruft Tools auf, ohne das Gespräch zu unterbrechen. Für einen personalisierten Avatar ist eine Aufnahme in die Freigabeliste erforderlich. Laut Modelldatenblatt ist die Ausgabe auf 24K Tokens begrenzt, und eine durchgehende Interaktion dauert einige Minuten. Avatar-Video kostet 1 Dollar pro Million Tokens bei 6.192 Tokens pro Sekunde gesprochener Sprache; das Zuhören wird nicht berechnet. Alles trägt das SynthID-Wasserzeichen.

🔗 Ankündigung von Google


Was Claude kostet: der Cache von Opus 5.5 und erneut berechnete Ablehnungen

Zwei Veröffentlichungen vom 24. September befassen sich mit den Kosten für Claude-Nutzer: wo Opus 5.5 Einsparungen bringt und warum bestimmte abgelehnte Anfragen wieder berechnet werden.

Längere Sitzungen und warum Opus 5.5 dabei weniger kostet

24. September — Ein Beitrag auf claude.com von Michael Segner fasst die Nutzung von Claude Code von März bis September 2026 zusammen. Die Zahl der Prompts pro Sitzung blieb gleich, aber Claude arbeitet an jedem 3,3-mal länger, mit über 40 % mehr Modellaufrufen und 68 % weniger Unterbrechungen. Der Kontext pro Anfrage ist um den Faktor 2,6 gewachsen, und das Verhältnis von Eingabe- zu Ausgabe-Tokens stieg von 189:1 auf 324:1. Damit macht das Lesen aus dem Cache den größten Kostenanteil aus, und die Preissenkung um 60 % bei Opus 5.5 wirkt sich entsprechend stark aus; laut Anthropic kostet ein Token aus dem Cache bei Opus 5.5 ein Fünftel dessen, was es bei Konkurrenzmodellen kostet. Bei Opus 5.5 und Fable 5.1 setzt ein Wechsel der Effort-Stufe während einer Sitzung den Cache nicht mehr zurück, obwohl der am 22. September veröffentlichte Leitfaden das Gegenteil besagte.

🔗 Beitrag auf claude.com

Blockierte Anfragen werden in drei Kategorien wieder berechnet

24. September — Anthropic berechnet wieder Anfragen, die seine Schutzmechanismen blockieren, bevor Claude antwortet, kündigt @ClaudeDevs an. Laut dem Tweet betrifft das nur Kategorien mit einer geringen Falsch-positiv-Rate: Biologie, Distillationsangriffe und die Entwicklung von Frontier-LLMs. Als Grund nennt Anthropic „koordinierte Angriffe“ auf seine Systeme in den vergangenen Wochen. Das Unternehmen gibt an, dass 99,7 % der Konten bei Claude Code, Claude.ai oder Cowork bei jüngsten Tests keine dieser kostenpflichtigen Sperren ausgelöst haben, und strebt weniger als 0,1 % falsch positive Entscheidungen an; eine ungerechtfertigte Sperre lässt sich über /feedback melden. Laut Dokumentation wird eine berechnete Ablehnung zum Tarif des jeweiligen Modells abgerechnet, sowohl über die Claude API als auch über Bedrock, Google Cloud und Microsoft Foundry; jede abgelehnte Anfrage zählt zum Ratenlimit.

Ablehnungskategorie (Dokumentation)Vor jeder Ausgabe berechnet
bioJa
frontier_llmJa
reasoning_extractionJa
cyberNein
general_harmsNein

🔗 Ankündigung von @ClaudeDevs · Abrechnung von Ablehnungen


KI und Gesundheit: Ebola in der DR Kongo, OpenEvidence, AlphaFold Database und NV-Reason-CT

Zwei Ankündigungen vom 22. September, die wir hier nachtragen, stellen Claude in den Dienst der öffentlichen Gesundheit. NVIDIA veröffentlicht zudem zwei offene Arbeiten: eine zur Virologie mit Google DeepMind und dem EMBL-EBI, die andere zur Radiologie.

Ebola in der DR Kongo

22. September — In „The Situation Report“, einem Beitrag vom 22. September, den @AnthropicAI am Abend des 23. September teilte, beschreibt Anthropic den Einsatz von Claude gegen den Ausbruch des Bundibugyo-Ebolavirus im Osten der Demokratischen Republik Kongo. Laut Lagebericht vom 19. September gibt es 7.672 bestätigte Fälle und 3.699 Todesfälle (eine Sterblichkeitsrate von 48,2 %); gegen diesen Virusstamm ist kein Impfstoff zugelassen. Die vom CEPI zusammengestellte Partnerschaft mit dem WHO-Regionalbüro für Afrika und dem nationalen Institut für biomedizinische Forschung (INRB) arbeitet mit zwei Teams von Anthropic zusammen. Das WHO-Regionalbüro für Afrika hat einen Skill geschrieben, der die Zahlen für jede Gesundheitszone extrahiert, sie mit denen des Vortags vergleicht und Änderungen des Trends meldet: Die Erstellung des täglichen Lageberichts dauert dadurch weniger als eine Stunde statt eines ganzen Tages. Das CEPI vergleicht mit Claude Impfstoffkandidaten, wobei die wissenschaftlichen Entscheidungen bei Fachleuten bleiben; das INRB kann Claude Science die Virusgenome und ihren phylogenetischen Stammbaum zusammensetzen lassen.

🔗 The Situation Report (Anthropic)

OpenEvidence kostenlos für rund 100 Länder

22. September — Während der Generalversammlung der Vereinten Nationen kündigte OpenEvidence eine Partnerschaft mit Anthropic an, um medizinischem Fachpersonal in rund 100 Ländern mit niedrigem und mittlerem Einkommen eine spezialisierte Version seiner Plattform kostenlos anzubieten. Dazu zählen Uganda, Angola, Sudan, Haiti und die Mongolei (Liste von OpenEvidence laut Reuters). OpenEvidence beantwortet klinische Fragen anhand begutachteter medizinischer Forschung und Behandlungsempfehlungen; in den USA und Kanada ist der Dienst bereits kostenlos. Laut dem Exklusivbericht von Reuters stellt Anthropic die Technologie im Hintergrund bereit, während OpenEvidence das System an jede Region anpasst; finanzielle Bedingungen wurden nicht genannt. Die Meldung stützt sich auf OpenEvidence und Reuters: Anthropic hat sie über seine offiziellen Kanäle nicht verbreitet.

🔗 Ankündigung von OpenEvidence · Exklusivbericht von Reuters

Proteinkomplexe von mehr als 2.800 Viren in der AlphaFold Database

24. September — NVIDIA schließt sich einer Koalition aus acht Organisationen an, darunter Google DeepMind, das EMBL-EBI und das CEPI. Sie veröffentlicht in der AlphaFold Database vorhergesagte 3D-Strukturen von Proteinkomplexen für mehr als 2.800 Viren, von Erkältungsviren bis zu neu auftretenden Bedrohungen wie Mpox. Die nach Vertrauensniveau gekennzeichneten Vorhersagen wurden mit AlphaFold2 erstellt, das durch NVIDIA BioNeMo Inference Runtime optimiert wurde; rund 30 % der hinzugefügten Interaktionen stehen nicht in der Protein Data Bank, der wichtigsten Datenbank für experimentell bestimmte Strukturen. NVIDIA veröffentlicht auch die BioNeMo Structure Prediction Pipeline, mit der die Daten erzeugt wurden, damit Forschende sie auf eigene Zielstrukturen anwenden können. Die Veröffentlichung fällt mit einem Treffen zur Pandemieprävention in New York während der UN-Generalversammlung zusammen; die Datenbank enthält inzwischen mehr als 260 Millionen Vorhersagen.

🔗 Wie offene Wissenschaft Forschenden bei der Vorbereitung auf die nächste Pandemie helfen kann

NV-Reason-CT

23. September — NVIDIA veröffentlicht NV-Reason-CT, ein offenes Vision-Language-Modell für CT-Aufnahmen (Computertomografie) von Brustkorb und Bauchraum. Statt das Volumen als Stapel von 2D-Schichten zu behandeln, zerlegt ein 3D-ViT-Encoder es in 13.824 visuelle Tokens, die an das Sprachmodell Qwen3.5-4B übergeben werden; das Modell erstellt strukturierte Berichte, legt einen an radiologische Befundung angelehnten Gedankengang dar und beantwortet Folgefragen. Auf CT-RATE, dem wichtigsten öffentlichen Benchmark für das Verständnis von 3D-CT-Daten, meldet NVIDIA einen Macro-F1 von 0,614 und eine Macro-AUROC von 0,871. Damit liegt es vor den veröffentlichten Modellen, mit denen es verglichen wird (VoxelFM: 0,581 und 0,870). Die Modellgewichte sind auf Hugging Face verfügbar. NVIDIA betont: Es handelt sich um eine Forschungsgrundlage, die für einen konkreten Einsatz weiter angepasst werden muss, nicht um ein eigenständiges Diagnosewerkzeug oder ein zugelassenes klinisches Produkt.

🔗 Vorstellung von NV-Reason-CT


OpenAI plädiert für internationale Standards für fortgeschrittene KI

23. September — Sam Altman, Geschäftsführer von OpenAI, sprach vor dem Sicherheitsrat der Vereinten Nationen; OpenAI veröffentlicht den Wortlaut der gehaltenen Rede. Darin beschreibt er zwei Fehlentwicklungen, die es zu vermeiden gelte: die Kontrolle über die Zukunft an KI zu verlieren und Macht so stark zu konzentrieren, dass eine Person, ein Unternehmen oder ein Land mit den leistungsfähigsten Modellen seine Weltsicht durchsetzen könnte. Da Systeme näher rückten, die ihre eigenen Nachfolger verbessern können, sei „äußerste Vorsicht“ geboten, sagt er; OpenAI habe die Entwicklung nach seinen Worten bereits einseitig verlangsamt und werde dies wieder tun.

It doesn’t matter whether people put the risk of catastrophe at 10%, or 1%, or 12%, or .1%. None of these levels are remotely acceptable.

🇩🇪 Es spielt keine Rolle, ob man das Katastrophenrisiko auf 10 %, 1 %, 12 % oder 0,1 % schätzt. Keiner dieser Werte ist auch nur annähernd akzeptabel. — Sam Altman, Rede vor dem Sicherheitsrat der Vereinten Nationen

An die Staaten richtet er vier Forderungen: einen Mechanismus, der nationale und internationale Standards für fortgeschrittene KI miteinander verbindet, gemeinsame Standards zum Vergleich von Nachweisen und zur Überprüfung der Einhaltung, Verfahren zur Meldung von Vorfällen sowie sichere Kommunikationskanäle zwischen Regierungen, Betreibern kritischer Infrastrukturen und Fachleuten. Damit greift er einen am 21. September von OpenAI veröffentlichten Beitrag auf, den wir hier nachtragen. OpenAI erklärt darin, dass eine vollständig autonome rekursive Selbstverbesserung bislang nicht existiert und nicht verfolgt werden sollte, solange sie nicht sicher durchgeführt werden kann. Das Unternehmen fordert die USA auf, gemeinsam mit dem vom US-amerikanischen CAISI (Center for AI Standards and Innovation) koordinierten Netzwerk der KI-Sicherheitsinstitute (zehn Länder, darunter Frankreich) die Entwicklung weltweiter technischer Standards anzuführen. Für OpenAI wären diese Standards weder Lizenzen noch eine verpflichtende Prüfung vor einer Veröffentlichung; jeder Staat würde selbst über ihren Platz in seinem Recht entscheiden. Ein Dialog zwischen den USA und China über diese Themen wäre „ein positiver Fortschritt“.

🔗 Standards für die nächste Phase der KI entwickeln


KI in der Cyberabwehr: Daybreak für die Ukraine und Fuzzing Taskflow

Zwei Ankündigungen stellen Modelle in den Dienst der Verteidiger: Die eine öffnet ein Programm für einen Staat, die andere überträgt das Fuzzing an einen Agenten.

Daybreak für die Ukraine geöffnet

23. September — OpenAI öffnet sein Cyberabwehrprogramm Daybreak in Zusammenarbeit mit dem Ministerium für digitale Transformation für die ukrainische Regierung: Die Tools sollen Software-Schwachstellen aufspüren und anschließend die Entwicklung und Prüfung von Korrekturen beschleunigen, um zivile Infrastruktur zu schützen. Die Ankündigung machten Dmytro Kushneruk, Generalkonsul der Ukraine in San Francisco, und Sasha Baker, bei OpenAI für nationale Sicherheitspolitik zuständig, am Rande der UN-Generalversammlung. OpenAI erinnert daran, dass CERT-UA, das nationale Incident-Response-Team, 2025 fast 6.000 Cybervorfälle bearbeitet hat, die unter anderem Krankenhäuser, Energieversorgung und Telekommunikation betrafen. Der Beitrag nennt zwei Ergebnisse aus Europa: ENISA fand Schwachstellen in Software von EU-Institutionen, die inzwischen alle behoben sind, und CERT Polska half dabei, sechs Schwachstellen in einer Router-Software eines Drittanbieters zu entdecken. Weder Laufzeit noch Betrag werden genannt.

🔗 OpenAI erweitert den Zugang zu Cyberabwehrtools für den zivilen Schutz in der Ukraine

Fuzzing Taskflow des GitHub Security Lab

24. September — Das GitHub Security Lab veröffentlicht Fuzzing Taskflow, eine autonome Fuzzing-Pipeline für C/C++-Projekte unter MIT-Lizenz, die auf seinem Taskflow Agent Framework aufbaut. Man gibt ihr ein GitHub-Repository an: Der Agent erkennt Einstiegspunkte, schreibt Test-Harnesses, startet AFL++, wertet die Coverage aus, ordnet jeden Absturz einem von sieben Urteilen zu und erstellt für jeden eigenständigen Bug einen Bericht mit einem als „zu prüfen“ gekennzeichneten Korrekturvorschlag. Der Agent trifft die Entscheidungen, MCP-Tools führen sie aus; bei jeder Iteration verdoppelt sich sein Zeitbudget von 30 auf 960 Sekunden (rund 32 Minuten pro Ziel), und die Schleife endet, wenn der Coverage-Zuwachs in zwei Iterationen jeweils unter 1 % liegt. Das Standardmodell ist Claude Sonnet 5, das alle internen Tests des Teams bestanden hat. Das Security Lab warnt: Die Pipeline führt vom LLM gewählte Befehle ohne Container aus und sollte daher nur in einer wegwerfbaren Umgebung eingesetzt werden. Der Beitrag nennt keine Zahlen zu gefundenen Bugs.

🔗 Beitrag des GitHub Security Lab


Project Suncatcher: TPUs im Orbit

24. September — Project Suncatcher, Googles im vergangenen Jahr angekündigtes Projekt zur Erforschung von KI-Rechenleistung im All, geht in seinen ersten Test im Orbit. Ein mit Planet gebauter Prototyp-Satellit soll mit der SpaceX-Mission Transporter-18 starten; der Beitrag vom 24. September kündigt Googles erste TPUs im Orbit für „nächste Woche“ an. Ziel ist zu prüfen, ob die Chips den Start, die Strahlung und die Temperaturschwankungen überstehen. Am Boden hielten Trillium-TPUs, die bei UC Davis unter voller KI-Last einem Protonenstrahl ausgesetzt wurden, einer höheren Strahlendosis stand, als bei einer fünfjährigen Mission zu erwarten wäre; die Kühlung durch Heatpipes und Radiatoren wurde in einer Thermalvakuumkammer erprobt. Der nächste Schritt für 2027 sind zwei Satelliten zur Erprobung von Laserverbindungen mit sehr hoher Datenrate. Laut Google empfängt ein Satellit in niedriger Erdumlaufbahn bis zu achtmal mehr Sonnenenergie als eine Anlage am Boden.

🔗 Einblick in Project Suncatcher


Generative Bilder und Videos: Midjourney, Runway, Google Research und Nunchux

Bei den Kreativtools verbessert Midjourney seine Bearbeitungswerkzeuge, Runway beziffert die Leistung seines Modell-Routers, Google Research erzeugt Videos von mehreren Minuten Länge und Nunchux beschleunigt MiniMax-H3 auf AMD-GPUs.

Midjourney: Inpainting, —tile und schnelle Modelle in der Alpha-Phase

24. September — Midjourney veröffentlicht für V8.1 und V8.2 eine neue Version des Parameters --tile, der wiederholbare Muster erzeugt: Laut Midjourney verschwinden damit sichtbare Übergänge zwischen den Kacheln. Inpainting und Outpainting des Bearbeitungsmodells verändern nur noch die ausgewählten Pixel, sodass mehrere Bearbeitungen nacheinander möglich sind, ohne den Rest des Bildes zu beeinträchtigen. Auf alpha.midjourney.com erprobt Midjourney schnelle Modelle (fast models), die auf X als erster Einblick in Echtzeitmodelle vorgestellt werden: Mit der Option „Live previews“ zeigt die Styles-Leiste für jeden Stil eine Vorschau des letzten Prompts, und ein Klick startet die Generierung. Namen und Zeitplan werden nicht genannt. Das Alpha-Changelog vom 23. September ergänzt zudem Standardeinstellungen (Settings → Advanced → Your defaults) und macht Koreanisch auf midjourney.com für alle verfügbar.

🔗 Ankündigung von @midjourney · Aktualisierungen von Midjourney

Runway beziffert die Leistung seines Model Router

24. September — Runway veröffentlicht eine erste zahlenbasierte Bewertung von Model Router, dem Router von Runway Dev, der für jede Anfrage anhand einer Präferenz für Kosten, Qualität oder Latenz ein Generierungsmodell auswählt. Das Verfahren vergleicht Seedance 2.5 als Referenz mit drei Router-Konfigurationen anhand von 250 Bild-zu-Video-Prompts, die doppelblind beurteilt wurden.

Getestete KonfigurationNutzbare VideosKosten pro ClipAusgabenunterschied
Referenz (Seedance 2.5)78 %1,80 Dollar—
Qualitäts-Router77 %1,28 Dollar-29 %
Qualität mit 1-Dollar-Limit74 %0,61 Dollar-66 %
Kosten-Router38 %0,30 Dollar-83 %

Laut Runway erreicht die Konfiguration mit Kostenlimit 95 % der Referenzqualität; bei Dialog und Lippensynchronisation schneidet sie besser ab (96 % gegenüber 92 %), bei der Physik schlechter (52 % gegenüber 60 %). Runway empfiehlt sie für die Produktion und sieht den Kostenmodus für die Erkundung vor; 64 % der Entwickler, die den Router bereits nutzen, haben ihn auf Kosten eingestellt.

🔗 Bewertung von Kosten und Qualität mit Runway Model Router

AI video co-director von Google Research

24. September — Google Research stellt AI video co-director vor, eine Multi-Agenten-Orchestrierung auf Basis von Gemini und Veo, die über mehrere Minuten hinweg zusammenhängende Erzählvideos erzeugen soll. Bisher fällt es Diffusionsmodellen schwer, Einstellungen aneinanderzureihen, ohne dass Kostüme und Kulissen sich verändern. Das System besteht aus vier Forschungsansätzen: einem Bandit-Algorithmus, der kreative Strategie, Erzählmodus und Ästhetik auswählt, bevor ein multimodaler Judge das Ergebnis bewertet; CANVAS, das eine visuelle Erinnerung an Figuren, Orte und Gegenstände führt; A²RD, das Abschnitt für Abschnitt generiert und einen durchgehenden zehnminütigen Film erzeugt hat; und VQQA, das den Prompt anhand der Kritik eines Vision-Language-Modells überarbeitet. Auf GenAD-Bench, einem der drei vom Team entwickelten Benchmarks mit 400 Werbeszenarien, erreicht das System einen maximalen Qualitätswert von 81,4. Es handelt sich um Forschung; weder ein Produkt noch ein Verfügbarkeitstermin wurden angekündigt.

🔗 Automatisierung der Erzeugung zusammenhängender Langformvideos

MiniMax-H3 auf AMD MI355X durch Nunchux

24. September — Von MiniMax verbreitete Ergebnisse, die Nunchux AI am 23. September veröffentlichte, zeigen MiniMax-H3, das Videomodell von MiniMax mit offenen Gewichten, auf einem Server mit acht AMD MI355X GPUs: Ein fünfsekündiges Video wurde in 1,33 Sekunden erzeugt, ein 15-sekündiges in 5,39 Sekunden, jeweils mit 1344×768. Gegenüber SGLang auf derselben Hardware, ausgeführt in BF16 mit 50 Euler-Schritten, beträgt die Beschleunigung das 21,8- bis 26,7-Fache. Die Zeiten umfassen Textkodierung, Entrauschung sowie Video- und Audiodekodierung, aber nicht die abschließende MP4-Kodierung. Nunchux führt die Beschleunigung auf seinen Modelloptimierer und seine Inferenz-Engine mit einem eigenen MXFP6-Kernel zurück. Die Geschwindigkeit erlaubt es, den Prompt während der Wiedergabe zu ändern. Ein kostenloser Zugang wird für „sehr bald“ angekündigt, zunächst über eine Warteliste; die Messwerte stammen von Nunchux.

🔗 Videogenerierung auf AMD MI355X · Beitrag von @MiniMax_AI


Coding-Agenten: Claude Code, Delta, Devin, Qwen Code und Kimi Code

Fünf Coding-Agenten veröffentlichen neue Versionen: Claude Code von Anthropic, Delta von Zed, Devin von Cognition, Qwen Code von Alibaba und Kimi Code von Moonshot AI.

Claude Code 2.1.282

24. September — Claude Code 2.1.282, veröffentlicht um 18:38 Uhr UTC, enthält 86 Einträge, darunter 59 Fehlerbehebungen. Die Einstellung maxProseWidth begrenzt die Breite von Claudes Text in breiten Terminals; Tabellen und Codeblöcke nutzen weiterhin die volle Breite. Mehrere Änderungen schränken ein, was ein Projekt vorgeben kann: Projekt- und lokale Einstellungen ignorieren OpenTelemetry-Variablen, die den Export aktivieren oder Inhalte erfassen (CLAUDE_CODE_ENABLE_TELEMETRY, OTEL_LOG_*). Darauf weisen ein Hinweis beim Start, /status und claude doctor hin. Die Namespaces anthropic-skills und claude-ai sind für Skills reserviert, die von claude.ai synchronisiert werden, und die verwaltete Einstellung allowClaudeInChromeWithManagedMcp erlaubt es, claude --chrome neben einem exklusiven managed-mcp.json auszuführen. Der Auto-Modus nutzt bei einer direkten API-Verbindung standardmäßig den serverseitigen Klassifikator, selbst wenn die Telemetrie deaktiviert ist. Fehlerbehebungen verhindern außerdem, dass erweitertes Denken (extended thinking) beim Fortsetzen einer Sitzung verloren geht.

🔗 Versionshinweise zu Claude Code 2.1.282

Delta 0.17 von Zed

23. September — Zed veröffentlicht Version 0.17.0 von Delta, seiner Mehrbenutzerumgebung für das Programmieren mit Agenten, die seit dem 16. September als öffentliche Beta verfügbar ist: mit 20 neuen Funktionen, 26 Verbesserungen und 59 Fehlerbehebungen. Aus einem Thread heraus lässt sich der Agent nun mit mehreren Aufgaben beauftragen. Jede läuft in einem eigenen Thread auf oberster Ebene mit isoliertem Arbeitsbereich, sodass sie parallel bearbeitet werden können; Agenten können sich auch über Threads hinweg Nachrichten schreiben. Die Befehle /approve und /request-changes geben in jedem Thread ein Review-Urteil ab. Die Version bringt außerdem die beiden am 22. September angekündigten Funktionen: Farben für Threads, die Unter-Threads und Unteragenten übernehmen, sowie eine Fortschrittsanzeige bis zur automatischen Komaktierung im Kontextbereich, die die Anteile von Anweisungen, Nachrichten, Denkprozess und Tools aufschlüsselt.

🔗 Versionshinweise zu Delta · Ankündigung von @zeddotdev

Devin Review: kombinierbare Auslöser und Perforce

23. September — Die Versionshinweise zu Devin vom 23. September widmen sich in 26 Abschnitten besonders Devin Review, dem Tool zur Prüfung von Pull Requests. Automatische Reviews beruhen nun auf kombinierbaren Auslösern: Zunächst wird ein Konto, eine Organisation, ein Repository, ein Repository-Präfix oder ein Mitglied ausgewählt. Anschließend lassen sich Bedingungen für Autor, Label, Branches, geänderte Dateien, Autorentyp (Mensch, Bot oder Devin) oder Diff-Größe kombinieren. Jeder Auslöser legt den Zeitpunkt des Reviews fest; Ausschlüsse haben stets Vorrang. Devin Review unterstützt jetzt auch Perforce: Ein Helix Swarm Review kann es über eine Testdefinition oder, ab Swarm 2026.3, über einen ausgehenden Webhook auslösen. Die Modellauswahl nach Leistungsstufe nennt nun die Modelle beim Namen (Ultra: Fable 5.1 und GPT-6 Astra), und die GitHub-App von Devin fordert sechs neue Berechtigungen an, die Administratoren genehmigen müssen.

🔗 Devin-Versionshinweise vom 23. September

Qwen Code v0.24.5

24. September — Qwen Code v0.24.5, eine stabile Version ohne angekündigte inkompatible Änderungen, enthält 87 Einträge, darunter 28 Funktionen und 38 Fehlerbehebungen. Qwen Live, die Echtzeit-Sprachunterhaltung des Agenten, läuft nun auf allen Plattformen über die Web Shell im Browser; unter macOS ist der native Host optional (QWEN_SERVE_LIVE_NATIVE_HOST=1). Während eines Anrufs kann der Nutzer seinen Bildschirm teilen. Dabei wird höchstens ein Bild pro Sekunde übertragen, und die Bildschirmfreigabe allein löst keine Antwort aus. Die Web Shell erhält eine Zeitleiste des Ausführungsverlaufs mit drei Spuren (Hauptsitzung, Tool-Aufrufe, Unteragenten), und Nachrichtenkanäle leiten Nachrichten anhand ihres Präfixes an getrennte Sitzungen weiter (messageRoutes). Beim Datenschutz respektiert der Modus --bare endlich die Ablehnung der Erfassung von Nutzungsstatistiken. Qwen Code Desktop v0.24.5 und das TypeScript SDK v0.1.15 folgten am selben Tag.

🔗 Versionshinweise zu Qwen Code v0.24.5

Kimi Code 2.1.1 nimmt die Sicherheitsverschärfungen von 2.1.0 zurück

24. September — Weniger als 19 Stunden nach Version 2.1.0, die am 23. September als Sicherheitsverschärfung vorgestellt wurde, nimmt Kimi Code 2.1.1 diese Änderungen zurück. Die Versionshinweise sprechen davon, „einige übermäßig restriktive Änderungen“ zu entfernen. Pull Request #4013 ist deutlicher: Er macht die verschärfte Vertrauensgrenze des Arbeitsbereichs rückgängig, mit der Begründung, dass nach der Freigabe eines Repositorys durch den Nutzer dessen Inhalt in seiner Verantwortung liege. Die vier betroffenen Schutzmaßnahmen entfallen: Datei-Tools folgen wieder symbolischen Links aus dem Arbeitsverzeichnis heraus, die lokale Konfiguration (local.toml) gilt ohne vorherige Freigabe, die Git-Konfiguration des Repositorys wird bei Hintergrundoperationen nicht mehr eingeschränkt, und das Home-Verzeichnis oder das Wurzelverzeichnis werden als zusätzliche Verzeichnisse nicht mehr abgelehnt. Wenn das Lesen der Vertrauensinformationen fehlschlägt, gilt der Arbeitsbereich weiterhin als „nicht freigegeben“. Die in 2.1.0 deaktivierten Datei-Watcher sind standardmäßig wieder aktiv.

🔗 Versionshinweise


Desktop-Agenten: Portable Computer von Perplexity und Kimi Work 3.2.14

Zwei Desktop-Agenten, die auf dem Computer des Nutzers arbeiten, werden am 24. September weiterentwickelt: Perplexity bringt Portable Computer auf PCs mit AMD-Prozessoren, und Moonshot AI veröffentlicht Kimi Work 3.2.14.

Portable Computer auf AMD Ryzen AI Max

24. September — Portable Computer, die vollständig lokale Version des Agenten Computer von Perplexity, läuft nun auf Windows-PCs mit Prozessoren der AMD Ryzen AI Max Series, darunter die Entwicklungsplattform Ryzen AI Halo. Bisher nannten die veröffentlichten Voraussetzungen nur NVIDIA-Hardware, von DGX Spark bis zu PCs mit RTX GPU. Erforderlich sind mindestens 24 GB für die GPU zugänglicher Speicher, Windows 10 oder 11 und ungefähr 20 GB Festplattenspeicher. Für diese Geräte werden zwei lokale Modelle angeboten: PPLX 27B, das von Perplexity nachtrainiert wurde, und Qwen 27B. Die Produktseite bietet für RTX-PCs dagegen nur PPLX 27B an. Ein lokaler Klassifikator erkennt Namen, Kontonummern und Kennungen, bevor Daten den PC verlassen, und die lokale Inferenz verbraucht keine Computer-Guthaben. Das Angebot steht Pro- und Max-Abonnenten offen, sowohl Einzelpersonen als auch Unternehmen.

🔗 Portable Computer kommt auf Agenten-PCs mit AMD-Prozessoren

Kimi Work 3.2.14: Nebenchats und Versionsverlauf

24. September — Zwei Tage nach 3.2.12 veröffentlicht Moonshot AI ohne begleitenden Tweet Kimi Work 3.2.14, die nächste Version seines Desktop-Agenten. Die wichtigste Neuerung ist der Nebenchat (Side Chat): Über das „+“-Menü lässt sich innerhalb einer Sitzung eine eigenständige Unterhaltung öffnen, die den Kontext der ursprünglichen Unterhaltung übernimmt. Auch ein ausgewählter Abschnitt der Unterhaltung kann zitiert werden. Office-Dateien erhalten einen Versionsverlauf, und im Browser lassen sich Webseiten mit Anmerkungen versehen, die anschließend im Eingabefeld zitiert werden können. Mit der Fernsteuerung (Remote Control) können Nutzer nun Dateien in der Vorschau ansehen und Anhänge vom Smartphone senden. Die Wachhaltefunktion (Keep Awake) wird nur noch auf Anfrage aktiviert.

🔗 Versionshinweise zu Kimi Work


Offene Modelle und Forschungslabore: Tev1, LFM2.5-VL-DSpark, LeRobot und Sakana AI

Aus dem offenen Ökosystem kommen ein kleines Entscheidungsmodell, ein Entwurfsmodell zur Beschleunigung eines Vision-Language-Modells, ein neues Datenformat für die Robotik und die Nachricht, dass Jürgen Schmidhuber zu Sakana AI stößt.

Tev1-4B-experimental von Together AI

23. September — Together AI veröffentlicht Tev1-4B-experimental, ein kleines Entscheidungsmodell: Es erhält eine Situation, eine Frage und eine Liste mit 2 bis 24 Optionen und antwortet mit dem Buchstaben der gewählten Option. Es ist eine von Jev inspirierte Feinabstimmung von Qwen3.5-4B. Jev ist ein Entscheidungsmodell, das in Beiträgen der Hugging Face Community häufig erwähnt wird. Die Modellkarte stellt klar, dass es sich nicht um eine Jev-Engine handelt: Das Modell behält den standardmäßigen Sprachkopf von Qwen. Together hebt die Kosten hervor: 17 Dollar für das Training, samt Datenrezept und Tutorial. Das Modell wird für 0,042 Dollar pro Million Eingabe-Tokens und 0 Dollar für Ausgabe-Tokens angeboten. Auf seinem wichtigsten Entwicklungsdatensatz trifft es 880 von 1.000 Entscheidungen richtig; die Modellkarte unterscheidet dieses Ergebnis ausdrücklich von einem unabhängigen Benchmark. Die Lizenz für die feinabgestimmten Gewichte „wird noch finalisiert“.

🔗 Ankündigung von Together AI · Modellkarte

LFM2.5-VL-DSpark von Liquid AI

24. September — Liquid AI erweitert seine Technik für spekulatives Decoding namens DSpark auf das Vision-Language-Modell LFM2.5-VL-3B. Entwurfsmodelle für Text hatte das Unternehmen am 20. August vorgestellt. Ein Entwurfsmodell mit 279,5 Millionen Parametern (+8,9 %) schlägt mehrere Tokens im Voraus vor, die das Zielmodell überprüft, ohne die endgültige Antwort bei Greedy Decoding zu verändern. Auf einem Mac M5 Max mit MLX läuft das Decoding 2,30- bis 3,13-mal schneller, während sich die Ende-zu-Ende-Latenz um den Faktor 1,56 bis 2,62 verbessert; auf einer H100 ist das Decoding bis zu 2,66-mal schneller. Der tatsächliche Gewinn bleibt durch die Bildkodierung begrenzt, die diese Technik nicht beschleunigt. Das Entwurfsmodell wird vom ersten Tag an von llama.cpp, MLX-VLM und SGLang unterstützt.

🔗 Beschleunigung von Vision-Language-Modellen mit LFM2.5-VL-DSpark

LeRobot und LanceDB

24. September — LeRobot, die Bibliothek von Hugging Face für robotisches Lernen, liest Datensätze im Lance-Format nun nativ und nutzt dabei dieselben Trainings-APIs. Dadurch kann direkt vom Hub oder aus einem Objektspeicher trainiert werden, ohne Hunderte Gigabyte herunterzuladen, und Daten lassen sich über den gesamten Datensatz hinweg mischen. Auf DROID (27,6 Millionen Frames, 369 GB Video) dauerten 10.000 SmolVLA-Schritte auf 8 H100 aus einem entfernten Speicher 1 Stunde und 27 Minuten. Mit dem Standard-Reader auf einer lokalen NVMe-Kopie waren es 2 Stunden, zuzüglich eines vorherigen Downloads von 384 GB. Der abschließende Loss ist gleich: Der Unterschied liegt in der Wartezeit auf Daten, 1,7 % gegenüber 37,4 %. Bei einem kleinen Datensatz liegen beide Ansätze gleichauf.

🔗 So trainieren Sie Ihren Roboter: die LanceDB-Edition

Jürgen Schmidhuber bei Sakana AI

24. September — Sakana AI gibt bekannt, dass Jürgen Schmidhuber als wissenschaftlicher Chefberater (Chief Scientific Advisor) zum Unternehmen stößt. Er wird diese Rolle zusätzlich zu seinen bisherigen Aufgaben übernehmen. Schmidhuber ist für seine Arbeiten zu Weltmodellen, Meta-Lernen und der Gödel-Maschine bekannt. Er wird sich am RSI Lab des Tokioter Start-ups beteiligen, das sich mit rekursiver Selbstverbesserung beschäftigt, und regelmäßig nach Tokio reisen. Laut Sakana haben seine Arbeiten, darunter seine Dissertation von 1987 über rekursive Selbstverbesserung, die Darwin Gödel Machine und The AI Scientist unmittelbar inspiriert. Die Ankündigung zeigt auch eine neue Richtung: Sakana arbeitet an seinen ersten „agentennativen“ Weltmodellen, die die physischen Folgen einer Handlung simulieren können, bevor sie ausgeführt wird. Dabei hat das Unternehmen die japanische Fertigungsindustrie im Blick.

🔗 Jürgen Schmidhuber kommt zu Sakana AI


Kurzmeldungen

  • Claude Tag und persönliche Konnektoren — In einem Slack-Kanal kann Claude Tag jetzt die persönlichen Konnektoren der Person nutzen, die es aufruft (Kalender, Drive, CRM), und ausschließlich deren Konnektoren. Jede Antwort kann überprüft werden; alternativ gibt es einen Automatikmodus. Für geplante Routinen werden die Konnektoren nie verwendet. Die Einführung auf Team läuft, Enterprise folgt. 🔗 Quelle
  • Sora 2 verlässt die API — Wie am 24. März angekündigt, wurden die Sora-2-Modelle und die Videos API am 24. September eingestellt, ohne gleichwertige Ersatz-API. Fünf Kennungen werden entfernt, von sora-2 und sora-2-pro bis zu ihren datierten Snapshots. Die Einstellung ist bislang nur in der Dokumentation festgehalten. 🔗 Quelle
  • ChatGPT Ads in Südostasien — Das Werbeangebot von ChatGPT startet in Indonesien, Malaysia, auf den Philippinen, in Singapur, Thailand, Vietnam und Taiwan und deckt damit mehr als 60 Länder ab, gegenüber mehr als 40 Ende August. Werbung erscheint nur in den Tarifen Free und Go. 🔗 Quelle
  • Grab und OpenAI — Das Programm GO Forward with AI soll innerhalb von zwei Jahren 30 000 Fahrer, Lieferkräfte und Händler aus dem Partnernetzwerk von Grab schulen. Den Anfang macht Singapur mit Workshops auf Grundlage von OpenAI Academy und ChatGPT Work. 🔗 Quelle
  • Drei Fallstudien bei OpenAI — Ringg bearbeitet mehr als 7 Millionen erfolgreich abgeschlossene Anrufe pro Monat und hat die Modellkosten für Workloads, die von GPT-4.1 auf GPT-5.6 Luna umgestellt wurden, um rund 90 % gesenkt. invideo gibt an, seine Erfolgsquote beim Grading mit GPT-6 Astra etwa verdreifacht zu haben. Harvey berichtet ohne Zahlen. 🔗 Quelle
  • ChatGPT für iOS 1.2026.258 — Der Eintrag vom 23. September im Changelog von ChatGPT & Codex beschreibt einen überarbeiteten Startbildschirm, eine geteilte Ansicht auf dem iPad, die die Aufgabenliste neben der geöffneten Aufgabe zeigt, sowie Korrekturen für fehlgeschlagene SSH-Kopplungen auf Mac und Linux. 🔗 Quelle
  • Gemini CLI v0.61.0 — Gemini 3.8 Flash und Gemini 3.5 Flash Lite, die bereits in der Nightly-Version enthalten waren, kommen per Cherry-Pick in die stabile Version, ohne dass die offiziellen Versionshinweise dies erwähnen. v0.62.0-preview.0 eröffnet den nächsten Preview-Kanal. 🔗 Quelle
  • Gemini in Chrome — Auf dem Computer erstellt Gemini in Chrome interaktive Quizze aus dem geöffneten Tab, zunächst auf Englisch in den USA und Indien. Außerdem analysiert es nun fast alle vollständig abgespielten Podcasts oder Videodateien, über YouTube hinaus. 🔗 Quelle
  • Google Photos — Die virtuelle Garderobe, die Kleidung auf Fotos katalogisiert, um Outfits anzuprobieren, steht berechtigten Nutzern in den USA, Indien und Brasilien offen. Dazu kommen die Retro-Stile Moods und 15 neue Remix-Vorlagen. 🔗 Quelle
  • API Gateway als MCP-Server — In der öffentlichen Vorschau wandelt Google Cloud API Gateway die Operationen einer REST-API anhand ihrer annotierten OpenAPI-3.x-Spezifikation in MCP-Tools um. Authentifizierung, Kontingente und Protokolle werden weiterverwendet; pro Gateway sind bis zu 1 000 Tools möglich. 🔗 Quelle
  • PostgreSQL for agents in AlloyDB — In der Vorschau erstellt AlloyDB binnen Sekunden isolierte, schreibgeschützte Instanzen mit einem Datenstand, der höchstens eine Sekunde zurückliegt. Sie sollen Anfragewellen von Agenten auffangen. Google nennt mehr als 3 Millionen Anfragen pro Sekunde. 🔗 Quelle
  • OLMo 3 7B auf TPU reproduziert — Das TPU-Team von Google Cloud hat das Vortraining von Ai2s OLMo 3 7B in MaxText reproduziert, mit etwa 5,9 Billionen Tokens. Das Modell ist auf acht Benchmarks vom Original nicht zu unterscheiden und erreicht auf Ironwood eine FLOPs-Auslastung von 44,5 %. Zuvor hatte das Team einen Fehler im Datenlader aufgespürt. 🔗 Quelle
  • The Talking Museum — Das Google Arts & Culture Lab eröffnet einen virtuellen Studienraum mit mehr als 190 Kulturobjekten in 3D. Während man sie dreht, erläutert Gemini ihre Geschichte und beantwortet Fragen. 🔗 Quelle
  • DeepSeek Harness 0.1.7-rc.2 — Der zweite Release Candidate innerhalb von zwei Tagen ist die 22. Vorabversion ohne stabile Version. Aufgaben laufen im Hintergrund weiter, nachdem das Desktop-Fenster geschlossen wurde, und geplante Aufgaben überstehen einen Neustart. Sie können bis zu einmal pro Minute wiederholt werden. 🔗 Quelle
  • Ein Anfragen-Router auf Jetson — Im Blog von Hugging Face ersetzt Eric Mey ein 9B-Modell durch ein feinabgestimmtes ModernBERT-large, das den Antworttyp auswählt: 180 von 180 Anfragen werden richtig geroutet, gegenüber 175, und das in 42 ms statt 771 ms, allerdings auf unterschiedlicher Hardware. Modell, Daten und Code stehen unter Apache-2.0. 🔗 Quelle
  • Genomischer Carbon-Korpus angereichert — Parag Ekbote veröffentlicht eine CPU-Pipeline ohne das Carbon-Modell, die 32,4 Millionen Einträge im Vortrainingskorpus von HuggingFaceBio um Länge, GC-Gehalt, Kodierungsstatus und Taxonomie ergänzt. 🔗 Quelle
  • ZCode v3.14.3 — Dies ist das einzige GitHub-Release von ZCode, dem Harness von Z.ai, seit der Code am 21. September veröffentlicht wurde. Die Parallelität eines laufenden Workflows lässt sich ändern, ohne ihn anzuhalten, und Workflow-Skripte verbrauchen weniger Tokens. 🔗 Quelle
  • Python-SDK von xAI 1.20.0 — Für grok-imagine-video-1.5 legt last_frame_url das letzte Bild des Clips fest, und keyframes platziert bis zu vier Keyframes innerhalb des Clips. Diese Optionen waren bereits in der API-Dokumentation beschrieben. 🔗 Quelle
  • Copilot code review — Die Seite mit persönlichen Einstellungen für die Code-Review steht nun allen Copilot-Tarifen offen, einschließlich Business und Enterprise. Automatische Reviews werden auf neue Pushes und Entwürfe ausgeweitet; Unternehmen können einen Standardaufwand für Reviews festlegen. Wie Ende August angekündigt, stellt GitHub den Standard am 28. September von Lite auf Balanced um. 🔗 Quelle
  • Präsenznachweis auf GitHub Enterprise Cloud — In der öffentlichen Vorschau können Aktionen mit großer Tragweite, etwa das Erstellen eines Tokens oder Webhooks und Änderungen an Sicherheitseinstellungen, eine erneute Authentifizierung oder MFA beim Identitätsanbieter erfordern. Der Nachweis gilt zwei Stunden; die Funktion ist Unternehmen mit EMU und GHEC-DR sowie Microsoft Entra ID vorbehalten. 🔗 Quelle
  • Ende von Node 20 in GitHub Actions — Runner führen JavaScript-Aktionen jetzt mit Node 24 aus, die Rückfalloption entfällt, und selbst gehostete Runner unter macOS 13.4 oder älter sowie auf ARM32 werden nicht mehr unterstützt. 🔗 Quelle
  • Die Canvases der Copilot-App — Burke Holland plädiert für diese kleinen Full-Stack-Anwendungen, die mit dem Agenten interagieren, statt alles über einen Chat abzuwickeln, und verweist auf Token-Einsparungen. Es gibt keine neue Funktion; die Canvases existieren seit Juni. 🔗 Quelle
  • Amp teilt seine Runner — Ein mit --share gestarteter Runner kann über ampcode.com für den gesamten Workspace freigegeben werden. Amp weist darauf hin, dass andere Mitglieder dann Code unter der Identität des Hosts ausführen; Administratoren können die Freigabe abschalten. 🔗 Quelle
  • Modellauswahl von v0 — Nachtrag vom 22. September: Die neue Auswahl zeigt die Modelle von AI Gateway samt Preis pro Token und kommt auch in Enterprise-Teams. Dort muss der Eigentümer Allow custom models aktivieren. 🔗 Quelle
  • MoE-Rezept von BioNeMo — NVIDIA beschreibt das Training biologischer Mixture-of-Experts-Modelle mit BioNeMo und Transformer Engine: auf Mixtral-8x7B und acht B200 bis zum 2,21-Fachen des Durchsatzes der Hugging-Face-Referenz. Der fusionierte Kernel ist Blackwell vorbehalten. 🔗 Quelle
  • Draft-Modus von Seedance 2.5 in Runway — Schnellere Entwürfe mit geringerem Credit-Verbrauch dienen zum Ausprobieren, bevor die besten in voller Qualität erstellt werden. Runway nennt keine Credit-Zahlen; derselbe Modus war am 22. bereits bei Pika eingeführt worden. 🔗 Quelle
  • Runway MCP im Cursor Marketplace — Der MCP-Server von Runway lässt sich seit dem 23. September aus dem Cursor Marketplace installieren. Seit dem 22. können Agenten Brand Kits mit Lesezugriff einsehen. 🔗 Quelle
  • Pika API Club — Pika beziffert die Einsparungen seiner Mitglieder gegenüber Fal.ai: Vuvie zahlte für 3 822 Generierungen mit Seedance 2.5 in 30 Tagen 12 185,80 Dollar weniger; bei AI-Bridge sank die Monatsrechnung von etwa 2 000 auf 990 Dollar. 🔗 Quelle
  • HeyGen-Studie zu Avataren — Unter 1 000 kleinen Unternehmen haben 71,6 % bereits ein Video aufgenommen, das nie veröffentlicht wurde. Von den Nutzern von Avataren sagen 71,1 %, dass sie Zeit sparen, und 55,3 % veröffentlichen häufiger. 🔗 Quelle
  • Luma-Umfrage — Nachtrag vom 22. September: Von 760 Kreativschaffenden haben 81 % bereits mit KI erstellte Inhalte veröffentlicht. Bei keiner einzelnen Aufgabe liegt die Nutzung jedoch über 42 %, und 62 % befürchten, zulasten menschlicher Kreativität von KI abhängig zu werden. 🔗 Quelle
  • Perplexity-Leitfaden für Marktforschung — Ein Leitfaden in acht Schritten mit Prompt-Beispielen, Prüfschritten und einer Checkliste mit fünf Punkten. Er enthält keine neue Funktion und verweist auf Deep Research und Spaces. 🔗 Quelle

Was das bedeutet

Der Agent verlässt das Chatfenster. Muse spricht mit einer Stimme, die man selbst beschreibt, erscheint als Avatar, steuert einen Mac und soll auf eine Brille kommen und dann, laut Mark Zuckerberg, im Dezember auf ein Gerät im Taschenformat. Google gibt Gemini 3.8 Live ebenfalls ein animiertes Gesicht für Empfang und Kundenservice, Perplexity bringt seinen lokalen Agenten auf PCs mit AMD-Prozessor, und Claude Code arbeitet in der Cloud weiter, nachdem der Laptop geschlossen wurde. Der Zeitplan ist uneinheitlich: Die Computersteuerung auf dem Mac und Live Avatar sind verfügbar, während Muse auf der Brille „in den kommenden Monaten“ kommen soll und für seine E-Mail-Adresse kein Termin genannt wird.

Die Kosten von Agenten werden zum Argument mit konkreten Zahlen. Anthropic bietet 100 oder 250 Dollar Guthaben für Cloud-Sitzungen und zeigt anhand von Nutzungsdaten, dass das Lesen aus dem Cache inzwischen den größten Anteil in Claude Code ausmacht. Dort ist das Verhältnis von Eingabe zu Ausgabe von 189:1 auf 324:1 gestiegen. Perplexity berechnet für Fast Search 1 statt 5 Dollar pro 1 000 Anfragen und beziffert die Ersparnis bei agentischen Aufgaben auf rund 68 % bei vergleichbarem Ergebnis. Runway erhält 74 % brauchbare Videos bei 66 % geringeren Ausgaben; Together AI trainiert ein Entscheidungsmodell für 17 Dollar. Jeder ermittelt seine Einsparungen nach einem eigenen Verfahren: Die Zahlen sind nützlich, aber selten direkt vergleichbar.

Über Vertrauen wird von Fall zu Fall entschieden, mitunter in entgegengesetzter Richtung. Anthropic berechnet bestimmte Ablehnungen wieder, um „koordinierte Angriffe“ einzudämmen, und strebt dabei weniger als 0,1 % falsche Ablehnungen an. Claude Code 2.1.282 verhindert, dass ein Projekt seine Telemetrie vorschreibt. Kimi Code 2.1.1 dagegen entfernt weniger als 19 Stunden nach ihrer Einführung die Schutzmaßnahmen aus Version 2.1.0, mit der Begründung, dass ein genehmigtes Repository in die Verantwortung des Nutzers falle. GitHub erprobt einen Präsenznachweis vor sensiblen Aktionen. Im Verteidigungsbereich öffnet OpenAI Daybreak für die Ukraine, und das GitHub Security Lab überlässt Fuzzing einem Agenten, weist aber darauf hin, dass dieser Fehler macht und in einer entbehrlichen Umgebung laufen muss.

Schließlich werden Regeln und Infrastruktur im großen Maßstab verhandelt. Bei den UN fordert Sam Altman internationale Standards für leistungsfähige KI. OpenAI will, dass die USA diese gemeinsam mit dem Netzwerk der Institute für KI-Sicherheit vorantreiben, ohne Lizenzpflicht oder verpflichtende Prüfung vor der Veröffentlichung. Google will seine ersten TPUs in die Umlaufbahn schicken, um Datenverarbeitung im All zu erproben. Perplexity hat die Engine, die alle seine Suchanfragen bedient, in Rust neu geschrieben und die p99-Latenz von etwa 800 auf 65 ms gesenkt. Zwischen Staaten ausgehandelte Standards, Chips im Orbit, eine neu geschriebene Engine: Die Grundlage für den Betrieb dieser Agenten entsteht zur selben Zeit wie die Agenten selbst.


Quellen