Suchen

Claude Dashboards und Claude Motion, Cyber Mission und OSS Scanner, GPT-6.1 Sol mit Ultrafast

ai-powered-markdown-translator

Artikel mit gpt-6.1-sol aus dem Französischen ins Deutsche übersetzt.

Projekt auf GitHub ansehen ↗

Anthropic ergänzt Claude um zwei Funktionen: Claude Dashboards für laufend aktualisierte Dashboards und Claude Motion für in Code geschriebene Animationen. Außerdem verlassen Docs, Slides und Design die Beta und werden in allen Tarifen verfügbar, einschließlich Free. Am selben Tag startet das Unternehmen seine Cyber Mission mit einem Programm zum Schutz kritischer Infrastrukturen und OSS Scanner, der Open-Source-Projekten kostenlose Scans durch seine leistungsfähigsten Modelle bietet. OpenAI führt seinerseits die Leistungsstufe Ultrafast für GPT-6.1 Sol ein, die bis zu 8-mal schneller als der Standard-Modus ist, während Anthropic und NVIDIA sich mit 150 Millionen beziehungsweise 1 Milliarde Dollar an der Genesis Mission beteiligen.


Claude Dashboards und Claude Motion in der Beta, Docs, Slides und Design in allen Tarifen

8. Oktober — Anthropic ergänzt Claude um zwei Funktionen. Mit Claude Dashboards, das in kostenpflichtigen Tarifen als Beta verfügbar ist, verbindet man eine Datenplattform des Unternehmens (Amazon Redshift, BigQuery, ClickHouse, Databricks oder Snowflake) oder einen anderen Connector, etwa für Salesforce-Verkaufschancen, und stellt anschließend eine Frage in natürlicher Sprache: Claude schreibt die Abfrage, erstellt das Dashboard und hält es aktuell, wenn sich die Daten ändern. Ein Klick auf eine Zahl zeigt die Abfrage an, die sie liefert, und jedes Diagramm gibt an, wann seine Daten aktualisiert wurden. Anthropic sieht die Funktion für schnelle, explorative Fragen vor; für weitergehende Analysen lässt sich das Dashboard an Amplitude, Grafana, Hex, Mixpanel, Omni, Perplexity, PostHog oder Sigma übergeben. Looker, monday.com und Tableau sollen folgen.

Claude Motion, als Beta in Team und Enterprise verfügbar, ist für kurze Animationen gedacht: ein 30 Sekunden langes Erklärvideo aus einem Quartalsbericht, ein animiertes Diagramm in einer Präsentation oder eine Produktdemonstration. Da kein Modell zur Videogenerierung zum Einsatz kommt, enthält die Animation weder KI-generierte Sequenzen noch KI-generierte Personen.

Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.

🇩🇪 Claude Motion verwandelt Berichte, Diagramme oder Produktdemonstrationen in kurze Animationen. Claude schreibt jede davon in Code, ganz ohne Videomodell, sodass Sie jedes Wort, jede Zahl oder jedes Timing ändern und anschließend ein MP4 exportieren können. In der Beta für die Tarife Team und Enterprise. — @claudeai auf X

Am selben Tag verlieren Claude Docs, Slides und Design die Beta-Kennzeichnung und werden in allen Tarifen verfügbar, einschließlich Free. Laut Anthropic wurden seit ihrer Einführung in den Unterhaltungen am 16. September mehr als 45 Millionen Dokumente, Präsentationen und Designs erstellt. Mit dem Ende der Beta kommen CMEK-Unterstützung für Artefakte, die Auswahl von Artefaktvorlagen durch Administratoren, gemeinsames Bearbeiten mit Claude, die Freigabe außerhalb der Organisation mit Zustimmung des Administrators, PowerPoint- und PDF-Exporte, die der Darstellung im Editor entsprechen, die direkte Übertragung an Google Slides und die Bearbeitung über die mobile App hinzu.

Betroffene FunktionStatus am 8. OktoberBetroffene Tarife
Claude DashboardsBetaKostenpflichtige Tarife
Claude MotionBetaTeam und Enterprise
Claude Docs, Slides und DesignBeta beendetAlle, einschließlich Free
claude.ai/design (eigenständige Website)Bis zum 14. Dezember geöffnet—

Praktische Folge: Die eigenständige Website claude.ai/design, die inzwischen in Claude integriert ist, bleibt bis zum 14. Dezember geöffnet. Die design systems einer Organisation lassen sich in einem Schritt über die Seite Artifacts migrieren. Die Unterhaltungen und Kommentare der eigenständigen Website sowie ihre öffentlichen Links verschwinden jedoch mit deren Schließung. In Enterprise sind Dashboards und Motion standardmäßig deaktiviert, während Docs, Slides und Design am 15. Oktober standardmäßig aktiviert werden.

🔗 Claude-Blogbeitrag: Dashboards und Motion · Thread von @claudeai

Runway und Luma als Startpartner von Claude Motion

8. Oktober — Zwei Anbieter generativer Videos stellen sich als Startpartner von Claude Motion vor. Bei Runway lässt sich jede Animation exportieren, um generierte Sequenzen hinzuzufügen, Einstellungen durch eine Beschreibung der gewünschten Änderung zu überarbeiten und Runway Agent einen längeren Schnitt rund um die Animation zusammenstellen zu lassen; dieselbe Animation im Format 16:9 kann dort auch in eine vertikale und eine quadratische Variante umgewandelt werden. Bei Luma lassen sich Animationen direkt über den in Claude hinzugefügten Luma-Connector (MCP) öffnen: Die Videomodelle Ray und Uni gestalten sie unter Beibehaltung der Bewegung stilistisch neu, schneiden sie auf 9:16, 1:1, 4:3 oder 21:9 zu, und der Luma-Agent erstellt weitere Versionen davon. Weder Runway noch Luma nennen Preise oder Kosten in Credits. Anthropic nennt außerdem Adobe, Descript, HeyGen, Higgsfield und invideo als Werkzeuge, mit denen sich eine Animation weiterbearbeiten lässt; Canva und Captions sollen bald folgen.

🔗 Blogbeitrag von Runway · Blogbeitrag von Luma


Anthropic Cyber Mission: ein Programm für kritische Infrastrukturen und OSS Scanner für Open Source

8. Oktober — Zwei Tage nach der Erweiterung seines Cyber Verification Program startet Anthropic die Anthropic Cyber Mission, die als langfristiges Engagement zur Absicherung der Systeme vorgestellt wird, von denen alle abhängen. Die Ausgangserkenntnis stammt aus Project Glasswing: Schwachstellen zu finden war noch nie so einfach, doch sie zu überprüfen, zu priorisieren und zu beheben bleibt schwierig. Die Mission beginnt in zwei Bereichen, kritischen Infrastrukturen und Open-Source-Software; weitere Bereiche sind angekündigt, allerdings ohne Termin.

Für kritische Infrastrukturen stellt das Critical Infrastructure Defense Program (CIDP) Dienstleistern von Betreibern operativer Technologien die fortschrittlichsten Claude-Modelle, Ingenieure vor Ort und Anthropics Forschung zu Bedrohungen zur Verfügung. Gemeint sind Steuerungen, Steuerungssoftware und industrielle Netzwerke der Strom- und Wasserversorgung oder des Verkehrswesens, die sich häufig nicht abschalten lassen, um einen Patch einzuspielen. Elf Gründungspartner beteiligen sich: Accenture, Booz Allen, CrowdStrike, Deloitte, Dragos, Hitachi, Insane Cyber, Nozomi Networks, Palo Alto Networks, PwC und Rockwell Automation. Das Programm beginnt mit einer kleinen Gruppe und soll in den kommenden Monaten auf weitere Partner und Branchen ausgeweitet werden.

Für Open Source bietet OSS Scanner, inspiriert von Googles OSS-Fuzz, angemeldeten Projekten kostenlos regelmäßige Scans durch Anthropics leistungsfähigste Modelle, einschließlich Claude Mythos. Jeder Bericht enthält ein Beispiel zur Reproduktion, eine Erklärung und, sofern vorhanden, einen möglichen Patch, wird jedoch ohne menschliche Prüfung versandt: Anthropic erwartet einen Anteil tatsächlich positiver Befunde von über 90 % und weist darauf hin, dass einige Berichte Fehler enthalten werden, etwa einen falsch bewerteten Schweregrad. Der Dienst soll den vom Frontier Red Team beschriebenen Engpass beheben: Die Zahl der gefundenen Schwachstellen übersteigt bei Weitem das, was Menschen sichten und priorisieren können.

Von Anthropic veröffentlichte KennzahlVeröffentlichter Wert
In sechs Monaten gefundene potenzielle SchwachstellenMehr als 29 000
Von Hand überprüfte und priorisierte SchwachstellenEtwa 6 000
Bestätigte kritische oder schwerwiegende Schwachstellen (48 Projekte)97
Erfüllten die Anforderungen für eine koordinierte Offenlegung (CVD)85, also 88 %
Tatsächliche, aber doppelte Befunde oder ungültige Befunde11 und 1
Anteil der von LLM gefundenen Schwachstellen im CyberGym-BenchmarkWeniger als 20 % Anfang letzten Jahres, mehr als 85 % dieses Jahr

wolfSSL gibt an, dass von 74 erhaltenen Berichten alle bis auf zwei gültig waren und fünf zu CVE wurden. Die Anmeldung erfolgt über einen Pull Request im GitHub-Repository anthropics/oss-scanner und ist den Hauptmaintainern von Projekten vorbehalten, die im Einzelfall als kritisch eingestuft werden. Der im August gestartete Defender Advantage Fund sorgt dafür, dass der Dienst kostenlos bleibt. Anthropics Prognose ist vorsichtig: Innerhalb von zwei Jahren wird KI die Verteidigung begünstigen, kurzfristig jedoch nicht unbedingt, da das Ausnutzen von Schwachstellen günstiger wird, während Überprüfung, Offenlegung und Behebung weiterhin langsam bleiben.

🔗 Anthropic-Blogbeitrag: Anthropic Cyber Mission · Blogbeitrag des Frontier Red Team zu OSS Scanner · Repository anthropics/oss-scanner


Ultrafast für GPT-6.1 Sol: bis zu 8-mal schneller, für 12 und 60 Dollar pro Million tokens

8. Oktober — Die am 29. September als „bald verfügbar“ angekündigte Leistungsstufe Ultrafast kommt für GPT-6.1 Sol. OpenAI Developers gibt an, dass sie noch am selben Tag in der API, in Codex und in ChatGPT Work eingeführt wird, mit einer Intelligenz, die als nahe an GPT-6 Astra beschrieben wird. OpenAI sieht sie für Aufgaben vor, bei denen jede Sekunde zählt: eine Störung debuggen, Agenten durch Anwendungen navigieren lassen oder Live-Erlebnisse anbieten.

Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.

🇩🇪 Ultrafast wird heute für GPT-6.1 Sol in der API, in Codex und in ChatGPT Work eingeführt. Eine Intelligenz nahe an Astra, bis zu 8-mal schneller als Sol im Standard-Modus, um so schnell zu entwickeln, wie die Ideen kommen. — @OpenAIDevs auf X

In der API genügt es, gpt-6.1-sol mit service_tier: "ultrafast" in der Responses API aufzurufen. Der Modus steht allen API-Nutzern unter Berücksichtigung der Rate Limits zur Verfügung, mit globaler Verarbeitung und Datenresidenz in den Vereinigten Staaten und der Europäischen Union, während GPT-6 Astra mit Ultrafast weiterhin auf Datenresidenz in den USA beschränkt bleibt. Der Preis folgt der bereits für Astra geltenden Regel: das Sechsfache des Standard-Preises, also 12 Dollar pro Million Eingabe-tokens und 60 Dollar pro Million Ausgabe-tokens, ein Fünftel des Preises von GPT-6 Astra mit Ultrafast (60 und 300 Dollar).

Verarbeitungsmodus von gpt-6.1-solEingabepreisEingabe aus dem CacheSchreiben in den CacheAusgabepreis
Standard, kurzer Kontext2,00 Dollar0,10 Dollar2,50 Dollar10,00 Dollar
Fast, kurzer Kontext4,00 Dollar0,20 Dollar5,00 Dollar20,00 Dollar
Ultrafast, kurzer Kontext12,00 Dollar0,60 Dollar15,00 Dollar60,00 Dollar
Ultrafast, langer Kontext24,00 Dollar1,20 Dollar30,00 Dollar90,00 Dollar

Preise pro Million tokens laut der API-Seite Pricing am 8. Oktober.

In Codex und ChatGPT Work ist der Zugang dem Tarif Pro 500, berechtigten Enterprise-Workspaces mit nutzungsabhängiger Abrechnung und Edu-Angeboten mit Credits vorbehalten. In Enterprise ist Ultrafast standardmäßig deaktiviert, und die Eigentümer des Workspaces müssen es für bestimmte Nutzer oder für alle aktivieren. Die Codex-Dokumentation erläutert die Kosten: Das im Abonnement enthaltene Kontingent wird 8-mal schneller aufgebraucht als im Standard-Modus, und gekaufte Credits sowie die Enterprise-Nutzung auf Abruf werden zum sechsfachen Preis abgerechnet. Andere Self-Service-Tarife haben zum Start keinen Zugang, auch nicht mit gekauften Credits.

🔗 Changelog der OpenAI-API · Preise der OpenAI-API · Ultrafast in Codex (Dokumentation)


Wissenschaft: 150 Millionen Dollar von Anthropic und 1 Milliarde von NVIDIA für die Genesis Mission, eine Himmelskarte im Ultraviolett

Zwei Zusagen für die Genesis Mission, das US-Bundesprogramm zur Beschleunigung wissenschaftlicher Entdeckungen durch KI, wurden am 8. Oktober auf demselben Gipfel, „Science: A New Golden Age“, bekannt gegeben, den das Office of Science and Technology Policy (OSTP) des Weißen Hauses in Washington veranstaltete. Am selben Tag zeigt Anthropic, was Claude Science für einen Astrophysiker erstellen kann.

Anthropic: 150 Millionen Dollar über drei Jahre und Claude für mehr als 15 Bundesbehörden

8. Oktober — Anthropic sagt 150 Millionen Dollar über drei Jahre für die Genesis Mission zu. Die Finanzierung soll Claude für mehr als 15 an der Mission beteiligte Behörden zugänglich machen, darunter die NASA, die National Institutes of Health und die National Science Foundation. Konkret wird Anthropic Claude, Claude Code und API-Credits für mehrere Hundert Forschungsprojekte bereitstellen, mit den Behörden und nationalen Laboren an den Prioritäten der Regierung arbeiten, darunter Fusionsenergie und Quantencomputing, und Schulungen sowie technischen Support anbieten. Die Zusage setzt die im Dezember 2025 geschlossene Partnerschaft mit dem Energieministerium fort; im Juli hatten Google DeepMind (40 Millionen Dollar) und OpenAI (17 Millionen Dollar) ihre eigenen Zusagen für die Mission bekannt gegeben.

🔗 Anthropic-Blogbeitrag: Engagement für die Genesis Mission · Tweet von @AnthropicAI

NVIDIA: 1 Milliarde Dollar über fünf Jahre für die US-amerikanische Wissenschaft

8. Oktober — Auf derselben Veranstaltung kündigt NVIDIA Zusagen im Wert von 1 Milliarde Dollar über fünf Jahre an, um die Kapazitäten der Vereinigten Staaten für Forschung und Entwicklung zur Superintelligenz in Bereichen wie Quantencomputing, Gesundheit und Energiesicherheit auszubauen. Die Mitteilung nennt drei Bereiche, ohne den Betrag aufzuschlüsseln: die Unterstützung universitärer Forschungseinrichtungen, Investitionen zur Beschleunigung der US-amerikanischen Führungsrolle im Quantencomputing und die Unterstützung von Cloud-Anbietern, die Regierungsaufgaben bedienen. NVIDIA erklärt außerdem, an mehreren Projekten mitzuwirken, die in Phase 2 der Genesis Mission finanziert und am selben Tag bekannt gegeben wurden, in den Bereichen Quantencomputing, Fusion, Beschleunigerdesign und Mikroelektronik. Das Unternehmen verweist zudem auf seine Partnerschaft mit dem DOE, die den größten wissenschaftlichen Supercomputer des Ministeriums am Argonne National Laboratory umfasst.

🔗 Pressemitteilung von NVIDIA

Die erste vollständige Karte des Himmels im Ultraviolett, erstellt mit Claude Science

8. Oktober — Der Blog Anthropic Science berichtet, wie Brice Ménard, Astrophysiker an der Johns Hopkins University und Forscher bei Anthropic, mit Claude Science das erstellt hat, was Anthropic als erste vollständige Karte des Himmels im Ultraviolett bezeichnet. Die weltraumgestützte Durchmusterung GALEX (NASA, 2003-2013) deckte mit rund 38 000 Beobachtungen nur etwa zwei Drittel davon ab. Claude koordinierte Agenten, die öffentlich verfügbare Durchmusterungen zusammentrugen und aufeinander kalibrierten. Anschließend ergänzten sie das fehlende Drittel durch Rekonstruktion (inpainting) anhand der Beziehung zwischen Ultraviolett und anderen Wellenlängen. In bewusst maskierten Bereichen weichen die Schätzungen um etwa 10 % von den tatsächlichen Messwerten ab.

The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.

🇩🇪 Diese Arbeit hätte Menschen Wochen gekostet, doch mit Claude dauerte sie nur wenige Tage, während Ménard an anderen Projekten arbeitete. — @AnthropicAI auf X

🔗 Beitrag von Anthropic Science


Verbotene Nutzungen und Missbrauch: Anthropics Nutzungsrichtlinie 2026 und zwei von OpenAI zerschlagene Einflussoperationen

Zwei Veröffentlichungen vom 8. Oktober zeigen, was die Labore verbieten und wie sie Missbrauch aufspüren: Anthropic überarbeitet seine Nutzungsrichtlinie, OpenAI beschreibt zwei Einflussoperationen, die es gesperrt hat.

Anthropic veröffentlicht die Fassung 2026 seiner Nutzungsrichtlinie, gültig ab dem 12. November

8. Oktober — Anthropic veröffentlicht die jährliche Aktualisierung seiner Nutzungsrichtlinie (Usage Policy), die am 12. November in Kraft tritt. Dabei handelt es sich vor allem um Klarstellungen auf Grundlage beobachteter Missbrauchsfälle. Ein neuer Abschnitt bündelt die bisher verstreuten Regeln zu täuschenden Kampagnen und künstlicher Aktivität und erfasst jede täuschende politische oder kommerzielle Aktivität, einschließlich der Entwicklung von Werkzeugen für Einflussoperationen. Der Abschnitt zu Wahlen, umbenannt in „Demokratische Prozesse nicht untergraben“ (Do Not Undermine Democratic Processes), hebt das allgemeine Verbot der personalisierten Ansprache von Wählern auf, das auch zivilgesellschaftliche Anwendungen wie die Information von Wählern in anderen Sprachen blockierte. Der Text stellt außerdem klar, dass das Waffenverbot auch deren Software und Komponenten sowie die Bewaffnung von Drohnen umfasst, verbietet das Nachverfolgen von Personen ohne deren Zustimmung und untersagt, allerdings nur in extremen Fällen, anhaltendes und grundlos missbräuchliches Verhalten gegenüber den Modellen.

🔗 Anthropic-Beitrag: Aktualisierung der Nutzungsrichtlinie 2026

OpenAI zerschlägt Dark Clark und Bogus Bylines, darunter seine erste Operation der Kategorie 5

8. Oktober — OpenAI veröffentlicht einen Bericht über zwei verdeckte Einflussoperationen, die es gesperrt hat und die mithilfe seiner Modelle Scheinorganisationen (false front) betrieben. „Dark Clark“ aus Russland zielte auf Lateinamerika: Die Betreiber verfassten vor allem ihre internen Berichte mit ChatGPT und steuerten ein vermeintliches Forschungszentrum, das Social Research Center, das von einer fiktiven Person namens „Mia Clark“ geführt wurde. „Bogus Bylines“ aus Iran platzierte unter sieben gefälschten Namen westlicher Journalisten fast 100 Artikel in rund einem Dutzend Onlinemedien, von denen eines fast 2 Millionen Follower auf Facebook hatte. OpenAI gibt an, in zweieinhalb Jahren 30 solcher Operationen aufgedeckt zu haben.

Zerschlagene OperationHerkunft der KontenHauptzielKategorie auf der IO Breakout Scale (1 bis 6)
Dark ClarkRusslandLateinamerika5, laut OpenAI erstmals erreicht
Bogus Bylines, ArtikelIranInternationale Onlinemedien4
Bogus Bylines, KommentareIranSoziale Netzwerke2

🔗 OpenAI-Bericht über Operationen mit Scheinorganisationen


Claude Haiku 5.5 bei Drittanbietern: GitHub Copilot bietet es ab dem Pro-Tarif an, Devin misst 58,4 %

Claude Haiku 5.5 wurde am 7. Oktober eingeführt und war noch am selben Tag in zwei Coding-Tools verfügbar, die es jeweils mit Claude Sonnet 5 vergleichen.

GitHub Copilot: Haiku 5.5 in allen kostenpflichtigen Tarifen, einschließlich Pro

7. Oktober — Etwas mehr als zwei Stunden nach der Einführung durch Anthropic ist Claude Haiku 5.5 in GitHub Copilot allgemein für die Tarife Pro, Pro+, Max, Business und Enterprise verfügbar: einschließlich Pro, wie Claude Sonnet 5.5 und anders als GPT-6.1 Sol Ende September. Es lässt sich in zehn Oberflächen auswählen, von VS Code bis Xcode. GitHub sieht es für Subagenten, schnelle Änderungen und Aufgaben im Terminal vor; ersten Tests zufolge erreichte es bei vielen Coding-Aufgaben das Niveau von Claude Sonnet 5 mit deutlich weniger Tokens und Schritten, ohne dass Zahlen veröffentlicht wurden. Es wird zum öffentlich ausgewiesenen Preis abgerechnet: 0,10 Dollar pro Million Eingabetokens und 0,50 Dollar für die Ausgabe bis zu 100 000 Eingabetokens, danach 0,50 und 2,50 Dollar, also auf der ersten Preisstufe ein Zehntel des Preises von Claude Haiku 4.5.

🔗 Claude Haiku 5.5 in GitHub Copilot · Modelle und Preise von GitHub Copilot

Devin: 58,4 % auf FrontierCode 1.1, vor Claude Sonnet 5

7. Oktober — Cognition stellt Claude Haiku 5.5 in Devin bereit. Auf FrontierCode 1.1, seinem proprietären Benchmark, der Modelle anhand realer Entwicklungsaufgaben nach Codequalität und Eignung zum Zusammenführen bewertet, erreicht Haiku 5.5 58,4 % und liegt damit vor Claude Sonnet 5. Laut Cognition betragen die Kosten pro Aufgabe dabei ungefähr ein Achtel, wobei kein genauer Betrag genannt wird. Es gehört außerdem zu den Helfern (sidekicks) von Devin Fusion, das ein Hauptmodell mit einem ergänzenden Modell kombiniert: Mit Claude Opus 5.5 als Hauptmodell und Haiku 5.5 als Ergänzung behält Fusion einen Score von 66,2 bei und senkt gleichzeitig Kosten und Latenz.

Von Cognition bewertetes ModellScore FrontierCode 1.1 Extended
Claude Sonnet 556,2
Kimi K358,2
Claude Haiku 5.558,4
GPT-6.1 Sol60,4
Claude Sonnet 5.564,4
Claude Opus 5.565,3

🔗 Claude Haiku 5.5 in Devin


Coding-Agenten: Claude Code 2.1.295, Codex CLI 0.162.0, Antigravity CLI 1.3.1, VS Code 1.141 und Delta 0.19

Fünf Werkzeuge für Coding-Agenten entwickeln sich weiter: Claude Code verschärft seine Hooks, Codex CLI verwaltet Worktrees, Antigravity CLI überarbeitet die Prüfung von Änderungen, VS Code ordnet Agentensitzungen in einem Raster an und Delta ermöglicht Teamarbeit.

Claude Code 2.1.295: Hooks, die bei Fehlern blockieren

8. Oktober — Claude Code erhielt im Laufe des Tages zwei Versionen. Die 2.1.294 korrigiert die Hooks prompt und agent, die als Anweisungen in natürlicher Sprache formuliert waren und Aktionen durchlassen konnten, die sie eigentlich blockieren sollten. Die 2.1.295 enthält 143 Einträge, darunter 97 Fehlerbehebungen. Mit der neuen Option onFailure: "block" für command- und HTTP-Hooks blockiert ein Hook, der nicht startet, das Zeitlimit überschreitet oder einen unerwarteten Code zurückgibt, die Aktion, statt sie durchzulassen; mehrere Fehlerbehebungen gehen in dieselbe Richtung, etwa für die Schutzmechanismen der Mods und die Optionen --tools und --restricted. Claude Code unterstützt außerdem das Program Status Protocol (OSC 7501), mit dem kompatible Terminals anzeigen können, ob der Agent arbeitet, wartet oder fertig ist. Zudem wächst die maximale Länge der über die Werkzeugsuche geladenen MCP-Werkzeugbeschreibungen von 2 048 auf 16 384 Zeichen.

🔗 Claude Code 2.1.295 · Claude Code 2.1.294

Codex CLI 0.162.0: verwaltete Worktrees und angeheftete Aufgaben

8. Oktober — Codex CLI 0.162.0, die erste stabile Version seit der 0.161.0 vom Vortag, listet 225 PR auf. Wenn die Worktrees-Funktion aktiviert ist, verfügt Codex über Werkzeuge zum Erstellen und Auflisten verwalteter Git-Worktrees aus vertrauenswürdigen lokalen Projekten. Die Agentenzentrale erlaubt es, mit der Taste p eine Aufgabe in einer gemeinsamen Gruppe „Pinned“ anzuheften, sofern der Server dies unterstützt. Das Terminal erhält /copy zum Durchgehen und Kopieren der Transkriptblöcke, Ctrl+Insert zum Kopieren einer Auswahl sowie eine Einstellung für die Scrollgeschwindigkeit. URLs werden auch in Freigaben und MCP-Eingabeaufforderungen anklickbar. Benutzerdefinierte Modellanbieter, die mit der Responses API kompatibel sind, können direkten Webzugriff und Compaction auf einem entfernten Server deklarieren. Bei den Fehlerbehebungen bewahrt apply_patch CRLF-Zeilenenden, die Linux-Sandbox wird gehärtet und die Windows-Versionen erhalten einen signierten PowerShell-Installer.

🔗 Versionshinweise zu Codex CLI 0.162.0

Antigravity CLI 1.3.1: überarbeitete Prüfung in /diff, mittlere Ausführlichkeit als Standard

7. Oktober — Für die CLI von Antigravity wurden zwischen dem 2. und 7. Oktober fünf Versionen veröffentlicht. Die 1.3.1 verbessert die Codeprüfung im Terminal: In der Dateiansicht von /diff öffnen die Pfeiltasten nach links und rechts die benachbarte Datei bei ihrer ersten Änderung, jede Datei behält ihre Position bei, n und N wechseln zur nächsten beziehungsweise vorherigen Datei, und die Kopfzeile zeigt die aktuelle Position an. Die zehn Fehlerbehebungen betreffen unter anderem /rewind in sehr langen Gesprächen, Plugins unter Windows und Sitzungen mit GEMINI_API_KEY-Schlüssel, die bei einem Verbindungsabbruch zur Gemini API einen erneuten Versuch starten. Die 1.3.0 vom 6. Oktober ändert die standardmäßige Ausführlichkeit von „high“ auf „medium“, das Werkzeugaufrufe und Überlegungen in knappen Zusammenfassungen bündelt; mit /config lässt sich zur vorherigen Einstellung zurückkehren. Zuvor hatte die 1.2.16 die Bilderzeugung einem integrierten Subagenten übertragen, und die 1.2.15 brachte Android-Binärdateien für Termux.

🔗 Antigravity-Changelog, CLI-Tab

VS Code 1.141: Agentensitzungen im Raster und Bereinigung von Worktrees

7. Oktober — VS Code 1.141 konzentriert sich auf die Agentensitzungen von Copilot. Das Agents-Fenster kann mehrere Sitzungen in einem Raster anordnen, und der Befehl Chat: Open Worktree Cleanup zeigt den von Worktrees inaktiver Sitzungen belegten Speicherplatz an, damit sie auf Wunsch oder automatisch nach dem Zusammenführen der Pull Request gelöscht werden können. Gespräche, die in Copilot CLI oder in der GitHub Copilot-App gestartet werden, erscheinen ab ihrer ersten Anfrage, ohne dass der Editor neu geladen werden muss. Ein in der ChatGPT-App oder in Codex CLI geöffnetes Codex-Gespräch lässt sich dort mit seinem Verlauf fortsetzen: Wer ein Copilot-Modell auswählt, setzt es mit seinem GitHub Copilot-Abonnement fort, beispielsweise nachdem das ChatGPT-Nutzungslimit erreicht wurde. Für Unternehmen kann die Sandbox des Copilot-Harness über verwaltete Einstellungen vorgeschrieben werden, zunächst als Vorschau. Dieser Harness wird außerdem schrittweise zur Standardauswahl für Nutzer, bei denen Experimente aktiviert sind.

🔗 Versionshinweise zu VS Code 1.141

Delta 0.19: Erwähnungen von Teamkollegen und Posteingang

7. Oktober — Zed Industries veröffentlicht Delta 0.19.0, seine Umgebung zum gemeinsamen Programmieren mit Agenten, gefolgt von der Fehlerkorrekturversion 0.19.1 am 8. Oktober. Teamkollegen lassen sich nun in einer Nachricht oder einem Kommentar erwähnen, indem man @ gefolgt von ihrem Benutzernamen eingibt; die Benachrichtigung landet in einem neuen Posteingang (Inbox). Der Agent @delta liest und ändert einen großen Teil der Einstellungen direkt im Gespräch. Eine Einstellung namens Agent Thread Creation verhindert, dass Agenten Gespräche auf oberster Ebene erstellen, ohne Subagenten abzuschalten. Der Agent kann Worktrees mehrerer Threads zusammenführen, und CLI-Befehle werden ausgeführt, ohne ein Fenster zu öffnen. Insgesamt listen die Versionshinweise 11 Neuerungen, 22 Verbesserungen und 45 Fehlerbehebungen auf. Am 8. Oktober beschreibt ein von Zed geteilter Beitrag, wie das Team Google Docs für seine internen Dokumente durch Delta ersetzt hat.

🔗 Versionshinweise zu Delta · Delta-Beitrag über den Abschied von Google Docs


Generative Medien: Nano Banana 2.1, Brand Kit und ElevenReader in Brasilien bei ElevenLabs, SemanTok von Stability AI

Vier Ankündigungen rund um Bild, Video und Stimme: ein Bildmodell zum halben Preis bei Google, wiederverwendbare Gestaltungsrichtlinien und eine App zum Vorlesen bei ElevenLabs sowie Forschung zur Videogenerierung bei Stability AI.

Nano Banana 2.1 allgemein in der Gemini API verfügbar, zum halben Preis

6. Oktober — Google hat Nano Banana 2.1 (gemini-nano-banana-2.1) in der Gemini API und Google AI Studio allgemein verfügbar gemacht, ohne Blogbeitrag. Dieses Modell zur Bilderzeugung und -bearbeitung aktualisiert Nano Banana 2 mit besserer visueller Qualität, besserer Textdarstellung, über mehrere Gesprächsrunden hinweg konsistenteren Figuren und Panoramaformaten von 1:4 bis 8:1, ohne Kachelartefakte in 2K und 4K. Es akzeptiert bis zu 14 Referenzbilder und nutzt die Google-Suche zur Fundierung. Der Preis pro Bild wird in 1K und 2K halbiert, und Google stuft Nano Banana 2 (gemini-3.1-flash-image) als veraltet ein, ohne ein Abschaltdatum zu nennen.

AusgabepreisNano Banana 2.1Nano Banana 2
Bild 1K0,0336 dollar0,067 dollar
Bild 2K0,0504 dollar0,101 dollar
Bild 4K0,113 dollar0,151 dollar
Million Bildtokens30 dollars60 dollars

🔗 Versionshinweise zur Gemini API · Modellbeschreibung zu Nano Banana 2.1

Brand Kit von ElevenLabs: Gestaltungsrichtlinien im Arbeitsbereich hinterlegt

8. Oktober — ElevenLabs ergänzt seine Kreativsuite ElevenCreative um Brand Kit. Farben, Schriftarten, Logos mit ihren Nutzungsregeln, Referenzbilder und Markenregeln, einschließlich dessen, was die Marke niemals tut, bilden ein einziges Objekt im Arbeitsbereich, das sich per @ in Image & Video, in Flows oder beim ElevenCreative-Agenten aufrufen lässt. Laut dem Thread von ElevenLabs lässt sich ein Kit in wenigen Minuten erstellen, indem man eine Website-Adresse einfügt oder die Ressourcen der Organisation hochlädt; das gesamte Team generiert dann anhand derselben Vorgaben, und eine Agentur kann für jeden Kunden ein Kit erstellen. ElevenLabs will die Kits auf Markenstimme und -klang ausweiten, nennt aber kein Datum. Brand Kit ist ab sofort verfügbar, ohne Preisangabe; HeyGen (August) und Runway (September) bieten bereits vergleichbare Werkzeuge an.

🔗 ElevenLabs-Beitrag: Brand Kit · Thread von @ElevenLabs

SemanTok von Stability AI: ein Modell mit 201M, das mit einem 3,4-mal größeren Modell gleichzieht

7. Oktober — Das Team Interactive Research von Stability AI stellt SemanTok vor, einen Video-Tokenizer für Weltmodelle (world models), die Videos Token für Token erzeugen; die Ankündigung auf X folgt am 8. Oktober. Bei Tokenizern „vom Groben zum Feinen“ (coarse-to-fine) beschreiben die ersten Tokens die gesamte Szene, während die folgenden Details hinzufügen; SemanTok verleiht diesen ersten Tokens mehr semantischen Gehalt und macht sie dadurch leichter vorhersagbar. Dazu speist es eingefrorene DINO-Merkmale in seinen Encoder ein und ergänzt leichtgewichtige Heads, die diese aus jedem Tokenpräfix rekonstruieren. Laut Stability AI erreicht oder übertrifft ein auf SemanTok aufgebautes autoregressives Modell mit 201M Parametern ein 3,4-mal größeres VideoFlexTok-Modell, und kurze Präfixe lassen sich kostengünstiger vorhersagen. Der Artikel ist auf arXiv verfügbar; weder Code noch Gewichte werden erwähnt.

🔗 Forschungsbeitrag von Stability AI · Artikel auf arXiv

ElevenReader kommt mit der Stimme von Fábio Porchat und 70 000 Büchern nach Brasilien

8. Oktober — ElevenLabs startet in Brasilien ElevenReader, seine kostenlose App für iOS und Android, die Bücher, Dokumente und Artikel hörbar macht, mit der Stimme des Schauspielers und Komikers Fábio Porchat. Der Katalog basiert auf einer Partnerschaft mit Bookwire Brasil: 70 000 Titel auf brasilianischem Portugiesisch, lizenziert von den wichtigsten Verlagen des Landes, von denen die meisten bisher keine Hörbuchausgabe hatten. ElevenLabs hat außerdem Dom Casmurro von Machado de Assis produziert, gelesen von Fábio Porchat, mit eigens komponierter Musik und Sounddesign. Laut dem Geschäftsführer von Bookwire Brasil ist dies die größte Auswahl brasilianischer Bücher, die jemals im Audioformat angeboten wurde.

Angebot in BrasilienZugangsbedingungen
ElevenReader-App (iOS, Android)Kostenlos
Dom Casmurro, gelesen von Fábio PorchatFür alle kostenlos
70 000 von Bookwire lizenzierte TitelMit ElevenReader Ultra, Preis nicht angegeben

🔗 ElevenLabs-Beitrag: ElevenReader in Brasilien


Spezialisierte Modelle: LightOnOCR-3 für Dokumente, Falcon-ASR für Arabisch, Carbon-A für Genome

Drei spezialisierte Modelle, davon zwei mit offenen Gewichten, zum Lesen von Dokumenten, Transkribieren von Arabisch und Annotieren von Genomen.

LightOnOCR-3: drei offene OCR-Modelle, die auch das Layout erkennen

8. Oktober — LightOn veröffentlicht LightOnOCR-3 unter der Apache-2.0-Lizenz in drei Größen (0.8B, 1B und 4B). Die Modelle können eine Seite nicht nur transkribieren, sondern auch jeden ihrer Bereiche erkennen: Mit dem Prompt zur visuellen Verankerung (grounding) steht vor jedem Block eine beschriftete Bounding Box, Bilder erhalten eine kurze Beschreibung und Diagramme werden in HTML-Datentabellen umgewandelt. Auf einer H100 verarbeitet das 4B-Modell 21 % mehr Seiten pro Sekunde als Chandra-OCR-2, das wie dieses auf Qwen3.5 basiert. LightOn weist darauf hin, dass seine Ergebnisse nach einer Normalisierung der Ausgaben berechnet werden, die zusammen mit dem Repository veröffentlicht wurde und die Ergebnisse aller führenden Modelle deutlich verändert.

BenchmarkLightOnOCR-3-4BLightOnOCR-3-0.8BLightOnOCR-3-1BAngeführte Referenz
olmOCR-Bench, Gesamtwertung86,385,584,5Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8
ParseBench, fünf Kategorien75,174,671,4Infinity Parser Pro 74,3
fr-bench-pdf2md, französische Dokumente74,170,569,6Chandra 2 69,0 ; MistralOCR4.1 54,1

🔗 Beitrag zu LightOnOCR-3

Falcon-ASR: 1,6 Milliarden Parameter für emiratisches Arabisch, ohne veröffentlichte Gewichte

7. Oktober — Das Technology Innovation Institute (TII) in Abu Dhabi stellt Falcon-ASR vor, ein Spracherkennungsmodell mit 1,6 Milliarden Parametern, das auf Arabisch und insbesondere auf den emiratischen Dialekt ausgerichtet ist. Derselbe Satz von Gewichten transkribiert auch Englisch, Französisch, Spanisch und Portugiesisch, ohne dass die Sprache angegeben werden muss, und versieht jedes Wort mit einem Zeitstempel. Wie Falcon-OCR-Arabic und Falcon-Emirati, die am Vortag vorgestellt wurden, wird es nur als Demo angeboten: TII kündigt einen API-Zugang und native Anwendungen an, veröffentlicht aber keine Gewichte.

Bewertung der Wortfehlerrate (WER)Ergebnis von Falcon-ASRAngeführte Referenz
Durchschnitt aus sechs arabischen Datensätzen (Open Universal Arabic ASR)20,92 %23,17 %, bestes veröffentlichtes Ergebnis zum 30. September
Emiratisches Arabisch, interne Bewertung von TII22,73 %Qwen3-Omni auf Platz zwei, 4,07 Punkte darüber
Durchschnitt aus sieben englischen Datensätzen (Open ASR Leaderboard)5,74 %Keine Referenz angeführt

🔗 Beitrag zu Falcon-ASR

Carbon-A: 566 Millionen Kandidatengene bei 22 617 Arten

8. Oktober — Das Biologieteam von Hugging Face (HuggingFaceBio) veröffentlicht Carbon-A, ein Modell mit 1,2 Milliarden Parametern unter der MIT-Lizenz, das proteinkodierende Regionen direkt in der DNA erkennt, mit einem einzigen Modell für Säugetiere, Pflanzen, Pilze und Protisten. Auf 42 Referenzgenomen erreicht es einen durchschnittlichen F1-Wert auf Nukleotidebene von 0,944 und übertrifft laut den Autoren die sieben verglichenen Tools, darunter AUGUSTUS, Helixer und Tiberius. Das Team hat das Modell auf den eukaryotischen Genomen von GenBank ausgeführt, um die Carbon Annotation Database aufzubauen: 48 167 Assemblies von 22 617 Taxa und 566 Millionen vorhergesagte kodierende Loci, also 11-mal mehr Taxa als im Trainingskorpus. Eine Laborvalidierung mit ActiveSite und der UCSD durch Sequenzierung von RNA in voller Länge bestätigt einen Teil der Gene; die Autoren weisen darauf hin, dass dies die Transkription belegt, aber noch nicht die Produktion der Proteine. Eine neue Charge ist in drei Wochen vorgesehen.

🔗 Beitrag zu Carbon-A


Training mit Reinforcement Learning: die 1 004 Umgebungen von TermGrade und TRL v1.15.0

Zwei Veröffentlichungen für Reinforcement Learning: bewertete Terminalumgebungen und eine Bibliothek, die längere Sequenzen beim Training ermöglicht.

TermGrade: 1 004 Terminalumgebungen, bewertet von sechs Modellen

8. Oktober — Das Unternehmen ai& veröffentlicht TermGrade, 1 004 Terminalumgebungen zum Trainieren und Bewerten von Agenten mittels Reinforcement Learning. Jede Aufgabe läuft in einem Linux-Container mit einer Aufgabenstellung und Tests und wurde nur aufgenommen, wenn ihre eigene Referenzlösung ihre Tests bestand: Von 66 165 durch DeepSeek-V4-Pro erstellten Aufgaben bestanden 1,5 % diesen Filter. Sechs Konfigurationen offener Modelle, von Kimi-K3 bis gemma-4-31B-it, haben jede Aufgabe bearbeitet, und die 36 144 Versuche werden einschließlich der Fehlschläge veröffentlicht. Ein Modell lernt am meisten aus Aufgaben, die es etwa bei jedem zweiten Versuch löst: Nach dem Training auf 151 Aufgaben aus diesem Bereich erreicht gemma-4-31B-it 46,1 auf Terminal-Bench 2.1, also 3,1 Punkte mehr als das Basismodell und durchschnittlich 2,1 Punkte mehr über fünf Trainingsläufe. Alles wird unter Apache-2.0 veröffentlicht.

🔗 Beitrag zu TermGrade · TermGrade-Sammlung auf Hugging Face

TRL v1.15.0: ein fusionierter LM Head für bis zu 6,9-mal längere Sequenzen

8. Oktober — TRL v1.15.0, die Trainingsbibliothek von Hugging Face, führt einen fusionierten LM Head (fused LM head) ein, der die Log-Wahrscheinlichkeiten und die Entropie jedes Tokens direkt mit einem Triton-Kernel berechnet, ohne jemals den vollständigen Logits-Tensor aufzubauen; er ist standardmäßig für SFT, DPO, KTO, GRPO, RLOO und Distillation aktiviert. Bei 8 192 Tokens sinkt der maximale Speicherbedarf je nach Methode um 52 bis 82 %. Diese Messungen wurden auf einer auf 79 Gio begrenzten B300 mit zufälligen Gewichten von gemma-3-1b durchgeführt, dessen Vokabular 262 000 Tokens umfasst; der Gewinn ist bei kleinen Modellen mit großem Vokabular am stärksten. Die Version bringt auch Kompatibilitätsbrüche: Die Unterstützung für Python 3.10 endet, use_liger_kernel wird als veraltet markiert und der experimentelle MiniLLM-Trainer wird entfernt.

TrainingsmethodeMaximale Länge in v1.14.2 (tokens)Maximale Länge in v1.15.0 (tokens)Verbesserungsfaktor
DPO10 24059 392×5,80
KTO (Batchgröße 2)9 21663 488×6,89
GRPO28 672114 688×4,00
RLOO23 552100 352×4,26
SFT (nll-Verlust)20 480107 520×5,25

🔗 Versionshinweise zu TRL v1.15.0


Inferenz: llama.cpp in Windows ML, ML Drift als Open Source, Together AI auf B300 von IBM Cloud

Drei Ankündigungen zum Ausführen von Modellen, vom Windows-PC bis zum GPU-Cluster.

llama.cpp kommt als experimentelle Unterstützung in Windows ML

7. Oktober — Bei seiner Windows-Veranstaltung ergänzt Microsoft Windows ML, sein Framework für lokale Inferenz, um experimentelle Unterstützung für llama.cpp: Man lädt ein GGUF-Modell von Hugging Face herunter und führt es über denselben Windows-ML-Stack lokal aus, mithilfe neuer APIs für bestimmte Aufgaben. Eine native Windows-API für die Ausführung auf niedrigerer Ebene wird ebenfalls als experimentelle Vorschau verfügbar. Microsoft erklärt, gemeinsam mit NVIDIA und der Community direkt zum Projekt llama.cpp beizutragen: optimierte CUDA-Kernel, besseres Scheduling zwischen CPU und GPU, CUDA graphs, spekulatives Decoding (Eagle-3, MTP, D-Flash2), Ausführung auf mehreren GPUs und das Format NVFP4. Der Beitrag verortet diese Neuerungen auf PCs mit NVIDIA-RTX-Spark-Chips, etwa dem Surface Laptop Ultra. Auf X begrüßt Georgi Gerganov von llama.cpp die Präsenz des Projekts bei der Windows-Veranstaltung und sieht darin ein Zeichen dafür, dass Software- und Hardware-Stacks endlich zusammenfinden.

🔗 Beitrag zu Microsoft Foundry on Windows · Tweet von @ggerganov

ML Drift: die GPU-Engine von LiteRT als Open Source veröffentlicht

8. Oktober — Das Team von Google AI Edge veröffentlicht ML Drift, seine GPU-Rechenengine für Inferenz auf dem Gerät, als Open Source unter der Apache-2.0-Lizenz. Sie abstrahiert die Unterschiede zwischen OpenGL ES, OpenCL, Metal und WebGPU, dient LiteRT als Engine für die GPU-Beschleunigung, ist als eigenständige Bibliothek verfügbar und löst den GPU-Delegate von TensorFlow Lite ab, der keine neuen Funktionen mehr erhalten wird. Die Engine wechselt die Kernel abhängig davon, ob das LLM den Prompt liest oder seine Tokens generiert, und stellt eine SKILL.md-Anleitung bereit, mit der Coding-Agenten Shader schreiben und überprüfen können. Sie läuft bereits im Produktivbetrieb: bis zu 40 % geringere Latenz pro Bild bei den Effekten von YouTube Shorts und laut dem Beitrag bis zu 30 % Leistungsgewinn für Lightroom und Photoshop auf Mobilgeräten; bei Gemma misst Google bis zu 12 % weniger Speicherbedarf als bei anderen Software-Frameworks (frameworks).

🔗 Ankündigung von ML Drift auf dem Google Developers Blog · Repository google-ai-edge/ml-drift

Together AI als erster Kunde eines Inferenzclusters mit B300-GPUs auf IBM Cloud

6. Oktober — Together AI kündigt eine Zusammenarbeit mit IBM und NVIDIA an, um seine Inferenzkapazität für Unternehmen auszubauen, beginnend mit einem großen Cluster aus NVIDIA-B300-GPUs, der auf IBM Cloud gehostet und über das Ethernet-Netzwerk Spectrum-X von NVIDIA verbunden wird. Laut Together AI ist dies der erste dedizierte Inferenzcluster dieser Größenordnung auf IBM Cloud, und das Unternehmen ist dessen erster Kunde: Es betreibt die Inferenzschicht, IBM stellt die Cloud bereit und NVIDIA die Chips und das Netzwerk. Together AI begründet diese Erweiterung mit der Nachfrage nach offenen Modellen: Nach eigenen Angaben verarbeitet das Unternehmen jeden Monat Hunderte Billionen Tokens für mehr als eine Million Entwickler. Der Beitrag nennt weder die Größe des Clusters noch einen Zeitplan.

🔗 Beitrag von Together AI · Tweet von @togethercompute


Kurznachrichten

  • Schnellere Steuerung von Codex — In der ChatGPT-Desktopanwendung berücksichtigt Codex eine während einer Aufgabe gesendete Folgenachricht früher, um einen Ansatz zu korrigieren oder die Richtung zu ändern; die Einstellung Follow-up behavior legt fest, ob diese Nachrichten die laufende Ausführung steuern oder auf die nächste warten. 🔗 Quelle
  • ChatGPT Go in Warp — Abonnenten von ChatGPT Go können ihr Abo nun in Warp für Terminalfragen oder Coding-Aufgaben nutzen; laut einem von Warp zitierten Mitglied von OpenAIs Team Sign in with ChatGPT steht die enthaltene Nutzung in allen Partneranwendungen neben Plus- und Pro-Kunden auch Go-Kunden offen. 🔗 Quelle
  • Oracle — Laut einer Fallstudie von OpenAI hat Oracle 130 000 aktive ChatGPT-Nutzer und mehr als 95 000 Codex-Nutzer; eine Recherche zum Arbeitskräftemarkt, die 2 bis 4 Tage benötigte, lässt sich in 15 bis 20 Minuten vorbereiten, und Codex übersetzt geschäftliche Fragen in SQL-Abfragen. 🔗 Quelle
  • Pollo AI — Diese Plattform für die Videoerstellung, die nach eigenen Angaben mehr als 26 Millionen Nutzer hat, nutzt GPT-5.6 zum Routing der Anfragen ihres Agenten, überträgt schwierige Aufgaben an GPT-6 Astra und sämtliche Bilder an GPT-Image-2.5 und reduziert nach eigenen Angaben die für die Modellauswahl aufgewendete Zeit um mehr als 50 %. 🔗 Quelle
  • Versionshinweise zu Devin vom 7. Oktober — Eine Benachrichtigungszentrale bündelt die Hinweise aus den Sessions, mit konfigurierbarer Weiterleitung an das Telefon; der Status der Merge Queue wird in der gesamten Anwendung angezeigt, und als Secrets gespeicherte private Schlüssel werden in der Befehlsausgabe zeilenweise maskiert. 🔗 Quelle
  • Copilot CLI 1.0.94 — Nach sechs Vorabversionen als stabile Version erschienen, ergänzt sie Claude Haiku 5.5 in der Modellauswahl, übermittelt den angezeigten Shell-Code an den Prüfer für Assisted Permissions, um unnötige Freigaben zu vermeiden, und ermöglicht es, einen MCP-Server vor dessen Erkennung zu aktivieren. 🔗 Quelle
  • Gemini CLI v0.65.0-nightly.20261008 — Die Telemetrie akzeptiert benutzerdefinierte OTLP-Header (telemetry.otlpHeaders), eine seit Oktober 2025 offene Anfrage; die CLI gerät nicht mehr in eine Schleife zwischen Prüfung und OAuth, und der Verlauf endet immer mit einer Nutzernachricht, was einen Fehler 400 nach /rewind verhindert. 🔗 Quelle
  • Das Antigravity SDK 0.1.21 isoliert experimentelle APIs und konfiguriert die Skills von Subagenten — Erste seit der Version 0.1.18 vom 21. September im Changelog aufgeführte Version: Ein Decorator @beta und ein Modul google.antigravity.beta trennen die Vorabversionen von der stabilen API, und skills_config ermöglicht einem Subagenten, die Skills des übergeordneten Agenten zu übernehmen, sie zu ersetzen oder auf sie zu verzichten. 🔗 Quelle
  • Developer Knowledge API — Google stellt das Ökosystem dieser API vor, die seine Entwicklerdokumentation (Google Cloud, Firebase, Android) als aktuelles Markdown bereitstellt: einen in Cloud Shell vorinstallierten Befehl gcloud developer-knowledge, einen mit einem MCP-Server verbundenen Skill für Coding-Agenten, wobei Antigravity, Claude Code, Cursor und GitHub Copilot genannt werden, sowie Bibliotheken in sieben Sprachen. 🔗 Quelle
  • AQuA — Google Cloud veröffentlicht diesen Qualitätsagenten (Ambient Quality Agent) als Referenzimplementierung; er erfasst bis zu 1 000 Sessions eines ADK-Agenten im Produktionsbetrieb als Stichprobe, gruppiert Fehler, verfolgt sie in BigQuery und startet mit Gemini 3.8 Flash eine Ursachenanalyse. 🔗 Quelle
  • Entwürfe zählen bei den Limits für Pull Requests mit — Angesichts von Beiträgen geringer Qualität ermöglicht GitHub, Pull Requests im Entwurfsstatus in die Limits pro Nutzer einzubeziehen, während ein Mitwirkender bisher unbegrenzt viele davon öffnen konnte. 🔗 Quelle
  • Archivierung von Pull Requests — Sie ist nicht mehr Administratoren vorbehalten: Die Rollen triage, write, maintain und admin können einen Pull Request archivieren, wodurch er geschlossen, für die Öffentlichkeit ausgeblendet und jede weitere Aktivität blockiert wird, einschließlich Kommentaren von Administratoren. 🔗 Quelle
  • GitHub-Timelines und Screenreader — Screenreader durchlaufen die Timelines von Issues und Pull Requests wie Listen, geben dabei die Anzahl der Elemente und die aktuelle Position an und kündigen geladene Ereignisse an, auf github.com und GitHub Enterprise Server 3.23. 🔗 Quelle
  • Paper Reproductions with ML Intern — Abubakar Abid kündigt bei Hugging Face eine Funktion an, die Agenten ausgehend von den Paper Pages die unabhängige Reproduktion der Experimente eines veröffentlichten Artikels überträgt, um offene Artefakte zu erzeugen, die helfen, solide Arbeiten zu erkennen; weder Zahlen noch Dokumentation. 🔗 Quelle
  • Der Chat von Hugging Face per SSH — Adrien Carreira, Leiter der Infrastruktur von Hugging Face, stellt einen Chat mit offenen Modellen vor, der über den Befehl ssh chat.hf.co ohne Konfiguration oder Schlüssel zugänglich ist; es gibt dazu weder Dokumentation noch eine Modellliste. 🔗 Quelle
  • huggingface_hub 2.2.0 — Kleine Fehlerkorrekturversion: hf jobs stats liefert nun einen Snapshot und gibt anschließend die Kontrolle zurück (-f zur Live-Verfolgung), parallele Downloads laufen alle über hf_xet, und zwei Änderungen brechen die Kompatibilität. 🔗 Quelle
  • swarmlab — Hugging Face hat ohne Ankündigung diesen Teststand veröffentlicht, der untersucht, wie Schwärme von LLM-Agenten verschiedener Anbieter je nach Topologie des Austauschs, Verzögerungen und Rollen die Wahrheit finden oder sich spalten; eine Zeile YAML genügt, um eine Hypothese zu testen. 🔗 Quelle
  • Darwin-27B-ZTC — VIDRAFT veröffentlicht unter Apache-2.0 einen Judge, der in einem einzigen Durchlauf eine Wahrscheinlichkeitsverteilung über die möglichen Antworten zurückgibt, ohne einen Token zu generieren: 0,743 Zero-Shot-Genauigkeit bei 2 000 Bewertungen von typed-decisions und ein Brier-Score von 0,097, laut den Autoren. 🔗 Quelle
  • Superfluid — basecompute veröffentlicht unter Apache-2.0 diesen lokalen LLM-Server, der mit den APIs von OpenAI, Anthropic und Ollama kompatibel ist und interaktiven Anfragen Vorrang vor der Arbeit der Agenten gibt: 0,36 Sekunden Antwortzeit bei acht aktiven Agenten, gegenüber mehr als 10 Sekunden bei llama-server, laut den Autoren. 🔗 Quelle
  • funes 1.8.0 — Das Tool, das die Sessions von Coding-Agenten indexiert, ergänzt ein mehrsprachiges Embedding-Modell: Bei 30 Fragen zu 2 000 Gesprächen auf Chinesisch erscheint das richtige Gespräch 30 von 30 Mal unter den ersten acht Ergebnissen, gegenüber 23 Mal, und der mittlere reziproke Rang steigt von 0,601 auf 0,983. 🔗 Quelle
  • GLiNER und indische Sprachen — Ein Community-Beitrag zeigt, dass durch das Beibehalten kombinierender Zeichen in Wörtern ohne erneutes Training der durchschnittliche Zero-Shot-F1 von GLiNER2 in neun indischen Sprachen von 13,2 auf 68,0 steigt und der F1 nach einem Fine-Tuning auf Hindi von 59,9 auf 82,6. 🔗 Quelle
  • Multilingual Terminal-Bench — LILT beschreibt seinen Benchmark mit 324 Coding-Aufgaben in zehn Sprachen: Claude Opus 5.5 liegt darin etwa 3 Punkte vor Opus 5 und benötigt 30 % weniger Tokens, was etwa 45 % geringere Kosten pro Aufgabe bedeutet; Gemini 3.8 Flash benötigt dort im Median 41 Runden pro Aufgabe, gegenüber 5 bei GPT-6 Sol. 🔗 Quelle
  • Kollektive GPU-Primitiven — Milos Kotlar sagt die Kommunikationszeit von fünf Primitiven auf vier RTX 4090 mit einem durchschnittlichen Fehler von 10,9 % voraus, gegenüber 22,9 % bei einem gemeinsamen Modell, allerdings beträgt der Fehler im schlechtesten Fall 61,6 %. 🔗 Quelle
  • Best-of-N beim Video-Reasoning — facebookresearch stellt ohne Ankündigung und unter der nicht kommerziellen Lizenz CC BY-NC 4.0 den Code der Studie Selecting or Solving? zur Auswahl mit best-of-N und zu Jurys aus Verifikatoren beim Video-Reasoning online. 🔗 Quelle
  • KDD Cup 2026 Data Agents — NVIDIA beschreibt den Harness, mit dem sein Team KGMON mit einem vorgeschriebenen kleinen LLM den zweiten Platz erreichte: in SQLite-Tabellen umgewandelte Daten, von Beginn an bereitgestelltes Schema, kleiner Werkzeugsatz, gezieltes Lesen von Dokumenten; der Beitrag nennt weder einen Score noch einen Modellnamen. 🔗 Quelle
  • Microduck — Matthieu Lapeyre von Pollen Robotics kündigt für diesen kleinen zweibeinigen Roboter mit der neuen, selbst entwickelten Elektronikplatine mehr als drei Stunden Laufzeit mit einem Akku von 2 600 mAh an, wobei der Prozessor höchstens 60 °C statt 114 °C erreicht. 🔗 Quelle
  • Alben auf Suno — Die am 5. Oktober vorgestellte Funktion ist verfügbar: Man fasst seine Stücke zu einer vollständigen Veröffentlichung zusammen, wählt das Cover, legt die Reihenfolge der Titel fest und veröffentlicht zum gewünschten Zeitpunkt; weder ein Tarif noch ein Limit für die Titelzahl werden angegeben. 🔗 Quelle
  • HeyGen und Ryan Serhant — HeyGen startet auf Instagram, TikTok und X eine tägliche Videoserie, die vom offiziellen Avatar des Immobilienmaklers Ryan Serhant präsentiert wird, bekannt aus der Netflix-Serie Owning Manhattan; keine finanziellen Details. 🔗 Quelle
  • Runway und die Tech Coalition — Runway tritt dieser Allianz gegen die sexuelle Ausbeutung von Kindern im Internet und ihrem Programm Lantern zum Austausch von Signalen zwischen Plattformen bei und erinnert an seine Schutzmaßnahmen: Datenfilterung, adversariale Tests, Hashing, Meldungen an das NCMEC und C2PA-Herkunftsnachweise. 🔗 Quelle
  • SpaceXAI und Omarchy — SpaceXAI wird mit 1,5 Millionen Dollar in Grok-Tokens Gründungsförderer der Omacom Foundation; Grok 4.7 und seine Nachfolger werden die Agenten des Projekts antreiben, darunter Omabot, der Pull Requests prüft. 🔗 Quelle
  • Leitfaden zu den Schutzmaßnahmen von Perplexity — Perplexity veröffentlicht einen Leitfaden, der IA-Schutzmaßnahmen an drei Stellen verortet (Eingabe, Aktionen der Agenten, Ausgabe), fünf Arten von Schutzmaßnahmen vergleicht und sieben Fälle von Prompt Injection bis zu Halluzinationen veranschaulicht; keine neue Funktion. 🔗 Quelle
  • pplx-decider-v1.1-27b auf OpenRouter — Das Entscheidungsmodell mit offenen Gewichten von Perplexity ist auf OpenRouter zum Preis der Decisions API verfügbar: 0,02 Dollar pro Million Eingabe-Tokens, kostenlose Ausgabe, Kontext von 262 000 Tokens. 🔗 Quelle
  • Cohere in Ottawa — Cohere eröffnet sein erstes Büro in Ottawa nahe dem Lansdowne Park, wo bereits knapp 30 Beschäftigte arbeiten (Vermarktung, Engineering, Infrastruktur, Sicherheit, souveräne IA); weder Fläche noch angestrebte Mitarbeiterzahl werden genannt. 🔗 Quelle

Was das bedeutet

Der Assistent erstellt inzwischen Arbeitsobjekte und nicht mehr nur Antworten. Ein Dashboard von Claude Dashboards aktualisiert sich, wenn sich die Daten ändern, eine Animation von Claude Motion bleibt Wort für Wort bearbeitbar, weil sie in Code geschrieben ist, und Docs, Slides und Design, die für alle Tarife die Betaphase verlassen haben, verzeichnen nach eigenen Angaben bereits mehr als 45 Millionen erstellte Inhalte. Diese Objekte gelangen anschließend in die vorhandenen Tools: Das Dashboard geht an Grafana oder PostHog, die Animation an Runway oder Luma, die generierte Aufnahmen hinzufügen. Das Brand Kit von ElevenLabs folgt derselben Logik: Die Gestaltungsrichtlinien werden zu einem Objekt im Arbeitsbereich, das per @ aufgerufen wird, statt zu einer Anweisung, die in jedem Prompt wiederholt werden muss.

Sicherheit erreicht eine neue Größenordnung, sowohl bei der Abwehr als auch bei der Durchsetzung von Regeln. Anthropic stellt fest, dass es noch nie so einfach war, Schwachstellen zu finden: mehr als 29 000 Kandidaten in sechs Monaten, davon etwa 6 000 manuell bewertet. OSS Scanner versendet Berichte bewusst ohne menschliche Nachprüfung und erwartet dabei mehr als 90 % True Positives, um diesen Engpass zu entschärfen. Parallel dazu werden die Nutzungsregeln konkreter: Anthropics Richtlinie von 2026 fasst täuschende Kampagnen in einem eigenen Abschnitt zusammen, und OpenAI stellt Dark Clark als die erste Operation der Kategorie 5 vor, die das Unternehmen seit Beginn seiner Berichte zerschlagen hat. In den Tools lässt Claude Code 2.1.295 einen fehlgeschlagenen Hook inzwischen die Aktion blockieren, statt sie durchzulassen.

Geschwindigkeit und Preis werden zu Einstellungen, die man selbst wählt. Ultrafast bietet GPT-6.1 Sol zum sechsfachen Preis an, um bis zu 8-mal schneller zu sein; laut GitHub und Cognition erreicht Claude Haiku 5.5 beim Code das Niveau von Sonnet 5 oder übertrifft es, laut Cognition zu etwa einem Achtel der Kosten pro Aufgabe; Nano Banana 2.1 halbiert den Preis eines 1K-Bildes. Die Inferenz reicht vom Endgerät, mit llama.cpp in Windows ML und ML Drift auf den GPUs von Telefonen und Computern, bis zum B300-Cluster, dessen erster Kunde bei IBM Cloud Together AI ist, und TRL reduziert den Spitzenwert des Speicherverbrauchs bei einem Training mit 8 192 Tokens um 52 bis 82 %.

Schließlich erheben diejenigen, die die Zahlen des Tages veröffentlichen, viele davon selbst. FrontierCode ist Cognitions proprietärer Benchmark, GitHub erklärt, Haiku 5.5 erreiche das Niveau von Sonnet 5, ohne Zahlen zu veröffentlichen, LightOn berechnet seine Scores nach einer Normalisierung, die die Werte aller führenden Modelle verändert, TII bewertet Falcon-ASR im emiratischen Arabisch nur anhand eines internen Datensatzes und veröffentlicht die Modellgewichte nicht, und die Autoren von Carbon-A vergleichen es selbst mit sieben Tools. Die offene Wissenschaft setzt einen Gegenpunkt: TermGrade veröffentlicht seine 36 144 Versuche einschließlich der Fehlschläge, Carbon-A seine Datenbank mit 566 Millionen Kandidatengenen, und die Ultraviolettkarte von Claude Science macht Pixel für Pixel kenntlich, was gemessen und was vorhergesagt ist. Die 150 Millionen Dollar von Anthropic und die Milliarde von NVIDIA für die Genesis Mission zielen in dieselbe Richtung: diese Tools in die Hände der Forschenden zu bringen.


Quellen