Suchen

Mistral Large 4 in der Vorabversion, Claude kommt in Google Docs, Sheets und Slides, Anthropic erweitert sein Cyberprogramm

ai-powered-markdown-translator

Artikel mit gpt-6.1-sol aus dem Französischen ins Deutsche übersetzt.

Projekt auf GitHub ansehen ↗

Mistral stellt Mistral Large 4 als Vorabversion bereit, ein multimodales Modell mit 1 000 Milliarden Parametern, dessen API ab heute allen zugänglich ist und dessen Gewichte für Ende Oktober angekündigt sind. Anthropic bringt Claude in Google Docs, Sheets und Slides und gestaltet sein Cyber-Verifizierungsprogramm mit drei Zugriffsstufen neu, während Google DeepMind EmbeddingGemma 2 veröffentlicht, ein offenes, multimodales Embedding-Modell, das auf ein Smartphone passt. Auch die Entscheidungsmodelle stehen heute im Mittelpunkt: OpenAI öffnet seine Decisions-API als öffentliche Beta, Perplexity halbiert seinen Preis, und ein Community-Ranking ordnet sie ein.


Mistral Large 4: 1 000 Milliarden Parameter in der Vorabversion, Gewichte für Ende Oktober angekündigt

6. Oktober — Mistral AI veröffentlicht Mistral Large 4 als öffentliche Vorabversion, kurz ML4 und „ganz offiziell“ auch der Chonk genannt. Es ist das bislang größte Modell des Unternehmens: ein nativ multimodales Expertenmischungsmodell (Mixture-of-Experts) mit 1 000 Milliarden Parametern (1T), davon laut Ankündigungsbeitrag 49 Milliarden aktiv, das Anweisungsbefolgung, Reasoning und agentische Fähigkeiten in einem Kontext von einer Million Tokens vereint. Die Modellübersicht in der Dokumentation nennt andere Zahlen, ohne die Abweichung zu erklären: 1 050 Milliarden Parameter, davon 52 Milliarden aktiv, dazu ein Vision-Encoder mit 1,6 Milliarden Parametern.

Die API ist ab heute auf Mistral Studio allen zugänglich, die Gewichte sind jedoch noch nicht veröffentlicht: Mistral kündigt sie bis Ende Oktober an, zusammen mit Details zur Architektur und zum Post-Training. Bis dahin wird das Modell unter realen Bedingungen von Verantwortlichen für Cybersicherheit, verifizierten Partnern und staatlichen Behörden erprobt, die mit reduzierter Moderation darauf zugreifen. ML4 wurde von Grund auf auf 3 800 NVIDIA Grace Blackwell GPUs in den europäischen Rechenzentren von Mistral trainiert, die auch die Vorabversion bereitstellen. Das Unternehmen plant einen europäischen Einsatz, den es vollständig selbst betreibt und der europäischem Recht unterliegt, und stellt das Modell als ersten Meilenstein der durch seine Series-D-Finanzierung über 3 Milliarden Euro finanzierten Roadmap vor.

Cybersicherheit ist das Hauptargument. Laut Mistral gehört ML4 zu den fünf führenden Modellen im Artificial Analysis Cyber Index und erreicht 82 % in einem seiner Tests, bei dem eine echte Sicherheitslücke in einer Open-Source-Software reproduziert und anschließend behoben werden muss — der beste Wert aller Modelle. Das Unternehmen behauptet, dass Claude Opus 5.5 und GPT-6 Astra im selben Test nahezu null erreichen, weil sie die Aufgabe ablehnen.

Bewerteter BenchmarkVon Mistral angegebener WertVon Mistral angeführter Vergleich
DeepSWE v1.161,7 %—
Coding Agent Index (kombiniert)49,8 %vor DeepSeek V4 Pro 0813 und Qwen3.8 Max
Menschliche Blindbewertung von Surge AI (Code, von 5)3,74, 2. von 5hinter Claude Opus 5 (4,22)
Cybench (40 Herausforderungen)93 %—
AA Cyber Index, eine Sicherheitslücke reproduzieren und anschließend beheben82 %bester Wert aller Modelle
AutomationBench (657 Geschäftsprozesse)59,9 %vor Kimi K3, MiMo-V2.6-Pro und DeepSeek V4 Pro

Der Beitrag und die Modellübersicht unterscheiden sich auch beim Preis: Die Übersicht im Beitrag zeigt 1,36 Dollar pro Million Eingabe-Tokens und 4,18 Dollar für die Ausgabe, während die Modellübersicht diese Preise durchstreicht und daneben einen halbierten Preis angibt, ohne Laufzeit oder Erklärung.

Eigenschaft von ML4Laut AnkündigungsbeitragLaut Modellübersicht in der Dokumentation
Parameter insgesamt1 000 Milliarden1 050 Milliarden
Aktive Parameter49 Milliarden52 Milliarden
Eingabe, pro Million Tokens1,36 Dollar0,68 Dollar (1,36 durchgestrichen)
Ausgabe, pro Million Tokens4,18 Dollar2,09 Dollar (4,18 durchgestrichen)

Alle diese Werte stammen von Mistral. Das Unternehmen erklärt, dass das Reinforcement Learning der Vorabversion ohne Anzeichen einer Sättigung fortgesetzt wird, und erwartet schnelle Fortschritte in den kommenden Wochen.

🔗 Mistral-Beitrag zu Mistral Large 4 🔗 Modellübersicht zu Mistral Large 4 in der Dokumentation


Claude for Google Workspace: Claude zieht in Docs, Sheets und Slides ein

6. Oktober — Anthropic veröffentlicht Claude for Google Workspace, eine Erweiterung (add-on), die Claude in einer Seitenleiste von Google Docs, Sheets und Slides öffnet, als öffentliche Beta für alle kostenpflichtigen Pläne. Claude liest die geöffnete Datei, sieht die aktuelle Auswahl (Text, Zellen oder Folien) und bearbeitet die Datei direkt.

Google-AnwendungWas Claude dort erledigt
DocsKorrekturen und Stiländerungen direkt im Dokument, Vorschlagskarten zum Übernehmen oder Verwerfen umfangreicherer Überarbeitungen
SheetsFormeln, Pivot-Tabellen, native Diagramme, neue Tabellenblätter, Verarbeitung eines Zellbereichs mit Python für einen Join oder eine Bereinigung
SlidesFolien auf Grundlage der Layouts und des Designs der Präsentation, Kontrolle von Elementen, die sich überlappen oder über den Rand hinausragen

Der Nutzer wählt den Grad der Autonomie: Im standardmäßig aktiven Modus „Vor Änderungen fragen“ (Ask before edits) wird jede Änderung über eine Freigabekarte bestätigt; im Modus „Alle Änderungen akzeptieren“ (Accept all edits) arbeitet Claude ohne Unterbrechung weiter. Mit dem Claude-Konto verbunden, nutzt die Seitenleiste dieselben Modelle, Konnektoren und Fähigkeiten (skills). Bei Enterprise-Plänen gelten die Compliance API, die vom Kunden verwalteten Verschlüsselungsschlüssel (CMEK) und der OpenTelemetry-Audit-Export auch für die Erweiterung.

Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.

🇩🇪 Claude funktioniert jetzt in Google Docs, Sheets und Slides, und diese Dateien lassen sich auch in Claude öffnen. In Google Workspace befindet sich Claude in einer Seitenleiste neben Ihrer Datei, liest die von Ihnen geöffnete Datei und bearbeitet sie direkt. Sie können jede Änderung genehmigen, bevor sie angewendet wird. — @claudeai auf X

Gleichzeitig wird auch der umgekehrte Weg möglich: Neue Konnektoren für Google Docs, Sheets und Slides, ebenfalls in der Beta, ermöglichen es, Google-Dateien aus Claude heraus zu erstellen und zu bearbeiten, indem man einen Link einfügt oder ein neues Dokument anfordert. In unterstützten Konfigurationen öffnet sich die Datei in einem Bereich neben dem Gespräch, und Claudes Zugriff richtet sich nach den Freigabeberechtigungen von Google. Die Erweiterung lässt sich über den Google Workspace Marketplace installieren (Extensions > Claude > Open Claude), und Administratoren können sie über die Google Admin-Konsole bereitstellen; bei Team und Enterprise muss ein Inhaber zunächst die Konnektoren aktivieren. Damit kommt Google Workspace zu Microsoft 365 hinzu, wo Claude für Excel, PowerPoint und Word seit dem 7. Mai allgemein verfügbar ist.

🔗 Anthropic-Beitrag zu Claude for Google Workspace


Cyber Verification Program: Anthropic stellt Opus 5.5, Sonnet 5.5 und Mythos 5.1 mit drei Zugriffsstufen bereit

6. Oktober — Anthropic gestaltet sein Cyber-Verifizierungsprogramm (Cyber Verification Program, CVP) neu, das verifizierten Sicherheitsfachleuten Fähigkeiten zugänglich macht, die seine Modelle für die breite Öffentlichkeit blockieren. Seit sechs Monaten bestanden zwei Angebote nebeneinander: Project Glasswing, das Organisationen, die für die kritischste Software verantwortlich sind, Zugang zu Claude Mythos gewährte, und ein einstufiges CVP, das die Schutzmechanismen der Modelle Opus und Sonnet lockerte. Sie werden zu drei Stufen zusammengeführt, die alle Zugang zu Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 und künftigen Modellen bieten. Die allgemein verfügbaren Modelle (Opus 5.5, Fable 5.1, Sonnet 5.5) behalten dagegen vorsichtige Schutzmechanismen bei, die den Großteil der Arbeiten im Bereich Cybersicherheit blockieren.

ZugriffsstufeAbgedeckte EinsatzbereicheZielgruppe und Wartezeit
Defense AccessSicherheitsleitstelle, Reaktion auf Sicherheitsvorfälle, Reverse Engineering von Malware, SchwachstellenanalyseSicherheitsteams, kritische Infrastrukturen jeder Größe, Open-Source-Maintainer, Forschende; wenige Tage
Red Team AccessDefensive Einsätze sowie autorisierte Penetrationstests und Übungen mit simulierten Angriffen (red teaming)Nur Organisationen, auf Systemen, die sie testen dürfen; wenige Wochen
Specialized AccessTests sicherheitskritischer Systeme: Luftfahrt, Stromnetze, Telekommunikation, Interbankenüberweisungen, VerwaltungsnetzeEinige Organisationen, die gemeinsam mit der US-Regierung einzeln geprüft werden; übernommene Glasswing-Mitglieder

Bei Red Team Access bleiben Handlungen, die physische Schäden oder massive Störungen verursachen können, etwa der Einsatz von Ransomware, in Echtzeit blockiert. Um seine Einstellungen zu überprüfen, ließ Anthropic Opus 5.5 CyScenarioBench absolvieren, eine Evaluation mehrstufiger Cyberoperationen, jeweils mit den Schutzmechanismen der einzelnen Stufen (10 Herausforderungen, jeweils 5 Versuche).

Von Anthropic getestete Konfiguration (Opus 5.5)Ergebnis auf CyScenarioBench (50 Versuche)
Ohne CVPAlle Aufgaben bereits beim ersten Prompt blockiert
Defense Access46 Versuche im Verlauf blockiert, 4 erfolgreich
Red Team AccessKeine Blockierung, 34 Aufgaben erfolgreich, entsprechend den 67,6 % des Modells ohne Schutzmechanismen

Der Beitrag zieht auch eine erste Bilanz von Glasswing, mit laut Anthropic unvollständigen Zahlen: mindestens 129 000 verifizierte Schwachstellen, die Partner von April bis Juli gefunden haben, dazu 5 500 durch Anthropics Open-Source-Analysen, davon mehr als 33 000 als kritisch oder mit hohem Schweregrad eingestuft. Diese Zahlen beruhen auf 33 Berichten von Partnern, und Anthropic schätzt die tatsächlichen Auswirkungen als „mindestens fünfmal so hoch“ ein. In einem am selben Tag veröffentlichten Erfahrungsbericht erklärt Comcast, bei der Untersuchung von 258 Systemen und rund 170 Millionen Codezeilen mit Claude Mythos Preview eine kritische Authentifizierungslücke gefunden zu haben, und ein Analyst von Booz Allen prüfte 138 Repositories in zwölf Tagen.

In der Praxis verlangt das Programm die Speicherung von Daten, um Missbrauch zu überwachen, bis Enterprise Frontier Safeguards (EFS) verfügbar ist. Damit wird es im weiteren Verlauf dieses Herbstes möglich sein, diese Daten in einer vom Kunden kontrollierten Cloud zu speichern; Organisationen, die Fable 5.1 oder Mythos 5.1 bereits ohne Datenspeicherung nutzen, können dies auch mit dem CVP tun. Das Programm ist auf Claude Platform, Vertex AI und Microsoft Foundry verfügbar und auf Amazon Bedrock ausschließlich für Kunden, die für EFS berechtigt sind. Eine individuelle Bewerbung ist nur für Defense Access mit einem kostenpflichtigen Plan möglich, und auf dieser Stufe muss spätestens am 15. Dezember eine phishingresistente Multifaktor-Authentifizierung eingeführt und auf API-Schlüssel verzichtet werden. Ein Webinar ist für den 14. Oktober um 9 Uhr PT geplant.

🔗 Anthropic-Beitrag zum Cyber Verification Program 🔗 Hilfeseite zum Cyber Verification Program 🔗 Comcast und Booz Allen mit Claude Mythos


EmbeddingGemma 2: Googles offenes Embedding-Modell wird multimodal

6. Oktober — Google DeepMind veröffentlicht EmbeddingGemma 2, die zweite Generation seines offenen Embedding-Modells, das für den Betrieb auf dem Gerät konzipiert wurde. Das erste EmbeddingGemma, das laut Google mehr als 20 Millionen Mal heruntergeladen wurde, verarbeitete ausschließlich Text; das neue projiziert Text (einschließlich Code), Bilder, Video und Audio, einzeln oder kombiniert, in einen gemeinsamen Raum mit 768 Dimensionen. Es basiert auf der Architektur von Gemma 4 und erscheint unter der Apache-2.0-Lizenz.

Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.

🇩🇪 Hier ist EmbeddingGemma 2, unser erstes offenes, nativ multimodales Modell für Embeddings auf dem Gerät. Es geht über Text hinaus und vereint Code, Bilder, Audio und Video in einem gemeinsamen Raum. — @GoogleDeepMind auf X

Das Modell hat 740 Millionen Parameter, ist aber modular aufgebaut: ein Textkern mit 270M, zu dem bei Bedarf ein Vision-Encoder (170M) und ein Audio-Encoder (300M) hinzukommen. Eine reine Textanwendung lädt somit nur 270M Parameter. Mit Quantisierung misst Google auf einem Pixel 11 Pro etwa 191 Mo aktiven RAM für die Textgewichte und 567 Mo für das vollständige multimodale Modell.

Eigenschaft von EmbeddingGemma 2Von Google angegebener Wert
Parameter insgesamt740M (Text 270M, Vision 170M, Audio 300M)
Vektordimensionen768, kürzbar auf 512, 256 oder 128
Kontextfenster8K tokens, viermal so groß wie bei der ersten Version
Aktiver RAM auf Pixel 11 Pro (quantisiert)etwa 191 Mo für reinen Text, 567 Mo für multimodale Nutzung
MTEB Code78,68 gegenüber 68,76 bei der ersten Version
MTEB mehrsprachig v261,36 gegenüber 61,15 bei der ersten Version

Das Lernen von Repräsentationen nach dem „Matrjoschka-Prinzip“ (Matryoshka Representation Learning) ermöglicht es, die Vektoren zu verkürzen und den Speicherbedarf um bis zu den Faktor sechs zu reduzieren; laut Modellkarte wird die Qualität bis hinunter zu 256 Dimensionen nur geringfügig beeinträchtigt, während 128 Dimensionen vor allem für reine Textanwendungen geeignet sind. Der deutlichste Fortschritt betrifft Code, mit laut Google fast zehn Punkten mehr auf MTEB Code, während mehrsprachiger Text auf dem bisherigen Niveau bleibt.

Die angestrebten Einsatzbereiche sind vollständig lokale Suche und Retrieval-Augmented Generation (RAG), beispielsweise das Auffinden einer Videopassage anhand einer Sprachnotiz. Da das Modell den Textsegmentierer (tokenizer) und den Audio-Encoder von Gemma 4 gemeinsam nutzt, können beide mit geringerem Speicherbedarf zusammen laufen. Die Gewichte sind auf Hugging Face und Kaggle verfügbar; die Aufnahme in den Model Garden der Gemini Enterprise Agent Platform wird für „bald“ angekündigt, ohne konkretes Datum. Das Modell wird bereits zum Start von Transformers (Version 5.19.0), sentence-transformers, MLX, vLLM, llama.cpp, Ollama und LM Studio sowie im Browser mit transformers.js unterstützt.

🔗 Ankündigung im Google-Blog 🔗 Modellkarte zu EmbeddingGemma 2 🔗 Gewichte auf Hugging Face


Entscheidungsmodelle: OpenAI öffnet seine Decisions API, Perplexity veröffentlicht Decider v1.1 und halbiert den Preis, der Decision Index 0.3 ordnet sie ein

Entscheidungsmodelle, die eine Option auswählen oder eine Eingabe bewerten, statt eine freie Antwort zu verfassen, standen einen Tag lang im Mittelpunkt: Zwei Anbieter überarbeiten ihr Angebot und ihre Preise, und die Community-Rangliste dieser Kategorie ändert ihre Methodik.

OpenAIs Decisions API in der öffentlichen Beta

6. Oktober — Eine Woche nach ihrer Freigabe mit beschränktem Zugang beim DevDay geht OpenAIs Decisions API in die öffentliche Beta über; die allgemeine Verfügbarkeit wird „in den kommenden Wochen“ erwartet. Sie beantwortet geschlossene Fragen zu einem Text, einem Bild oder beidem mit GPT-6 Luna, dem einzigen verfügbaren Modell, über einen eigenen Endpunkt (POST /v1/decisions); laut OpenAI treffen ihre typisierten Antworten etwa 10-mal schneller ein als mit der Responses API. Die Neuigkeit des Tages ist der Preis: 0,10 Dollar pro Million Eingabetokens, ohne Berechnung der Ausgabe oder des Cache, zuzüglich Aufschlägen für regionale Verarbeitung und langen Kontext.

FragetypAngestrebter EinsatzZurückgegebenes Ergebnis
Prädikat (predicate)Eine Bedingung prüfen, etwa ein beschädigtes Produkt auf einem FotoWahrscheinlichkeit von 0 bis 1, dass die Bedingung erfüllt ist
Auswahl (choice)Eine Option aus einer vorgegebenen Liste auswählenDie Option, die Wahrscheinlichkeit jeder Option und ein Konfidenzwert
Score (score)Auf geordneten Stufen bewerten, etwa die Schwere eines VorfallsMit den Wahrscheinlichkeiten gewichteter Mittelwert der Stufen

Mehrere Fragen können sich in einer einzigen Anfrage auf dieselbe Eingabe beziehen, und Bilder müssen als base64 gesendet werden, ohne gehostete URL oder Datei-ID. Die API unterstützt den Verzicht auf Datenspeicherung (Zero Data Retention) und HIPAA-Anwendungen für berechtigte Kunden, mit Datenresidenz in den USA und Europa.

🔗 Leitfaden zur Decisions API 🔗 Changelog der OpenAI API

Perplexitys pplx-decider-v1.1-27b und der halbierte Preis

6. Oktober — Fünf Tage nach dem Start seiner eigenen Decisions API aktualisiert Perplexity das zugrunde liegende Modell und kündigt dies in einem Thread seines Entwicklerkontos @perplexitydevs an. pplx-decider-v1.1-27b wird mit offenen Gewichten unter der Apache-2.0-Lizenz auf Hugging Face veröffentlicht, behält die Qwen3.8-27B-Basis der v1 bei, liest Text und Bilder in einem Kontext von 250k tokens und entfernt die kausale Maske (causal mask) seiner Schichten mit vollständiger Attention. Die Decisions API, die nun dieses Modell bereitstellt, kostet 0,02 Dollar pro Million Eingabetokens, halb so viel wie die 0,04 Dollar der v1, und die Ausgabe bleibt kostenlos.

Kategorie des Decision Index (Hugging-Face-Modellkarte)Score von JevScore der v1Score der v1.1
Wissen (Knowledge)51,440,948,18
Sprache (Language)62,063,569,45
Informationssuche (Retrieval)55,454,961,26
Tools (Tools)75,179,378,88
Kunst (Arts)37,739,444,66
Gewichteter Gesamtscore57,956,461,56

Laut Modellkarte steigt der Gesamtscore von 56,4 auf 61,56 und liegt damit vor den 57,9 von Jev, dem Entscheidungsmodell von TypeSafe AI, das beim Wissen allerdings weiterhin vorne liegt. Perplexity behauptet außerdem, den besten Score im neuen Decision Index 0.3 zu erzielen. Für das eigene Hosting benötigt man eine GPU, die etwa 49 Gio an Gewichten aufnehmen kann, sowie die bereitgestellte Implementierung, da eine standardmäßige kausale Inferenz das gemessene Verhalten nicht reproduziert.

🔗 Der Thread von @perplexitydevs auf X 🔗 pplx-decider-v1.1-27b auf Hugging Face

Der Decision Index 0.3

6. Oktober — apolinario, Ingenieur bei Hugging Face, veröffentlicht Version 0.3 des Decision Index, der Community-Rangliste offener Entscheidungsmodelle, die das Decision Model von Jev nachbilden. Sie umfasst nun 112 Modelle, darunter 111 offene Nachbildungen, die auf einer NVIDIA RTX PRO 6000 laufen. Die Methodik ändert sich: Der Gesamtscore (Full score) kombiniert 37 öffentliche Benchmarks, private Tests, die dieselben Fähigkeiten messen, und private Aufgaben aus neuen Bereichen, damit der Rang Fähigkeiten widerspiegelt und nicht nur den Erfolg bei bekannten Benchmarks. Außerdem kommt ein Vision-Tab hinzu.

Angezeigter RangEingestuftes ModellGesamtscore
1Perplexity Decider v1.1 (27B)62,8
2Fastino GLiDE ohne Reasoning (28B)60,2
ReferenzJev60,1
3Torchcast Decision 27B59,9
4deck31b (Gemma 4 31B)59,0

Die beiden Scores von Decider v1.1 sind voneinander zu unterscheiden: 61,56 ist der Wert aus Perplexitys Modellkarte, 62,8 der Wert, den diese Rangliste mit ihrer neuen Methodik berechnet. Die privaten Tests werden ihrer Natur nach nicht veröffentlicht.

🔗 apolinarios Ankündigung auf X 🔗 Der Decision Index 0.3


Computersteuerung: OpenAI trainiert GPT-6 Astra mit den Verträgen von Ironclad

6. Oktober — OpenAI startet Forschungskooperationen mit Softwareanbietern, um seine Agenten in Unternehmenssoftware effektiver zu machen, ein Vorhaben im Bereich Computersteuerung (computer use), und beginnt mit Ironclad, einem Spezialisten für KI-gestütztes Vertragsmanagement. Die Teams haben 11 Aufgaben aus den Bereichen Recht, Vertrieb und Einkauf definiert, die laut OpenAI für einen erfahrenen Nutzer jeweils 30 bis 40 Minuten dauern und anhand von 8 bis 50 Kriterien bewertet werden. Ironclad stellte gehostete Umgebungen seiner Software bereit, in denen die Modelle mittels Reinforcement Learning mit synthetischen Aufgaben trainierten, die aus öffentlichen Verträgen der EDGAR-Datenbank der SEC abgeleitet wurden.

OpenAIs Messung bei den 11 AufgabenGPT-5.6 Sol (Reasoning High)GPT-6 Astra (Reasoning Max)
Durchschnittlicher Score41,6 %55,0 % (+32 %)
Geschätzte durchschnittliche Zeit pro Versuch (simuliert)37,0 Minuten19,2 Minuten (-48 %)

GPT-6 Astra ist das erste Frontier-Modell von OpenAI, das mit diesen Aufgaben trainiert wurde, und ein während seiner Entwicklung eingesetztes internes Modell erreicht 63,7 %. Diese Zahlen stammen von OpenAI, und die Zeiten wurden anhand angenommener Verarbeitungsgeschwindigkeiten simuliert und nicht bei Kunden gemessen. OpenAI lädt andere Anbieter ein, Aufgaben vorzuschlagen, die heutige Agenten noch nicht zuverlässig bewältigen.

🔗 OpenAIs Beitrag zur Zusammenarbeit mit Ironclad


APIs und Plattformen: Stufen und BAA der OpenAI API, Dokumente und Bilder in Perplexitys Agent API, GLM-5.3 auf Bedrock

Vier Änderungen betreffen Entwickler, die Inferenz einkaufen: die Zugangsbedingungen zu OpenAIs API, die Tools von Perplexitys Agent API und ein neues offenes Modell im AWS-Katalog.

Die Nutzungsstufen der OpenAI API werden von fünf auf drei reduziert

6. Oktober — OpenAI vereinfacht den Zugang zu den höchsten Anfrageratenlimits (rate limits) seiner API: Aus den fünf kostenpflichtigen Nutzungsstufen werden drei, Build, Launch und Grow. Die höchste Stufe, Grow, erhält man mit insgesamt 500 Dollar an API-Zahlungen, gegenüber 1 000 Dollar für die bisherige höchste Stufe. Organisationen, die sich bereits auf einer kostenpflichtigen Stufe befinden, werden automatisch und ohne eigenes Zutun umgestellt und steigen anschließend auf, sobald ihre kumulierten Guthabenkäufe die Schwellen erreichen; die kostenlose Stufe bleibt auf 100 Dollar pro Monat begrenzt.

NutzungsstufeSchwelle der kumulierten KäufeMonatliches NutzungslimitAstra, Sol und Terra (Anfragen und Tokens pro Minute)Luna (Anfragen und Tokens pro Minute)
Build5 Dollar500 Dollar5 000 und 1 000 0005 000 und 2 000 000
Launch100 Dollar5 000 Dollar10 000 und 4 000 00010 000 und 10 000 000
Grow500 Dollar200 000 Dollar15 000 und 40 000 00030 000 und 180 000 000

🔗 Der Thread von @OpenAIDevs auf X 🔗 Dokumentation der Anfrageratenlimits

BAA und HIPAA-Konformität im Self-Service für die OpenAI API

5. Oktober — Organisationen, die geschützte Gesundheitsdaten mit OpenAIs API verarbeiten, können nun selbst die vom US-amerikanischen HIPAA-Gesetz vorgeschriebene Vereinbarung mit Geschäftspartnern (Business Associate Agreement, BAA) abschließen. Unter Settings > Organization > General akzeptiert ein Administrator das Standard-BAA und aktiviert die Unterstützung für HIPAA-Konformität, ohne Enterprise-Vertrag. Dieser Self-Service ist berechtigten Organisationen mit einer etablierten API-Nutzungshistorie vorbehalten, und die Aktivierung lässt sich über diese Einstellungen nicht rückgängig machen. Individuelle Klauseln müssen weiterhin per E-Mail angefragt werden, mit einer Antwort innerhalb von ein bis zwei Werktagen. OpenAI weist darauf hin, dass der Abschluss des BAA allein eine Anwendung nicht konform macht und dass für ChatGPT Business kein BAA angeboten wird.

🔗 OpenAIs Hilfeartikel zum BAA der API

Perplexitys Agent API liest Dokumente und sucht Bilder

5. Oktober — Der Changelog der Perplexity API erhält am späten Abend drei Einträge. Die Agent API akzeptiert nun PDF-, DOC-, DOCX-, TXT- und RTF-Dokumente als Eingabe, die in die Anfrage eingebettet oder über eine öffentliche HTTPS-URL angegeben werden; die Unterstützung hängt vom gewählten Modell und Anbieter ab. Ein neues Tool, image_search, sucht Bilder im Web und liefert strukturierte Ergebnisse mit der Bildadresse und der Adresse der Ursprungsseite: 1 bis 30 Bilder pro Aufruf, standardmäßig 5, Filter für Domains und Formate sowie eine standardmäßig aktivierte sichere Suche. Es kostet 2,50 Dollar pro 1 000 erfolgreiche Aufrufe, fehlgeschlagene Aufrufe werden nicht berechnet. Der dritte Eintrag korrigiert die Kostenaufschlüsselung: Die Antworten weisen nun die Kosten der in der Sandbox durchgeführten Extraktionen aus, zum unveränderten Tarif von GPT-6 Luna.

🔗 Changelog der Perplexity API 🔗 Dokumentation des Tools image_search

GLM-5.3 von Z.ai auf Amazon Bedrock

6. Oktober — Z.ai kündigt die Verfügbarkeit von GLM-5.3, seinem Flaggschiffmodell mit offenen Gewichten, auf Amazon Bedrock an; die AWS-Modellkarte datiert den Start auf den 5. Oktober. Es handelt sich um ein Mixture-of-Experts-Modell mit 744 Milliarden Parametern, von denen etwa 40 Milliarden pro Token aktiv sind, einem Kontext von einer Million Tokens und bis zu 128 000 Ausgabetokens. Der Zugang ist berechtigten Kunden vorbehalten, die sich an ihr AWS-Account-Team wenden, und das Modell wird ausschließlich über regionsübergreifende Inferenz (US- oder globales Profil) bereitgestellt, mit Prompt-Caching ab 1 024 Tokens und den Servicestufen Standard, Priority, Flex und Reserved. Die Modellkarte nennt keinen Preis und verweist auf die Bedrock-Preisseite. GLM-5.3 folgt auf Kimi K3 (22. September) und Grok 4.7 (28. September), die in den vergangenen zwei Wochen auf Bedrock verfügbar wurden.

🔗 Modellkarte zu GLM 5.3 auf Amazon Bedrock 🔗 Z.ais Ankündigung auf X


Coding-Agenten: Claude Code 2.1.290 bis 2.1.292, Cloud-Sessions, Vibe CLI 2.26.0, Antigravity und Replit

Die Coding-Agenten erhalten fünf Updates, vom Terminal bis zum Editor: drei Versionen von Claude Code in weniger als zwanzig Stunden, einen Leitfaden für Cloud-Sessions, eine Vibe CLI, deren neue Oberfläche in Rust erweitert wird, die Antigravity-Erweiterung für VS Code und ein Replit, das alle Projekte des Nutzers sieht.

Claude Code 2.1.290 bis 2.1.292

5. und 6. Oktober — Claude Code 2.1.290, veröffentlicht am 5. Oktober um 23:33 Uhr UTC, ist eine umfangreiche Version: 190 Einträge, darunter 131 Fehlerkorrekturen. claude attach und claude logs akzeptieren einen Teil des Sitzungsnamens anstelle der Sitzungskennung, und /claude-api managed-agents-onboard wandelt das auf einer Webseite beschriebene Managed-Agents-Modell in ant apply-Dateien um. Das Websuchbudget der interaktiven Sitzung endet nicht mehr nach 200 Aufrufen: Es wird mit 100 Aufrufen pro Stunde aufgefüllt. Bei mittlerem Aufwand (medium) meldet /code-review auf Opus 5.5 und Sonnet 5.5 auch Abweichungen von den Konventionen in CLAUDE.md. In Slack erhält Claude Tag einen Schnellmodus (!fast), ein browser_batch-Aufruf von Claude in Chrome hat 90 statt 60 Sekunden Zeit, und WebFetch schneidet Text jenseits von 100 000 Zeichen nicht mehr stillschweigend ab. pyright und weitere Formen von ps erfordern eine Berechtigung, und mehrere Berechtigungslücken werden geschlossen: vom Shell expandierte Wildcards von rg und git grep, außerhalb der Arbeitsverzeichnisse verlinkte CLAUDE.md-Dateien und ein Organisations-Mod, der durch einen Benutzer-Mod umgangen wurde. Vier Stunden später behebt 2.1.291 zwei Regressionen: Eine trat mit 2.1.290 auf (verlorene Antworten auf Berechtigungsabfragen in Cloud-Sitzungen), die andere mit 2.1.288 (die letzten Nachrichten einer Sitzung gingen beim Beenden verloren).

Am 6. Oktober um 18:59 Uhr UTC ergänzt 2.1.292 (92 Einträge, darunter 64 Fehlerkorrekturen) das Agent-Tool um einen Parameter effort, um einen Subagent mit dem gewünschten Aufwand zu starten, sowie claude plugin install --marketplace, das bei Bedarf den Marktplatz (marketplace) hinzufügt und anschließend das Plugin installiert. Lokale MCP-Server (stdio) handeln nun standardmäßig das Protokoll 2026-07-28 aus (MCP_PROTOCOL_NEGOTIATION=legacy zum Zurückwechseln), CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS verlängert die Wiederholungsversuche bei 529-Fehlern, und die Mods erhalten ein Ereignis zur Prompt-Autovervollständigung sowie einen Prompt-Cache. In puncto Sicherheit umgehen Freigaben durch einen PreToolUse-Hook und der Auto-Modus die Berechtigungsabfrage beim Lesen von Netzwerkpfaden (UNC) nicht mehr, und von einem Hook geschriebene <system-reminder>-Tags werden mit Escape-Zeichen versehen, bevor sie Claude erreichen. Das Artifact-Tool listet endlich 200 Artefakte statt 50 auf, und Code Review schlüsselt seine Statistiken nach Repository auf. Weder 2.1.290 noch 2.1.292 wurden auf X angekündigt.

Claude Code-VersionVeröffentlichungsdatum (UTC)Anzahl der EinträgeWichtigste Neuerung
2.1.2905. Oktober, 23 h 33190, darunter 131 FehlerkorrekturenSitzungen anhand ihres Namens auswählen, managed-agents-onboard, aufgefülltes WebSearch-Budget
2.1.2916. Oktober, 3 h 552 FehlerkorrekturenZwei Regressionen behoben
2.1.2926. Oktober, 18 h 5992, darunter 64 FehlerkorrekturenAufwand der Subagents, Plugin und Marktplatz mit einem Befehl, MCP 2026-07-28

🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292

Der Leitfaden zu den Cloud-Sitzungen von Claude Code

6. Oktober — Zwei Wochen nach Veröffentlichung der Preview der Cloud-Sitzungen von Claude Code veröffentlicht Anthropic auf claude.dev einen Praxisleitfaden von Addy Osmani. Jede Aufgabe läuft dabei auf einer neuen virtuellen Maschine mit etwa 4 vCPU, 16 GB RAM und 30 GB Festplattenspeicher, wobei das Repository auf einem neuen Branch geklont wird und bei den Tarifen Pro, Max, Team und Enterprise keine zusätzlichen Rechenkosten anfallen. Der Leitfaden beschreibt sieben Einsatzmöglichkeiten: eine Liste ausstehender Aufgaben (backlog) parallel abarbeiten, eine Fehlerkorrektur durch wiederholte Ausführungen verifizieren lassen, lokal planen und anschließend die Sitzung mit claude --teleport fortsetzen, den Fortschritt vom Smartphone aus verfolgen, CI-Fehlschläge und Review-Kommentare an Auto-fix übergeben, Routinen auslösen und unsicheren Code in einer anschließend verworfenen VM ausführen. In seiner Demonstration waren alle drei Sitzungen 87 Sekunden nach dem ersten Start abgeschlossen, und ein Projekt kann bis zu 200 neue Unterhaltungen (threads) pro Tag starten. Der Leitfaden erläutert auch die Verbindung zu GitHub: Sich mit GitHub anzumelden und die Claude GitHub-App zu installieren, sind zwei getrennte Berechtigungen, und nur die zweite ermöglicht den Zugriff auf private Repositories. Das Bonusguthaben von 100 Dollar (Pro) oder 250 Dollar (Max) muss vor dem 7. Oktober um 23:59 Uhr PT abgerufen werden und verfällt am 4. November.

🔗 Praxisleitfaden zu Cloud-Sitzungen auf claude.dev 🔗 Die Erinnerung von @ClaudeDevs an das Bonusguthaben

Vibe CLI 2.26.0

6. Oktober — Mistral veröffentlicht Vibe CLI 2.26.0, seinen Coding-Agent für die Kommandozeile, dreizehn Tage nach 2.25.8 und ohne Ankündigung auf X. Mit 33 Ergänzungen, 23 Änderungen und 91 Fehlerkorrekturen ist das Update umfangreich: 72 seiner 147 Einträge betreffen die neue, in Rust geschriebene Oberfläche: einen Assistenten für den ersten Start, einen Sprachmodus (/voice), wiederkehrende Prompts, die mit /loop in natürlicher Sprache beschrieben werden, die Übertragung der Sitzung an Vibe Code Web mit /teleport und den Befehl vibe update. Vibe läuft nun immer auf dem Unified Harness, seiner neuen Laufzeitumgebung, und beendet sich mit einer ausdrücklichen Fehlermeldung, wenn dieser fehlt, statt stillschweigend auf die alte Laufzeitumgebung zurückzufallen. Plugins können ihren eigenen MCP-Server mitbringen, der in ~/.vibe/.env gespeicherte Fallback-API-Schlüssel ist nur noch für seinen Eigentümer lesbar, und die Rust CLI übermittelt nun ihre Nutzungstelemetrie (Startzeit, verwendete Befehle, erkanntes Terminal) an Mistral.

🔗 Release Notes von Mistral Vibe v2.26.0

Die Antigravity-Erweiterung für VS Code 1.7.0

5. Oktober — Google veröffentlicht Version 1.7.0 der Antigravity-Erweiterung für Visual Studio Code, die die Agents von Google Antigravity in den Editor von Microsoft bringt (Unterhaltungen in der Seitenleiste, Inline-Reviews von Diffs, interaktive Pläne), ab VS Code 1.90. Laut Changelog wird sie seit Anfang September etwa wöchentlich aktualisiert; hier wurde bislang noch nicht über sie berichtet. Diese Version 1.7.0 (6 Verbesserungen, 9 Fehlerkorrekturen) verbessert die Code-Reviews: Entscheidungen mit Accept und Reject lassen sich per Tastatur rückgängig machen und wiederherstellen, der Diff-Editor mit nebeneinander angeordneten Ansichten erhält die Buttons Accept All und Reject All, und das automatische Speichern (Auto Save) von VS Code kann ein laufendes Review nicht mehr überschreiben oder beenden. Unter Windows melden native Benachrichtigungen den Abschluss einer Aufgabe, wenn das Fenster nicht im Vordergrund ist, und Google Cloud Workstations sowie Cloud Shell erhalten eine interaktive Authentifizierung. Am selben Tag steigt die Erweiterung für Visual Studio auf 1.0.261005.0 und fügt übermittelten Rückmeldungen Diagnose-Logs bei.

🔗 Changelog von Google Antigravity

Replit und der Kontext aller Projekte

6. Oktober — Replit kündigt an, nun über den Kontext sämtlicher Projekte eines Nutzers zu verfügen. In einer neuen Unterhaltung kann man es bitten, ein bestehendes Projekt zu finden, dort eine Funktion hinzuzufügen oder ein Projekt als Referenz für ein anderes heranzuziehen; Replit liest dann die betreffenden Dateien und startet die Änderungen als Hintergrundaufgaben (background tasks), mit Links zum Überprüfen der Änderungen. Das gewählte Beispiel geht über reinen Code hinaus: die Farbpalette eines „Partner Marketing Hub“ auf zwei weitere Projekte einer Kaffeemarke übertragen. Die Ankündigung besteht aus einem Tweet mit einem Video, ohne Blogbeitrag, Dokumentation oder Preisangaben.

🔗 Die Ankündigung von Replit auf X


Gestapelte Pull Requests von GitHub sind allgemein verfügbar

6. Oktober — GitHub gibt gestapelte Pull Requests (stacked pull requests), die seit dem 30. Juli in der öffentlichen Preview waren, für alle Tarife auf github.com frei: Eine große Änderung wird in kleinere Pull Requests aufgeteilt, die getrennt geprüft und anschließend gemeinsam gemergt werden. GitHub Enterprise Server erhält sie in einer kommenden Version. Laut GitHub mergen Repositories, die Stacks verwenden, 9 % mehr Code als vergleichbare Repositories, und mehr als zwei Drittel der obersten 1 % der Repositories nutzen sie, wobei die Zeit bis zum Merge um 5 % kürzer ist.

Die finale Version vereinfacht den Merge. Wenn sich der Hauptbranch weiterentwickelt, behält „Rebase stack“ die Freigaben für unveränderten Code bei und erzeugt signierte Ersatz-Commits; ein Stack durchläuft die Merge-Warteschlange (merge queue) als eine einzige Gruppe, und ein Stack, dessen Basisbranch gelöscht wurde, erhält ein neues Ziel, statt geschlossen zu werden. Der automatische Merge eines gesamten Stacks kommt „im Laufe der nächsten Wochen“. Für die Nutzung über die Kommandozeile und durch Agents unterstützt die GitHub CLI-Erweiterung gh stack Git-Worktrees.

🔗 Changelog von GitHub zu gestapelten Pull Requests


Mehrsprachige Modelle: Tiny Aya L2-Thinker von Cohere und Falcon-OCR-Arabic von TII

Zwei kleine Modelle widmen sich Sprachen, die große Modelle weniger gut unterstützen: Das eine denkt in der Sprache des Nutzers, das andere liest Dokumente auf Arabisch.

Tiny Aya L2-Thinker von Cohere

6. Oktober — Cohere widmet sich der Sprache, in der Modelle denken: Werden sie auf Spanisch, Arabisch oder Swahili befragt, denken die meisten auf Englisch, bevor sie antworten. Sein Forschungsmodell Tiny Aya L2-Thinker (3,35 Milliarden Parameter) denkt in mehr als 93 % der Fälle in der Sprache des Prompts, über 60 Sprachen hinweg. Das Rezept liegt in der Datenmischung: Mit etwa 1,7 Millionen englischen Reasoning-Beispielen, die von gpt-oss-120b generiert wurden, denkt es nur in 12,8 % der Fälle in der Sprache des Nutzers; etwa 5 000 übersetzte Beispiele pro Sprache, über 44 Sprachen hinweg, erhöhen diesen Anteil auf 86,1 %, und mehrsprachige Daten ohne Reasoning übertragen dieses Verhalten auf weitere Sprachen. Gegenüber seinem auf Englisch denkenden Zwilling sinkt die Genauigkeit bei fünf der sechs Benchmarks um höchstens zwei bis drei Punkte; nur bei PolyMath, einem Benchmark für Wettbewerbsmathematik, fällt der Rückgang deutlicher aus, da eine Trainingsphase mit Reinforcement Learning fehlt. Das Modell verbraucht im Durchschnitt weniger als 5 000 Reasoning-Tokens. Modelle und Daten werden auf Hugging Face unter der nichtkommerziellen Lizenz CC-BY-NC 4.0 veröffentlicht; der Blogbeitrag stellt einen arXiv-Artikel vom 9. September vor.

🔗 Forschungsbeitrag von Cohere zu Tiny Aya L2-Thinker

Falcon-OCR-Arabic von TII

6. Oktober — TII, das emiratische Institut, das die Falcon-Modelle entwickelt, stellt im Blog von Hugging Face Falcon-OCR-Arabic vor, eine arabische Version seines Texterkennungsmodells Falcon OCR. Es behält seine 270 Millionen Parameter und seine Early-Fusion-Architektur bei und wurde durch überwachtes Fine-Tuning mit realen und synthetischen arabischen Dokumenten sowie anschließendes Reinforcement Learning angepasst. In einem von TII selbst erstellten Benchmark (11 974 reale Dokumente, 15 Kategorien) belegt es unter den 17 verglichenen Modellen den zweiten Platz und den ersten bei offiziellen Dokumenten, Verwaltungsformularen, Quittungen und Rechnungen.

Von TII bewertetes ModellTextgenauigkeitTable TEDS-Score
Gemini 3.5 Flash84,34 %51,30 %
Falcon-OCR-Arabic (270M)81,87 %59,95 %
Claude Opus 5.579,22 %43,98 %
GPT Astra75,02 %51,23 %
Chandra OCR 2 (bestes spezialisiertes OCR-Modell)61,67 %32,63 %

Der Blogbeitrag bietet lediglich eine Testumgebung (playground): Zum Zeitpunkt unserer Erhebung waren auf dem Hub keine Modellgewichte von Falcon-OCR-Arabic zu finden, und eine Lizenz wird nicht genannt.

🔗 Der Blogbeitrag von TII zu Falcon-OCR-Arabic


Bibliotheken von Hugging Face: Diffusers 0.41.0 integriert Qwen-Image 2.1, Transformers v5.19.0 nimmt EmbeddingGemma 2 auf

Die beiden großen Modellbibliotheken von Hugging Face veröffentlichen am selben Tag eine neue Version.

Diffusers 0.41.0 und Qwen-Image 2.1

6. Oktober — Diffusers 0.41.0, die Bibliothek von Hugging Face für Diffusionsmodelle, integriert Qwen-Image 2.1, das Modell von Alibaba, das Bildgenerierung und Bildbearbeitung vereint: Es kann nun direkt zum Generieren, Bearbeiten, Erstellen von Bildern mit transparentem Hintergrund (native RGBA-Ausgabe) und Trainieren von LoRAs verwendet werden, wobei die Komponente zur visuellen Generierung 7 Milliarden Parameter umfasst. Das Team ändert auch seinen Rhythmus: Wie Transformers wird Diffusers seine Minor-Releases künftig am Erscheinen neuer Modelle ausrichten, während Patch-Releases Fehlerkorrekturen vorbehalten bleiben. Das Laden mit Tensorparallelismus erlaubt jeder GPU, nur ihren Teil der Gewichte einzulesen, und die Version ergänzt die Pipelines LTX-2.5 DFR sowie Optimierungen für Cosmos 3. Im Gegenzug wird der ONNX-Support zugunsten von Optimum als veraltet gekennzeichnet.

🔗 Release Notes von Diffusers 0.41.0

Transformers v5.19.0

6. Oktober — Sechs Tage nach v5.18.0 nimmt Transformers v5.19.0 das weiter oben vorgestellte EmbeddingGemma 2 auf, mit seinen kürzbaren Vektoren und seinen beim Laden deaktivierbaren Vision- und Audio-Encodern. Beim verteilten Training erhält der Expertenparallelismus eine Token-Verteilung (token dispatch), die für Qwen3 MoE und Mellum standardmäßig aktiviert ist: Der Grad des Expertenparallelismus muss nicht mehr dem des Tensorparallelismus entsprechen, und der Trainer funktioniert mit diesem Modus. Der Cache lässt sich nun Schicht für Schicht konfigurieren, was für heterogene Modelle nützlich ist, und die kontinuierliche Batch-Verarbeitung (continuous batching) unterstützt XPU. Die Version umfasst sechs Breaking Changes, darunter die Rückgabe von Router-Logits für alle MoE und das schrittweise Aufgeben des Präfixes paged|.

🔗 Release Notes von Transformers v5.19.0


Sprachagenten: ElevenLabs startet ElevenAgents Architect in Alpha

6. Oktober — ElevenLabs integriert in ElevenAgents, seine Plattform für Konversationsagenten, einen Experten namens Architect, den Teams per Sprache oder Text nutzen können, um ihre Sprach- oder Textagenten zu erstellen und zu verbessern. Er kennt sämtliche Einstellungen von ElevenAgents (Wissensdatenbank, Prompts, Abläufe, Stimmen, Guardrails, Tools, Simulationen) und ihr Zusammenspiel. Man kann ihm eine Frage, einen fehlgeschlagenen Test, eine Zunahme von Übergaben an menschliche Mitarbeiter oder eine Feststellung aus ElevenAgents Spotlight vorlegen: Er analysiert die Transkripte, ermittelt die Ursache, schlägt eine Änderung vor und schreibt die Simulationen, die sie validieren. Er erstellt auch einen Agent allein anhand einer einfachen Beschreibung. Jede Änderung wird als versionierter, reversibler Entwurf bereitgestellt, und ohne Freigabe geht nichts in Produktion. Architect ist aus dem Produkt heraus zugänglich, aber auch über Claude, Claude Code, ChatGPT, Cursor und Grok Bot. Er ist ab sofort in Alpha verfügbar, ohne Preisangaben oder Ergebniszahlen.

🔗 Blogbeitrag von ElevenLabs zu ElevenAgents Architect


Generative Videos: FLUX 3 laut Black Forest Labs an der Spitze von Physics-IQ Verified

6. Oktober — Black Forest Labs beansprucht den ersten Platz bei Physics-IQ, dem Benchmark von Google DeepMind, der das Verständnis der physischen Welt durch Videomodelle misst: Dem Modell wird der Anfang eines gefilmten realen Experiments gezeigt, und es muss dessen weiteren Verlauf vorhersagen (Flüssigkeiten, Optik, Festkörpermechanik). Die Referenzrangliste Physics-IQ Verified wird von Anates Labs geführt. In der Kategorie Video zu Video liegt FLUX 3 [large] deutlich vor Cosmos3 von NVIDIA, bei höheren Kosten pro Video.

Modell und Methode (Video zu Video)Physics-IQ Verified-ScoreKosten pro normalisiertem Video
FLUX 3 [large], beste von 8 Generierungen64,35 %16,43 Dollar
FLUX 3 [large]61,11 %2,08 Dollar
Cosmos3 Super (NVIDIA)50,80 %0,82 Dollar
Cosmos3 Nano (NVIDIA)43,00 %0,82 Dollar

In der Kategorie Bild zu Video zieht FLUX 3 [large] ebenfalls an Physis-Lang vorbei, der Methode, die NVIDIA am 29. September an die Spitze gesetzt hatte. FLUX 3 [large] ist ein proprietäres Modell, und der Thread nennt für diese Variante weder ein Verfügbarkeitsdatum noch einen Preis.

🔗 Der Thread von @bfl_ai auf X 🔗 Rangliste Physics-IQ Verified


Öffentliche Evaluationen: GeoGuess Bench und RSI Arena

Zwei öffentlich zugängliche Evaluationen weichen von den üblichen Benchmarks ab: Bei einer spielen die Modelle GeoGuessr, bei der anderen stimmt das Publikum über von Agenten trainierte Modelle ab.

GeoGuess Bench

6. Oktober — Hassan, verantwortlich für die Entwicklererfahrung bei Together AI, veröffentlicht GeoGuess Bench, einen persönlichen Benchmark, bei dem die Modelle GeoGuessr spielen: Jedes sieht dieselben 210 Straßenfotos und setzt eine Stecknadel, die nach der Formel des Spiels bewertet wird, mit bis zu 25 000 Punkten pro Partie mit fünf Runden. Claude Opus 5.5 übernimmt die Führung, knapp vor Claude Fable 5.1; für die Überraschung sorgt Muse Glimmer 30B, das Modell von Meta mit offenen Gewichten, auf Platz drei und vor GPT-6 Astra, bei etwa 45-mal geringeren Kosten pro Partie.

Rang bei GeoGuess BenchBewertetes ModellPunktzahl von 25 000Kosten pro Partie
1Claude Opus 5.523 4120,064 Dollar
2Claude Fable 5.123 3070,115 Dollar
3Muse Glimmer 30B (offen)22 4070,0049 Dollar
4GPT-6 Astra21 5620,223 Dollar
5GPT-6.1 Sol21 1940,042 Dollar
6GLM-5.3 Flash (offen)21 1830,0087 Dollar

GLM-5.3 Flash liegt damit gleichauf mit GPT-6.1 Sol, bei etwa fünfmal geringeren Kosten. Es handelt sich um das persönliche Projekt eines Mitarbeiters von Together AI, einem Inferenzanbieter für offene Modelle, und nicht um eine Evaluation des Unternehmens; kein Gemini-Modell ist vertreten, und der Code ist auf GitHub veröffentlicht.

🔗 Hassans Ankündigung auf X 🔗 GeoGuess Bench

RSI Arena

6. Oktober — Zichen Chen kündigt eine neue Runde von RSI Arena an (für rekursive Selbstverbesserung, recursive self-improvement), diesmal mit Hugging Face. KI-Agenten erhielten GPUs und eine einzige Aufgabe: bessere Modelle zu trainieren. Sie wählten selbst die Daten aus, schrieben den Code und führten die Experimente durch. Nach Abschluss der ersten Trainingsrunde wird das Publikum in den Prozess einbezogen: Die Modelle treten in Duellen gegeneinander an, jeder stimmt ab, und die Agenten nutzen dieses Feedback für neue Experimente. Die Inference Endpoints von Hugging Face stellen jedes Modell live bereit, und die Website listet zehn Agenten auf, darunter GPT-6 Astra, Grok 4.7, DeepSeek V4.1 Flash, GLM-5.3 und Muse Spark 1.3; ihr Dashboard zeigte API-Ausgaben von 286,60 Dollar von 300 und 755,17 GPU-Stunden von 1 000 an. Das Team verspricht, jedes von den Agenten trainierte Modell auf dem Hub zu veröffentlichen und am Ende des Experiments sämtliche Artefakte: Daten, Code und den vollständigen Forschungsverlauf jedes Agenten.

🔗 Zichen Chens Ankündigung auf X 🔗 RSI Arena


GPU-Infrastruktur: NVIDIA veröffentlicht AICR v1.0

6. Oktober — NVIDIA veröffentlicht die Version 1.0 von AI Cluster Runtime (AICR), einem offenen Projekt, das Schluss mit der Konfiguration von Kubernetes-GPU-Clustern durch Versuch und Irrtum machen will. Ein beschleunigter Cluster hängt von Dutzenden Komponenten mit voneinander unabhängigen Versionen ab (Kernel, Treiber, Container-Laufzeitumgebungen, Netzwerk, Speicher, Operatoren, Bibliotheken), und eine Kombination, die an einem Ort funktioniert, kann anderswo unbemerkt scheitern. AICR begegnet dem mit validierten Rezepten mit festgeschriebenen Versionen, die für Helm, Argo CD, Flux oder Helmfile aufbereitet werden und signierte Validierungsnachweise für die getestete Hardware enthalten. Die v1.0 legt einen Kompatibilitätsvertrag fest: Die CLI, die REST-API, das Go-SDK, die Struktur der Deployment-Pakete und die Artefaktschemas werden zu stabilen Schnittstellen, und jede inkompatible Änderung erfordert eine neue Hauptversion. NVIDIA spricht von mehr als 100 Mitwirkenden, von denen fast die Hälfte nicht zum Unternehmen gehört, und nennt Integrationen bei Pulumi Labs und im Multicluster-Manager k0rdent von Mirantis.

🔗 Beitrag im technischen Blog von NVIDIA


Claude Startups: bis zu 7 000 Dollar an Produkten und Guthaben sowie ein Startup Stack im Wert von 45 000 Dollar

6. Oktober — Anthropic erweitert den Zugang zu Claude Startups, seinem Programm für Gründer, die auf Claude aufbauen, auf Start-ups, die vor weniger als fünf Jahren gegründet wurden oder in den vergangenen zwei Jahren eine Finanzierung erhalten haben.

ProgrammvorteilVon Anthropic angegebener Wert
Ein Jahr Claude Team, bis zu fünf Premium-Plätze6 000 Dollar (fünf Plätze zu 100 Dollar pro Monat)
Einmaliges API-Guthaben, ab Genehmigung verfügbar1 000 Dollar
Gesamtwert der Claude-Produkte und -Guthabenbis zu 7 000 Dollar
Claude Startup Stack (Partnerangebote)bis zu 45 000 Dollar

Das Jahr Claude Team gilt für Unternehmen, die neu bei Team sind, und sein tatsächlicher Wert hängt von der Anzahl und Art der Plätze ab. Der heute neu eingeführte Claude Startup Stack bündelt Rabatte und Guthaben von Unternehmen, die mit Claude entwickeln, darunter Linear, Lovable, ElevenLabs, Granola und Hex; seine Obergrenze entspricht dem Gesamtwert aller Angebote zu den Listenpreisen von September 2026, und diese Angebote lassen sich nicht alle miteinander kombinieren. Das Programm ergänzt Gesprächstermine mit dem Applied AI-Team von Anthropic, Unterstützung beim Veröffentlichen eines Eintrags auf dem Claude Marketplace und Zugang zu Veranstaltungen.

🔗 Anthropics Beitrag zu Claude Startups 🔗 Der Thread von @claudeai zum Claude Startup Stack


Kurzmeldungen

  • Claude Projects und lokaler Ordner — Dan Fein von Anthropic kündigt an, dass die Cloud-Sitzungen von Claude Projects eine Verbindung zu einem freigegebenen Ordner auf dem Computer herstellen können, auf den sie nur zugreifen, wenn eine Aufgabe es erfordert; die Einführung erfolgt seit dem 5. Oktober schrittweise, und laut Boris Cherny ist das Team fast so weit (Fast geschafft). 🔗 Quelle · 🔗 Boris Cherny
  • Claude in Slack-Gruppennachrichten — Claude kann jetzt wie jeder andere Teilnehmer zu Gruppennachrichten (group DMs) in Slack hinzugefügt werden; Claude antwortet in einem Thread, den es weiter verfolgt, und kann die persönlichen Konnektoren der Person nutzen, die es anspricht, ohne nähere Angaben zu Tarifen oder Zeitplan. 🔗 Quelle
  • Boris Cherny und seine Art zu prompten — Boris Cherny lässt Opus 5.5 eine interaktive Begleitwebsite zu einer Episode des Podcasts Acquired über Home Depot erstellen, einschließlich Aquarellen; ihm zufolge gibt es beim Prompten kein Geheimnis: dem Modell sagen, was man möchte, wie viel Aufwand es dafür betreiben soll und wie es das Ergebnis überprüfen soll. 🔗 Begleitwebsite · 🔗 seine Art zu prompten
  • Atlassian und OpenAI — Im Rahmen einer neuen Vereinbarung werden die Frontier-Modelle der GPT-6-Familie, darunter GPT-6 Astra, die Agenten der Atlassian-Plattform und von Rovo antreiben; mehr als 3 000 Entwickler bei Atlassian nutzen bereits Codex, und weitergehende Jira-Integrationen werden geprüft, ohne dass eine Summe genannt wurde. 🔗 Quelle
  • Codex-Widgets in ChatGPT für iOS — Die Version 1.2026.267 von ChatGPT für iOS vom 2. Oktober ergänzt Widgets für den Home-Bildschirm mit den jüngsten Codex-Aufgaben ausgewählter Computer, weitere für das verbleibende Nutzungskontingent und dessen Zurücksetzung, auch auf dem Sperrbildschirm, sowie eine Einstellung, die die Tastatur geöffnet hält. 🔗 Quelle
  • Gemini CLI v0.63.0 und v0.64.0-preview.0 — Die stabile v0.63.0 übernimmt unverändert die 15 Einträge der Vorabversion vom 29. September, und die Vorabversion v0.64.0-preview.0 fasst die 16 Einträge der Nightly-Versionen vom 30. September bis zum 3. Oktober zusammen: keine neuen Inhalte, und die Nightly-Version vom 6. Oktober ist leer. 🔗 Quelle
  • Python-SDK von Mistral 3.1.0 — Diese automatisch aus der API generierte Version ergänzt vierzehn Evaluierungsoperationen als Beta im Observability-Modul; die Methoden Runs werden nach Workflows.runs verschoben, wodurch bestehender Code trotz eines bloßen Wechsels der Minor-Version nicht mehr funktionieren kann. 🔗 Quelle
  • Qwen Code v0.25.1-preview.0 — Einen Tag nach der v0.25.0 bringt diese Vorabversion 13 Funktionen und 27 Fehlerbehebungen, darunter eine experimentelle Kubernetes-Laufzeitumgebung, Shell-Befehle und eine Überwachung im Hintergrund für den Managed Agent sowie MCP-Regeln, die keinen gleichnamigen Server mehr zulassen. 🔗 Quelle
  • TypeScript-SDK von SpaceXAI 0.2.2 — Diese am 5. Oktober ohne Ankündigung veröffentlichte Version enthält nur eine Änderung: Die Option retryBeforeOutput gilt auch für einen Aufruf von create() ohne kontinuierlichen Datenstrom (streaming), der JSON erwartet. 🔗 Quelle
  • Falcon-Emirati-7B, der emiratische Dialekt — TII spezialisiert Falcon-H1-Arabic 7B auf emiratisches Arabisch: 84,83 % auf Alyah, einem Benchmark mit 1 173 Fragen, und eine Dialekttreue von 0,52 gegenüber bestenfalls 0,05 bei ALLaM, Gemma 3 27B, Jais-2 und Fanar-2, laut dem Bewertungsmodell Gemini 3.7 Flash; das Modell wird nur auf der Chatplattform von TII angeboten. 🔗 Quelle
  • Datasets 5.1.0 — Die am 5. Oktober veröffentlichte Datensatzbibliothek liest nun die Harbor-Umgebungen für Reinforcement Learning, das spaltenorientierte Format Vortex und fünf biologische Formate (FASTA, FASTQ, GenBank, PDB, mmCIF) und behebt eine Sicherheitslücke, durch die ein Archiv in ein benachbartes Verzeichnis schreiben konnte. 🔗 Quelle
  • TRL v1.14.2 — Dieser Fix behebt ein unbemerkt verfälschtes Training: Ohne vLLM stoppten GRPO, RLOO und Distillation bei Modellen wie Gemma oder Phi-3.5 nicht am Ende des Turns und lernten aus dem gesamten folgenden Text bis zur maximalen Länge; außerdem werden drei Abstürze behoben. 🔗 Quelle
  • Jev gegen Wahlkampf-E-Mails — In einem Community-Beitrag sortiert Stephen Solka seine politischen E-Mails mit Jev (99 richtige Antworten bei 100 echten E-Mails, ein falsch positives Ergebnis), anschließend mit einem SetFit-Klassifikator mit 22,6 Millionen Parametern, der auf dem Prozessor läuft: 98 % bei der Pilotevaluation, aber 18 von 23 bei schwierigen Fällen. 🔗 Quelle
  • Open Together am 16. Oktober — vLLM und Hugging Face organisieren Open Together, ein Treffen von Open-Source-Entwicklern, das am Freitag, dem 16. Oktober, in San Francisco die Open Source AI Week eröffnen wird; laut Jeff Boudier stehen 150 Personen auf der Warteliste, und die Kapazität wurde verdoppelt. 🔗 Quelle · 🔗 Jeff Boudier
  • Copilot CLI 1.0.93-2 — Diese Vorabversion ergänzt eine Unternehmenseinstellung, permissions.limitTo, die Netzwerkanfragen auf verwaltete Domains beschränkt, hebt GPT-6.1 Sol, GPT-6 Astra und Luna sowie die Claude 5.5-Modelle im Auswahlmenü hervor und liest die Benutzereinstellungen nur noch aus ~/.copilot/settings.json. 🔗 Quelle
  • AI Scan in der Sicherheitsübersicht — Organisations- und Unternehmensadministratoren sehen nun in der Sicherheitsübersicht (security overview) von GitHub, welche Repositories die KI-Analyse von Pull Requests (AI Scan for pull requests) aktiviert haben, mit zwei Filtern und einer Spalte im CSV-Export. 🔗 Quelle
  • Secret-Erkennung: Lovable, Pydantic und Supabase — Die Secret-Erkennung (secret scanning) von GitHub erkennt fünf neue Secret-Typen, darunter den API-Schlüssel von Lovable, das Logfire-Token und den Schlüssel für die Pydantic AI Gateway sowie zwei Supabase-Token; Lovable Labs tritt auch dem Partnerprogramm von GitHub bei. 🔗 Quelle
  • Versionshinweise von Devin vom 5. Oktober — Vor allem Feinschliff: ein Terminal-Tab im Workspace der Sitzung (das Öffnen von Files oder Terminal aktiviert Devin), Aufwandstufen für Devin Review, die sich über Auslöseaktionen einstellen lassen, und Codeanalysen (code scans), die per Kennung über die API v3 oder den MCP von Devin abrufbar sind. 🔗 Quelle
  • Delta und seine eigenen Worktrees — Im Blog von Delta erklärt Conrad Irwin, warum das Tool Git-Worktrees ersetzt: Jeder Thread hat seinen in DeltaDB gespeicherten Worktree, der zwischen Personen, Agenten und Maschinen repliziert wird, mehrere Agenten arbeiten auf demselben Branch, und ein versioniertes Skript .agents/prepare bereitet jeden Checkout vor; ein Beitrag ohne neue Version. 🔗 Quelle
  • v0: persönliche Konten werden zu Team-Workspaces — Persönliche v0-Konten werden zu Team-Workspaces, wobei Gespräche, Projekte und Einstellungen automatisch migriert werden; die Dokumentation beschränkt bestimmte Funktionen, etwa Team-Vorlagen, jedoch auf die Tarife Plus, Business und Enterprise. 🔗 Quelle
  • v0 und das ChatGPT-Abonnement unter iOS — Das ChatGPT-Abonnement, das v0 seit dem 29. September akzeptiert, lässt sich nun auch in dessen iOS-App nutzen, ohne Preisangaben oder weitere Details. 🔗 Quelle
  • Eleven v4 und Eleven v4 Turbo an der Spitze — ElevenLabs kündigt an, dass seine beiden am 28. September eingeführten Sprachsynthesemodelle die ersten beiden Plätze in der Sprachsynthese-Rangliste (text to speech) von Artificial Analysis belegen; v4 lag dort schon bei der Einführung auf Platz eins. 🔗 Quelle
  • HeyGen Video in 2K — Eine Woche nach seiner Einführung bietet HeyGen Video nun 2K-Auflösung; laut HeyGen liegt es nach Nutzung auf Platz eins der Video-Rangliste von OpenRouter, ohne eigenen Preis für 2K, während die Katalogseite weiterhin 0,01 Dollar pro Sekunde bis Ende Oktober anzeigt. 🔗 Quelle
  • Nano Banana 2.1 auf Pika — Pika ergänzt seine Plattform und seinen Pika API Club um Nano Banana 2.1, die neue Version des Nano Banana-Modells von Google, laut Pika mit besserer visueller Qualität und höherer Geschwindigkeit; Preise oder Kosten in Credits werden nicht angegeben. 🔗 Quelle
  • DOCA GPUNetIO — NVIDIA macht DOCA GPUNetIO zur gemeinsamen Implementierung für GPU-gesteuerte Vernetzung (GDA-KI) für NCCL, NVSHMEM und NIXL/UCX, als vollständige Version im DOCA-SDK und als schlankeres Open-Source-Projekt mit Schwerpunkt auf RDMA Verbs. 🔗 Quelle
  • Green contexts von CUDA — Ein technischer Beitrag von NVIDIA zeigt, wie sich SM für eine kritische Aufgabe reservieren lassen: Auf einer Blackwell-GPU mit 148 SM antwortet ein Kernel auf 8 reservierten SM in 0,007 ms, gegenüber 0,140 ms mit einem priorisierten Stream (stream) und 3,727 ms ohne Priorität. 🔗 Quelle
  • Offene Modelle bei Telekommunikationsanbietern — In einem Positionspapier verweist NVIDIA auf seine Telekommunikationsumfrage 2026, in der 89 % der Befragten Open Source für wichtig halten, sowie auf Erfahrungsberichte von SoftBank, AT&T und Indosat; kein neues Produkt. 🔗 Quelle
  • Perplexitys Leitfaden zu Kollaborationstools — Perplexity vergleicht zehn Kollaborationstools mit KI (Slack, Loom, Confluence, Airtable, Notion, ClickUp, Asana, Monday.com, Trello, Miro), ihre KI-Funktionen und die Tarife, die diese enthalten; keine Produktneuheit. 🔗 Quelle

Was das bedeutet

Entscheidungsmodelle werden zu einer eigenständigen Kategorie mit einem eigenen Preiskampf und einer eigenen Rangliste. Am selben Tag legt OpenAI den Preis seiner Decisions API auf 0,10 Dollar pro Million Eingabe-Tokens fest, und Perplexity senkt seinen auf 0,02 Dollar, halb so viel wie vor fünf Tagen; keiner der beiden Anbieter berechnet die Ausgabe. Diese Modelle verfassen keine Texte, sondern wählen aus oder bewerten: Bezahlt wird das Lesen, und sie sollen schnell sein. OpenAI verspricht dabei Antworten, die etwa zehnmal schneller sind als mit seiner Responses API. Der Decision Index 0.3 dient als Bewertungsinstanz der Community, und seine neue private Hälfte soll Fähigkeiten messen statt den Erfolg auf bekannten Benchmarks. Sein Urteil prägt bereits die Kommunikation der Anbieter: Perplexity beruft sich in seiner Ankündigung darauf, auch wenn die Modellkarte einen anderen Wert angibt als die Rangliste.

KI hält Einzug in Bürotools statt umgekehrt. Claude kommt nach Excel, PowerPoint und Word nun auch in Google Docs, Sheets und Slides, wird in die Gruppennachrichten von Slack integriert, und die GPT-6-Modelle werden die Rovo-Agenten bei Atlassian antreiben. Bei diesen Integrationen geht es nicht mehr nur um die Qualität des Modells, sondern auch um die Kontrolle: ein Modus, in dem jede Änderung genehmigt werden muss, Konnektoren, die Googles Freigabeberechtigungen berücksichtigen, und Enterprise-Kontrollen, die auf das Modul angewendet werden. Dieselbe Logik zieht sich durch die heutigen Agententools, von widerrufbaren Review-Entscheidungen in Antigravity bis zu versionierten Entwürfen in ElevenAgents Architect.

Bei der Cybersicherheit richtet sich der Umfang des Zugangs nach der Verifizierung. Anthropics CVP verändert nicht das Modell, sondern dessen Schutzmechanismen: Auf CyScenarioBench reicht die Spanne beim selben Opus 5.5 von Aufgaben, die ohne Verifizierung bereits beim ersten Prompt blockiert werden, bis zu 34 erfolgreich abgeschlossenen Aufgaben von 50 mit Red Team Access. Mistral führt ein anderes Argument an: ein Modell, das keine Anfragen verweigert. Das Unternehmen gibt einen Wert von 82 % bei einem Cybertest an, den Claude Opus 5.5 und GPT-6 Astra seiner Aussage nach nicht absolvieren wollen. Beide Ansätze stimmen in einem Punkt überein: Der umfassendste Zugang zu Cyberfähigkeiten führt zunächst über verifizierte Fachleute, die vor der Veröffentlichung der Gewichte Partner von Mistral oder Mitglieder von Anthropics Programm sind.

Auch bei der Größe dehnen sich die Modelle in beide Richtungen aus. Am oberen Ende steht Mistral Large 4 mit seinen 1 000 Milliarden Parametern, dessen Gewichte für Ende Oktober angekündigt sind; am unteren Ende stehen EmbeddingGemma 2, das auf einem Telefon mit etwa 567 MB RAM auskommt, Tiny Aya L2-Thinker mit seinen 3,35 Milliarden Parametern oder Falcon-OCR-Arabic mit seinen 270 Millionen, derzeit nur als Demo. Viele der heutigen Zahlen werden allerdings vom Anbieter selbst erhoben: die Werte von Mistral, der von Black Forest Labs beanspruchte erste Platz, der hauseigene Benchmark von TII, die Modellkarte von Perplexity, die von OpenAI bewerteten Aufgaben von Ironclad oder die von GitHub angekündigten Verbesserungen bei Merges. Am Tag einer Ankündigung ist das oft die einzige verfügbare Messung; sie sollte durch unabhängige Bewertungen überprüft werden, was die Gewichte von Mistral Large 4 nach ihrer Veröffentlichung ermöglichen werden.


Quellen