Suchen

Meta veröffentlicht sechs mit Muse Spark verfasste Mathematikartikel, Perplexity startet seine Decisions API, Anthropic eröffnet die Claude Frontier Academy

ai-powered-markdown-translator

Artikel mit gpt-6.1-sol aus dem Französischen ins Deutsche übersetzt.

Projekt auf GitHub ansehen ↗

Am Freitag, dem 2. Oktober, veröffentlicht Meta sechs Mathematikartikel, die Forscher mit seinem Modell Muse Spark erarbeitet haben; laut Meta beantworten fünf davon bislang offene Forschungsfragen. Anthropic stellt 100 Millionen Dollar bereit, um mit der Claude Frontier Academy 10 000 Ingenieure für die Bereitstellung auszubilden, und veröffentlicht Claude Code 2.1.288, während NVIDIA einen DGX Spark mit 64 Go ab 4 999 Dollar ankündigt. Zwei Ankündigungen vom Vorabend ergänzen den Tag: die Decisions API von Perplexity, die mit Wahrscheinlichkeiten antwortet und deren Modell mit offenen Gewichten veröffentlicht wurde, sowie der Satellit von Google, der dessen erste TPU in die Umlaufbahn bringt.


Meta veröffentlicht sechs mit Muse Spark verfasste Mathematikartikel, Ai2 öffnet AstaBrief, Googles KI prognostiziert die Grippe

2. Oktober — Meta veröffentlicht auf seinem Forschungsblog sechs Mathematikartikel, die Forscher mit Muse Spark, seinem eigenen Modell, erarbeitet haben. Laut Meta beantworten fünf davon bislang offene Forschungsfragen, ohne dass der Beitrag angibt, welcher Artikel die Ausnahme bildet. Die Mathematiker haben in den vergangenen Monaten mit Muse Spark 1.1 und 1.2 im Modus Thinking gearbeitet, direkt in der Chatoberfläche von meta.ai, ohne maßgeschneidertes Forschungsgerüst (custom research scaffold).

Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?

🇩🇪 Nachdem unsere KI-Modelle in fünf Wettbewerben in Mathematik, Physik und Chemie Leistungen auf Goldmedaillenniveau erbracht hatten, stellten wir uns eine schwierigere Frage: Kann KI einen Beitrag leisten, wenn ein Problem tatsächlich offen ist und kein Weg zu seiner Lösung existiert? — @AIatMeta auf X

Das vorgestellte Verfahren ist streng: Ein Team von Mathematikern leitet die Forschung, eine zweite Gruppe prüft die Arbeit, und jeder Artikel kennzeichnet die Passagen, die hauptsächlich von den Forschern oder von der KI verfasst wurden. Der Beitrag des Modells variiert stark von Artikel zu Artikel, von unterstützenden Berechnungen bis zum Verfassen ganzer Abschnitte:

Mathematisches GebietVon Meta angekündigtes ErgebnisBeitrag von Muse Spark laut Meta
WahrscheinlichkeitstheorieScharfer Schwellenwert für die Anpassung eines Ellipsoids durch zufällige gaußverteilte Punkte in hoher DimensionBeweisstrategien
DifferentialgleichungenExplosion in endlicher Zeit radialer Lösungen mit negativer Energie der massenkritischen biharmonischen nichtlinearen Schrödinger-Gleichung, eine seit 2015 offene FrageBerechnungen, Prüfung von Argumenten, Überarbeitung des Beweises
GruppentheorieEine semiabelsche Gruppe ist nicht zwangsläufig monomial: Gegenbeispiel der Ordnung 384 zu einer Vermutung von M. Kida (2024)In GAP geschriebenes Suchprogramm, das das Gegenbeispiel gefunden hat
OptimierungExakte Regel dafür, wann eine Zyklenrelaxation das ursprüngliche Problem erfasstProbabilistische Umformulierung, Gegenbeispiel, Beweisstrategie
Arithmetische PhysikDie Zweipunktfunktion der p-adischen Stringtheorie entspricht einer Höhenfunktion auf einer Klasse von Kurven, die weit über die Tate-Kurve hinausgehtMögliche Beweise, drei verfasste technische Abschnitte
Nichtassoziative AlgebraGegenbeispiel der Dimension 3 zu einer Vermutung über auflösbare EvolutionsalgebrenGegenbeispiel und alternative Charakterisierungen

Meta räumt ein, dass drei dieser Probleme auch andernorts gelöst wurden: drei im August veröffentlichte Arbeiten zum gaußschen Schwellenwert, ein am 16. September vom KI-Agenten Nilradical gemeldetes Gegenbeispiel zu Kidas Vermutung sowie Gegenbeispiele zu Evolutionsalgebren von Hu und Wen. Laut Meta wurden die eigenen Ergebnisse unabhängig und mit anderen Ansätzen erzielt. Die Ankündigung folgt auf die von OpenAI, das am 21. September erklärt hatte, ein internes Modell habe mehr als 100 offene Probleme gelöst; Meta betont die unveränderte Nutzung eines allgemein verfügbaren Modells und die Transparenz bezüglich des KI-Anteils, wobei sämtliche Beweise weiterhin von Mathematikern überprüft, korrigiert und neu formuliert werden.

🔗 Offene Forschungsprobleme gemeinsam lösen (Meta AI Research)

AstaBrief 8B: Ai2 öffnet ein Modell, das wissenschaftliche Berichte mit Quellenangaben verfasst

2. Oktober — Ai2 öffnet AstaBrief 8B, ein Modell, das eine Forschungsfrage und Literaturauszüge in einen wissenschaftlichen Bericht mit Quellenangaben umwandelt. Es treibt nun den Modus Fast der Funktion „Bericht erstellen“ von Asta an, der agentischen Wissenschaftsplattform von Ai2, neben dem von Claude betriebenen Modus Thinking. Das Verfahren bleibt einfach: Qwen3-8B, ein überwachtes Fine-Tuning (SFT) anhand von 47 000 Beispielen aus der Pipeline ScholarQA, anschließend eine direkte Präferenzoptimierung (DPO) anhand von etwa 6 000 Paaren, ohne Reinforcement Learning. Die Gewichte, laut Modellkarte unter der Lizenz Apache-2.0, und die Trainingsdaten werden veröffentlicht: Ein Labor kann das Modell auf seiner eigenen Hardware betreiben.

Das Modell verfasst seinen Bericht in einem einzigen Durchlauf. Über die gesamte Pipeline von Asta hinweg dauert ein Bericht im Modus Fast durchschnittlich 51,1 Sekunden gegenüber 178,5 im Modus Thinking, ist also etwa 3,5-mal schneller fertig. In einer kleinen Studie mit menschlichen Bewertern (14 Fragen, 3 Forscher) gewinnt DR Tulu bei der Gesamtpräferenz, doch zwei von drei Forschern bevorzugen AstaBrief hinsichtlich der Genauigkeit der Quellenangaben. Ai2 weist darauf hin, dass der Großteil des Trainings und der Evaluierung aus dem Jahr 2025 stammt und nicht im Vergleich mit aktuellen Modellen wiederholt wurde.

🔗 AstaBrief als Open Source veröffentlichen (Ai2)

Grippe: Ein mit Googles KI entwickeltes Modell belegt in der FluSight-Evaluierung der CDC den ersten Platz unter 39 Modellen

30. September — Google gibt bekannt, dass ein mit seiner KI entwickeltes Modell zur Grippeprognose in der Saison 2025-2026 das beste Modell bei FluSight war. Dieses Programm der US-amerikanischen Centers for Disease Control and Prevention (CDC) bündelt von Oktober bis Mai jede Woche Prognosen zu Krankenhausaufnahmen. Der Saisonabschlussbericht der CDC bestätigt dies: Unter den 39 ausgewählten Modellen aus 53 Einreichungen von 34 Teams liegt bei den Einzelmodellen Google_SAI-FluEns mit einem relativen WIS von 0,56 an erster Stelle (ein Fehlermaß: Je niedriger es ist, desto besser die Prognose), vor drei Modellen mit 0,58, darunter OHT_JHU-nbxd. Das FluSight-Ensemble, das die CDC für ihre öffentliche Kommunikation verwenden, belegt den 7. Platz.

Diese Prognosen wurden mit Empirical Research Assistance (ERA) entwickelt, einem KI-Werkzeug von Google, das Optimierungsalgorithmen für verschiedene wissenschaftliche Gebiete generiert und vertrauenswürdigen Testern zugänglich ist. Der zugehörige Forschungsartikel beschreibt ein autonomes System, das seinen eigenen Prognosecode mittels einer von einem LLM gesteuerten Baumsuche schreibt, bewertet und verbessert; es hat auch Modelle für COVID-19 und das respiratorische Synzytial-Virus (RSV) entwickelt.

🔗 Beitrag von Google Research · FluSight-Bericht 2025-2026 der CDC


Perplexity startet die Decisions API und öffnet pplx-decider-v1-27b, llama.cpp stellt Entscheidungsmodelle bereit

1. Oktober — Perplexity öffnet eine neue API, die Decisions API, und veröffentlicht das zugrunde liegende Modell pplx-decider-v1-27b unter der Lizenz Apache 2.0. Die Ankündigung erfolgte am Abend über @perplexitydevs, den Entwickleraccount des Unternehmens. Statt eine Antwort zu verfassen, liefert dieses Entscheidungsmodell (decision model) eine Wahrscheinlichkeitsverteilung über eine feste Menge von Antworten: Es liest Text, JSON oder Bilder, schreibt aber keine Antwort, generiert keinen Code und erklärt seine Schlussfolgerungen nicht.

Drei Fragetypen sind vorgesehen: noul liefert die Wahrscheinlichkeit für ein Ja, choice wählt aus 1 bis 255 Optionen und liefert für jede eine Wahrscheinlichkeit sowie einen Konfidenzwert, score ordnet den Inhalt auf einer Skala mit höchstens 10 Stufen ein. Eine Anfrage kann bis zu 128 Fragen zu demselben Inhalt stellen und muss einschließlich der Fragen unter 262 144 Eingabe-Tokens bleiben. Der Preis beträgt 0,04 Dollar pro Million Eingabe-Tokens, die Ausgabe ist kostenlos und es fallen keine Gebühren pro Anfrage an; jede Organisation kann unabhängig von ihrem Tarif 10 Anfragen pro Sekunde senden. Perplexity zielt auf Klassifizierung, Routing und Bewertung anhand eines Rasters ab: Sein Referenzbeispiel (cookbook) sortiert Supporttickets, wobei die Decisions API die erste Entscheidung übernimmt und die Agent API die Eskalationen.

Das Modell wurde auf Basis von Qwen3.8-27B durch Fine-Tuning angepasst; seine Gewichte auf Hugging Face benötigen eine CUDA-GPU, die etwa 49 Gio aufnehmen kann, zuzüglich des Arbeitsspeichers. Die Modellkarte vergleicht es anhand von elf Benchmarks mit Jev, einem anderen Entscheidungsmodell, und mit seinem Basismodell, wobei die Ergebnisse von pplx-decider-v1-27b über die API von Perplexity gemessen wurden:

Benchmark (Genauigkeit)Wert von JevWert von Qwen3.8-27B (Basismodell)Wert von pplx-decider-v1-27b
WinoGrande90,70 %73,10 %83,30 %
FinancialPhraseBank76,98 %75,68 %84,18 %
RAGTruth77,27 %61,53 %88,80 %
JudgeBench78,57 %68,86 %78,29 %
BBH94,27 %72,80 %82,80 %
JevBench public hard73,27 %72,28 %70,30 %
TabFact89,80 %78,60 %90,60 %
ContractNLI77,45 %80,78 %80,78 %
Circa84,60 %87,00 %89,20 %
Belebele95,00 %93,20 %94,00 %
TruthfulQA binary92,00 %82,80 %85,40 %
Gesamt (laut Modellkarte)84,51 %74,76 %85,71 %

In der in der Ankündigung hervorgehobenen Zeile „Gesamt“ liegt pplx-decider-v1-27b vor Jev, mit 85,71 % gegenüber 84,51 %, doch die Modellkarte erläutert nicht, wie diese Zeile berechnet wird. Laut der veröffentlichten Tabelle liegt Jev bei sechs der elf Benchmarks weiterhin vorne, darunter BBH und WinoGrande, und bei JevBench public hard fällt das Modell von Perplexity sogar hinter sein Basismodell zurück.

🔗 Ankündigung von @perplexitydevs · Dokumentation der Decisions API · pplx-decider-v1-27b auf Hugging Face

llama.cpp stellt Entscheidungsmodelle mit der zu Jev kompatiblen API /v1/systemone bereit

2. Oktober — Der Server von llama.cpp kann nun Entscheidungsmodelle über einen neuen Endpunkt, /v1/systemone, bereitstellen, der mit dem am 2. Oktober gemergten PR Nr. 29818 hinzugekommen ist. Der von Xuan-Son Nguyen und Victor Mustar verfasste Beitrag von ggml-org beschreibt das Prinzip: Man sendet einen Zustand (Text, JSON, Screenshot) und typisierte Fragen, choice, score (mit 2 bis 10 Stufen) oder noul (Ja oder Nein), und das Modell liefert in einem einzigen Durchlauf eine Wahrscheinlichkeit pro Option. Die API übernimmt das von Jev, dem Modell von TypeSafe, eingeführte Format System One: Ein bestehender Client muss lediglich seine Basis-URL ändern. Ein Routermodus lädt bei Bedarf mehrere Modelle auf demselben Server.

Unterstütztes EntscheidungsmodellModellgrößeBasismodellMedianzeit pro Frage
Julia-1 (mehr als 50 Sprachen)144MmmBERT-small3 ms
Laya421MModernBERT-large5 ms
Kev-4B4BQwen3.5-4B-Base12 ms
lev4BQwen3.5-4B36 ms
OpenJev (liest auch Bilder)27BQwen3.8-27B43 ms

Die Zeiten wurden auf einer NVIDIA RTX PRO 6000 gemessen. Als nächstes Modell ist Clef angekündigt, das Cloudflare am 1. Oktober mit einer zu Jev kompatiblen API vorgestellt hat; ggml-org hat am 2. Oktober die GGUF-Repositories von Clef und Clef-flash auf Hugging Face erstellt.

🔗 Neu in llama.cpp: Entscheidungsmodelle


Anthropic startet die Claude Frontier Academy und stellt 100 Millionen Dollar für die Ausbildung von 10 000 Ingenieuren bereit

2. Oktober — Anthropic startet die Claude Frontier Academy, ein Ausbildungsprogramm mit einer Finanzierungszusage von 100 Millionen Dollar. Ziel ist es, bis Ende 2027 10 000 Ingenieure für den Einsatz fortschrittlicher KI (Frontier Deployed Engineers, FDE) auszubilden. Die ersten Kohorten umfassen Ingenieure von Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley und Novo Nordisk.

Das erste Programm, die Frontier Deployed Engineer Residency, orientiert sich am Modell der medizinischen Ausbildung. Laut Programmseite beginnt es mit einem viertägigen Intensivmodul: drei Tage vor Ort, an denen ein Claude-System für ein simuliertes Unternehmen aufgebaut wird, gefolgt von einer benoteten Prüfung, die das Badge Claude Resident Engineer verleiht. Darauf folgen zwölf Wochen Residency, in denen die Teilnehmenden Claude in ihrer eigenen Organisation einsetzen, und eine abschließende Bewertung für das Badge Claude Frontier Deployed Engineer; die ersten werden Anfang 2027 erwartet.

Der Zugang bleibt beschränkt: Teilnahme auf Nominierung, vorzeitiger Zugang nur für ausgewählte Kunden und Partner, Kohorten in San Francisco, New York und London. Die Academy erweitert das Claude Partner Network (46 000 Unternehmen, mehr als 175 000 Zertifizierungen), das im März mit 100 Millionen Dollar gestartet wurde; der Beitrag sagt nicht, ob das neue Budget zusätzlich bereitgestellt wird.

🔗 Ankündigung von Anthropic · Programmseite


Agents: Claude Code 2.1.288, GLM 5.3 in Cursor, Replit, DeepSeek Harness und der Benchmark SWE-sweep

Claude Code 2.1.288 hebt die Begrenzung für Hintergrundbefehle in interaktiven Sitzungen auf

2. Oktober — Claude Code 2.1.288 erscheint mit 89 Einträgen, darunter 64 Fehlerbehebungen. Die auffälligste Änderung betrifft Befehle, die im Hintergrund gestartet werden: Die mit 2.1.285 eingeführte Zeitbegrenzung (standardmäßig 30 Minuten, maximal 2 Stunden) gilt nur noch für unbeaufsichtigte Sitzungen (-p, Agent SDK, CI, Cloud). Im Terminal, in der Desktop-Anwendung und in VS Code kann ein Hintergrundbefehl wieder unbegrenzt laufen.

Ein versehentlich mit Ctrl+C gelöschter Prompt lässt sich mit der Pfeiltaste nach oben wiederherstellen, /code-review akzeptiert --max-findings, um mehr oder weniger Probleme auszugeben, claude project purge wird zu claude purge, und die am Vortag gestarteten Mods erhalten $.ui.selection(), das den zuletzt im Vollbild ausgewählten Text zurückgibt. Wenn die API mitten in einer Antwort einen Timeout erreicht, setzen nicht interaktive Sitzungen und Subagents bei der Teilantwort fort, statt fehlzuschlagen. Bei der Sicherheit gilt: Ein gefährliches rm, das in ein bash -c-Skript eingeschleust wurde, wird im Modus bypassPermissions nicht mehr ohne Bestätigung ausgeführt, und ein PreToolUse- oder PermissionRequest-Hook, dessen Abgleich fehlschlägt, blockiert jetzt den Aufruf, statt ignoriert zu werden. Außerdem ignoriert der clientseitige Klassifikator des auto-Modus jetzt eine Variable ANTHROPIC_DEFAULT_SONNET_MODEL, die Sonnet 5.5 oder Opus 5.5 angibt, und verwendet stattdessen Claude Sonnet 5.

Sechs Minuten nach dem Release hob @ClaudeDevs You should know hervor, einen integrierten Mod, der einen sekundären Agent startet, um oberhalb des Prompts Informationen anzuzeigen, die man nicht verpassen sollte. Er gehörte bereits zu den sechs integrierten Mods, die am 1. Oktober vorgestellt wurden, und bleibt standardmäßig deaktiviert.

We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin

🇩🇪 Wir fügen Claude Code ein neues Plugin hinzu: You should Know. Es durchsucht Claudes Ausgabe nach wichtigen Informationen, die Ihnen entgehen könnten, um Sie auf dem Laufenden zu halten. Aktivieren Sie es mit: /plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs auf X

🔗 Versionshinweise zu Claude Code 2.1.288

GLM 5.3 und GLM 5.3 Flash kommen zu Cursor

1. Oktober — Cursor nimmt GLM 5.3 und GLM 5.3 Flash, die offenen Modelle von Z.ai, in seine Modellauswahl auf und beansprucht für GLM 5.3 Max den ersten Platz unter den offenen Modellen auf seinem eigenen Benchmark.

GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.

🇩🇪 GLM 5.3 und GLM 5.3 Flash sind jetzt in Cursor verfügbar! GLM 5.3 Max ist das Modell mit offenen Gewichten mit der höchsten Bewertung auf CursorBench 4.0. — @cursor_ai auf X

Die beigefügte Grafik ordnet die Modelle nach ihrem CursorBench-4.0-Score und ihren durchschnittlichen Kosten pro Aufgabe ein, beschriftet aber nur einen Punkt: GLM 5.3 mit dem Zusatz „(max)“, bei 42,6 % und 5,05 Dollar pro Aufgabe. Laut dieser Grafik bleibt GLM 5.3 unter Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1 und Grok 4.7; kein anderes offenes Modell ist darin aufgeführt, und GLM 5.3 Flash erscheint dort nicht. Cursor hat weder Preise noch einen Beitrag noch eine Methodik zur Untermauerung seiner Rangliste veröffentlicht.

Replit stellt GPT-6.1 Sol und Claude Sonnet 5.5 in Agent sowie Jev in seinen AI Integrations bereit

2. Oktober — Das Changelog von Replit fügt zwei aktuelle Modelle zur Auswahl in Replit Agent hinzu: Claude Sonnet 5.5 im Power-Modus und GPT-6.1 Sol im Max-Modus. Derselbe Eintrag stellt Jev, das bereits im Vergleich mit pplx-decider-v1-27b erwähnte Entscheidungsmodell, in den Replit AI Integrations bereit: Eine Anwendung kann Inhalte klassifizieren, Anfragen routen oder potenzielle Kunden anhand schneller, strukturierter Entscheidungen bewerten, ohne einen API-Key verwalten zu müssen. Die Dokumentation präzisiert, dass Jev unter der Kennung jev-latest über OpenRouter bereitgestellt wird. Die Einstellungen öffnen sich jetzt auf einer ganzen Seite, und Enterprise-Konten können Regeln für das gesamte Unternehmen festlegen, mit Ausnahmen pro Team (Workspace). Der Eintrag nennt keine Preise.

🔗 Replit-Changelog vom 2. Oktober

DeepSeek Harness lässt sich auf macOS und Windows installieren

30. September — Der Account @DeepSeekHarness kündigt eine Desktop-Version von DeepSeek Harness, dem Open-Source-Agent-Harness von DeepSeek, für macOS und Windows an. Am 2. Oktober verbreitet der Hauptaccount @deepseek_ai die Ankündigung weiter und präzisiert, dass Linux-Nutzer das npm-Paket @deepseek-ai/dsh verwenden. Die Installer können auf der Website von DeepSeek heruntergeladen werden, für macOS mit ARM-Chip und für Windows x64.

Die offizielle Seite, mit PREVIEW gekennzeichnet, stellt Harness als weltweit zugängliche öffentliche Vorabversion und als Open Source vor. Es basiert auf der Architektur „Alles ist ein Plugin“ (everything is a plugin) des Frameworks Cordis und deckt Büroarbeit (Dateien, Daten, Dokumente, Präsentationen), Code, Recherche mit Quellenangaben und Hintergrundaufgaben ab, mit einem Creator-Modus, der im Gespräch neue Plugins schreiben lässt. Neu ist die Verteilung: Die Vorabversion vom 29. September integrierte den Befehl dsh bereits in die Desktop-Anwendung, und auf GitHub ist noch keine stabile Version veröffentlicht.

🔗 Ankündigung von @deepseek_ai · Seite zu DeepSeek Harness

SWE-sweep: ein Benchmark, bei dem Agents die zu behebenden Bugs selbst finden müssen

1. Oktober — Forschende von Meta Superintelligence Labs veröffentlichen gemeinsam mit Harvard, der University of Washington und Stanford SWE-sweep, einen Benchmark, bei dem Coding-Agents die Bugs eines echten Repositorys selbst entdecken und möglichst viele davon beheben müssen, ohne Hinweise auf deren Art oder Fundort. Der Datensatz umfasst 100 Repositorys und 4 068 Bugs; der Code steht unter der MIT-Lizenz und basiert auf dem Framework Harbor, und Ofir Press und John Yang gehören zu den Autoren. Für das am 1. Oktober erstellte Repository gibt es noch keine begleitende Ankündigung.

Die am 24. September aktualisierte Rangliste, gemessen mit dem Agent mini-SWE-agent, zeigt das Ausmaß der Aufgabe:

Rang in der RanglisteBewertetes ModellBehobene BugsGesamtkosten
1Sol 5.6 (xhigh), OpenAI4,7 %7 230 dollars
2Luna 5.6 (xhigh), OpenAI2,5 %224 dollars
3Terra 5.6 (xhigh), OpenAI1,5 %357 dollars
4Luna 5.6 (high), OpenAI1,4 %28 dollars
5Opus 5 (xhigh), Anthropic1,3 %5 363 dollars

🔗 SWE-sweep


Rechenleistung und Hardware: erste TPU im Orbit, DGX Spark 64 Go, DeepGEMM und DeepEP auf Ascend 950

Project Suncatcher: Googles Prototyp-Satellit bringt die ersten TPU in den Orbit

1. Oktober — Eine Woche nach der Ankündigung seines ersten Tests im Orbit hat Google den Prototyp-Satelliten von Project Suncatcher gestartet, einem langfristigen Forschungsprojekt (moonshot), das untersucht, ob der Weltraum eines Tages Infrastruktur für Machine Learning im großen Maßstab beherbergen könnte. Der gemeinsam mit Planet gebaute Satellit erreichte den Orbit an Bord von Transporter-18, einer Rideshare-Mission von SpaceX; laut Travis Beals von Google hat das Team Kontakt hergestellt, und der Satellit funktioniert wie vorgesehen.

In den kommenden Wochen wird Google messen, wie seine TPU den Belastungen der Raumfahrt und den extremen Strahlungs- und Temperaturbedingungen standhalten; am Boden hatten Trillium-TPU bereits eine höhere Strahlendosis überstanden als die einer fünfjährigen Mission. Der durch Peer Review geprüfte Artikel, der die Forschung im Detail beschreibt, erscheint in der Fachzeitschrift Joule. Beim Weiterverbreiten der Startmeldung am 2. Oktober erinnert @GoogleAI an das Argument für das Projekt: Im niedrigen Erdorbit ist das Sonnenlicht nahezu konstant, und Satelliten können bis zu 8-mal mehr Solarenergie erzeugen als auf der Erde. Als nächster Schritt sind zwei Satelliten im Jahr 2027 angekündigt, um Laserverbindungen zu testen.

🔗 Der Prototyp von Project Suncatcher ist im Orbit · Der in Joule veröffentlichte Artikel · Die Weiterverbreitung durch @GoogleAI

DGX Spark 64 Go: NVIDIA ergänzt eine Konfiguration, die ab dem 23. Oktober verkauft wird

2. Oktober — NVIDIA ergänzt seinen DGX Spark um eine Konfiguration mit 64 Go Unified Memory neben dem Modell mit 128 Go. Sie wird ab Freitag, dem 23. Oktober, ausschließlich von sechs Partnerherstellern verkauft: Acer, ASUS, Dell, Gigabyte, HP und MSI. Der Einstiegspreis beträgt 4 999 Dollar; der Beitrag nennt den aktuellen Preis des Modells mit 128 Go nicht. Die Basis bleibt dieselbe: GB10-Grace-Blackwell-Chip, DGX OS und NVIDIA-AI-Software-Stack für Modelle mit bis zu 100 Milliarden Parametern, die auf dem Gerät ausgeführt werden.

Das Hauptargument ist die Cluster-Bildung: Zwei Einheiten, die über ein QSFP-Kabel an ihren ConnectX-7-Netzwerkkarten verbunden sind, nutzen ihren Speicher gemeinsam.

Technisches MerkmalEin DGX Spark 64 GoZwei DGX Spark 64 Go im Cluster
Unified Memory64 Go128 Go gemeinsam genutzt
Angekündigte ModellgrößeBis zu 100 Milliarden ParameterBis zu 200 Milliarden Parameter
Leistung mit Qwen 3.8 27B (NVIDIA-Test)ReferenzBis zum 1,7-Fachen

Die Anwendung NVIDIA Sync übernimmt dies mit Cluster Assistant, der die Einheiten erkennt und das Netzwerk konfiguriert. NVIDIA Sync Model Launcher, für Ende des Monats angekündigt, wird Qwen3.8 27B herunterladen und auf einem Gerät oder einem Cluster starten sowie OpenCode für dessen Nutzung konfigurieren.

🔗 NVIDIAs Beitrag zu DGX Spark 64 Go

DeepSeek portiert DeepGEMM und DeepEP auf Huaweis Ascend-950-NPU

29. und 30. September — DeepSeek hat auf GitHub ohne Ankündigung zwei Portierungen seiner Rechenbibliotheken auf Huaweis Ascend-NPU veröffentlicht. DeepGEMM-Ascend, dessen README die erste Version auf den 30. September datiert, übernimmt die API von DeepGEMM unverändert: Matrixmultiplikationen in BF16, FP8 und FP4, MQA-Logits und MegaMoE, unter der MIT-Lizenz, für die Ascend-950-Serie. DeepEP-Ascend portiert die Kommunikationsbibliothek für den Expertenparallelismus (expert parallelism) von MoE-Modellen mit den all-to-all-Operationen zur Verteilung (dispatch) und Zusammenführung (combine).

Auf Ascend 950DT misst DeepEP-Ascend eine Verteilungsrate von 373 bis 375 Go/s mit 8 Ranks und von 313 bis 320 Go/s mit 128 Ranks; bis zu 32 Ranks erreicht es etwa 90 bis 95 % der physikalischen Bandbreitengrenze. Diese Werte wurden mit einem DeepSeek bereitgestellten Hardware-Kit (HDK) für einen Proof of Concept und einer manuellen Konfiguration ermittelt, die beide nicht öffentlich bereitgestellt werden; das README verweist auf die kommerzielle Version, deren Verfügbarkeit Huawei für etwa den 15. Oktober plant.

🔗 DeepGEMM-Ascend auf GitHub · DeepEP-Ascend auf GitHub


Stimme und Audio: Suno Speech in der Beta, ElevenLabs nach FedRAMP 20x Class A zertifiziert

Suno Speech erzeugt gesprochene Sprache und Hintergrundmusik in derselben Audiospur

1. Oktober — Suno stellt Speech als Beta bereit, eine Funktion, die gesprochenes Audio mit origineller Hintergrundmusik direkt in Suno erstellt: Man gibt eine Idee, ein Gedicht oder einen Text ein und beschreibt anschließend die gewünschte Stimme und den Musikstil. Suno stellt Speech als das erste Audiomodell vor, das Stimme und Musik gemeinsam in einer einzigen stimmigen Audiospur erzeugt. Die Funktion wurde einen Monat lang mit einer kleinen Nutzergruppe getestet und steht jetzt nach einem Update der Anwendung allen offen.

Der von Produktchef Jack Brody verfasste Beitrag nennt vor allem persönliche Anwendungen: Nachrichten von Freunden werden zu dramatischen Lesungen, Sprachnotizen werden mit Musik unterlegt, hinzu kommen Meditationen oder Gute-Nacht-Geschichten. Suno weist darauf hin, dass die Beta noch nicht ausgereift ist: Ein britischer Akzent kann ins Australische abgleiten, und dramatische Pausen können sehr ausgeprägt sein. Preise, Tarife und unterstützte Sprachen werden nicht genannt.

🔗 Vorstellung von Speech (Suno)

ElevenLabs erhält die Zertifizierung FedRAMP 20x Class A für ElevenAgents und seine Sprach-APIs

1. Oktober — ElevenLabs erhält die Zertifizierung FedRAMP 20x Class A, den Rahmen, anhand dessen US-Bundesbehörden entscheiden, ob ein Cloud-Produkt sicher mit Regierungsdaten genutzt werden kann. Sie deckt ElevenAgents sowie die APIs Text to Speech und Speech to Text ab, sofern diese im Zero Retention Mode mit Datenresidenz in den Vereinigten Staaten betrieben werden. Sie erweitert das Angebot ElevenLabs for Government, und das Unternehmen ist jetzt im FedRAMP Marketplace gelistet. Laut FedRAMP, von ElevenLabs zitiert, reicht die Stufe Class A für die meisten nicht sensiblen Anwendungsfälle der Behörden aus; ElevenLabs nennt Leistungsanträge, Genehmigungen, Steuern oder die Transkription von Anhörungen.

ElevenLabs stützt die Ankündigung auf bestehende Einsätze im öffentlichen Sektor:

Genannter Einsatz im öffentlichen SektorVon ElevenLabs genannte Kennzahl
Nationale Beschäftigungshotline (Ukraine)25 % von Gesprächsagenten bearbeitet
Leistungs- und Beschäftigungshotlines (Tschechien)85 % von etwa 5 000 Anrufen pro Tag gelöst
Stadt Midland7 000 verpasste Anrufe weniger pro Monat (Prognose)

🔗 Beitrag von ElevenLabs


ChatGPT öffnet Finances für Free- und Go-Nutzer in den USA

2. Oktober — Finances, der Bereich von ChatGPT für persönliche Finanzen, wird in den USA auf die Tarife Free und Go ausgeweitet, im Web sowie auf iOS und Android. Die Funktion war bereits für Plus- und Pro-Abonnenten verfügbar: Im Mai als Vorschau ausschließlich für Pro-Abonnenten gestartet, hatte sie am 21. September die Überwachung des Experian-Kredit-Scores für Plus- und Pro-Abonnenten erhalten. Sie deckt nun die Tarife Free, Go, Plus und Pro ab, weiterhin ausschließlich in den USA.

Das Prinzip bleibt gleich: Bank- und Anlagekonten werden über Plaid verbunden, der Kreditbericht über Experian; beide Verbindungen lassen sich gemeinsam oder getrennt nutzen. Die Seite Finances bündelt Ausgaben, Rechnungen, Abonnements, Nettovermögen, Anlagen und Kredit-Score. Im Gespräch kategorisiert ChatGPT Ausgaben, erkennt Abonnements, vergleicht den aktuellen Monat mit jüngsten Trends und organisiert für die Steuererklärung Informationen und weist auf prüfenswerte Möglichkeiten wie Abzüge hin.

🔗 Versionshinweise zu ChatGPT · Finances in ChatGPT


SpaceXAI veröffentlicht sein offizielles TypeScript-SDK als experimentelle Version

2. Oktober — SpaceXAI hat ohne Ankündigung die erste öffentliche Version seines offiziellen TypeScript-SDK veröffentlicht. Version 0.1.0 erschien um 16:57 Uhr UTC, gefolgt um 18:25 Uhr UTC von Version 0.2.0, die die Client-Klasse xAI in SpaceXAI umbenennt: eine inkompatible Änderung, die den Code an den neuen Unternehmensnamen anpasst. Das SDK deckt bereits die Responses API ab (Streaming, Compaction und Gespräche über mehrere Runden), die integrierten Tools der Plattform (Websuche und X-Suche, Codeausführung, entfernte MCP-Server), die Generierung und Bearbeitung von Bildern und Videos sowie die APIs Files, Batch und Voice.

SDK-ElementFestgestelltes Detail
npm-Paket@xai-official/sdk
LizenzApache-2.0
VoraussetzungenNode.js 22.13 oder neuer, ESM-Projekt, keine Laufzeitabhängigkeiten
StatusExperimentell, Schnittstellen vor 1.0 nicht festgelegt

Standardmäßig verweigert das SDK die Ausführung in einem Browser oder Worker, um den geheimen Schlüssel nicht auf der Client-Seite offenzulegen. TypeScript-Entwickler verfügen damit über ein Gegenstück zum offiziellen Python-SDK, dessen Version 1.20.0 am 24. September erschienen ist.

🔗 CHANGELOG des TypeScript-SDK von SpaceXAI · Das Paket @xai-official/sdk auf npm


Kurzmeldungen

  • GPT-6.1 Sol in v0 — Am 29. September, dem Veröffentlichungstag des Modells, stellte v0, der App-Generator von Vercel, GPT-6.1 Sol bereit, wenige Stunden nachdem die Anmeldung mit einem ChatGPT-Abonnement ermöglicht worden war; die Ankündigung nennt weder Preise noch v0-spezifische Messwerte. 🔗 Quelle
  • Neues Agenten-Dashboard in Grok Build — Das am 1. Oktober angekündigte Dashboard zeigt mit /dashboard alle Agenten auf einem einzigen Bildschirm, startet Aufgaben parallel und platziert einen Agenten mit Ctrl+W in seinem eigenen Git-Worktree; Grok Build hatte am 15. Juni ein erstes Dashboard erhalten. 🔗 Quelle
  • Nightly von Gemini CLI — Die v0.64.0-nightly vom 2. Oktober enthält nur acht Fehlerbehebungen: Ctrl+C bricht wieder einen laufenden Vorgang ab, und der Zustand ~/.gemini/state.json wird atomar geschrieben, mit einer Sicherung .bak, die bei einer Beschädigung wiederhergestellt wird; die stabile Version und die Vorabversion bleiben unverändert. 🔗 Quelle
  • Aus GitHub Copilot entfernte Modelle — Wie am 3. September angekündigt, werden Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code und Claude Opus 4.7 aus allen Copilot-Angeboten entfernt; GitHub empfiehlt Gemini 3.8 Flash, Kimi K3 und nun Claude Opus 5.5 anstelle von Claude Opus 5. 🔗 Quelle
  • Eine SKILL.md testen — In einem Community-Beitrag schlägt Golda Manuel eine Methode ohne veröffentlichte Messwerte vor, um zu prüfen, ob ein Skill gefunden, geladen und von Coding-Agenten sinnvoll genutzt wird: der von Claude Code oder Codex erwartete Speicherort, die Aktivierung bei drei Anfrageebenen sowie ein Vergleich mit und ohne Skill anhand von acht Messgrößen. 🔗 Quelle
  • Manus erläutert Video Editor und Game Dev — Zwei Beiträge vom 1. Oktober gehen näher auf Manus 2.0 ein: Video Editor in Manus Studio platziert jedes Element eines Videos auf einer eigenen Spur (125 Clips zu einem Film von 10 min 50 s mit 195 Schnitten montiert), und Game Dev passt ein Spiel live an; weder Preis noch Datum werden genannt. 🔗 Video Editor · 🔗 Game Dev
  • AutoSynthData von ServiceNow — Das CoreAI-Team von ServiceNow generiert überprüfte Trainingsaufgaben aus den Fehlern eines Modells: Auf EnterpriseOps Gym gewinnt Gemma-4-26B-A4B-it im Bereich Hybrid 7,2 Pass@1-Punkte hinzu und steigt in ITSM von 18,77 % auf 27,18 %; weder Code noch Daten wurden veröffentlicht. 🔗 Quelle
  • POCKET-Darwin-180B — VIDRAFT veröffentlicht eine 4-Bit-GGUF-Version mit 111 GB (gegenüber 360 GB) von Darwin-180B-RSI, einem MoE mit 180 Milliarden Parametern: laut den Autoren 18,4 bis 21 Tokens pro Sekunde bei reinem CPU-Betrieb, 4,17 auf einem Laptop mit einer RTX 5060 mit 8 GB und 87,65 % auf MMLU-Pro, wie beim Original. 🔗 Quelle
  • Leitfaden zu den GPT-6-Modellen — OpenAI veröffentlicht einen Leitfaden für Startups: GPT-6 Astra für die schwierigsten Denkaufgaben, GPT-6.1 Sol für komplexen Code, Recherche und Computernutzung, GPT-6 Luna für gezielte Aufgaben in großem Maßstab; gecachte Tokens kosten je nach Modell bis zu 95 % weniger. 🔗 Quelle
  • ChatGPT digitalisiert auf iOS mehrere Seiten über die Kamera zu einem einzigen PDF — wird seit dem 1. Oktober ausgerollt.
  • Chatham Financial und Codex — Das Beratungsunternehmen für Kapitalmärkte hat mit Codex eine Anwendung zur Transaktionsvalidierung entwickelt: Laut ersten Messungen sinkt die Prüfzeit von etwa 30 Minuten auf weniger als 4; seine Plattform Onyx kombiniert GPT-5.6 Sol und Terra, GPT-5.4 und GPT-4.1. 🔗 Quelle
  • The Den und ChatGPT Work — Laut einer OpenAI-Fallstudie vom 1. Oktober spart das Leitungsteam dieses Clubs für Eltern in Denver mit ChatGPT Work, das mit Gmail, Slack und Google Drive verbunden ist, 10 bis 15 Stunden pro Woche; ein Förderantrag dauert 2 Stunden statt 3 Tage. 🔗 Quelle
  • GPT-6 Astra Ultrafast auf Blackwell — NVIDIA erklärt am 1. Oktober, dass die von OpenAI am 29. September eingeführte Ultrafast-Stufe von GPT-6 Astra auf seinen Blackwell-GPUs läuft, bis zu 8-mal schneller als der Modus Astra Standard, und dass OpenAI seine Inferenzsoftware mit eigenen Modellen optimiert; keine neuen Zahlen. 🔗 Quelle
  • RL Rollouts bei CoreWeave — Dieser am 30. September zusammen mit CoreWeave Forge vorgestellte und am 2. Oktober von NVIDIA aufgegriffene Dienst auf Basis von NVIDIA Dynamo lädt während des Post-Trainings mittels Reinforcement Learning neue Checkpoints im laufenden Betrieb; bei Nemotron 3.5 Lightning verbessert sich die Latenz beim Neuladen des Modells um den Faktor 15. 🔗 Quelle
  • Eleven v4 in ElevenReader — Das ausdrucksstärkste Sprachmodell von ElevenLabs, das am 28. September veröffentlicht wurde, kommt in dessen Lese-App: Artikel, E-Books und PDFs mit der gewählten Stimme, in mehr als 90 Sprachen, auf iOS, Android und im Web. 🔗 Quelle
  • Alpha-Changelog von Midjourney — Das auf den 1. Oktober datierte Changelog enthält vor allem Fehlerbehebungen, darunter pro Ordner gespeicherte Prompt-Einstellungen und zu einem Chip zusammengefasste Stilreferenzen, bevor die für die folgende Woche angekündigten neuen Tools für die Zusammenarbeit erscheinen. 🔗 Quelle
  • Grok 4.7 zum halben Preis in Ramp Router — Bis zum 6. Oktober bietet das LLM-Gateway Ramp Router Grok 4.7 mit 50 % Rabatt an, ein von SpaceXAI aufgegriffenes Angebot; über die API von SpaceXAI kostet das Modell 2 Dollar für die Eingabe und 6 Dollar für die Ausgabe pro Million Tokens. 🔗 Quelle
  • Vertrauliche Kommentare zu Sicherheitshinweisen — GitHub ermöglicht Kommentare zu einem Sicherheitshinweis eines Repositorys, ohne dass die meldende Person sie sieht: Nur Personen mit Schreibzugriff können diese Kommentare lesen, deren Aufrufe protokolliert werden; eine REST API für Kommentare geht in die öffentliche Vorabversion. 🔗 Quelle · 🔗 REST API
  • GraphQL API der GitHub Advisory Database — Das Objekt SecurityAdvisory erhält fünf Felder, darunter die CVE-Kennung und das Veröffentlichungsdatum durch die NVD, und die Abfrage securityAdvisories zwei Filter, nach Schweregrad und Rückzugsstatus: Der Umweg über die REST API entfällt. 🔗 Quelle
  • Ende des macOS-14-Images in GitHub Actions — Die am 1. Oktober angekündigte Entfernung erfolgt am 2. November, nach acht geplanten Unterbrechungen im Oktober von 14 Uhr bis Mitternacht UTC; die Workflows müssen auf macos-15 oder macos-latest umgestellt werden, das auf macos-26 verweist. 🔗 Quelle
  • KI-Reife in Unternehmen — Perplexity veröffentlicht einen Leitfaden, der vier Reifestufen beschreibt, die Rahmenwerke von Gartner, Deloitte und Google Cloud zusammenfasst und ein Raster zur Selbsteinschätzung anbietet; laut der darin zitierten McKinsey-Umfrage von 2026 sehen 80 % der Befragten eine höhere persönliche Produktivität, aber nur 37 % einen Beitrag zum EBIT. 🔗 Quelle

Was das bedeutet

KI in der Wissenschaft wird zunehmend anhand von Kriterien beurteilt, die nicht von denjenigen stammen, die sie vorstellen. Meta begnügt sich nicht damit, Ergebnisse aufzulisten: Jeder Artikel gibt an, welche Passagen die KI verfasst hat, eine zweite Gruppe von Mathematikern prüft sie, und der Beitrag räumt ein, dass drei der Probleme auch andernorts gelöst wurden. Das mit Googles KI entwickelte Modell für Grippeprognosen gewinnt seinen Wert durch eine Bewertung der CDC über eine ganze Saison hinweg im Vergleich mit 38 anderen Modellen. Ai2 veröffentlicht die Gewichte und Daten von AstaBrief, weist aber darauf hin, dass die Vergleiche aus dem Jahr 2025 stammen: Ein offenes Modell lässt sich überprüfen, eine Bewertung veraltet.

Entscheidungsmodelle werden innerhalb weniger Tage zu einer eigenständigen Kategorie. Nach Jev, d1 von Liquid AI und Clef von Cloudflare bietet Perplexity sowohl eine pro Eingabe-Token abgerechnete API als auch die Gewichte seines Modells an; llama.cpp stellt diese Modelle lokal im selben System-One-Format bereit, und Replit nimmt Jev ohne API-Schlüssel in seine Integrationen auf. Für Entwickler ist der Nutzen konkret: eine Wahrscheinlichkeit pro Option, die in einem einzigen Durchlauf ermittelt wird, anstelle einer Textantwort, die anschließend analysiert werden muss. Die Vergleiche erfordern Vorsicht: Die Zeile Overall im Datenblatt platziert pplx-decider-v1-27b vor Jev, doch die veröffentlichten Details sehen Jev bei sechs von elf Benchmarks im Vorteil.

Coding-Agenten machen schneller Fortschritte als ihre tatsächliche Autonomie. Wenn das beste Modell auf SWE-sweep allein mit einem Repository arbeitet, findet und behebt es nur 4,7 % der Bugs, für mehr als 7 000 Dollar. Claude Code 2.1.288 widmet den Großteil seiner 89 Einträge Fehlerbehebungen, darunter die Wiederaufnahme nach einem API-Timeout und mehrere verschärfte Berechtigungsregeln, und hebt einen Mod hervor, der die Arbeit des Hauptagenten überwacht. Anthropic geht den anderen Engpass an, die menschlichen Kompetenzen, und stellt 100 Millionen Dollar bereit, um Ingenieure auszubilden, die eine Bereitstellung bis in den Produktivbetrieb führen können. Offene Modelle wiederum finden ihren Platz in den Tools, mit GLM 5.3 in Cursor und DeepSeek Harness auf dem Desktop.

Die Rechenhardware schließlich entwickelt sich in drei Richtungen weiter. Google testet im Orbit TPUs, die eines Tages von bis zu 8-mal mehr Sonnenenergie als auf der Erde profitieren könnten, NVIDIA ergänzt seinen DGX Spark um eine Konfiguration mit 64 GB, von der zwei Geräte gekoppelt werden können, um 200 Milliarden Parameter zu erreichen, und DeepSeek macht seine Low-Level-Bibliotheken mit derselben API auf den Ascend-Chips von Huawei nutzbar. Jeder erweitert auf seine Weise die Orte und die Hardware, auf denen Modelle laufen können.


Quellen