Szukaj

Meta publikuje sześć artykułów matematycznych napisanych z pomocą Muse Spark, Perplexity uruchamia Decisions API, Anthropic otwiera Claude Frontier Academy

ai-powered-markdown-translator

Artykuł przetłumaczony z francuskiego na polski za pomocą gpt-6.1-sol.

Zobacz projekt na GitHubie ↗

W piątek 2 października Meta publikuje sześć artykułów matematycznych opracowanych przez badaczy z pomocą modelu Muse Spark; według Meta pięć z nich odpowiada na dotąd otwarte pytania badawcze. Anthropic przeznacza 100 milionów dolarów na szkolenie 10 000 inżynierów wdrożeniowych w ramach Claude Frontier Academy i publikuje Claude Code 2.1.288, a NVIDIA zapowiada DGX Spark z 64 Go w cenie od 4 999 dolarów. Dzień uzupełniają dwa ogłoszenia z poprzedniego wieczoru: Decisions API od Perplexity, które odpowiada prawdopodobieństwami i korzysta z modelu o udostępnionych wagach, oraz satelita Google, który zabiera na orbitę pierwsze TPU firmy.


Meta publikuje sześć artykułów matematycznych napisanych z pomocą Muse Spark, Ai2 udostępnia AstaBrief, IA Google prognozuje grypę

2 października — Meta publikuje na swoim blogu badawczym sześć artykułów matematycznych opracowanych przez badaczy z pomocą Muse Spark, własnego modelu firmy. Według Meta pięć z nich odpowiada na dotąd otwarte pytania badawcze, choć wpis nie precyzuje, który stanowi wyjątek. W ostatnich miesiącach matematycy pracowali z Muse Spark 1.1 i 1.2 w trybie Thinking, bezpośrednio w interfejsie czatu meta.ai, bez specjalnie opracowanego środowiska wspomagającego badania (custom research scaffold).

Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?

🇵🇱 Po tym, jak nasze modele IA osiągnęły wyniki na poziomie złotego medalu w pięciu konkursach z matematyki, fizyki i chemii, zadaliśmy sobie trudniejsze pytanie: czy IA może pomóc, gdy problem jest rzeczywiście otwarty i nie istnieje żadna droga prowadząca do jego rozwiązania? — @AIatMeta na X

Przedstawiony protokół jest rygorystyczny: zespół matematyków kieruje badaniami, druga grupa sprawdza pracę, a każdy artykuł wskazuje fragmenty napisane głównie przez badaczy lub przez IA. Wkład modelu znacznie różni się między artykułami, od pomocniczych obliczeń po napisanie całych sekcji:

Dziedzina matematykiWynik ogłoszony przez MetaWkład Muse Spark według Meta
Rachunek prawdopodobieństwaŚcisły próg dopasowania elipsoidy przechodzącej przez losowe punkty gaussowskie w przestrzeni o dużym wymiarzeStrategie dowodzenia
Równania różniczkoweEksplozja w skończonym czasie radialnych rozwiązań o ujemnej energii biharmonicznego nieliniowego równania Schrödingera krytycznego względem masy, problem otwarty od 2015Obliczenia, testowanie argumentów, rewizja dowodu
Teoria grupGrupa półabelowa nie musi być monomialna: kontrprzykład rzędu 384 dla hipotezy M. Kidy (2024)Program do poszukiwań napisany w GAP, który znalazł kontrprzykład
OptymalizacjaDokładna reguła określająca, kiedy relaksacja oparta na cyklach oddaje pierwotny problemPrzeformułowanie probabilistyczne, kontrprzykład, strategia dowodzenia
Fizyka arytmetycznaFunkcja dwupunktowa p-adycznej teorii strun jest równa funkcji wysokości na klasie krzywych znacznie szerszej niż krzywa Tate’aPropozycje dowodów, napisane trzy sekcje techniczne
Algebra niełącznaKontrprzykład wymiaru 3 dla hipotezy dotyczącej rozwiązalnych algebr ewolucyjnychKontrprzykład i alternatywne charakterystyki

Meta przyznaje, że trzy z tych problemów rozwiązano również gdzie indziej: trzy prace dotyczące progu gaussowskiego opublikowano w sierpniu, kontrprzykład dla hipotezy Kidy zgłosił 16 września agent IA Nilradical, a kontrprzykłady dotyczące algebr ewolucyjnych przedstawili Hu i Wen. Według Meta jej własne wyniki uzyskano niezależnie, innymi metodami. Ogłoszenie następuje po zapowiedzi OpenAI, które 21 września podało, że wewnętrzny model rozwiązał ponad 100 otwartych problemów; Meta podkreśla wykorzystanie powszechnie dostępnego modelu bez modyfikacji oraz przejrzystość w kwestii wkładu IA, przy czym wszystkie dowody nadal są sprawdzane, poprawiane i przepisywane przez matematyków.

🔗 Wspólne rozwiązywanie otwartych problemów badawczych (Meta AI Research)

AstaBrief 8B: Ai2 udostępnia model, który pisze raporty naukowe z cytowaniami

2 października — Ai2 udostępnia AstaBrief 8B, model przekształcający pytanie badawcze i fragmenty literatury w raport naukowy z cytowaniami. Model zasila teraz tryb Fast funkcji „Wygeneruj raport” w Asta, platformie agentowej Ai2 dla nauki, obok trybu Thinking opartego na Claude. Receptura pozostaje prosta: Qwen3-8B, nadzorowane dostrajanie (SFT) na 47 000 przykładów wygenerowanych przez pipeline ScholarQA, a następnie bezpośrednia optymalizacja preferencji (DPO) na około 6 000 par, bez uczenia przez wzmacnianie. Wagi, objęte według karty modelu licencją Apache-2.0, oraz dane treningowe zostały opublikowane: laboratorium może uruchomić model na własnym sprzęcie.

Model pisze raport w jednym przebiegu. W całym pipeline Asta przygotowanie raportu zajmuje średnio 51,1 sekundy w trybie Fast wobec 178,5 w trybie Thinking, czyli jest około 3,5 razy szybsze. W niewielkim badaniu z udziałem ludzi (14 pytań, 3 badaczy) pod względem ogólnych preferencji zwycięża DR Tulu, ale dwóch z trzech badaczy preferuje AstaBrief pod względem poprawności cytowań. Ai2 zaznacza, że większość prac nad treningiem i ewaluacją pochodzi z 2025 roku i nie powtórzono ich w odniesieniu do obecnych modeli.

🔗 Udostępnienie AstaBrief jako open source (Ai2)

Grypa: model opracowany z użyciem IA Google pierwszy wśród 39 w ewaluacji FluSight prowadzonej przez CDC

30 września — Google ogłasza, że model prognozowania grypy opracowany z użyciem jego IA był najlepszy w sezonie 2025-2026 w FluSight, systemie amerykańskich Centrów Kontroli i Zapobiegania Chorobom (CDC), który co tydzień, od października do maja, agreguje prognozy przyjęć do szpitali. Potwierdza to raport CDC podsumowujący sezon: spośród 39 modeli wybranych z 53 zgłoszonych przez 34 zespoły najlepszym modelem indywidualnym jest Google_SAI-FluEns, ze względnym WIS wynoszącym 0,56 (miara błędu: im niższa, tym lepsza prognoza), przed trzema modelami z wynikiem 0,58, w tym OHT_JHU-nbxd. Model zespołowy FluSight, który CDC wykorzystują w komunikacji publicznej, zajmuje 7. miejsce.

Prognozy te opracowano z pomocą Empirical Research Assistance (ERA), narzędzia IA od Google, które generuje algorytmy optymalizacyjne dla różnych dziedzin nauki i jest udostępnione zaufanym testerom. Powiązany artykuł badawczy opisuje autonomiczny system, który pisze, ocenia i ulepsza własny kod prognozowania poprzez przeszukiwanie drzewa sterowane przez LLM; system stworzył również modele dla COVID-19 i syncytialnego wirusa oddechowego (VRS).

🔗 Wpis Google Research · Raport CDC FluSight 2025-2026


Perplexity uruchamia Decisions API i udostępnia pplx-decider-v1-27b, llama.cpp obsługuje modele decyzyjne

1 października — Perplexity udostępnia nowe API, Decisions API, i publikuje na licencji Apache 2.0 model, który je napędza, pplx-decider-v1-27b. Ogłoszenie pojawiło się wieczorem na @perplexitydevs, koncie firmy dla deweloperów. Zamiast pisać odpowiedź, ten model decyzyjny (decision model) zwraca rozkład prawdopodobieństwa na ustalonym zbiorze odpowiedzi: odczytuje tekst, JSON lub obrazy, ale nie pisze odpowiedzi, nie generuje kodu i nie wyjaśnia swojego rozumowania.

Przewidziano trzy typy pytań: noul zwraca prawdopodobieństwo odpowiedzi „tak”, choice wybiera spośród 1 do 255 opcji, podając prawdopodobieństwo każdej z nich i wskaźnik pewności, a score umieszcza treść na skali obejmującej najwyżej 10 poziomów. Jedno żądanie może obejmować do 128 pytań dotyczących tej samej treści i musi, łącznie z pytaniami, mieścić się poniżej 262 144 tokenów wejściowych. Cena wynosi 0,04 dolara za milion tokenów wejściowych, tokeny wyjściowe są bezpłatne i nie pobiera się opłaty za żądanie; każda organizacja może wysyłać 10 żądań na sekundę, niezależnie od swojego planu. Perplexity celuje w klasyfikację, routing i ocenianie według skali: przykład referencyjny (cookbook) sortuje zgłoszenia do pomocy technicznej, przy czym Decisions API podejmuje pierwszą decyzję, a Agent API obsługuje eskalacje.

Model dostrojono na bazie Qwen3.8-27B; jego wagi, dostępne na Hugging Face, wymagają GPU CUDA zdolnego pomieścić około 49 Gio oraz dodatkowej pamięci roboczej. Karta modelu porównuje go z Jev, innym modelem decyzyjnym, oraz z jego modelem bazowym na jedenastu benchmarkach, przy czym wyniki pplx-decider-v1-27b zmierzono za pośrednictwem API Perplexity:

Benchmark (dokładność)Wynik JevWynik Qwen3.8-27B (model bazowy)Wynik pplx-decider-v1-27b
WinoGrande90,70 %73,10 %83,30 %
FinancialPhraseBank76,98 %75,68 %84,18 %
RAGTruth77,27 %61,53 %88,80 %
JudgeBench78,57 %68,86 %78,29 %
BBH94,27 %72,80 %82,80 %
JevBench public hard73,27 %72,28 %70,30 %
TabFact89,80 %78,60 %90,60 %
ContractNLI77,45 %80,78 %80,78 %
Circa84,60 %87,00 %89,20 %
Belebele95,00 %93,20 %94,00 %
TruthfulQA binary92,00 %82,80 %85,40 %
Ogółem (według karty modelu)84,51 %74,76 %85,71 %

W wierszu Ogółem, wyeksponowanym w ogłoszeniu, pplx-decider-v1-27b wyprzedza Jev wynikiem 85,71 % wobec 84,51 %, ale karta modelu nie precyzuje, jak obliczono ten wiersz. Według opublikowanej tabeli Jev nadal prowadzi na sześciu z jedenastu benchmarków, w tym BBH i WinoGrande, a na JevBench public hard model Perplexity wypada nawet gorzej od swojego modelu bazowego.

🔗 Ogłoszenie @perplexitydevs · Dokumentacja Decisions API · pplx-decider-v1-27b na Hugging Face

llama.cpp obsługuje modele decyzyjne za pomocą API /v1/systemone, zgodnego z Jev

2 października — Serwer llama.cpp potrafi teraz obsługiwać modele decyzyjne za pośrednictwem nowego endpointu, /v1/systemone, dodanego w PR nr 29818, scalonym 2 października. Wpis ggml-org, którego autorami są Xuan-Son Nguyen i Victor Mustar, opisuje zasadę działania: wysyła się stan (tekst, JSON, zrzut ekranu) i pytania określonych typów, choice, score (od 2 do 10 poziomów) lub noul (tak lub nie), a model zwraca prawdopodobieństwo każdej opcji w jednym przebiegu. API przyjmuje format System One wprowadzony przez Jev, model TypeSafe: istniejący klient musi jedynie zmienić bazowy URL. Tryb routera ładuje wiele modeli na żądanie na tym samym serwerze.

Obsługiwany model decyzyjnyRozmiar modeluModel bazowyMediana czasu na pytanie
Julia-1 (ponad 50 języków)144MmmBERT-small3 ms
Laya421MModernBERT-large5 ms
Kev-4B4BQwen3.5-4B-Base12 ms
lev4BQwen3.5-4B36 ms
OpenJev (odczytuje także obrazy)27BQwen3.8-27B43 ms

Czasy zmierzono na NVIDIA RTX PRO 6000. Następny zapowiedziany model to Clef, który firma Cloudflare zaprezentowała 1 października wraz z API zgodnym z API Jev; ggml-org utworzyło 2 października repozytoria GGUF modeli Clef i Clef-flash na Hugging Face.

🔗 Nowość w llama.cpp: modele decyzyjne


Anthropic uruchamia Claude Frontier Academy i przeznacza 100 milionów dolarów na szkolenie 10 000 inżynierów

2 października — Anthropic uruchamia Claude Frontier Academy, program szkoleniowy wsparty zobowiązaniem do przeznaczenia 100 milionów dolarów. Celem jest wyszkolenie 10 000 inżynierów wdrożeń najnowocześniejszych technologii (Frontier Deployed Engineers, FDE) do końca 2027 roku. Pierwsze grupy obejmują inżynierów z Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley i Novo Nordisk.

Pierwszy program, Frontier Deployed Engineer Residency, nawiązuje do modelu kształcenia medycznego. Według strony programu zaczyna się od intensywnego czterodniowego modułu: trzy dni stacjonarnej pracy nad systemem Claude dla symulowanej firmy, a następnie oceniany egzamin, który pozwala zdobyć odznakę Claude Resident Engineer. Potem następuje dwanaście tygodni rezydentury, podczas której uczestnicy prowadzą wdrożenie Claude we własnej organizacji, oraz końcowa ocena pozwalająca uzyskać odznakę Claude Frontier Deployed Engineer; pierwsze takie odznaki mają zostać przyznane na początku 2027 roku.

Dostęp pozostaje zamknięty: udział wymaga nominacji, wczesny dostęp jest zarezerwowany dla wybranych klientów i partnerów, a grupy szkoleniowe działają w San Francisco, Nowym Jorku i Londynie. Academy rozwija Claude Partner Network (46 000 firm, ponad 175 000 certyfikatów), uruchomiony w marcu z budżetem 100 milionów dolarów; wpis nie wyjaśnia, czy nowe środki stanowią dodatkową kwotę.

🔗 Ogłoszenie Anthropic · Strona programu


Agenci: Claude Code 2.1.288, GLM 5.3 w Cursor, Replit, DeepSeek Harness i benchmark SWE-sweep

Claude Code 2.1.288 znosi limit czasu poleceń działających w tle w sesji interaktywnej

2 października — Claude Code 2.1.288 zawiera 89 pozycji na liście zmian, w tym 64 poprawki. Najbardziej widoczna zmiana dotyczy poleceń uruchamianych w tle: limit czasu wprowadzony w wersji 2.1.285 (domyślnie 30 minut, maksymalnie 2 godziny) obowiązuje już tylko w sesjach bez nadzoru (-p, Agent SDK, CI, cloud). W terminalu, aplikacji desktopowej i VS Code polecenie działające w tle może ponownie pracować bez limitu.

Prompt przypadkowo usunięty za pomocą Ctrl+C można odzyskać strzałką w górę, /code-review obsługuje --max-findings, aby zgłaszać więcej lub mniej problemów, claude project purge zmienia się w claude purge, a mody, wprowadzone dzień wcześniej, otrzymują $.ui.selection(), który zwraca ostatni tekst zaznaczony w trybie pełnoekranowym. Gdy podczas generowania odpowiedzi upłynie limit czasu API, sesje nieinteraktywne i subagenci wznawiają pracę od częściowej odpowiedzi, zamiast zakończyć się błędem. W zakresie bezpieczeństwa niebezpieczny rm umieszczony w skrypcie bash -c nie jest już wykonywany bez potwierdzenia w trybie bypassPermissions, a hook PreToolUse lub PermissionRequest, którego dopasowanie zakończy się niepowodzeniem, blokuje teraz wywołanie, zamiast zostać zignorowany. Wreszcie klasyfikator trybu auto po stronie klienta ignoruje teraz zmienną ANTHROPIC_DEFAULT_SONNET_MODEL wskazującą Sonnet 5.5 lub Opus 5.5 i korzysta w zamian z Claude Sonnet 5.

Sześć minut po wydaniu @ClaudeDevs wyróżnił You should know, wbudowany mod uruchamiający dodatkowego agenta, który wyświetla nad promptem informacje, których nie należy przeoczyć. Mod należał już do sześciu wbudowanych modów przedstawionych 1 października i pozostaje domyślnie wyłączony.

We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin

🇵🇱 Dodajemy nowy plugin do Claude Code: You should Know. Analizuje odpowiedzi Claude w poszukiwaniu ważnych informacji, które mogą Ci umknąć, aby na bieżąco Cię informować. Włącz go za pomocą: /plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs na X

🔗 Informacje o wydaniu Claude Code 2.1.288

GLM 5.3 i GLM 5.3 Flash trafiają do Cursor

1 października — Cursor dodaje GLM 5.3 i GLM 5.3 Flash, otwarte modele Z.ai, do swojego selektora modeli i deklaruje, że GLM 5.3 Max zajmuje pierwsze miejsce wśród modeli otwartych w jego własnym benchmarku.

GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.

🇵🇱 GLM 5.3 i GLM 5.3 Flash są już dostępne w Cursor! GLM 5.3 Max jest najwyżej ocenionym modelem o otwartych wagach w CursorBench 4.0. — @cursor_ai na X

Załączony wykres rozmieszcza modele według wyniku CursorBench 4.0 i średniego kosztu zadania, ale etykietę ma tylko jeden punkt: GLM 5.3 oznaczony jako „(max)”, z wynikiem 42,6 % przy koszcie 5,05 dolara za zadanie. Według tego wykresu GLM 5.3 pozostaje poniżej Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1 i Grok 4.7; nie ma na nim żadnego innego otwartego modelu ani GLM 5.3 Flash. Cursor nie opublikował cennika, wpisu ani metody uzasadniającej ten ranking.

Replit udostępnia GPT-6.1 Sol i Claude Sonnet 5.5 w Agent, a Jev w swoich AI Integrations

2 października — Changelog Replit dodaje dwa najnowsze modele do wyboru w Replit Agent: Claude Sonnet 5.5 w trybie Power i GPT-6.1 Sol w trybie Max. Ten sam wpis udostępnia Jev, model decyzyjny wcześniej wspominany w zestawieniu z pplx-decider-v1-27b, w Replit AI Integrations: aplikacja może klasyfikować treści, kierować zapytania lub oceniać potencjalnych klientów za pomocą szybkich, ustrukturyzowanych decyzji, bez zarządzania kluczem API. Dokumentacja precyzuje, że Jev jest udostępniany pod identyfikatorem jev-latest przez OpenRouter. Ustawienia otwierają się teraz na całej stronie, a konta Enterprise mogą ustalać reguły dla całej firmy, z wyjątkami dla poszczególnych zespołów (Workspace). Wpis nie podaje żadnych cen.

🔗 Changelog Replit z 2 października

DeepSeek Harness można zainstalować na macOS i Windows

30 września — Konto @DeepSeekHarness ogłasza wersję desktopową DeepSeek Harness, narzędzia open source do uruchamiania agentów DeepSeek, dla macOS i Windows. 2 października główne konto @deepseek_ai udostępnia ogłoszenie i wyjaśnia, że użytkownicy Linux korzystają z pakietu npm @deepseek-ai/dsh. Instalatory można pobrać ze strony DeepSeek: dla macOS na układach ARM i dla Windows x64.

Oficjalna strona, oznaczona PREVIEW, przedstawia Harness jako publiczną wersję wstępną, dostępną na całym świecie i open source. Narzędzie opiera się na architekturze „wszystko jest pluginem” (everything is a plugin) frameworka Cordis i obsługuje pracę biurową (pliki, dane, dokumenty, prezentacje), kod, wyszukiwanie z cytowaniem źródeł oraz zadania w tle, a tryb Creator pozwala tworzyć nowe pluginy poprzez rozmowę. Nowość dotyczy dystrybucji: wersja wstępna z 29 września integrowała już polecenie dsh z aplikacją desktopową, a na GitHub nie opublikowano jeszcze żadnej stabilnej wersji.

🔗 Ogłoszenie @deepseek_ai · Strona DeepSeek Harness

SWE-sweep: benchmark, w którym agenci muszą samodzielnie znaleźć bugi do naprawienia

1 października — Badacze z Meta Superintelligence Labs wraz z Harvardem, Uniwersytetem Waszyngtońskim i Stanfordem udostępniają SWE-sweep, benchmark wymagający od agentów kodujących samodzielnego odkrywania bugów w rzeczywistym repozytorium i naprawienia jak największej ich liczby, bez wskazówek dotyczących ich rodzaju ani lokalizacji. Zbiór obejmuje 100 repozytoriów i 4 068 bugów; kod, dostępny na licencji MIT, opiera się na frameworku Harbor, a wśród autorów są Ofir Press i John Yang. Repozytorium, utworzonemu 1 października, nie towarzyszy jeszcze żadne ogłoszenie.

Ranking, zaktualizowany 24 września i opracowany z użyciem agenta mini-SWE-agent, pokazuje skalę zadania:

Pozycja w rankinguOceniany modelNaprawione bugiCałkowity koszt
1Sol 5.6 (xhigh), OpenAI4,7 %7 230 dollars
2Luna 5.6 (xhigh), OpenAI2,5 %224 dollars
3Terra 5.6 (xhigh), OpenAI1,5 %357 dollars
4Luna 5.6 (high), OpenAI1,4 %28 dollars
5Opus 5 (xhigh), Anthropic1,3 %5 363 dollars

🔗 SWE-sweep


Obliczenia i sprzęt: pierwsze TPU na orbicie, DGX Spark 64 Go, DeepGEMM i DeepEP na Ascend 950

Project Suncatcher: prototypowy satelita Google wynosi pierwsze TPU na orbitę

1 października — Tydzień po ogłoszeniu pierwszego testu na orbicie Google wystrzelił prototypowego satelitę Project Suncatcher, długofalowego projektu badawczego (moonshot), który ma sprawdzić, czy przestrzeń kosmiczna mogłaby kiedyś pomieścić infrastrukturę uczenia maszynowego na dużą skalę. Zbudowany wspólnie z Planet satelita trafił na orbitę w ramach Transporter-18, misji współdzielonego wynoszenia ładunków SpaceX; według Travisa Bealsa z Google zespół nawiązał kontakt, a satelita działa zgodnie z planem.

Przez najbliższe tygodnie Google będzie mierzyć, jak jego TPU znoszą obciążenia związane z lotem kosmicznym oraz skrajne poziomy promieniowania i temperatury; na Ziemi TPU Trillium wytrzymały już dawkę promieniowania większą niż podczas pięcioletniej misji. Recenzowany artykuł opisujący badania ukazuje się w czasopiśmie Joule. Udostępniając informację o wystrzeleniu 2 października, @GoogleAI przypomina uzasadnienie projektu: na niskiej orbicie okołoziemskiej światło słoneczne jest niemal stale dostępne, a satelity mogą wytwarzać nawet 8 razy więcej energii słonecznej niż na Ziemi. Zapowiedziany kolejny etap: dwa satelity w 2027 roku do testowania połączeń laserowych.

🔗 Prototyp Project Suncatcher jest na orbicie · Artykuł opublikowany w Joule · Wpis udostępniony przez @GoogleAI

DGX Spark 64 Go: NVIDIA dodaje konfigurację dostępną w sprzedaży od 23 października

2 października — NVIDIA dodaje do DGX Spark konfigurację z 64 Go pamięci zunifikowanej, obok modelu 128 Go. Będzie ona sprzedawana wyłącznie przez sześciu producentów partnerskich: Acer, ASUS, Dell, Gigabyte, HP i MSI, od piątku 23 października, w cenie od 4 999 dolarów; wpis nie podaje aktualnej ceny modelu 128 Go. Podstawa pozostaje taka sama: układ GB10 Grace Blackwell, DGX OS i stos oprogramowania NVIDIA AI, umożliwiające uruchamianie na urządzeniu modeli liczących do 100 miliardów parametrów.

Głównym argumentem jest łączenie w klastry: dwa urządzenia połączone kablem QSFP przez karty sieciowe ConnectX-7 współdzielą pamięć.

Parametr technicznyJeden DGX Spark 64 GoDwa DGX Spark 64 Go w klastrze
Pamięć zunifikowana64 Go128 Go współdzielonej pamięci
Deklarowana wielkość modeluDo 100 miliardów parametrówDo 200 miliardów parametrów
Wydajność na Qwen 3.8 27B (test NVIDIA)Wartość odniesieniaDo 1,7 raza

Zajmuje się tym aplikacja NVIDIA Sync z funkcją Cluster Assistant, która wykrywa urządzenia i konfiguruje sieć. NVIDIA Sync Model Launcher, zapowiedziany na koniec miesiąca, będzie pobierać i uruchamiać Qwen3.8 27B na pojedynczym urządzeniu lub w klastrze oraz konfigurować OpenCode do korzystania z tego modelu.

🔗 Wpis NVIDIA o DGX Spark 64 Go

DeepSeek przenosi DeepGEMM i DeepEP na NPU Ascend 950 firmy Huawei

29 i 30 września — DeepSeek opublikował na GitHub, bez ogłoszenia, dwa porty swoich bibliotek obliczeniowych na NPU Ascend firmy Huawei. DeepGEMM-Ascend, którego README datuje pierwszą wersję na 30 września, zachowuje identyczne API jak DeepGEMM: mnożenie macierzy w BF16, FP8 i FP4, logits MQA oraz MegaMoE, na licencji MIT, dla serii Ascend 950. DeepEP-Ascend przenosi bibliotekę komunikacyjną do równoległego przetwarzania ekspertów (expert parallelism) w modelach MoE, z operacjami all-to-all rozdzielania (dispatch) i ponownego łączenia (combine).

Na Ascend 950DT DeepEP-Ascend osiąga prędkość rozdzielania od 373 do 375 Go/s przy 8 rangach i od 313 do 320 Go/s przy 128 rangach; do 32 rang osiąga około 90 do 95 % fizycznego limitu przepustowości. Wyniki te uzyskano przy użyciu zestawu sprzętowego (HDK) do weryfikacji koncepcji, dostarczonego DeepSeek, oraz ręcznej konfiguracji, które nie zostały udostępnione publicznie; README odsyła do wersji komercyjnej, której dostępność Huawei przewiduje około 15 października.

🔗 DeepGEMM-Ascend na GitHub · DeepEP-Ascend na GitHub


Głos i audio: Suno Speech w wersji beta, ElevenLabs z certyfikatem FedRAMP 20x Class A

Suno Speech generuje mowę i muzykę w tle na jednej ścieżce

1 października — Suno udostępnia w wersji beta Speech, funkcję tworzącą mowę na tle oryginalnej muzyki bezpośrednio w Suno: użytkownik wpisuje pomysł, wiersz lub tekst, a następnie opisuje pożądany głos i styl muzyczny. Suno przedstawia Speech jako pierwszy model audio, który generuje głos i muzykę razem, na jednej spójnej ścieżce. Funkcja, testowana przez miesiąc przez niewielką grupę użytkowników, jest teraz dostępna dla wszystkich po aktualizacji aplikacji.

Wpis, podpisany przez dyrektora ds. produktu Jacka Brody’ego, wymienia przede wszystkim zastosowania osobiste: wiadomości od znajomych przekształcane w dramatyczne odczyty, notatki głosowe z podkładem muzycznym, medytacje lub opowieści na dobranoc. Suno uprzedza, że wersja beta pozostaje niedoskonała: brytyjski akcent może przechodzić w australijski, a dramatyczne pauzy mogą być bardzo mocno zaakcentowane. Nie podano cen, planów ani obsługiwanych języków.

🔗 Przedstawiamy Speech (Suno)

ElevenLabs z certyfikatem FedRAMP 20x Class A dla ElevenAgents i swoich głosowych API

1 października — ElevenLabs uzyskuje certyfikat FedRAMP 20x Class A, w ramach systemu, na podstawie którego amerykańskie agencje federalne decydują, czy produkt cloud może bezpiecznie przetwarzać dane rządowe. Obejmuje on ElevenAgents oraz API Text to Speech i Speech to Text, pod warunkiem działania w Zero Retention Mode i przechowywania danych w Stanach Zjednoczonych. Rozszerza ofertę ElevenLabs for Government, a firma jest teraz obecna w FedRAMP Marketplace. Według FedRAMP, cytowanego przez ElevenLabs, poziom Class A wystarcza dla większości zastosowań agencji niewymagających przetwarzania danych wrażliwych; ElevenLabs wymienia wnioski o świadczenia, zezwolenia, podatki i transkrypcję rozpraw.

ElevenLabs wspiera ogłoszenie przykładami istniejących wdrożeń w sektorze publicznym:

Przywołane wdrożenie w sektorze publicznymDane podane przez ElevenLabs
Krajowa infolinia zatrudnienia (Ukraina)25 % obsługiwanych przez agentów konwersacyjnych
Infolinie świadczeń i zatrudnienia (Czechy)85 % z około 5 000 połączeń dziennie załatwionych
Miasto MidlandO 7 000 mniej nieodebranych połączeń miesięcznie (prognoza)

🔗 Wpis ElevenLabs


ChatGPT udostępnia Finances użytkownikom Free i Go w Stanach Zjednoczonych

2 października — Finances, przestrzeń w ChatGPT poświęcona finansom osobistym, trafia do planów Free i Go w Stanach Zjednoczonych, w wersji webowej oraz na iOS i Androidzie. Funkcja była już dostępna dla subskrybentów Plus i Pro: zadebiutowała w maju w wersji zapoznawczej wyłącznie dla subskrybentów Pro, a 21 września otrzymała funkcję śledzenia oceny kredytowej Experian dla subskrybentów Plus i Pro. Teraz obejmuje plany Free, Go, Plus i Pro, nadal wyłącznie w Stanach Zjednoczonych.

Zasada pozostaje bez zmian: konta bankowe i inwestycyjne łączy się przez Plaid, a raport kredytowy przez Experian; oba połączenia można wykorzystywać razem lub osobno. Strona Finances gromadzi wydatki, rachunki, subskrypcje, majątek netto, inwestycje i ocenę kredytową. W rozmowie ChatGPT kategoryzuje wydatki, wykrywa subskrypcje, porównuje bieżący miesiąc z ostatnimi trendami, a w kwestiach podatkowych porządkuje informacje i wskazuje możliwości warte sprawdzenia, takie jak odliczenia.

🔗 Informacje o wydaniach ChatGPT · Finances w ChatGPT


SpaceXAI publikuje swój oficjalny SDK TypeScript w wersji eksperymentalnej

2 października — SpaceXAI opublikowała bez ogłoszenia pierwszą publiczną wersję swojego oficjalnego SDK TypeScript. Wersja 0.1.0 ukazała się o 16:57 UTC, a o 18:25 UTC pojawiła się wersja 0.2.0, która zmienia nazwę klasy klienta z xAI na SpaceXAI: to zmiana naruszająca kompatybilność, która dostosowuje kod do nowej nazwy firmy. SDK obsługuje już Responses API (streaming, compaction i rozmowy wieloturowe), wbudowane narzędzia platformy (wyszukiwanie w sieci i na X, wykonywanie kodu, zdalne serwery MCP), generowanie i edycję obrazów oraz filmów, a także API Files, Batch i Voice.

Element SDKOdnotowany szczegół
Pakiet npm@xai-official/sdk
LicencjaApache-2.0
WymaganiaNode.js 22.13 lub nowszy, projekt ESM, brak zależności wymaganych podczas wykonywania
StatusEksperymentalny, interfejsy nieustalone przed 1.0

Domyślnie SDK odmawia uruchomienia w przeglądarce lub w Workerze, aby nie ujawnić tajnego klucza po stronie klienta. Programiści TypeScript otrzymują tym samym odpowiednik oficjalnego SDK Python, którego wersja 1.20.0 ukazała się 24 września.

🔗 CHANGELOG SDK TypeScript firmy SpaceXAI · Pakiet @xai-official/sdk na npm


Krótkie wiadomości

  • GPT-6.1 Sol w v0 — 29 września, w dniu premiery modelu, v0, generator aplikacji firmy Vercel, udostępnił GPT-6.1 Sol, kilka godzin po umożliwieniu połączenia przez subskrypcję ChatGPT; ogłoszenie nie podaje cen ani wyników pomiarów dotyczących konkretnie v0. 🔗 źródło
  • Nowy panel agentów w Grok Build — Ogłoszony 1 października panel wyświetla wszystkich agentów na jednym ekranie za pomocą /dashboard, uruchamia zadania równolegle i umieszcza agenta w jego własnym worktree git za pomocą Ctrl+W; Grok Build otrzymał pierwszy panel 15 czerwca. 🔗 źródło
  • Nightly Gemini CLI — Wersja v0.64.0-nightly z 2 października zawiera tylko osiem poprawek: Ctrl+C ponownie anuluje trwającą operację, a stan ~/.gemini/state.json jest zapisywany atomowo, z kopią zapasową .bak przywracaną w razie uszkodzenia; wersje stabilna i zapoznawcza pozostają bez zmian. 🔗 źródło
  • Modele usunięte z GitHub Copilot — Zgodnie z zapowiedzią z 3 września Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code i Claude Opus 4.7 znikają ze wszystkich środowisk Copilot; GitHub sugeruje Gemini 3.8 Flash, Kimi K3, a teraz także Claude Opus 5.5 zamiast Claude Opus 5. 🔗 źródło
  • Testowanie SKILL.md — We wpisie społecznościowym Golda Manuel proponuje metodę, bez opublikowanych wyników pomiarów, sprawdzania, czy umiejętność jest odnajdywana, ładowana i przydatna agentom programistycznym: lokalizacja oczekiwana przez Claude Code lub Codex, aktywacja przy trzech poziomach zapytań oraz porównanie z umiejętnością i bez niej według ośmiu miar. 🔗 źródło
  • Manus szczegółowo opisuje Video Editor i Game Dev — Dwa wpisy z 1 października przedstawiają dokładniej Manus 2.0: Video Editor w Manus Studio umieszcza każdy element filmu na osobnej ścieżce (125 klipów zmontowanych w film o długości 10 min 50 s ze 195 cięciami), a Game Dev dostosowuje grę na żywo; nie podano cen ani daty. 🔗 Video Editor · 🔗 Game Dev
  • AutoSynthData firmy ServiceNow — Zespół CoreAI firmy ServiceNow generuje zweryfikowane zadania treningowe na podstawie niepowodzeń modelu: w EnterpriseOps Gym Gemma-4-26B-A4B-it zyskuje 7,2 punktu Pass@1 w domenie Hybrid i przechodzi z 18,77 % do 27,18 % w ITSM; nie opublikowano kodu ani danych. 🔗 źródło
  • POCKET-Darwin-180B — VIDRAFT publikuje 4-bitową wersję GGUF o rozmiarze 111 GB (zamiast 360 GB) modelu Darwin-180B-RSI, MoE o 180 miliardach parametrów: według autorów osiąga od 18,4 do 21 tokenów na sekundę na samym procesorze, 4,17 na laptopie z RTX 5060 z 8 GB pamięci oraz 87,65 % w MMLU-Pro, tak jak oryginał. 🔗 źródło
  • Przewodnik po modelach GPT-6 — OpenAI publikuje przewodnik dla startupów: GPT-6 Astra do najtrudniejszych zadań wymagających rozumowania, GPT-6.1 Sol do złożonego kodu, badań i korzystania z komputera, GPT-6 Luna do konkretnych zadań na dużą skalę; tokeny w cache kosztują nawet o 95 % mniej, zależnie od modelu. 🔗 źródło
  • ChatGPT skanuje wiele stron do jednego PDF za pomocą aparatu w iOS — wdrażanie w toku, 1 października.
  • Chatham Financial i Codex — Firma doradcza działająca na rynkach kapitałowych zbudowała z pomocą Codex aplikację do zatwierdzania transakcji: według pierwszych pomiarów weryfikacja skraca się z około 30 minut do mniej niż 4; jej platforma Onyx łączy GPT-5.6 Sol i Terra, GPT-5.4 oraz GPT-4.1. 🔗 źródło
  • The Den i ChatGPT Work — Według studium przypadku OpenAI z 1 października zespół kierowniczy tego klubu dla rodziców w Denver oszczędza od 10 do 15 godzin tygodniowo dzięki ChatGPT Work połączonemu z Gmail, Slack i Google Drive; przygotowanie wniosku o dotację zajmuje 2 godziny zamiast 3 dni. 🔗 źródło
  • GPT-6 Astra Ultrafast na Blackwell — NVIDIA wyjaśnia 1 października, że wariant Ultrafast modelu GPT-6 Astra, uruchomiony przez OpenAI 29 września, działa na jej GPU Blackwell, nawet 8 razy szybciej niż tryb Astra Standard, a OpenAI optymalizuje swoje oprogramowanie do inferencji za pomocą własnych modeli; brak nowych danych liczbowych. 🔗 źródło
  • RL Rollouts w CoreWeave — Usługa przedstawiona 30 września wraz z CoreWeave Forge i nagłośniona przez NVIDIA 2 października, zbudowana na NVIDIA Dynamo, ładuje nowe checkpointy bez przerywania pracy podczas dodatkowego treningu z uczeniem przez wzmacnianie; w przypadku Nemotron 3.5 Lightning opóźnienie ponownego ładowania modelu zmniejszono 15 razy. 🔗 źródło
  • Eleven v4 w ElevenReader — Najbardziej ekspresyjny model głosowy ElevenLabs, uruchomiony 28 września, trafia do aplikacji do czytania tej firmy: artykuły, e-booki i PDF odczytywane wybranym głosem, w ponad 90 językach, na iOS, Androidzie i w wersji webowej. 🔗 źródło
  • Changelog wersji alpha Midjourney — Datowany na 1 października, obejmuje głównie poprawki, w tym ustawienia promptów zapamiętywane dla każdego folderu i referencje stylu zgrupowane w jeden element w kształcie pastylki, przed wprowadzeniem nowych narzędzi do współpracy zapowiedzianych na następny tydzień. 🔗 źródło
  • Grok 4.7 za połowę ceny w Ramp Router — Do 6 października brama LLM Ramp Router oferuje Grok 4.7 z rabatem 50 %, a ofertę nagłaśnia SpaceXAI; w API SpaceXAI model kosztuje 2 dolary za wejście i 6 dolarów za wyjście na milion tokenów. 🔗 źródło
  • Poufne komentarze do komunikatów bezpieczeństwa — GitHub umożliwia komentowanie komunikatu bezpieczeństwa repozytorium tak, aby autor zgłoszenia go nie widział: komentarze mogą czytać wyłącznie osoby z uprawnieniami do zapisu, a ich odczyty są rejestrowane; API REST komentarzy przechodzi do publicznej wersji zapoznawczej. 🔗 źródło · 🔗 API REST
  • API GraphQL GitHub Advisory Database — Obiekt SecurityAdvisory zyskuje pięć pól, w tym identyfikator CVE i datę publikacji przez NVD, a zapytanie securityAdvisories dwa filtry, według poziomu zagrożenia i statusu wycofania: nie trzeba już korzystać dodatkowo z API REST. 🔗 źródło
  • Koniec obrazu macOS 14 w GitHub Actions — Wycofanie ogłoszone 1 października nastąpi 2 listopada i zostanie poprzedzone ośmioma zaplanowanymi przerwami w październiku, od godz. 14 do północy UTC; workflow muszą przejść na macos-15 lub macos-latest, który wskazuje na macos-26. 🔗 źródło
  • Dojrzałość IA w przedsiębiorstwach — Perplexity publikuje przewodnik opisujący cztery etapy dojrzałości, podsumowujący modele Gartner, Deloitte i Google Cloud oraz proponujący tabelę samooceny; według przytoczonego badania McKinsey z 2026 roku 80 % respondentów dostrzega wzrost osobistej produktywności, ale tylko 37 % wkład w EBIT. 🔗 źródło

Co to oznacza

IA stosowana w nauce jest coraz częściej oceniana według kryteriów niezależnych od podmiotów, które ją ogłaszają. Meta nie ogranicza się do prezentowania wyników: każdy artykuł wskazuje, które fragmenty napisała IA, druga grupa matematyków przeprowadza ponowną recenzję, a wpis przyznaje, że trzy z problemów zostały również rozwiązane gdzie indziej. Model prognozowania grypy opracowany z pomocą IA Google czerpie swoją wartość z oceny przeprowadzonej przez CDC na przestrzeni całego sezonu, w porównaniu z 38 innymi modelami. Ai2 publikuje wagi i dane AstaBrief, ale ostrzega, że porównania pochodzą z 2025 roku: otwarty model można zweryfikować, a ocena z czasem się dezaktualizuje.

Modele decyzyjne w ciągu kilku dni stają się pełnoprawną kategorią. Po Jev, d1 firmy Liquid AI i Clef firmy Cloudflare Perplexity oferuje zarówno API rozliczane według tokenów wejściowych, jak i wagi swojego modelu; llama.cpp udostępnia te modele lokalnie w tym samym formacie System One, a Replit dodaje Jev do swoich integracji bez klucza API. Dla programisty korzyść jest konkretna: prawdopodobieństwo dla każdej opcji, uzyskane w jednym przebiegu, zamiast odpowiedzi tekstowej, którą trzeba potem przeanalizować. Porównania wymagają ostrożności: wiersz Overall w karcie modelu stawia pplx-decider-v1-27b przed Jev, ale opublikowane szczegóły dają przewagę Jev w sześciu z jedenastu benchmarków.

Agenci programistyczni rozwijają się szybciej niż ich rzeczywista autonomia. Najlepszy model, pozostawiony sam z repozytorium w SWE-sweep, znajduje i naprawia tylko 4,7 % błędów, za ponad 7 000 dolarów. Claude Code 2.1.288 poświęca większość swoich 89 pozycji poprawkom, w tym wznowieniu działania po przekroczeniu limitu czasu API i kilku zaostrzonym regułom uprawnień, a także promuje mod monitorujący pracę głównego agenta. Anthropic zajmuje się innym wąskim gardłem, kompetencjami ludzi, przeznaczając 100 milionów dolarów na szkolenie inżynierów potrafiących doprowadzić wdrożenie do środowiska produkcyjnego. Otwarte modele z kolei zyskują miejsce w narzędziach, z GLM 5.3 w Cursor i DeepSeek Harness na pulpicie.

Sprzęt obliczeniowy wreszcie różnicuje się w trzech kierunkach. Google testuje na orbicie TPU, które pewnego dnia mogłyby korzystać z nawet 8 razy większej ilości energii słonecznej niż na Ziemi, NVIDIA dodaje do DGX Spark konfigurację z 64 GB, którą można łączyć w pary, aby obsłużyć 200 miliardów parametrów, a DeepSeek umożliwia korzystanie ze swoich bibliotek niskiego poziomu, z tym samym API, na układach Ascend firmy Huawei. Każdy na swój sposób poszerza wybór miejsc i sprzętu, na których mogą działać modele.


Źródła