ai-powered-markdown-translatorArtykuł przetłumaczony z francuskiego na polski za pomocą gpt-6.1-sol.
Anthropic dodaje do Claude dwie funkcje: Claude Dashboards do tworzenia na bieżąco aktualizowanych pulpitów oraz Claude Motion do animacji tworzonych w kodzie, a także wyprowadza Docs, Slides i Design z wersji beta i udostępnia je we wszystkich planach, w tym Free. Tego samego dnia firma uruchamia Cyber Mission, obejmującą program ochrony infrastruktury krytycznej oraz OSS Scanner, który oferuje projektom open source bezpłatne skanowanie przez jej najpotężniejsze modele. OpenAI z kolei wdraża tryb Ultrafast dla GPT-6.1 Sol, do 8 razy szybszy od trybu Standard, a Anthropic i NVIDIA angażują się w Genesis Mission, przeznaczając na nią odpowiednio 150 milionów i 1 miliard dolarów.
Claude Dashboards i Claude Motion w wersji beta, Docs, Slides i Design we wszystkich planach
8 października — Anthropic dodaje do Claude dwie funkcje. W Claude Dashboards, dostępnym w wersji beta w płatnych planach, podłącza się firmową platformę danych (Amazon Redshift, BigQuery, ClickHouse, Databricks lub Snowflake) albo inny konektor, na przykład szanse sprzedażowe z Salesforce, a następnie zadaje pytanie w języku naturalnym: Claude pisze zapytanie, tworzy pulpit i aktualizuje go, gdy dane się zmieniają. Kliknięcie liczby wyświetla zapytanie, które ją zwraca, a każdy wykres wskazuje, kiedy jego dane zostały zaktualizowane. Anthropic przeznacza tę funkcję do szybkich pytań i eksploracji; do dalszej pracy pulpit można przenieść do Amplitude, Grafana, Hex, Mixpanel, Omni, Perplexity, PostHog lub Sigma, a obsługa Looker, monday.com i Tableau ma pojawić się później.
Claude Motion, dostępny w wersji beta w planach Team i Enterprise, służy do tworzenia krótkich animacji: 30-sekundowego filmu objaśniającego na podstawie raportu kwartalnego, animowanego wykresu w prezentacji lub demonstracji produktu. Ponieważ nie wykorzystuje żadnego modelu generowania wideo, animacja nie zawiera sekwencji ani osób wygenerowanych przez AI.
Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.
🇵🇱 Claude Motion przekształca raporty, wykresy lub demonstracje produktu w krótkie animacje. Claude tworzy każdą z nich w kodzie, bez użycia jakiegokolwiek modelu wideo, dzięki czemu możesz zmienić dowolne słowo, liczbę lub czas wyświetlania, a następnie wyeksportować MP4. W wersji beta w planach Team i Enterprise. — @claudeai na X
Tego samego dnia Claude Docs, Slides i Design tracą oznaczenie wersji beta i stają się dostępne we wszystkich planach, w tym Free. Według Anthropic od ich wprowadzenia do rozmów 16 września powstało ponad 45 milionów dokumentów, prezentacji i projektów. Wyjście z wersji beta przynosi obsługę CMEK dla artefaktów, możliwość wyboru szablonów artefaktów przez administratorów, wspólną edycję z Claude, udostępnianie poza organizacją, jeśli administrator na to zezwoli, eksport do PowerPoint i PDF wiernie odwzorowujący zawartość edytora, bezpośrednie przesyłanie do Google Slides oraz edycję w aplikacji mobilnej.
| Funkcja | Status na 8 października | Dostępne plany |
|---|---|---|
| Claude Dashboards | Wersja beta | Płatne plany |
| Claude Motion | Wersja beta | Team i Enterprise |
| Claude Docs, Slides i Design | Wyjście z wersji beta | Wszystkie, w tym Free |
| claude.ai/design (osobna witryna) | Dostępna do 14 grudnia | — |
Praktyczna konsekwencja: osobna witryna claude.ai/design, obecnie zintegrowana z Claude, pozostanie dostępna do 14 grudnia. Systemy projektowania (design systems) organizacji można przenieść jednorazowo ze strony Artifacts, ale rozmowy i komentarze z osobnej witryny oraz jej publiczne linki znikną wraz z jej zamknięciem. W Enterprise Dashboards i Motion są domyślnie wyłączone, natomiast Docs, Slides i Design zostaną domyślnie włączone 15 października.
🔗 Wpis Claude: Dashboards i Motion · Wątek @claudeai
Runway i Luma, partnerzy startowi Claude Motion
8 października — Dwie firmy z sektora generowania wideo przedstawiają się jako partnerzy startowi Claude Motion. Do Runway można wyeksportować dowolną animację, aby dodać do niej wygenerowane sekwencje, zmodyfikować ujęcia przez opisanie pożądanej zmiany i zlecić Runway Agent zmontowanie dłuższego materiału wokół animacji; ten sam materiał w formacie 16:9 można też przekształcić w wersję pionową i kwadratową. W Luma animacje otwierają się bezpośrednio dzięki konektorowi Luma (MCP) dodanemu w Claude: modele wideo Ray i Uni zmieniają ich styl, zachowując ruch, kadrują je do formatów 9:16, 1:1, 4:3 lub 21:9, a agent Luma tworzy kolejne wersje. Ani Runway, ani Luma nie podają ceny ani kosztu w kredytach. Anthropic wymienia także Adobe, Descript, HeyGen, Higgsfield i invideo wśród narzędzi, w których można dalej rozwijać animację, a obsługę Canva i Captions zapowiada na najbliższy czas.
🔗 Wpis Runway · Wpis Luma
Anthropic Cyber Mission: program dla infrastruktury krytycznej i OSS Scanner dla open source
8 października — Dwa dni po rozszerzeniu Cyber Verification Program Anthropic uruchamia Anthropic Cyber Mission, przedstawianą jako długoterminowe zobowiązanie do zabezpieczania systemów, od których zależą wszyscy. Punktem wyjścia są ustalenia Project Glasswing: znajdowanie podatności nigdy nie było tak łatwe, ale ich weryfikowanie, ustalanie priorytetów i usuwanie nadal sprawia trudności. Misja rozpoczyna się w dwóch obszarach: infrastruktury krytycznej i oprogramowania open source; zapowiedziano kolejne obszary, bez podania terminów.
W przypadku infrastruktury krytycznej Critical Infrastructure Defense Program (CIDP) zapewnia najbardziej zaawansowane modele Claude, inżynierów pracujących na miejscu oraz badania Anthropic dotyczące zagrożeń dostawcom obsługującym operatorów technologii operacyjnych: sterowników, oprogramowania sterującego i sieci przemysłowych w energetyce, gospodarce wodnej lub transporcie, których często nie można zatrzymać, aby zastosować poprawkę. Uczestniczy w nim jedenastu partnerów założycielskich: Accenture, Booz Allen, CrowdStrike, Deloitte, Dragos, Hitachi, Insane Cyber, Nozomi Networks, Palo Alto Networks, PwC i Rockwell Automation. Program rozpoczyna się od niewielkiej grupy i w kolejnych miesiącach ma objąć następnych partnerów oraz sektory.
W przypadku open source OSS Scanner, inspirowany OSS-Fuzz od Google, oferuje zarejestrowanym projektom bezpłatne okresowe skanowanie przez najpotężniejsze modele Anthropic, w tym Claude Mythos. Każdy raport zawiera kod odtwarzający podatność, wyjaśnienie oraz, jeśli jest dostępna, proponowaną poprawkę, ale jest wysyłany bez weryfikacji przez człowieka: Anthropic oczekuje odsetka prawdziwie dodatnich wyników powyżej 90 % i uprzedza, że niektóre raporty będą zawierały błędy, na przykład niewłaściwą ocenę poziomu zagrożenia. Usługa odpowiada na wąskie gardło opisane przez zespół Frontier Red Team: liczba znalezionych podatności znacznie przekracza możliwości ich oceny przez ludzi.
| Wskaźnik opublikowany przez Anthropic | Opublikowana wartość |
|---|---|
| Potencjalne podatności znalezione w ciągu sześciu miesięcy | Ponad 29 000 |
| Podatności ręcznie przejrzane i sklasyfikowane | Około 6 000 |
| Zweryfikowane podatności krytyczne lub wysokiego ryzyka (48 projektów) | 97 |
| Spełniające wymagania skoordynowanego ujawniania podatności (CVD) | 85, czyli 88 % |
| Rzeczywiste, ale zduplikowane, lub nieprawidłowe | 11 i 1 |
| Udział podatności znalezionych przez LLM w benchmarku CyberGym | Mniej niż 20 % na początku ubiegłego roku, ponad 85 % w tym roku |
wolfSSL podaje, że spośród 74 otrzymanych raportów wszystkie poza dwoma były prawidłowe, a pięć otrzymało identyfikatory CVE. Zgłoszenie odbywa się przez pull request w repozytorium GitHub anthropics/oss-scanner i jest zarezerwowane dla głównych maintainerów projektów uznanych indywidualnie za krytyczne, a uruchomiony w sierpniu Defender Advantage Fund zapewnia bezpłatność usługi. Prognoza Anthropic jest ostrożna: w ciągu dwóch lat AI będzie sprzyjać obronie, ale niekoniecznie w krótkiej perspektywie, ponieważ wykorzystywanie podatności kosztuje mniej, podczas gdy ich weryfikacja, ujawnianie i usuwanie nadal zajmują dużo czasu.
🔗 Wpis Anthropic: Anthropic Cyber Mission · Wpis Frontier Red Team o OSS Scanner · Repozytorium anthropics/oss-scanner
Ultrafast dla GPT-6.1 Sol: do 8 razy szybciej, za 12 i 60 dolarów za milion tokenów
8 października — Zapowiedziany 29 września jako dostępny „wkrótce” tryb Ultrafast trafia do GPT-6.1 Sol. OpenAI Developers informuje, że tego samego dnia jest wdrażany w API, Codex i ChatGPT Work, z poziomem inteligencji przedstawianym jako zbliżony do GPT-6 Astra. OpenAI przeznacza go do zadań, w których liczy się każda sekunda: debugowania awarii, kierowania agentami poruszającymi się po aplikacjach lub zapewniania interakcji w czasie rzeczywistym.
Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.
🇵🇱 Ultrafast jest dziś wdrażany dla GPT-6.1 Sol w API, Codex i ChatGPT Work. Inteligencja zbliżona do Astra, do 8 razy szybciej niż Sol w trybie Standard, aby tworzyć tak szybko, jak pojawiają się pomysły. — @OpenAIDevs na X
W API wystarczy wywołać gpt-6.1-sol z service_tier: "ultrafast" w Responses API. Tryb jest dostępny dla wszystkich użytkowników API, z uwzględnieniem limitów przepustowości, przy przetwarzaniu globalnym oraz z rezydencją danych w Stanach Zjednoczonych i Unii Europejskiej, podczas gdy GPT-6 Astra w Ultrafast nadal ogranicza rezydencję danych do Stanów Zjednoczonych. Cena podlega zasadzie stosowanej już dla Astra: sześciokrotność ceny Standard, czyli 12 dolarów za milion tokenów wejściowych i 60 dolarów za milion tokenów wyjściowych, pięć razy mniej niż GPT-6 Astra w Ultrafast (60 i 300 dolarów).
| Tryb przetwarzania gpt-6.1-sol | Cena wejścia | Wejście z cache | Zapis do cache | Cena wyjścia |
|---|---|---|---|---|
| Standard, krótki kontekst | 2,00 dolary | 0,10 dolara | 2,50 dolara | 10,00 dolarów |
| Fast, krótki kontekst | 4,00 dolary | 0,20 dolara | 5,00 dolarów | 20,00 dolarów |
| Ultrafast, krótki kontekst | 12,00 dolarów | 0,60 dolara | 15,00 dolarów | 60,00 dolarów |
| Ultrafast, długi kontekst | 24,00 dolary | 1,20 dolara | 30,00 dolarów | 90,00 dolarów |
Stawki za milion tokenów, strona Pricing API według stanu na 8 października.
W Codex i ChatGPT Work dostęp jest zarezerwowany dla planu Pro 500, kwalifikujących się przestrzeni Enterprise rozliczanych według zużycia oraz ofert Edu z kredytami. W Enterprise Ultrafast jest domyślnie wyłączony, a właściciele przestrzeni roboczej muszą go włączyć dla wybranych użytkowników lub dla wszystkich. Dokumentacja Codex szczegółowo opisuje koszt: limity zawarte w abonamencie są zużywane 8 razy szybciej niż w trybie Standard, a zakupione kredyty oraz zużycie Enterprise na żądanie są rozliczane sześć razy drożej. Pozostałe plany samoobsługowe nie mają dostępu w momencie premiery, nawet z zakupionymi kredytami.
🔗 Changelog API OpenAI · Cennik API OpenAI · Ultrafast w Codex (dokumentacja)
Nauka: 150 milionów dolarów od Anthropic i 1 miliard od NVIDIA na Genesis Mission, mapa nieba w ultrafiolecie
Dwa zobowiązania w ramach Genesis Mission, amerykańskiego programu federalnego, który ma przyspieszyć odkrycia naukowe dzięki AI, ogłoszono 8 października podczas tego samego szczytu „Nauka: nowa złota era”, zorganizowanego w Waszyngtonie przez Office of Science and Technology Policy (OSTP) Białego Domu. Tego samego dnia Anthropic pokazuje, co Claude Science może stworzyć dla astrofizyka.
Anthropic: 150 milionów dolarów w ciągu trzech lat i Claude dla ponad 15 agencji federalnych
8 października — Anthropic zobowiązuje się przeznaczyć 150 milionów dolarów w ciągu trzech lat na Genesis Mission. Finansowanie ma zapewnić dostęp do Claude ponad 15 agencjom uczestniczącym w misji, w tym NASA, National Institutes of Health i National Science Foundation. W praktyce Anthropic dostarczy Claude, Claude Code i kredyty API kilkuset projektom badawczym, będzie współpracować z agencjami i laboratoriami narodowymi nad priorytetami administracji, w tym energią z fuzji jądrowej i informatyką kwantową, oraz zapewni szkolenia i wsparcie techniczne. Zobowiązanie stanowi kontynuację partnerstwa nawiązanego w grudniu 2025 roku z Departamentem Energii; w lipcu Google DeepMind (40 milionów dolarów) i OpenAI (17 milionów dolarów) ogłosiły własne zobowiązania w ramach misji.
🔗 Wpis Anthropic: zaangażowanie w Genesis Mission · Wpis @AnthropicAI
NVIDIA: 1 miliard dolarów w ciągu pięciu lat na amerykańską naukę
8 października — Podczas tego samego wydarzenia NVIDIA ogłasza zobowiązania o wartości 1 miliarda dolarów na pięć lat, aby rozwijać potencjał Stanów Zjednoczonych w zakresie badań i rozwoju superinteligencji w takich dziedzinach jak informatyka kwantowa, zdrowie i bezpieczeństwo energetyczne. Komunikat wymienia trzy obszary, bez podziału kwoty: wsparcie akademickich instytucji badawczych, inwestycje mające przyspieszyć umacnianie amerykańskiego przywództwa w informatyce kwantowej oraz wsparcie dostawców usług cloud obsługujących misje rządowe. NVIDIA informuje także o współpracy przy kilku projektach finansowanych w fazie 2 Genesis Mission, ogłoszonych tego samego dnia, w dziedzinach informatyki kwantowej, fuzji jądrowej, projektowania akceleratorów i mikroelektroniki, oraz przypomina o swoim partnerstwie z DOE, obejmującym największy superkomputer naukowy departamentu w Argonne National Laboratory.
Pierwsza kompletna mapa nieba w ultrafiolecie, opracowana z pomocą Claude Science
8 października — Blog Anthropic Science opisuje, jak Brice Ménard, astrofizyk z Uniwersytetu Johnsa Hopkinsa i badacz w Anthropic, opracował z pomocą Claude Science to, co Anthropic przedstawia jako pierwszą kompletną mapę nieba w ultrafiolecie. Kosmiczny przegląd GALEX (NASA, 2003-2013) obejmował jedynie około dwóch trzecich nieba, w ramach około 38 000 obserwacji. Claude koordynował agentów, którzy zebrali i wzajemnie skalibrowali publicznie dostępne przeglądy nieba, a następnie uzupełnili brakującą jedną trzecią przez rekonstrukcję (inpainting), na podstawie zależności między ultrafioletem a innymi długościami fal. Na celowo zamaskowanych obszarach szacunki odbiegają od rzeczywistych pomiarów o około 10 %.
The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.
🇵🇱 Ludziom ta praca zajęłaby tygodnie, ale z pomocą Claude zajęła zaledwie kilka dni, podczas gdy Ménard pracował nad innymi projektami. — @AnthropicAI na X
Zakazane zastosowania i nadużycia: polityka użytkowania Anthropic na 2026 rok i dwie operacje wpływu zlikwidowane przez OpenAI
Dwie publikacje z 8 października pokazują, czego laboratoria zabraniają i jak tropią nadużycia: Anthropic zmienia swoją politykę użytkowania, a OpenAI szczegółowo opisuje dwie zablokowane operacje wpływu.
Anthropic publikuje wersję polityki użytkowania na 2026 rok, obowiązującą od 12 listopada
8 października — Anthropic publikuje coroczną aktualizację swojej polityki użytkowania (Usage Policy), która wejdzie w życie 12 listopada. Są to przede wszystkim doprecyzowania wynikające z zaobserwowanych nadużyć. Nowa sekcja zbiera dotąd rozproszone zasady dotyczące kampanii wprowadzających w błąd i sztucznej aktywności oraz obejmuje wszelką działalność wprowadzającą w błąd, polityczną lub komercyjną, w tym tworzenie narzędzi do operacji wpływu. Sekcja dotycząca wyborów, przemianowana na „nie podważać procesów demokratycznych” (Do Not Undermine Democratic Processes), znosi ogólny zakaz spersonalizowanego kierowania przekazu do wyborców, który blokował zastosowania obywatelskie, takie jak informowanie wyborców w innych językach. Tekst precyzuje również, że zakaz dotyczący broni obejmuje jej oprogramowanie i komponenty, a także uzbrajanie dronów, zabrania śledzenia osób bez ich zgody i zakazuje, wyłącznie w skrajnych przypadkach, uporczywych i niczym nieuzasadnionych agresywnych zachowań wobec modeli.
🔗 Wpis Anthropic: aktualizacja polityki użytkowania na 2026 rok
OpenAI likwiduje Dark Clark i Bogus Bylines, w tym po raz pierwszy operację kategorii 5
8 października — OpenAI publikuje raport o dwóch zablokowanych tajnych operacjach wpływu, które prowadziły fikcyjne podmioty (false front) z pomocą jego modeli. „Dark Clark”, pochodząca z Rosji, była skierowana na Amerykę Łacińską: jej operatorzy używali ChatGPT głównie do pisania raportów wewnętrznych i prowadzili pseudoośrodek badawczy Social Research Center, kierowany przez fikcyjną postać „Mia Clark”. „Bogus Bylines”, pochodząca z Iranu, zamieściła niemal 100 artykułów podpisanych siedmioma zmyślonymi nazwiskami zachodnich dziennikarzy w około dwunastu mediach internetowych, z których jedno miało niemal 2 miliony obserwujących na Facebooku. OpenAI twierdzi, że w ciągu dwóch i pół roku ujawniło 30 takich operacji.
| Zlikwidowana operacja | Pochodzenie kont | Główny cel | Kategoria w IO Breakout Scale (od 1 do 6) |
|---|---|---|---|
| Dark Clark | Rosja | Ameryka Łacińska | 5, po raz pierwszy według OpenAI |
| Bogus Bylines, artykuły | Iran | Międzynarodowe media internetowe | 4 |
| Bogus Bylines, komentarze | Iran | Media społecznościowe | 2 |
🔗 Raport OpenAI o operacjach wykorzystujących fikcyjne podmioty
Claude Haiku 5.5 u zewnętrznych dostawców: GitHub Copilot udostępnia go już w planie Pro, w Devin osiąga 58,4 %
Claude Haiku 5.5, udostępniony 7 października, trafił tego samego dnia do dwóch narzędzi programistycznych, z których każde porównuje go z Claude Sonnet 5.
GitHub Copilot: Haiku 5.5 we wszystkich płatnych planach, także Pro
7 października — Nieco ponad dwie godziny po premierze w Anthropic Claude Haiku 5.5 staje się ogólnie dostępny w GitHub Copilot w planach Pro, Pro+, Max, Business i Enterprise: także w Pro, tak jak Claude Sonnet 5.5 i inaczej niż GPT-6.1 Sol pod koniec września. Można go wybrać w dziesięciu interfejsach, od VS Code po Xcode. GitHub przeznacza go dla podagentów, do szybkich zmian i zadań w terminalu; według pierwszych testów dorównał Claude Sonnet 5 w wielu zadaniach programistycznych przy znacznie mniejszej liczbie tokenów i kroków, bez opublikowania konkretnych liczb. Jest rozliczany według publicznego cennika: 0,10 dolara za milion tokenów wejściowych i 0,50 dolara za milion tokenów wyjściowych do 100 000 tokenów wejściowych, a następnie 0,50 i 2,50 dolara, czyli dziesięciokrotnie mniej niż Claude Haiku 4.5 w pierwszym progu.
🔗 Claude Haiku 5.5 w GitHub Copilot · Modele i ceny GitHub Copilot
Devin: 58,4 % w FrontierCode 1.1, przed Claude Sonnet 5
7 października — Cognition udostępnia Claude Haiku 5.5 w Devin. W FrontierCode 1.1, swoim własnym benchmarku oceniającym modele na rzeczywistych zadaniach inżynierskich według jakości kodu i jego gotowości do scalenia, Haiku 5.5 uzyskuje 58,4 %, wyprzedzając Claude Sonnet 5, przy koszcie na zadanie wynoszącym około jednej ósmej jego kosztu według Cognition, które nie podaje konkretnej kwoty. Dołącza też do pomocników (sidekicks) Devin Fusion, które łączy model główny z modelem pomocniczym: z Claude Opus 5.5 jako modelem głównym i Haiku 5.5 jako pomocniczym Fusion utrzymuje wynik 66,2, jednocześnie zmniejszając koszt i opóźnienie.
| Model oceniany przez Cognition | Wynik FrontierCode 1.1 Extended |
|---|---|
| Claude Sonnet 5 | 56,2 |
| Kimi K3 | 58,2 |
| Claude Haiku 5.5 | 58,4 |
| GPT-6.1 Sol | 60,4 |
| Claude Sonnet 5.5 | 64,4 |
| Claude Opus 5.5 | 65,3 |
Agenci programistyczni: Claude Code 2.1.295, Codex CLI 0.162.0, Antigravity CLI 1.3.1, VS Code 1.141 i Delta 0.19
Pięć narzędzi z agentami programistycznymi wprowadza zmiany: Claude Code zaostrza działanie hooków, Codex CLI zarządza worktrees, Antigravity CLI przeprojektowuje przegląd zmian, VS Code układa sesje agentów w siatce, a Delta otwiera się na pracę zespołową.
Claude Code 2.1.295: hooki, które blokują działanie w razie błędu
8 października — Claude Code doczekał się tego dnia dwóch wersji. Wersja 2.1.294 poprawia hooki prompt i agent zapisane jako instrukcje w języku naturalnym, które mogły przepuszczać to, co miały blokować. Wersja 2.1.295 zawiera 143 wpisy, w tym 97 poprawek. Dzięki nowej opcji onFailure: "block" dla hooków command i HTTP hook, który nie uruchomi się, przekroczy limit czasu lub zwróci nieoczekiwany kod, blokuje działanie zamiast je przepuszczać; kilka poprawek idzie w tym samym kierunku, obejmując zabezpieczenia modów oraz opcje --tools i --restricted. Claude Code obsługuje też Program Status Protocol (OSC 7501), który pozwala zgodnym terminalom pokazywać, czy agent pracuje, czeka, czy zakończył pracę, a limit opisów narzędzi MCP ładowanych przez wyszukiwanie narzędzi rośnie z 2 048 do 16 384 znaków.
🔗 Claude Code 2.1.295 · Claude Code 2.1.294
Codex CLI 0.162.0: zarządzane worktrees i przypięte zadania
8 października — Codex CLI 0.162.0, pierwsze stabilne wydanie od opublikowanej dzień wcześniej wersji 0.161.0, wymienia 225 PR. Gdy funkcja worktrees jest włączona, Codex dysponuje narzędziami do tworzenia i wyświetlania listy zarządzanych worktrees Git na podstawie zaufanych projektów lokalnych, a centrum zarządzania agentami pozwala przypiąć zadanie klawiszem p w grupie „Pinned”, współdzielonej, gdy serwer na to pozwala. Terminal zyskuje /copy do przeglądania i kopiowania bloków zapisu sesji, Ctrl+Insert do kopiowania zaznaczenia oraz ustawienie szybkości przewijania, a adresy URL stają się klikalne także w prośbach o zatwierdzenie i promptach MCP. Dostawcy niestandardowych modeli zgodnych z Responses API mogą deklarować dostęp do sieci w czasie rzeczywistym i zdalną kompakcję. Wśród poprawek apply_patch zachowuje zakończenia wierszy CRLF, zabezpieczenia sandboxa w Linuksie zostają wzmocnione, a wydania dla Windows otrzymują podpisany instalator PowerShell.
🔗 Informacje o wydaniu Codex CLI 0.162.0
Antigravity CLI 1.3.1: przeprojektowany przegląd zmian w /diff, domyślnie średnia szczegółowość
7 października — CLI Antigravity doczekało się pięciu wersji między 2 a 7 października. Wersja 1.3.1 usprawnia przegląd kodu w terminalu: w widoku pliku w /diff strzałki w lewo i w prawo otwierają sąsiedni plik w miejscu jego pierwszej zmiany, każdy plik zapamiętuje swoją pozycję, n i N przełączają na następny lub poprzedni plik, a nagłówek pokazuje bieżącą pozycję. Dziesięć poprawek obejmuje między innymi /rewind w bardzo długich rozmowach, pluginy w Windows oraz sesje z kluczem GEMINI_API_KEY, które ponawiają próbę po zerwaniu połączenia z API Gemini. Wersja 1.3.0 z 6 października zmienia domyślną szczegółowość z „high” na „medium”, grupując wywołania narzędzi i rozważania w zwięzłe podsumowania; /config pozwala przywrócić poprzednie ustawienie. Wcześniej wersja 1.2.16 powierzyła generowanie obrazów wbudowanemu podagentowi, a 1.2.15 dodała pliki binarne dla Androida przeznaczone do Termux.
🔗 Changelog Antigravity, karta CLI
VS Code 1.141: sesje agentów w siatce i porządkowanie worktrees
7 października — VS Code 1.141 skupia się na sesjach agentów Copilot. Okno Agents może układać kilka sesji w siatce, a polecenie Chat: Open Worktree Cleanup pokazuje miejsce na dysku zajmowane przez worktrees nieaktywnych sesji, aby można było je usunąć na żądanie lub automatycznie po scaleniu pull request. Rozmowy rozpoczęte w Copilot CLI lub w aplikacji GitHub Copilot pojawiają się już po pierwszym zapytaniu, bez ponownego ładowania edytora, a rozmowę Codex otwartą w aplikacji ChatGPT lub w Codex CLI można tam kontynuować wraz z jej historią: po wybraniu modelu Copilot rozmowa jest kontynuowana w ramach abonamentu GitHub Copilot, na przykład po osiągnięciu limitu korzystania z ChatGPT. W zastosowaniach firmowych sandbox środowiska wykonawczego Copilot można wymusić za pomocą zarządzanych ustawień, w wersji preview, a samo środowisko stopniowo staje się domyślnym wyborem dla użytkowników z włączonymi eksperymentami.
🔗 Informacje o wydaniu VS Code 1.141
Delta 0.19: wzmianki między członkami zespołu i skrzynka odbiorcza
7 października — Zed Industries publikuje Delta 0.19.0, swoje środowisko do wspólnego programowania z agentami, po którym 8 października ukazuje się wersja 0.19.1 z poprawkami. Teraz można wspomnieć członka zespołu w wiadomości lub komentarzu, wpisując @, a następnie jego nazwę użytkownika, a powiadomienie trafia do nowej skrzynki odbiorczej (Inbox). Agent @delta odczytuje i zmienia znaczną część ustawień bezpośrednio z rozmowy. Ustawienie Agent Thread Creation uniemożliwia agentom tworzenie rozmów najwyższego poziomu, zachowując działanie podagentów, agent może scalać worktrees z kilku wątków, a polecenia CLI wykonują się bez otwierania okna. Łącznie informacje o wydaniu wymieniają 11 nowości, 22 ulepszenia i 45 poprawek. 8 października wpis udostępniony przez Zed opisuje, jak zespół zastąpił Google Docs środowiskiem Delta do pracy nad dokumentami wewnętrznymi.
🔗 Informacje o wydaniu Delta · Wpis Delta o rezygnacji z Google Docs
Media generatywne: Nano Banana 2.1, Brand Kit i ElevenReader w Brazylii od ElevenLabs, SemanTok od Stability AI
Cztery ogłoszenia dotyczące obrazu, wideo i głosu: dwukrotnie tańszy model obrazów od Google, zasady identyfikacji wizualnej do wielokrotnego wykorzystania i aplikacja do czytania na głos od ElevenLabs oraz badania nad generowaniem wideo od Stability AI.
Nano Banana 2.1 ogólnie dostępny w API Gemini, o połowę tańszy
6 października — Google wprowadziło Nano Banana 2.1 (gemini-nano-banana-2.1) do ogólnej dostępności w API Gemini i Google AI Studio, bez wpisu na blogu. Ten model generowania i edycji obrazów jest aktualizacją Nano Banana 2, z lepszą jakością wizualną, lepszym renderowaniem tekstu, większą spójnością postaci między kolejnymi turami i formatami panoramicznymi od 1:4 do 8:1, bez artefaktów kafelkowania w 2K i 4K. Obsługuje do 14 obrazów referencyjnych i opiera wyniki na wyszukiwaniu Google. Cena za obraz spada o połowę w 1K i 2K, a Google oznacza Nano Banana 2 (gemini-3.1-flash-image) jako przestarzały, bez podania daty wyłączenia.
| Cena na wyjściu | Nano Banana 2.1 | Nano Banana 2 |
|---|---|---|
| Obraz 1K | 0,0336 dollar | 0,067 dollar |
| Obraz 2K | 0,0504 dollar | 0,101 dollar |
| Obraz 4K | 0,113 dollar | 0,151 dollar |
| Milion tokenów obrazu | 30 dollars | 60 dollars |
🔗 Informacje o wydaniach API Gemini · Karta Nano Banana 2.1
Brand Kit od ElevenLabs: zasady identyfikacji wizualnej zapisane w przestrzeni roboczej
8 października — ElevenLabs dodaje Brand Kit do ElevenCreative, swojego pakietu narzędzi do tworzenia treści. Kolory, fonty, logotypy wraz z zasadami ich użycia, obrazy referencyjne i reguły marki, w tym określające, czego marka nigdy nie robi, tworzą jeden obiekt w przestrzeni roboczej, który wywołuje się przez @ w Image & Video, w Flows lub u agenta ElevenCreative. Według wątku ElevenLabs zestaw można utworzyć w kilka minut, wklejając adres strony lub przesyłając zasoby organizacji; cały zespół generuje wtedy treści według tych samych wskazówek, a agencja może utworzyć osobny zestaw dla każdego klienta. ElevenLabs chce rozszerzyć zestawy o głos i brzmienie marki, bez podania daty. Brand Kit jest już dostępny, bez podanej ceny; HeyGen (sierpień) i Runway (wrzesień) oferują już porównywalne narzędzia.
🔗 Wpis ElevenLabs: Brand Kit · Wątek @ElevenLabs
SemanTok od Stability AI: model 201M dorównuje modelowi 3,4 razy większemu
7 października — Zespół Interactive Research w Stability AI prezentuje SemanTok, tokenizer wideo dla modeli świata (world models), które generują wideo token po tokenie, ogłoszony na X 8 października. W tokenizerach „od ogółu do szczegółu” (coarse-to-fine) pierwsze tokeny opisują scenę jako całość, a kolejne dodają szczegóły; SemanTok wzbogaca znaczenie tych pierwszych tokenów, dzięki czemu łatwiej je przewidywać. W tym celu wprowadza do swojego enkodera zamrożone cechy DINO i dodaje lekkie głowice, które odtwarzają je na podstawie każdego prefiksu tokenów. Według Stability AI model autoregresyjny o 201M parametrów zbudowany na SemanTok dorównuje modelowi VideoFlexTok 3,4 razy większemu lub go przewyższa, a przewidywanie krótkich prefiksów kosztuje mniej. Artykuł jest dostępny na arXiv; nie wspomniano ani o kodzie, ani o wagach.
🔗 Wpis badawczy Stability AI · Artykuł na arXiv
ElevenReader trafia do Brazylii z głosem Fábio Porchata i 70 000 książek
8 października — ElevenLabs wprowadza w Brazylii ElevenReader, swoją bezpłatną aplikację na iOS i Android, która zamienia książki, dokumenty i artykuły w materiały do słuchania, z głosem aktora i komika Fábio Porchata. Katalog powstał dzięki partnerstwu z Bookwire Brasil: obejmuje 70 000 tytułów w brazylijskiej odmianie portugalskiego, licencjonowanych przez największe wydawnictwa w kraju, z których większość nie miała wcześniej wydania audio. ElevenLabs wyprodukowało także Dom Casmurro autorstwa Machado de Assisa, czytane przez Fábio Porchata, z oryginalną muzyką i oprawą dźwiękową. Według dyrektora generalnego Bookwire Brasil to największy wybór brazylijskich książek, jaki kiedykolwiek udostępniono w formie audio.
| Oferta w Brazylii | Warunki dostępu |
|---|---|
| Aplikacja ElevenReader (iOS, Android) | Bezpłatna |
| Dom Casmurro czytane przez Fábio Porchata | Bezpłatne dla wszystkich |
| 70 000 tytułów na licencji Bookwire | W ramach ElevenReader Ultra, cena niepodana |
🔗 Wpis ElevenLabs: ElevenReader w Brazylii
Modele specjalistyczne: LightOnOCR-3 do dokumentów, Falcon-ASR do arabskiego, Carbon-A do genomów
Trzy modele specjalistyczne, w tym dwa z otwartymi wagami, do odczytywania dokumentów, transkrypcji arabskiego i anotacji genomów.
LightOnOCR-3: trzy otwarte modele OCR, które rozpoznają także układ strony
8 października — LightOn publikuje na licencji Apache 2.0 LightOnOCR-3 w trzech rozmiarach (0.8B, 1B i 4B). Oprócz transkrypcji strony modele potrafią rozpoznawać każdy jej obszar: przy użyciu promptu ugruntowania wizualnego (grounding) każdy blok jest poprzedzony opisaną ramką ograniczającą, obrazy otrzymują krótki opis, a wykresy są przekształcane w tabele danych HTML. Na H100 model 4B przetwarza o 21 % więcej stron na sekundę niż Chandra-OCR-2, zbudowany podobnie jak on na bazie Qwen3.5. LightOn zaznacza, że wyniki obliczono po normalizacji danych wyjściowych, udostępnionej wraz z repozytorium, która znacząco zmienia wyniki wszystkich czołowych modeli.
| Zestaw ewaluacyjny | LightOnOCR-3-4B | LightOnOCR-3-0.8B | LightOnOCR-3-1B | Przytoczony punkt odniesienia |
|---|---|---|---|---|
| olmOCR-Bench, wynik ogólny | 86,3 | 85,5 | 84,5 | Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8 |
| ParseBench, pięć kategorii | 75,1 | 74,6 | 71,4 | Infinity Parser Pro 74,3 |
| fr-bench-pdf2md, dokumenty francuskie | 74,1 | 70,5 | 69,6 | Chandra 2 69,0 ; MistralOCR4.1 54,1 |
Falcon-ASR: 1,6 miliarda parametrów dla emirackiej odmiany arabskiego, bez opublikowanych wag
7 października — Technology Innovation Institute (TII) z Abu Zabi przedstawia Falcon-ASR, model rozpoznawania mowy z 1,6 miliarda parametrów, skupiony na języku arabskim, a szczególnie na dialekcie emirackim. Ten sam zestaw wag transkrybuje także angielski, francuski, hiszpański i portugalski, bez konieczności wskazywania języka, ze znacznikiem czasu dla każdego słowa. Podobnie jak zaprezentowane dzień wcześniej Falcon-OCR-Arabic i Falcon-Emirati, model jest dostępny jedynie w wersji demonstracyjnej: TII zapowiada dostęp przez API oraz aplikacje natywne, bez publikacji wag.
| Ocena wskaźnika błędów słów (WER) | Wynik Falcon-ASR | Przytoczony punkt odniesienia |
|---|---|---|
| Średnia z sześciu zbiorów arabskich (Open Universal Arabic ASR) | 20,92 % | 23,17 %, najlepszy wynik opublikowany do 30 września |
| Dialekt emiracki, wewnętrzna ewaluacja TII | 22,73 % | Qwen3-Omni, drugi w rankingu, o 4,07 punktu wyżej |
| Średnia z siedmiu zbiorów angielskich (Open ASR Leaderboard) | 5,74 % | Nie przytoczono punktu odniesienia |
Carbon-A: 566 milionów potencjalnych genów u 22 617 gatunków
8 października — Zespół biologiczny Hugging Face (HuggingFaceBio) publikuje Carbon-A, model z 1,2 miliarda parametrów na licencji MIT, który wykrywa regiony kodujące białka bezpośrednio w ADN, wykorzystując jeden model dla ssaków, roślin, grzybów i protistów. Na 42 genomach referencyjnych osiąga średni wynik F1 na poziomie nukleotydów wynoszący 0,944 i według autorów wyprzedza wszystkie siedem porównywanych narzędzi, w tym AUGUSTUS, Helixer i Tiberius. Zespół uruchomił go na genomach eukariotycznych z GenBank, aby zbudować Carbon Annotation Database: 48 167 złożeń genomów z 22 617 taksonów i 566 milionów przewidywanych loci kodujących, czyli 11 razy więcej taksonów niż w zbiorze treningowym. Walidacja laboratoryjna przeprowadzona z ActiveSite i UCSD za pomocą sekwencjonowania ARN pełnej długości potwierdza część genów; autorzy zaznaczają, że dowodzi to transkrypcji, ale jeszcze nie produkcji białek. Nowa partia danych jest planowana za trzy tygodnie.
Uczenie ze wzmocnieniem: 1 004 środowiska TermGrade i TRL v1.15.0
Dwie publikacje dotyczące uczenia ze wzmocnieniem: oceniane środowiska terminalowe i biblioteka, która wydłuża sekwencje możliwe do wykorzystania w treningu.
TermGrade: 1 004 środowiska terminalowe oceniane przez sześć modeli
8 października — Firma ai& publikuje TermGrade, 1 004 środowiska terminalowe do trenowania i oceny agentów poprzez uczenie ze wzmocnieniem. Każde zadanie działa w kontenerze Linux z instrukcją i testami, a do zbioru trafiało tylko wtedy, gdy jego własne rozwiązanie referencyjne przechodziło testy: spośród 66 165 zadań kandydujących napisanych przez DeepSeek-V4-Pro filtr ten przeszło 1,5 %. Sześć konfiguracji otwartych modeli, od Kimi-K3 po gemma-4-31B-it, podjęło każde zadanie, a wszystkie 36 144 próby zostały opublikowane, również te nieudane. Model najwięcej uczy się na zadaniach, które rozwiązuje mniej więcej raz na dwa podejścia: po treningu na 151 takich zadaniach gemma-4-31B-it osiąga 46,1 na Terminal-Bench 2.1, czyli o 3,1 punktu więcej niż model bazowy, oraz średnią poprawę o 2,1 punktu w pięciu treningach. Wszystko opublikowano na licencji Apache-2.0.
🔗 Wpis o TermGrade · Kolekcja TermGrade na Hugging Face
TRL v1.15.0: zintegrowana głowica LM umożliwiająca trenowanie na sekwencjach do 6,9 razy dłuższych
8 października — TRL v1.15.0, biblioteka do trenowania modeli od Hugging Face, wprowadza zintegrowaną głowicę LM (fused LM head), która bezpośrednio oblicza logarytmy prawdopodobieństw i entropię każdego tokenu za pomocą jądra Triton, bez tworzenia pełnego tensora logits; jest ona domyślnie włączona dla SFT, DPO, KTO, GRPO, RLOO i destylacji. Przy 8 192 tokenach szczytowe zużycie pamięci spada o 52 do 82 % w zależności od metody. Pomiary przeprowadzono na B300 z pamięcią ograniczoną do 79 Gio, z losowymi wagami gemma-3-1b, którego słownik liczy 262 000 tokenów; największe korzyści uzyskują małe modele z dużym słownikiem. Wersja wprowadza także zmiany naruszające kompatybilność: koniec obsługi Python 3.10, oznaczenie use_liger_kernel jako przestarzałego i usunięcie eksperymentalnego trenera MiniLLM.
| Metoda treningu | Maksymalna długość w v1.14.2 (tokens) | Maksymalna długość w v1.15.0 (tokens) | Współczynnik wzrostu |
|---|---|---|---|
| DPO | 10 240 | 59 392 | ×5,80 |
| KTO (partia 2) | 9 216 | 63 488 | ×6,89 |
| GRPO | 28 672 | 114 688 | ×4,00 |
| RLOO | 23 552 | 100 352 | ×4,26 |
| SFT (funkcja straty nll) | 20 480 | 107 520 | ×5,25 |
🔗 Informacje o wydaniu TRL v1.15.0
Inferencja: llama.cpp w Windows ML, ML Drift jako open source, Together AI na B300 w IBM Cloud
Trzy ogłoszenia dotyczące uruchamiania modeli, od PC z Windows po klaster GPU.
llama.cpp trafia do Windows ML w wersji eksperymentalnej
7 października — Podczas wydarzenia poświęconego Windows Microsoft dodaje do Windows ML, swojego środowiska lokalnej inferencji, eksperymentalną obsługę llama.cpp: można pobrać model GGUF z Hugging Face i uruchomić go lokalnie przez ten sam stos Windows ML, korzystając z nowych API przeznaczonych do konkretnych zadań. Natywne API wykonawcze Windows, działające na niższym poziomie, również trafia do eksperymentalnej wersji zapoznawczej. Microsoft deklaruje bezpośredni wkład w projekt llama.cpp wraz z NVIDIA i społecznością: zoptymalizowane jądra CUDA, lepsze planowanie pracy między procesorem a GPU, CUDA graphs, dekodowanie spekulacyjne (Eagle-3, MTP, D-Flash2), wykonywanie na wielu GPU i format NVFP4. Wpis przedstawia te nowości w kontekście PC wyposażonych w układy NVIDIA RTX Spark, takich jak Surface Laptop Ultra. Na X Georgi Gerganov z llama.cpp z zadowoleniem przyjmuje obecność projektu na wydarzeniu Windows i widzi w niej znak, że stosy oprogramowania i sprzętu wreszcie się łączą.
🔗 Wpis Microsoft Foundry on Windows · Wpis @ggerganov
ML Drift: silnik GPU LiteRT opublikowany jako open source
8 października — Zespół Google AI Edge publikuje jako open source, na licencji Apache 2.0, ML Drift, swój silnik obliczeniowy GPU do inferencji na urządzeniu. Ukrywa on różnice między OpenGL ES, OpenCL, Metal i WebGPU, służy jako silnik akceleracji GPU dla LiteRT, jest dostępny jako samodzielna biblioteka i zastępuje delegata GPU TensorFlow Lite, który nie będzie już otrzymywać nowych funkcji. Silnik zmienia jądra w zależności od tego, czy LLM odczytuje prompt, czy generuje tokeny, oraz udostępnia przewodnik SKILL.md, dzięki któremu agenci programistyczni mogą pisać i weryfikować shadery. Działa już w środowisku produkcyjnym: według wpisu zmniejsza opóźnienie na klatkę nawet o 40 % w efektach YouTube Shorts i przynosi poprawę nawet o 30 % w mobilnych wersjach Lightroom i Photoshop; w przypadku Gemma Google odnotowuje zużycie pamięci nawet o 12 % mniejsze niż w innych środowiskach programistycznych (frameworks).
🔗 Ogłoszenie ML Drift na Google Developers Blog · Repozytorium google-ai-edge/ml-drift
Together AI pierwszym klientem klastra GPU B300 do inferencji w IBM Cloud
6 października — Together AI ogłasza współpracę z IBM i NVIDIA w celu zwiększenia swoich mocy obliczeniowych do inferencji dla przedsiębiorstw, zaczynając od dużego klastra GPU NVIDIA B300 hostowanego w IBM Cloud i połączonego siecią Ethernet Spectrum-X firmy NVIDIA. Według Together AI jest to pierwszy dedykowany klaster inferencyjny tej skali w IBM Cloud, a firma jest jego pierwszym klientem: obsługuje warstwę inferencji, IBM zapewnia chmurę, a NVIDIA układy i sieć. Together AI uzasadnia rozbudowę zapotrzebowaniem na otwarte modele: deklaruje, że co miesiąc przetwarza setki bilionów tokenów dla ponad miliona deweloperów. Wpis nie podaje ani wielkości klastra, ani harmonogramu.
🔗 Wpis Together AI · Wpis @togethercompute
W skrócie
- Szybsze sterowanie Codex — W aplikacji desktopowej ChatGPT Codex wcześniej uwzględnia wiadomość uzupełniającą wysłaną podczas zadania, aby skorygować podejście lub zmienić kierunek; ustawienie Follow-up behavior określa, czy te wiadomości ukierunkowują bieżące wykonanie, czy czekają na następne. 🔗 źródło
- ChatGPT Go w Warp — Abonenci planu ChatGPT Go mogą teraz korzystać z niego w Warp przy wszelkich pytaniach dotyczących terminala lub zadaniach programistycznych; według cytowanego przez Warp członka zespołu Sign in with ChatGPT w OpenAI korzystanie w ramach abonamentu jest dostępne klientom Go, obok Plus i Pro, we wszystkich aplikacjach partnerskich. 🔗 źródło
- Oracle — Według studium przypadku OpenAI Oracle ma 130 000 aktywnych użytkowników ChatGPT i ponad 95 000 użytkowników Codex; badanie rynku talentów, które wymagało 2 do 4 dni, przygotowuje się w 15 do 20 minut, a Codex przekłada pytania biznesowe na zapytania SQL. 🔗 źródło
- Pollo AI — Ta platforma do tworzenia wideo, która deklaruje ponad 26 milionów użytkowników, kieruje zapytania swojego agenta za pomocą GPT-5.6, powierza trudne zadania GPT-6 Astra, a generowanie wszystkich obrazów GPT-Image-2.5, i twierdzi, że skraca czas poświęcany na wybór modelu o ponad 50 %. 🔗 źródło
- Informacje o wydaniu Devin z 7 października — Panel powiadomień zbiera alerty z sesji, z możliwością skonfigurowania wysyłki na telefon, stan kolejki scalania jest widoczny w całej aplikacji, a klucze prywatne zapisane jako sekrety są maskowane wiersz po wierszu w wynikach poleceń. 🔗 źródło
- Copilot CLI 1.0.94 — Po sześciu wersjach wstępnych trafia do wydania stabilnego, dodaje Claude Haiku 5.5 do selektora modeli, przekazuje wyświetlany kod shell mechanizmowi oceny Assisted Permissions, aby uniknąć zbędnych zatwierdzeń, i pozwala włączyć serwer MCP przed jego wykryciem. 🔗 źródło
- Gemini CLI v0.65.0-nightly.20261008 — Telemetria obsługuje niestandardowe nagłówki OTLP (
telemetry.otlpHeaders), o co wnioskowano od października 2025; CLI nie wpada już w pętlę między weryfikacją a OAuth, a historia zawsze kończy się wiadomością użytkownika, co zapobiega błędowi 400 po/rewind. 🔗 źródło - SDK Antigravity 0.1.21 oddziela eksperymentalne API i reguluje skills podagentów — Pierwsza wersja wpisana do changelogu od 0.1.18 z 21 września: dekorator
@betai modułgoogle.antigravity.betaoddzielają wersje wstępne od stabilnego API, askills_configpozwala podagentowi odziedziczyć skills agenta nadrzędnego, zastąpić je lub z nich zrezygnować. 🔗 źródło - Developer Knowledge API — Google przedstawia ekosystem tego API, które udostępnia aktualną dokumentację deweloperską (Google Cloud, Firebase, Android) w formacie Markdown: polecenie
gcloud developer-knowledgepreinstalowane w Cloud Shell, skill dla agentów programistycznych połączony z serwerem MCP, z wymienionymi Antigravity, Claude Code, Cursor i GitHub Copilot, oraz biblioteki w siedmiu językach. 🔗 źródło - AQuA — Google Cloud udostępnia jako implementację referencyjną tego agenta jakości (Ambient Quality Agent), który pobiera próbkę obejmującą do 1 000 sesji agenta ADK działającego w środowisku produkcyjnym, grupuje niepowodzenia, śledzi je w BigQuery i uruchamia diagnostykę przyczyn za pomocą Gemini 3.8 Flash. 🔗 źródło
- Wersje robocze wliczają się do limitów pull requests — W odpowiedzi na wkład niskiej jakości GitHub umożliwia uwzględnianie wersji roboczych pull requests w limitach na użytkownika, podczas gdy dotąd współtwórca mógł otwierać je bez ograniczeń. 🔗 źródło
- Archiwizowanie pull requests — Nie jest już zarezerwowane dla administratorów: role triage, write, maintain i admin mogą archiwizować pull request, co go zamyka, ukrywa przed publicznym dostępem i blokuje wszelką nową aktywność, w tym komentarze administratorów. 🔗 źródło
- Osie czasu GitHub i czytniki ekranu — Czytniki ekranu przeglądają osie czasu issues i pull requests jako listy, podając liczbę elementów i bieżącą pozycję, oraz informują o załadowanych zdarzeniach, na github.com i w GitHub Enterprise Server 3.23. 🔗 źródło
- Paper Reproductions with ML Intern — Abubakar Abid zapowiada w Hugging Face funkcję, która z poziomu Paper Pages zleca agentom niezależne odtworzenie eksperymentów z opublikowanego artykułu, aby tworzyć otwarte artefakty pomagające rozpoznać solidne prace; brak danych liczbowych i dokumentacji. 🔗 źródło
- Czat Hugging Face przez SSH — Adrien Carreira, szef infrastruktury Hugging Face, przedstawia czat z otwartymi modelami dostępny przez polecenie
ssh chat.hf.co, bez konfiguracji i klucza; nie towarzyszy mu żadna dokumentacja ani lista modeli. 🔗 źródło - huggingface_hub 2.2.0 — Niewielkie wydanie z poprawkami:
hf jobs statszwraca teraz migawkę, po czym oddaje sterowanie (-fdo śledzenia na żywo), wszystkie równoległe pobierania korzystają z hf_xet, a dwie zmiany naruszają kompatybilność. 🔗 źródło - swarmlab — Hugging Face bez zapowiedzi udostępniło to środowisko testowe, które bada, jak roje agentów LLM różnych dostawców dochodzą do prawdy lub dzielą się w zależności od topologii wymiany informacji, opóźnień i ról; do przetestowania hipotezy wystarczy jeden wiersz YAML. 🔗 źródło
- Darwin-27B-ZTC — VIDRAFT udostępnia na licencji Apache-2.0 model oceniający, który w jednym przebiegu zwraca rozkład prawdopodobieństwa możliwych odpowiedzi, bez generowania tokena: według autorów osiąga trafność 0,743 w trybie zero-shot na 2 000 ocen z typed-decisions oraz wynik Brier 0,097. 🔗 źródło
- Superfluid — basecompute udostępnia na licencji Apache-2.0 ten lokalny serwer LLM, zgodny z API OpenAI, Anthropic i Ollama, który daje pierwszeństwo pytaniom interaktywnym przed pracą agentów: według autorów czas odpowiedzi wynosi 0,36 sekundy przy ośmiu aktywnych agentach, wobec ponad 10 sekund dla llama-server. 🔗 źródło
- funes 1.8.0 — Narzędzie indeksujące sesje agentów programistycznych dodaje wielojęzyczny model embeddings: dla 30 pytań dotyczących 2 000 rozmów po chińsku właściwa rozmowa pojawia się wśród ośmiu pierwszych wyników 30 razy na 30, wobec 23 wcześniej, a średnia odwrotność rangi wzrasta z 0,601 do 0,983. 🔗 źródło
- GLiNER i języki indyjskie — Wpis społeczności pokazuje, że zachowanie znaków łączących w wyrazach, bez ponownego treningu, podnosi średni F1 GLiNER2 w trybie zero-shot z 13,2 do 68,0 dla dziewięciu języków indyjskich, a w przypadku modelu dostrojonego w hindi z 59,9 do 82,6. 🔗 źródło
- Multilingual Terminal-Bench — LILT szczegółowo opisuje swój zestaw testowy obejmujący 324 zadania programistyczne w dziesięciu językach: Claude Opus 5.5 wyprzedza w nim Opus 5 o około 3 punkty, zużywając o 30 % mniej tokenów, co oznacza koszt zadania niższy o około 45 %; mediana liczby tur na zadanie wynosi tam 41 dla Gemini 3.8 Flash, wobec 5 dla GPT-6 Sol. 🔗 źródło
- Kolektywne prymitywy GPU — Milos Kotlar przewiduje czas komunikacji pięciu prymitywów na czterech RTX 4090 ze średnim błędem 10,9 %, wobec 22,9 % dla wspólnego modelu, ale w najgorszym przypadku błąd wynosi 61,6 %. 🔗 źródło
- Best-of-N w rozumowaniu wideo — facebookresearch udostępnia w internecie, bez zapowiedzi i na niekomercyjnej licencji CC BY-NC 4.0, kod badania Selecting or Solving? dotyczącego selekcji best-of-N i zespołów weryfikatorów w rozumowaniu wideo. 🔗 źródło
- KDD Cup 2026 Data Agents — NVIDIA szczegółowo opisuje system sterowania agentem, dzięki któremu jej zespół KGMON zajął drugie miejsce z narzuconym małym LLM: dane przekonwertowane na tabele SQLite, schemat dostarczony od razu, niewielki zestaw narzędzi, ukierunkowane czytanie dokumentów; wpis nie podaje ani wyniku, ani nazwy modelu. 🔗 źródło
- Microduck — Matthieu Lapeyre z Pollen Robotics ogłasza ponad trzy godziny pracy na baterii o pojemności 2 600 mAh dla tego małego dwunożnego robota wyposażonego w nową płytkę elektroniczną własnej konstrukcji, z procesorem, którego temperatura osiąga najwyżej 60 °C zamiast 114 °C. 🔗 źródło
- Albumy w Suno — Funkcja zaprezentowana 5 października już działa: można zebrać swoje utwory w pełne wydanie, wybrać okładkę, ustalić kolejność utworów i opublikować je w wybranym momencie; nie określono planu abonamentowego ani limitu utworów. 🔗 źródło
- HeyGen i Ryan Serhant — HeyGen uruchamia codzienną serię wideo prowadzoną przez oficjalnego awatara agenta nieruchomości Ryana Serhanta, znanego z serialu Netflix Owning Manhattan, na Instagramie, TikToku i X; brak szczegółów finansowych. 🔗 źródło
- Runway i Tech Coalition — Runway dołącza do tego sojuszu przeciwko wykorzystywaniu seksualnemu dzieci w internecie oraz do jego programu Lantern służącego wymianie sygnałów między platformami i przypomina o swoich zabezpieczeniach: filtrowaniu danych, testach adwersarialnych, haszowaniu, zgłaszaniu do NCMEC i pochodzeniu treści zgodnym z C2PA. 🔗 źródło
- SpaceXAI i Omarchy — SpaceXAI zostaje mecenasem założycielskim Omacom Foundation, przekazując 1,5 miliona dolarów w tokenach Grok; Grok 4.7 i jego następcy będą zasilać agentów projektu, w tym Omabot, który przegląda pull requests. 🔗 źródło
- Poradnik zabezpieczeń Perplexity — Perplexity publikuje poradnik, który umiejscawia zabezpieczenia AI na trzech etapach (wejście, działania agentów, wyjście), porównuje pięć rodzajów ochrony i ilustruje siedem przypadków, od wstrzyknięcia promptu po halucynację; brak nowych funkcji. 🔗 źródło
- pplx-decider-v1.1-27b w OpenRouter — Model decyzyjny Perplexity z otwartymi wagami trafia do OpenRouter z cenami takimi jak w Decisions API: 0,02 dolara za milion tokenów wejściowych, wyjście bezpłatne, kontekst 262 000 tokenów. 🔗 źródło
- Cohere w Ottawie — Cohere otwiera swoje pierwsze biuro w Ottawie, w pobliżu parku Lansdowne, gdzie pracuje już blisko 30 osób (komercjalizacja, inżynieria, infrastruktura, bezpieczeństwo, suwerenna AI); nie podano powierzchni ani docelowej liczby pracowników. 🔗 źródło
Co to oznacza
Asystent tworzy teraz konkretne materiały do pracy, a nie tylko odpowiedzi. Panel Claude Dashboards aktualizuje się, gdy zmieniają się dane, animacja Claude Motion pozostaje edytowalna słowo po słowie, ponieważ jest zapisana w kodzie, a Docs, Slides i Design, które wyszły z wersji beta we wszystkich planach, deklarują już ponad 45 milionów stworzonych projektów. Te materiały trafiają następnie do istniejących narzędzi: panel do Grafana lub PostHog, animacja do Runway lub Luma, które dodają do niej wygenerowane ujęcia. Brand Kit od ElevenLabs działa według tej samej logiki: identyfikacja wizualna staje się obiektem w przestrzeni roboczej, wywoływanym przez @, zamiast instrukcją powtarzaną w każdym prompcie.
Bezpieczeństwo zmienia skalę zarówno po stronie obrony, jak i egzekwowania zasad. Anthropic stwierdza, że wykrywanie podatności nigdy nie było tak łatwe: ponad 29 000 potencjalnych podatności w sześć miesięcy, z czego około 6 000 poddano ręcznej ocenie. OSS Scanner bierze na siebie wysyłanie raportów bez weryfikacji przez człowieka, z oczekiwanym odsetkiem prawdziwie dodatnich wyników przekraczającym 90 %, aby zmniejszyć to wąskie gardło. Równolegle doprecyzowywane są zasady użytkowania: polityka Anthropic na 2026 rok grupuje kampanie wprowadzające w błąd w osobnej sekcji, a OpenAI przedstawia Dark Clark jako pierwszą operację kategorii 5, którą rozbiło od rozpoczęcia publikowania swoich raportów. W narzędziach Claude Code 2.1.295 pozwala teraz, by niesprawny hook blokował działanie, zamiast zezwalać na jego wykonanie.
Szybkość i cena stają się parametrami, które można wybierać. Ultrafast sprzedaje GPT-6.1 Sol sześć razy drożej w zamian za nawet 8 razy większą szybkość; według GitHub i Cognition Claude Haiku 5.5 dorównuje Sonnet 5 lub go wyprzedza w zadaniach programistycznych, przy około jednej ósmej kosztu zadania według Cognition; Nano Banana 2.1 obniża cenę obrazu 1K o połowę. Inferencja rozciąga się od urządzeń, z llama.cpp w Windows ML i ML Drift na GPU telefonów i komputerów, aż po klaster B300, którego pierwszym klientem w IBM Cloud jest Together AI, a TRL zmniejsza szczytowe zużycie pamięci podczas treningu z 8 192 tokenami o 52 do 82 %.
Wreszcie, wiele dzisiejszych danych liczbowych pochodzi z pomiarów tych, którzy je publikują. FrontierCode to własny benchmark Cognition, GitHub twierdzi, że Haiku 5.5 dorównuje Sonnet 5, nie publikując danych liczbowych, LightOn oblicza wyniki po normalizacji, która zmienia wyniki wszystkich czołowych modeli, TII ocenia Falcon-ASR w emirackiej odmianie arabskiego tylko na wewnętrznym zbiorze danych i nie publikuje jego wag, a autorzy Carbon-A sami porównują go z siedmioma narzędziami. Otwarta nauka stanowi przeciwwagę: TermGrade publikuje swoje 36 144 próby, w tym nieudane, Carbon-A swoją bazę 566 milionów genów kandydujących, a mapa ultrafioletowa Claude Science rozróżnia piksel po pikselu to, co zmierzono, od tego, co przewidziano. 150 milionów dolarów od Anthropic i miliard od NVIDIA na Genesis Mission wspierają ten sam kierunek: oddanie tych narzędzi w ręce naukowców.
Źródła
- Claude Dashboards i Claude Motion (wpis na blogu Claude)
- Wątek ogłaszający premierę Dashboards i Motion (@claudeai)
- Claude Motion (@claudeai)
- Runway i Claude Motion (Runway)
- Luma i Claude Motion (Luma)
- Anthropic Cyber Mission (Anthropic)
- OSS Scanner (Frontier Red Team Anthropic)
- Repozytorium anthropics/oss-scanner
- Ultrafast dla GPT-6.1 Sol (@OpenAIDevs)
- Dziennik zmian API OpenAI
- Cennik API OpenAI
- Ultrafast w Codex (dokumentacja)
- Zaangażowanie w Genesis Mission (Anthropic)
- Ogłoszenie Genesis Mission (@AnthropicAI)
- NVIDIA zobowiązuje się przeznaczyć 1 miliard dolarów na rozwój nauki w USA (NVIDIA)
- Brakująca mapa nieba (Anthropic Science)
- Mapa nieba w ultrafiolecie (@AnthropicAI)
- Aktualizacja polityki użytkowania na 2026 rok (Anthropic)
- Zakłócanie działań prowadzonych pod fałszywą przykrywką z użyciem AI (OpenAI)
- Claude Haiku 5.5 w GitHub Copilot (dziennik zmian GitHub)
- Modele i cennik GitHub Copilot
- Claude Haiku 5.5 w Devin (blog Devin)
- Claude Code 2.1.295
- Claude Code 2.1.294
- Codex CLI 0.162.0
- Dziennik zmian Antigravity, karta CLI
- Informacje o wydaniu VS Code 1.141
- Informacje o wydaniach Delta
- Wpis na blogu Delta o rezygnacji z Google Docs
- Informacje o wydaniach API Gemini
- Karta Nano Banana 2.1
- Przedstawiamy Brand Kit (ElevenLabs)
- Brand Kit (@ElevenLabs)
- SemanTok (Stability AI)
- Publikacja o SemanTok na arXiv
- ElevenReader w Brazylii (ElevenLabs)
- LightOnOCR-3 (blog Hugging Face)
- Falcon-ASR (blog Hugging Face)
- Carbon-A i Carbon Annotation Database (blog Hugging Face)
- TermGrade (ai&)
- Kolekcja TermGrade na Hugging Face
- TRL v1.15.0
- llama.cpp w Windows ML (Microsoft Foundry on Windows)
- llama.cpp na wydarzeniu Windows (@ggerganov)
- ML Drift (blog Google Developers)
- Repozytorium google-ai-edge/ml-drift
- Together AI, IBM Cloud i NVIDIA (blog Together AI)
- Klaster B300 w IBM Cloud (@togethercompute)
- Informacje o wydaniach ChatGPT
- ChatGPT Go w Warp (@warpdotdev)
- Oracle (studium przypadku OpenAI)
- Pollo AI (studium przypadku OpenAI)
- Informacje o wydaniu Devin z 7 października
- Copilot CLI 1.0.94
- Gemini CLI v0.65.0-nightly.20261008
- Dziennik zmian Antigravity, karta SDK
- Ekosystem Developer Knowledge API (blog Google Developers)
- AQuA, agent kontroli jakości dla agentów ADK (blog Google Developers)
- Robocze pull requesty wliczają się do limitów pull requestów (dziennik zmian GitHub)
- Użytkownicy z rolą Triage lub wyższą mogą teraz archiwizować pull requesty (dziennik zmian GitHub)
- Czytniki ekranu mogą nawigować po osiach czasu jak po listach (dziennik zmian GitHub)
- Odtwarzanie wyników publikacji naukowych za pomocą ML Intern (@abidlabs)
- Czat przez SSH (@XciD_)
- huggingface_hub 2.2.0
- Repozytorium huggingface/swarmlab
- Darwin-27B-ZTC (blog Hugging Face)
- Superfluid (blog Hugging Face)
- funes 1.8.0 (blog Hugging Face)
- GLiNER i języki indyjskie (blog Hugging Face)
- Multilingual Terminal-Bench (blog Hugging Face)
- Czas komunikacji prymitywów kolektywnych GPU (blog Hugging Face)
- Repozytorium facebookresearch/best-n-selection-video-reasoning
- Wnioski z KDD Cup 2026 (blog techniczny NVIDIA)
- Autonomia Microduck (@matth_lapeyre)
- Albumy w Suno (@suno)
- Codzienna seria Ryana Serhanta (@HeyGen)
- Runway dołącza do Tech Coalition (Runway)
- SpaceXAI, mecenas założycielski (omarchy.org)
- Zabezpieczenia AI (Perplexity)
- pplx-decider-v1.1-27b na OpenRouter
- Nowe biuro Cohere w Ottawie (Cohere)