ai-powered-markdown-translatorArtykuł przetłumaczony z fr na pl za pomocą gpt-5.4-mini.
24 sierpnia to dzień równie mocno sprzętowy, co modelowy. NVIDIA ogłasza trzy komunikaty infrastrukturalne w tym samym bloku Hot Chips — pierwsze pomiary na krzemie dla Vera Rubin NVL72, wejście Groq 3 LPX do produkcji, otwarcie platformy na układy firm trzecich poprzez NVLink Fusion. Alibaba uruchamia Wan 3.0, który generuje natywne 30 sekund wideo w jednym przebiegu. I dwa laboratoria spoza USA pokazują się tego samego dnia obok instytucji krajowych: Mistral z HUMAIN w Arabii Saudyjskiej, Sakana AI z japońskim Ministerstwem Obrony. Do tego dochodzi ogólna dostępność zarządzanej przez przedsiębiorstwo autoryzacji dla konektorów MCP w Anthropic, pojawienie się GPT-5.6 w Kiro oraz seria ogłoszeń dotyczących agentów głosowych.
Wan 3.0 generuje 30 sekund natywnie w jednym przebiegu
24 sierpnia — Alibaba uruchamia Wan 3.0, nową generację swojego modelu wideo. Najbardziej widoczna zmiana dotyczy długości: model produkuje natywne 30 sekund w jednym przebiegu, bez łączenia kolejnych ujęć (stitching). Dotąd przekroczenie około dziesięciu sekund wymagało generowania kilku segmentów, a następnie ich scalania, z towarzyszącymi temu rozjazdami spójności w oświetleniu, teksturach i twarzach.
Drugim filarem jest wejście multimodalne. Wan 3.0 przyjmuje do 20 zasobów referencyjnych i analizuje dokumenty oraz strony internetowe oprócz obrazów, dźwięku i wideo — to, co oficjalna strona nazywa tworzeniem omnimodalnym (Omni-Creation). W praktyce podaje mu się raczej pakiet materiałów marki niż sam opis tekstowy.
Model generuje ponadto natywny zsynchronizowany dźwięk: głosy, efekty i tło są produkowane równocześnie z obrazem, a nie dodawane później. Jeśli chodzi o obrazy statyczne, Wan 3.0 łączy do 9 obrazów w jedną kompozycję i generuje 12 sekwencyjnych obrazów o stałym stylu i temacie, co wprost celuje w storyboard i warianty reklamowe.
Dwie mniej spektakularne, ale istotne w zastosowaniach zawodowych możliwości to renderowanie długiego tekstu w 12 językach, obejmujące wykresy, wzory i infografiki tam, gdzie modele wideo zwykle zawodzą, oraz precyzyjna kontrola kolorymetryczna, warunek zgodności z księgą identyfikacji wizualnej.
Ekosystem zareagował jeszcze tego samego dnia: Wan 3.0 był dostępny od dnia premiery w fal, Leonardo.Ai, Scenario, RunningHub, Venice, TapNow, DeeVid, Pixmax oraz przez Pika API Club.
| Zadeklarowana możliwość | Wartość dla Wan 3.0 |
|---|---|
| Natywna długość | 30 s w jednym przebiegu, bez łączenia |
| Zasoby referencyjne | Do 20, z analizą dokumentów i stron internetowych |
| Dźwięk | Zsynchronizowany, generowany natywnie wraz z obrazami |
| Renderowanie tekstu | Długi tekst w 12 językach (wykresy, wzory, infografiki) |
| Łączenie obrazów | Do 9 obrazów w jedną kompozycję |
| Sekwencje obrazów | Do 12 spójnych obrazów sekwencyjnych |
NVIDIA mierzy do 30x więcej pracy na wat na Vera Rubin NVL72
24 sierpnia — Z okazji konferencji Hot Chips NVIDIA publikuje swoje pierwsze pomiary wydajności na krzemie dla Vera Rubin NVL72. Wyróżniana liczba bezpośrednio odnosi się do ekonomii centrów danych: do 30x większa przepustowość na megawat niż generacja GB300 NVL72 na modelu DeepSeek V4 Pro oraz koszt na milion tokenów nawet 35x niższy.
Znaczenie ma też metodologia. NVIDIA odrzuca klasyczne pomiary inferencji, kalibrowane na sekwencjach od 1 000 do 8 000 tokenów: w sesji agentowej kontekst narasta i sięga setek tysięcy tokenów wejściowych. Pomiary wykonano więc z użyciem SemiAnalysis AgentX, czyli rzeczywistego, zarejestrowanego obciążenia sesjami agentowego kodowania, z zachowanymi wywołaniami narzędzi i subagentami. Dwie uwagi: liczby czekają na recenzję SemiAnalysis i nie uwzględniają jeszcze wkładu CPU Vera.
Uzasadnienie wynika ze statystyki OpenRouter: obciążenie agentowe zużywa 15x więcej tokenów niż zwykłe zapytanie czatowe. Dla fabryki AI ograniczonej energią stawka jest opisana bez ogródek — przepustowość na megawat decyduje o przychodzie, koszt na milion tokenów decyduje o marży. Technologia DSX MaxLPS pozwala ponadto zapewnić do 40% więcej GPU przy tym samym budżecie megawatowym.
Zyski pochodzą z szeregu optymalizacji inferencji: usługi rozdzielonej, oddzielającej przetwarzanie kontekstu od generowania odpowiedzi, rozproszonej pamięci podręcznej KV z odciążaniem etapami, scalonych jąder CUDA takich jak MegaMoE oraz kwantyzacji NVFP4, która kompresuje wagi do 4 bitów. Cała platforma obejmuje siedem układów, w tym GPU Rubin.
| Zmierzane porównanie | Zapowiadany zysk |
|---|---|
| Vera Rubin NVL72 kontra GB300 NVL72 (przepustowość/MW) | do 30x |
| Vera Rubin NVL72 kontra GB300 NVL72 (koszt/milion tokenów) | do 35x taniej |
| GB300 NVL72 kontra Hopper (przepustowość/MW) | do 15x |
| DSX MaxLPS | +40% GPU przy tym samym budżecie MW |
🔗 Vera Rubin NVL72 i obciążenia agentowe
Groq 3 LPX wchodzi do pełnej produkcji, Nebius i SpaceXAI adoptują Vera Rubin
24 sierpnia — Druga część tego samego bloku Hot Chips: system rack-scale NVIDIA Groq 3 LPX wchodzi do pełnej produkcji, jako rozszerzenie Vera Rubin NVL72.
Liczba referencyjna pochodzi z benchmarku Artificial Analysis na Gemma 4 31B: 3 400 tokenów wyjściowych na sekundę przy długim kontekście 100 000 tokenów, czyli 4x więcej niż najbliższa alternatywna platforma. Rozwiązywany problem ma konkretną nazwę — opóźnienie dekodowania: agent generuje odpowiedź token po tokenie, a najmniejsze opóźnienie jednostkowe mnoży się wzdłuż łańcuchów pracy.
Podział ról jest jasny: GPU Rubin obsługują kontekst na dużą skalę, LPX przyspiesza dekodowanie wrażliwe na opóźnienia. Jeden rack może zawierać 256 akceleratorów LP30 połączonych bezpośrednimi łączami chip-to-chip.
Wymieniono trzech adoptujących. Nebius jest pierwszym cloudem AI, który integruje Groq 3 LPX, w swojej Token Factory; CoreWeave wdraża w produkcji Spectrum-X Multiplane, aby połączyć swoje racki Vera Rubin; a SpaceXAI adoptuje CPU NVIDIA Vera do orkiestracji, wywołań narzędzi i wykonywania kodu za agentową AI, z zamiarem zbudowania architektury wokół Vera Rubin — od naziemnych centrów danych po satelity na orbicie.
Po stronie sieci przekroczenie rozmiarów największych obecnych klastrów wymagałoby dotąd trzeciego poziomu, kosztownego w okablowaniu, optyce, energii i opóźnieniu. Spectrum-X Multiplane zamiast tego dzieli połączenie każdego serwera na kilka niezależnych ścieżek, czyli planów, z których każda działa jako własna sieć dwupoziomowa.
| Mierzony element | Zapowiadana wartość |
|---|---|
| Groq 3 LPX na Gemma 4 31B, kontekst 100k | 3 400 tokenów/s wyjściowo, 4x najbliższa platforma |
| Rack Groq 3 LPX | do 256 akceleratorów LP30, łącza chip-to-chip |
| Spectrum-X Multiplane | do 512 000 GPU na dwóch poziomach |
| Utrata jednego z ośmiu planów | zachowane około 90% przepustowości |
| Odtworzenie sprzętowe | 11x szybciej niż równoważenie programowe, 1,6x produkcji |
🔗 Groq 3 LPX, Spectrum-X i NVLink Fusion
NVLink Fusion podłącza niestandardowe układy do platformy NVIDIA
24 sierpnia — Trzeci artykuł NVIDIA tego dnia: NVLink Fusion wprowadza niestandardowe układy (XPU) do domeny skalowania NVLink obejmującej 72 akceleratory. Szósta generacja NVLink pokazuje opóźnienie end-to-end 3x niższe niż rozwiązania oparte na standardowym Ethernecie, przy 10x większej przepustowości pakietów; mapa drogowa zapowiada domeny do 1 152 akceleratorów oraz optykę co-packaged. NVLink-C2C łączy XPU z CPU Vera lub innymi CPU z nawet 6x lepszą efektywnością energetyczną niż interfejs PCIe.
Argument dotyczy rozdzielenia warstw: planowanie fabryki AI — energia, budynek, chłodzenie, racki, sieć — zaczyna się długo przed ustaleniem mieszanki akceleratorów, a centrum danych zamknięte na jeden układ staje się ryzykiem harmonogramowym. Adoptujący ponownie wykorzystują architekturę rack MGX i jej łańcuch dostaw. Wymienieni partnerzy: Intel, MediaTek, GUC, QCT i Annapurna Labs.
Mistral i HUMAIN podpisują umowę o suwerenną AI w Arabii Saudyjskiej
24 sierpnia — Mistral ogłasza strategiczną współpracę z HUMAIN, saudyjską firmą zajmującą się sztuczną inteligencją: infrastrukturą obliczeniową, rozwojem zaawansowanych modeli i wdrażaniem rozwiązań w królestwie oraz regionie. Zobowiązanie, według Mistral, opiewa na kilkaset milionów euro.
Początkowe obszary to cyberbezpieczeństwo i głos, z wydajnymi modelami granicznymi w języku arabskim. Mistral zbada wykorzystanie centrów danych HUMAIN na potrzeby własnych lokalnych mocy obliczeniowych, a obaj partnerzy wspólnie celują w branże regulowane królestwa. Ogłoszenie rozwija serię rozpoczętą tego lata — rozszerzone partnerstwo z Microsoft, a potem European Compute Units na początku sierpnia — a komunikat precyzuje, że są to stwierdzenia wybiegające w przyszłość, zależne od późniejszych umów handlowych.
Control is becoming the defining topic in enterprise AI adoption. Across the world, and especially in regulated industries, organizations want the benefits of AI without giving up control over their sensitive data and systems.
🇵🇱 Kontrola staje się kluczowym tematem wdrażania AI w przedsiębiorstwach. Na całym świecie, a szczególnie w branżach regulowanych, organizacje chcą korzyści z AI bez rezygnacji z kontroli nad swoimi danymi i wrażliwymi systemami. — @MistralAI na X
🔗 Ogłoszenie @MistralAI · Wpis Mistral
Sakana AI zdobywa kontrakt japońskiego Ministerstwa Obrony
24 sierpnia — Sakana AI ujawnia kontrakt podpisany 29 lipca z japońskim Ministerstwem Obrony (防衛省), dotyczący badania i demonstracji funkcji AI niezbędnych do zintegrowanych operacji analitycznych. Projekt kierowany jest do oficerów analitycznych Dyrekcji Wywiadu, w trzech obszarach: zbieraniu informacji, możliwościach analitycznych i zarządzaniu dokumentacją. Wykorzystywany element to technologia agentów AI laboratorium.
To nie jest jego pierwszy kontrakt obronny: w marcu 2026 roku tokijski lab został już wybrany do prac nad podstawowymi technologiami systemów dowodzenia i kontroli. Dla firmy, której publiczna tożsamość opiera się na otwartych modelach, ta trajektoria zasługuje na odnotowanie — blog ma teraz osobną sekcję poświęconą obronie i wywiadowi, a Sakana AI rekrutuje do tego zespołu.
「Sakana AI株式会社は、令和8年7月29日、防衛省と「総合分析業務に必要なAI機能の調査・実証」に関する契約を締結いたしました。」
🇵🇱 Sakana AI zawarło 29 lipca 2026 r. umowę z Ministerstwem Obrony dotyczącą badania i demonstracji funkcji AI niezbędnych do zintegrowanych operacji analitycznych. — Sakana AI, oficjalny wpis
🔗 Sakana AI — zintegrowana analiza dla obrony
Anthropic udostępnia ogólnie zarządzaną przez przedsiębiorstwo autoryzację dla konektorów MCP
24 sierpnia — Zarządzana przez przedsiębiorstwo autoryzacja (enterprise-managed auth) dla konektorów MCP przechodzi do ogólnej dostępności w Claude Team i Claude Enterprise, po otwartej becie w czerwcu. Rozwiązany problem jest konkretny: dotąd podłączenie konektora MCP wymagało dwóch kroków — administrator włączał go dla organizacji, a następnie każdy użytkownik przechodził przez przepływ OAuth dla każdego narzędzia. Administrator autoryzuje teraz jednorazowo, przez dostawcę tożsamości przedsiębiorstwa, a użytkownicy znajdują swoje narzędzia już połączone.
Jeden punkt zainteresuje zespoły bezpieczeństwa: administrator może wymagać, aby konektor zawsze przechodził przez dostawcę tożsamości, co uniemożliwia podłączenie prywatnego konta do narzędzia służbowego. Na starcie obsługiwanych jest dziesięciu dostawców MCP — Asana, Atlassian, Canva, Datadog, Figma, Granola, Linear, Notion, Slack i Supabase — z Okta jako jedynym IdP na razie. Mechanizm nie jest własnościowy: to pierwsza implementacja rozszerzenia Enterprise-Managed Authorization dla Model Context Protocol.
🔗 Ogłoszenie @ClaudeDevs · Wpis Anthropic
Boris Cherny uznaje odmowy związane z cyberbezpieczeństwem za błąd
24 sierpnia — Dzień po swoich uwagach o trzech poziomach możliwości, szef Claude Code odpowiada na dwa powtarzające się pytania zadawane przez programistów zajmujących się bezpieczeństwem. Pierwsze dotyczy podejrzenia istnienia uprzywilejowanego modelu wewnętrznego: zespół używa dokładnie tego samego Fable co użytkownicy końcowi.
Drugie jest bardziej bezpośrednie: odmowy wywoływane tematyką cyberbezpieczeństwa są uznawane za błąd, w słowach, które nie próbują tego łagodzić, a zespół pracuje nad ich ograniczeniem. To przydatna informacja dla praktyków bezpieczeństwa defensywnego lub CTF, którzy regularnie napotykają odmowy przy uzasadnionych prośbach. Nie podano żadnego harmonogramu, ale komunikat rozwija sierpniową aktualizację dotyczącą zabezpieczeń biologicznych w Fable 5, która już wtedy miała na celu zmniejszenie liczby fałszywych alarmów.
We use the same exact Fable. Cyber security refusals suck, and we are working on reducing them. More to come.
🇵🇱 Używamy dokładnie tego samego Fable. Odmowy dotyczące cyberbezpieczeństwa są uciążliwe i pracujemy nad ich ograniczeniem. Więcej już wkrótce. — @bcherny na X
Anthropic zaczyna automatycznie utrzymywać własne aplikacje
23 sierpnia — Poproszony o doprecyzowanie, co rozumie przez kodowanie, Boris Cherny wprowadza prosty podział: coding to akt pisania kodu, a engineering to wszystko, co jest ponad to. Przyznaje, że rozróżnienie między pracą taktyczną a strategiczną to inna, również uzasadniona perspektywa.
To końcówka jego wypowiedzi przynosi nową informację. Twierdzi, że widzi, jak części pracy strategicznej zaczynają być automatyzowane, i podaje konkretny przykład: Anthropic zaczyna automatycznie utrzymywać swoje aplikacje, a szybko rosnąca liczba klientów miałaby robić to samo. Niuans ma znaczenie — nie chodzi już o generowanie kodu na żądanie, lecz o pozostawienie agentom bieżącej obsługi aplikacji w produkcji: aktualizacji zależności, poprawek, dostosowań do zmian API. Użyty czasownik opisuje trwające wdrożenie, a nie stan faktyczny, i nie podano żadnych liczb, żadnej nazwanej aplikacji ani dokładnego zakresu.
🔗 Wątek @bcherny o coding i engineering
Cotygodniowy automatyczny komercyjny digest z Claude Code
24 sierpnia — Anthropic publikuje wpis o wewnętrznym zastosowaniu Claude Code poza tworzeniem oprogramowania: pracowniczka działu marketingu terenowego opowiada tam, jak zastąpiła piętnastominutowy poniedziałkowy stand-up spersonalizowanym cotygodniowym digestem, dostarczanym każdemu handlowcowi w wiadomości Slack.
Architektura jest prosta: Claude jest połączony z BigQuery przez MCP, a hurtownia danych pełni rolę źródła prawdy dla danych marketingowych. Sama metoda jest bardziej pouczająca niż technika: pilotaż rozpoczęto z jednym ochotniczym zespołem, a każda poprawka zgłoszona przez odbiorców została zamieniona w jednoznaczną regułę promptu: pod koniec pierwszego tygodnia zawierał on dziewięć reguł treści, z których każda była możliwa do powiązania z konkretną uwagą zwrotną. Ponieważ każda wiadomość jest tworzona na podstawie listy kont przypisanych do odbiorcy, żadne dwie wiadomości nie są identyczne; BDR (business development representatives) poprosili potem o własną wersję.
🔗 Spersonalizowany tygodniowy digest z Claude Code
GPT-5.6 trafia do Kiro, agenta deweloperskiego AWS
24 sierpnia — Pełna rodzina GPT-5.6 — Sol, Terra i Luna — jest dostępna w Kiro, agencie do tworzenia oprogramowania od AWS. Podkreślany argument nie dotyczy surowej mocy, lecz relacji ceny do wydajności: w Terminal-Bench 2.1, teście przeprowadzonym wspólnie przez OpenAI i AWS, GPT-5.6 Terra kończy zadania z sukcesem przy około 82% niższym koszcie.
Podawane wyjaśnienie wynika z metody Kiro, czyli developmentu kierowanego specyfikacją (spec-driven development): narzędzie przekształca intencję wysokiego poziomu w wymagania, projekt techniczny i wykonywalne zadania, co od początku zakotwicza model w konkretnym kontekście i ogranicza fałszywe tropy. OpenAI szczegółowo opisuje docelowe zastosowania: ustrukturyzowane plany implementacji, wieloetapowe zadania kodowe, kontekst repozytorium, punkty kontrolne przed zastosowaniem zmian. Dla osób śledzących ekosystem agentów kodu ogłoszenie potwierdza przede wszystkim, że gama GPT-5.6 rozprzestrzenia się poza powierzchnie OpenAI.
Codex zyskuje tryb deweloperski z dostępem do Chrome DevTools Protocol
24 sierpnia — Changelog ChatGPT i Codex otrzymuje serię nowości skupionych na przeglądarce sterowanej przez agenta. Najważniejszą z nich jest tryb deweloperski dla Browser use, zarówno w Chrome, jak i w zintegrowanej przeglądarce Codex: daje on kontrolowany dostęp do Chrome DevTools Protocol, interfejsu używanego przez narzędzia deweloperskie Chrome. Agent może więc profilować wydajność i debugować ruch sieciowy, wyjście konsoli oraz stan strony, zamiast ograniczać się do tego, co odczytuje na ekranie.
Ten sam protokół służy szybkości: Browser use staje się nawet dwa razy szybszy dzięki migawkom DOM, które ograniczają liczbę rund między agentem a przeglądarką. Zaplanowane automatyzacje respektują teraz wybrany tryb zatwierdzania, co usuwa uciążliwą rozbieżność w przypadku uruchomień bez nadzoru.
| Nowość w changelogu | Zapowiedziany zakres |
|---|---|
| Tryb deweloperski dla Browser use | Chrome i zintegrowana przeglądarka Codex, kontrolowany dostęp CDP |
| Przyspieszony Browser use | Nawet 2x szybciej (optymalizacje CDP i migawki DOM) |
Polecenie /init | Composer aplikacji, działanie identyczne jak CLI Codex |
| Computer Use | Firmy spoza EOG, Wielkiej Brytanii i Szwajcarii |
| Kontrole Computer Use w Windows | Konfigurowalne osobno dla każdej aplikacji |
Laureaci Gemma 4 Good Challenge
24 sierpnia — Google publikuje wyniki swojego Gemma 4 Good Challenge, konkursu Kaggle, który zapraszał deweloperów do rozwiązywania rzeczywistych problemów za pomocą jego otwartych modeli: ponad 1 600 projektów zgłoszonych w sześć tygodni. Trudność wynikała mniej z jakości modeli niż z ich wdrożenia w ograniczonym środowisku, a uczestnicy korzystali z LiteRT, Cactus, Ollama, llama.cpp i Unsloth, by uruchamiać je na zwykłym sprzęcie.
Wspólnym motywem nagrodzonych projektów jest działanie offline i prywatność z założenia. GEM-4 zdobywa pierwsze miejsce dzięki asystentowi robotycznemu dla osób starszych i z niepełnosprawnościami: Gemma 4 31B anotuje sekwencje wideo treningowych, a dostrojony kontroler E2B tłumaczy obserwacje i instrukcje na ruchy. Wśród nagród specjalnych Gem-Care dostraja Gemma 4 E2B do rekonstruowania mowy nienormatywnej i obniża wskaźnik błędów słów z 32,7% do 19,0%; PreVillage zapewnia trasowanie konwersacyjne w nepalskim romanizowanym na Raspberry Pi 5 z szybkością 7,5 tokena na sekundę.
🔗 Nagrodzone projekty Gemma 4 Good Challenge
ADK natywnie ocenia agentów głosowych
24 sierpnia — Agent Development Kit od Google obsługuje teraz ewaluację agentów live i głosowych w tym samym obiegu co agentów tekstowych. Zasada jest prosta: symulator użytkownika wypowiada swoje tury, które są syntetyzowane przez Gemini TTS, a następnie streamowane do agenta, którego odpowiedzi głosowe są oceniane automatycznie. Tryb live uruchamia się wyłącznie przez obecność bloku live_model_config ; bez niego te same przypadki testowe działają w trybie tekstowym.
Przypadki testowe występują w dwóch stylach: scenariusz, w którym persona improwizuje swoje wypowiedzi zgodnie z planem, oraz rozmowa stała, skryptowana słowo w słowo. Ocena odbywa się przez sędziów LLM sterowanych rubrykami w naturalnym języku, napisanymi raz i stosowanymi do całej serii. Uruchamianie odbywa się przez adk eval lub AgentEvaluator, co pozwala włączać ewaluacje głosowe do pipeline’u CI/CD. ADK Web dodaje przełącznik między trybem standardowym a live, rekonstruuje transkrypcję z przepływu audio i dołącza do każdej tury odtwarzalny klip audio.
🔗 Ewaluacja agentów głosowych w ADK
Grok Voice Think Fast 2.0 obejmuje prowadzenie w indeksie Speech-to-Speech
24 sierpnia — xAI ogłasza, że Grok Voice Think Fast 2.0 zajmuje pierwsze miejsce w indeksie Speech-to-Speech firmy Artificial Analysis, który mierzy nie tyle jakość odtwarzanego głosu, ile zdolność agenta głosowego do rozumowania nad tym, co słyszy, rozwiązania realnego problemu klienta i doprowadzenia zadania do końca z użyciem narzędzi.
Model nie jest nowością dnia: jego wpis prezentacyjny pochodzi z 29 lipca. To, co xAI komunikuje tutaj, to ranking i liczby produkcyjne. W Starlink, spółce z tej samej grupy, Grok Voice obsługuje ponad 15 000 przychodzących połączeń wsparcia i sprzedaży dziennie oraz finalizuje ponad 3 000 zamówień tygodniowo, łącznie głosem i czatem. Rodzina Think Fast wykonuje rozumowanie równolegle z syntezą mowy, co pozwala nie płacić za inteligencję opóźnieniem.
| Benchmark | Think Fast 2.0 | GPT-Realtime-2.1 (High) | Gemini 3.1 Flash (High) |
|---|---|---|---|
| AA Speech-to-Speech Quality Index | 82,9 % | 79,1 % | 69,5 % |
| τ-voice Bench (wydajność agenta) | 56,5 % | 45,7 % | 37,7 % |
| Czas do pierwszego dźwięku | 0,70 s | — | 2,98 s |
🔗 Ogłoszenie @SpaceXAI · Wpis x.ai
ElevenLabs przenosi całe swoje API do terminala
24 sierpnia — ElevenLabs publikuje wersję 1 swojego CLI, które udostępnia całe API w terminalu. Ogłoszenie kierowane jest do dwóch grup po równo: deweloperów i agentów kodu.
Ten podwójny cel widać w wyborach technicznych. Polecenia są udokumentowane tak, by można je było łatwo odkrywać, agent skills są wbudowane bezpośrednio w narzędzie, a wynik jest dostępny w ustrukturyzowanym JSON — to trzy warunki, by agent mógł sterować narzędziem niezawodnie zamiast interpretować swobodny tekst. Tryb dry run dopełnia całości: pozwala podejrzeć rezultat operacji przed jej wykonaniem, co jest użyteczną osłoną, gdy wywołanie uruchamia autonomiczny agent. Wydanie wpisuje się w ciągłość oficjalnego serwera MCP uruchomionego przez wydawcę 17 sierpnia.
MiniMax otwiera 14 dni nieograniczonego dostępu na GMI Cloud
24 sierpnia — Od 24 sierpnia do 6 września MiniMax otwiera nieograniczony dostęp do swoich modeli na GMI Cloud: M3 i M2.7 po stronie językowej, Speech 2.8 i Music 3.0 po stronie audio.
Najciekawszy element wykracza poza samą akcję handlową. 21 sierpnia MiniMax ograniczał się do enigmatycznego ogłoszenia sugerującego nadejście modelu M3, bez specyfikacji i bez daty. Trzy dni później M3 jest już jawnie dostępny w ofercie opatrzonej datą, obok dwóch modeli audio, których numery wersji nie pojawiały się wcześniej w komunikatach dostawcy. Ogłoszeniu nie towarzyszą żadne benchmarki ani specyfikacje techniczne: to udostępnienie, a nie karta produktu.
🔗 14 dni nieograniczonego dostępu na GMI Cloud
Krótkie wiadomości
- Nemotron 3.5 Lightning wchodzi do top 4 PinchBench — Model NVIDIA plasuje się w pierwszej czwórce modeli o otwartych wagach z 86,4% średnią skutecznością w standaryzowanych testach agentów OpenClaw; Nemotron 3 Ultra nadal utrzymuje pierwsze miejsce. 🔗 Tweet @NVIDIAAI
- Wan 3.0 jest już dostępny przez Pika API Club — Agregator uruchomiony 5 sierpnia daje dostęp do ponad stu modeli przez jedno API. Dodanie modelu w dniu premiery rozwija logikę już obserwowaną przy Seedance 2.5 z 17 sierpnia. 🔗 Tweet @pika_labs
- Runway rozszerza Ruby na wszystkie modele swojej platformy — Wyjścia z Seedance 2.5, Gen-4.5 czy MiniMax H3 są teraz konwertowane do EXR 16-bit albo do ProRes i HEVC 10- oraz 12-bit, bez osobnego łańcucha kalibracji dla każdego generatora. 🔗 Tweet @runwayml
- Runway otwiera stacjonarny hackathon w San Francisco — 30 września, z naciskiem na budowę agentów i aplikacji; zgłoszenia przez hackathon.runway.com. 🔗 Tweet @runwayml
- Zdaniem Borisa Cherny’ego prompt injection okazał się problemem rozwiązywalnym — Kontynuuje on temat generowania kodu bez błędów i przywołuje precedens: połączenie treningu pod kątem alignmentu i mechanistycznej interpretowalności ostatecznie poradziło sobie z tym problemem po wielu latach. 🔗 Wątek @bcherny
- Webinar GitHub 25 sierpnia wokół aplikacji Copilot — Demonstracja na żywo od 18:00 do 19:00 CEST z Piercem Bogganem i Jamesem Clanceyem; strona rejestracji opisuje Agent Merge, który obsługuje rebase, code review i checki aż do merge. 🔗 Tweet @github
- GitHub promuje sezon 2 swojego podcastu — Wideo prezentujące prowadzących i ich ulubione odcinki z poprzedniego sezonu, bez ogłoszenia produktu. 🔗 Tweet @github
- Grok 4.6 za pół ceny w portalu Nous Research — Rabat 50% przez tydzień, możliwy do wykorzystania z open source’owym agentem Hermes albo przez istniejącą subskrypcję SuperGrok lub X Premium+. 🔗 Tweet @SpaceXAI
- Codex Live Build podkreśla sterowanie głosem — Sesja na żywo na X z twórcą Alexem Finnem, poświęcona pracy bez klawiatury w Codex na komputerze i urządzeniach mobilnych. Demonstracja, bez ogłoszenia funkcji. 🔗 Tweet @OpenAIDevs
- HeyGen publikuje przewodnik po promptach do filmów o nieruchomościach — Pisanie promptów przeznaczonych do filmów z awatarami o jakości kinowej, w kontynuacji swojej serii o nieruchomościach. 🔗 Tweet @HeyGen
- 110. rocznica parków narodowych USA z Maps, Search i Gemini — Google zestawia swoje trendy wyszukiwania (zapytania o wędrówki dla początkujących rosną o 165% w skali miesiąca) i użycie AI Mode, Ask Maps oraz Gemini Live w przygotowaniach do podróży. Bez nowych funkcji. 🔗 Wpis blog.google
Co to oznacza
Po kilku dniach skupionych na zastosowaniach programowych sprzęt wraca na pierwszy plan — i to, co mierzy, uległo zmianie. NVIDIA wyraźnie odchodzi od miar inferencji kalibrowanych na sekwencjach od 1 000 do 8 000 tokenów, preferując prawdziwe, zarejestrowane sesje kodowania agentowego, z rosnącym kontekstem, wywołaniami narzędzi i podagentami włącznie. Jednostka rozliczeniowa podąża za tym samym przesunięciem: nie chodzi już o surową przepustowość, lecz o pracę na megawat, oraz koszt na milion tokenów. Ograniczeniem nie jest już dostępny krzem, tylko energia, którą można mu dostarczyć. Podział GPU/LPU mówi to samo z innej perspektywy: z jednej strony przetwarzanie kontekstu, z drugiej dekodowanie wrażliwe na opóźnienia, ponieważ inferencja agentowa przestała być jednorodnym obciążeniem.
Drugim sygnałem dnia jest otwarcie platformy. NVLink Fusion łączy układy zaprojektowane przez innych, SpaceXAI korzysta z CPU Vera, a Intel, MediaTek i Annapurna Labs znajdują się na liście partnerów. Argument handlowy dotyczy harmonogramu: fabrykę AI planuje się — energia, budynek, chłodzenie, sieć — na długo przed ustaleniem miksu akceleratorów, a sprzedaż szafy rack, sieci i narzędzi zamiast wyłącznie akceleratora oznacza stanie się niezbędnym nawet dla tych, którzy tworzą własny krzem.
Jeszcze bardziej zaskakujące jest to, że tego samego dnia suwerenność pojawia się w dwóch ogłoszeniach. Mistral ogłasza współpracę z HUMAIN przy modelach arabojęzycznych i wykorzystaniu saudyjskich centrów danych; Sakana AI podpisuje umowę z japońskim Ministerstwem Obrony na analizę informacji wywiadowczych. Dwa laboratoria spoza USA, dwie instytucje narodowe, ta sama logika: to, co Mistral nazywa kontrolą, a japoński rząd nazywa siłą informacyjną, oznacza zdolność do wykonywania treningu i inferencji w wybranej jurysdykcji. W przypadku Sakana, którego publiczna tożsamość opiera się na otwartych pracach, sekcja poświęcona obronności i powiązane rekrutacje wskazują na trwały kierunek działalności, a nie pojedynczy kontrakt.
Pozostaje jeszcze dyskretna, ale spójna nić: narzędzia są budowane tak, by sterował nimi agent, a nie tylko człowiek. ElevenLabs wypuszcza CLI, którego argumenty sprzedażowe — możliwe do odkrycia komendy, uporządkowany JSON, tryb dry run — są wprost skierowane do agentów kodu. Codex zyskuje dostęp do Chrome DevTools Protocol, czyli możliwość odczytu rzeczywistego stanu strony zamiast jej renderingu. ADK dodaje natywną ocenę głosową, aby mówiące agenty przestały być oceniane „na wyczucie”. A Grok Voice publikuje wolumeny produkcyjne — 15 000 wywołań dziennie w Starlink — zamiast ograniczać się do wyniku w rankingu. Za każdym razem ten sam zwrot: wyjście z prototypu wymaga interfejsów, które da się obsługiwać maszynowo, i pomiarów, które da się odtworzyć.
Źródła
- Wan 3.0 — oficjalna strona
- NVIDIA — Vera Rubin NVL72 i obciążenia agentowe
- NVIDIA — Groq 3 LPX, Spectrum-X i NVLink Fusion
- NVIDIA — NVLink Fusion i XPU
- NVIDIA — Nemotron 3.5 Lightning na PinchBench
- Mistral i HUMAIN — oficjalne ogłoszenie
- Mistral — ogłoszenie współpracy z HUMAIN na X
- Mistral — kontrola jako kwestia decydująca
- Sakana AI — zintegrowana analiza dla obronności
- Sakana AI — ogłoszenie na X
- Anthropic — enterprise-managed auth dla konektorów MCP
- Anthropic — ogłoszenie enterprise-managed auth na X
- Boris Cherny — odmowa w cyberbezpieczeństwie
- Boris Cherny — kodowanie, inżynieria i automatyczna konserwacja
- Boris Cherny — wstrzyknięcie promptu jako problem możliwy do rozwiązania
- Anthropic — spersonalizowany cotygodniowy digest z Claude Code
- OpenAI — GPT-5.6 w Kiro
- OpenAI — changelog ChatGPT i Codex
- OpenAI — Codex Live Build z Alexem Finnem
- Google — nagrodzone projekty Gemma 4 Good Challenge
- Google — ocena agentów głosowych w ADK
- Google — 110 lat parków narodowych USA
- xAI — Grok Voice Think Fast 2.0
- xAI — ranking Speech-to-Speech na X
- xAI — Grok 4.6 w portalu Nous Research
- ElevenLabs — CLI v1
- MiniMax — 14 dni nieograniczonego dostępu w GMI Cloud
- Runway — Ruby rozszerzony na wszystkie modele
- Runway — hackathon w San Francisco
- Pika — Wan 3.0 w API Club
- HeyGen — przewodnik po promptach do filmów nieruchomościowych
- GitHub — webinar o aplikacji Copilot
- GitHub — sezon 2 podcastu