ai-powered-markdown-translatorPrzetłumaczony artykuł z fr na pl za pomocą gpt-5.4-mini.
23 sierpnia dzień mówi mniej o nowych możliwościach, a bardziej o realnym użyciu. Boris Cherny, twórca Claude Code, wyjaśnia, że od listopada 2025 nie pisze już kodu ręcznie i przedstawia Claude’a na trzech poziomach możliwości; przy okazji uznaje rozwlekłość Opusa za priorytet do naprawy dla Anthropic. W Google Gemini 3.7 Flash, wydany 13 sierpnia, staje się najszybciej zaadaptowanym modelem Gemini i trafia do Google Search, podczas gdy otwarta rodzina Gemma przekracza miliard pobrań. Amp nadaje czytelne nazwy domenowe aplikacjom hostowanym na swoich orbach, a otwarty benchmark do przewidywania właściwości leków publikuje swój poziom szumu obok każdego wyniku.
Boris Cherny przedstawia Claude na trzech poziomach i nie koduje już ręcznie od listopada 2025
23 sierpnia — Twórca Claude Code rozkłada postęp modeli na trzy poziomy: kodować lepiej niż on; wykonywać lepiej niż on pracę inżynierską wokół kodu, od debugowania po projektowanie systemów; a następnie przewyższać większość ludzi w większości zadań możliwych do wykonania na komputerze. Umieszcza Claude’a na pierwszym poziomie i części drugiego, a Opus 4.8 wskazuje jako pierwszy model, który wydał mu się lepszy od niego. Dodał też zastrzeżenie: według Andersa Hejlsberga, twórcy TypeScript, pierwszy poziom być może wcale nie został jeszcze osiągnięty.
Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.
🇵🇱 W listopadzie 2025 całkowicie przestałem ręcznie pisać kod, choć nadal codziennie koduję (z agentami). […] Ale inżynieria to coś więcej niż samo kodowanie. — @bcherny na X
Anthropic uznaje rozwlekłość Opusa za priorytet i dostarcza środek zaradczy
23 sierpnia — Zapytany o wady Opusa, Boris Cherny udziela bezpośredniej publicznej odpowiedzi: rozwlekłość jest zidentyfikowanym problemem i priorytetem dla zespołu. Na razie komenda claude /config outputStyle=concise aktywuje styl Concise ogłoszony 20 sierpnia. To jest właściwa informacja: Concise nie jest opcją dla wygody, ale tymczasową odpowiedzią na zachowanie, które zespół stara się naprawić u źródła.
Ta sama wymiana zawiera wskazówkę dotyczącą użycia sformułowaną dzień wcześniej, 22 sierpnia: Opus ma być zbyt rzadko wykorzystywany do iteracyjnej optymalizacji — zużycia CPU i pamięci, czasu CI, opóźnień, liczby klatek na sekundę — według powtarzalnego wzorca, iterować na X z profilerem i zestawem danych aż do osiągnięcia Y.
We know Opus is not perfect, and it is a big priority for the team to fix it.
🇵🇱 Wiemy, że Opus nie jest idealny, a naprawienie tego to duży priorytet dla zespołu. — @bcherny na X
🔗 Opus i iteracyjna optymalizacja
Gemini 3.7 Flash trafia do Google Search po rekordowej adopcji
22 sierpnia — Sundar Pichai nie ogłasza nowego modelu: Gemini 3.7 Flash został wydany 13 sierpnia. Ogłasza adopcję, najszybszą w rodzinie Gemini, oraz wdrożenie: model działa teraz w Google Search, oprócz aplikacji Gemini. Przy starcie był dostępny tylko dla subskrybentów Pro i Ultra przez Spark, w Gemini Enterprise Agent Platform oraz przez API — jego wejście do Search zmienia skalę ekspozycji.
| Oceniany benchmark | Uzyskany wynik | Koszt na zadanie (USD) |
|---|---|---|
| ARC-AGI-1 | 95,5 % | 0,12 |
| ARC-AGI-2 | 84,6 % | 0,25 |
Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.
🇵🇱 Gemini 3.7 Flash pobił wcześniejsze rekordy wzrostu Gemini już w pierwszym tygodniu, co czyni go naszym najszybciej rosnącym modelem do tej pory. — @sundarpichai na X
🔗 Wyniki ARC-AGI opublikowane 20 sierpnia przez ARC Prize
Gemma przekracza miliard pobrań, a Google publikuje repozytorium Awesome Gemma
20 sierpnia — Clement Farabet i Olivier Lacombe z Google DeepMind ogłaszają, że rodzina otwartych modeli Gemma przekroczyła łącznie miliard pobrań, a społeczność opublikowała ponad 100 000 wariantów w ciągu dwóch lat. Wymienione wdrożenia pokazują skalę tego zasięgu: NASA, Satlyt i Starcloud uruchamiają Gemmę na pokładzie satelitów do wbudowanej analizy obrazów; w Indiach National Health Authority zintegrował Gemmę 4 w Aarogya Setu 2.0, aby normalizować raporty medyczne. Po stronie badań C2S-Scale, zbudowany na Gemmie przez Yale i Google, zidentyfikował ścieżkę terapeutyczną przeciwnowotworową, później zweryfikowaną na żywych komórkach. Google uzupełnia ten kamień milowy o materiał dla deweloperów: repozytorium GitHub Awesome Gemma, oficjalny katalog projektów i samouczków tego ekosystemu.
| Mierzony wskaźnik | Ogłoszona wartość |
|---|---|
| Łączna liczba pobrań Gemma | ponad 1 miliard |
| Warianty opublikowane przez społeczność | ponad 100 000 |
| Projekty zgłoszone do Gemma Challenge | ponad 1 600 |
Amp nadaje czytelne nazwy domenowe portalom swoich orbów
23 sierpnia — Orb to zdalna, jednorazowa maszyna, na której Amp uruchamia agenta; portal to HTTP-owe wejście, które pozwala otworzyć w przeglądarce aplikację aktualnie budowaną na tym orbie. Każdy portal otrzymywał nieczytelny, automatycznie generowany adres, w rodzaju t-01a0095e-9568-whatever-p1234.onamp.dev — wystarczający do szybkiego podglądu, dużo mniej do linku przekazywanego zespołowi. Zastępują go trzy opcje: niestandardowy prefiks, domena osobista albo domena przestrzeni roboczej (workspace). Amp podaje przykład park.mixfox.org, zwykłego adresu służącego aplikacji hostowanej na orbie. Konfigurację można wykonać z poziomu zakładki Portal albo prosząc o to agenta. Podawany motyw jest równie ważny jak funkcjonalność: portale coraz mniej służą do jednorazowych podglądów, a coraz bardziej do trwałych aplikacji. Jedno ograniczenie pozostaje, co potwierdza Quinn Slack: udostępnianie nie wykracza poza granice przestrzeni roboczej.
LEADBOARD publikuje poziom szumu swoich benchmarków przewidywania leków
22 sierpnia — Kolektyw FINAL-Bench opublikował na Hugging Face otwarty benchmark przewidywania właściwości leków: 21 tabel, 7 dziedzin, 212 670 związków treningowych i 18 382 testowych. Artykuł jest mniej premierą, a bardziej demonstracją metodologiczną. W tabeli hERG zamiana podziału czasowego na losowy podnosi AUROC z 0,606 do 0,818, przy tych samych molekułach, fingerprintach, algorytmie i hiperparametrach: losowanie rozdziela tę samą serię chemiczną po obu stronach zbioru testowego. Drugi wniosek dotyczy jakości etykiet: poziom szumu hERG wynosi 0,421, a w 19 tabelach regresyjnych proste przewidywanie średniej daje najlepszy błąd bezwzględny w siedmiu z nich.
| Podział danych hERG | Uzyskany AUROC | MAE modelu | MAE stałej |
|---|---|---|---|
| Czasowy, cięcie w 2022 roku | 0,606 | 0,599 | 0,589 |
| Losowy, średnia z 5 seedów | 0,818 | 0,457 | 0,671 |
🔗 Artykuł FINAL-Bench na Hugging Face
Krótkie informacje
- Dlaczego logowanie sesji z telefonu trwało tak długo — Dzień po wczorajszej zapowiedzi Boris Cherny wyjaśnia 22 sierpnia, że domyślne zabezpieczenia ustaliły harmonogram: zaufanie i weryfikacja urządzenia, ochrona przed prompt injection. Kolejne aktualizacje pojawią się później. 🔗 Wątek @bcherny
- GitHub ponownie promuje cooldown Dependabota — Aktualizacje wersji niezwiązane z bezpieczeństwem czekają trzy dni, aby skanery mogły wykryć zatrutą wersję; poprawki bezpieczeństwa pozostają natychmiastowe. Opóźnienie regulowane przez
cooldown. Wpis z 23 lipca ponownie promowany 23 sierpnia. 🔗 Tweet @github - Stable Audio 3.0 na Music Technology Hackathon w Montrealu — 48-godzinny hackathon 22 i 23 sierpnia z Music Hackspace i MUTEK, wokół narzędzi dla producentów muzyki. Stability AI broni tam otwartych wag: przejrzystości, kontroli artystycznej, prawa głosu w kwestii użycia technologii. 🔗 Wideo zamykające
- DOOM działa na procesorze zaprojektowanym przez GPT-5.6 Sol — Model złożył w grze Turing Complete procesor RV32IM nazwany Codex-R32, na którym uruchamia się port PureDOOM skompilowany do natywnego kodu maszynowego. Demonstracja udostępniona 23 sierpnia przez @OpenAIDevs. 🔗 Wątek @Angaisb_
Co to oznacza
Żaden model nie został wydany w ten weekend, i właśnie dlatego ten dzień jest czytelny. To, co się zmienia, to wdrażanie istniejących modeli, liczba rąk, które z nich korzystają, oraz naprawianie tego, co przeszkadza w użyciu. Gracze pracują nad adopcją, nie nad samym ogłoszeniem.
W obszarze narzędzi deweloperskich świadectwo Borisa Cherny’ego jest ważne przede wszystkim przez granicę, którą stawia w tym samym zdaniu: kodowanie wydaje mu się rozwiązane dla części praktyków, inżynieria — nie, i starannie cytuje eksperta, dla którego pierwszy poziom nie został nawet osiągnięty. Uznanie rozwlekłości Opusa idzie w tym samym kierunku: domyślne zachowanie modelu staje się osobnym tematem produktowym. Konfiguracyjny środek zaradczy, taki jak outputStyle=concise, przerzuca ciężar na użytkownika, co Anthropic otwarcie akceptuje, nazywając go tymczasową poprawką.
Wdrożenie na skalę przybiera w ten weekend trzy różne formy. Gemini 3.7 Flash wychodzi poza obszar subskrybentów i deweloperów, by trafić do Search, co ekonomicznie uzasadnia koszt 0,25 USD na zadanie w ARC-AGI-2 przy wyniku 84,6 %. Gemma z kolei mierzy swoją adopcję pobraniami i wariantami społeczności, z wdrożeniami na orbicie i w zdrowiu publicznym, które nie przypominają żadnego demonstracyjnego przypadku użycia. Amp wreszcie wyciąga wnioski z użycia, którego nie przewidział: kiedy jednorazowe podglądy stają się trwałymi aplikacjami, trzeba nadać im stały adres.
Pozostaje kwestia pomiaru, a LEADBOARD trafia w odpowiedni moment. Różnica 0,21 punktu AUROC uzyskana bez zmiany ani jednej linii modelu, stała predykcja bijąca modele w siedmiu z dziewiętnastu tabel regresyjnych: wynik opublikowany bez podziału danych, poziomu szumu i trywialnych punktów odniesienia nie jest interpretowalny. To właśnie nadaje wagę liczbom ARC-AGI, na które tego samego weekendu zwrócił uwagę Google — pomiarom zewnętrznym, w trybie weryfikowanym, a nie wynikom własnym.
Źródła
- Boris Cherny — trzy poziomy możliwości
- Boris Cherny — rozwlekłość Opusa i styl Concise
- Boris Cherny — Opus i iteracyjna optymalizacja
- Boris Cherny — bezpieczeństwo zdalnego uruchamiania sesji
- Sundar Pichai — Gemini 3.7 Flash w Search
- Logan Kilpatrick — wzrost Gemini 3.7 Flash
- ARC Prize — wyniki ARC-AGI dla Gemini 3.7 Flash
- Google DeepMind — Gemma przekracza miliard pobrań
- Amp — nazwy domen dla portalów orbów
- Quinn Slack — udostępnianie pozostaje ograniczone do workspace
- FINAL-Bench — LEADBOARD na Hugging Face
- LEADBOARD — Space Hugging Face
- GitHub — cooldown Dependabota
- GitHub Blog — the case for a cooldown
- Stability AI — hackathon w Montrealu
- DOOM na procesorze Codex-R32