ai-powered-markdown-translatorArtikel vertaald van fr naar nl met gpt-5.4-mini.
Op 23 augustus draait de dag minder om nieuwe mogelijkheden dan om echt gebruik. Boris Cherny, de maker van Claude Code, legt uit dat hij sinds november 2025 geen code meer met de hand schrijft en plaatst Claude op drie capaciteitsniveaus; tegelijk erkent hij de spraakzaamheid van Opus als een prioriteit voor Anthropic om te verhelpen. Bij Google wordt Gemini 3.7 Flash, uitgebracht op 13 augustus, het snelst geadopteerde Gemini-model en verschijnt het in Google Search, terwijl de open familie Gemma de grens van een miljard downloads overschrijdt. Amp geeft leesbare domeinnamen aan toepassingen die op zijn orbs worden gehost, en een open benchmark voor het voorspellen van medicijnkenmerken publiceert zijn ruisvloer naast elke score.
Boris Cherny plaatst Claude op drie niveaus en codeert sinds november 2025 niet meer met de hand
23 augustus — De maker van Claude Code splitst de voortgang van modellen op in drie niveaus: beter coderen dan hijzelf; beter dan hijzelf zijn in het engineeringwerk rond code, van debuggen tot systeemontwerp; en vervolgens de meeste mensen overtreffen op de meeste taken die op een computer kunnen worden uitgevoerd. Hij plaatst Claude op het eerste niveau en deels op het tweede, en noemt Opus 4.8 het eerste model dat hem beter leek dan hijzelf. Een nuance die hij toevoegt: voor Anders Hejlsberg, ontwerper van TypeScript, is het eerste niveau misschien nog niet bereikt.
Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.
🇳🇱 In november 2025 ben ik volledig gestopt met code met de hand te schrijven, terwijl ik wel elke dag bleef coderen (met agents). […] Maar engineering is meer dan alleen coderen. — @bcherny op X
Anthropic erkent de spraakzaamheid van Opus als prioriteit en levert een noodoplossing
23 augustus — Gevraagd naar de tekortkomingen van Opus geeft Boris Cherny een directe publieke erkenning: spraakzaamheid is een vastgesteld probleem en een prioriteit voor het team. Ondertussen activeert commando claude /config outputStyle=concise de op 20 augustus aangekondigde stijl Concise. Dat is het echte nieuws: Concise is geen comfortoptie, maar het tijdelijke antwoord op een gedrag dat het team probeert te corrigeren aan de bron.
In hetzelfde gesprek zit een gebruikstips van de dag ervoor, 22 augustus: Opus zou te weinig worden gebruikt voor iteratieve optimalisatie — CPU- en geheugengebruik, CI-tijd, latentie, beeldsnelheid — volgens een reproduceerbaar patroon, itereren op X met een profiler en een dataset totdat Y is bereikt.
We know Opus is not perfect, and it is a big priority for the team to fix it.
🇳🇱 We weten dat Opus niet perfect is, en het oplossen daarvan is een grote prioriteit voor het team. — @bcherny op X
🔗 Opus en iteratieve optimalisatie
Gemini 3.7 Flash komt in Google Search na een recordadoptie
22 augustus — Sundar Pichai kondigt geen model aan: Gemini 3.7 Flash verscheen op 13 augustus. Hij kondigt adoptie aan, de snelste van de Gemini-familie, en een uitrol: het model draait nu in Google Search, naast de Gemini-app. Bij de lancering was het alleen toegankelijk voor Pro- en Ultra-abonnees via Spark, via het Gemini Enterprise Agent Platform en via de API — de komst in Search verandert de schaal van de blootstelling.
| Beoordeelde benchmark | Behaalde score | Kost per taak (USD) |
|---|---|---|
| ARC-AGI-1 | 95,5 % | 0,12 |
| ARC-AGI-2 | 84,6 % | 0,25 |
Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.
🇳🇱 Gemini 3.7 Flash verbrak al in zijn eerste week alle eerdere groeirecords van Gemini, waardoor het ons tot nu toe snelst groeiende model is. — @sundarpichai op X
🔗 ARC-AGI-scores gepubliceerd op 20 augustus door ARC Prize
Gemma passeert een miljard downloads en Google publiceert de repository Awesome Gemma
20 augustus — Clement Farabet en Olivier Lacombe, van Google DeepMind, kondigen aan dat de open modelfamilie Gemma de grens van een miljard cumulatieve downloads heeft overschreden, met meer dan 100.000 varianten die door de community in twee jaar zijn gepubliceerd. De genoemde uitrol laat de omvang zien: NASA, Satlyt en Starcloud draaien Gemma aan boord van satellieten voor ingebouwde beeldanalyse; in India heeft de National Health Authority Gemma 4 geïntegreerd in Aarogya Setu 2.0 om medische verslagen te normaliseren. Aan de onderzoekszijde heeft C2S-Scale, gebouwd op Gemma door Yale en Google, een kankerbestrijdende therapeutische route geïdentificeerd die vervolgens is bevestigd op levende cellen. Google koppelt de mijlpaal aan een leverbaar product voor ontwikkelaars: de GitHub-repository Awesome Gemma, een officiële gids met projecten en tutorials van dit ecosysteem.
| Gemeten indicator | Aangegeven waarde |
|---|---|
| Cumulatieve downloads van Gemma | meer dan 1 miljard |
| Variants gepubliceerd door de community | meer dan 100.000 |
| Projecten ingediend voor de Gemma Challenge | meer dan 1.600 |
Amp geeft leesbare domeinnamen aan de portals van zijn orbs
23 augustus — Een orb is de verre, wegwerpbare machine waarop Amp een agent uitvoert; een portal is de HTTP-ingang waarmee je in een browser de applicatie kunt openen die in die orb wordt gebouwd. Elke portal kreeg een onleesbaar automatisch gegenereerd adres, zoals t-01a0095e-9568-whatever-p1234.onamp.dev — handig voor een snelle blik, veel minder voor een link die je naar een team doorstuurt. Drie opties vervangen die: een aangepast voorvoegsel, een persoonlijk domein of een workspace-domein. Amp geeft het voorbeeld van park.mixfox.org, een gewoon adres dat een toepassing host die op een orb draait. De configuratie gebeurt via het tabblad Portal of door het aan de agent te vragen. De gepresenteerde motivatie telt net zo zwaar als de functionaliteit: portals dienen steeds minder als vluchtige preview en steeds meer als duurzame toepassingen. Eén beperking blijft bestaan, bevestigd door Quinn Slack: delen gaat niet over de grenzen van de workspace heen.
LEADBOARD publiceert de ruisvloer van zijn benchmarks voor medicijnvoorspelling
22 augustus — Het collectief FINAL-Bench heeft op Hugging Face een open benchmark voor het voorspellen van medicijnkenmerken online gezet: 21 tabellen, 7 disciplines, 212.670 trainingsverbindingen en 18.382 testverbindingen. Het artikel is minder een lancering dan een methodologische demonstratie. Op de hERG-tabel zorgt het vervangen van een temporele splitsing door een willekeurige splitsing ervoor dat de AUROC stijgt van 0,606 naar 0,818, met identieke moleculen, vingerafdrukken, algoritme en hyperparameters: de willekeurige trekking verdeelt dezelfde chemische reeks over en weer van de testset. Een tweede bevinding, over de kwaliteit van de labels: de ruisvloer van hERG komt uit op 0,421, en op de 19 regressietabellen behaalt gewoon het gemiddelde voorspellen de beste absolute fout op zeven daarvan.
| hERG-gegevenssplitsing | Behaalde AUROC | MAE van het model | MAE van de constante |
|---|---|---|---|
| Temporeel, afkapping in 2022 | 0,606 | 0,599 | 0,589 |
| Willekeurig, gemiddelde van 5 seeds | 0,818 | 0,457 | 0,671 |
🔗 FINAL-Bench-artikel op Hugging Face
Kort nieuws
- Waarom sessieaanmelding vanaf de telefoon zo lang heeft geduurd — De dag na de gisteren besproken aankondiging legt Boris Cherny op 22 augustus uit dat standaardbeveiliging de planning heeft bepaald: vertrouwen en apparaatverificatie, bescherming tegen prompt-injectie. Andere updates volgen nog. 🔗 Thread @bcherny
- GitHub brengt de cooldown van Dependabot opnieuw onder de aandacht — Versie-upgrades zonder veiligheidsissue wachten drie dagen, zodat scanners een vergiftigde versie kunnen herkennen; beveiligingspatches blijven direct. De vertraging is instelbaar via
cooldown. Bericht van 23 juli opnieuw onder de aandacht op 23 augustus. 🔗 Tweet @github - Stable Audio 3.0 op de Music Technology Hackathon in Montréal — 48-uurs hackathon op 22 en 23 augustus met Music Hackspace en MUTEK, rond tools voor muziekproducenten. Stability AI verdedigt daar de open weights: transparantie, artistieke controle, en inspraak over het gebruik van de technologie. 🔗 Slotsvideo
- DOOM draait op een processor ontworpen door GPT-5.6 Sol — Het model heeft in het spel Turing Complete een RV32IM-processor in elkaar gezet, Codex-R32 genaamd, waarop de PureDOOM-port draait, gecompileerd naar native machinecode. Demonstratie op 23 augustus gedeeld door @OpenAIDevs. 🔗 Thread @Angaisb_
Wat dit betekent
Er is dit weekend geen enkel model uitgebracht, en juist dat maakt de dag leesbaar. Wat beweegt, is de uitrol van bestaande modellen, het aantal handen dat ze gebruikt, en het corrigeren van wat in de praktijk stoort. De spelers werken aan adoptie, niet aan aankondiging.
Voor de ontwikkeltooling is het getuigenis van Boris Cherny vooral waardevol door de grens die hij in dezelfde zin trekt: coderen lijkt voor een deel van de gebruikers opgelost, engineering niet, en hij neemt de moeite een expert te citeren voor wie het eerste niveau nog niet eens is bereikt. De erkenning over de spraakzaamheid van Opus gaat dezelfde kant op: het standaardgedrag van een model wordt een volwaardig productonderwerp. Een configuratienoodoplossing zoals outputStyle=concise schuift de last door naar de gebruiker, en Anthropic benoemt dat expliciet als een tijdelijke correctie.
De uitrol op schaal krijgt dit weekend drie verschillende vormen. Gemini 3.7 Flash verlaat het domein van abonnees en ontwikkelaars om Search binnen te gaan, wat economisch haalbaar wordt gemaakt door een kost van 0,25 USD per taak op ARC-AGI-2 voor een score van 84,6 %. Gemma meet zijn adoptie op zijn beurt in downloads en communityvarianten, met uitrol in de ruimte en in de volksgezondheid die nergens op lijken als demonstratiegebruik. Amp trekt ten slotte de consequentie van een gebruik dat het niet had voorzien: wanneer wegwerp-previews duurzame toepassingen worden, moeten ze een stabiel adres krijgen.
Blijft de vraag naar meting, en LEADBOARD komt precies op het juiste moment. Een verschil van 0,21 AUROC-punt verkregen zonder één regel in het model te veranderen, een constante voorspelling die de modellen verslaat op zeven van de negentien regressietabellen: een score die wordt gepubliceerd zonder zijn splitsing, zijn ruisvloer en zijn triviale referenties is niet interpreteerbaar. Dat is precies wat de door Google hetzelfde weekend benadrukte ARC-AGI-cijfers gewicht geeft — metingen van derden, in geverifieerde modus, en geen huis-tuin-en-keukenresultaten.
Bronnen
- Boris Cherny — drie capaciteitsniveaus
- Boris Cherny — spraakzaamheid van Opus en stijl Concise
- Boris Cherny — Opus en iteratieve optimalisatie
- Boris Cherny — beveiliging van aanmelden op afstand
- Sundar Pichai — Gemini 3.7 Flash in Search
- Logan Kilpatrick — groei van Gemini 3.7 Flash
- ARC Prize — ARC-AGI-resultaten van Gemini 3.7 Flash
- Google DeepMind — Gemma passeert een miljard downloads
- Amp — domeinnamen voor orb-portals
- Quinn Slack — delen blijft beperkt tot de workspace
- FINAL-Bench — LEADBOARD op Hugging Face
- LEADBOARD — Hugging Face Space
- GitHub — de cooldown van Dependabot
- GitHub Blog — the case for a cooldown
- Stability AI — hackathon in Montréal
- DOOM op de Codex-R32-processor