Zoeken

Anthropic stelt Claude Code open voor mods, GitHub Copilot bestuurt desktopapplicaties, Black Forest Labs lanceert FLUX 3 Image

ai-powered-markdown-translator

Artikel vertaald van het Frans naar het Nederlands met gpt-6.1-sol.

Bekijk project op GitHub ↗

Donderdag 1 oktober lanceert Anthropic mods: kleine TypeScript-functies die inhaken op events van Claude Code om het gedrag en de interface ervan te herschrijven, geleverd met versie 2.1.287. GitHub stelt dezelfde dag twee agentmogelijkheden beschikbaar als publieke preview in Copilot CLI en de GitHub Copilot-app: het besturen van desktopapplicaties en dynamische workflows, in code geschreven orchestrations. Black Forest Labs lanceert FLUX 3 Image, dat composities maakt met begrenzingsvakken en tot 4K genereert; Google rolt Guided Vision uit in Gemini Live, Barclays breidt het gebruik van Claude uit naar de hele bank en GitHub scherpt het melden van kwetsbaarheden aan vanwege door AI gegenereerde rapporten.


Claude Code stelt zich open voor mods, TypeScript-functies die het gedrag en de interface ervan herschrijven

1 oktober — Anthropic lanceert mods, kleine TypeScript-functies die veranderen hoe Claude Code werkt. Elke actie van de tool genereert een event (toolaanroep, toestemmingsverzoek, ingediende prompt, begin en einde van een beurt, tekenen van een deel van het scherm), en een mod haakt daarop in: vooraf, achteraf, als vervanging of als wrapper. Een mod kan een prompt herschrijven voordat die het model bereikt, een toolaanroep blokkeren, herschrijven of opnieuw uitvoeren, toestemming goedkeuren of weigeren, geheimen verbergen in de uitvoer van een tool voordat Claude die leest, of eigen panelen, knoppen en invoervelden toevoegen. Mods worden geleverd in plugins, worden geïnstalleerd met /plugin en worden op dezelfde manier gedeeld; ze komen met Claude Code 2.1.287 en zijn standaard ingeschakeld. Je hoeft de API niet te kennen om te beginnen: je kunt Claude Code vragen de mod te schrijven, waarna het de TypeScript-code produceert, de mod installeert en deze tijdens de sessie opnieuw laadt zonder herstart.

Het verschil met de bestaande hooks is duidelijk. Een instellingenhook (settings hook) voert bij elk event een shell-commando uit; een mod wordt één keer geladen en blijft in de sessie, waardoor hij toestand bijhoudt, de interface bij elk event opnieuw tekent en slash-commando’s of tools kan registreren die het model aanroept. Anthropic gebruikt ze al voor eigen functies: het paneel /diff en de ondersteuning voor AGENTS.md zijn ingebouwde mods geworden die je kunt uitschakelen of vervangen, en de ontwikkelaar is van plan in de loop van de tijd meer functies om te zetten, zodat je Claude Code tot een kleine kern kunt terugbrengen. Tot de zes ingebouwde mods die de documentatie noemt, behoort You should know, dat standaard uitgeschakeld is en waarin een secundaire agent aangeeft wat de gebruiker of Claude mogelijk over het hoofd ziet.

Aspect van modsOfficieel detail
Minimale versieClaude Code 2.1.287, mods standaard ingeschakeld
Omgevingen met weergaveCLI in de terminal, tabblad Code van Claude Desktop (behalve WSL-sessies)
Omgevingen zonder weergaveVS Code-extensie, claude -p, Agent SDK en cloudsessies, waarin de hooks draaien
Ingebouwde mods6, waaronder /diff, AGENTS.md, sec-default en You should know
Eigen uitvoeringstijd van een hook10 seconden per activering
Uitschakelen/plugin voor één mod, --safe-mode voor een sessie, disableAllHooks voor alle mods

De startgids van Addy Osmani op claude.dev bouwt Token Weather, een mod van ongeveer 80 regels die boven de prompt het « weer » van de context toont, met een minigrafiek van de laatste 12 beurten. De gids presenteert ook Blast Radius, dat een rm -rf, een git reset --hard of een force push tegenhoudt om eerst te laten zien wat die zou raken, en Replay Theater, dat de bestandswijzigingen van een beurt opnieuw afspeelt.

Vertrouwen blijft het lastige punt. De blogpost waarschuwt dat mods niet geïsoleerd zijn: ze hebben dezelfde toegang tot de machine als Claude Code, en de documentatie vermeldt dat een mod omgevingsvariabelen en instellingenbestanden kan lezen, elke prompt kan zien, een toolaanroep kan goedkeuren of het gebruikstegoed van het abonnement kan verbruiken, maar de toestemmingsprompt niet kan wijzigen. De gids van claude.dev beschrijft echter een module die in een eigen sandbox draait, zonder DOM of Node, waarbij elke externe actie via de API $ verloopt: daardoor kan claude plugin validate vóór de installatie aangeven welke events een mod onderschept en welke aanroepen hij doet. Op Team en Enterprise, en op elke machine met beheerde instellingen, wordt de ingebouwde mod sec-default als eerste geladen en voorkomt die dat door de gebruiker geïnstalleerde mods weigeringsregels omzeilen; beheerders kunnen hun eigen mods ervoor plaatsen.

Mods are absolutely insane. You can now customize Claude to work and look the way you want by just prompting it. Each person works differently, so there’s no reason why everyone should have an identical Claude experience. Make Claude your own, and share mods as plugins so others can try your mods too.

🇳🇱 Mods zijn echt waanzinnig. Je kunt Claude nu aanpassen zodat hij werkt en wordt weergegeven zoals jij dat wilt, gewoon door het hem te vragen. Iedereen werkt anders, dus er is geen reden waarom iedereen dezelfde Claude-ervaring zou moeten hebben. Maak Claude je eigen, en deel je mods als plugins zodat anderen ze kunnen uitproberen. — @bcherny op X

De lancering werd verwacht: Boris Cherny had die op 14 september aangekondigd, en Anthropic had het ontwerp gedeeld op GitHub (issue #91870). De blogpost en de gids van claude.dev nodigen gebruikers uit hun mods in te dienen voor de Claude-directory.

🔗 Claude Code aanpassen met mods in TypeScript · Startgids op claude.dev · Documentatie van mods

Claude Code 2.1.287: standaardcontext van 1M bij cloudproviders en 67 bugfixes

1 oktober — Claude Code 2.1.287 is de versie die mods introduceert, maar de release bevat 106 vermeldingen, waaronder 67 bugfixes. Voor bedrijven gebruiken Opus 4.7 en latere versies, evenals Fable, op Bedrock, Vertex, Foundry en de Claude apps-gateway voortaan standaard een contextvenster van 1M, zonder het achtervoegsel [1m]; met CLAUDE_CODE_DISABLE_1M_CONTEXT=1 kun je op 200K blijven. /advisor accepteert Sonnet 5.5 als adviseur van Opus 4.7 en 4.8, een automatische modelwisseling behoudt het huidige inspanningsniveau, en MCP-servers met protocol 2025-11-25 kunnen URL-prompts openen. Een gevaarlijke rm behoudt zijn bevestiging, ook wanneer het commando de uitvoer omleidt naar ~ of een wildcard, openstaande toestemmingsprompts worden van de oudste naar de nieuwste weergegeven, en negen vermeldingen verbeteren de schermlezermodus. In VS Code kan een lopend commando of een subagent naar de achtergrond worden verplaatst (Run in background).

🔗 Release notes van Claude Code 2.1.287


GitHub Copilot: het besturen van desktopapplicaties en dynamische workflows in publieke preview

1 oktober — GitHub stelt dezelfde dag twee agentmogelijkheden beschikbaar als publieke preview in Copilot CLI en de GitHub Copilot-app: het besturen van desktopapplicaties en dynamische workflows, die ook worden aangeboden in de GitHub Copilot SDK.

Copilot bestuurt desktopapplicaties. Computerbesturing (computer use) komt naar macOS en Windows. Copilot leest de toegankelijke inhoud van een venster en de visuele context ervan, via de toegankelijkheidsboom van het systeem of indien nodig via screenshots, klikt op bedieningselementen, voert tekst in, drukt op toetsen, scrolt, sleept en zet neer, en voert achtereenvolgens stappen uit in verschillende applicaties; de demonstratie laat zien hoe het een onkostendeclaratie invult in Safari. GitHub richt zich op oudere of uitsluitend grafische software, zonder API, commandline-interface of MCP-integratie, en de documentatie raadt die mogelijkheden aan wanneer ze beschikbaar zijn, omdat ze voorspelbaardere resultaten opleveren. De functie is standaard uitgeschakeld: /computer on schakelt haar in de CLI in, /computer show toont de status en /computer off schakelt haar uit, terwijl de app haar aanbiedt in de instellingen. Copilot vraagt toestemming voordat het elke applicatie bestuurt: je kunt die voor de sessie geven, voor volgende sessies opslaan of weigeren. Een permanente goedkeuring (Always allow) geldt voor de CLI en de app op dezelfde machine, maar een weigeringsregel heeft altijd voorrang, en twee keer op Esc drukken in de CLI, of de knop Stop in de app, onderbreekt een actie die uit de hand loopt. De beheerde instellingen van een organisatie kunnen de functie uitschakelen, zonder dat lokale inschakeling dit kan omzeilen. GitHub waarschuwt dat een onduidelijke instructie of onverwachte inhoud op het scherm ongewenste acties kan veroorzaken op ingelogde accounts, waaronder financiële accounts, en raadt permanente goedkeuring voor gevoelige applicaties af. De betreffende abonnementen worden niet gespecificeerd en er worden geen cijfers gegeven; het commando /computer stond al in de release notes van Copilot CLI 1.0.85 van 16 september.

🔗 GitHub Copilot kan nu met computer use desktopapps bedienen

In code geschreven orchestrations. Dynamische workflows (dynamic workflows), beschikbaar op alle Copilot-abonnementen, beschrijven in een programma hoe een taak moet worden uitgevoerd: de code bepaalt de stappen, het moment waarop een agent ingrijpt en het gebruik van zijn resultaten, opeenvolgend, parallel of beide, terwijl de agents behandelen wat analyse of oordeelsvorming vereist. Een workflow kan commando’s uitvoeren, een doel opsplitsen in parallelle taken, gestructureerde resultaten van de ene stap naar de andere doorgeven, de bevindingen van een subagent door een andere laten controleren en stoppen bij een controlepunt (checkpoint) voor een beoordeling voordat hij verdergaat. GitHub noemt het onderzoeken van een incident, het parallel reviewen van de bestanden in een pull request, of reviewcommentaren die aan twee modellen worden voorgelegd en alleen worden gemeld als beide overeenstemmen.

Copilot-modusWie het werk organiseert, volgens de documentatie
AutopilotCopilot, dat verdergaat zonder na elke stap om goedkeuring te vragen
/fleetCopilot, dat de taak telkens verdeelt over parallelle subagents
Dynamische workflowDe code die de auteur schrijft: stappen, voorwaarden en overdrachten

Het programma bevindt zich in een extensie van Copilot CLI en de app. Een door Copilot geschreven workflow blijft beperkt tot de sessie, maar kan opnieuw worden gebruikt door de extensie naar de persoonlijke map te kopiëren, worden gedeeld via de map van een repository of worden verpakt als plugin. Subagents erven de toestemmingen van de sessie, terwijl het commando copilot workflow run geen prompts weergeeft: de toestemmingen moeten vóór de start worden verleend. In de app zijn workflows zonder instellingen beschikbaar; in de CLI vereisen ze dat de experimentele functies worden ingeschakeld (--experimental of /experimental on). GitHub publiceert geen cijfers of factureringsregels, en de naam doet denken aan de Dynamic Workflows die Anthropic op 28 mei in Claude Code lanceerde, zonder dat er een verband is aangekondigd.

🔗 Dynamische workflows in Copilot CLI en de Copilot-app


FLUX 3 Image: Black Forest Labs maakt composities met begrenzingsvakken en genereert tot 4K

1 oktober — Black Forest Labs (BFL) voegt een beeldmodel toe aan zijn FLUX 3-familie, met als motto: elke pixel beheersen. FLUX 3 Image bewerkt een gebied in meerdere opeenvolgende stappen zonder de rest van het beeld te wijzigen, en accepteert meerdere wijzigingen in één verzoek.

De meest zichtbare vernieuwing is het maken van composities met begrenzingsvakken (bounding boxes). Ongeacht het formaat wordt het beeld een coördinatenstelsel van 0 tot 1000 op elke as: je tekent een vak per element, beschrijft de inhoud ervan en vat vervolgens de scène in één regel samen, waarna het model elk element in zijn vak plaatst; alleen een tekstprompt gebruiken blijft mogelijk. FLUX 3 Image combineert ook tot 10 referentiebeelden, die via tokens in de prompt worden aangehaald en waarvan het zelf de plaats en grootte bepaalt. BFL presenteert het als « ontworpen voor agents »: een LLM kan op basis van een eenvoudig verzoek de tabel met elementen en hun vakken opstellen, die de gebruiker aanpast voordat de generatie wordt gestart.

Aangekondigde eigenschapDoor BFL verstrekt detail
Native resolutie2K en 4K (voorbeeld op de modelpagina: 5456 × 3072 pixels, 16,8 MP)
ReferentiebeeldenTot 10
CompositieBegrenzingsvakken op een raster van 0 tot 1000 per as
BewerkingMeerdere beurten, zonder de overige pixels te wijzigen
API-aanbod50 % korting tot 8 oktober
ModelgewichtenCommercieel onder licentie; open gewichten « in de komende weken »

Wat de toegang betreft is FLUX 3 Image beschikbaar via de API met 50 % korting tot 8 oktober, en biedt BFL commerciële gewichten onder licentie aan bedrijven die het willen finetunen en op hun eigen infrastructuur willen inzetten. De versie met open gewichten is aangekondigd zonder datum. Op het moment van de aankondiging was geen basisprijs of benchmark met cijfers gepubliceerd. Het model vult een reeks aan die deze zomer werd gelanceerd: FLUX 3, een verenigd multimodaal model (23 juli), FLUX 3 Video (4 augustus), de bewerkingsmodus daarvan (10 september) en FLUX 3 Action voor robotica (23 september).

🔗 Aankondiging van FLUX 3 Image door @bfl_ai · Modelpagina van FLUX 3 Image


Assistenten voor het brede publiek: Guided Vision in Gemini Live, virtueel passen in ChatGPT, grafieken in Perplexity Computer, ruimere limieten voor de artefacten van Claude

Guided Vision: Gemini Live begeleidt blinde en slechtziende mensen

1 oktober — Google rolt Guided Vision uit in Gemini Live op Android 9 en latere versies, in de regio’s en talen waarin Gemini Live beschikbaar is. De functie is ontworpen samen met blinde en slechtziende mensen, beschrijft in realtime wat de gedeelde camera filmt, beantwoordt vervolgvragen en geeft mondelinge aanwijzingen om het beeld bij te stellen: langzaam naar rechts draaien, naar beneden kantelen, achteruitgaan. Google noemt het lezen van een voedingswaarde-etiket of een menu in een donker restaurant, het zoeken naar een gevallen oordopje of het beschrijven van de kleuren van een kledingstuk. Voor de training werkte Google samen met Aira, een dienst voor visuele interpretatie: tienduizenden uren aan gegevens, meer dan 1 000 testers uit het netwerk van Aira en specialisten die betrokken waren bij de veiligheidsmaatregelen. Guided Vision kan worden ingeschakeld via het profiel in de Gemini-app, een toegankelijkheidssnelkoppeling van Android of TalkBack. Google benadrukt dat het geen medisch hulpmiddel of mobiliteitshulpmiddel is: de functie vervangt de witte stok niet.

🔗 Guided Vision in Gemini Live (Google-blog)

ChatGPT: virtueel passen en favorieten voor aankopen

1 oktober — Volgens de release notes van ChatGPT verschijnt er een pasknop (Try on) op de productpagina’s van kleding en accessoires: je maakt of uploadt een selfie, waarna ChatGPT Images een virtuele pasweergave van het artikel genereert. De referentiefoto wordt bewaard voor volgende passessies; deze kan in de instellingen, bij de referentiefoto’s (Settings → Personalization → Reference photos), worden vervangen of verwijderd. Elk product kan ook worden opgeslagen als favoriet of in een map in de ChatGPT-bibliotheek worden geplaatst. Beide functies zijn beschikbaar op mobiel en op het web, maar de toelichting vermeldt niet voor welke abonnementen of landen ze gelden. ChatGPT bood sinds 24 maart al visueel winkelen aan.

🔗 Release notes van ChatGPT

Perplexity Computer maakt interactieve grafieken

1 oktober — Perplexity Computer maakt nu rechtstreeks in het gesprek interactieve grafieken en visualisaties. Voor financiële gegevens gebruikt de agent Lightweight Charts van TradingView om candlesticks, volume en voortschrijdende gemiddelden weer te geven. De aankondiging bestaat uit een tweet met een video: er staat niet welke abonnementen toegang krijgen of op welke platforms, en er is nog geen vermelding in de changelog die de functie toelicht. ChatGPT en Claude sloegen deze weg al in op 10 en 12 maart, Replit Agent op 25 september.

🔗 Aankondiging van @perplexity_ai op X

Claude halveert het verbruik van de limieten na een artefact, tot 15 oktober

1 oktober — Van 1 oktober om 11 uur PT tot 15 oktober om 23.59 uur PT zorgt het maken of wijzigen van een artefact (document, presentatie of design) in Claude of Claude Cowork ervoor dat het daaropvolgende werk 50 % minder van de sessielimiet van vijf uur verbruikt. Het aanbod geldt automatisch voor de abonnementen Pro, Max en Team; Free en de Enterprise-abonnementen zijn uitgesloten, en de wekelijkse limiet verandert niet.

Betrokken omgevingReikwijdte van de korting van 50 %
Gesprek gestart vanuit het menu OutputVanaf het eerste bericht: 10 berichten, 15 stappen per antwoord
Gewoon gesprekDe 10 berichten na het maken van het artefact, 15 stappen per antwoord
Cowork-taak in de cloud gestart vanuit OutputOngeveer de eerste 45 minuten
Andere Cowork-taak in de cloudTot 80 stappen na het maken of wijzigen van een artefact

Claude Code, de API, Claude in Slack, lokale of geplande Cowork-taken, gebruikscredits en de zelfstandige Claude Design-app zijn uitgesloten. Anthropic stelt voor om het met Sonnet 5.5 te proberen en behoudt zich het recht voor om het aanbod eerder te wijzigen of te beëindigen.

🔗 Aankondiging van @claudeai op X · Voorwaarden van het aanbod (Claude-helpcentrum)


Financiën: Barclays breidt Claude uit naar de hele bank, American Express stelt Perplexity Computer beschikbaar aan zijn Business-klanten

Barclays wil dat de helft van zijn ontwikkelaars eind 2026 Claude Code gebruikt

1 oktober — Barclays, de Britse universele bank, breidt zijn samenwerking met Anthropic uit en rolt Claude uit in de hele organisatie om softwareontwikkeling te versnellen, oude systemen te moderniseren en de operationele efficiëntie te verbeteren. De bank verwacht dat 50 % van zijn ontwikkelaars eind 2026 Claude Code gebruikt, gevolgd door een meerderheid van zijn software-engineers in 2027. Voor twee toepassingen zijn al cijfers beschikbaar. De Colleague Knowledge Assistant, die sinds 2025 in gebruik is en op Claude is gebouwd met een architectuur voor retrieval-augmented generation (RAG), is door meer dan 16 000 collega’s in gebruik genomen en heeft meer dan een miljoen zoekopdrachten verwerkt; hij helpt de teams die meer dan 20 miljoen particuliere klanten in het Verenigd Koninkrijk bedienen. Binnen Global Markets classificeren, verrijken en routeren de Claude-modellen ongeveer 120 000 e-mails per dag. Paul Smith, commercieel directeur van Anthropic, ziet hierin een belangrijke stap voor het bedrijf in het Verenigd Koninkrijk; er is geen contractbedrag of looptijd bekendgemaakt.

🔗 Barclays breidt het gebruik van Claude uit om de bedrijfsvoering en de klantervaring te verbeteren

Perplexity en American Express: tien zakelijke Skills in Computer voor Business-kaarten

1 oktober — Perplexity lanceert een collectie kant-en-klare Skills voor Perplexity Computer, uitsluitend voor Amerikaanse houders van een American Express Business-kaart met een Perplexity Enterprise-abonnement. De bedrijfsleider kiest een taak en specificeert die in een formulier in plaats van een prompt te schrijven. De tien Skills omvatten kasstroomprognoses, belastingvoorbereiding, leveranciersvergelijking, begrotingsscenario’s, rekeningafstemming, marketingcampagnes, vraagprognoses, rendement op advertentie-uitgaven per kanaal (ROAS), het volgen van bedrijfsactiviteiten en werving. De kaart wordt vanuit Personal CFO via Plaid gekoppeld, en elke uitvoering verbruikt Computer-credits afhankelijk van de complexiteit van de taak. De partnerpagina biedt daarnaast tot 29 maart 2027 een eenmalig tegoed van 125 dollars bij een aankoop van minstens 325 dollars voor een Enterprise Pro- of Enterprise Max-abonnement, en eenmalig 1 000 gratis Computer-credits per account. Corporate-kaarten zijn uitgesloten, en de resultaten gelden niet als financieel, fiscaal, juridisch of boekhoudkundig advies.

🔗 Blogbericht van Perplexity · Partnerpagina van American Express


Generatieve video en avatars: Wan 3.0 bovenaan bij Artificial Analysis, Project Continuum van Runway, Sessions van Synthesia

Wan 3.0 neemt de leiding in de nieuwe videoranglijst van Artificial Analysis

1 oktober — Alibaba claimt de eerste plaats voor Wan 3.0 in de nieuwe tekst-naar-video-ranglijst van Artificial Analysis, AA-Video-T2V v2.0, die op 30 september werd gelanceerd met een nieuwe methodologie: elk model wordt in 1080p beoordeeld op een regelmatig vernieuwde set prompts, en geluidssynchronisatie telt mee in de score. De top drie ligt dicht bij elkaar, met overlappende betrouwbaarheidsintervallen.

Gerangschikt modelElo-scoreRangintervalPrijs via API
Wan 3.01157 (±9)1 tot 212,00 dollars per minuut
Utopai X (gebouwd op MiniMax H3)1150 (±10)1 tot 3Geen openbare API
Dreamina Seedance 2.51144 (±9)2 tot 434,12 dollars per minuut
MiniMax H3 (768p)1139 (±9)3 tot 54,80 dollars per minuut

De verrassing in de ranglijst is Utopai X, dat op 30 september werd gelanceerd door Utopai Studios, een film- en televisiestudio die vanaf het begin op AI is gericht. Het model heeft aanvullende training op basis van MiniMax H3 gekregen, is alleen toegankelijk via het PAI-platform van de studio (93 credits per seconde video, abonnementen vanaf 15 dollars per maand) en staat hoger dan MiniMax H3 zelf.

🔗 Aankondiging van @Alibaba_Wan op X · Ranglijst AA-Video-T2V v2.0 · Utopai X volgens @ArtificialAnlys

Runway Labs onthult Project Continuum, interfaces die in realtime als video worden gegenereerd

1 oktober — Runway Labs, de onderzoekstak van Runway, toont Project Continuum, een onderzoekstoepassing die een besturingssysteem voorstelt waarvan de interface in realtime als video wordt gegenereerd, voortbouwend op Solaris, het wereldmodel voor interfaces dat op 31 augustus werd gepresenteerd. Deze eerste preview beschrijft vier manieren om met je computer te werken. Met Portals genereert een videomodel tijdens het navigeren geanimeerde en interactieve overlays, met vervaagde randen om gegenereerde inhoud aan te duiden. Responsieve video-interfaces (Responsive Video Interfaces) herschikken zich wanneer je hun formaat wijzigt en reageren op klikken. Interactive Worlds verandert media in een interactieve simulatie, zowel voor mensen als voor agents. Visual Thinking is tot slot een harness voor code-agents: een realtime videomodel brengt elke stap en elke toolaanroep in beeld, zodat de gebruiker betrokken blijft. Runway vermeldt geen toegangsmogelijkheid, datum, prijs of onderliggend model.

🔗 Thread van @runwayml op X

Synthesia lanceert Sessions, avatars die mensen trainen en ondervragen

1 oktober — Synthesia lanceert Sessions, een productfamilie die is gebouwd op zijn interactieve avatars: een videogesprek waarbij de gesprekspartner een avatar is die vragen stelt, luistert, tegenspreekt en samenvat. Roleplay Sessions dient voor training: de avatar speelt een klant, een prospect of een medewerker, een AI-coach geeft feedback op elke poging en managers volgen scores en voortgang in een dashboard. Survey Sessions verandert een vragenlijst in een interview: de avatar ondervraagt honderden mensen tegelijk, stelt vervolgvragen op basis van de antwoorden en levert vervolgens een rapport over thema’s en sentiment, waarbij elk antwoord raadpleegbaar blijft als transcriptie, audio of CSV. Er wordt een gratis proefperiode aangeboden, zonder gedetailleerde prijsinformatie. Sessions steunt op de Interactive Avatar API, die op 16 september algemeen beschikbaar werd, en Synthesia belooft meer varianten.

🔗 Aankondiging van @synthesiaIO op X · Pagina van Synthesia Sessions


AI en wetenschap: SynthID Bio voorziet eiwitten van een watermerk, Matthew Schwartz beschrijft wetenschap « in de vorm van Claude »

SynthID Bio: Google DeepMind voorziet door AI ontworpen eiwitten van een watermerk

30 september — Google DeepMind presenteert SynthID Bio, een familie van methoden voor digitale watermerken (watermarking) voor biologische creaties die door AI zijn gegenereerd, waarover op 1 oktober ook op X werd bericht. Het blogbericht presenteert dit als een proof of concept: een onmerkbare handtekening wordt in de biologische code aangebracht en kan zowel op het digitale model als op het gesynthetiseerde eiwit worden gecontroleerd. Voor sequenties stuurt de methode subtiel de keuze van aminozuren; voor 3D-structuren wordt een klein deel van het diffusienetwerk van AlphaFold 3 verfijnd. In het laboratorium evenaarden de bindende eiwitten met een watermerk bij drie doelwitten (VEGF-A, het RBD-domein van het spike-eiwit van SARS-CoV-2 en PD-L1) de conventionele versies in slagingspercentage, affiniteit en sequentiediversiteit. Het doel is bioveiligheid: een automatisch signaal zou leveranciers van DNA-synthese helpen de herkomst van een onbekende sequentie te controleren. Google DeepMind publiceert zijn methodenartikel, de code, de in-vitrogegevens en de gewichten voor onderzoek; samen met het Hie lab van Stanford en het Arc Institute wordt de aanpak al uitgebreid naar het genoom van een door Evo 2 ontworpen bacteriofaag. Robuustheid tegen opzettelijke wijzigingen blijft het belangrijkste werkpunt.

🔗 Blogbericht van Google DeepMind over SynthID Bio

Wetenschap « in de vorm van Claude »: het gastartikel van Matthew Schwartz

1 oktober — De blog Anthropic Science publiceert een gastartikel van Matthew Schwartz, natuurkundige aan Harvard, die aangeeft als gastonderzoeker bij Anthropic te werken. Hij beschrijft een « impedantiemismatch » tussen wetenschappers en AI: werken met een model zoals met een menselijke collega haalt er niet het beste uit, en het is beter te zoeken naar problemen « in de vorm van Claude », waarbij een bekende techniek uit de wiskunde, natuurkunde of informatica in één keer een vraag uit een ander vakgebied oplost. Daaruit ontwikkelde hij BootLoops, een open source harness voor exacte berekeningen dat met elk model kan worden gebruikt; BootLoops is geen Anthropic-project, Schwartz onderhoudt het zelf. In de natuurkunde zijn 30 integralen van begin tot eind behandeld, waarvan 15 nooit eerder waren berekend; in de ecologie veranderen de bomen op Barro Colorado Island 4,5 keer sneller dan de neutrale theorie toelaat; in de taalkunde omvat de AccStack-database de woordklemtoon van 6 072 talen. De balans: 36 manuscripten in 18 vakgebieden met 19 coauteurs in drie maanden. Schwartz benoemt ook de beperkingen: Claude heeft geen tijdsbesef, houdt ervan « de overwinning uit te roepen », en zijn resultaten buiten de natuurkunde bleven weinig interessant totdat een expert er een andere richting aan gaf.

🔗 Wetenschap in de vorm van Claude (blog Anthropic Science)


Open modellen en training: Olmo-core 3 van Ai2, Clef en Clef-flash van Cloudflare, RL met meerdere harnesses van FineEnvs

Olmo-core 3: Ai2 stelt een MoE-trainingstack open die mikt op meer dan duizend miljard parameters

1 oktober — Ai2 publiceert Olmo-core 3, een nieuwe versie van het framework waarmee het zijn Olmo-modellen traint, opnieuw opgebouwd rond een volledig open trainingssysteem met een mengsel van experts (mixture-of-experts, MoE). Het is een van de systemen van de volgende generatie Olmo, die op MoE zal overstappen en volgens Ai2 de meest capabele Olmo moet worden. De oude implementatie, gebaseerd op FSDP, verzamelde de gewichten en verdeelde ze vervolgens opnieuw bij elke batch; Olmo-core 3 stapt over op DDP, houdt de experts op hun GPU’s en stuurt de gegevens naar hen toe.

Door Ai2 gepubliceerde metingGemeten waarde
MoE met 47 miljard parameters op acht B300, voorlopige test52 000 tegenover 19 400 tokens/s per GPU, ongeveer 2,7 keer
MXFP8 tegenover BF16, op vier B300Ongeveer 21 % meer doorvoer
Model met 1 200 miljard parameters op 512 GPUMaximaal 858 TFLOP/s per GPU, willekeurige routering

Ai2 benadrukt dat de meting met 1 200 miljard parameters het systeem beoordeelt, niet de kwaliteit van een getraind model. De code (versie 3.0.0), het technische rapport en een interactieve demonstratie zijn gepubliceerd.

🔗 Blogbericht van Ai2 over Olmo-core 3 · Release Olmo-core v3.0.0

Clef en Clef-flash: Cloudflare maakt twee beslissingsmodellen beschikbaar die compatibel zijn met Jev

1 oktober — Het Workers AI-team van Cloudflare publiceert Clef en Clef-flash, zijn eerste intern getrainde modellen, op het terrein dat Jev, het System One-model van Typesafe AI, heeft geopend: ze ontvangen een toestand (tekst, JSON, afbeelding of video) en een schema met getypeerde vragen, en geven vervolgens in één doorgang een kans voor elke toegestane optie terug. Clef is verder getraind op basis van Qwen3.8-27B, Clef-flash is gebaseerd op Qwen3.5-9B. Ze worden gehost op Workers AI met een API die compatibel is met die van Jev en worden volgens de blogpost op Hugging Face gepubliceerd onder de Apache 2.0-licentie, met een contextvenster van 64k tokens tegenover 32k voor Jev. De door Cloudflare gekozen cijfers geven een gemengd beeld:

Benchmark en metriekScore van ClefScore van Clef-flashScore van Jev
BFCL, exacte gevallen98,4798,7695,75
BANKING77, macro-F194,2090,9379,74
When2Call, nauwkeurigheid72,3765,5880,97
BRIGHT, nDCG@1045,9139,2647,52
Mediane latentie209,3 ms38,8 ms524,1 ms

Cloudflare stelt dat Clef bovenaan de Jev Decision Index staat, een positie die Liquid AI twee dagen eerder voor d1 claimde, en lanceert een dienst om Clef via reinforcement learning te finetunen op klantgegevens.

🔗 Blogpost van Cloudflare over Clef · Clef op Hugging Face

FineEnvs traint een model met reinforcement learning in vier harnesses voor agents tegelijk

1 oktober — Eenzelfde model gedraagt zich anders naargelang de harness die het aanstuurt: de modelgewichten van LFM2.5-2.6B van Liquid AI lossen 62 % van de taken op onder Mini-SWE-Agent, maar 33 % onder Claude Code. De organisatie FineEnvs publiceert op Hugging Face een gids om een model via reinforcement learning rechtstreeks in de harnesses van ontwikkelaars te trainen, zonder hun code te wijzigen. Een aan OpenEnv toegevoegde proxy voor het vastleggen van gegevens presenteert zich aan de harness als een modelprovider (OpenAI-, Anthropic- of Gemini-formaten) en registreert de exacte tokens en kansen die vLLM produceert; Harbor levert taken en sandboxes, TRL traint met asynchrone GRPO. Wanneer LFM2.5-2.6B in vier harnesses tegelijk wordt getraind, stijgt het gemiddelde van 42 % naar 54 %, en een kleine bonus voor zuinige oplossingen vermindert het aantal toolaanroepen bij al opgeloste taken met 31 %. Een groter model nabootsen volstaat niet: gesuperviseerde finetuning op 3 189 rollouts van Qwen3.8-27B blijft steken op 47,5 %. De proxy, trainer, taken, gegevens en getrainde modellen worden gepubliceerd.

🔗 De ultieme gids voor RL met meerdere harnesses


Grok 4.7 in preview op het agentplatform van Google Cloud

1 oktober — SpaceXAI kondigt aan dat Grok 4.7 beschikbaar is op Gemini Enterprise Agent Platform, het agentplatform van Google Cloud. De modelkaart, gedateerd op 30 september, vermeldt het als preview onder de identifier grok-4.7 en beschrijft het als een model van xAI voor programmeren en kenniswerk, dat langer aan moeilijke taken werkt en zijn eigen werk controleert. Het accepteert tekst en afbeeldingen als input en geeft alleen tekst terug; functieaanroepen, gestructureerde output en redeneren worden ondersteund, batchvoorspellingen niet.

Door Google Cloud gepubliceerde gegevensWaarde voor Grok 4.7
Contextlengte524 288 tokens
Quota per minuut13 verzoeken, 188 000 inputtokens en 16 000 outputtokens
GebruiksvormenAlleen vaste quota, geen betaling naar gebruik of vooraf toegewezen doorvoer
Serviceregio’sMultiregio Verenigde Staten en globaal endpoint
Prijs per miljoen tokens2 dollar voor input, 6 voor output, 0,50 voor cache bij minder dan 200 000 inputtokens, het dubbele daarboven

Het tariefschema komt overeen met dat van de xAI-API. Grok 4.7 werd op 21 september gelanceerd en kwam op 28 september naar Amazon Bedrock; Grok 4.6 was op 21 augustus al toegevoegd aan hetzelfde Google-platform.

🔗 Modelkaart van Grok 4.7 op Google Cloud · Aankondiging van @SpaceXAI op X


GitHub scherpt het privé melden van kwetsbaarheden aan in reactie op door AI gegenereerde meldingen

1 oktober — GitHub publiceert in dezelfde minuut twee maatregelen voor het privé melden van kwetsbaarheden (private vulnerability reporting), met dezelfde constatering: beheerders van open source ontvangen steeds meer geautomatiseerde of door AI gegenereerde meldingen van lage kwaliteit, waardoor belangrijke meldingen ondersneeuwen.

A single free-text box made it easy to submit low-quality or AI-generated reports and hard for you to find the signal in them.

🇳🇱 Een eenvoudig veld voor vrije tekst maakte het gemakkelijk om meldingen van lage kwaliteit of door AI gegenereerde meldingen in te dienen, en maakte het voor je moeilijk om daarin de essentie te herkennen. — GitHub Changelog, Gestructureerde formulieren voor privémeldingen van kwetsbaarheden

Een gestructureerd formulier. Standaard moet de melder vier verplichte velden invullen: een samenvatting, details, een proof of concept van minstens 150 tekens en de impact. Deze worden samengevoegd in de beschrijving van het beveiligingsadvies, dat de beheerder zoals voorheen beoordeelt. Elke repository kan het formulier aanpassen met een bestand .github/VULNERABILITY_REPORT.yml, of het op alle repositories toepassen vanuit de repository .github van de organisatie; beheerders kunnen een CWE-categorie verplicht stellen, wat een organisatie of onderneming via beleid kan opleggen. Met een selectievakje kan de melder aangeven dat AI heeft geholpen bij het vinden van de kwetsbaarheid of het schrijven van de melding. Voor de REST API geldt een aangepast formulier eveneens, maar het standaardformulier niet, om bestaande integraties niet te verstoren.

Een dagelijks maximum. Het aantal nieuwe meldingen dat één account per dag kan indienen, is voortaan beperkt, zowel voor één repository als voor heel GitHub; reacties op bestaande beveiligingsadviezen vallen hier niet onder. Beheerders kunnen hun eigen limiet instellen en vertrouwde melders vrijstellen, en GitHub noemt geen getal voor de standaardlimiet. Beide maatregelen gelden voor openbare repositories die het privé melden van kwetsbaarheden hebben ingeschakeld, op GitHub Free, Pro, Team en Enterprise Cloud.

🔗 Frequentielimieten voor privémeldingen van kwetsbaarheden


Agents voor code: Codex CLI 0.160.0, Delta 0.18 en Antigravity 2.19.1

Codex CLI 0.160.0: de geschiedenis van het commandocentrum en sessies buiten projecten

1 oktober — OpenAI publiceert Codex CLI 0.160.0, de eerste stabiele versie sinds 0.159.3 van de vorige dag, met 55 vermelde PR’s sinds 0.159.0. Het commandocentrum voor agents (agent command center) krijgt een actie om oudere taken te tonen (Meer tonen), die met het toetsenbord kan worden gebruikt. Sessies kunnen buiten een project starten, met de standaardinstellingen van de werkruimte wanneer het organisatiebeleid dat toestaat, en opgeslagen machtigingen worden bij hervatting hersteld. De goedkeuringscontrole Guardian krijgt twee optionele mogelijkheden: eerder door de gebruiker gegeven instructies terugvinden en de context van overdrachten tussen agents meenemen. In volledig scherm kun je in lokale Linux X11-terminals het transcript selecteren en met de middelste muisknop plakken. Verder worden berichten in de wachtrij na een nieuwe verbinding weer verwerkt zonder dubbel te worden verstuurd, en richt een reeks correcties zich op de Windows-sandbox en SQLite-blokkades tijdens de initialisatie.

🔗 Codex CLI 0.160.0 op GitHub

Delta 0.18: threads draaien in bestaande Git-worktrees en er komt een CLI

30 september — Zed publiceert versie 0.18.0 van Delta, zijn multiplayeromgeving om met agents te programmeren: 23 nieuwe functies, 41 verbeteringen, 51 correcties en één verwijdering. De belangrijkste nieuwigheid was op 28 september al aangekondigd, zonder datum: een thread kan voortaan in elke al gekoppelde, bestaande Git-worktree draaien en die werkkopie doorgeven aan nieuwe threads die vanuit die thread worden aangemaakt. Delta kan ook vanuit de terminal worden bediend: een CLI delta kan op macOS, Windows en Linux worden geïnstalleerd, en de commando’s delta auth beheren het aangemelde account. Wat modellen betreft voegt de versie de Gemini-modellen van Google AI Studio toe, maakt ze GPT-6 Sol, GPT-6 Luna en Claude Opus 5.5 toegankelijk met een API-key, en accepteert de desktopapp elke provider die compatibel is met OpenAI of Anthropic. Werken met threads krijgt een zoekfunctie voor alle subthreads en bladwijzers; subthreads publiceren hun voortgangsberichten echter niet meer in de bovenliggende thread, waarin alleen de resultaten van Land Changes zichtbaar blijven.

🔗 Release notes van Delta 0.18.0

Antigravity 2.19.1: rechtstreeks aan subagents schrijven

30 september — Antigravity 2.19.1 maakt het mogelijk om vanuit het invoerveld rechtstreeks een bericht naar een subagent te sturen, zonder tussenkomst van de hoofdagent; de CLI bood dit al met zijn @-syntaxis sinds versies 1.2.8 en 1.2.9. De versie voegt PDF-export toe van de Markdown die in artefacten en het zijpaneel wordt weergegeven, inclusief tabellen, codeblokken en diagrammen, en een optie voor ongedaan maken die beperkt is tot de conversatie; bij de vijf correcties hoort dat aangepaste agents eindelijk de globale regels en de projectregels volgen. De uitrol verloopt geleidelijk en kan enkele dagen duren. De CLI had op 27 september ongemerkt versie 1.2.12 gekregen: een sessie die met een key GEMINI_API_KEY is gestart, stopt voortaan onmiddellijk wanneer de Gemini-API meldt dat het dagelijkse quotum is uitgeput, een uitgavenlimiet is bereikt of de vooraf betaalde credits zijn opgebruikt, in plaats van minutenlang pogingen te blijven doen die tot mislukken gedoemd zijn.

🔗 Changelog van de Antigravity-app · Changelog van de Antigravity-CLI


Kort nieuws

  • Copilot CLI 1.0.90 en 1.0.91 — Versie 1.0.90 wordt op 30 september stable, met GPT-6.1 Sol in de modelkiezer en oplossingen voor problemen met MCP en het hervatten van sessies; versie 1.0.91 voegt op 1 oktober de commando’s copilot sandbox ca toe om het proxycertificaat van de sandbox te beheren. 🔗 bron
  • Codex CLI 0.159.3 — Deze versie, uitgebracht op 30 september om 22 h 57 UTC, bevat slechts één backport: lokale sessies die via ChatGPT zijn aangemeld, kunnen optionele herinneringen tonen om de beveiligingsinstellingen van het account te voltooien. Deze wijziging is ook opgenomen in 0.160.0. 🔗 bron
  • Gemini CLI nightly — Versie v0.64.0-nightly van 1 oktober verhelpt een vastloper waarbij de processor in headless-modus op 100 % draait en maakt schrijfbewerkingen van bestandstools atomair; de stable- en prereleaseversies blijven ongewijzigd. 🔗 bron
  • Zed 1.23.1 als prerelease — Deze versie, uitgebracht op 30 september, toont JSONL- en NDJSON-bestanden als tabel, voegt de instelling agent.max_idle_retained_threads toe en probeert verzoeken automatisch opnieuw wanneer een Google AI-model overbelast is. 🔗 bron
  • Copilot in VS Code in september — Het maandelijkse overzicht van versies 1.136 tot 1.140 vermeldt enkele weinig belichte vernieuwingen, waaronder het hervatten in VS Code van een Codex-gesprek dat in de ChatGPT-app is begonnen, een appbadge in preview en chats die zonder workspace worden geopend. 🔗 bron
  • Samen plannen in Delta — Op de blog van Delta vertelt Nathan Sobo hoe drie teamleden in dezelfde thread plannen met Fable en vervolgens Astra, met een afzonderlijke subthread en sub-agent, in plaats van in een bestand plan.md; er wordt geen nieuwe functie aangekondigd. 🔗 bron
  • Innate gefilmd door Cursor — Cursor publiceert een kort videoportret van Innate, een team van zeven mensen dat robots voor het dagelijks leven bouwt en waarvan medeoprichter Vignesh Anand zegt dat het het werk van 50 mensen doet, zonder toe te lichten hoe het Cursor gebruikt. 🔗 bron
  • Ophalen in plaats van comprimeren — David Corvoysier, ontwikkelaar van funes, meet met Claude Code dat het ophalen van de vorige sessie via zijn tool de juiste antwoorden oplevert met 8, 4 en 3 keer minder gewogen tokens dan wanneer alle context behouden blijft, bij drie taken die hij zelf heeft gekozen. 🔗 bron
  • Nieuw GitHub-dashboard — De weergave die actieve agentsessies, issues en pull requests samenbrengt, met maximaal 12 items per lijst, wordt voor iedereen de standaardweergave; het nieuwsoverzicht verhuist naar een tabblad Feed en de oude weergave blijft toegankelijk. 🔗 bron
  • Asynchrone merge-API — Deze wordt algemeen beschikbaar en wordt de aanbevolen manier om programmatisch te mergen, ter vervanging van het synchrone REST-endpoint en de GraphQL-mutaties; het is de enige merge-API die gestapelde pull requests ondersteunt. 🔗 bron
  • npm-dist-tags zonder token — De configuraties voor vertrouwd publiceren van npm kunnen een optionele toestemming krijgen, die standaard uitstaat, om dist-tags te beheren met kort geldige OIDC-inloggegevens in plaats van een lang geldig toegangstoken. 🔗 bron
  • Bewaartermijn van GitHub Actions — Checks, workflowruns en statussen, inclusief die van apps van derden, volgen voortaan de ingestelde bewaartermijn voor artefacten en logs en worden daarna verwijderd, met maximaal 90 dagen voor openbare repositories en zonder mogelijkheid tot herstel. 🔗 bron
  • Code scanning en inactieve repositories — Geplande wekelijkse analyses van code scanning en GitHub Code Quality starten voortaan pas na een analyse die door een push of pull request is geactiveerd, zodat een inactieve repository niet nog zes maanden langer actief lijkt. 🔗 bron
  • Codedekking — De action upload-code-coverage van GitHub Code Quality laat de CI niet meer mislukken bij een push naar een branch waarvoor nog geen pull request openstaat. 🔗 bron
  • Toegankelijkheidsverklaringen — Een bestand ACCESSIBILITY.md in de hoofdmap, in .github/ of in docs/ wordt prominent getoond op de startpagina van de repository, bij alle abonnementen op github.com, en komt ook naar GitHub Enterprise Server 3.24. 🔗 bron
  • Actions Runner Controller 0.15.0 — De Kubernetes-controller voor zelfgehoste runners werkt resources ter plaatse bij tijdens upgrades naar patchversies, maakt de wachttijd voor afsluiten, de limieten van de Kubernetes-client en de concurrency van controllers configureerbaar, en vermindert de belasting door zijn verzoeken. 🔗 bron
  • Grok Bot neemt het initiatief — De belangrijkste Bot van de gebruiker herkent voortaan werk dat hij kan overnemen en stelt voor om dat te doen; de uitrol duurt enkele uren en deze suggesties tellen niet mee voor het gebruik, zonder vermelding van abonnementen of landen. 🔗 bron
  • Genspark en Azure Cosmos DB — Een bericht op de blog van Azure Cosmos DB, geschreven vanuit het perspectief van Genspark, legt uit hoe bepaalde achtergrondprocessen globale secundaire indexen gebruiken om live agentsessies niet langer te vertragen; er worden geen cijfers gegeven. 🔗 bron
  • Gebruikerservaring bij Genspark — Seulki Kang, met vijftien jaar ervaring in marketing, zegt een complete set lesmaterialen in 5 uur in plaats van 30 uur voor te bereiden door haar oude documenten aan SecondBrain en vervolgens aan AI Slides te koppelen; er is geen productvernieuwing. 🔗 bron
  • Albertsons en OpenAI — De winkelketen met meer dan 2 200 winkels breidt zijn partnerschap uit van ChatGPT Enterprise voor geselecteerde teams naar de API voor zijn klantervaringen en promotieanalyses, en zet zijn Safeway-plugin in ChatGPT in de schijnwerpers, die op 5 augustus werd aangekondigd. 🔗 bron
  • De eeuwige aanvulling — OpenAI publiceert het eerste essay in een reeks over de toekomstige economie, geschreven door Hemanth Asirvatham en Elliott Mokski, die aangeven op persoonlijke titel te spreken: het grootste deel van de machine-intelligentie zou voor uitvoering kunnen worden ingezet in plaats van voor doorbraken. 🔗 bron
  • Perplexity en consultants — Een gids vergelijkt tien AI-tools voor consultants, van AlphaSense tot Qwilr, met prijzen die in september zijn gecontroleerd; de FAQ herinnert eraan dat het gratis abonnement van Perplexity zijn modellen traint op gebruikersgegevens, tenzij gebruikers daar bezwaar tegen maken. 🔗 bron
  • Luma Variants — De functie, die de dag ervoor zonder verdere details werd gepresenteerd, wordt voor alle Luma-gebruikers gelanceerd: op basis van een goedgekeurde statische advertentie maakt ze varianten in vijf standaardformaten, van 9:16 tot 16:9, en in meerdere talen, zonder aangekondigde prijs. 🔗 bron
  • HeyGen Professional Voice Clone — Volgens het septemberoverzicht stelt HeyGen zijn meest natuurgetrouwe stemkloon beschikbaar via de API, getraind op minstens 20 minuten aan opnamen (1 tot 10 bestanden), na een besloten preview die op 9 september begon. 🔗 bron
  • Pika en zijn apps — Pika zegt meer dan 40 apps op zijn nieuwe platform te hebben en presenteert er twee: Podcast Video, dat twee personages laat debatteren, en Color Grade, dat de kleuren van een afbeelding of clip corrigeert, zonder datum of prijs. 🔗 bron
  • ElevenLabs in de Benelux — ElevenLabs opent kantoren in Brussel en Amsterdam en wil zijn teams daar verdrievoudigen; bij telecomoperator KPN stijgt de herkenning van postcodes van 64 % naar 82 % en verwerkt de verificatieagent ongeveer 60 000 oproepen per week. 🔗 Nederland · 🔗 België
  • DOCA-skills van NVIDIA — Bij 65 echte prompts van ontwikkelaars voldoen codeagents met deze skills voor BlueField-DPU’s aan 100 % van de criteria van het beoordelingsschema, tegenover 19 % zonder; ze zijn gepubliceerd op GitHub. 🔗 bron
  • DIN Deploy — NVIDIA publiceert opensourcevoorbeelden in C++ om modellen lokaal uit te voeren met ONNX Runtime en TensorRT RTX, onder Windows en Linux; op een DGX Spark transcribeert Parakeet TDT op de GPU 206 keer sneller dan realtime, tegenover 14 keer op de CPU. 🔗 bron
  • Nemotron 3.5 ASR en Saoedische dialecten — Een tutorial van NVIDIA finetunet het model op de Najdi- en Hijazi-dialecten: het woordfoutpercentage daalt van 55,05 % naar 29,96 % in 12 000 stappen op twee RTX PRO 6000, terwijl de resultaten voor Engels en Arabisch in FLEURS zelfs licht verbeteren. 🔗 bron
  • HSTU-aanbevelingssysteem op Dynamo-Triton — NVIDIA draait een generatief HSTU-aanbevelingssysteem met PyTorch AOTInductor en een KV-cache: in het beste geval op een RTX PRO 6000 tot 4,47 en 5,93 keer sneller, afhankelijk van het aantal lagen, oftewel 0,423 en 0,678 ms per verzoek. 🔗 bron
  • Rendabiliteit van AI-fabrieken — In een opiniestuk raamt NVIDIA de kosten van een AI-fabriek op ongeveer 60 miljoen dollar per megawatt en haalt het gegevens van SemiAnalysis aan: Vera Rubin NVL72 is bij DeepSeek V4 Pro tot 45 keer goedkoper per miljoen tokens dan GB300 NVL72, tegenover 35 keer op 24 augustus. 🔗 bron
  • huggingface_hub 2.1.0 — De library start mislukte Jobs automatisch opnieuw, plant ze opnieuw in zonder ze opnieuw aan te maken, leest het resterende ZeroGPU-quotum uit en downloadt Xet-bestanden via hf_xet: een parquet-bestand van 2 Go gaat op HF Jobs van ongeveer 120 naar 7 seconden; drie breaking changes. 🔗 bron
  • ML Intern en MCP — Hugging Face koppelt MCP-databronnen aan ML Intern, de modus van HuggingChat die modellen traint, om open modellen te finetunen op eigen bedrijfsgegevens; de aankondiging bevat geen officiële cijfers. 🔗 bron
  • Hugging Face en het Open Source for Science Fund — De twee partners willen vaststellen van welke libraries bijdragers aan wetenschappelijke modellen het meest afhankelijk zijn en de maintainers daarvan ondersteunen, zonder bedrag of tijdschema. 🔗 bron
  • Een miljoen trainingen met TRL — Volgens de telemetrie die Quentin Gallouédec aanhaalt, telt de library voor post-training van Hugging Face een miljoen trainingen per maand, met als doel een miljoen per week; de telmethode is niet gepubliceerd. 🔗 bron
  • Het miljoen datasets van de Hub — Drie auteurs laten zien dat organisatieaccounts ongeveer 19 % van de datasets publiceren maar de helft van de downloads voor hun rekening nemen, en dat de Verenigde Staten 390 van de 1 000 meest gedownloade datasets hebben. 🔗 bron
  • Acht VLM’s op een RTX 3090 — Aakash Gupta van ThinkEvolve laat zien dat Qwen3-VL-8B bij gelijke nauwkeurigheid elk verzoek 2,2 keer sneller verwerkt dan Qwen3.8-27B, maar 18,88 uur nodig heeft tegenover 7,53 uur voor een taak met 7 329 aanroepen, doordat het de prefixcache niet hergebruikt. 🔗 bron
  • GLiNER2.5-Decide tegenover layax — Aravind Vijayakumar slaagt er niet in om enige betrouwbaarheidsdrempel voor het model van Fastino te certificeren, tegenover 10 geslaagde pogingen op 10 voor layax, zijn eigen tool, die 20 tot 23 punten nauwkeuriger en ongeveer vijf keer sneller is. 🔗 bron
  • David Ha en orchestrators — In een opiniestuk voor Nikkei Asia stelt de medeoprichter en CEO van Sakana AI dat de waarde zal verschuiven van de gewichten van een model naar de intelligentie die meerdere modellen combineert, en definieert hij soevereiniteit als de robuustheid van de toeleveringsketen. 🔗 bron
  • Videodiffusie op TPU — Drie ingenieurs van Google verkorten het verwijderen van ruis uit een video van 1440p van 2 471 naar 1 461 seconden op acht TPU v6e-chips, oftewel 1,69 keer sneller, dankzij de sparse attention van Sparse VideoGen en een geoptimaliseerde Splash Attention-kernel. 🔗 bron

Wat dit betekent

Codeagents worden programmeerbaar door hun gebruikers. Met mods stelt Claude Code zijn interne gebeurtenissen beschikbaar aan kleine TypeScript-functies, waarbij het zelfs zijn eigen functies omzet in vervangbare mods; met dynamische workflows laat GitHub de orchestratie van sub-agents in code schrijven, in plaats van Copilot telkens te laten beslissen over de taakverdeling. De gids van FineEnvs laat zien waarom de harness even zwaar weegt als het model: dezelfde gewichten lossen 62 % van de taken op in de ene harness en 33 % in een andere. Daar staat vertrouwen tegenover. Een mod heeft dezelfde toegang tot de machine als Claude Code, copilot workflow run toont geen bevestigingsvraag en de besturing van desktopapps kan handelingen uitvoeren op aangemelde accounts. De twee leveranciers reageren daarop door desktopbesturing standaard uit te schakelen, mods vóór installatie te controleren (claude plugin validate) en bedrijfsregels voorrang te geven.

AI vereist ook nieuwe filters voor degenen die de gegenereerde resultaten ontvangen. GitHub structureert en begrenst de besloten melding van kwetsbaarheden omdat door AI gegenereerde rapporten maintainers overspoelen; Google DeepMind stelt voor om door AI ontworpen eiwitten van een watermerk te voorzien, zodat aanbieders van DNA-synthese weten waar een onbekende sequentie vandaan komt. In beide gevallen is het doel om het gebruik van AI zichtbaar te maken, zonder het te verbieden: aan de ene kant een selectievakje om AI-hulp aan te geven, aan de andere kant een verifieerbare handtekening.

Bij bedrijven wordt de adoptie inmiddels gemeten aan de hand van concrete toepassingen. Barclays streeft ernaar dat eind 2026 50 % van zijn ontwikkelaars Claude Code gebruikt en laat dagelijks 120 000 e-mails sorteren, American Express maakt van zijn Business-kaart een toegangspoort tot de Skills van Perplexity Computer, met gratis credits als stimulans, en Anthropic gebruikt zijn gebruikslimieten als prikkel door gedurende twee weken het verbruik voor werk dat volgt op het maken van een artefact te halveren. Voor het grote publiek krijgen assistenten een plaats in concrete handelingen: een menu voorlezen aan een blinde persoon, een kledingstuk passen voordat je het koopt, een beursgrafiek tekenen in het gesprek.

Tot slot moeten de cijfers over modellen worden gelezen met hun meetprotocol in gedachten. Ai2 verduidelijkt dat zijn meting bij 1 200 miljard parameters het systeem beoordeelt en geen getraind model, Cloudflare kiest zijn benchmarks en erkent dat Jev voorop blijft op When2Call en BRIGHT, en de videoranglijst van Artificial Analysis zet Wan 3.0 bovenaan met overlappende betrouwbaarheidsintervallen. FLUX 3 Image volgt een inmiddels gangbaar pad: commerciële gewichten meteen onder licentie, open gewichten later, zonder datum.


Bronnen