ai-powered-markdown-translatorArtikel översatt från fr till sv med gpt-6.1-sol.
Torsdagen den 1 oktober lanserar Anthropic mods, små TypeScript-funktioner som kopplas till händelser i Claude Code för att skriva om dess beteende och gränssnitt, och som levereras med version 2.1.287. Samma dag gör GitHub två agentfunktioner tillgängliga i en publik förhandsversion i Copilot CLI och GitHub Copilot-appen: styrning av skrivbordsappar och dynamiska workflows, orkestreringar skrivna i kod. Black Forest Labs lanserar FLUX 3 Image, som komponerar med begränsningsrutor och genererar upp till 4K; Google rullar ut Guided Vision i Gemini Live, Barclays inför Claude i hela banken och GitHub skärper rapporteringen av sårbarheter för att hantera AI-genererade rapporter.
Claude Code öppnar för mods, TypeScript-funktioner som skriver om dess beteende och gränssnitt
1 oktober — Anthropic lanserar mods, små TypeScript-funktioner som ändrar hur Claude Code fungerar. Varje åtgärd i verktyget skickar ut en händelse (verktygsanrop, begäran om behörighet, inskickad prompt, början och slutet av en omgång, rendering av en del av skärmen), och en mod kopplas in före, efter, i stället för eller runt åtgärden. Den kan skriva om en prompt innan den når modellen, blockera, skriva om eller köra ett verktygsanrop igen, godkänna eller neka en behörighet, dölja hemligheter i ett verktygs utdata innan Claude läser dem eller lägga till egna paneler, knappar och inmatningsfält. Mods levereras i plugins, installeras med /plugin och delas på samma sätt som plugins; de kommer med Claude Code 2.1.287 och är aktiverade som standard. Man behöver inte känna till API:et för att komma igång: man kan be Claude Code att skriva en mod, så skapar det TypeScript-koden, installerar den och laddar om den utan omstart i sessionen.
Skillnaden mot befintliga hooks är tydlig. En inställningshook (settings hook) kör ett shell-kommando vid varje händelse; en mod laddas en gång och finns kvar i sessionen, så den behåller ett tillstånd, ritar om gränssnittet efter hand som händelser inträffar och kan registrera slash-kommandon eller verktyg som modellen anropar. Anthropic använder redan detta för sina egna funktioner: panelen /diff och stödet för AGENTS.md har blivit inbyggda mods som kan inaktiveras eller ersättas, och leverantören planerar att omvandla fler med tiden så att Claude Code kan reduceras till en liten kärna. Bland de sex inbyggda mods som dokumentationen listar finns You should know, inaktiverad som standard, där en sekundär agent uppmärksammar sådant som användaren eller Claude kan missa.
| Aspekt av mods | Officiell information |
|---|---|
| Lägsta version | Claude Code 2.1.287, mods aktiverade som standard |
| Gränssnitt med visning | CLI i terminalen, fliken Code i Claude Desktop (utom WSL-sessioner) |
| Gränssnitt utan visning | VS Code-tillägget, claude -p, Agent SDK och molnsessioner, där hooks körs |
| Inbyggda mods | 6, däribland /diff, AGENTS.md, sec-default och You should know |
| Egen körtid för en hook | 10 sekunder per utlösning |
| Inaktivering | /plugin för en mod, --safe-mode för en session, disableAllHooks för alla |
Addy Osmanis kom igång-guide på claude.dev bygger Token Weather, en mod på cirka 80 rader som visar kontextens ”väder” ovanför prompten, med ett minidiagram över de 12 senaste omgångarna. Den presenterar också Blast Radius, som håller tillbaka en rm -rf, en git reset --hard eller en forcerad push tills den har visat vad åtgärden skulle påverka, och Replay Theater, som spelar upp filändringarna från en omgång igen.
Tillit är fortfarande den känsliga punkten. Inlägget varnar för att mods inte är isolerade: de har samma åtkomst till datorn som Claude Code, och dokumentationen klargör att en mod kan läsa miljövariabler och inställningsfiler, se varje prompt, godkänna ett verktygsanrop eller förbruka abonnemangets användningsutrymme, men inte ändra behörighetsprompten. Guiden på claude.dev beskriver dock en modul som körs i en egen sandbox, utan DOM eller Node, där varje extern åtgärd går via API:et $: det är detta som gör att claude plugin validate före installationen kan lista vilka händelser en mod fångar upp och vilka anrop den gör. På Team och Enterprise, och på alla datorer med centralt hanterade inställningar, laddas den inbyggda modden sec-default först och hindrar användarinstallerade mods från att kringgå nekanderegler; administratörer kan placera sina egna mods före den.
Mods are absolutely insane. You can now customize Claude to work and look the way you want by just prompting it. Each person works differently, so there’s no reason why everyone should have an identical Claude experience. Make Claude your own, and share mods as plugins so others can try your mods too.
🇸🇪 Mods är helt galna. Nu kan du anpassa Claude så att det arbetar och visas precis som du vill, bara genom att be om det. Alla arbetar på olika sätt, så det finns ingen anledning till att alla ska ha samma Claude-upplevelse. Gör Claude till ditt eget och dela dina mods som plugins så att andra kan prova dem. — @bcherny på X
Lanseringen var väntad: Boris Cherny hade annonserat den den 14 september, och Anthropic hade delat utformningen på GitHub (issue #91870). Inlägget och guiden på claude.dev uppmuntrar användarna att skicka in sina mods till Claude-katalogen.
🔗 Anpassa Claude Code med mods i TypeScript · Kom igång-guide på claude.dev · Dokumentation för mods
Claude Code 2.1.287: kontext på 1M som standard hos molnleverantörer och 67 korrigeringar
1 oktober — Claude Code 2.1.287 är versionen som levererar mods, men den innehåller 106 poster, varav 67 korrigeringar. För företag på Bedrock, Vertex, Foundry och gatewayen för Claude apps använder Opus 4.7 och senare versioner samt Fable nu ett kontextfönster på 1M som standard, utan suffixet [1m]; CLAUDE_CODE_DISABLE_1M_CONTEXT=1 gör det möjligt att stanna på 200K. /advisor accepterar Sonnet 5.5 som rådgivare åt Opus 4.7 och 4.8, ett automatiskt modellbyte behåller den aktuella ansträngningsnivån, och MCP-servrar med protokollet 2025-11-25 kan öppna URL-prompter. En farlig rm behåller sin bekräftelse även när kommandot omdirigerar sina utdata till ~ eller ett jokertecken, väntande behörighetsprompter visas från den äldsta till den nyaste, och nio poster förbättrar skärmläsarläget. I VS Code kan ett pågående kommando eller en underagent flyttas till bakgrunden (Run in background).
🔗 Versionsinformation för Claude Code 2.1.287
GitHub Copilot: styrning av skrivbordsappar och dynamiska workflows i publik förhandsversion
1 oktober — Samma dag gör GitHub två agentfunktioner tillgängliga i en publik förhandsversion i Copilot CLI och GitHub Copilot-appen: styrning av skrivbordsappar och dynamiska workflows, som också erbjuds i GitHub Copilot SDK.
Copilot styr skrivbordsappar. Datorstyrning (computer use) kommer till macOS och Windows. Copilot läser en fönstervys tillgängliga innehåll och visuella kontext via systemets tillgänglighetsträd eller skärmbilder när det behövs, klickar på kontroller, skriver text, trycker på tangenter, rullar, drar och släpper och utför steg över flera appar; demonstrationen visar hur det fyller i en utläggsrapport i Safari. GitHub riktar sig till äldre eller helt grafiska program utan API, kommandoradsgränssnitt eller MCP-integration, och dokumentationen rekommenderar dessa alternativ när de finns eftersom de ger mer förutsägbara resultat. Funktionen är inaktiverad som standard: /computer on aktiverar den i CLI, /computer show visar dess status och /computer off stänger av den, medan appen erbjuder den i sina inställningar. Copilot begär tillstånd innan det styr varje app: man kan ge det för sessionen, spara det för kommande sessioner eller neka det. Ett permanent godkännande (Always allow) gäller för CLI och appen på samma dator, men en nekanderegel har alltid företräde, och två tryck på Escape i CLI eller knappen Stop i appen avbryter en åtgärd som går fel. En organisations centralt hanterade inställningar kan inaktivera funktionen, och en lokal aktivering kan inte åsidosätta detta. GitHub varnar för att en tvetydig instruktion eller oväntat innehåll på skärmen kan orsaka oavsiktliga åtgärder på inloggade konton, även finansiella, och avråder från permanent godkännande för känsliga appar. Varken vilka abonnemang som omfattas eller några siffror anges; kommandot /computer fanns redan i versionsinformationen för Copilot CLI 1.0.85 den 16 september.
🔗 GitHub Copilot kan nu interagera med skrivbordsappar med computer use
Orkestreringar skrivna i kod. Dynamiska workflows (dynamic workflows), som är tillgängliga i alla Copilot-abonnemang, beskriver i ett program hur en uppgift ska genomföras: koden bestämmer stegen, när en agent ska ingripa och hur dess resultat ska användas, i sekvens, parallellt eller både och, medan agenterna hanterar sådant som kräver analys eller omdöme. Ett workflow kan köra kommandon, dela upp ett mål i parallella uppgifter, överföra strukturerade resultat från ett steg till nästa, låta en underagent verifiera en annans slutsatser och stanna vid en kontrollpunkt (checkpoint) för granskning innan det fortsätter. GitHub nämner utredning av en incident, parallell granskning av filerna i en pull request eller granskningskommentarer som bedöms av två modeller och bara lyfts fram om båda är överens.
| Copilot-läge | Vem som organiserar arbetet enligt dokumentationen |
|---|---|
| Autopilot | Copilot, som går vidare utan att begära godkännande efter varje steg |
/fleet | Copilot, som varje gång delar upp uppgiften mellan parallella underagenter |
| Dynamiskt workflow | Koden som författaren skriver: steg, villkor och överlämningar |
Programmet finns i ett tillägg till Copilot CLI och appen. Ett workflow som Copilot skriver är begränsat till sessionen, men kan återanvändas genom att tillägget kopieras till användarens hemkatalog, delas via ett repos katalog eller paketeras som en plugin. Underagenterna ärver sessionens behörigheter, medan kommandot copilot workflow run inte visar någon prompt: behörigheterna måste ges före start. Workflows är tillgängliga utan särskilda inställningar i appen, men i CLI måste de experimentella funktionerna aktiveras (--experimental eller /experimental on). GitHub publicerar varken siffror eller faktureringsregler, och namnet påminner, utan någon annonserad koppling, om Dynamic Workflows som Anthropic lanserade i Claude Code den 28 maj.
🔗 Dynamiska workflows i Copilot CLI och Copilot-appen
FLUX 3 Image: Black Forest Labs komponerar med begränsningsrutor och genererar upp till 4K
1 oktober — Black Forest Labs (BFL) lägger till en bildmodell i sin FLUX 3-familj, med ett ledord: kontrollera varje pixel. FLUX 3 Image retuscherar ett område i flera på varandra följande steg utan att ändra resten av bilden och accepterar flera ändringar i samma begäran.
Den mest synliga nyheten är komposition med begränsningsrutor (bounding boxes). Oavsett format blir bilden ett koordinatsystem från 0 till 1000 på varje axel: man ritar en ruta för varje element, beskriver dess innehåll och sammanfattar sedan scenen på en rad, så placerar modellen varje element i sin ruta; det går fortfarande att använda enbart en textprompt. FLUX 3 Image kombinerar också upp till 10 referensbilder, som anges med tokens i prompten och vars placering och storlek modellen bestämmer själv. BFL presenterar den som ”utformad för agenter”: en LLM kan skriva tabellen över elementen och deras rutor utifrån en enkel begäran, som användaren sedan justerar innan genereringen startas.
| Annonserad egenskap | Information från BFL |
|---|---|
| Nativ upplösning | 2K och 4K (exempel från modellsidan: 5456 × 3072 pixels, 16,8 MP) |
| Referensbilder | Upp till 10 |
| Komposition | Begränsningsrutor på ett rutnät från 0 till 1000 per axel |
| Redigering | Flera omgångar, utan att ändra övriga pixlar |
| API-erbjudande | 50 % rabatt till den 8 oktober |
| Modellvikter | Kommersiella under licens; öppna vikter ”under de kommande veckorna” |
När det gäller åtkomst är FLUX 3 Image tillgänglig via API med 50 % rabatt till den 8 oktober, och BFL erbjuder kommersiella vikter under licens till företag som vill finjustera och driftsätta den på sin egen infrastruktur. Versionen med öppna vikter är annonserad utan datum. Varken något grundpris eller några benchmarkresultat med siffror hade publicerats vid tillkännagivandet. Modellen kompletterar en serie som lanserades i somras: FLUX 3, en enhetlig multimodal modell (23 juli), FLUX 3 Video (4 augusti), dess redigeringsläge (10 september) och FLUX 3 Action för robotik (23 september).
🔗 Tillkännagivande av FLUX 3 Image från @bfl_ai · Modellsidan för FLUX 3 Image
Konsumentassistenter: Guided Vision i Gemini Live, virtuell provning i ChatGPT, diagram i Perplexity Computer, lättade begränsningar för Claudes artefakter
Guided Vision: Gemini Live vägleder blinda och personer med synnedsättning
1 oktober — Google lanserar Guided Vision i Gemini Live på Android 9 och senare versioner, i de regioner och på de språk där Gemini Live är tillgängligt. Funktionen har utformats tillsammans med blinda och personer med synnedsättning och beskriver i realtid det som den delade kameran filmar, svarar på följdfrågor och ger muntliga instruktioner för att justera bildutsnittet: vrid långsamt åt höger, vinkla nedåt, backa. Google nämner att läsa en näringsdeklaration eller en meny i en mörk restaurang, hitta en tappad hörlur eller beskriva färgerna på ett plagg. För träningen samarbetade Google med Aira, en tjänst för visuell tolkning: tiotusentals timmar med data, över 1 000 testare från tjänstens nätverk och specialister involverade i skyddsåtgärderna. Guided Vision aktiveras via profilen i Gemini-appen, en tillgänglighetsgenväg i Android eller via TalkBack. Google betonar att funktionen varken är en medicinteknisk produkt eller ett förflyttningshjälpmedel: den ersätter inte den vita käppen.
🔗 Guided Vision i Gemini Live (Googles blogg)
ChatGPT: virtuell provning och favoriter för shopping
1 oktober — Enligt versionsinformationen för ChatGPT visas en knapp för provning (Try on) på produktkorten för kläder och accessoarer: man tar eller laddar upp en selfie, och ChatGPT Images genererar en virtuell provning av varan. Referensfotot sparas för kommande provningar och kan ersättas eller raderas i inställningarna, under referensfoton (Settings → Personalization → Reference photos). Alla produkter kan också sparas som favoriter eller placeras i en mapp i ChatGPT-biblioteket. Båda funktionerna är tillgängliga på mobil och webb, men informationen anger varken vilka abonnemang eller länder som omfattas. ChatGPT erbjöd redan visuell shopping sedan den 24 mars.
🔗 Versionsinformation för ChatGPT
Perplexity Computer ritar interaktiva diagram
1 oktober — Perplexity Computer skapar nu interaktiva diagram och visualiseringar direkt i konversationen. För finansiella data använder agenten Lightweight Charts från TradingView för att visa candlesticks, volym och glidande medelvärden. Tillkännagivandet består av en tweet med en video: det anger varken vilka abonnemang som får tillgång eller på vilka plattformar, och ingen post i changeloggen beskriver ännu funktionen närmare. ChatGPT och Claude tog detta steg den 10 respektive 12 mars, Replit Agent den 25 september.
🔗 Tillkännagivande från @perplexity_ai på X
Claude halverar kvotförbrukningen efter en artefakt fram till den 15 oktober
1 oktober — Från den 1 oktober kl. 11 PT till den 15 oktober kl. 23.59 PT gör skapandet eller redigeringen av en artefakt (dokument, presentation eller design) i Claude eller Claude Cowork att det efterföljande arbetet förbrukar 50 % mindre av sessionskvoten på fem timmar. Erbjudandet gäller automatiskt för abonnemangen Pro, Max och Team; Free och Enterprise-abonnemang omfattas inte, och veckogränsen ändras inte.
| Berört användningsområde | Omfattning av minskningen på 50 % |
|---|---|
| Konversation som startas från menyn Output | Från det första meddelandet: 10 meddelanden, 15 steg per svar |
| Vanlig konversation | De 10 meddelandena efter att artefakten skapats, 15 steg per svar |
| Cowork-uppgift i molnet som startas från Output | Ungefär de första 45 minuterna |
| Annan Cowork-uppgift i molnet | Upp till 80 steg efter att en artefakt skapats eller redigerats |
Claude Code, API:et, Claude i Slack, lokala eller schemalagda Cowork-uppgifter, användningskrediter och den fristående appen Claude Design omfattas inte. Anthropic föreslår att man provar med Sonnet 5.5 och förbehåller sig rätten att ändra eller avsluta erbjudandet i förtid.
🔗 Tillkännagivande från @claudeai på X · Villkor för erbjudandet (Claudes hjälpcenter)
Finans: Barclays inför Claude i hela banken, American Express ger sina Business-kunder tillgång till Perplexity Computer
Barclays siktar på att hälften av utvecklarna använder Claude Code i slutet av 2026
1 oktober — Barclays, den brittiska universalbanken, utökar sitt samarbete med Anthropic och inför Claude i hela organisationen för att påskynda mjukvaruutvecklingen, modernisera äldre system och förbättra den operativa effektiviteten. Banken planerar att 50 % av utvecklarna ska använda Claude Code i slutet av 2026 och därefter en majoritet av mjukvaruingenjörerna under 2027. Två användningsområden har redan kvantifierats. Colleague Knowledge Assistant, som har varit i drift sedan 2025 och bygger på Claude med en arkitektur för retrieval-augmented generation (RAG), har tagits i bruk av över 16 000 kollegor och hanterat över en miljon sökningar; den hjälper teamen som betjänar över 20 miljoner privatkunder i Storbritannien. Inom Global Markets klassificerar, berikar och dirigerar Claude-modellerna omkring 120 000 e-postmeddelanden per dag. Paul Smith, kommersiell chef på Anthropic, ser detta som en viktig milstolpe för företaget i Storbritannien; varken kontraktsbelopp eller avtalstid offentliggörs.
🔗 Barclays skalar upp Claude för att förbättra verksamheten och kundupplevelsen
Perplexity och American Express: tio verksamhetsanpassade Skills i Computer för Business-kort
1 oktober — Perplexity lanserar en samling färdiga Skills för Perplexity Computer, reserverad för amerikanska innehavare av ett American Express Business-kort som prenumererar på Perplexity Enterprise. Företagsledaren väljer en uppgift och preciserar den i ett formulär i stället för att skriva en förfrågan. De tio Skills omfattar likviditetsprognoser, förberedelser inför deklaration, leverantörsjämförelser, budgetscenarier, avstämning, marknadsföringskampanjer, efterfrågeprognoser, avkastning på annonsutgifter per kanal (ROAS), uppföljning av verksamheten och rekrytering. Kortet kopplas via Plaid från Personal CFO, och varje körning förbrukar Computer-krediter utifrån uppgiftens komplexitet. Partnersidan erbjuder dessutom, fram till den 29 mars 2027, en engångskreditering på 125 dollar vid köp för minst 325 dollar av ett Enterprise Pro- eller Enterprise Max-abonnemang, samt 1 000 Computer-krediter utan kostnad en gång per konto. Corporate-kort omfattas inte, och resultaten utgör inte finansiell, skattemässig, juridisk eller redovisningsmässig rådgivning.
🔗 Inlägg från Perplexity · American Express partnersida
Generativ video och avatarer: Wan 3.0 toppar Artificial Analysis, Project Continuum från Runway, Sessions från Synthesia
Wan 3.0 tar ledningen i Artificial Analysis nya videorankning
1 oktober — Alibaba uppger att Wan 3.0 har förstaplatsen i Artificial Analysis nya rankning för text till video, AA-Video-T2V v2.0, som lanserades den 30 september med en ny metodik: varje modell bedöms i 1080p med en uppsättning prompts som förnyas regelbundet, och ljudsynkroniseringen räknas in i poängen. Det är jämnt mellan de tre främsta, med överlappande konfidensintervall.
| Rankad modell | Elo-poäng | Placeringsintervall | Pris via API |
|---|---|---|---|
| Wan 3.0 | 1157 (±9) | 1 till 2 | 12,00 dollar per minut |
| Utopai X (byggd på MiniMax H3) | 1150 (±10) | 1 till 3 | Inget offentligt API |
| Dreamina Seedance 2.5 | 1144 (±9) | 2 till 4 | 34,12 dollar per minut |
| MiniMax H3 (768p) | 1139 (±9) | 3 till 5 | 4,80 dollar per minut |
Rankningens överraskning är Utopai X, som lanserades den 30 september av Utopai Studios, en film- och tv-studio byggd kring AI från början. Modellen har eftertränats på MiniMax H3 och är bara tillgänglig i studions PAI-plattform (93 krediter per sekund video, abonnemang från 15 dollar per månad), och den placerar sig före själva MiniMax H3.
🔗 Tillkännagivande från @Alibaba_Wan på X · Rankningen AA-Video-T2V v2.0 · Utopai X enligt @ArtificialAnlys
Runway Labs presenterar Project Continuum, gränssnitt som genereras som video i realtid
1 oktober — Runway Labs, Runways enhet för utforskande projekt, visar Project Continuum, en forskningsapplikation som föreställer sig ett operativsystem vars gränssnitt genereras som video i realtid, i samma riktning som Solaris, världsmodellen för gränssnitt som presenterades den 31 augusti. Denna första förhandsvisning beskriver fyra sätt att interagera med datorn. Med Portals genererar en videomodell animerade och interaktiva överlägg under navigeringen, med suddiga kanter för att markera genererat innehåll. Responsiva videogränssnitt (Responsive Video Interfaces) anpassar sin komposition när storleken ändras och reagerar på klick. Interactive Worlds förvandlar medieinnehåll till en interaktiv simulering, för både människor och agenter. Visual Thinking är slutligen en harness för kodagenter: en videomodell i realtid visualiserar varje steg och varje verktygsanrop för att hålla användaren delaktig. Runway anger varken tillgång, datum, pris eller underliggande modell.
Synthesia lanserar Sessions, avatarer som ger träning och ställer frågor
1 oktober — Synthesia lanserar Sessions, en produktfamilj byggd på företagets interaktiva avatarer: ett videosamtal där samtalspartnern är en avatar som ställer frågor, lyssnar, säger emot och sammanfattar. Roleplay Sessions används för träning: avataren spelar en kund, en potentiell kund eller en medarbetare, en AI-coach kommenterar varje försök och cheferna följer poäng och framsteg i en kontrollpanel. Survey Sessions förvandlar frågeformuläret till en intervju: avataren intervjuar hundratals personer parallellt, ställer följdfrågor utifrån svaren och levererar sedan en rapport om teman och sentiment, medan varje svar förblir tillgängligt som transkription, ljud eller CSV. En kostnadsfri provperiod erbjuds, utan detaljerade prisuppgifter. Sessions bygger på Interactive Avatar API, som blev allmänt tillgängligt den 16 september, och Synthesia utlovar fler varianter.
🔗 Tillkännagivande från @synthesiaIO på X · Sidan för Synthesia Sessions
AI och vetenskap: SynthID Bio vattenmärker proteiner, Matthew Schwartz beskriver vetenskap « i Claudes form »
SynthID Bio: Google DeepMind vattenmärker proteiner som utformats av AI
30 september — Google DeepMind presenterar SynthID Bio, en familj av metoder för digital vattenmärkning (watermarking) av biologiska skapelser genererade av AI, som uppmärksammades på X den 1 oktober. Inlägget beskriver metoderna som ett koncepttest: en omärkbar signatur skrivs in i den biologiska koden och kan verifieras både i den digitala modellen och i det syntetiserade proteinet. För sekvenser styr metoden diskret valet av aminosyror; för 3D-strukturer finjusteras en liten del av diffusionsnätverket i AlphaFold 3. I laboratoriet, för tre mål (VEGF-A, RBD-domänen i spikeproteinet hos SARS-CoV-2 och PD-L1), matchade de vattenmärkta bindarna de vanliga versionerna i framgångsgrad, affinitet och sekvensmångfald. Syftet är biosäkerhet: en automatisk signal skulle hjälpa leverantörer av DNA-syntes att kontrollera ursprunget för en okänd sekvens. Google DeepMind publicerar sin metodartikel, koden, in vitro-data och modellvikterna för forskning; tillsammans med Hie lab vid Stanford och Arc Institute utvidgas metoden redan till genomet hos en bakteriofag utformad av Evo 2. Robusthet mot avsiktlig förändring är fortfarande det viktigaste arbetsområdet.
🔗 Inlägg från Google DeepMind om SynthID Bio
Vetenskap « i Claudes form »: Matthew Schwartz gästinlägg
1 oktober — Bloggen Anthropic Science publicerar ett gästinlägg av Matthew Schwartz, fysiker vid Harvard, som uppger att han arbetar som gästforskare hos Anthropic. Där beskriver han en « impedansmissanpassning » mellan forskare och AI: att arbeta med en modell som med en mänsklig kollega tar inte vara på dess fulla förmåga, och det är bättre att söka problem « i Claudes form », där en känd teknik från matematik, fysik eller datavetenskap i ett slag löser en fråga inom ett annat område. Ur detta utvecklade han BootLoops, en open source-harness för exakta beräkningar som kan användas med vilken modell som helst; BootLoops är inget Anthropic-projekt, utan underhålls av Schwartz. Inom fysik har 30 integraler behandlats från början till slut, varav 15 aldrig tidigare beräknats; inom ekologi förändras träden på Barro Colorado Island 4,5 gånger snabbare än vad den neutrala teorin tillåter; inom lingvistik omfattar databasen AccStack lexikal betoning i 6 072 språk. Resultatet: 36 manuskript inom 18 områden med 19 medförfattare på tre månader. Schwartz nämner också begränsningarna: Claude saknar tidsuppfattning, gillar att « utropa seger », och resultaten utanför fysiken förblev föga intressanta innan en expert styrde dem i en annan riktning.
🔗 Vetenskap i Claudes form (bloggen Anthropic Science)
Öppna modeller och träning: Olmo-core 3 från Ai2, Clef och Clef-flash från Cloudflare, RL med flera harness från FineEnvs
Olmo-core 3: Ai2 öppnar en träningsstack för MoE som siktar på över tusen miljarder parametrar
1 oktober — Ai2 publicerar Olmo-core 3, en ny version av det framework som tränar företagets Olmo-modeller, ombyggt kring ett helt öppet träningssystem med en blandning av experter (mixture-of-experts, MoE). Det är ett av systemen för nästa generation av Olmo, som ska gå över till MoE och enligt Ai2 bli den mest kapabla Olmo-generationen. Den gamla implementationen, som byggde på FSDP, samlade in och delade sedan upp vikterna på nytt för varje batch; Olmo-core 3 går över till DDP, håller experterna på deras GPU och skickar data till dem.
| Mätning publicerad av Ai2 | Uppmätt värde |
|---|---|
| MoE med 47 miljarder parametrar på åtta B300, preliminärt test | 52 000 mot 19 400 tokens/s per GPU, cirka 2,7 gånger |
| MXFP8 jämfört med BF16, på fyra B300 | Cirka 21 % högre genomströmning |
| Modell med 1 200 miljarder parametrar på 512 GPU | Som mest 858 TFLOP/s per GPU, slumpmässig routning |
Ai2 förtydligar att mätningen med 1 200 miljarder parametrar bedömer systemet, inte kvaliteten på en tränad modell. Kod (version 3.0.0), teknisk rapport och interaktiv demonstration har publicerats.
🔗 Inlägg från Ai2 om Olmo-core 3 · Utgåva Olmo-core v3.0.0
Clef och Clef-flash: Cloudflare släpper två öppna beslutsmodeller som är kompatibla med Jev
1 oktober — Cloudflares Workers AI-team släpper Clef och Clef-flash, sina första internt tränade modeller, inom det område som Jev, Typesafe AI:s System One-modell, banat väg för: de tar emot ett tillstånd (text, JSON, bild eller video) och ett schema med typade frågor och returnerar sedan i en enda körning en sannolikhet för varje tillåtet alternativ. Clef är eftertränad utifrån Qwen3.8-27B, medan Clef-flash bygger på Qwen3.5-9B. De körs på Workers AI med ett API som är kompatibelt med Jevs och publiceras enligt blogginlägget på Hugging Face under licensen Apache 2.0, med ett kontextfönster på 64k tokens jämfört med 32k för Jev. Siffrorna, som Cloudflare valt ut, ger en blandad bild:
| Benchmark och mätvärde | Resultat för Clef | Resultat för Clef-flash | Resultat för Jev |
|---|---|---|---|
| BFCL, exakta träffar | 98,47 | 98,76 | 95,75 |
| BANKING77, macro-F1 | 94,20 | 90,93 | 79,74 |
| When2Call, träffsäkerhet | 72,37 | 65,58 | 80,97 |
| BRIGHT, nDCG@10 | 45,91 | 39,26 | 47,52 |
| Medianlatens | 209,3 ms | 38,8 ms | 524,1 ms |
Cloudflare hävdar att Clef leder Jev Decision Index, en plats som Liquid AI gjorde anspråk på för d1 två dagar tidigare, och lanserar en tjänst för att finjustera Clef med förstärkningsinlärning på kundens data.
🔗 Cloudflares blogginlägg om Clef · Clef på Hugging Face
FineEnvs tränar en modell med förstärkningsinlärning i fyra agentramverk samtidigt
1 oktober — Samma modell beter sig olika beroende på vilket agentramverk som styr den: vikterna i Liquid AI:s LFM2.5-2.6B klarar 62 % av uppgifterna i Mini-SWE-Agent men 33 % i Claude Code. Organisationen FineEnvs publicerar på Hugging Face en guide till hur man tränar en modell med förstärkningsinlärning direkt i utvecklarnas agentramverk, utan att ändra ramverkens kod. En proxy för datainsamling som lagts till i OpenEnv presenterar sig för ramverket som en modellleverantör (OpenAI-, Anthropic- eller Gemini-format) och registrerar de exakta tokens och sannolikheter som vLLM producerar; Harbor tillhandahåller uppgifter och sandboxmiljöer, medan TRL tränar med asynkron GRPO. När LFM2.5-2.6B tränas i fyra ramverk samtidigt ökar genomsnittsresultatet från 42 % till 54 %, och en liten bonus för resurssnåla lösningar minskar dess verktygsanrop med 31 % på uppgifter som redan har lösts. Att imitera en större modell räcker inte: övervakad finjustering på 3 189 rollouts från Qwen3.8-27B når som mest 47,5 %. Proxy, tränare, uppgifter, data och tränade modeller publiceras.
🔗 Den ultimata guiden till RL i flera agentramverk
Grok 4.7 som förhandsversion på Google Clouds agentplattform
1 oktober — SpaceXAI meddelar att Grok 4.7 finns tillgänglig på Gemini Enterprise Agent Platform, Google Clouds agentplattform. Modellkortet, daterat den 30 september, anger att den är en förhandsversion med identifieraren grok-4.7 och beskriver den som en modell från xAI avsedd för kod och kunskapsarbete, som arbetar längre med svåra uppgifter och kontrollerar sitt eget arbete. Den accepterar text och bilder som indata och returnerar endast text; funktionsanrop, strukturerad utdata och resonemang stöds, men inte batchprediktioner.
| Uppgift publicerad av Google Cloud | Värde för Grok 4.7 |
|---|---|
| Kontextlängd | 524 288 tokens |
| Kvoter per minut | 13 förfrågningar, 188 000 tokens i indata och 16 000 tokens i utdata |
| Användningsformer | Endast fast kvot, varken betalning efter användning eller provisionerad genomströmning |
| Tjänsteregioner | Multiregion i USA och global endpoint |
| Pris per miljon tokens | 2 dollar för indata, 6 för utdata, 0,50 för cache under 200 000 tokens i indata, det dubbla däröver |
Prislistan motsvarar den för xAI:s API. Grok 4.7 lanserades den 21 september och blev tillgänglig på Amazon Bedrock den 28 september, medan Grok 4.6 hade kommit till samma plattform hos Google den 21 augusti.
🔗 Modellkort för Grok 4.7 på Google Cloud · Meddelande från @SpaceXAI på X
GitHub stramar åt privat sårbarhetsrapportering till följd av AI-genererade rapporter
1 oktober — GitHub publicerar under samma minut två åtgärder för privat sårbarhetsrapportering (private vulnerability reporting), med ett gemensamt konstaterande: underhållare av open source får allt fler automatiserade eller AI-genererade rapporter av låg kvalitet som dränker de betydelsefulla rapporterna.
A single free-text box made it easy to submit low-quality or AI-generated reports and hard for you to find the signal in them.
🇸🇪 Ett enkelt fritextfält gjorde det lättare att skicka rapporter av låg kvalitet eller AI-genererade rapporter och gjorde det svårt för dig att urskilja det väsentliga. — GitHub Changelog, Strukturerade formulär för privata sårbarhetsrapporter
Ett strukturerat formulär. Som standard måste rapportören fylla i fyra obligatoriska fält: en sammanfattning, detaljer, ett proof of concept på minst 150 tecken och påverkan. Dessa sammanfogas i beskrivningen av säkerhetsmeddelandet, som underhållaren granskar som tidigare. Varje repo kan anpassa formuläret med en .github/VULNERABILITY_REPORT.yml-fil, eller tillämpa det på organisationens alla repon via organisationens .github-repo; underhållare kan kräva en CWE-kategori, något som en organisation eller ett företag kan göra obligatoriskt genom en policy. En kryssruta låter rapportören ange att AI har hjälpt till att hitta sårbarheten eller skriva rapporten. För REST-API:t gäller även anpassade formulär, men inte standardformuläret, för att inte bryta befintliga integrationer.
En daglig gräns. Antalet nya rapporter som samma konto kan skicka varje dag är nu begränsat, både till ett enskilt repo och över hela GitHub; kommentarer i befintliga säkerhetsmeddelanden omfattas inte. Administratörer kan ange sin egen gräns och undanta betrodda rapportörer, och GitHub anger ingen siffra för standardgränsen. Båda åtgärderna gäller publika repon där privat rapportering är aktiverad, på GitHub Free, Pro, Team och Enterprise Cloud.
🔗 Frekvensgränser för privata sårbarhetsrapporter
Kodagenter: Codex CLI 0.160.0, Delta 0.18 och Antigravity 2.19.1
Codex CLI 0.160.0: historik i kommandocentralen och sessioner utanför projekt
1 oktober — OpenAI släpper Codex CLI 0.160.0, den första stabila versionen sedan föregående dags 0.159.3, med 55 listade PR:er sedan 0.159.0. Agenternas kommandocentral (agent command center) får en funktion för att visa äldre uppgifter (Show more), som kan användas med tangentbordet. Sessioner kan starta utanför ett projekt, med arbetsytans standardinställningar när organisationens policy tillåter det, och sparade behörigheter återställs när sessionen återupptas. Godkännandegranskningen Guardian får två valfria funktioner: att hitta instruktioner som användaren gett tidigare och att ta med kontext från överlämningar mellan agenter. I helskärmsläge gör lokala Linux X11-terminaler det möjligt att markera transkriptionen och klistra in med ett klick på mittenknappen. Bland korrigeringarna återupptas köade meddelanden efter en återanslutning utan att skickas dubbelt, och en rad korrigeringar gäller Windows sandbox och SQLite-låsningar vid initiering.
Delta 0.18: trådar körs i befintliga Git-worktrees och en CLI tillkommer
30 september — Zed släpper version 0.18.0 av Delta, sin fleranvändarmiljö för kodning med agenter: 23 nyheter, 41 förbättringar, 51 korrigeringar och en borttagen funktion. Den största nyheten hade aviserats utan lanseringsdatum den 28 september: en tråd kan nu köras i valfri befintlig Git-worktree som redan är länkad och föra över den arbetskopian till nya trådar som skapas från den. Delta kan också styras från terminalen: en CLI delta kan installeras på macOS, Windows och Linux, och kommandona delta auth hanterar det inloggade kontot. När det gäller modeller lägger versionen till Gemini-modellerna från Google AI Studio, gör GPT-6 Sol, GPT-6 Luna och Claude Opus 5.5 tillgängliga med en API-nyckel och accepterar alla OpenAI- eller Anthropic-kompatibla leverantörer i skrivbordsappen. Arbetet i trådar får en sökfunktion för alla undertrådar och bokmärken; däremot publicerar undertrådarna inte längre sina statusmeddelanden i den överordnade tråden, där endast resultaten från Land Changes visas.
🔗 Versionsinformation för Delta 0.18.0
Antigravity 2.19.1: skriv direkt till underagenter
30 september — Antigravity 2.19.1 gör det möjligt att skicka ett meddelande direkt till en underagent från inmatningsfältet, utan att gå via huvudagenten; CLI:n erbjöd redan detta med sin @-syntax sedan versionerna 1.2.8 och 1.2.9. Versionen lägger till export till PDF av renderad Markdown i artefakterna och sidopanelen, inklusive tabeller, kodblock och diagram, samt ett alternativ för att ångra som enbart gäller konversationen; bland dess fem korrigeringar finns att anpassade agenter nu respekterar både de globala reglerna och projektets regler. Utrullningen sker gradvis och kan ta några dagar. CLI:n hade den 27 september fått version 1.2.12, som gått obemärkt förbi: en session som startats med en GEMINI_API_KEY-nyckel avslutas nu omedelbart när Gemini-API:t anger att dagskvoten är förbrukad, utgiftsgränsen nådd eller de förbetalda krediterna förbrukade, i stället för att under flera minuter fortsätta med försök som är dömda att misslyckas.
🔗 Ändringslogg för Antigravity-appen · Ändringslogg för Antigravity CLI
Notiser
- Copilot CLI 1.0.90 och 1.0.91 — 1.0.90 blir stabil den 30 september med GPT-6.1 Sol i modellväljaren och korrigeringar för MCP och återupptagning av sessioner; 1.0.91, den 1 oktober, lägger till kommandona
copilot sandbox caför att hantera proxycertifikatet i sin sandbox. 🔗 källa - Codex CLI 0.159.3 — Den släpptes den 30 september klockan 22.57 UTC och innehåller bara en backport: lokala sessioner som är inloggade med ChatGPT kan visa valfria påminnelser om att slutföra konfigureringen av kontots säkerhet, en ändring som också ingår i 0.160.0. 🔗 källa
- Nightly-version av Gemini CLI — v0.64.0-nightly från den 1 oktober åtgärdar en låsning med 100 % processorbelastning i headless-läge och gör filverktygens skrivningar atomiska; den stabila versionen och förhandsversionen är oförändrade. 🔗 källa
- Zed 1.23.1 i förhandsversion — Den släpptes den 30 september och visar JSONL- och NDJSON-filer som tabeller, lägger till inställningen
agent.max_idle_retained_threadsoch försöker automatiskt igen med anrop när en Google AI-modell är överbelastad. 🔗 källa - Copilot i VS Code i september — Månadssammanfattningen av versionerna 1.136 till 1.140 tar upp några nyheter som fått mindre uppmärksamhet, däribland möjligheten att i VS Code återuppta en Codex-konversation som började i ChatGPT-appen, en appbadge i förhandsversion och chattar som öppnas utan arbetsyta. 🔗 källa
- Planera tillsammans i Delta — På Deltas blogg berättar Nathan Sobo hur tre teammedlemmar planerar i samma tråd med Fable och sedan Astra, en isolerad undertråd och en isolerad underagent, i stället för i en
plan.md-fil; ingen ny funktion tillkännages. 🔗 källa - Innate filmat av Cursor — Cursor publicerar ett kort videoporträtt av Innate, ett team på sju personer som bygger vardagsrobotar och vars medgrundare Vignesh Anand hävdar att teamet gör 50 personers arbete, utan att ange hur det använder Cursor. 🔗 källa
- Hämta historik i stället för att komprimera — David Corvoysier, utvecklare av funes, mäter med Claude Code att hämtning av den gamla sessionen via hans verktyg ger rätt svar med 8, 4 och 3 gånger färre viktade tokens än att behålla hela kontexten, på tre uppgifter som han själv har valt. 🔗 källa
- Ny översikt i GitHub — Vyn som samlar aktiva agentsessioner, issues och pull requests, med högst 12 poster per lista, blir standardvyn för alla; nyhetsflödet flyttas till fliken Feed och den gamla layouten är fortsatt tillgänglig. 🔗 källa
- API för asynkron sammanslagning — Det blir allmänt tillgängligt och den rekommenderade vägen för programmatiska sammanslagningar, i stället för den synkrona REST-endpointen och GraphQL-mutationerna; det är det enda API:t för sammanslagning som hanterar staplade pull requests. 🔗 källa
- npm-dist-tags utan token — npm:s konfigurationer för betrodd publicering kan få en valfri behörighet, avstängd som standard, att hantera dist-tags med kortlivade OIDC-autentiseringsuppgifter i stället för en långlivad åtkomsttoken. 🔗 källa
- Lagringstid för GitHub Actions — Checks, workflow-körningar och statusar, även från tredjepartsappar, följer nu inställningen för hur länge artefakter och loggar sparas och raderas när tiden löpt ut, med högst 90 dagar för publika repositorier och utan möjlighet till återställning. 🔗 källa
- Code scanning och vilande repositorier — De schemalagda veckovisa analyserna i code scanning och GitHub Code Quality startar numera först efter en analys som utlösts av en push eller pull request, så att ett vilande repositorium inte längre framstår som aktivt i ytterligare sex månader. 🔗 källa
- Kodtäckning — GitHub Code Quality-actionen
upload-code-coveragefår inte längre CI att misslyckas vid en push till en gren som ännu saknar en öppen pull request. 🔗 källa - Tillgänglighetsdeklarationer — En
ACCESSIBILITY.md-fil placerad i roten, i.github/eller idocs/lyfts fram på repositoriets startsida, på alla abonnemangsnivåer på github.com, och kommer till GitHub Enterprise Server 3.24. 🔗 källa - Actions Runner Controller 0.15.0 — Kubernetes-controllern för självhostade runners uppdaterar resurser på plats vid patchuppgraderingar, gör avstängningstiden, Kubernetes-klientens gränser och controllrarnas samtidighet konfigurerbara och gör sina anrop mindre resurskrävande. 🔗 källa
- Grok Bot tar initiativ — Användarens huvudsakliga Bot upptäcker nu arbete som den kan avlasta användaren med och erbjuder sig att sköta det; utrullningen sker under några timmar och förslagen räknas inte som användning, utan uppgifter om abonnemang eller länder. 🔗 källa
- Genspark och Azure Cosmos DB — Ett inlägg på Azure Cosmos DB-bloggen, skrivet ur Gensparks perspektiv, förklarar hur vissa bakgrundsprocesser går via globala sekundärindex för att inte längre bromsa pågående agentsessioner; inga siffror anges. 🔗 källa
- Erfarenheter med Genspark — Seulki Kang, med femton års erfarenhet av marknadsföring, säger sig ta fram en komplett uppsättning kursmaterial på 5 timmar i stället för 30 genom att koppla sina gamla dokument till SecondBrain och sedan till AI Slides; inga produktnyheter. 🔗 källa
- Albertsons och OpenAI — Detaljhandelskedjan med över 2 200 butiker utökar sitt partnerskap, från ChatGPT Enterprise för utvalda team till API:t för kundupplevelser och kampanjanalyser, och lyfter fram sitt Safeway-plugin i ChatGPT, som tillkännagavs den 5 augusti. 🔗 källa
- Det eviga komplementet — OpenAI publicerar den första essän i en serie om framtidens ekonomi, skriven av Hemanth Asirvatham och Elliott Mokski, som klargör att de uttalar sig i eget namn: merparten av maskinernas intelligens skulle kunna användas för genomförande snarare än genombrott. 🔗 källa
- Perplexity och konsulterna — En guide jämför tio AI-verktyg för konsulter, från AlphaSense till Qwilr, med priser kontrollerade i september; dess FAQ påminner om att Perplexity i gratisabonnemanget tränar sina modeller på användarnas data om användarna inte säger nej. 🔗 källa
- Luma Variants — Funktionen, som presenterades dagen innan utan detaljer, lanseras för alla Luma-användare: utifrån en godkänd statisk annons skapar den varianter i fem standardformat, från 9:16 till 16:9, och på flera språk, utan att något pris anges. 🔗 källa
- HeyGen Professional Voice Clone — Enligt sin septembersammanfattning gör HeyGen sin mest naturtrogna röstklon tillgänglig via API:t, tränad på minst 20 minuters inspelningar (1 till 10 filer), efter en privat förhandsvisning som inleddes den 9 september. 🔗 källa
- Pika och dess appar — Pika uppger att det finns över 40 appar på den nya plattformen och presenterar två av dem, Podcast Video, som låter två karaktärer debattera, och Color Grade, som färggraderar en bild eller ett klipp, utan datum eller pris. 🔗 källa
- ElevenLabs i Benelux — ElevenLabs öppnar kontor i Bryssel och Amsterdam och planerar att tredubbla personalstyrkan där; hos operatören KPN ökar igenkänningen av postnummer från 64 % till 82 % och verifieringsagenten hanterar omkring 60 000 samtal per vecka. 🔗 Nederländerna · 🔗 Belgien
- DOCA-skills från NVIDIA — På 65 verkliga prompts från utvecklare uppfyller kodagenter med dessa skills för BlueField-DPU:er 100 % av bedömningsmatrisens kriterier, jämfört med 19 % utan dem; de publiceras på GitHub. 🔗 källa
- DIN Deploy — NVIDIA publicerar open source-exempel i C++ för att köra modeller lokalt med ONNX Runtime och TensorRT RTX, på Windows och Linux; på en DGX Spark transkriberar Parakeet TDT 206 gånger snabbare än realtid på GPU:n, jämfört med 14 gånger på CPU:n. 🔗 källa
- Nemotron 3.5 ASR och saudiska dialekter — En NVIDIA-handledning finjusterar modellen på dialekterna najdi och hijazi: ordfelfrekvensen sjunker från 55,05 % till 29,96 % på 12 000 steg med två RTX PRO 6000, samtidigt som resultaten för engelska och arabiska i FLEURS till och med förbättras något. 🔗 källa
- HSTU-rekommendationssystem på Dynamo-Triton — NVIDIA serverar ett generativt HSTU-rekommendationssystem med PyTorch AOTInductor och en KV-cache: i bästa fall, på en RTX PRO 6000, upp till 4,47 och 5,93 gånger snabbare beroende på antalet lager, vilket motsvarar 0,423 och 0,678 ms per anrop. 🔗 källa
- AI-fabrikernas lönsamhet — I ett ställningstagande blogginlägg uppskattar NVIDIA kostnaden för en AI-fabrik till omkring 60 miljoner dollar per megawatt och återger data från SemiAnalysis: Vera Rubin NVL72 är upp till 45 gånger billigare per miljon tokens än GB300 NVL72 på DeepSeek V4 Pro, jämfört med 35 gånger den 24 augusti. 🔗 källa
- huggingface_hub 2.1.0 — Biblioteket startar automatiskt om misslyckade Jobs, schemalägger om dem utan att skapa dem på nytt, läser av återstående ZeroGPU-kvot och laddar ner Xet-filer via
hf_xet: en parquet-fil på 2 Go går från omkring 120 till 7 sekunder på HF Jobs; tre ändringar som bryter bakåtkompatibiliteten. 🔗 källa - ML Intern och MCP — Hugging Face kopplar MCP-datakällor till ML Intern, läget i HuggingChat som tränar modeller, för att finjustera öppna modeller på egna verksamhetsdata; inga officiella siffror följer med tillkännagivandet. 🔗 källa
- Hugging Face och Open Source for Science Fund — De två partnerna vill identifiera de bibliotek som bidragsgivare till vetenskapliga modeller är mest beroende av och stödja dem som underhåller biblioteken, utan belopp eller tidsplan. 🔗 källa
- En miljon träningskörningar med TRL — Enligt telemetrin som Quentin Gallouédec hänvisar till når Hugging Faces bibliotek för efterträning en miljon träningskörningar per månad, med ett mål på en miljon per vecka; räknemetoden har inte publicerats. 🔗 källa
- En miljon dataset på Hub — Tre författare visar att organisationskonton publicerar omkring 19 % av dataseten men står för hälften av nedladdningarna, och att USA har 390 av de 1 000 mest nedladdade dataseten. 🔗 källa
- Åtta VLM på en RTX 3090 — Aakash Gupta från ThinkEvolve visar att Qwen3-VL-8B vid samma träffsäkerhet behandlar varje anrop 2,2 gånger snabbare än Qwen3.8-27B men behöver 18,88 timmar jämfört med 7,53 för ett arbete med 7 329 anrop, eftersom den inte återanvänder prefixcachen. 🔗 källa
- GLiNER2.5-Decide mot layax — Aravind Vijayakumar lyckas inte certifiera någon konfidensgräns för Fastinos modell, jämfört med 10 försök av 10 för layax, hans eget verktyg, som är 20 till 23 procentenheter mer träffsäkert och omkring fem gånger snabbare. 🔗 källa
- David Ha och orkestrerarna — I en debattartikel för Nikkei Asia bedömer Sakana AI:s medgrundare och vd att värdet kommer att flyttas från en modells vikter till den intelligens som kombinerar flera modeller, och definierar suveränitet som leveranskedjans robusthet. 🔗 källa
- Videodiffusion på TPU — Tre Google-ingenjörer minskar tiden för brusreducering av en 1440p-video från 2 471 till 1 461 sekunder på åtta TPU v6e-chip, alltså 1,69 gånger snabbare, tack vare gles attention från Sparse VideoGen och en optimerad Splash Attention-kernel. 🔗 källa
Vad det betyder
Kodagenter blir programmerbara för dem som använder dem. Med mods exponerar Claude Code sina interna händelser för små TypeScript-funktioner, till den grad att det omvandlar sina egna funktioner till utbytbara mods; med dynamiska workflows låter GitHub orkestreringen av underagenter skrivas i kod, i stället för att låta Copilot bestämma uppdelningen varje gång. FineEnvs-guiden påminner om varför agentens harness spelar lika stor roll som modellen: samma vikter löser 62 % av uppgifterna i en harness och 33 % i en annan. Det kräver i gengäld förtroende. En mod har samma åtkomst till datorn som Claude Code, copilot workflow run visar ingen prompt, och styrningen av skrivbordsappar kan agera på inloggade konton. De båda leverantörerna svarar genom att stänga av skrivbordsstyrning som standard, kontrollera mods före installation (claude plugin validate) och ge företagsregler företräde.
AI tvingar också fram nya filter hos dem som tar emot det som den producerar. GitHub strukturerar och begränsar privat rapportering av sårbarheter eftersom AI-genererade rapporter dränker dem som underhåller projekten; Google DeepMind föreslår att vattenmärka proteiner som utformats av AI så att leverantörer av DNA-syntes kan veta var en okänd sekvens kommer ifrån. I båda fallen är målet att göra AI-användningen synlig snarare än att förbjuda AI: en ruta för att ange AI-hjälp i det ena fallet, en verifierbar signatur i det andra.
Hos företagen mäts införandet numera i konkreta användningsområden. Barclays sätter som mål att 50 % av utvecklarna ska använda Claude Code i slutet av 2026 och låter 120 000 e-postmeddelanden sorteras per dag, American Express gör sitt Business-kort till en ingång till Skills i Perplexity Computer, med gratis krediter som stöd, och Anthropic använder sina användningsgränser som ett styrmedel genom att under två veckor halvera förbrukningen för arbete som följer efter skapandet av en artefakt. För allmänheten tar assistenterna plats i konkreta vardagshandlingar: läsa en meny för en blind person, prova ett plagg före köp, rita ett börsdiagram i konversationen.
Modellernas siffror måste till sist läsas tillsammans med mätmetoden. Ai2 klargör att mätningen med 1 200 miljarder parametrar bedömer systemet och inte en tränad modell, Cloudflare väljer sina benchmarks och medger att Jev fortfarande ligger före på When2Call och BRIGHT, och videorankningen hos Artificial Analysis placerar Wan 3.0 först med överlappande konfidensintervall. FLUX 3 Image följer ett mönster som blivit vanligt: kommersiella vikter under licens direkt, öppna vikter senare, utan datum.
Källor
- Anpassa Claude Code med mods i TypeScript (claude.com)
- Kom igång med mods på claude.dev
- Dokumentation för mods i Claude Code
- Boris Chernys reaktion på X
- Versionsinformation för Claude Code 2.1.287
- Changelog från GitHub om styrning av skrivbordsappar
- Changelog från GitHub om dynamiska workflows
- Lansering av FLUX 3 Image från @bfl_ai
- Modellsidan för FLUX 3 Image
- Guided Vision i Gemini Live (Googles blogg)
- Versionsinformation för ChatGPT
- Interaktiva diagram i Perplexity Computer
- Erbjudande om artefakter presenterat av @claudeai
- Villkor för erbjudandet om artefakter (Claudes hjälpcenter)
- Barclays och Claude (Anthropic)
- Perplexitys blogginlägg om American Express
- Perplexitys partnersida för American Express
- Lansering av Wan 3.0 från @Alibaba_Wan
- Artificial Analysis rankning AA-Video-T2V v2.0
- Utopai X i Artificial Analysis rankning
- Project Continuum från @runwayml
- Lansering av Sessions från @synthesiaIO
- Sidan för Synthesia Sessions
- SynthID Bio (Google DeepMind)
- Vetenskap formad av Claude (Anthropic Science)
- Olmo-core 3 (Ai2)
- Release av Olmo-core v3.0.0
- Clef och Clef-flash (Cloudflares blogg)
- Clef på Hugging Face
- FineEnvs guide till RL med flera harness
- Information om Grok 4.7 på Google Cloud
- Lansering av Grok 4.7 på Google Cloud från @SpaceXAI
- Strukturerade formulär för privata sårbarhetsrapporter
- Dagliga gränser för privata sårbarhetsrapporter
- Codex CLI 0.160.0
- Versionsinformation för Delta 0.18.0
- Changelog för Antigravity-appen
- Changelog för Antigravity CLI
- Copilot CLI 1.0.91
- Codex CLI 0.159.3
- Nightly för Gemini CLI den 1 oktober
- Förhandsversion av Zed 1.23.1
- Septembersammanfattning för Copilot i VS Code
- Planera tillsammans i Delta
- Porträtt av Innate från Cursor
- Benchmark för sessionsminne med funes
- Ny dashboard på GitHub
- GitHubs API för asynkron merge
- Dist-tags och betrodd publicering i npm
- Lagringstid för GitHub Actions
- Code scanning och inaktiva kodarkiv
- Inskickning av kodtäckningsdata
- Tillgänglighetsdeklarationer för kodarkiv
- Actions Runner Controller 0.15.0
- Förslag från Grok Bot
- Genspark och Azure Cosmos DB
- Erfarenheter från Seulki Kang (Genspark)
- Albertsons Companies och OpenAI
- Det eviga komplementet (OpenAI)
- Perplexitys guide till AI-verktyg för konsulter
- Luma Variants
- Septembersammanfattning från HeyGen
- Pikas appar
- ElevenLabs i Nederländerna
- ElevenLabs i Belgien
- Skills för DOCA från NVIDIA
- DIN Deploy från NVIDIA
- Nemotron 3.5 ASR och saudiska dialekter
- Rekommendationssystemet HSTU på Dynamo-Triton
- AI-fabrikernas lönsamhet (NVIDIA)
- huggingface_hub 2.1.0
- ML Intern och MCP-datakällor
- Open Source for Science Fund och Hugging Face
- En miljon träningar med TRL
- En miljon dataset på Hub
- Åtta VLM utvärderade på en RTX 3090
- GLiNER2.5-Decide mot layax
- Debattartikel av David Ha delad av Sakana AI
- Accelererad videodiffusion på TPU