検索

AnthropicがClaude Codeをmodsに開放、GitHub Copilotがデスクトップアプリを操作、Black Forest LabsがFLUX 3 Imageを発表

ai-powered-markdown-translator

gpt-6.1-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

10月1日木曜日、Anthropicはmodsを発表した。Claude Codeのイベントに接続して動作やインターフェースを書き換える小さなTypeScript関数で、バージョン2.1.287に同梱される。同日、GitHubはCopilot CLIとGitHub Copilotアプリで、デスクトップアプリの操作と、コードで記述するオーケストレーションである動的ワークフローという2つのエージェント機能をパブリックプレビューとして公開した。Black Forest Labsは、バウンディングボックスで構図を組み立て、最大4Kで生成するFLUX 3 Imageを発表。GoogleはGemini LiveにGuided Visionを展開し、BarclaysはClaudeの利用を銀行全体に拡大、GitHubはAI生成の報告への対応として脆弱性報告の要件を厳格化する。


Claude Codeがmodsに対応、TypeScript関数で動作とインターフェースを書き換え

10月1日 — Anthropicは、Claude Codeの動作を変える小さなTypeScript関数であるmodsを発表した。ツールの各操作はイベントを発行する。ツール呼び出し、権限の要求、プロンプトの送信、ターンの開始と終了、画面の一部の描画などが対象で、modはその処理の前後に介入したり、処理を置き換えたり、ラップしたりできる。モデルに届く前にプロンプトを書き換える、ツール呼び出しをブロック・書き換え・再実行する、権限の要求を承認または拒否する、Claudeが読む前にツールの出力から機密情報を隠す、独自のパネル・ボタン・入力欄を追加するといったことが可能だ。modsはプラグインに同梱され、/pluginでインストールでき、プラグインと同じように共有できる。Claude Code 2.1.287から利用でき、既定で有効になっている。始めるのにAPIの知識は不要だ。Claude Codeにmodの作成を頼めば、TypeScriptを生成し、インストールして、セッション内でホットリロードしてくれる。

既存のフックとの違いは明確だ。設定フック(settings hook)はイベントごとにシェルコマンドを実行する。一方、modは一度読み込まれるとセッション内に常駐するため、状態を保持し、イベントに応じてインターフェースを再描画し、スラッシュコマンドやモデルが呼び出すツールを登録できる。Anthropicはすでに自社の機能にも利用している。/diffパネルとAGENTS.mdのサポートは組み込みmodsとなり、無効化や置き換えが可能になった。同社は今後もほかの機能を順次modsに移行し、Claude Codeを小さなコアだけに絞れるようにする予定だ。ドキュメントに掲載された6つの組み込みmodsには、既定で無効になっているYou should knowもある。これはサブエージェントが、ユーザーやClaudeが見落としている可能性のあることを知らせる機能だ。

modsの項目公式の詳細
最低バージョンClaude Code 2.1.287、modsは既定で有効
表示に対応する環境ターミナルのCLI、Claude DesktopのCodeタブ(WSLセッションを除く)
表示に対応しない環境VS Code拡張機能、claude -p、Agent SDK、クラウドセッション。フックは動作する
組み込みmods6、/diff、AGENTS.md、sec-default、You should knowなど
フック自体の実行時間発火ごとに10秒
無効化mod単位は/plugin、セッション単位は--safe-mode、すべてはdisableAllHooks

アディ・オスマニによるclaude.devの入門ガイドでは、約80行のmodであるToken Weatherを作成する。プロンプトの上にコンテキストの「天気」を表示し、直近12ターンの小さなグラフも添える。また、rm -rf、git reset --hard、強制プッシュを、影響する対象を表示する間だけ保留するBlast Radiusや、あるターンのファイル変更を再生するReplay Theaterも紹介している。

信頼性は依然として難しい点だ。記事では、modsは隔離されておらず、Claude Codeと同じマシンへのアクセス権を持つと注意を促している。ドキュメントによれば、modは環境変数や設定ファイルを読み、すべてのプロンプトを確認し、ツール呼び出しを承認し、プランの利用枠を消費できるが、権限確認のプロンプトは変更できない。一方、claude.devのガイドでは、DOMもNodeもない独自のサンドボックス内で動作し、外部への操作はすべて$ APIを経由するモジュールとして説明されている。この仕組みによって、claude plugin validateはインストール前に、modが介入するイベントと実行する呼び出しを一覧表示できる。TeamとEnterprise、および管理された設定を持つすべてのマシンでは、組み込みmodのsec-defaultが最初に読み込まれ、ユーザーがインストールしたmodsによる拒否ルールの回避を防ぐ。管理者は独自のmodsをそれより先に配置できる。

Mods are absolutely insane. You can now customize Claude to work and look the way you want by just prompting it. Each person works differently, so there’s no reason why everyone should have an identical Claude experience. Make Claude your own, and share mods as plugins so others can try your mods too.

🇯🇵 modsは本当にすごい。頼むだけで、Claudeの動作や表示を自分の望む形にカスタマイズできるようになりました。仕事の進め方は人それぞれなので、全員が同じClaude体験をする理由はありません。Claudeを自分のものにして、ほかの人も試せるようmodsをプラグインとして共有してください。 — Xの@bcherny

この公開は予告されていた。ボリス・チェルニーが9月14日に発表し、AnthropicはGitHubで設計を共有していた(issue #91870)。記事とclaude.devのガイドは、作成したmodsをClaudeディレクトリに投稿するよう呼びかけている。

🔗 TypeScriptのmodsでClaude Codeをカスタマイズ · claude.devの入門ガイド · modsのドキュメント

Claude Code 2.1.287:クラウドプロバイダーで既定のコンテキストが1Mに、67件の修正

10月1日 — Claude Code 2.1.287はmodsを提供するバージョンだが、変更項目は106件あり、そのうち67件が修正だ。企業向けでは、Bedrock、Vertex、Foundry、Claude appsゲートウェイ上のOpus 4.7以降とFableで、[1m]の接尾辞を付けずに、既定で1Mのコンテキストウィンドウを使うようになった。CLAUDE_CODE_DISABLE_1M_CONTEXT=1を指定すれば200Kのままにできる。/advisorはOpus 4.7と4.8の助言役としてSonnet 5.5を利用でき、モデルが自動で切り替わっても現在の思考努力レベルが維持される。また、プロトコル2025-11-25に対応するMCPサーバーはURLプロンプトを開ける。危険なrmは、コマンドの出力先を~やワイルドカードにリダイレクトしても確認が維持される。保留中の権限確認は古いものから新しいものの順に表示され、9項目ではスクリーンリーダーモードが改善されている。VS Codeでは、実行中のコマンドやサブエージェントをバックグラウンドに移せる(Run in background)。

🔗 Claude Code 2.1.287のリリースノート


GitHub Copilot:デスクトップアプリの操作と動的ワークフローをパブリックプレビューで公開

10月1日 — GitHubは同日、Copilot CLIとGitHub Copilotアプリで、デスクトップアプリの操作と動的ワークフローという2つのエージェント機能をパブリックプレビューとして公開した。動的ワークフローはGitHub Copilot SDKでも提供される。

Copilotがデスクトップアプリを操作。 コンピューター操作(computer use)がmacOSとWindowsに登場した。Copilotは、システムのアクセシビリティツリーや、必要に応じてスクリーンショットを使い、ウィンドウのアクセス可能な内容と視覚的な状況を読み取る。コントロールのクリック、テキスト入力、キー操作、スクロール、ドラッグアンドドロップを行い、複数のアプリをまたいで手順を進める。デモではSafariで経費精算書を入力している。GitHubが想定するのは、API、コマンドラインインターフェース、MCP連携を持たない古いソフトウェアや、グラフィカルな操作しかできないソフトウェアだ。これらの連携手段がある場合は、結果がより予測しやすいため、ドキュメントはそちらを推奨している。機能は既定で無効で、CLIでは/computer onで有効化、/computer showで状態表示、/computer offで無効化できる。アプリでは設定から利用できる。Copilotは各アプリを操作する前に許可を求め、ユーザーはそのセッションだけ許可する、以降のセッションにも適用するよう保存する、または拒否することができる。恒久的な承認(Always allow)は同じマシンのCLIとアプリの両方に適用されるが、拒否ルールが常に優先される。CLIでエスケープキーを2回押すか、アプリのStopボタンを押せば、意図から外れた操作を中断できる。組織の管理された設定で機能を無効化でき、ローカルで有効にしても上書きできない。GitHubは、曖昧な指示や画面上の予期しない内容によって、金融関連を含むログイン済みのアカウントで意図しない操作が起こり得ると注意を促し、機密性の高いアプリへの恒久的な承認を推奨していない。対象プランも具体的な数値も示されていない。/computerコマンドは、9月16日のCopilot CLI 1.0.85のリリースノートにすでに掲載されていた。

🔗 GitHub Copilotがコンピューター操作でデスクトップアプリを操作可能に

コードで記述するオーケストレーション。 すべてのCopilotプランで利用できる動的ワークフロー(dynamic workflows)は、タスクの進め方をプログラムで記述する。コードが手順、エージェントが介入するタイミング、結果の利用方法を定め、逐次実行、並列実行、またはその両方を組み合わせる。エージェントは分析や判断を要する部分を担当する。ワークフローは、コマンドの実行、目標の並列タスクへの分割、ステップ間での構造化された結果の受け渡し、あるサブエージェントの発見を別のサブエージェントに検証させることができる。また、チェックポイント(checkpoint)で停止し、確認を受けてから再開できる。GitHubは例として、インシデントの調査、pull request内のファイルの並列レビュー、レビューコメントを2つのモデルに評価させ、両者が一致した場合にだけ報告する使い方を挙げている。

Copilotのモードドキュメントによる作業の編成者
AutopilotCopilot。各ステップの後に承認を求めずに進める
/fleetCopilot。毎回タスクを分割し、複数のサブエージェントに並列で割り当てる
動的ワークフロー作成者が記述したコード。手順、条件、処理の引き継ぎを定める

プログラムはCopilot CLIとアプリの拡張機能内に置かれる。Copilotが作成したワークフローはセッション内に限定されるが、拡張機能をホームディレクトリにコピーすれば再利用でき、リポジトリのディレクトリを通じて共有したり、プラグインにまとめたりもできる。サブエージェントはセッションの権限を継承する一方、copilot workflow runコマンドは確認を表示しないため、起動前に権限を付与しておく必要がある。アプリでは設定なしで利用できるが、CLIでは実験的機能を有効にする必要がある(--experimentalまたは/experimental on)。GitHubは数値も課金ルールも公開していない。この名称は、Anthropicが5月28日にClaude Codeで公開したDynamic Workflowsを想起させるが、関連は発表されていない。

🔗 Copilot CLIとCopilotアプリの動的ワークフロー


FLUX 3 Image:Black Forest Labsがバウンディングボックスで構図を組み立て、最大4Kで生成

10月1日 — Black Forest Labs(BFL)は、「すべてのピクセルを制御する」を掲げ、FLUX 3ファミリーに画像モデルを追加した。FLUX 3 Imageは、画像のほかの部分を変更せずに、特定の領域を複数回にわたって順次編集でき、1つのリクエストで複数の変更を受け付ける。

最も目立つ新機能は、バウンディングボックス(bounding boxes)による構図の指定だ。画像の形式にかかわらず、各軸を0から1000までの座標で表す。要素ごとにボックスを描いて内容を記述し、場面全体を1行で要約すると、モデルが各要素をそのボックス内に配置する。テキストだけのプロンプトも引き続き利用できる。FLUX 3 Imageは、プロンプト内のトークンで参照する最大10枚の参照画像も組み合わせ、その配置と大きさを自ら決める。BFLは「エージェント向けに設計された」と説明している。LLMが簡単な依頼から要素とボックスの表を作成し、ユーザーが生成前に調整できる。

発表された特徴BFLが公表した詳細
ネイティブ解像度2Kおよび4K(モデルページの例:5456 × 3072 pixels, 16,8 MP)
参照画像最大10
構図各軸0から1000のグリッド上のバウンディングボックス
編集複数ターンに対応し、ほかのピクセルは変更しない
APIのキャンペーン10月8日まで50 %割引
モデルの重みライセンス契約で商用提供。オープンウェイトは「今後数週間以内」

利用方法としては、FLUX 3 ImageはAPI経由で提供され、10月8日まで50 %割引となる。また、BFLは、自社インフラでファインチューニングして展開したい企業向けに、ライセンス契約で商用モデルの重みを提供する。オープンウェイト版は発表されているが、公開日は示されていない。発表時点では、基本料金も数値付きのベンチマークも公開されていなかった。このモデルは、今夏に始まったシリーズに加わる。統合マルチモーダルモデルのFLUX 3(7月23日)、FLUX 3 Video(8月4日)、その編集モード(9月10日)、ロボティクス向けのFLUX 3 Action(9月23日)がすでに発表されている。

🔗 @bfl_aiによるFLUX 3 Imageの発表 · FLUX 3 Imageのモデルページ


一般向けアシスタント:Gemini LiveにGuided Vision、ChatGPTにバーチャル試着、Perplexity Computerにグラフ、Claudeのアーティファクトの制限を緩和

Guided Vision:Gemini Liveが視覚障害のある人を案内

10月1日 — Googleは、Gemini Liveが利用できる地域と言語で、Android 9以降のGemini LiveにGuided Visionを展開する。全盲の人や弱視の人とともに設計されたこの機能は、共有されたカメラが映す内容をリアルタイムで説明し、追加の質問に答え、「ゆっくり右を向く」「下に傾ける」「後ろに下がる」といった、撮影範囲を調整するための指示を音声で伝える。Googleは利用例として、栄養成分表示や暗いレストランのメニューの読み取り、落としたイヤホンの探索、衣服の色の説明を挙げている。学習にあたり、Googleは視覚情報の通訳サービスAiraと提携し、数万時間のデータ、同社のネットワークに属する1 000人以上のテスター、安全対策に関わる専門家の協力を得た。Guided Visionは、Geminiアプリのプロフィール、Androidのユーザー補助ショートカット、またはTalkBackから有効にできる。Googleは、この機能は医療機器でも移動支援具でもなく、白杖の代わりにはならないと明記している。

🔗 Gemini LiveのGuided Vision(Googleブログ)

ChatGPT:買い物向けの仮想試着とお気に入り機能

10月1日 — ChatGPTのリリースノートによると、衣服やアクセサリーの商品ページに試着ボタン(試着する)が表示される。自撮り写真を撮影またはアップロードすると、ChatGPT Imagesがその商品の仮想試着画像を生成する。参照写真は次回以降の試着用に保存され、設定の参照写真項目(設定 → パーソナライズ → 参照写真)で差し替えや削除ができる。どの商品もお気に入りに保存したり、ChatGPTライブラリのフォルダーに整理したりできる。両機能はモバイルとウェブで利用できるが、リリースノートには対象プランや国が明記されていない。ChatGPTはすでに3月24日からビジュアルショッピングを提供していた。

🔗 ChatGPTのリリースノート

Perplexity Computerがインタラクティブなグラフを描画

10月1日 — Perplexity Computerが、会話の中で直接、インタラクティブなグラフや可視化を作成できるようになった。金融データでは、エージェントがTradingViewのLightweight Chartsを使い、ローソク足、出来高、移動平均線を表示する。発表は動画付きの投稿1件のみで、対象プランや対応プラットフォームは示されておらず、変更履歴にもまだ詳細な記載はない。ChatGPTとClaudeは3月10日と12日に、Replit Agentは9月25日に同様の方向へ進んでいた。

🔗 Xでの@perplexity_aiの発表

Claude、アーティファクト作成後の利用上限消費を半減、10月15日まで

10月1日 — 10月1日11時 PTから10月15日23時59分 PTまで、ClaudeまたはClaude Coworkでアーティファクト(文書、プレゼンテーション、デザイン)を作成または変更すると、その後の作業による5時間のセッション上限の消費量が50 %減る。この特典はPro、Max、Teamプランに自動適用される。FreeとEnterpriseプランは対象外で、週間上限は変わらない。

対象となる利用環境50 %削減の適用範囲
Outputメニューから開始した会話最初のメッセージから:10メッセージ、回答ごとに15ステップ
通常の会話アーティファクト作成後の10メッセージ、回答ごとに15ステップ
Outputから開始したクラウド上のCoworkタスク最初の約45分間
その他のクラウド上のCoworkタスクアーティファクトの作成または変更後、最大80ステップ

Claude Code、API、Slack内のClaude、ローカルまたは予約実行のCoworkタスク、利用クレジット、独立したClaude Designアプリは対象外。AnthropicはSonnet 5.5で試すことを勧めており、特典を予定より早く変更または終了する権利を留保している。

🔗 Xでの@claudeaiの発表 · 特典の利用条件(Claudeヘルプセンター)


金融:BarclaysがClaudeを全行に展開、American ExpressがBusiness顧客にPerplexity Computerを提供

Barclays、2026年末までに開発者の半数によるClaude Code導入を目指す

10月1日 — イギリスのユニバーサルバンクBarclaysは、Anthropicとの協力を拡大し、ソフトウェア開発の加速、旧来システムの近代化、業務効率の向上に向けてClaudeを組織全体に展開する。同行は2026年末までに開発者の50 %がClaude Codeを導入し、2027年にはソフトウェアエンジニアの過半数が利用することを見込んでいる。すでに2つの用途で数値が公表されている。2025年から稼働するColleague Knowledge Assistantは、検索拡張生成(RAG)アーキテクチャを用いてClaude上に構築され、16 000人以上の従業員に導入され、100万件以上の検索を処理した。イギリスで2,000万人以上の個人顧客に対応するチームを支援している。Global Markets事業では、Claudeモデルが1日あたり約120 000通のメールを分類し、情報を付加して適切な宛先に振り分けている。Anthropicの最高商務責任者ポール・スミスは、同社のイギリス事業にとって重要な一歩だと評価している。契約金額や期間は公表されていない。

🔗 Barclays、業務と顧客体験の向上に向けClaudeの利用を拡大

PerplexityとAmerican Express:Businessカード向けにComputerで10種類の業務用Skillsを提供

10月1日 — Perplexityは、Perplexity Enterpriseを契約している米国のAmerican Express Businessカード保有者限定で、Perplexity Computer向けのすぐに使えるSkills集を公開する。経営者はプロンプトを書く代わりに、タスクを選び、フォームで詳細を指定する。10種類のSkillsは、資金繰り予測、税務準備、仕入先比較、予算シナリオ、照合、マーケティングキャンペーン、需要予測、チャネル別の広告費用対効果(ROAS)、業務状況の追跡、採用を対象とする。カードはPersonal CFOからPlaid経由で連携でき、実行ごとにタスクの複雑さに応じたComputerクレジットを消費する。提携ページではさらに、2027年3月29日まで、Enterprise ProまたはEnterprise Maxプランを325ドル以上購入すると125ドルのクレジットを1回限り付与し、アカウントごとにComputerクレジット1 000を1回無料で提供するとしている。Corporateカードは対象外で、出力結果は金融、税務、法律、会計の助言には当たらない。

🔗 Perplexityのブログ記事 · American Expressの提携ページ


動画生成とアバター:Artificial AnalysisでWan 3.0が首位、RunwayのProject Continuum、SynthesiaのSessions

Wan 3.0、Artificial Analysisの新しい動画ランキングで首位に

10月1日 — Alibabaは、Artificial Analysisの新しいテキストから動画を生成するモデルのランキング、AA-Video-T2V v2.0でWan 3.0が首位になったと発表した。このランキングは9月30日に新しい評価手法で公開された。各モデルは定期的に更新されるプロンプト群を使って1080pで評価され、音声の同期もスコアに含まれる。上位の差は小さく、信頼区間は重なっている。

ランキング対象モデルEloスコア順位区間API利用料金
Wan 3.01157 (±9)1〜21分あたり12,00ドル
Utopai X(MiniMax H3を基盤に構築)1150 (±10)1〜3公開APIなし
Dreamina Seedance 2.51144 (±9)2〜41分あたり34,12ドル
MiniMax H3 (768p)1139 (±9)3〜51分あたり4,80ドル

ランキングで意外な結果を見せたのは、AIを基盤とする映画・テレビ制作スタジオUtopai Studiosが9月30日に公開したUtopai Xだ。MiniMax H3に事後学習を施したこのモデルは、同スタジオのPAIプラットフォームでのみ利用できる(動画1秒あたり93クレジット、月額15ドルから)。基盤となったMiniMax H3自体を上回っている。

🔗 Xでの@Alibaba_Wanの発表 · AA-Video-T2V v2.0ランキング · @ArtificialAnlysによるUtopai Xの紹介

Runway Labs、リアルタイム動画でインターフェースを生成するProject Continuumを公開

10月1日 — Runwayの探索研究部門Runway Labsが、Project Continuumを紹介した。これは、インターフェースをリアルタイムの動画で生成するオペレーティングシステムを構想する研究アプリで、8月31日に発表されたインターフェース世界モデルSolarisの流れをくむ。今回の初公開では、コンピューターとやり取りする4つの方法が示された。Portalsでは、操作中に動画モデルがアニメーション付きのインタラクティブな重ね合わせ表示を生成し、生成されたコンテンツであることを示すために縁をぼかす。応答型動画インターフェース(Responsive Video Interfaces)は、サイズ変更に合わせて構成を組み直し、クリックに反応する。Interactive Worldsはメディアをインタラクティブなシミュレーションに変換し、人にもエージェントにも利用できるようにする。最後のVisual Thinkingは、コーディングエージェント向けのハーネスだ。リアルタイム動画モデルが各ステップとツール呼び出しを映像化し、ユーザーが処理に関与し続けられるようにする。Runwayは利用方法、提供日、料金、基盤モデルのいずれも明らかにしていない。

🔗 Xでの@runwaymlのスレッド

Synthesia、訓練や聞き取りを行うアバター製品Sessionsを公開

10月1日 — Synthesiaは、同社のインタラクティブアバターを基盤とする製品群Sessionsを公開した。ビデオ通話の相手となるアバターが、質問し、話を聞き、異論を述べ、内容をまとめる。Roleplay Sessionsは訓練用で、アバターが顧客、見込み客、同僚を演じ、AIコーチが各練習にコメントし、管理者はダッシュボードでスコアと進捗を確認する。Survey Sessionsは質問票を面談に変える。アバターが数百人に並行して質問し、回答に応じて追加質問を行い、その後、テーマと感情分析のレポートを提供する。各回答は文字起こし、音声、CSVで確認できる。無料体験が用意されているが、詳しい料金は示されていない。Sessionsは9月16日に一般提供が始まったInteractive Avatar APIを基盤としており、Synthesiaはさらなる展開を予告している。

🔗 Xでの@synthesiaIOの発表 · Synthesia Sessionsのページ


AIと科学:SynthID Bioがタンパク質に透かしを付与、マシュー・シュワルツが「Claude型の科学」を論じる

SynthID Bio:Google DeepMindがAI設計のタンパク質に透かしを付与

9月30日 — Google DeepMindは、AIが生成した生物学的な創作物に電子透かし(watermarking)を付与する手法群SynthID Bioを発表し、10月1日にXでも紹介した。ブログ記事では概念実証と位置付けている。知覚できない署名を生物学的なコードに埋め込み、デジタルモデルでも合成されたタンパク質でも検証できる。配列ではアミノ酸の選択をわずかに誘導し、3D構造ではAlphaFold 3の拡散ネットワークのごく一部を微調整する。研究室で3つの標的(VEGF-A、SARS-CoV-2のスパイクタンパク質のRBD領域、PD-L1)を試験したところ、透かし付きの結合タンパク質は、成功率、親和性、配列の多様性で通常のものと同等だった。狙いはバイオセキュリティで、自動検出できる信号によって、DNA合成業者が未知の配列の出所を確認しやすくなる。Google DeepMindは、手法を記した論文、コード、試験管内実験のデータ、研究用の重みを公開する。スタンフォード大学のHie研究室とArc Instituteとの協力により、この手法はすでにEvo 2が設計したバクテリオファージのゲノムにも拡張されている。意図的な改変に対する頑健性が、引き続き最大の課題だ。

🔗 SynthID BioについてのGoogle DeepMindのブログ記事

「Claude型の科学」:マシュー・シュワルツの寄稿記事

10月1日 — Anthropic Scienceブログは、ハーバード大学の物理学者マシュー・シュワルツの寄稿記事を公開した。本人はAnthropicで客員研究員として働いていることを明記している。記事では科学者とAIの間にある「インピーダンス不整合」を論じている。モデルを人間の共同研究者と同じように扱っても、その能力を最大限には引き出せない。むしろ、数学、物理学、情報科学の既知の手法が、別分野の問いを一気に解決する「Claude型」の問題を探すほうがよいという。この考えから、どのモデルでも使える厳密計算用のオープンソースハーネスBootLoopsを開発した。BootLoopsはAnthropicのプロジェクトではなく、シュワルツ自身が保守している。物理学では30の積分を最初から最後まで処理し、うち15はそれまで計算されたことがなかった。生態学では、バロ・コロラド島の樹木が、中立理論の許容する速度の4,5倍の速さで変化していることを示した。言語学では、AccStackデータベースが6 072言語の語アクセントを網羅している。成果は3か月で、19人の共著者と18分野にわたる36本の原稿となった。シュワルツは限界にも触れている。Claudeには時間感覚がなく、「勝利宣言」を好み、物理学以外の成果は、専門家が方向を修正するまではあまり興味深いものになっていなかったという。

🔗 Claude型の科学(Anthropic Scienceブログ)


オープンモデルと学習:Ai2のOlmo-core 3、CloudflareのClefとClef-flash、FineEnvsの複数ハーネスを使うRL

Olmo-core 3:Ai2、1兆超のパラメータを目指すMoE学習基盤を公開

10月1日 — Ai2は、同社のOlmoモデルを学習するフレームワークの新版Olmo-core 3を公開した。完全にオープンな混合エキスパート(mixture-of-experts、MoE)学習システムを中心に再構築されている。これは次世代Olmoを支えるシステムの1つで、次世代モデルはMoEに移行し、Ai2によればOlmoで最も高い能力を持つものになる予定だ。FSDPを基盤とする旧実装は、バッチごとに重みを集約してから再分割していた。Olmo-core 3はDDPに移行し、エキスパートをそれぞれのGPU上に保持したまま、データを送り込む。

Ai2が公表した測定項目測定値
パラメータ数47(単位:十億)のMoE、B300 8基での予備試験GPUあたり52 000対19 400 tokens/s、約2,7倍
B300 4基でのMXFP8とBF16の比較スループットが約21 %向上
パラメータ数1 200(単位:十億)のモデル、512 GPUで実行GPUあたり最大858 TFLOP/s、ランダムルーティング

Ai2は、1兆2,000億パラメータでの測定はシステムを評価するもので、学習済みモデルの品質を評価するものではないと明記している。コード(バージョン3.0.0)、技術報告、インタラクティブなデモが公開されている。

🔗 Olmo-core 3についてのAi2のブログ記事 · Olmo-core v3.0.0のリリース

Clef と Clef-flash:Cloudflare が Jev と互換性のある2つの意思決定モデルを公開

10月1日 — Cloudflare の Workers AI チームが、自社で初めて訓練したモデル Clef と Clef-flash を公開した。Typesafe AI の System One モデル Jev が切り開いた分野に参入する両モデルは、状態(テキスト、JSON、画像、動画)と型付きの質問スキーマを受け取り、許可された各選択肢の確率を1回の処理で返す。Clef は Qwen3.8-27B をベースに事後訓練され、Clef-flash は Qwen3.5-9B をベースとしている。Workers AI 上でホストされ、Jev と互換性のある API を備える。記事によると、Hugging Face 上で Apache 2.0 ライセンスの下で公開され、コンテキストウィンドウは Jev の 32k tokens に対して 64k tokens。Cloudflare が選んだ評価結果には、強みと弱みが表れている:

ベンチマークと指標Clef のスコアClef-flash のスコアJev のスコア
BFCL、完全一致ケース98,4798,7695,75
BANKING77、macro-F194,2090,9379,74
When2Call、正解率72,3765,5880,97
BRIGHT、nDCG@1045,9139,2647,52
レイテンシ中央値209,3 ms38,8 ms524,1 ms

Cloudflare は Clef が Jev Decision Index で首位に立ったと主張している。これは、その2日前に Liquid AI が d1 について主張していた順位だ。同社はまた、顧客のデータを使って Clef を強化学習でファインチューニングするサービスを開始する。

🔗 Cloudflare の Clef に関する記事 · Hugging Face 上の Clef

FineEnvs が4つのエージェントハーネスでモデルを同時に強化学習

10月1日 — 同じモデルでも、制御するハーネスによって挙動は変わる。Liquid AI の LFM2.5-2.6B の重みは、Mini-SWE-Agent ではタスクの 62 % を解決するが、Claude Code では 33 % にとどまる。FineEnvs は、開発者が使うハーネスのコードを変更せず、その中で直接モデルを強化学習するためのガイドを Hugging Face で公開した。OpenEnv に追加した記録用プロキシが、ハーネスに対してモデルプロバイダーとして振る舞い(OpenAI、Anthropic、Gemini の形式に対応)、vLLM が生成したトークンと確率を正確に記録する。Harbor がタスクとサンドボックスを提供し、TRL が非同期 GRPO で訓練する。4つのハーネスで同時に訓練した LFM2.5-2.6B は、平均成績が 42 % から 54 % に向上した。また、効率的な解法に小さな報酬を与えることで、既に解決できていたタスクでのツール呼び出しが 31 % 減った。より大きなモデルを模倣するだけでは不十分で、Qwen3.8-27B の 3 189 件のロールアウトを使った教師ありファインチューニングは 47,5 % で頭打ちになった。プロキシ、訓練ツール、タスク、データ、訓練済みモデルが公開されている。

🔗 複数ハーネスでの強化学習の完全ガイド


Google Cloud のエージェントプラットフォームで Grok 4.7 がプレビュー公開

10月1日 — SpaceXAI は、Google Cloud のエージェントプラットフォーム Gemini Enterprise Agent Platform で Grok 4.7 が利用可能になったと発表した。9月30日付のモデル紹介ページでは、識別子 grok-4.7 のプレビュー版として掲載されている。コードと知識業務向けに設計された xAI のモデルで、難しいタスクにより長く取り組み、自分の作業を検証すると説明されている。入力にはテキストと画像を受け付け、出力はテキストのみ。関数呼び出し、構造化出力、推論に対応するが、バッチ予測には対応しない。

Google Cloud が公開した項目Grok 4.7 の値
コンテキスト長524 288 tokens
1分当たりのクォータ13 リクエスト、入力 188 000 tokens、出力 16 000 tokens
利用方式固定クォータのみ、従量課金とプロビジョニング済みスループットには非対応
サービス提供リージョン米国マルチリージョンとグローバルエンドポイント
100万トークン当たりの料金入力が 200 000 tokens 未満の場合、入力 2 ドル、出力 6 ドル、キャッシュ 0,50 ドル。それ以上は倍額

料金表は xAI の API と同じ。9月21日に公開された Grok 4.7 は、9月28日に Amazon Bedrock に登場していた。また、Grok 4.6 は8月21日に同じ Google のプラットフォームに加わっていた。

🔗 Google Cloud の Grok 4.7 紹介ページ · X 上の @SpaceXAI の発表


GitHub、AI が生成する報告への対策として脆弱性の非公開報告を厳格化

10月1日 — GitHub は、脆弱性の非公開報告(非公開の脆弱性報告)に関する2つの対策を同じ時刻に公開した。両者に共通する問題認識は、オープンソースのメンテナーに届く、自動化されたものや AI が生成した低品質な報告が増え、重要な報告が埋もれているというものだ。

A single free-text box made it easy to submit low-quality or AI-generated reports and hard for you to find the signal in them.

🇯🇵 単純な自由記入欄では、低品質な報告や AI が生成した報告を容易に送信できてしまい、その中から重要な情報を見つけるのが難しくなっていました。 — GitHub 更新履歴、脆弱性の非公開報告向けの構造化フォーム

構造化フォーム。 デフォルトでは、報告者は概要、詳細、150文字以上の概念実証、影響という4つの必須項目を入力する。これらはセキュリティアドバイザリの説明にまとめられ、メンテナーは従来どおり確認する。各リポジトリは .github/VULNERABILITY_REPORT.yml ファイルでフォームを調整でき、組織の .github リポジトリから全リポジトリに適用することもできる。メンテナーは CWE カテゴリの入力を必須にでき、組織や企業はポリシーでこれを義務付けられる。チェックボックスでは、問題の発見や報告の作成に AI の支援を受けたかどうかを報告者が申告できる。REST API にもカスタムフォームは適用されるが、既存の連携を壊さないよう、デフォルトフォームは適用されない。

1日当たりの上限。 同じアカウントが1日に送信できる新規報告の件数に、個々のリポジトリと GitHub 全体の両方で上限が設けられた。既存のアドバイザリへのコメントは対象外。管理者は独自の上限を設定し、信頼できる報告者を適用対象から除外できる。GitHub はデフォルトの上限値を公表していない。両対策は、GitHub Free、Pro、Team、Enterprise Cloud で非公開報告を有効にしている公開リポジトリが対象となる。

🔗 脆弱性の非公開報告のレート制限


コーディングエージェント:Codex CLI 0.160.0、Delta 0.18、Antigravity 2.19.1

Codex CLI 0.160.0:コマンドセンターの履歴とプロジェクト外のセッション

10月1日 — OpenAI が Codex CLI 0.160.0 を公開した。前日の 0.159.3 以来初の安定版で、0.159.0 以降の 55 件の PR が掲載されている。エージェントのコマンドセンター(エージェント指令センター)に、過去のタスクを表示する操作(さらに表示)が追加され、キーボードからも利用できる。組織のポリシーで許可されていれば、ワークスペースのデフォルト設定を使ってプロジェクト外でセッションを開始でき、再開時には保存された権限が復元される。Guardian の承認レビューには、ユーザーが以前に与えた指示を探す機能と、エージェント間の引き継ぎの文脈を取り込む機能という2つの任意機能が加わった。全画面表示では、ローカルの Linux X11 端末で会話記録を選択し、マウスの中ボタンで貼り付けられる。修正では、キュー内のメッセージが再接続後に重複送信されずに処理を再開するようになり、Windows のサンドボックスと初期化時の SQLite の停止問題にも一連の修正が加えられた。

🔗 GitHub 上の Codex CLI 0.160.0

Delta 0.18:既存の Git worktree でスレッドを実行、CLI も登場

9月30日 — Zed が、複数人でエージェントとコーディングする環境 Delta のバージョン 0.18.0 を公開した。新機能 23 件、改善 41 件、修正 51 件、削除 1 件が含まれる。主な新機能は、9月28日に提供日を示さずに発表されていたものだ。スレッドを、既に連携済みの任意の Git worktree で実行できるようになり、そこから作成する新しいスレッドにその作業コピーを引き継げる。Delta は端末からも操作できるようになった。CLI delta を macOS、Windows、Linux にインストールでき、delta auth コマンドでログイン中のアカウントを管理する。モデル関連では、Google AI Studio の Gemini モデルが追加され、API キーを使って GPT-6 Sol、GPT-6 Luna、Claude Opus 5.5 を利用できるようになった。デスクトップアプリでは、OpenAI または Anthropic と互換性のある任意のプロバイダーに対応する。スレッドでの作業には、全サブスレッドの検索とブックマークが加わった。一方、サブスレッドは親スレッドに進捗メッセージを投稿しなくなり、親スレッドには Land Changes の結果だけが表示される。

🔗 Delta 0.18.0 のリリースノート

Antigravity 2.19.1:サブエージェントに直接メッセージを送信

9月30日 — Antigravity 2.19.1 では、メインエージェントを経由せず、入力欄からサブエージェントに直接メッセージを送れるようになった。CLI では、バージョン 1.2.8 と 1.2.9 から @ 構文で既に利用できていた。今回のバージョンでは、成果物とサイドパネルに表示された Markdown を、表、コードブロック、図を含めて PDF に書き出す機能と、会話だけを対象にした取り消しオプションが追加された。5件の修正のうち、カスタムエージェントがようやくグローバルルールとプロジェクトルールに従うようになった。段階的に展開されるため、数日かかる場合がある。CLI には9月27日、あまり注目されなかったバージョン 1.2.12 も公開されていた。GEMINI_API_KEY キーで開始したセッションは、Gemini API が1日のクォータの枯渇、支出上限への到達、前払いクレジットの枯渇を通知すると、失敗する試行を数分間繰り返す代わりに、直ちに停止するようになった。

🔗 Antigravity アプリの更新履歴 · Antigravity CLI の更新履歴


短報

  • Copilot CLI 1.0.90と1.0.91 — 1.0.90は9月30日に安定版となり、モデル選択欄にGPT-6.1 Solが加わったほか、MCPとセッション再開に関する不具合が修正された。10月1日の1.0.91では、サンドボックスのプロキシ証明書を管理するcopilot sandbox caコマンドが追加された。🔗 出典
  • Codex CLI 0.159.3 — 9月30日22時57分UTCに公開され、バックポートは1件だけ含まれる。ChatGPTでログインしたローカルセッションで、アカウントのセキュリティ設定を完了するための任意のリマインダーを表示できるようになった。この変更は0.160.0にも取り込まれている。🔗 出典
  • Gemini CLIのナイトリー版 — 10月1日のv0.64.0-nightlyは、ヘッドレスモードでプロセッサー使用率が100 %のまま固まる問題を修正し、ファイル操作ツールによる書き込みをアトミックにした。安定版とプレビュー版に変更はない。🔗 出典
  • Zed 1.23.1のプレビュー版 — 9月30日に公開され、JSONLとNDJSONのファイルを表形式で表示できるようになったほか、agent.max_idle_retained_threads設定が追加され、Google AIのモデルが過負荷になるとリクエストを自動で再試行するようになった。🔗 出典
  • 9月のVS CodeのCopilot — バージョン1.136から1.140までを振り返る月次まとめでは、ChatGPTアプリで始めたCodexの会話をVS Codeで再開する機能、プレビュー版のアプリバッジ、ワークスペースなしで開けるチャットなど、あまり目立たなかった新機能が紹介されている。🔗 出典
  • Deltaで共同計画 — Deltaのブログで、ネイサン・ソボが、チームの3人で同じスレッド内で計画を立てる方法を紹介している。plan.mdファイルを使う代わりに、Fable、次いでAstraを使い、独立したサブスレッドとサブエージェントを交える。新機能の発表はない。🔗 出典
  • Cursorが撮影したInnate — Cursorが、日常生活向けのロボットを開発する7人のチーム、Innateを紹介する短い動画を公開した。共同創業者のヴィグネシュ・アナンドは50人分の仕事をこなしていると述べているが、Cursorをどう使っているかは明らかにしていない。🔗 出典
  • 圧縮よりも過去のセッションの呼び出し — funesの開発者デビッド・コルヴォワジエは、自ら選んだ3つのタスクについてClaude Codeで測定した。全コンテキストを保持する場合に比べ、自身のツールで以前のセッションを呼び出すと、それぞれ8分の1、4分の1、3分の1の重み付きトークン数で正しい答えを見つけられた。🔗 出典
  • GitHubの新しいダッシュボード — 実行中のエージェントセッション、イシュー、プルリクエストをまとめ、各一覧に最大12件を表示する画面が、全ユーザーの標準表示になる。ニュースフィードはFeedタブに移り、従来の表示も引き続き利用できる。🔗 出典
  • 非同期マージAPI — 一般提供となり、同期RESTエンドポイントやGraphQLのミューテーションに代わって、プログラムからマージする際の推奨手段になる。積み重ねたプルリクエストに対応する唯一のマージAPIでもある。🔗 出典
  • トークン不要のnpmのdist-tags — npmの信頼された公開設定に、短期間有効なOIDC認証情報でdist-tagsを管理するための任意の権限を付与できるようになった。この権限は標準では無効で、長期間有効なアクセストークンの代わりに使える。🔗 出典
  • GitHub Actionsの保持期間 — チェック、ワークフローの実行、ステータスは、サードパーティー製アプリのものも含め、アーティファクトとログの保持期間設定に従い、期間を過ぎると削除されるようになった。公開リポジトリでは最長90日で、復元はできない。🔗 出典
  • コードスキャンと休眠リポジトリ — コードスキャンとGitHub Code Qualityの毎週の定期解析は、プッシュまたはプルリクエストによる解析が実行された後にだけ開始されるようになった。休眠リポジトリがさらに6か月間、活動中に見えることを防ぐためだ。🔗 出典
  • コードカバレッジ — GitHub Code Qualityのupload-code-coverageアクションは、まだプルリクエストが開かれていないブランチへのプッシュでCIを失敗させなくなった。🔗 出典
  • アクセシビリティ声明 — ルート、.github/、またはdocs/に置いたACCESSIBILITY.mdファイルが、リポジトリのホームページで目立つ形で表示される。github.comの全プランで利用でき、GitHub Enterprise Server 3.24にも導入される。🔗 出典
  • Actions Runner Controller 0.15.0 — セルフホスト型ランナーのKubernetesコントローラーは、パッチバージョンへの更新時にリソースをその場で更新するようになった。停止までの待機時間、Kubernetesクライアントの制限、コントローラーの並行実行数を設定可能にし、リクエストの負荷も軽減する。🔗 出典
  • Grok Botが先回り — ユーザーのメインのボットが、肩代わりできる仕事を見つけて引き受けることを提案するようになった。展開は数時間かけて行われ、こうした提案は利用量に計上されない。対象のプランや国は明示されていない。🔗 出典
  • GensparkとAzure Cosmos DB — Azure Cosmos DBのブログ記事が、Gensparkの視点から、一部のバックグラウンド処理にグローバルセカンダリインデックスを使い、リアルタイムのエージェントセッションを遅くしない仕組みを説明している。数値は示されていない。🔗 出典
  • Gensparkの利用者の声 — マーケティング経験15年のカン・スルギは、過去の資料をSecondBrain、次いでAI Slidesにつなげることで、講座教材一式の準備が30時間から5時間になったと述べている。製品の新機能はない。🔗 出典
  • AlbertsonsとOpenAI — 2,200を超える店舗を持つ小売企業が、選ばれたチーム向けのChatGPT Enterpriseから、顧客体験や販促分析に使うAPIへと提携範囲を広げる。また、8月5日に発表したChatGPT内のSafewayプラグインを紹介している。🔗 出典
  • 永遠の補完者 — OpenAIが、これからの経済を扱う連載の最初の論考を公開した。執筆者のヘマント・アシルヴァタムとエリオット・モクスキは個人としての見解だと明記し、機械の知能の大部分は、画期的な発見よりも実行に使われる可能性があると論じている。🔗 出典
  • Perplexityとコンサルタント — ガイドが、AlphaSenseからQwilrまで、コンサルタント向けのAIツール10種類を9月に確認した価格とともに比較している。よくある質問では、Perplexityの無料プランは、拒否しない限りユーザーデータをモデルの学習に使うと改めて説明している。🔗 出典
  • Luma Variants — 前日に詳細なしで紹介された機能が、Lumaの全ユーザー向けに提供された。承認済みの静止画広告から、9:16から16:9までの5つの標準形式と複数の言語でバリエーションを生成する。料金の発表はない。🔗 出典
  • HeyGen Professional Voice Clone — 9月のまとめによると、HeyGenは、9月9日に始まった非公開の先行提供を経て、忠実度が最も高い音声クローンをAPIで提供する。学習には少なくとも20分の録音を使い、ファイル数は1〜10件となる。🔗 出典
  • Pikaとそのアプリ — Pikaは、新しいプラットフォームに40を超えるアプリがあるとし、2人のキャラクターに議論させるPodcast Videoと、画像や動画クリップの色調を調整するColor Gradeの2つを紹介している。日付や料金は示されていない。🔗 出典
  • ベネルクスのElevenLabs — ElevenLabsがブリュッセルとアムステルダムに拠点を開設し、現地のチームを3倍に増やす計画だ。通信事業者KPNでは、郵便番号の認識率が64 %から82 %に向上し、確認用エージェントが週に約60,000件の電話を処理している。🔗 オランダ · 🔗 ベルギー
  • NVIDIAのDOCAスキル — 開発者の実際のプロンプト65件で、BlueField DPU向けのこれらのスキルを備えたコードエージェントは、評価表の基準を100 %満たした。スキルなしでは19 %だった。スキルはGitHubで公開されている。🔗 出典
  • DIN Deploy — NVIDIAが、WindowsとLinuxでONNX RuntimeとTensorRT RTXを使ってモデルをローカル実行するためのオープンソースのC++サンプルを公開した。DGX Sparkでは、Parakeet TDTがGPUで実時間の206倍の速度で文字起こしし、CPUでは14倍となる。🔗 出典
  • Nemotron 3.5 ASRとサウジアラビアの方言 — NVIDIAのチュートリアルが、ナジュド方言とヒジャーズ方言でモデルを微調整している。2台のRTX PRO 6000で12,000ステップ学習すると、単語誤り率は55.05 %から29.96 %に下がり、FLEURSの英語とアラビア語での性能もわずかに向上する。🔗 出典
  • Dynamo-Triton上のHSTU推薦システム — NVIDIAが、PyTorch AOTInductorとKVキャッシュを使って生成型HSTU推薦システムを提供する。RTX PRO 6000での最良の条件では、層数に応じて最大4.47倍および5.93倍に高速化し、リクエスト当たり0.423 msおよび0.678 msとなる。🔗 出典
  • AI工場の収益性 — NVIDIAは見解を示す記事で、AI工場の費用を1メガワット当たり約6,000万ドルと見積もり、SemiAnalysisのデータを引用している。DeepSeek V4 Proでは、Vera Rubin NVL72の100万トークン当たりのコストはGB300 NVL72の最大45分の1で、8月24日時点では35分の1だった。🔗 出典
  • huggingface_hub 2.1.0 — ライブラリは、失敗したJobsを自動で再実行し、作り直さずに実行予定を変更でき、残りのZeroGPU利用枠を読み取り、hf_xet経由でXetファイルをダウンロードする。HF Jobsでは、2 GBのparquetファイルのダウンロードが約120秒から7秒に短縮される。破壊的変更は3件ある。🔗 出典
  • ML InternとMCP — Hugging Faceが、モデルを学習させるHuggingChatのモードであるML InternにMCPのデータソースを接続する。これにより、自社の業務データでオープンモデルを微調整できる。発表に公式の数値は添えられていない。🔗 出典
  • Hugging FaceとOpen Source for Science Fund — 両者は、科学分野のモデルの開発に貢献する人々が最も依存しているライブラリを特定し、そのメンテナーを支援する意向だ。金額や日程は示されていない。🔗 出典
  • TRLで100万回の学習 — カンタン・ガルエデックが引用したテレメトリーによると、Hugging Faceの事後学習ライブラリでは月に100万回の学習が行われており、週に100万回を目指している。集計方法は公表されていない。🔗 出典
  • Hubの100万件のデータセット — 3人の著者が、組織アカウントはデータセットの約19 %を公開しながらダウンロードの半分を占めること、そしてダウンロード数上位1,000件のうち390件をアメリカが保有していることを示している。🔗 出典
  • RTX 3090で8つのVLM — ThinkEvolveのアーカーシュ・グプタは、正確度が同じ場合、Qwen3-VL-8Bは各リクエストをQwen3.8-27Bより2.2倍速く処理するものの、プレフィックスキャッシュを再利用しないため、7,329回の呼び出しを行う処理では7.53時間に対して18.88時間かかることを示している。🔗 出典
  • GLiNER2.5-Decideとlayaxの比較 — アラヴィンド・ヴィジャヤクマールは、Fastinoのモデルでは信頼度の閾値を一つも保証できなかった。一方、自身のツールであるlayaxでは10回の試行すべてで保証でき、正確度も20〜23ポイント高く、速度も約5倍だった。🔗 出典
  • デビッド・ハとオーケストレーター — Sakana AIの共同創業者兼最高経営責任者は、Nikkei Asiaへの寄稿で、価値はモデルの重みから複数のモデルを組み合わせる知能へと移ると論じ、主権をサプライチェーンの強固さとして定義している。🔗 出典
  • TPU上の動画拡散 — Googleのエンジニア3人が、Sparse VideoGenのスパースアテンションと最適化したSplash Attentionカーネルにより、8基のTPU v6eで1440p動画のノイズ除去時間を2,471秒から1,461秒へ短縮し、1.69倍に高速化した。🔗 出典

これが意味すること

コードエージェントは、使う人がプログラムできるものになりつつある。Claude Codeはmodsによって内部イベントを小さなTypeScript関数に公開し、自身の機能まで置き換え可能なmodsへと変えている。GitHubは動的ワークフローによって、毎回Copilotに分担を決めさせる代わりに、サブエージェントのオーケストレーションをコードで記述させる。FineEnvsのガイドは、ハーネスがモデルと同じくらい重要な理由を改めて示している。同じ重みでも、あるハーネスではタスクの62 %を解決し、別のハーネスでは33 %にとどまる。その代わり、信頼が前提となる。modはClaude Codeと同じようにマシンへアクセスでき、copilot workflow runは確認を一切表示せず、デスクトップアプリの操作はログイン済みのアカウントに作用し得る。両社は、デスクトップ操作を標準では無効にし、modsにはインストール前の確認(claude plugin validate)を設け、企業のルールを優先することで対応している。

AIは、その出力を受け取る側にも新しいフィルターを求めている。GitHubは、AIが生成した報告でメンテナーが埋もれてしまうため、脆弱性の非公開報告を構造化し、件数に上限を設ける。Google DeepMindは、DNA合成の事業者が未知の配列の出所を把握できるよう、AIで設計したタンパク質に透かしを埋め込むことを提案している。どちらも目的はAIを禁止することではなく、その使用を可視化することだ。一方はAIの支援を受けたことを申告するチェックボックスで、もう一方は検証可能な署名となる。

企業では、導入状況が具体的な用途で測られるようになっている。Barclaysは2026年末までに開発者の50 %がClaude Codeを使う目標を掲げ、1日120,000件のメールを分類させている。American Expressは、クレジットの特典を添えて、BusinessカードをPerplexity ComputerのSkillsへの入口にしている。Anthropicは利用上限を施策として活用し、アーティファクト作成後の作業による利用量の消費を、2週間にわたって半分にしている。一般消費者向けには、目の見えない人にメニューを読み上げる、買う前に服を試着する、会話の中で株価チャートを描くといった具体的な行動に、アシスタントが入り込んでいる。

最後に、モデルの数値は評価手順と合わせて読む必要がある。Ai2は、1兆2,000億パラメーターでの測定が、学習済みモデルではなくシステムを評価するものだと明示している。Cloudflareはベンチマークを選定し、When2CallとBRIGHTではJevが依然として上回っていると認めている。Artificial Analysisの動画ランキングではWan 3.0が首位だが、信頼区間は重なっている。FLUX 3 Imageは、今ではよく見られる道筋をたどる。商用の重みはライセンス付きですぐに提供し、オープンな重みは後日公開するが、日付は示していない。


出典