搜索

Claude Dashboards 与 Claude Motion、Cyber Mission 与 OSS Scanner,以及 GPT-6.1 Sol 的 Ultrafast

ai-powered-markdown-translator

文章已使用 gpt-6.1-sol 从法语翻译成中文。

在 GitHub 上查看项目 ↗

Anthropic 为 Claude 新增两项功能:Claude Dashboards 用于持续更新仪表板,Claude Motion 用于通过代码编写动画;同时,Docs、Slides 和 Design 结束测试,向所有套餐开放,包括 Free。同一天,该公司启动 Cyber Mission,推出关键基础设施防御计划和 OSS Scanner,后者使用其最强大的模型,为开源项目提供免费扫描。OpenAI 则为 GPT-6.1 Sol 推出 Ultrafast 档位,速度最高可达 Standard 模式的 8 倍;与此同时,Anthropic 和 NVIDIA 分别承诺为 Genesis Mission 投入 1.5 亿美元和 10 亿美元。


Claude Dashboards 与 Claude Motion 进入测试阶段,Docs、Slides 和 Design 向所有套餐开放

10 月 8 日 — Anthropic 为 Claude 新增两项功能。Claude Dashboards 在付费套餐中提供测试版:用户连接企业数据平台(Amazon Redshift、BigQuery、ClickHouse、Databricks 或 Snowflake),或其他连接器,例如 Salesforce 商机,然后用日常语言提问,Claude 就会编写查询、构建仪表板,并在数据变化时持续更新。点击一个数字即可查看生成该数字的查询,每张图表也会标明数据更新时间。Anthropic 将其定位为快速提问和探索分析工具;如需进一步分析,可将仪表板转到 Amplitude、Grafana、Hex、Mixpanel、Omni、Perplexity、PostHog 或 Sigma,Looker、monday.com 和 Tableau 的支持则将在之后推出。

Claude Motion 在 Team 和 Enterprise 中提供测试版,面向短动画制作:例如根据季度报告生成一段 30 秒的讲解视频,在演示文稿中加入动态图表,或制作产品演示。由于整个过程不使用视频生成模型,动画中不会包含由人工智能生成的片段或人物。

Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.

🇨🇳 Claude Motion 可将报告、图表或产品演示转化为短动画。Claude 用代码编写每一段动画,无需任何视频模型,因此你可以修改任意文字、数字或时间安排,再导出 MP4。目前在 Team 和 Enterprise 套餐中提供测试版。 — @claudeai 在 X 上

同一天,Claude Docs、Slides 和 Design 去掉测试版标签,向所有套餐开放,包括 Free。据 Anthropic 称,自 9 月 16 日这些功能加入对话以来,用户已创建超过 4500 万份文档、演示文稿和设计作品。正式发布带来了对产物的 CMEK 支持、管理员选择产物模板的功能、与 Claude 协同进行多人编辑、经管理员允许向组织外分享、与编辑器显示效果一致的 PowerPoint 和 PDF 导出、直接发送至 Google Slides,以及在移动应用中编辑的能力。

相关功能截至 10 月 8 日的状态适用套餐
Claude Dashboards测试版付费套餐
Claude Motion测试版Team 和 Enterprise
Claude Docs、Slides 和 Design结束测试所有套餐,包括 Free
claude.ai/design(独立网站)开放至 12 月 14 日—

实际影响是:如今已整合到 Claude 中的独立网站 claude.ai/design 将继续开放至 12 月 14 日。组织的设计系统(design systems)可以从 Artifacts 页面一次性迁移,但独立网站上的对话、评论及其公开链接将在网站关闭时消失。在 Enterprise 中,Dashboards 和 Motion 默认关闭,而 Docs、Slides 和 Design 将于 10 月 15 日默认启用。

🔗 Claude 博文:Dashboards 与 Motion · @claudeai 帖子串

Runway 与 Luma 成为 Claude Motion 的首发合作伙伴

10 月 8 日 — 两家生成式视频厂商宣布成为 Claude Motion 的首发合作伙伴。在 Runway 中,任何动画都可以导出后加入生成的视频片段,通过描述所需变化来修改镜头,并让 Runway Agent 围绕动画剪辑出更长的视频;同一段 16:9 动画还可以改为竖屏和方形格式。在 Luma 中,通过添加到 Claude 的 Luma 连接器(MCP),可以直接打开动画:视频模型 Ray 和 Uni 能在保留运动的同时改变风格,将画面裁切为 9:16、1:1、4:3 或 21:9,Luma 智能体则可以生成其他版本。Runway 和 Luma 均未说明价格或所需点数。Anthropic 还列出了 Adobe、Descript、HeyGen、Higgsfield 和 invideo,作为进一步加工动画的工具,并表示 Canva 和 Captions 的支持即将推出。

🔗 Runway 博文 · Luma 博文


Anthropic Cyber Mission:关键基础设施计划与面向开源项目的 OSS Scanner

10 月 8 日 — 在扩大 Cyber Verification Program 两天后,Anthropic 启动 Anthropic Cyber Mission,将其定位为保障人人依赖的系统安全的长期承诺。其出发点来自 Project Glasswing:发现漏洞从未如此容易,但验证、确定优先级和修复漏洞仍然困难。该任务首先从关键基础设施和开源软件两方面展开;未来还将扩展至其他领域,但未公布时间。

针对关键基础设施,Critical Infrastructure Defense Program(CIDP)为运营技术运营方的服务供应商提供前沿 Claude 模型、驻场工程师以及 Anthropic 的威胁研究成果。这些运营技术包括电力、供水或交通领域的自动控制器、控制软件和工业网络,往往无法停机安装补丁。共有十一家创始合作伙伴参与:Accenture、Booz Allen、CrowdStrike、Deloitte、Dragos、Hitachi、Insane Cyber、Nozomi Networks、Palo Alto Networks、PwC 和 Rockwell Automation。该计划从一小批参与者起步,并将在未来几个月扩展至更多合作伙伴和行业。

针对开源软件,受 Google 的 OSS-Fuzz 启发,OSS Scanner 免费为已登记项目提供定期扫描,使用 Anthropic 最强大的模型,包括 Claude Mythos。每份报告都包含重现程序、说明,以及在存在的情况下提供的候选补丁,但报告发送前不经过人工复核:Anthropic 预计真阳性率将超过 90 %,并提醒部分报告会包含错误,例如对严重程度的判断不准确。该服务旨在解决 Frontier Red Team 团队描述的瓶颈:发现的漏洞数量远远超过人工能够分类处理的数量。

Anthropic 公布的指标公布的数值
六个月内发现的疑似漏洞超过 29 000
经人工复核和分类处理的漏洞约 6 000
已验证的严重或高危漏洞(48 个项目)97
达到协调漏洞披露(CVD)要求的漏洞85,即 88 %
真实但重复的漏洞,或无效漏洞11 和 1
在 CyberGym 基准中由 LLM 发现的漏洞比例去年年初低于 20 %,今年超过 85 %

wolfSSL 表示,在收到的 74 份报告中,除两份外均有效,其中五份成为 CVE。登记需要向 GitHub 仓库 anthropics/oss-scanner 提交拉取请求,仅限经逐一评估被认定为关键项目的主要维护者;8 月启动的 Defender Advantage Fund 则维持服务免费。Anthropic 的预测较为谨慎:未来两年内,人工智能将有利于防守,但短期内未必如此,因为漏洞利用的成本下降,而验证、披露和修复仍然缓慢。

🔗 Anthropic 博文:Anthropic Cyber Mission · Frontier Red Team 关于 OSS Scanner 的博文 · anthropics/oss-scanner 仓库


GPT-6.1 Sol 的 Ultrafast:速度最高提升至 8 倍,每百万词元 12 和 60 美元

10 月 8 日 — 9 月 29 日曾宣布“即将推出”的 Ultrafast 档位正式登陆 GPT-6.1 Sol。OpenAI Developers 表示,该档位当天开始在 API、Codex 和 ChatGPT Work 中推出,其智能水平被描述为接近 GPT-6 Astra。OpenAI 将其面向分秒必争的工作:排查故障、让智能体在应用中操作,或提供实时交互体验。

Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.

🇨🇳 GPT-6.1 Sol 的 Ultrafast 今天开始在 API、Codex 和 ChatGPT Work 中推出。智能水平接近 Astra,速度最高可达 Standard 模式下 Sol 的 8 倍,让你以灵感涌现的速度进行开发。 — @OpenAIDevs 在 X 上

在 API 中,只需在 Responses API 中调用 gpt-6.1-sol 并设置 service_tier: "ultrafast"。在符合速率限制的前提下,该模式向所有 API 用户开放,支持全球处理,以及美国和欧盟的数据驻留,而 GPT-6 Astra 的 Ultrafast 仍仅支持美国数据驻留。定价沿用 Astra 已采用的规则:为 Standard 价格的六倍,即每百万输入词元 12 美元、输出词元 60 美元,仅为 GPT-6 Astra 的 Ultrafast(60 和 300 美元)的五分之一。

gpt-6.1-sol 处理模式输入价格缓存输入缓存写入输出价格
Standard,短上下文2,00 美元0,10 美元2,50 美元10,00 美元
Fast,短上下文4,00 美元0,20 美元5,00 美元20,00 美元
Ultrafast,短上下文12,00 美元0,60 美元15,00 美元60,00 美元
Ultrafast,长上下文24,00 美元1,20 美元30,00 美元90,00 美元

以上为每百万词元的价格,来自截至 10 月 8 日的 API 定价页面。

在 Codex 和 ChatGPT Work 中,仅 Pro 500 套餐、符合条件且按用量计费的 Enterprise 工作空间,以及采用额度制的 Edu 套餐可以使用。在 Enterprise 中,Ultrafast 默认关闭,工作空间所有者必须为部分用户或所有用户启用。Codex 文档详细说明了成本:订阅内含配额的消耗速度为 Standard 模式的 8 倍,购买的额度和 Enterprise 按需用量则按六倍价格计费。其他自助订阅套餐在推出时无法使用,即使购买了额度也不例外。

🔗 OpenAI API 更新日志 · OpenAI API 定价 · Codex 中的 Ultrafast(文档)


科学:Anthropic 与 NVIDIA 分别为 Genesis Mission 投入 1.5 亿和 10 亿美元,以及一幅紫外波段天空图

10 月 8 日,在美国白宫科学与技术政策办公室(OSTP)于华盛顿举办的“科学:全新的黄金时代”峰会上,两家公司宣布对 Genesis Mission 的投入承诺。这项美国联邦计划旨在通过人工智能加速科学发现。同一天,Anthropic 展示了 Claude Science 能为天体物理学家完成的工作。

Anthropic:三年投入 1.5 亿美元,向超过 15 家联邦机构提供 Claude

10 月 8 日 — Anthropic 承诺在三年内向 Genesis Mission 投入 1.5 亿美元。这笔资金将使该任务的超过 15 家成员机构能够使用 Claude,包括 NASA、美国国立卫生研究院和美国国家科学基金会。具体而言,Anthropic 将向数百个研究项目提供 Claude、Claude Code 和 API 额度,与各机构及国家实验室共同推进政府的优先事项,包括聚变能源和量子计算,并提供培训及技术支持。这项承诺延续了其于 2025 年 12 月与美国能源部建立的合作;7 月,Google DeepMind(4000 万美元)和 OpenAI(1700 万美元)已分别宣布对该任务的投入承诺。

🔗 Anthropic 博文:对 Genesis Mission 的投入承诺 · @AnthropicAI 帖子

NVIDIA:五年投入 10 亿美元支持美国科学

10 月 8 日 — 在同一活动上,NVIDIA 宣布将在五年内提供价值 10 亿美元的投入,以提升美国在量子计算、健康和能源安全等领域开展超级智能研发的能力。新闻稿列出了三个方向,但未说明资金分配:支持高校研究机构、投资加速美国在量子计算领域的领先地位,以及支持服务于政府任务的云供应商。NVIDIA 还表示,将参与当天公布的 Genesis Mission 第二阶段资助的多个项目,涵盖量子计算、聚变、加速器设计和微电子,并重申其与 DOE 的合作,其中包括部署在阿贡国家实验室、该部门规模最大的科学超级计算机。

🔗 NVIDIA 新闻稿

由 Claude Science 制作的首张完整紫外全天图

10月8日 — Anthropic Science 博客讲述了约翰斯·霍普金斯大学天体物理学家、Anthropic 研究员布里斯·梅纳尔如何借助 Claude Science,制作出被 Anthropic 称为首张完整紫外全天图的成果。空间巡天项目 GALEX(NASA,2003-2013)通过约 38 000 次观测,仅覆盖了约三分之二的天空。Claude 协调多个智能体,汇集公开巡天数据并进行交叉校准,再根据紫外波段与其他波长之间的关系,通过重建(inpainting)补全缺失的三分之一。在刻意遮蔽的区域中,估算结果与真实测量值的差异约为 10 %。

The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.

🇨🇳 这项工作原本需要人工花费数周,但借助 Claude,在梅纳尔忙于其他项目的同时,仅用几天就完成了。 — @AnthropicAI 在 X 上

🔗 Anthropic Science 博文


禁止用途与滥用:Anthropic 的 2026 年使用政策,以及 OpenAI 拆解的两场影响力行动

10月8日发布的两份材料展示了实验室禁止哪些行为,以及如何追查滥用:Anthropic 重写了使用政策,OpenAI 则详细介绍了其封禁的两场影响力行动。

Anthropic 发布 2026 年版使用政策,11月12日生效

10月8日 — Anthropic 发布使用政策(Usage Policy)的年度更新,将于 11月12日 生效。此次更新主要根据观察到的滥用行为澄清规则。新增章节将此前分散的欺骗性宣传活动和虚假活跃度相关规则整合起来,涵盖所有政治或商业领域的欺骗性活动,包括为影响力行动构建工具。选举相关章节更名为“不得破坏民主进程”(不得破坏民主进程),取消了对个性化选民定向活动的一概禁止,因为这项禁令此前阻碍了用其他语言向选民提供信息等公民事务用途。文本还明确,武器禁令涵盖相关软件、组件以及无人机武装化,禁止未经同意追踪个人,并且仅在极端情况下,禁止持续、无端地辱虐模型。

🔗 Anthropic 博文:2026 年使用政策更新

OpenAI 拆解 Dark Clark 和 Bogus Bylines,其中包括其首个第 5 级行动

10月8日 — OpenAI 发布报告,介绍其封禁的两场秘密影响力行动。这些行动借助其模型维持虚假门面实体(false front)的运作。来自俄罗斯的“Dark Clark”以拉丁美洲为目标:操作者主要用 ChatGPT 撰写内部报告,并运营一个由虚构人物“米娅·克拉克”主持的伪研究中心 Social Research Center。来自伊朗的“Bogus Bylines”使用七名虚构西方记者的署名,在十余家在线媒体上投放了近 100 篇文章,其中一家媒体在 Facebook 上拥有近 2 百万名关注者。OpenAI 表示,两年半来已揭露 30 场此类行动。

被拆解的行动账号来源主要目标IO Breakout Scale 等级(1 至 6)
Dark Clark俄罗斯拉丁美洲5,据 OpenAI 称为首次
Bogus Bylines,文章伊朗国际在线媒体4
Bogus Bylines,评论伊朗社交网络2

🔗 OpenAI 关于虚假门面行动的报告


第三方工具中的 Claude Haiku 5.5:GitHub Copilot 从 Pro 套餐起开放,Devin 测得 58,4 %

Claude Haiku 5.5 于10月7日发布,当天便进入两款编程工具,两者都将其与 Claude Sonnet 5 进行比较。

GitHub Copilot:所有付费套餐均可使用 Haiku 5.5,包括 Pro

10月7日 — Anthropic 发布 Claude Haiku 5.5 两个多小时后,该模型便在 GitHub Copilot 的 Pro、Pro+、Max、Business 和 Enterprise 套餐中正式开放:与 Claude Sonnet 5.5 一样包含 Pro 套餐,这与9月底的 GPT-6.1 Sol 不同。从 VS Code 到 Xcode,用户可在十个使用界面中选择它。GitHub 将其定位于子智能体、快速修改和终端任务;据早期测试,它在许多编程任务上达到了 Claude Sonnet 5 的水平,同时使用的 tokens 和步骤明显更少,但未公布具体数字。它按公开价格计费:输入不超过 100 000 tokens 时,每百万输入 tokens 为 0,10 美元,每百万输出 tokens 为 0,50 美元;超过这一阈值后,分别为 0,50 和 2,50 美元,即第一档价格仅为 Claude Haiku 4.5 的十分之一。

🔗 GitHub Copilot 中的 Claude Haiku 5.5 · GitHub Copilot 的模型与价格

Devin:FrontierCode 1.1 得分 58,4 %,领先 Claude Sonnet 5

10月7日 — Cognition 在 Devin 中开放 Claude Haiku 5.5。其自有 benchmark FrontierCode 1.1 根据代码质量和能否合并,对模型在真实工程任务中的表现评分。Haiku 5.5 获得 58,4 %,领先 Claude Sonnet 5;据 Cognition 称,每项任务的成本约为后者的八分之一,但未给出具体金额。它也加入了 Devin Fusion 的辅助模型(sidekicks)阵容。Fusion 将主模型与辅助模型搭配使用:以 Claude Opus 5.5 为主模型、Haiku 5.5 为辅助模型时,Fusion 保持了 66,2 的得分,同时降低了成本和延迟。

Cognition 评测的模型FrontierCode 1.1 Extended 得分
Claude Sonnet 556,2
Kimi K358,2
Claude Haiku 5.558,4
GPT-6.1 Sol60,4
Claude Sonnet 5.564,4
Claude Opus 5.565,3

🔗 Devin 中的 Claude Haiku 5.5


编程智能体:Claude Code 2.1.295、Codex CLI 0.162.0、Antigravity CLI 1.3.1、VS Code 1.141 和 Delta 0.19

五款编程智能体工具迎来更新:Claude Code 加强 hooks 的约束,Codex CLI 管理 worktrees,Antigravity CLI 重新设计修改审阅流程,VS Code 将智能体会话排列成网格,Delta 则扩展团队协作能力。

Claude Code 2.1.295:hooks 失败时阻止操作

10月8日 — Claude Code 在一天内发布了两个版本。2.1.294 修复了以自然语言指令编写的 hooks prompt 和 agent,此前它们可能放行本应阻止的操作。2.1.295 包含 143 条更新,其中 97 项为修复。command 和 HTTP hooks 新增 onFailure: "block" 选项后,无法启动、超时或返回意外代码的 hook 会阻止操作,而不是放行;针对 mods 防护机制以及 --tools 和 --restricted 选项的多项修复也朝同一方向加强约束。Claude Code 还支持 Program Status Protocol(OSC 7501),使兼容终端能够显示智能体正在工作、等待还是已完成;通过工具搜索加载的 MCP 工具描述长度,也从 2 048 增至 16 384 个字符。

🔗 Claude Code 2.1.295 · Claude Code 2.1.294

Codex CLI 0.162.0:受管理的 worktrees 与固定任务

10月8日 — Codex CLI 0.162.0 是继前一天的 0.161.0 之后发布的首个稳定版本,列出了 225 个 PR。启用 worktrees 功能后,Codex 可使用工具,从受信任的本地项目创建并列出由其管理的 Git worktrees;智能体指挥中心则允许按 p 键固定任务,放入一个在服务器支持时可共享的“Pinned”分组。终端新增 /copy,用于浏览和复制会话记录中的内容块,新增 Ctrl+Insert,用于复制选区,并增加滚动速度设置;URL 在审批界面和 MCP 提示中也变得可点击。兼容 Responses API 的自定义模型提供商可以声明支持实时网页访问和远程上下文压缩。修复方面,apply_patch 会保留 CRLF 换行符,Linux 沙箱得到加固,Windows 版本则获得带签名的 PowerShell 安装程序。

🔗 Codex CLI 0.162.0 版本说明

Antigravity CLI 1.3.1:重新设计 /diff 审阅流程,默认采用中等详细程度

10月7日 — Antigravity CLI 在10月2日至7日期间发布了五个版本。1.3.1 改进了终端中的代码审阅体验:在 /diff 的文件视图中,左右方向键会打开相邻文件并定位到首处修改,每个文件都会记住浏览位置,n 和 N 可接着跳转至下一个或上一个文件,顶部标题则显示当前位置。其十项修复涉及超长对话中的 /rewind、Windows 插件,以及使用 GEMINI_API_KEY 密钥的会话;这些会话会在 Gemini API 连接中断时重试。10月6日发布的 1.3.0 将默认详细程度从“high”改为“medium”,把工具调用和思考过程整合为简洁摘要;/config 可切回原设置。更早的 1.2.16 将图像生成交给内置子智能体,1.2.15 则为 Termux 提供了 Android 二进制文件。

🔗 Antigravity 更新日志,CLI 选项卡

VS Code 1.141:网格排列的智能体会话与 worktrees 清理

10月7日 — VS Code 1.141 聚焦 Copilot 智能体会话。Agents 窗口可将多个会话排列成网格,Chat: Open Worktree Cleanup 命令则会显示非活跃会话的 worktrees 占用的磁盘空间,以便手动删除,或在 pull request 合并后自动删除。在 Copilot CLI 或 GitHub Copilot 应用中发起的对话,从首次请求起就会出现在编辑器中,无需重新加载;在 ChatGPT 应用或 Codex CLI 中开启的 Codex 对话,也可携带历史记录在这里继续:选择 Copilot 模型后,便可使用 GitHub Copilot 订阅继续对话,例如在达到 ChatGPT 使用上限后。企业方面,可通过受管理的设置强制启用 Copilot 执行框架的沙箱,这项能力处于预览阶段;对于启用了实验功能的用户,该执行框架也正逐步成为默认选项。

🔗 VS Code 1.141 版本说明

Delta 0.19:提及队友与收件箱

10月7日 — Zed Industries 发布 Delta 0.19.0,这是一个支持多人借助智能体共同编程的环境;10月8日又发布了修复版本 0.19.1。如今,在消息或评论中输入 @ 并跟上队友的用户名,即可提及对方,通知会进入新增的收件箱(Inbox)。@delta 智能体可在对话中读取和修改大部分设置。Agent Thread Creation 设置可阻止智能体创建顶层对话,同时保留子智能体;智能体能够合并多个对话线程的 worktrees,CLI 命令也可在不打开窗口的情况下执行。版本说明共列出 11 项新功能、22 项改进和 45 项修复。10月8日,Zed 转发的一篇博文讲述了团队如何用 Delta 替代 Google Docs 来处理内部文档。

🔗 Delta 版本说明 · Delta 关于弃用 Google Docs 的博文


生成式媒体:Nano Banana 2.1、ElevenLabs 的 Brand Kit 与在巴西推出的 ElevenReader、Stability AI 的 SemanTok

围绕图像、视频和语音的四项公告:Google 推出价格减半的图像模型,ElevenLabs 提供可重复使用的视觉规范和有声阅读应用,Stability AI 则公布视频生成研究。

Nano Banana 2.1 在 Gemini API 中正式开放,价格减半

10月6日 — Google 将 Nano Banana 2.1(gemini-nano-banana-2.1)在 Gemini API 和 Google AI Studio 中转为正式可用,未发布博文。这款图像生成与编辑模型是 Nano Banana 2 的更新版,提升了视觉质量和文字渲染效果,使角色在多轮交互中更加一致,并支持从 1:4 到 8:1 的全景比例,在 2K 和 4K 下不会出现拼接伪影。它最多接受 14 张参考图像,并利用 Google 搜索提供依据。1K 和 2K 图像的单张价格减半,Google 同时宣布弃用 Nano Banana 2(gemini-3.1-flash-image),但未公布停用日期。

输出价格Nano Banana 2.1Nano Banana 2
1K 图像0,0336 dollar0,067 dollar
2K 图像0,0504 dollar0,101 dollar
4K 图像0,113 dollar0,151 dollar
百万图像 tokens30 dollars60 dollars

🔗 Gemini API 版本说明 · Nano Banana 2.1 模型说明

ElevenLabs Brand Kit:将视觉规范存入工作区

10月8日 — ElevenLabs 为其创作套件 ElevenCreative 添加 Brand Kit。颜色、字体、标志及其使用规则、参考图像和品牌规范,包括品牌绝不会做的事情,都整合为工作区中的一个对象,可在 Image & Video、Flows 或与 ElevenCreative 智能体交互时,通过 @ 调用。根据 ElevenLabs 的帖子串,粘贴网站地址或上传组织的素材,即可在几分钟内创建一个套件;随后整个团队都能依据相同指令生成内容,代理机构也可为每位客户创建独立套件。ElevenLabs 希望将这些套件扩展至品牌语音和声音,但未给出时间。Brand Kit 现已开放,未公布价格;HeyGen(8月)和 Runway(9月)已提供类似工具。

🔗 ElevenLabs 博文:Brand Kit · @ElevenLabs 帖子串

Stability AI SemanTok:201M 模型达到规模为其 3,4 倍的模型水平

10月7日 — Stability AI 的 Interactive Research 团队介绍了 SemanTok,这是一款面向逐 token 生成视频的世界模型(world models)的视频 tokenizer,并于10月8日在 X 上宣布。在“由粗到细”(coarse-to-fine)的 tokenizers 中,最初的 tokens 描述整个场景,后续 tokens 再补充细节;SemanTok 让这些最初的 tokens 承载更丰富的语义,因此更容易预测。为此,它将冻结的 DINO 特征注入编码器,并添加轻量预测头,从每个 tokens 前缀重建这些特征。据 Stability AI 称,基于 SemanTok 构建的 201M 参数自回归模型,可以达到或超过规模为其 3,4 倍的 VideoFlexTok 模型,且预测较短前缀的成本更低。论文已发布在 arXiv;未提及代码或权重。

🔗 Stability AI 研究博文 · arXiv 论文

ElevenReader 登陆巴西,提供法比奥·波尔沙的声音和 70 000 本图书

10 月 8 日 — ElevenLabs 在巴西推出 ElevenReader。这款应用可将图书、文档和文章转为音频,在 iOS 和 Android 上免费提供,并采用演员兼喜剧演员法比奥·波尔沙的声音。其书目来自与 Bookwire Brasil 的合作:70 000 部巴西葡萄牙语作品,获得该国主要出版商授权,其中大多数此前没有音频版。ElevenLabs 还制作了马沙多·德·阿西斯的《Dom Casmurro》,由法比奥·波尔沙朗读,并配有原创音乐和声音设计。Bookwire Brasil 总经理表示,这是迄今以音频形式提供的最丰富的巴西图书合集。

巴西提供的内容访问条件
ElevenReader 应用 (iOS, Android)免费
法比奥·波尔沙朗读的 Dom Casmurro所有人均可免费收听
Bookwire 授权的 70 000 部作品需订阅 ElevenReader Ultra,价格未公布

🔗 ElevenLabs 博文:ElevenReader 登陆巴西


专用模型:处理文档的 LightOnOCR-3、识别阿拉伯语的 Falcon-ASR、分析基因组的 Carbon-A

三款专用模型,其中两款开放权重,分别用于读取文档、转录阿拉伯语和注释基因组。

LightOnOCR-3:三款开放的 OCR 模型,还能识别版面布局

10 月 8 日 — LightOn 以 Apache 2.0 许可证发布 LightOnOCR-3,提供三种规模(0.8B、1B 和 4B)。除了转录页面内容,这些模型还能识别页面中的各个区域:使用视觉定位(grounding)提示词时,每个内容块前都会附上带标签的边界框,图像会得到简短描述,图表则会转换为 HTML 数据表格。在 H100 上,4B 模型每秒处理的页面数比 Chandra-OCR-2 多 21 %,后者和它一样基于 Qwen3.5 构建。LightOn 指出,其评分是在对输出进行归一化后计算的;这套归一化方法随仓库一并发布,会显著改变所有领先模型的评分。

评测基准LightOnOCR-3-4BLightOnOCR-3-0.8BLightOnOCR-3-1B所引对照结果
olmOCR-Bench,总分86,385,584,5Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8
ParseBench,五个类别75,174,671,4Infinity Parser Pro 74,3
fr-bench-pdf2md,法语文档74,170,569,6Chandra 2 69,0 ; MistralOCR4.1 54,1

🔗 LightOnOCR-3 博文

Falcon-ASR:面向阿联酋阿拉伯语的 16 亿参数模型,尚未公开权重

10 月 7 日 — 阿布扎比的技术创新研究院(TII)推出 Falcon-ASR。这款语音识别模型拥有 16 亿参数,聚焦阿拉伯语,尤其是阿联酋方言。同一套权重还可转录英语、法语、西班牙语和葡萄牙语,无需指定语言,并为每个词提供时间戳。与前一天发布的 Falcon-OCR-Arabic 和 Falcon-Emirati 一样,它目前仅提供演示:TII 宣布将提供 API 访问和原生应用,但未公开权重。

词错误率 (WER) 评测Falcon-ASR 得分所引对照结果
六个阿拉伯语数据集的平均值 (Open Universal Arabic ASR)20,92 %23,17 %,截至 9 月 30 日公布的最佳结果
阿联酋方言,TII 内部评测22,73 %Qwen3-Omni 排名第二,比它高 4,07 个百分点
七个英语数据集的平均值 (Open ASR Leaderboard)5,74 %未引用对照结果

🔗 Falcon-ASR 博文

Carbon-A:22 617 个物种中的 5.66 亿个候选基因

10 月 8 日 — Hugging Face 的生物学团队(HuggingFaceBio)发布 Carbon-A。这款采用 MIT 许可证的模型拥有 12 亿参数,可直接在 ADN 中识别蛋白质编码区域,同一个模型即可处理哺乳动物、植物、真菌和原生生物。在 42 个参考基因组上,其平均核苷酸级 F1 达到 0.944;作者称,它超越了参与比较的全部七款工具,包括 AUGUSTUS、Helixer 和 Tiberius。团队将其应用于 GenBank 的真核生物基因组,构建了 Carbon Annotation Database:涵盖 22 617 个分类单元的 48 167 个组装,以及 5.66 亿个预测编码位点,分类单元数量是训练语料的 11 倍。团队与 ActiveSite 和 UCSD 合作,通过全长 ARN 测序开展实验室验证,确认了部分基因;作者强调,这证明了转录,尚未证明蛋白质的产生。新一批结果计划在三周后发布。

🔗 Carbon-A 博文


强化学习训练:TermGrade 的 1 004 个环境与 TRL v1.15.0

两项面向强化学习的发布:经过评分的终端环境,以及可训练更长序列的库。

TermGrade:由六款模型评测的 1 004 个终端环境

10 月 8 日 — ai& 公司发布 TermGrade,提供 1 004 个终端环境,用于通过强化学习训练和评估智能体。每项任务都在 Linux 容器中运行,包含任务说明和测试,只有其自身的参考解答通过测试才会被保留:DeepSeek-V4-Pro 编写的 66 165 项候选任务中,仅 1.5 % 通过了这道筛选。从 Kimi-K3 到 gemma-4-31B-it,六种开放模型配置都尝试了每项任务,全部 36 144 次尝试均已公开,包括失败的尝试。模型从成功率约为一半的任务中学到的最多:在这一区间的 151 项任务上训练后,gemma-4-31B-it 在 Terminal-Bench 2.1 上达到 46.1,比基础模型高 3.1 分;五次训练的平均提升为 2.1 分。所有内容均以 Apache-2.0 许可证发布。

🔗 TermGrade 博文 · Hugging Face 上的 TermGrade 合集

TRL v1.15.0:融合 LM 头,序列长度最高可达原来的 6.9 倍

10 月 8 日 — Hugging Face 的训练库 TRL v1.15.0 引入了融合 LM 头(fused LM head),通过 Triton 内核直接计算每个 token 的对数概率和熵,无需构建完整的 logits 张量;SFT、DPO、KTO、GRPO、RLOO 和蒸馏均默认启用这一功能。在 8 192 个 token 的序列长度下,峰值显存用量根据方法不同下降 52 至 82 %。这些测量使用一张显存限制为 79 Gio 的 B300,以及 gemma-3-1b 的随机权重;该模型的词表包含 262 000 个 token,因此词表较大的小模型获益最明显。该版本还引入了不兼容变更:停止支持 Python 3.10,弃用 use_liger_kernel,并移除实验性 MiniLLM 训练器。

训练方法v1.14.2 中的最大长度 (tokens)v1.15.0 中的最大长度 (tokens)提升倍数
DPO10 24059 392×5,80
KTO (批量为 2)9 21663 488×6,89
GRPO28 672114 688×4,00
RLOO23 552100 352×4,26
SFT (nll 损失)20 480107 520×5,25

🔗 TRL v1.15.0 版本说明


推理:Windows ML 集成 llama.cpp、ML Drift 开源、Together AI 使用 IBM Cloud 的 B300

三项模型运行相关公告,覆盖从 Windows 个人电脑到 GPU 集群的场景。

llama.cpp 以实验性功能进入 Windows ML

10 月 7 日 — 在 Windows 活动上,Microsoft 为其本地推理框架 Windows ML 添加了对 llama.cpp 的实验性支持:用户可从 Hugging Face 获取 GGUF 模型,通过同一套 Windows ML 软件栈,借助面向特定任务的新 API 在本地运行。更底层的 Windows 原生执行 API 也进入实验性预览阶段。Microsoft 表示,正与 NVIDIA 和社区一起直接为 llama.cpp 项目作出贡献,包括优化 CUDA 内核、改善处理器与 GPU 之间的调度、CUDA graphs、推测解码(Eagle-3、MTP、D-Flash2)、多 GPU 执行和 NVFP4 格式。博文将这些新功能置于搭载 NVIDIA RTX Spark 芯片的个人电脑场景中,例如 Surface Laptop Ultra。在 X 上,llama.cpp 的格奥尔基·格尔加诺夫对该项目亮相 Windows 活动表示欢迎,并认为这标志着软件栈与硬件栈终于走到了一起。

🔗 Microsoft Foundry on Windows 博文 · @ggerganov 的推文

ML Drift:LiteRT 的 GPU 引擎开源发布

10 月 8 日 — Google AI Edge 团队以 Apache 2.0 许可证开源 ML Drift,这是其用于设备端推理的 GPU 计算引擎。它屏蔽了 OpenGL ES、OpenCL、Metal 和 WebGPU 之间的差异,为 LiteRT 提供 GPU 加速,也可作为独立库使用,并接替不再新增功能的 TensorFlow Lite GPU 委托组件。该引擎会根据 LLM 正在读取提示词还是生成 token 来切换内核,并提供 SKILL.md 指南,帮助编程智能体编写和验证着色器。它已经用于生产环境:据博文介绍,YouTube Shorts 特效的单帧延迟最多降低 40 %,移动端 Lightroom 和 Photoshop 的性能最多提升 30 %;在 Gemma 上,Google 测得其内存用量比其他软件框架(frameworks)最多低 12 %。

🔗 Google Developers Blog 上的 ML Drift 公告 · google-ai-edge/ml-drift 仓库

Together AI 成为 IBM Cloud 上 B300 GPU 推理集群的首个客户

10 月 6 日 — Together AI 宣布与 IBM 和 NVIDIA 合作,扩展面向企业的推理能力,首先部署托管于 IBM Cloud 的大型 NVIDIA B300 GPU 集群,并通过 NVIDIA 的 Spectrum-X 以太网连接。据 Together AI 介绍,这是 IBM Cloud 上首个达到这一规模的专用推理集群,该公司也是其首个客户:Together AI 运营推理层,IBM 提供云服务,NVIDIA 提供芯片和网络。Together AI 将此次扩容归因于开放模型的需求:该公司称,每月为超过一百万名开发者处理数百万亿个 token。博文未公布集群规模或时间安排。

🔗 Together AI 博文 · @togethercompute 的推文


简讯

  • 更快地调整 Codex 的执行方向 — 在 ChatGPT 桌面应用中,Codex 会更早处理任务执行期间收到的后续消息,以便修正方法或改变方向;“后续消息行为”设置用于选择这些消息是引导当前执行,还是等待下一次执行。 🔗 来源
  • Warp 支持 ChatGPT Go — ChatGPT Go 订阅用户现在可以在 Warp 中使用该订阅,处理各类终端问题或编码任务;据 Warp 引述的 OpenAI“使用 ChatGPT 登录”团队成员介绍,所有合作应用中的订阅内含用量现已向 Go 用户开放,此前已支持 Plus 和 Pro 用户。 🔗 来源
  • Oracle — 根据 OpenAI 的一项案例研究,Oracle 拥有 130 000 名 ChatGPT 活跃用户和超过 95 000 名 Codex 活跃用户;一项原本需要 2 至 4 天准备的人才市场研究,现在只需 15 至 20 分钟,Codex 还能将业务问题转换为 SQL 查询。 🔗 来源
  • Pollo AI — 这家视频创作平台宣称拥有超过 2 600 万用户,使用 GPT-5.6 路由其代理的请求,将困难任务交给 GPT-6 Astra,所有图像任务则交给 GPT-Image-2.5,并表示选择模型所花费的时间减少了超过 50 %。 🔗 来源
  • Devin 10 月 7 日版本说明 — 通知收件箱集中展示各个会话的提醒,并可设置是否推送到手机;合并队列的状态会显示在整个应用中;作为机密信息保存的私钥会在命令输出中逐行隐藏。 🔗 来源
  • Copilot CLI 1.0.94 — 经过六个预览版本后,该版本进入稳定发布阶段,在模型选择器中加入 Claude Haiku 5.5,将显示的 shell 代码传给 Assisted Permissions 的判定组件,以避免不必要的审批,并允许在发现 MCP 服务器之前启用它。 🔗 来源
  • Gemini CLI v0.65.0-nightly.20261008 — 遥测现已支持自定义 OTLP 请求头(telemetry.otlpHeaders),这是自 2025 年 10 月以来一直待解决的请求;CLI 不再在验证与 OAuth 之间循环,历史记录也始终以用户消息结束,从而避免在 /rewind 之后出现 400 错误。 🔗 来源
  • Antigravity SDK 0.1.21 隔离实验性 API,并支持配置子代理的 skills — 这是自 9 月 21 日的 0.1.18 以来首个列入更新日志的版本:装饰器 @beta 和模块 google.antigravity.beta 将预览版与稳定 API 分离,skills_config 则允许子代理继承父代理的 skills、替换它们或不使用任何 skills。 🔗 来源
  • Developer Knowledge API — Google 介绍了这项 API 的生态系统,它以最新的 Markdown 格式提供开发者文档(Google Cloud、Firebase、Android):包括 Cloud Shell 中预装的命令 gcloud developer-knowledge、连接到 MCP 服务器的编码代理技能,并提到 Antigravity、Claude Code、Cursor 和 GitHub Copilot,以及七种语言的库。 🔗 来源
  • AQuA — Google Cloud 发布了这个质量代理(Ambient Quality Agent)作为参考实现,它会从生产环境中的 ADK 代理采样最多 1 000 个会话,将失败情况分组,在 BigQuery 中跟踪,并使用 Gemini 3.8 Flash 诊断原因。 🔗 来源
  • 草稿也计入拉取请求数量限制 — 为应对低质量贡献,GitHub 允许将草稿拉取请求纳入每位用户的数量限制,而此前贡献者可以无限制地创建草稿。 🔗 来源
  • 归档拉取请求 — 这项操作不再仅限于管理员:triage、write、maintain 和 admin 角色都可以归档拉取请求,这会将其关闭、对公众隐藏,并阻止所有后续活动,包括管理员发表评论。 🔗 来源
  • GitHub 时间线与屏幕阅读器 — 在 github.com 和 GitHub Enterprise Server 3.23 上,屏幕阅读器会将议题和拉取请求的时间线作为列表浏览,读出条目总数和当前位置,并播报已加载的事件。 🔗 来源
  • Paper Reproductions with ML Intern — 阿布巴卡尔·阿比德宣布,Hugging Face 推出一项功能,可从 Paper Pages 将已发表论文中的实验交给代理独立复现,产出开放的成果,帮助识别扎实可靠的研究;未提供数据或文档。 🔗 来源
  • 通过 SSH 使用 Hugging Face 聊天 — Hugging Face 基础设施负责人阿德里安·卡雷拉展示了一项开放模型聊天服务,可通过命令 ssh chat.hf.co 访问,无需配置或密钥;未附带文档或模型列表。 🔗 来源
  • huggingface_hub 2.2.0 — 一个小型修复版本:hf jobs stats 现在返回快照后便交还控制权(使用 -f 可实时跟踪),所有并行下载都通过 hf_xet 进行,另有两项变更破坏了兼容性。 🔗 来源
  • swarmlab — Hugging Face 在未发布公告的情况下开放了这个测试平台,用于研究不同供应商的 LLM 代理群如何根据通信拓扑、延迟和角色找到真相或产生分歧;只需一行 YAML 即可测试一个假设。 🔗 来源
  • Darwin-27B-ZTC — VIDRAFT 以 Apache-2.0 许可证发布了一个评判模型,可在单次处理过程中返回所有可能答案的概率分布,无需生成 token:据作者介绍,它在 typed-decisions 的 2 000 项判断中取得了 0.743 的零样本准确率,Brier 分数为 0.097。 🔗 来源
  • Superfluid — basecompute 以 Apache-2.0 许可证发布了这款本地 LLM 服务器,兼容 OpenAI、Anthropic 和 Ollama 的 API,并优先处理交互式问题,再处理代理任务:据作者介绍,在八个代理处于活动状态时,其响应时间为 0.36 秒,而 llama-server 超过 10 秒。 🔗 来源
  • funes 1.8.0 — 这款为编码代理会话建立索引的工具新增了多语言嵌入模型:针对 2 000 段中文对话提出的 30 个问题,正确对话全部进入前八个结果,而此前为 23 次;平均倒数排名从 0.601 提升至 0.983。 🔗 来源
  • GLiNER 与印度语言 — 一篇社区文章显示,只需保留词中的组合字符,无需重新训练,GLiNER2 在九种印度语言上的平均零样本 F1 就从 13.2 提升至 68.0,经过印地语微调的模型则从 59.9 提升至 82.6。 🔗 来源
  • Multilingual Terminal-Bench — LILT 详细介绍了这个包含十种语言、324 项编码任务的测试平台:Claude Opus 5.5 的成绩比 Opus 5 高约 3 分,所用 tokens 减少 30 %,每项任务的成本因此降低约 45 %;Gemini 3.8 Flash 每项任务的交互轮数中位数为 41,而 GPT-6 Sol 为 5。 🔗 来源
  • GPU 集合通信原语 — 米洛什·科特拉尔预测了五种原语在四块 RTX 4090 上的通信时间,平均误差为 10.9 %,通用模型则为 22.9 %,但最差情况下的误差达到 61.6 %。 🔗 来源
  • 视频推理中的 Best-of-N — facebookresearch 在未发布公告的情况下,以非商业许可证 CC BY-NC 4.0 上线了《选择还是求解?》研究的代码,该研究探讨视频推理中的 best-of-N 选择与验证器评审团。 🔗 来源
  • KDD Cup 2026 Data Agents — NVIDIA 详细介绍了让其 KGMON 团队在必须使用小型 LLM 的条件下获得第二名的运行框架:将数据转换为 SQLite 表,一开始就提供数据库模式,使用少量工具,并有针对性地读取文档;文章未提供分数或模型名称。 🔗 来源
  • Microduck — Pollen Robotics 的马蒂厄·拉佩尔宣布,这款配备全新自研电路板的小型双足机器人使用 2 600 mAh 电池可续航超过三小时,处理器最高温度从 114 °C 降至 60 °C。 🔗 来源
  • Suno 专辑功能 — 这项于 10 月 5 日介绍的功能已经上线:用户可以将歌曲整合为完整作品,选择封面、排列曲目,并在希望的时间发布;未说明适用套餐或曲目数量限制。 🔗 来源
  • HeyGen 与瑞安·瑟汉特 — HeyGen 推出每日视频系列,由房地产经纪人瑞安·瑟汉特的官方数字分身主持,并在 Instagram、TikTok 和 X 上发布;他曾出现在 Netflix 剧集《曼哈顿地产风云》中;未披露财务细节。 🔗 来源
  • Runway 与 Tech Coalition — Runway 加入了这个打击网络儿童性剥削的联盟及其跨平台共享信号的 Lantern 项目,并重申其防护措施:数据过滤、对抗性测试、哈希处理、向 NCMEC 报告以及 C2PA 来源溯源。 🔗 来源
  • SpaceXAI 与 Omarchy — SpaceXAI 以价值 150 万美元的 Grok tokens 成为 Omacom Foundation 的创始赞助方;Grok 4.7 及其后续版本将为该项目的代理提供支持,其中包括负责审查拉取请求的 Omabot。 🔗 来源
  • Perplexity 防护措施指南 — Perplexity 发布了一份指南,将人工智能防护措施设置在三个环节(输入、代理执行操作、输出),比较五类保护措施,并展示从提示注入到幻觉的七个案例;未推出新功能。 🔗 来源
  • OpenRouter 上的 pplx-decider-v1.1-27b — Perplexity 的开放权重决策模型登陆 OpenRouter,采用 Decisions API 的定价:输入每百万 tokens 收费 0.02 美元,输出免费,上下文长度为 262 000 tokens。 🔗 来源
  • Cohere 在渥太华设立办公室 — Cohere 在兰斯当公园附近开设了首个渥太华办公室,已有近 30 名员工在那里工作,涉及市场推广、工程、基础设施、安全和主权人工智能;未披露面积或人员规模目标。 🔗 来源

这意味着什么

助手现在产出的已经是可供使用的工作成果,而不只是回答。Claude Dashboards 仪表板会随着数据变化而更新,Claude Motion 动画因为以代码编写,仍可逐字修改;面向所有套餐结束测试阶段的 Docs、Slides 和 Design,则宣称已累计创作超过 4 500 万件作品。这些成果随后流转到现有工具中:仪表板可以导入 Grafana 或 PostHog,动画可以导入 Runway 或 Luma,由它们添加生成的镜头。ElevenLabs 的 Brand Kit 也遵循同样的逻辑:品牌视觉规范成为工作空间中的一个对象,可通过 @ 调用,无需在每条提示中重复说明。

安全防护与规则执行的规模都在扩大。Anthropic 发现,寻找漏洞从未如此容易:六个月内发现了超过 29 000 个疑似漏洞,其中约 6 000 个经过人工筛查。OSS Scanner 明确选择在未经人工复核的情况下发送报告,预计真阳性率超过 90 %,以缓解这一瓶颈。与此同时,使用规则也变得更加明确:Anthropic 的 2026 年政策将欺骗性活动归入专门章节,OpenAI 则将 Dark Clark 称为自开始发布相关报告以来首次瓦解的第 5 类行动。在工具层面,Claude Code 2.1.295 现在会让发生故障的 hook 阻止操作,而不再放行。

速度和价格正在成为可以自行选择的设置。Ultrafast 以六倍的价格提供 GPT-6.1 Sol,速度最高可达八倍;据 GitHub 和 Cognition 介绍,Claude Haiku 5.5 在编码方面与 Sonnet 5 持平或更优,而据 Cognition 计算,其每项任务的成本约为后者的八分之一;Nano Banana 2.1 则将一张 1K 图像的价格减半。推理部署从设备端延伸至集群端:设备端包括 Windows ML 中的 llama.cpp,以及在手机和电脑 GPU 上运行的 ML Drift;集群端则包括 IBM Cloud 上的 B300 集群,Together AI 是其首位客户。TRL 还将长度为 8 192 tokens 的训练所需峰值内存降低了 52 至 82 %。

最后,今天的许多数据都由发布者自行测量。FrontierCode 是 Cognition 的专有基准测试,GitHub 表示 Haiku 5.5 与 Sonnet 5 持平,却没有公布数据;LightOn 在进行会改变所有领先模型分数的归一化后计算成绩;TII 仅在内部数据集上评估 Falcon-ASR 对阿联酋阿拉伯语的表现,也没有发布其权重;Carbon-A 的作者则自行将其与七款工具比较。开放科学提供了另一种参照:TermGrade 发布了全部 36 144 次尝试,包括失败记录;Carbon-A 发布了包含 5.66 亿个候选基因的数据库;Claude Science 的紫外线图则逐像素区分测量结果与预测结果。Anthropic 的 1.5 亿美元和 NVIDIA 为 Genesis Mission 投入的 10 亿美元,也都推动着同一方向:将这些工具交到研究人员手中。


来源