ai-powered-markdown-translator文章使用 gpt-6.1-sol 从法语翻译为中文。
Mistral 开放了 Mistral Large 4 的预览版。这款多模态模型拥有 1 万亿参数,其 API 从今天起向所有人开放,模型权重则承诺于十月底公布。Anthropic 将 Claude 引入 Google Docs、Sheets 和 Slides,并将其网络安全验证计划重组为三个访问级别;与此同时,Google DeepMind 发布了 EmbeddingGemma 2,这是一款能在手机上运行的开放多模态嵌入模型。决策模型今天也迎来了新进展:OpenAI 将 Decisions API 开放为公开测试版,Perplexity 将价格减半,社区排行榜则对它们进行了比较排名。
Mistral Large 4:万亿参数模型开放预览,权重承诺于十月底公布
10 月 6 日 — Mistral AI 推出了 Mistral Large 4 的公开预览版,简称 ML4,另一个“非常正式”的昵称是 Chonk。这是该公司迄今为止最大的模型:采用原生多模态混合专家架构(Mixture-of-Experts),拥有 1 万亿参数(1T),公告文章称其中活跃参数为 490 亿,在百万词元的上下文中融合了指令遵循、推理和智能体能力。文档中的资料页给出了另一组数字,却没有解释差异:总参数量为 1,05 万亿,其中活跃参数为 520 亿,另有一个 16 亿参数的视觉编码器。
API 从今天起通过 Mistral Studio 向所有人开放,但权重尚未发布:Mistral 承诺在十月底之前公布权重,并提供架构和后训练的详细信息。在此之前,网络安全负责人、经过验证的合作伙伴和政府机构正在真实环境中测试该模型,他们使用模型时受到的内容审核限制较少。ML4 在 Mistral 的欧洲数据中心使用 3 800 块 NVIDIA Grace Blackwell GPU 从零开始训练,这些数据中心也为预览版提供服务。公司计划在欧洲部署该模型,由其全程运营,并受欧洲法律管辖;公司还将该模型称为其 30 亿欧元 D 轮融资所支持路线图的首个里程碑。
网络安全是其主要卖点。根据 Mistral 的说法,ML4 位列 Artificial Analysis Cyber Index 的前五名,并在其中一项测试中取得了 82 % 的成绩,居所有模型之首。该测试要求复现开源软件中的一个真实漏洞,然后将其修复。公司声称,Claude Opus 5.5 和 GPT-6 Astra 在同一测试中的得分接近零,因为它们拒绝执行任务。
| 评测基准 | Mistral 公布的得分 | Mistral 引用的比较结果 |
|---|---|---|
| DeepSWE v1.1 | 61,7 % | — |
| Coding Agent Index(综合) | 49,8 % | 领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max |
| Surge AI 人工盲评(代码,5 分制) | 3,74,5 个模型中排名第 2 | 落后于 Claude Opus 5(4,22) |
| Cybench(40 项挑战) | 93 % | — |
| AA Cyber Index,复现并修复漏洞 | 82 % | 所有模型中的最高分 |
| AutomationBench(657 项业务流程) | 59,9 % | 领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro |
公告文章和资料页的价格也不一致:文章中的卡片显示,每百万输入词元收费 1,36 美元,每百万输出词元收费 4,18 美元;资料页则划掉了这两个价格,并在旁边标出减半后的价格,却没有说明持续时间或原因。
| ML4 特性 | 公告文章中的信息 | 文档资料页中的信息 |
|---|---|---|
| 参数总量 | 1 000 十亿 | 1 050 十亿 |
| 活跃参数量 | 49 十亿 | 52 十亿 |
| 输入,每百万词元 | 1,36 美元 | 0,68 美元(1,36 已划掉) |
| 输出,每百万词元 | 4,18 美元 | 2,09 美元(4,18 已划掉) |
这些分数均由 Mistral 提供。公司表示,预览版的强化学习仍在继续,尚未出现饱和迹象,并预计未来几周将取得快速进展。
🔗 Mistral 关于 Mistral Large 4 的公告文章 🔗 文档中的 Mistral Large 4 资料页
Claude for Google Workspace:Claude 进驻 Docs、Sheets 和 Slides
10 月 6 日 — Anthropic 推出了 Claude for Google Workspace。这款附加组件(add-on)让用户能够在 Google Docs、Sheets 和 Slides 的侧边栏中使用 Claude,公开测试版面向所有付费套餐开放。Claude 会读取当前打开的文件,查看当前选中的内容(文本、单元格或幻灯片),并直接修改文件。
| Google 应用 | Claude 在其中的功能 |
|---|---|
| Docs | 直接进行纠错和风格调整;对于幅度较大的改写,提供可应用或忽略的建议卡片 |
| Sheets | 创建公式、数据透视表、原生图表和新工作表;通过 Python 处理选定范围的数据,以进行连接或清理 |
| Slides | 根据演示文稿的版式和主题制作幻灯片,检查重叠或超出边界的元素 |
用户可以选择自主程度:在默认启用的“修改前询问”模式(Ask before edits)下,每次修改都需要通过审批卡片确认;在“接受所有修改”模式(Accept all edits)下,Claude 会连续执行,无需停下来等待。连接 Claude 账户后,侧边栏会沿用相同的模型、连接器和技能(skills)。对于 Enterprise 套餐,Compliance API、客户管理的加密密钥(CMEK)以及 OpenTelemetry 审计导出功能也适用于该组件。
Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.
🇨🇳 Claude 现在可以在 Google Docs、Sheets 和 Slides 中使用,这些文件也能在 Claude 中打开。在 Google Workspace 中,Claude 位于文件旁边的侧边栏中,读取您打开的内容,并直接修改文件。您可以在每项修改生效前进行批准。 — @claudeai 在 X 上
反向操作也同步推出:新的 Google Docs、Sheets 和 Slides 连接器同样处于测试阶段,支持用户在 Claude 中创建和修改 Google 文件,只需粘贴链接或请求创建新文档。在受支持的配置中,文件会在对话旁边的面板中打开,Claude 的访问权限遵循 Google 的共享权限设置。该组件可从 Google Workspace Marketplace 安装(扩展程序 > Claude > 打开 Claude),管理员也可以通过 Google Admin 控制台部署;在 Team 和 Enterprise 套餐中,需要先由所有者启用连接器。Google Workspace 由此加入 Microsoft 365 的行列,适用于 Excel、PowerPoint 和 Word 的 Claude 已于 5 月 7 日正式发布。
🔗 Anthropic 关于 Claude for Google Workspace 的公告文章
Cyber Verification Program:Anthropic 以三个访问级别开放 Opus 5.5、Sonnet 5.5 和 Mythos 5.1
10 月 6 日 — Anthropic 重组了其网络安全验证计划(Cyber Verification Program,CVP),向经过验证的安全专业人员开放其面向公众的模型会阻止的能力。过去六个月,两套机制一直并行运作:Project Glasswing 向负责最关键软件的组织提供 Claude Mythos 访问权限,而只有一个访问级别的 CVP 则放宽了 Opus 和 Sonnet 模型的防护限制。两者现在合并为三个级别,所有级别均可访问 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 以及未来的模型。正式发布的模型(Opus 5.5、Fable 5.1、Sonnet 5.5)仍保留较为谨慎的防护措施,会阻止大多数网络安全工作。
| 访问级别 | 涵盖的用途 | 目标用户与等待时间 |
|---|---|---|
| Defense Access | 安全运营中心、事件响应、恶意软件逆向工程、漏洞分析 | 安全团队、各种规模的关键基础设施组织、开源维护者、研究人员;数天 |
| Red Team Access | 防御用途,以及获得授权的渗透测试和模拟攻击演练(red teaming) | 仅限组织,且只能针对其获准测试的系统;数周 |
| Specialized Access | 安全关键系统测试:航空、电网、电信、银行间转账、政府行政网络 | 与美国政府共同逐一审查的少数组织;Glasswing 成员转入该级别 |
在 Red Team Access 级别,可能造成物理损害或大规模中断的行为,例如部署勒索软件,仍会被实时阻止。为验证各级别的设置,Anthropic 让 Opus 5.5 在每个级别的防护措施下接受 CyScenarioBench 测试。这是一项多步骤网络安全行动评估,共有 10 项挑战,每项尝试 5 次。
| Anthropic 测试的配置(Opus 5.5) | CyScenarioBench 结果(50 次尝试) |
|---|---|
| 不使用 CVP | 所有任务均在首次提示时被阻止 |
| Defense Access | 46 次尝试在某个阶段被阻止,4 次成功 |
| Red Team Access | 无阻止情况,34 项任务成功,相当于无防护模型 67,6 % 的成绩 |
文章还对 Glasswing 进行了初步总结,Anthropic 表示这些数字只是部分统计:合作伙伴在 4 月至 7 月期间发现了至少 129 000 个经过验证的漏洞,Anthropic 的开源分析又发现了 5 500 个,其中超过 33 000 个被评为严重或高危。这些统计基于合作伙伴提交的 33 份报告,Anthropic 估计实际影响“至少高出五倍”。在同日发布的案例分享中,Comcast 表示,它使用 Claude Mythos Preview 评估了 258 个系统和约 1,7 亿行代码,发现了一个严重的身份验证漏洞;Booz Allen 的一名分析师则在十二天内审查了 138 个代码仓库。
实际使用方面,该计划要求保留数据以监测滥用行为,直到 Enterprise Frontier Safeguards(EFS)推出。EFS 将于今年秋季晚些时候允许将这些数据保存在由客户控制的云环境中;已经以零数据保留方式使用 Fable 5.1 或 Mythos 5.1 的组织,也可以在 CVP 中采用同样的方式。该计划已在 Claude Platform、Vertex AI 和 Microsoft Foundry 上开放;在 Amazon Bedrock 上,仅符合 EFS 条件的客户可以使用。个人只能申请 Defense Access,且需要使用付费套餐;该级别还要求用户在 12 月 15 日之前采用抗钓鱼的多因素身份验证,并停止使用 API 密钥。网络研讨会定于 10 月 14 日太平洋时间上午 9 时举行。
🔗 Anthropic 关于 Cyber Verification Program 的公告文章 🔗 Cyber Verification Program 帮助页面 🔗 Comcast 和 Booz Allen 使用 Claude Mythos 的案例
EmbeddingGemma 2:Google 的开放嵌入模型迈向多模态
10 月 6 日 — Google DeepMind 发布 EmbeddingGemma 2,这是其面向设备端运行的开放嵌入模型的第二代。据 Google 称,第一代 EmbeddingGemma 的下载量已超过 2000 万次,但只能处理文本;新模型则能将文本(包括代码)、图像、视频和音频,无论单独输入还是组合输入,都映射到同一个 768 维空间中。它基于 Gemma 4 架构构建,采用 Apache 2.0 许可证发布。
Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.
🇨🇳 这就是 EmbeddingGemma 2,我们首个用于设备端嵌入的原生多模态开放模型。它超越了文本,将代码、图像、音频和视频统一到一个共享空间中。 — @GoogleDeepMind 在 X 上
该模型拥有 7.4 亿参数,但采用模块化设计:一个 270M 参数的文本核心,可按需加载视觉编码器(170M)和音频编码器(300M)。因此,纯文本应用只需加载 270M 参数。经过量化后,Google 在 Pixel 11 Pro 上测得,文本权重的活动 RAM 用量约为 191 Mo,完整多模态模型约为 567 Mo。
| EmbeddingGemma 2 的特性 | Google 公布的数值 |
|---|---|
| 总参数量 | 740M(文本 270M、视觉 170M、音频 300M) |
| 向量维度 | 768,可截短至 512、256 或 128 |
| 上下文窗口 | 8K tokens,是第一代的四倍 |
| Pixel 11 Pro 上的活动 RAM 用量(量化后) | 纯文本约 191 Mo,多模态约 567 Mo |
| MTEB Code | 78,68,第一代为 68,76 |
| 多语言 MTEB v2 | 61,36,第一代为 61,15 |
“俄罗斯套娃式”表征学习(套娃表征学习)可缩短向量,使存储占用最多减少至原来的六分之一;根据模型说明,缩减至 256 维时,质量仍几乎不受影响,而 128 维主要适合纯文本用途。最明显的提升体现在代码方面:据 Google 称,MTEB Code 得分提高了近十分,而多语言文本表现则保持在上一代水平。
目标用途是完全在本地运行的搜索和检索增强生成(RAG),例如通过一段语音备忘录找到视频中的某个片段。由于该模型与 Gemma 4 共享文本分词器(tokenizer)和音频编码器,两者可以同时运行,并减少内存占用。权重已在 Hugging Face 和 Kaggle 上提供;官方宣布将“很快”上线 Gemini Enterprise Agent Platform 的 Model Garden,但未给出日期。模型发布时即获得 Transformers(5.19.0 版本)、sentence-transformers、MLX、vLLM、llama.cpp、Ollama 和 LM Studio 的支持,也可通过 transformers.js 在浏览器中运行。
🔗 Google 博客公告 🔗 EmbeddingGemma 2 模型说明 🔗 Hugging Face 上的权重
决策模型:OpenAI 开放 Decisions API,Perplexity 发布 Decider v1.1 并将价格减半,Decision Index 0.3 更新排名
决策模型通过选择选项或为输入评分来作答,而不是生成自由形式的回答。这类模型迎来了集中更新的一天:两家厂商调整了产品和价格,该类别的社区排行榜也更改了评估方法。
OpenAI 的 Decisions API 进入公开测试
10 月 6 日 — 在 DevDay 上向有限用户开放一周后,OpenAI 的 Decisions API 进入公开测试,预计将在“未来几周”全面开放。它通过专用端点(POST /v1/decisions),使用目前唯一可用的模型 GPT-6 Luna,对文本、图像或两者组合回答封闭式问题;据 OpenAI 称,其带有明确类型的回答返回速度约为 Responses API 的 10 倍。当天的新消息是价格:每百万输入 tokens 收费 0,10 美元,输出和缓存均不收费,区域处理和长上下文的附加费用另计。
| 问题类型 | 目标用途 | 返回结果 |
|---|---|---|
谓词(predicate) | 检查某个条件,例如照片中的商品是否损坏 | 条件为真的概率,范围为 0 至 1 |
选择(choice) | 从提供的列表中选出一个选项 | 所选选项、各选项的概率以及置信度指标 |
评分(score) | 按有序等级评分,例如事件的严重程度 | 按概率加权的等级均值 |
一次请求可以针对同一输入提出多个问题,图像必须以 base64 格式发送,不能使用托管 URL 或文件标识符。该 API 支持不保留数据(零数据保留),并为符合条件的客户提供 HIPAA 用途支持,数据驻留区域包括美国和欧洲。
🔗 Decisions API 指南 🔗 OpenAI API 更新日志
Perplexity 的 pplx-decider-v1.1-27b 与价格减半
10 月 6 日 — 在推出自家的 Decisions API 五天后,Perplexity 通过开发者账号 @perplexitydevs 的一条帖子串,更新了该 API 背后的模型。pplx-decider-v1.1-27b 以开放权重形式在 Hugging Face 上发布,采用 Apache 2.0 许可证,沿用 v1 的 Qwen3.8-27B 基础模型,可在 250k tokens 的上下文中读取文本和图像,并移除了全注意力层的因果掩码(因果掩码)。如今使用该模型的 Decisions API,每百万输入 tokens 收费 0,02 美元,比 v1 的 0,04 美元低了一半,输出仍然免费。
| Decision Index 类别(Hugging Face 模型说明) | Jev 得分 | v1 得分 | v1.1 得分 |
|---|---|---|---|
| 知识(知识) | 51,4 | 40,9 | 48,18 |
| 语言(语言) | 62,0 | 63,5 | 69,45 |
| 信息检索(检索) | 55,4 | 54,9 | 61,26 |
| 工具(工具) | 75,1 | 79,3 | 78,88 |
| 艺术(艺术) | 37,7 | 39,4 | 44,66 |
| 加权总分 | 57,9 | 56,4 | 61,56 |
根据模型说明,总分从 56,4 提升至 61,56,超过了 TypeSafe AI 的决策模型 Jev 的 57,9,不过 Jev 在知识类别中仍然领先。Perplexity 还表示,该模型在新版 Decision Index 0.3 中取得了最高分。若要自行托管,需要一块能够容纳约 49 Gio 权重的 GPU,并使用随模型提供的实现,因为标准因果推理无法复现评测中的行为。
🔗 @perplexitydevs 在 X 上的帖子串 🔗 Hugging Face 上的 pplx-decider-v1.1-27b
Decision Index 0.3
10 月 6 日 — Hugging Face 工程师 apolinario 发布了 Decision Index 0.3,这是一个对复现 Jev Decision Model 的开放决策模型进行排名的社区排行榜。它目前收录了 112 个模型,其中包括 111 个开放复现模型,均在 NVIDIA RTX PRO 6000 上运行。评估方法有所变化:完整得分(完整得分)结合了 37 项公开基准、衡量相同能力的私有测试,以及来自新领域的私有任务,使排名反映模型的能力,而不只是它们在已知基准上的表现。排行榜还新增了视觉选项卡。
| 显示排名 | 上榜模型 | 完整得分 |
|---|---|---|
| 1 | Perplexity Decider v1.1 (27B) | 62,8 |
| 2 | Fastino GLiDE 不启用思考 (28B) | 60,2 |
| 参考 | Jev | 60,1 |
| 3 | Torchcast Decision 27B | 59,9 |
| 4 | deck31b (Gemma 4 31B) | 59,0 |
Decider v1.1 的两个分数不能混为一谈:61,56 是 Perplexity 模型说明中公布的得分,62,8 则是该排行榜按新方法计算出的得分。私有测试按其性质不会公开。
🔗 apolinario 在 X 上的公告 🔗 Decision Index 0.3
计算机操作:OpenAI 使用 Ironclad 的合同任务训练 GPT-6 Astra
10 月 6 日 — OpenAI 开始与软件厂商开展研究合作,以提高其智能体在业务软件中的效率。这项工作属于计算机操作(计算机使用)领域,首个合作伙伴是专注于人工智能辅助合同处理的 Ironclad。双方团队定义了 11 项法律、销售和采购任务;据 OpenAI 称,熟练用户完成每项任务需要 30 至 40 分钟,每项任务按 8 至 50 项标准评估。Ironclad 提供了其软件的托管环境,模型在其中通过强化学习训练,所用合成任务来自 SEC 的 EDGAR 数据库中的公开合同。
| OpenAI 对 11 项任务的测量 | GPT-5.6 Sol(推理级别 High) | GPT-6 Astra(推理级别 Max) |
|---|---|---|
| 平均得分 | 41,6 % | 55,0 % (+32 %) |
| 每次尝试的估计平均耗时(模拟) | 37,0 分钟 | 19,2 分钟 (-48 %) |
GPT-6 Astra 是 OpenAI 首个在这些任务上训练的前沿模型,其开发过程中使用的一款内部模型达到了 63,7 %。这些数据由 OpenAI 提供,耗时是根据假定的处理速度模拟得出的,并非在客户环境中测量。OpenAI 邀请其他软件厂商提供当前智能体尚无法可靠完成的任务。
API 与平台:OpenAI API 的用量等级与 BAA、Perplexity Agent API 的文档与图像功能,以及 Bedrock 上的 GLM-5.3
四项变化与购买推理服务的开发者有关,涉及 OpenAI API 的访问条件、Perplexity Agent API 的工具,以及 AWS 产品目录中新增的开放模型。
OpenAI API 的用量等级从五级减少至三级
10 月 6 日 — OpenAI 简化了获得其 API 最高速率限制(速率限制)的条件:五个付费用量等级变为三个,分别是 Build、Launch 和 Grow。最高等级 Grow 的门槛是累计支付 500 美元的 API 费用,而此前最高等级的门槛为 1 000 美元。已经处于付费等级的组织会自动迁移,无需采取任何操作;此后,当累计额度购买金额达到相应门槛时,就会升级。免费等级仍设有每月 100 美元的上限。
| 用量等级 | 累计购买金额门槛 | 每月用量上限 | Astra、Sol 和 Terra(每分钟请求数和 tokens 数) | Luna(每分钟请求数和 tokens 数) |
|---|---|---|---|---|
| Build | 5 美元 | 500 美元 | 5 000 和 1 000 000 | 5 000 和 2 000 000 |
| Launch | 100 美元 | 5 000 美元 | 10 000 和 4 000 000 | 10 000 和 10 000 000 |
| Grow | 500 美元 | 200 000 美元 | 15 000 和 40 000 000 | 30 000 和 180 000 000 |
🔗 @OpenAIDevs 在 X 上的帖子串 🔗 速率限制文档
OpenAI API 支持自助签署 BAA 与启用 HIPAA 合规支持
10 月 5 日 — 使用 OpenAI API 处理受保护健康信息的组织,如今可以自行签署美国 HIPAA 法律要求的商业伙伴协议(商业伙伴协议,BAA)。管理员可在 Settings > Organization > General 中接受标准 BAA 并启用 HIPAA 合规支持,无需签订企业合同。这项自助服务仅面向符合条件且已有稳定 API 使用记录的组织,启用后无法从这些设置中撤销。定制条款仍需通过电子邮件申请,通常会在一至两个工作日内收到回复。OpenAI 提醒,签署 BAA 本身并不能使应用达到合规要求,且 ChatGPT Business 不提供任何 BAA。
Perplexity Agent API 支持读取文档与搜索图像
10 月 5 日 — Perplexity API 更新日志在当晚较晚时新增了三条记录。Agent API 现在接受 PDF、DOC、DOCX、TXT 和 RTF 文档作为输入,可将文档直接嵌入请求,也可通过公开的 HTTPS URL 指定,具体支持情况取决于所选模型和提供商。新工具 image_search 可在网上搜索图像,并返回包含图像地址和来源页面地址的结构化结果:每次调用可返回 1 至 30 张图像,默认为 5 张,支持域名和格式筛选,并默认启用安全搜索。每 1 000 次成功调用收费 2,50 美元,失败调用不收费。第三条记录修正了成本统计:响应现在会详细列出沙箱内提取操作的成本,GPT-6 Luna 的费率保持不变。
🔗 Perplexity API 更新日志 🔗 image_search 工具文档
Z.ai 的 GLM-5.3 上线 Amazon Bedrock
10 月 6 日 — Z.ai 宣布其旗舰开放权重模型 GLM-5.3 上线 Amazon Bedrock;AWS 的产品说明将发布日期标为 10 月 5 日。该模型采用混合专家架构,拥有 7440 亿参数,每个 token 激活约 400 亿参数,上下文长度为 100 万 tokens,最多可输出 128 000 tokens。只有符合条件的客户才能访问,需通过其 AWS 客户团队申请;该模型仅提供跨区域推理(美国或全球配置),支持从 1 024 tokens 起的提示词缓存,并提供 Standard、Priority、Flex 和 Reserved 服务等级。产品说明未列出价格,而是指向 Bedrock 定价页面。GLM-5.3 继 Kimi K3(9 月 22 日)和 Grok 4.7(9 月 28 日)之后上线,后两者均在过去两周内加入 Bedrock。
🔗 Amazon Bedrock 上的 GLM 5.3 产品说明 🔗 Z.ai 在 X 上的公告
编程智能体:Claude Code 2.1.290 至 2.1.292、云端会话、Vibe CLI 2.26.0、Antigravity 与 Replit
从终端到编辑器,编程智能体迎来五项更新:Claude Code 在不到二十小时内发布了三个版本,一份云端会话指南,新 Rust 界面功能持续扩充的 Vibe CLI,面向 VS Code 的 Antigravity 扩展,以及能够查看用户所有项目的 Replit。
Claude Code 2.1.290 至 2.1.292
10 月 5 日和 6 日 — Claude Code 2.1.290 于 10 月 5 日 23 时 33 分 UTC 发布,是一次大规模更新:共 190 条记录,其中 131 项为修复。claude attach 和 claude logs 支持用会话名称的一部分代替会话标识符,/claude-api managed-agents-onboard 则将网页中描述的 Managed Agents 模型转换为 ant apply 文件。交互式会话的网页搜索不再在调用 200 次后停止:其额度会以每小时 100 次调用的速度补充。在中等推理强度(medium)下,/code-review 在 Opus 5.5 和 Sonnet 5.5 中还会指出不符合 CLAUDE.md 约定之处。在 Slack 中,Claude Tag 新增快速模式(!fast);Claude in Chrome 的 browser_batch 调用时限从 60 秒延长至 90 秒;WebFetch 不再悄无声息地截断超过 100 000 字符的文本。pyright 和更多形式的 ps 需要请求权限,同时修复了多项权限漏洞:由 shell 展开的 rg 和 git grep 通配符、链接到工作目录之外的 CLAUDE.md,以及用户级 mod 绕过组织级 mod 的问题。四小时后,2.1.291 修复了两项回归问题:一项始于 2.1.290,导致云端会话中对权限提示的回答丢失;另一项始于 2.1.288,导致退出时会话的最后几条消息丢失。
10 月 6 日 18 时 59 分 UTC,2.1.292 发布,共 92 条记录,其中 64 项为修复。该版本为 Agent 工具新增 effort 参数,用于按指定推理强度启动子智能体;同时新增 claude plugin install --marketplace,可在必要时添加插件市场(marketplace),然后安装插件。本地 MCP 服务器(stdio)现在默认协商使用 2026-07-28 协议(可通过 MCP_PROTOCOL_NEGOTIATION=legacy 恢复原协议),CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS 延长了遇到 529 错误时的重试过程,mods 则新增提示词自动补全事件和提示词缓存。在安全方面,PreToolUse hook 的批准和自动模式不再绕过读取网络路径(UNC)时的权限提示,hook 写入的 <system-reminder> 标签也会在传递给 Claude 前进行转义。Artifact 工具终于可以列出 200 个产物,而非原来的 50 个,Code Review 也开始按仓库细分统计数据。2.1.290 和 2.1.292 均未在 X 上发布公告。
| Claude Code 版本 | 发布日期(UTC) | 条目数量 | 主要新功能 |
|---|---|---|---|
| 2.1.290 | 10 月 5 日,23 h 33 | 190,其中 131 项修复 | 按名称指定会话,managed-agents-onboard,WebSearch 额度补充 |
| 2.1.291 | 10 月 6 日,3 h 55 | 2 项修复 | 修复两项回归问题 |
| 2.1.292 | 10 月 6 日,18 h 59 | 92,其中 64 项修复 | 子智能体推理强度,一条命令添加插件及插件市场,MCP 2026-07-28 |
🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292
Claude Code 云端会话指南
10 月 6 日 — Claude Code 云端会话结束预览阶段两周后,Anthropic 在 claude.dev 上发布了由 Addy Osmani 撰写的实战指南。每项任务都在一台全新的虚拟机上运行,配置约为 4 vCPU、16 GB RAM 和 30 GB 磁盘空间,仓库克隆到新分支,Pro、Max、Team 和 Enterprise 套餐无需支付额外计算费用。指南介绍了七种用法:并行清空待办任务列表(backlog)、通过重复运行验证修复、先在本地规划再通过 claude --teleport 继续会话、通过手机跟进、将 CI 失败和审查意见交给 Auto-fix 处理、触发例行流程,以及在一次性虚拟机中运行不太安全的代码。在演示中,三场会话均在首次启动后的 87 秒内完成,每个项目每天最多可启动 200 个新会话线程(threads)。指南还详细说明了 GitHub 连接方式:使用 GitHub 登录和安装 Claude GitHub 应用是两项独立授权,只有后者才能访问私有仓库。100 美元(Pro)或 250 美元(Max)的奖励额度须在 10 月 7 日 23 时 59 分 PT 前领取,并于 11 月 4 日到期。
🔗 claude.dev 上的云端会话实战指南 🔗 @ClaudeDevs 关于奖励额度的提醒
Vibe CLI 2.26.0
10 月 6 日 — Mistral 发布了命令行编程智能体 Vibe CLI 2.26.0,距 2.25.8 发布已有 13 天,且未在 X 上发布公告。此次更新规模较大,包含 33 项新增、23 项变更和 91 项修复:147 条记录中有 72 条涉及用 Rust 编写的新界面,包括首次启动向导、语音模式(/voice)、通过 /loop 用自然语言描述的周期性提示词、通过 /teleport 将会话发送至 Vibe Code Web,以及 vibe update 命令。Vibe 现在始终使用新的执行引擎 Unified Harness;如果该引擎缺失,会明确报错并停止运行,不再悄悄回退到旧引擎。插件可以附带自己的 MCP 服务器,存放在 ~/.vibe/.env 中的备用 API 密钥现在仅其所有者可读取,Rust CLI 也开始向 Mistral 发送使用遥测数据,包括启动耗时、使用的命令和检测到的终端。
VS Code 的 Antigravity 扩展 1.7.0
10 月 5 日 — Google 发布了 Visual Studio Code 的 Antigravity 扩展 1.7.0,将 Google Antigravity 智能体引入 Microsoft 编辑器,提供侧边栏对话、行内差异审查和交互式计划,支持 VS Code 1.90 及以上版本。根据更新日志,该扩展自 9 月初以来大约每周更新一次,此前尚未在这里介绍过。1.7.0 包含 6 项改进和 9 项修复,重点改善代码审查:可通过键盘撤销和恢复接受或拒绝的决定,并排差异编辑器新增“全部接受”和“全部拒绝”按钮,VS Code 的自动保存(Auto Save)不再覆盖或关闭正在进行的审查。在 Windows 下,当窗口不在前台时,原生通知会提示任务完成;Google Cloud Workstations 和 Cloud Shell 也新增交互式身份验证。同日,Visual Studio 扩展升级至 1.0.261005.0,并在提交反馈时附加诊断日志。
Replit 掌握所有项目的上下文
10 月 6 日 — Replit 宣布,现在已能掌握用户所有项目的上下文。在新对话中,可以要求它查找现有项目、为项目添加功能,或以某个项目为参考开展另一个项目;随后,Replit 会读取相关文件,并通过后台任务(background tasks)执行修改,同时提供链接供用户检查变更。公告中的示例超出了纯粹编写代码的范围:将“Partner Marketing Hub”的配色应用到同一咖啡品牌的另外两个项目中。公告只有一条附带视频的推文,没有文章、文档或价格信息。
GitHub 堆叠式拉取请求正式全面开放
10 月 6 日 — GitHub 向 github.com 的所有套餐开放堆叠式拉取请求(stacked pull requests),该功能自 7 月 30 日起处于公开预览阶段:将一项大型变更拆分成多个较小的拉取请求,分别审查,再一起合并。GitHub Enterprise Server 将在后续版本中获得该功能。根据 GitHub 的数据,使用堆叠功能的仓库比同类仓库多合并 9 % 的代码,排名前 1 % 的仓库中超过三分之二在使用该功能,合并所需时间缩短了 5 %。
正式版减少了合并过程中的阻碍。当主分支向前推进时,“Rebase stack”会保留未变更代码的批准状态,并生成带签名的替代提交;整个堆叠会作为一组通过合并队列(merge queue);如果堆叠的基准分支被删除,则会重新指定目标分支,而不是关闭堆叠。整个堆叠的自动合并功能将在“未来几周内”推出。对于命令行和智能体使用场景,GitHub CLI 的 gh stack 扩展支持 Git worktrees。
多语言模型:Cohere 的 Tiny Aya L2-Thinker 和 TII 的 Falcon-OCR-Arabic
两个小型模型面向大型模型服务较弱的语言:一个用用户的语言推理,另一个读取阿拉伯语文档。
Cohere 的 Tiny Aya L2-Thinker
10 月 6 日 — Cohere 着手解决模型推理语言的问题:当用户用西班牙语、阿拉伯语或斯瓦希里语提问时,大多数模型都会先用英语思考再回答。其研究模型 Tiny Aya L2-Thinker 拥有 33.5 亿参数,在覆盖 60 种语言的测试中,超过 93 % 的时间使用提示词的语言推理。关键在于数据混合:约 170 万条由 gpt-oss-120b 生成的英语推理示例,只能让模型在 12.8 % 的时间里使用用户的语言推理;为 44 种语言各提供约 5 000 条翻译示例后,这一比例升至 86.1 %;不含推理过程的多语言数据则将这一行为扩展到其他语言。与使用英语推理的同源模型相比,它在六项基准测试中的五项上,准确率最多下降两到三个百分点;只有竞赛数学测试 PolyMath 的下降更明显,原因是缺少强化学习阶段。该模型平均消耗不到 5 000 个思考 tokens。模型和数据已在 Hugging Face 上以非商业用途许可 CC-BY-NC 4.0 发布;文章介绍了一篇 9 月 9 日发布的 arXiv 论文。
🔗 Cohere 关于 Tiny Aya L2-Thinker 的研究文章
TII 的 Falcon-OCR-Arabic
10 月 6 日 — 开发 Falcon 模型的阿联酋研究机构 TII 在 Hugging Face 博客上介绍了 Falcon-OCR-Arabic,这是其文本识别模型 Falcon OCR 的阿拉伯语版本。该模型保留了 2.7 亿参数和早期融合架构,先在真实与合成阿拉伯语文档上进行监督微调,再通过强化学习进行适配。在 TII 自建的基准测试中,共有 11 974 份真实文档、15 个类别,它在参与比较的 17 个模型中排名第二,并在官方文件、行政表格、收据和发票类别中排名第一。
| TII 评测的模型 | 文本准确率 | Table TEDS 得分 |
|---|---|---|
| Gemini 3.5 Flash | 84,34 % | 51,30 % |
| Falcon-OCR-Arabic (270M) | 81,87 % | 59,95 % |
| Claude Opus 5.5 | 79,22 % | 43,98 % |
| GPT Astra | 75,02 % | 51,23 % |
| Chandra OCR 2(最佳专用 OCR) | 61,67 % | 32,63 % |
文章仅提供了一个试用空间(playground):在我们查看时,Hub 上尚未出现 Falcon-OCR-Arabic 的任何权重,也未提及任何许可证。
🔗 TII 关于 Falcon-OCR-Arabic 的文章
Hugging Face 库:Diffusers 0.41.0 集成 Qwen-Image 2.1,Transformers v5.19.0 支持 EmbeddingGemma 2
Hugging Face 的两大模型库在同一天发布了新版本。
Diffusers 0.41.0 与 Qwen-Image 2.1
10 月 6 日 — Hugging Face 的扩散模型库 Diffusers 0.41.0 集成了 Alibaba 的 Qwen-Image 2.1,该模型将图像生成与编辑结合在一起:现在可以直接用于生成图像、编辑图像、制作透明背景图像(原生 RGBA 输出)以及训练 LoRA,其视觉生成组件拥有 70 亿参数。团队还调整了发布节奏:与 Transformers 一样,Diffusers 今后将根据新模型的到来发布次要版本,而补丁版本仍仅用于修复问题。张量并行加载使每块 GPU 只需读取自己负责的那部分权重;该版本还新增了 LTX-2.5 DFR pipelines 和针对 Cosmos 3 的优化。同时,ONNX 支持被弃用,改用 Optimum。
Transformers v5.19.0
10 月 6 日 — 距 v5.18.0 发布六天后,Transformers v5.19.0 开始支持上文介绍的 EmbeddingGemma 2,包括可缩短的向量,以及可在加载时禁用的视觉和音频编码器。在分布式训练方面,专家并行新增 token 分发(token dispatch),并为 Qwen3 MoE 和 Mellum 默认启用:其并行规模不再必须与张量并行相同,Trainer 也支持这种模式。缓存现在可以逐层配置,适用于异构模型;连续批处理(continuous batching)也开始支持 XPU。该版本包含六项破坏性变更,包括为所有 MoE 返回路由器 logits,以及逐步弃用 paged| 前缀。
语音智能体:ElevenLabs 推出 ElevenAgents Architect Alpha 版
10 月 6 日 — ElevenLabs 在其对话智能体平台 ElevenAgents 中集成了一位名为 Architect 的专家,团队通过语音或文字与它交流,即可获得构建和改进语音或文本智能体的帮助。它熟悉 ElevenAgents 的所有设置,包括知识库、提示词、流程衔接、语音、防护措施、工具和模拟测试,以及这些设置之间的相互影响。用户可以向它提出问题、提交失败的测试、报告转接人工次数上升,或提供 ElevenAgents Spotlight 的发现:它会分析对话记录、追溯原因、提出修改建议,并编写用于验证修改的模拟测试。它还可以根据简单描述构建智能体。每项变更都会以带版本记录、可撤销的草稿形式提交,未经批准不会进入生产环境。除了从产品内访问 Architect,也可以通过 Claude、Claude Code、ChatGPT、Cursor 和 Grok Bot 访问。它现已推出 Alpha 版,尚未公布价格或效果数据。
🔗 ElevenLabs 关于 ElevenAgents Architect 的文章
生成式视频:Black Forest Labs 称 FLUX 3 在 Physics-IQ Verified 榜单中位居第一
10 月 6 日 — Black Forest Labs 宣称在 Physics-IQ 中排名第一。这项由 Google DeepMind 推出的基准测试衡量视频模型对物理世界的理解能力:向模型展示一段真实实验视频的开头,让它预测后续过程,涵盖流体、光学和固体力学。参考榜单 Physics-IQ Verified 由 Anates Labs 维护。在视频转视频赛道上,FLUX 3 [large] 明显领先于 NVIDIA 的 Cosmos3,但每条视频的成本更高。
| 模型与方法(视频转视频) | Physics-IQ Verified 得分 | 每条标准化视频的成本 |
|---|---|---|
| FLUX 3 [large],8 次生成中的最佳结果 | 64,35 % | 16,43 美元 |
| FLUX 3 [large] | 61,11 % | 2,08 美元 |
| Cosmos3 Super (NVIDIA) | 50,80 % | 0,82 美元 |
| Cosmos3 Nano (NVIDIA) | 43,00 % | 0,82 美元 |
在图像转视频赛道上,FLUX 3 [large] 也超过了 Physis-Lang,后者是 NVIDIA 在 9 月 29 日宣布领先的方法。FLUX 3 [large] 是专有模型,这条帖子串没有公布该版本的开放日期或价格。
🔗 @bfl_ai 在 X 上的帖子串 🔗 Physics-IQ Verified 榜单
公开评测:GeoGuess Bench 与 RSI Arena
两项面向公众开放的评测突破了常见基准测试的形式:一项让模型玩 GeoGuessr,另一项让公众为智能体训练的模型投票。
GeoGuess Bench
10 月 6 日 — Together AI 开发者体验负责人 Hassan 发布了 GeoGuess Bench,这是他个人搭建的评测平台,让模型玩 GeoGuessr:每个模型看到相同的 210 张街景照片,并在地图上放置标记,按游戏的公式评分,每局五轮,最高 25 000 分。Claude Opus 5.5 位居第一,略高于 Claude Fable 5.1;令人意外的是 Meta 的开放权重模型 Muse Glimmer 30B 排名第三,领先于 GPT-6 Astra,而每局成本约为后者的 1/45。
| GeoGuess Bench 排名 | 受评模型 | 得分,满分 25 000 | 每局成本 |
|---|---|---|---|
| 1 | Claude Opus 5.5 | 23 412 | 0,064 美元 |
| 2 | Claude Fable 5.1 | 23 307 | 0,115 美元 |
| 3 | Muse Glimmer 30B(开放) | 22 407 | 0,0049 美元 |
| 4 | GPT-6 Astra | 21 562 | 0,223 美元 |
| 5 | GPT-6.1 Sol | 21 194 | 0,042 美元 |
| 6 | GLM-5.3 Flash(开放) | 21 183 | 0,0087 美元 |
GLM-5.3 Flash 因此以约五分之一的成本,与 GPT-6.1 Sol 达到了相当的表现。这是开放模型推理服务商 Together AI 一名员工的个人项目,并非该公司的评测;其中没有任何 Gemini 模型,代码已发布在 GitHub 上。
🔗 Hassan 在 X 上的公告 🔗 GeoGuess Bench
RSI Arena
10 月 6 日 — Zichen Chen 宣布 RSI Arena(意为递归自我改进,递归自我改进)开启新一轮实验,这次与 Hugging Face 合作。人工智能智能体获得了 GPU,以及唯一的任务:训练出更好的模型。它们自行选择数据、编写代码并开展实验。第一轮训练结束后,公众加入反馈循环:模型两两对决,大家投票,智能体再根据这些反馈开展新的实验。Hugging Face 的 Inference Endpoints 为每个模型提供实时服务,网站列出了十个智能体,包括 GPT-6 Astra、Grok 4.7、DeepSeek V4.1 Flash、GLM-5.3 和 Muse Spark 1.3;其仪表盘显示,API 开支已达到 300 美元预算中的 286,60 美元,GPU 使用时长已达到 1 000 小时额度中的 755,17 小时。团队承诺在 Hub 上发布智能体训练的每个模型,并在实验结束后公布所有产物:数据、代码,以及每个智能体完整的研究轨迹。
🔗 Zichen Chen 在 X 上的公告 🔗 RSI Arena
GPU 基础设施:NVIDIA 发布 AICR v1.0
10 月 6 日 — NVIDIA 发布 AI Cluster Runtime(AICR)1.0 版本。这个开源项目旨在结束靠反复摸索配置 Kubernetes GPU 集群的状况。加速计算集群依赖数十个各自独立更新版本的组件,包括内核、驱动、容器运行环境、网络、存储、运算符和库;一套在某处正常运行的组合,换个环境可能就会悄无声息地失败。AICR 提供经过验证且锁定版本的配置方案,生成供 Helm、Argo CD、Flux 或 Helmfile 使用的配置,并附上在受测硬件上获得的、带签名的验证凭证。v1.0 确立了兼容性契约:CLI、REST API、Go SDK、部署包结构和产物模式成为稳定接口,任何破坏兼容性的变更都必须发布新的主版本。NVIDIA 称贡献者超过 100 人,其中近一半来自公司外部,并提到了 Pulumi Labs 的集成,以及 Mirantis 多集群管理工具 k0rdent 中的集成。
Claude Startups:最高 7 000 美元的产品与额度,以及价值 45 000 美元的 Startup Stack
10 月 6 日 — Anthropic 扩大了 Claude Startups 的开放范围。这项计划面向基于 Claude 构建产品的创始人,现向成立不足五年或在过去两年内获得融资的初创企业开放。
| 计划权益 | Anthropic 公布的价值 |
|---|---|
| 一年 Claude Team,最多五个 Premium 席位 | 6 000 美元(五个席位,每个每月 100 美元) |
| 一次性 API 额度,获批后即可使用 | 1 000 美元 |
| Claude 产品与额度总计 | 最高 7 000 美元 |
| Claude Startup Stack(合作伙伴优惠) | 最高 45 000 美元 |
一年 Claude Team 权益适用于首次使用 Team 的企业,其实际价值取决于席位数量和类型。当日新推出的 Claude Startup Stack 汇集了使用 Claude 构建产品的企业提供的折扣与额度,包括 Linear、Lovable、ElevenLabs、Granola 和 Hex;其上限对应所有优惠按 2026 年 9 月标价计算的累计价值,但这些优惠并非全部可以叠加使用。该计划还增加了与 Anthropic 的 Applied AI 团队交流的预约时段、在 Claude Marketplace 发布介绍页的协助,以及参加活动的机会。
🔗 Anthropic 关于 Claude Startups 的博客文章 🔗 @claudeai 关于 Claude Startup Stack 的帖子串
简讯
- Claude Projects 与本地文件夹 — Anthropic 的 Dan Fein 宣布,Claude Projects 的云端会话可以连接到电脑上获准访问的文件夹,只有任务需要时才会访问;这项功能自 10 月 5 日起逐步推出,Boris Cherny 表示,团队已接近完成(快完成了)。🔗 来源 · 🔗 Boris Cherny
- Slack 群组消息中的 Claude — 如今可以像添加普通参与者一样,将 Claude 加入 Slack 的群组消息(群组私信);它会在一个持续跟进的讨论串中回复,并可使用向它发起请求者的个人连接器,尚未说明适用套餐或推出时间。🔗 来源
- Boris Cherny 的提示词写法 — Boris Cherny 让 Opus 5.5 为 Acquired 播客中讲述 Home Depot 的一期节目制作交互式配套网站,连水彩画也一并生成;他认为,写提示词没有秘诀:告诉模型自己想要什么、应投入多少精力,以及如何验证结果。🔗 配套网站 · 🔗 他的提示词写法
- Atlassian 与 OpenAI — 根据一项新协议,GPT-6 系列的前沿模型,包括 GPT-6 Astra,将为 Atlassian 平台和 Rovo 的智能体提供支持;Atlassian 已有超过 3 000 名开发者使用 Codex,双方也在研究更深入的 Jira 集成,未公布协议金额。🔗 来源
- ChatGPT iOS 版中的 Codex 小组件 — 10 月 2 日发布的 ChatGPT iOS 版 1.2026.267 新增主屏幕小组件,用于查看所选电脑上最近的 Codex 任务;还新增显示剩余用量及重置时间的小组件,也可放在锁定屏幕上,并增加了保持键盘展开的设置。🔗 来源
- Gemini CLI v0.63.0 与 v0.64.0-preview.0 — 稳定版 v0.63.0 原样收录了 9 月 29 日预览版的 15 条更新,预览版 v0.64.0-preview.0 则汇集了 9 月 30 日至 10 月 3 日夜间构建版的 16 条更新:没有新增内容,10 月 6 日的夜间构建版也没有更新条目。🔗 来源
- Mistral Python SDK 3.1.0 — 该版本由 API 自动生成,在可观测性模块下新增了十四项测试阶段的评估操作;
Runs方法移至Workflows.runs下,因此即使只是次版本更新,也可能破坏现有代码。🔗 来源 - Qwen Code v0.25.1-preview.0 — 在 v0.25.0 发布的次日,这个预览版带来了 13 项功能和 27 项修复,包括实验性的 Kubernetes 运行环境、Managed Agent 的 Shell 命令与后台监控,以及不再允许同名服务器的 MCP 规则。🔗 来源
- SpaceXAI TypeScript SDK 0.2.2 — 该版本于 10 月 5 日发布,没有公告,仅包含一项变更:
retryBeforeOutput选项也适用于不采用连续输出(流式传输)、且等待 JSON 的create()调用。🔗 来源 - Falcon-Emirati-7B:阿联酋方言模型 — TII 将 Falcon-H1-Arabic 7B 专门针对阿联酋阿拉伯语进行优化:在包含 1 173 道问题的 Alyah 基准测试中得分为 84,83 %;根据 Gemini 3.7 Flash 评审模型的判断,其方言忠实度达到 0,52,而 ALLaM、Gemma 3 27B、Jais-2 和 Fanar-2 中的最佳结果仅为 0,05;该模型仅在 TII 的聊天平台上提供。🔗 来源
- Datasets 5.1.0 — 这个数据集库于 10 月 5 日发布新版本,如今可以读取 Harbor 强化学习环境、Vortex 列式格式,以及五种生物数据格式(FASTA、FASTQ、GenBank、PDB、mmCIF),并修复了一个允许压缩包向相邻目录写入文件的漏洞。🔗 来源
- TRL v1.14.2 — 这次补丁修复了一个会在没有提示的情况下导致训练偏差的问题:未使用 vLLM 时,GRPO、RLOO 和 Distillation 在处理 Gemma 或 Phi-3.5 等模型时,不会在回合结束处停止,而是继续学习后续全部文本,直到达到最大长度;此外还修复了三处崩溃问题。🔗 来源
- 用 Jev 筛选竞选邮件 — Stephen Solka 在一篇社区文章中,先用 Jev 对政治邮件进行分类,在 100 封真实邮件中正确判断了 99 封,出现一次误报;随后使用了一个拥有 2 260 万个参数、在处理器上运行的 SetFit 分类器:初步评测准确率为 98 %,但在较难的案例中只答对了 23 个中的 18 个。🔗 来源
- 10 月 16 日举办 Open Together — vLLM 与 Hugging Face 将举办 Open Together,这场开源开发者聚会将于 10 月 16 日星期五在旧金山拉开 Open Source AI Week 的序幕;Jeff Boudier 表示,候补名单上已有 150 人,活动容量已扩大一倍。🔗 来源 · 🔗 Jeff Boudier
- Copilot CLI 1.0.93-2 — 这个预览版新增企业设置
permissions.limitTo,将网络请求限制在受管理的域名内;在模型选择器中突出展示 GPT-6.1 Sol、GPT-6 Astra、Luna 和 Claude 5.5 系列模型,并且只从~/.copilot/settings.json读取用户设置。🔗 来源 - 安全概览中的 AI Scan — 组织和企业管理员如今可以在 GitHub 的安全概览(安全概览)中查看哪些仓库启用了拉取请求的人工智能扫描(拉取请求人工智能扫描),并获得两个筛选条件,以及 CSV 导出中的一列相关信息。🔗 来源
- 密钥检测:Lovable、Pydantic 与 Supabase — GitHub 的密钥检测(密钥扫描)新增对五种密钥类型的识别,包括 Lovable 的 API 密钥、Logfire 令牌和 Pydantic AI Gateway 密钥,以及两种 Supabase 令牌;Lovable Labs 也加入了其合作伙伴计划。🔗 来源
- Devin 10 月 5 日的版本说明 — 主要是细节完善:会话工作区新增 Terminal 标签页,打开 Files 或 Terminal 会唤醒 Devin;Devin Review 的投入程度可通过触发操作调整;代码扫描(代码扫描)结果可通过 API v3 或 Devin 的 MCP,按标识符获取。🔗 来源
- Delta 与它自己的 worktrees — Conrad Irwin 在 Delta 博客上解释了该工具为何替代 Git worktrees:每个讨论串都有自己的 worktree,记录在 DeltaDB 中,并在用户、智能体和机器之间复制;多个智能体在同一个分支上工作,纳入版本管理的
.agents/prepare脚本会为每次检出做好准备;这篇文章没有伴随新版本发布。🔗 来源 - v0:个人账号转为团队空间 — v0 的个人账号将变为团队工作区,对话、项目和设置会自动迁移;不过,文档将团队模板等部分功能限定于 Plus、Business 和 Enterprise 套餐。🔗 来源
- v0 与 iOS 上的 ChatGPT 订阅 — v0 自 9 月 29 日起支持使用 ChatGPT 订阅,如今其 iOS 应用也支持这一方式,没有公布价格或更多细节。🔗 来源
- Eleven v4 与 Eleven v4 Turbo 包揽前两名 — ElevenLabs 宣布,9 月 28 日推出的两款语音合成模型占据了 Artificial Analysis 语音合成(文本转语音)榜单的前两名;v4 在发布时就已位居第一。🔗 来源
- HeyGen Video 支持 2K — 发布一周后,HeyGen Video 升级至 2K 分辨率;HeyGen 称其按使用量计算,在 OpenRouter 视频榜单上排名第一,但没有公布 2K 的单独定价,产品目录页面仍显示截至 10 月底每秒 0,01 美元。🔗 来源
- Pika 上的 Nano Banana 2.1 — Pika 在其平台和 Pika API Club 中加入了 Google 的 Nano Banana 模型新版本 Nano Banana 2.1;据 Pika 称,该版本视觉质量更好、速度更快,但没有公布价格或额度消耗。🔗 来源
- DOCA GPUNetIO — NVIDIA 将 DOCA GPUNetIO 作为 NCCL、NVSHMEM 和 NIXL/UCX 共用的 GPU 主导网络(GDA-KI)实现,在 DOCA SDK 中提供完整版本,同时提供以 RDMA Verbs 为核心、更轻量的开源项目。🔗 来源
- CUDA 的 Green contexts — NVIDIA 的一篇技术文章展示了如何为关键任务预留 SM:在拥有 148 个 SM 的 Blackwell GPU 上,限定使用 8 个 SM 的内核响应时间为 0,007 ms,相比之下,使用优先流(流)时为 0,140 ms,没有优先级时为 3,727 ms。 🔗 来源
- 电信运营商采用开放模型 — NVIDIA 在一篇立场文章中引用了其 2026 年电信行业调查,其中 89 % 的受访者认为开源很重要,并引用了 SoftBank、AT&T 和 Indosat 的观点;未发布新产品。🔗 来源
- Perplexity 协作工具指南 — Perplexity 比较了十款具备人工智能功能的协作工具(Slack、Loom、Confluence、Airtable、Notion、ClickUp、Asana、Monday.com、Trello、Miro)、各自的人工智能功能以及包含这些功能的套餐;没有产品更新。🔗 来源
这意味着什么
决策模型正在成为一个独立类别,有自己的价格战和排行榜。同一天,OpenAI 将 Decisions API 的输入价格定为每百万 token 0.10 美元,Perplexity 则将自己的价格降至 0.02 美元,只有五天前的一半;两者都不对输出收费。这些模型不负责撰写内容,而是进行选择或评分:费用按读取的内容计算,速度也是关键,OpenAI 承诺其响应速度约为 Responses API 的十倍。Decision Index 0.3 充当社区评判标准,其新增的私有测试部分占一半,旨在衡量能力,而不只是模型在已知基准测试上的表现。其评判结果已经影响了厂商的宣传:Perplexity 在公告中引用了这一结果,尽管其模型说明中的分数与排行榜不同。
人工智能正融入办公工具,而不是反过来。继 Excel、PowerPoint 和 Word 之后,Claude 进入 Google Docs、Sheets 和 Slides,也加入了 Slack 群组消息,而 GPT-6 模型将为 Atlassian 的 Rovo 智能体提供支持。在这些集成中,问题不再仅仅是模型质量,还有控制权:要求每次修改都获得批准的模式、遵循 Google 共享权限的连接器,以及应用于模块的 Enterprise 控制措施。同样的逻辑也贯穿当天发布的智能体工具,从 Antigravity 中可撤销的审核决定,到 ElevenAgents Architect 中带有版本管理的草稿。
在网络安全领域,访问权限根据验证程度分级。Anthropic 的 CVP 不改变模型本身,而是调整其防护机制:在 CyScenarioBench 上,同一个 Opus 5.5 在未经验证时,任务从第一条提示开始就被阻止,而在 Red Team Access 中则成功完成了 50 项任务中的 34 项。Mistral 提出了另一个卖点,即模型不会拒绝执行任务:它声称在一项网络安全测试中取得了 82 % 的成绩,并表示 Claude Opus 5.5 和 GPT-6 Astra 都拒绝参加该测试。两种做法有一个共同点:最广泛的网络安全能力访问权限,首先向经过验证的专业人士开放,包括权重发布前的 Mistral 合作伙伴,或 Anthropic 计划的成员。
模型规模也在向两端延伸。大模型一端是拥有 1 万亿参数的 Mistral Large 4,其权重预计于十月底发布;小模型一端则有在手机上仅需约 567 MB 内存的 EmbeddingGemma 2、拥有 33.5 亿参数的 Tiny Aya L2-Thinker,以及拥有 2.7 亿参数、目前仅提供演示的 Falcon-OCR-Arabic。不过,当天的许多数据都来自厂商自身的测量:Mistral 的成绩、Black Forest Labs 声称的第一名、TII 自建的基准测试、Perplexity 的模型说明、由 OpenAI 评分的 Ironclad 任务,以及 GitHub 宣布的合并效率提升。这往往是公告发布当天唯一可用的衡量结果;通过独立评估交叉验证,会让这些结果更可靠,而 Mistral Large 4 的权重发布后,正好能为此提供条件。
来源
- Mistral 关于 Mistral Large 4 的博客文章
- 文档中的 Mistral Large 4 说明
- Anthropic 关于 Claude for Google Workspace 的博客文章
- @claudeai 在 X 上关于 Claude for Google Workspace 的帖子
- Anthropic 关于 Cyber Verification Program 的博客文章
- Cyber Verification Program 帮助页面
- Comcast 和 Booz Allen 使用 Claude Mythos
- Google 博客上的 EmbeddingGemma 2 文章
- EmbeddingGemma 2 模型说明
- @GoogleDeepMind 在 X 上关于 EmbeddingGemma 2 的帖子
- Hugging Face 上的 EmbeddingGemma 2
- OpenAI Decisions API 指南
- OpenAI API 更新日志
- @perplexitydevs 在 X 上关于 pplx-decider-v1.1-27b 的帖子
- Hugging Face 上的 pplx-decider-v1.1-27b
- @multimodalart 在 X 上关于 Decision Index 0.3 的帖子
- Decision Index 0.3
- OpenAI 关于与 Ironclad 合作的博客文章
- @OpenAIDevs 在 X 上关于使用等级的帖子
- OpenAI API 速率限制文档
- OpenAI 关于 API 的 BAA 的帮助文章
- Perplexity API 更新日志
- Perplexity 的 image_search 工具文档
- Amazon Bedrock 上的 GLM 5.3 说明
- @Zai_org 在 X 上关于 Bedrock 上的 GLM-5.3 的帖子
- Claude Code 2.1.290
- Claude Code 2.1.291
- Claude Code 2.1.292
- claude.dev 上的云端会话实用指南
- @ClaudeDevs 在 X 上关于云端会话奖励额度的帖子
- Mistral Vibe v2.26.0 版本说明
- Google Antigravity 更新日志
- @Replit 在 X 上关于所有项目上下文的帖子
- GitHub 关于堆叠式拉取请求的更新日志
- Cohere 关于 Tiny Aya L2-Thinker 的研究博客文章
- TII 关于 Falcon-OCR-Arabic 的博客文章
- Diffusers 0.41.0 版本说明
- Transformers v5.19.0 版本说明
- ElevenLabs 关于 ElevenAgents Architect 的博客文章
- @bfl_ai 在 X 上关于 FLUX 3 和 Physics-IQ 的帖子
- Physics-IQ Verified 排行榜
- @nutlope 在 X 上关于 GeoGuess Bench 的帖子
- GeoGuess Bench
- @my_cat_can_code 在 X 上关于 RSI Arena 的帖子
- RSI Arena
- NVIDIA 技术博客上的 AICR v1.0 文章
- Anthropic 关于 Claude Startups 的博客文章
- @claudeai 在 X 上关于 Claude Startup Stack 的帖子
- 丹·费恩在 X 上关于 Claude Projects 和本地文件夹的帖子
- 鲍里斯·切尔尼在 X 上关于 Claude Projects 逐步推出的帖子
- 丹·费恩在 X 上关于 Slack 群组消息中的 Claude 的帖子
- 鲍里斯·切尔尼在 X 上关于 Acquired 配套网站的帖子
- 鲍里斯·切尔尼在 X 上关于他如何为 Claude 编写提示的帖子
- Atlassian 和 OpenAI 扩大合作伙伴关系
- ChatGPT 和 Codex 更新日志:ChatGPT 的 iOS 版 1.2026.267
- Gemini CLI v0.63.0
- Mistral Python SDK v3.1.0
- Qwen Code v0.25.1-preview.0
- SpaceXAI TypeScript SDK v0.2.2
- TII 关于 Falcon-Emirati 的博客文章
- Datasets 5.1.0
- TRL v1.14.2
- 斯蒂芬·索尔卡的博客文章
- @vllm_project 在 X 上关于 Open Together 的帖子
- 杰夫·布迪耶在 X 上关于 Open Together 等候名单的帖子
- Copilot CLI 1.0.93-2
- GitHub 关于 AI Scan 启用状态的更新日志
- GitHub 关于新增密钥检测器的更新日志
- Devin 10 月 5 日版本说明
- 康拉德·欧文在 Delta 博客上的文章
- v0 更新日志:将个人账户转换为团队空间
- @v0 在 X 上关于 iOS 上的 ChatGPT 订阅的帖子
- @ElevenLabs 在 X 上关于 Eleven v4 位居榜首的帖子
- @HeyGenDev 在 X 上关于 HeyGen Video 支持 2K 的帖子
- @pika_labs 在 X 上关于 Pika 上的 Nano Banana 2.1 的帖子
- NVIDIA 技术博客上的 DOCA GPUNetIO 文章
- NVIDIA 技术博客上的 Green contexts 文章
- NVIDIA 博客:开放模型与电信运营商
- Perplexity 协作工具指南