ai-powered-markdown-translator使用 gemini-3.8-flash-high 从法语翻译成中文的文章。
GPT-6 与 Intelligent UI 正式面向 ChatGPT 全体用户推出:付费套餐自 10 月 7 日起可使用 GPT-6 Sol,Free 和 Go 用户则于 10 月 8 日起迎来 GPT-6 Luna。Anthropic 推出 Claude Haiku 5.5 补全其 5.5 系列,输入每百万 Token 仅 0.10 美元起;同时,微软的 Windows 活动开启了 RTX Spark PC 的预购,并宣布 GitHub Copilot 很快将能够把任务交由本地模型处理。OpenAI 还公开发布了由内部模型生成的 722 篇数学成果手稿。
ChatGPT 全面升级至 GPT-6 与 Intelligent UI,支持音频文件并筹备 College Planner
10 月 7 日——OpenAI 将 GPT-6 推广至 ChatGPT 的全体用户。这并非全新的基础模型:自 9 月起,付费客户已可以使用 GPT-6 Sol 和 GPT-6 Luna(此处曾在 9 月 22 日进行过报道)。这一次,针对日常对话调优的这两款模型的 10 月版本登陆了 Chat 标签页:Plus、Pro、Business 和 Enterprise 套餐自 10 月 7 日起可用 GPT-6 Sol,Free 和 Go 用户自 10 月 8 日起可用 GPT-6 Luna。它们在 ChatGPT 中取代了 GPT-5.6 Sol 和 GPT-5.6 Luna,而 Codex 和 ChatGPT Work 则保留 9 月版本。OpenAI 表示,此举旨在服务每周使用 ChatGPT 的超过 12 亿用户。
最引人注目的新功能名为 Intelligent UI。GPT-6 在生成回复时能够整合文本、视觉内容以及交互式元素(图表、按钮、表单、交互式流程图、卡片),并可按需创建小型工具,例如储蓄计算器、账单分摊器或小游戏;当纯文本足以解答时,ChatGPT 则仅输出文本。为此,OpenAI 依托于一个原生组件库和一个在生成过程中实时呈现界面的编译器。Intelligent UI 支持从 Instant 到 Extra High 的思考强度(effort),且不占用单独配额,但不支持由 GPT-6 Pro(基于 GPT-6 Astra 驱动)负责的 Pro 级别思考强度,也不支持旧版 macOS 和 Windows 桌面应用程序。
第二项变化:ChatGPT 可以在思考或调用工具的同时开始作答,随后无需输入新提示词即可补全回复。根据 OpenAI 的内部评估,在需要网络搜索的问题上,GPT-6 Instant 开始回复的时间平均比 GPT-5.6 Instant 早 44%;而 GPT-6 Extra High 的启动耗时与 GPT-5.6 Medium 相当,整体得分则高于 GPT-5.6 Extra High。
| 套餐或思考强度设置 | ChatGPT 中使用的模型 | 时间表及详情 |
|---|---|---|
| Plus、Pro、Business 和 Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | 自 10 月 7 日起全球推出 |
| Free 和 Go | GPT-6 Luna | 10 月 8 日起 |
| Pro 思考强度(Pro 100 与 200 dollars,Business、Enterprise) | GPT-6 Pro,由 GPT-6 Astra 驱动 | 不含 Intelligent UI |
| ChatGPT Work 和 Codex | GPT-6 Sol 与 GPT-6 Luna 的 9 月版本 | 无变化 |
安全方面,同日发布的系统报告(system card)依据《准备框架》(Preparedness Framework),将这些版本在网络安全以及生物和化学领域的能力评定为“High”(高),但在自我改进方面未达到该阈值;它们继承了 GPT-5.6 的防护机制,并提升了对越狱(jailbreaks)尝试的抵御能力,包括多轮对话中的防范。在 API 中,快照 chat-latest 现已指向这款全新的 ChatGPT 模型,OpenAI 建议在生产环境中使用 GPT-6 系列。
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇨🇳 GPT-6 和 Intelligent UI 现正面向所有人推送到 ChatGPT 中。在 ChatGPT 中,Intelligent UI 提供快速且交互式的回复,让日常问题更具直观性,让复杂主题更容易理解,并能针对您的任务即时提供适用的交互式工具。 — @OpenAI 在 X 上
🔗 面向所有人的 GPT-6 与 Intelligent UI · 系统报告,10 月更新 · ChatGPT 中的 GPT-6 及其他模型
ChatGPT 支持音频文件
10 月 6 日——ChatGPT 现已支持上传音频文件附件。用户可将录音添加到对话中,以获取转录文本、摘要或针对其内容的解答,亦可将会议、访谈或课程转化为结构化笔记,甚至是跟进邮件草稿。该功能仅限付费订阅和工作区(包括 Enterprise)使用:Free 套餐“目前”无法使用。支持的格式包括 WAV、MP3、OGG、FLAC、AAC、M4A 和 PCM,以及仅包含音频的 WebM 和 MP4,每个文件最大支持 512 MB。OpenAI 提醒称,转录内容可能存在错误,发言人识别仍不够可靠,且性能因语言而异。
🔗 ChatGPT 发版说明 · 在 ChatGPT 中上传文件与音频
ChatGPT for Teens:首批使用数据与即将推出的 College Planner
10 月 7 日——OpenAI 对 ChatGPT for Teens 进行了首次阶段性梳理,这是默认应用于被识别为 18 岁以下账户的使用体验。据该公司称,一周内有近 120 万青少年使用了 Learning Visualizations,超过 18 万人使用了 Study Mode;他们平均每天在此花费不到 15 分钟,且连续使用超过 3 小时的比例不足 2%。宣布的新功能 College Planner 将在“近期”推出,首先面向美国目标申请四年制大学的 10 至 12 年级高中生:同一规划方案中将汇总申请要求、截止日期、任务以及包括奖学金在内的助学金申请流程。OpenAI 还对 College Advising Corps 以及波士顿儿童医院的 Digital Wellness Lab(为期三年)提供支持,但未透露具体金额。
Claude Haiku 5.5 发布:据 Anthropic 称成本比 Haiku 4.5 降低约 75%
10 月 7 日——在 Opus 5.5 发布 15 天后、Sonnet 5.5 发布 9 天后,Anthropic 推出了 Claude Haiku 5.5(claude-haiku-5-5),补全了 Claude 5.5 系列。该模型面向高吞吐量且对成本敏感的任务(摘要、上下文压缩、数据库查询、分类),在代码领域充当 Opus 5.5 和 Sonnet 5.5 的子智能体,并适用于注重速度的场景,例如实时客户支持或浏览器操作:它是 Anthropic 在标准速度下最快的模型,尽管开启 Fast Mode 的 Opus 依然更快。这也是首款配备思考强度(effort)调节(默认为 medium)的 Haiku 模型,拥有 100 万 Token 的上下文窗口以及最多 128,000 Token 的输出能力。
其定价分为两个档位。在 100,000 Token 的提示词以内,Haiku 5.5 输入每百万 Token 为 0.10 美元,输出为 0.50 美元,比 Haiku 4.5 降低了 90%;超过该阈值后,价格分别为 0.50 美元和 2.50 美元,降低了 50%。官方宣传的“约 75%”成本节约是 Anthropic 计算的平均值:发往 Haiku 4.5 的请求中有 90% 处于该阈值之下,而且新的分词器(tokenizer)对于相同文本计算出的 Token 数量增加了约 30%。
| 计费类型(每百万 Token) | Haiku 5.5(不超过 100 000 Prompt Token) | Haiku 5.5(超过 100 000 Token) | Haiku 4.5 |
|---|---|---|---|
| 输入 Token | 0,10 dollar | 0,50 dollar | 1 dollar |
| 输出 Token | 0,50 dollar | 2,50 dollars | 5 dollars |
| 缓存读取 | 0,01 dollar | 0,05 dollar | 0,10 dollar |
| 缓存写入 | 0,125 dollar | 0,625 dollar | 1,25 dollar |
在 Anthropic 公布的基准测试中,其与 Haiku 4.5 的差距十分显著,且在两者同时参与测试的所有项目中,Haiku 5.5 均领先于 OpenAI 的 GPT-6 Luna。不过它依然落后于 Sonnet 5.5,Anthropic 仍然推荐将 Sonnet 5.5 与 Opus 5.5 一起用于复杂的智能体代码任务。
| 评估基准(Anthropic 数据) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0(智能体代码) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1,离线子集 | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam,无工具 | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (effort Xhigh) |
| Chartography,无工具 | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
六家客户分享了他们的早期测试体验:HubSpot 表示在其 CRM 套件上取得了 92.8% 的得分,为其迄今为止的最佳成绩;AlphaSense 在 400 次查询中获得了 0.84 的评分,而 Haiku 4.5 为 0.76;Box 则提升了 11 个百分点,同时延迟降低了约一半。从 Haiku 4.5 进行迁移需要一些适配工作:迁移指南列出了十一项变更,包括废止 budget_tokens、参数 temperature、top_p 与 top_k 以及预填充功能,而 Claude Code 的 /claude-api migrate 命令可自动完成其中的一部分。安全方面,Anthropic 表示其网络安全防护机制比 Haiku 4.5 更为严格,但略微宽松于其近期推出的其他模型:相比 Sonnet 5.5 允许执行更多防御性任务,而渗透测试依然被严格拦截。
此次发布还伴随着降价举措:Sonnet 5.5 的缓存读取价格自 10 月 7 日起由每百万 Token 0.20 美元降至 0.10 美元,据 Anthropic 称,这使得该模型在大多数智能体任务中的成本降低了约 20%。Haiku 5.5 现已在 Claude API、Amazon Web Services、Google Cloud 和 Microsoft Azure 上线,并已接入 Claude Code。
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇨🇳 隆重推出 Claude Haiku 5.5:这是我们迄今为止发布的价格最实惠、速度最快且性能最强的小型模型。平均而言,其运行成本比 Claude Haiku 4.5 降低了约 75%。 — @claudeai 在 X 上
🔗 Claude Haiku 5.5 发布公告 · Haiku 5.5 迁移指南
Cursor 中的 Haiku 5.5:在 CursorBench 上取得 48.4% 的得分
10 月 7 日——Cursor 在发布当天即上线了 Claude Haiku 5.5,可在其模型设置中启用。据 Cursor 称,在短请求上其成本比 Claude Haiku 4.5 低 10 倍。在 Cursor 官网公布的 CursorBench 榜单中,Haiku 5.5 在 Max 思考强度下位列第 10,成功率为 48.4%,单任务成本为 1.12 美元,略高于 Sonnet 5.5 在 High 思考强度下的表现(Cursor 于 10 月 7 日重新计算了 Sonnet 5.5 的成本以反映其新价格),并领先于 Max 思考强度下的 Opus 5。不过它的工作量更大:平均每个任务消耗 325,934 Token 并执行 163 步,而 High 思考强度下的 Sonnet 5.5 仅需 37,391 Token 和 41 步。
| Cursor 测试配置 | 榜单排名 | CursorBench 得分 | 单任务成本 |
|---|---|---|---|
| Opus 5.5, effort Max | 1 | 57,8 % | 13,43 dollars |
| Haiku 5.5, effort Max | 10 | 48,4 % | 1,12 dollar |
| Sonnet 5.5, effort High | 11 | 47,8 % | 1,20 dollar |
| Opus 5, effort Max | 13 | 46,6 % | 11,95 dollars |
| Haiku 5.5, effort Low | 54 | 30,9 % | 0,08 dollar |
🔗 Cursor 在 X 上的发布公告 · CursorBench 榜单
Max 与 Team 套餐可享每月 100 至 500 美元 API 额度
10 月 7 日 — 与 Haiku 5.5 在同一篇博文中宣布,面向 Max 和 Team 订阅用户、可在 Claude Platform 上使用的每月额度即将推出,并将在几天内逐步推送。该额度用于通过 API 构建自己的工具、应用程序与智能体(Agent);据 @ClaudeDevs 称,它支持包括 Haiku 5.5 在内的所有模型,既可在开发者自己的代码中使用,也可用于第三方工具。
| 适用套餐 | 每月 API 额度 |
|---|---|
| Max 5x | 100 美元 |
| Max 20x | 200 美元 |
| Team,Standard 席位 | 每席位 20 美元 |
| Team,Premium 席位 | 每席位 100 美元 |
| Team 团队上限 | 500 美元,共享资金池 |
| Free、Pro 和 Enterprise | 不符合资格 |
在 Team 套餐中,各席位的额度会合并到一个共享资金池中:例如,3 个 Standard 席位和 2 个 Premium 席位每月可获得 260 美元。该额度覆盖 Claude API 的所有模型,包括 Message Batches API,以及 Console 的 Playground、Claude Managed Agents 和 Claude Agent SDK。它不涵盖交互式使用的 Claude Code(终端、IDE、桌面端或 Web 应用),也不涵盖超出套餐额度的额外用量,亦不涵盖由 Amazon Bedrock、Google Cloud Vertex AI 或 Microsoft Foundry 提供的 Claude 模型,并且不会改变 Claude、Claude Code 或 Cowork 的使用上限。
要申领该额度,需持有符合资格套餐的有效订阅满至少 7 天,然后从 claude.ai 的账单设置中关联一个 Claude Console 组织,无需添加付款方式。只能关联一个组织,且只能由客服进行更改。额度在每个账单周期刷新,不可结转,且优先于已购买额度扣除;额度耗尽后,API 调用将暂停直至下一个周期额度发放,除非该组织已购买额度或启用了自动充值,并且不会在 Claude 订阅中产生额外扣费。今年 5 月,Anthropic 曾宣布自 6 月 15 日起为编程用途提供每月额度;帮助页面明确指出,这一新额度并不等同于那些目前已不可用的“Agent SDK 额度”。
🔗 帮助页面:Max 与 Team 套餐的每月 API 额度 · @ClaudeDevs 的公告
Windows 本地 AI:NVIDIA 开启 RTX Spark PC 预购并预先展示 DGX Station for Windows
10 月 7 日 — 在旧金山举办的 Windows AI and Surface 活动上,黄仁勋(Jensen Huang)与萨提亚·纳德拉(Satya Nadella)展开对话,NVIDIA 和微软借此机会正式商业化推出 RTX Spark,即 6 月 2 日在 Build 大会上发布的 Windows PC 芯片。笔记本电脑的预购已于 10 月 7 日开启,将于 10 月 16 日正式发货;迷你 PC(mini-PC)将于 11 月跟进。Acer、ASUS、Dell、HP、Lenovo、Microsoft、MSI 和 Gigabyte 正在准备相关机型,微软也展示了搭载该芯片的 Surface Laptop Ultra。NVIDIA 的博文未提及任何价格。
RTX Spark 结合了 Blackwell RTX GPU 与 Grace CPU,互连带宽达 600 GB/s,可提供 1 PFLOPS 的 FP4 AI 算力和高达 128 GB 的统一内存。NVIDIA 强调可在本地运行大模型,无需向云端传输数据,没有用量计费,并享有与其服务器相同的 CUDA 堆栈。该芯片同样面向创作者(NVFP4、硬件级 AV1 和 4:2:2 编码)以及游戏玩家,借助 DLSS 5 能以超过 100 fps 的帧率畅玩 1440p 游戏。
针对企业端,NVIDIA 预先展示了同样于 6 月在 Build 大会上公布的 DGX Station for Windows,并将其描述为 Windows 生态系统中的首款桌面 AI 超级计算机:无需离开 Windows 即可在本地运行万亿参数量级的模型,同时仍可通过 WSL 使用 Linux 工具。目前尚未公布日期或售价,仅开放了通知预约注册。另一方面,微软宣布 Microsoft Execution Containers (MXC) 进入正式发布(GA)阶段,这是在 Windows 控制下于后台运行智能体的基础设施。
| 对比项目 | RTX Spark | DGX Station for Windows |
|---|---|---|
| 芯片 | Blackwell RTX GPU(最高 6,144 核)与 Grace CPU(最高 20 核) | GB300 Grace Blackwell Ultra Desktop 超级芯片 |
| 内存 | 高达 128 GB,统一内存 | 748 GB,一致性内存 |
| FP4 AI 算力 | 1 PFLOPS | 最高 20 PFLOPS |
| 宣布的发售情况 | 笔记本电脑开启预购,10 月 16 日发售;迷你 PC 将于 11 月推出 | 预先展示,未定日期与价格 |
在 Windows 上进行本地开发:Copilot 将路由至 MAI Code 1.1 Flash,其沙箱功能正式发布,Replit 筹备桌面应用
10 月 7 日 — GitHub Copilot 很快将能够自主在开发者本机运行的模型与云端模型之间进行选择。根据微软和 GitHub 在 Microsoft Command Line 博客上发布的文章,该路由功能将于“本月底前”推出:目前尚未上线。GitHub 将其视作 Project HydraFusion 的下一步演进,该编排器已能够在多个模型之间分配任务,并着重强调了节省 AI 额度的优势(未给出具体量化数据)。
Copilot CLI、GitHub Copilot 应用以及 VS Code 中规划了两种使用方式。Auto 模式将根据任务上下文和缓存状态,在每轮交互中自主选择本地推理或云端推理;开发者也可以自行指定本地模型,无论是通过 Windows ML 提供商运行的 MAI Code 1.1 Flash,还是由兼容 OpenAI API 的本地端点(endpoint)暴露的任何模型。博文同时提醒:本地推理并不会使会话完全离线。
该演示在一台配备 RTX Spark 的 Surface Laptop Ultra 上运行。Microsoft AI 在其上运行了本地版本的 MAI Code 1.1 Flash,这是一款专用于代码的混合专家(mixture-of-experts)模型,总参数量达 1370 亿,其中活跃参数为 68 亿。量化至每个权重约 3.3 位后,其体积为 53 GB,比云端版本减少了 80%,在 256,000 个 token 上下文时的内存峰值为 75.5 GB。
| 评测基准(微软 10 月 5 日测试) | MAI Code 1.1 Flash | 设备端量化版本 | GPT OSS 120B(Unsloth 的 GGUF 版本) |
|---|---|---|---|
| SWE-Bench Verified(500 项任务) | 72.6% | 70.80% | 32.0% |
| Terminal-Bench 2.1(89 项任务) | 62.9% | 66.29% | 23.6% |
微软指出,这些测试运行在适用于 Windows ARM64 的 llama.cpp 运行时环境中,测试结果会因设备和配置而异。首批基础构件已在终端中推出:从 Copilot CLI 预发布版 1.0.94-0 开始,/model 命令即可发现本地 Ollama 实例中的模型。未经确认不会添加任何内容,Ollama 和相应模型必须已预先安装,且仅推荐支持工具调用和流式传输(streaming)的模型。
🔗 为 Windows 和 GitHub Copilot 带来本地模型与沙箱工具 · 在 GitHub Copilot CLI 中发现本地模型
Copilot 本地沙箱功能正式发布
10 月 7 日 — GitHub Copilot 的本地沙箱脱离了 6 月 2 日开启的公开预览阶段:现已在 Copilot CLI、GitHub Copilot 应用以及通过 Agent Host 运行的 VS Code 会话中正式发布(GA),无需额外费用。届时,Copilot 启动的工具和命令将根据开发者或其组织设定的策略,在对文件、网络、Git 与 GitHub CLI 凭据以及其他系统功能的访问受到限制的环境下执行;企业可以强制执行开发者无法放宽的策略设置,无论使用何种模型。其底层引擎 Microsoft eXecution Container (MXC) 是 Windows 团队开发的一个开源库,在 Windows 上基于 ProcessContainer、在 macOS 上基于 Seatbelt、在 Linux 上基于 bubblewrap 构建,无需虚拟机。文档中也明确指出了其局限性:内置文件工具由 Copilot 自身控制而非操作系统控制,且远程 MCP 服务器仍处于本地沙箱之外。
Replit 在 Windows 上实现本地构建应用
10 月 7 日 — Replit 与微软联合宣布推出一款桌面应用程序的预览版,该应用可在 Windows 上直接于用户电脑本地构建并运行应用程序。Replit 此前已提供桌面应用:新特性在于这种本地构建能力,每次构建(build)都在各自独立的沙箱中运行,该沙箱基于 Microsoft Execution Containers 和 NVIDIA 的开源运行时环境 OpenShell 构建。早期访问需加入候补名单,未公布具体日期或价格,且未提及 macOS 版本。Replit 在 10 月 7 日的 Windows 活动现场展示了这一预览版。
OpenAI 发布由内部模型生成的 722 篇数学成果手稿
10 月 6 日 — OpenAI 一次性发布了由尚未公开的尖端内部模型生成的大量数学成果。于 10 月 6 日晚公布的 GitHub 仓库 openai/math 收录了 722 篇手稿,按学科归为 372 个系列:一项主要成果可能附带补充论证、推论或替代证明。
绝大多数成果源自相同的流程:向该模型提出了约 4,000 个问题,每项成果平均耗费相当于 ChatGPT Pro 三小时的思考时间。OpenAI 解释称,在现有的数学评测达到饱和后,他们将评测范围拓展到了开放式研究问题。有两项研究是该流程的例外:黎曼 zeta 函数的一个无零点区域(为了提高可读性,其文稿经过了人工润色),以及霍奇猜想在 CM 阿贝尔簇这一特例下的证明。
| OpenAI 发布的指标 | 公布的数值 |
|---|---|
| 发布的手稿数量 | 722 |
| 成果系列数量 | 372 |
| 向模型提出的问题数 | 约 4,000 |
| 每项成果的平均计算量 | 相当于 ChatGPT Pro 约三小时的思考时间 |
| 发布的推理总结数 | 10 |
并非所有成果都经过相同方式的验证。许多证明已在 Lean(一种允许通过计算机验证证明的语言)中进行了形式化,但并非全部:OpenAI 警告称“某些未形式化的成果可能包含错误”,承诺将迅速更正,并会陆续添加新的形式化证明。关于模型推理的十份总结涵盖了 π 的无理度量、马勒猜想、特征二下的卡普兰斯基直接有限性猜想,以及自由群因子的同构等主题。
此次成果发布本身是与普林斯顿高等研究院的数学与 AI 独立咨询小组联合筹备的:包括审阅与引用规范、更正作为新版本发布以及保留版本历史记录。OpenAI 还宣布资助专门针对这些成果的研讨会、会议与研究项目,并表示正在努力为科学家提供针对该生成模型的“负责任”访问途径,但未给出时间表。
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇨🇳 我们正在发布由尖端内部模型生成的一系列广泛的全新数学成果。我们咨询了普林斯顿高等研究院的数学与人工智能独立咨询小组,并参考了其建议和公开准则,以确定发布这些成果的方式。 — @OpenAI 在 X 上
🔗 分享数学领域的 AI 进展 · GitHub 上的 openai/math 仓库
Perplexity 发布 pplx-embed-v2-late:面向文本与图像的多向量嵌入模型
10月7日 — Perplexity Research 发布了 pplx-embed-v2-late,包含 0.6B 和 9B 参数的两款后期交互(late interaction)嵌入模型,均已在 Hugging Face 上以 MIT 许可证发布。传统的稠密嵌入将每个文档压缩为一个向量,而这类 ColBERT 风格的模型则为每个 token 保留一个 128 维向量,并通过 MaxSim 对每个查询-文档对进行评分:将查询中的每个 token 与文档中最接近的 token 进行匹配。它们无需经过 OCR 即可检索文本、图像和渲染页面(PDF、幻灯片、扫描件),从而保留了表格、图表和排版布局。
这两种尺寸共享相同的嵌入空间,因为它们是基于一个从 27B 基座衍生的 18B 内部教师模型进行逐 token 蒸馏得到的。因此,使用 9B 建立索引的语料库可以通过 0.6B 编码的查询进行检索:在图像任务 ViDoRe v3 上,该配置达到了 63,5 %,而两端均使用 0.6B 时为 62,3 %,且不会增加查询端的开销。从 Qwen3.5-0.8B 剪枝而来的 0.6B 模型由此可用作轻量级查询编码器,甚至能部署在端侧设备上。
| 评估基准(Perplexity 测算) | 9B 得分 | 0.6B 得分 | 对比参考 |
|---|---|---|---|
| 72 项专业任务 (nDCG@10) | 81,3 % | 78,0 % | 9B 领先次优模型 1,6 点 |
| Q2D-Web,网页搜索 (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b:69,3 % |
| ViDoRe v3 图像任务 (nDCG@10) | 65,2 % | 62,3 % | 仅 EVIE 领先 9B |
| BrowseComp+ (智能体 GPT-OSS-120B) | 64,0 % | — | 下一个最佳 ColBERT:落后 4,9 点 |
| MADQA (智能体 Gemini 3.5 Flash) | 92,4 % | 90,1 % | Mixedbread Agentic Search:93,4 % |
9B 并非处处领先,Perplexity 也明确指出了这一点:腾讯的 EVIE 在 ViDoRe v3 图像基准上超过了它,gemini-embedding-2 在 MIRACL-Vision 以及内部基准 PPLX-Q2I 上领先,而 Mixedbread Agentic Search 在 MADQA 上取得了更高得分(Perplexity 认为这一差距处于其置信区间之内)。该公司还承认,存储占用和评分成本会随着文档长度的增加而上升。技术报告预计将于“今年晚些时候”发布,Perplexity 还计划在其 API 平台上逐步开放其后期交互、稠密及上下文嵌入模型,目前暂未公布具体日期。
🔗 Perplexity Research 博客文章 · Hugging Face 上的 pplx-embed-v2-late-9b
代码智能体:Claude Code 2.1.293、Codex CLI 0.161.0、iOS 版 Cursor、Antigravity 2.21.0 与 Warp Factories
五款代码智能体工具迎来更新:Claude Code 采用 Haiku 5.5,Codex CLI 支持从终端连接 MCP 服务器,Cursor 支持通过 iPhone 进行控制,Antigravity 对其智能体操作进行了折叠收起,Warp 则向微软工具开放。
Claude Code 2.1.293 默认切换至 Haiku 5.5
10月7日 — 在 Haiku 5.5 发布几分钟后推出的 Claude Code 2.1.293 版本,将其设为 Anthropic API 上的默认 Haiku 模型。该版本在 subagentStatusLine 的有效载荷中新增了 agentType 字段,以区分自定义子智能体;还增加了一个 isDeferred 选项,可从一开始就公开由 mod 声明的工具架构。更新的核心在于 56 项记录中的 38 项修复:Claude 曾可能在上下文压缩后将其压缩前的最后操作置于其后,从而撤回或重复已完成的工作;当 Claude 在 Bash 中使用 cat 或 grep 读取文件时,限定路径的规则以及嵌套的 CLAUDE.md 也能被加载;修复了 MCP HTTP 连接的内存泄漏问题。两项最近的改动被回滚(2.1.281 的自动模式拒绝提示信息、2.1.290 的云会话补丁),并且 Claude Tag 的通道规则上限从 20 提高到 50。
🔗 GitHub 上的 Claude Code 2.1.293
Codex CLI 0.161.0 将 Daybreak 置于选项之后
10月7日 — Codex CLI 0.161.0 是自 10 月 5 日 0.160.1 以来的首个稳定版本。通过 /mcp login <name> 命令,无需离开当前终端会话即可连接到 MCP 服务器,并且语音对话新增了麦克风、扬声器和输入通道的选择功能。OpenAI 的网络安全产品线 Daybreak 现已转为可选配置:在用户通过 --enable cli_daybreak(或 features.cli_daybreak=true)启用之前,切换开关 /daybreak 和状态栏中的 Daybreak 状态将保持隐藏,且若未启用,将忽略自动 Cyber 路由。针对单轮对话,codex exec --cyber-access-program 可选择 Cyber 访问程序。在 Amazon Bedrock 方面,多智能体 V2 和 Ultra 推理努力程度已向兼容模型推出,Bedrock Mantle 也开始支持 AWS GovCloud 区域。修复内容涉及权限问题、会话恢复以及损坏 SQLite 数据库的检测。
Cursor 支持通过 iOS 控制电脑端的智能体
10月6日 — Cursor 的 iOS 应用现已支持显示电脑本地运行的智能体:用户可以查看每个智能体正在执行的操作并进行回复,官方公告推文还提到了发起新任务的功能。智能体仍留在本地计算机上运行,应用通过网络连接到该设备:因此电脑必须保持开机并处于联网状态,同时提供了一项 Keep this computer awake 设置,在插上电源且屏幕打开时防止电脑进入休眠。该功能默认开启,但在 Enterprise 组织中需要管理员手动启用;配对操作在桌面应用中确认,且无需使用云端智能体。6 月底推出的 iOS 应用主打云端智能体,而现在本地智能体也可以直接通过手机进行访问。
Antigravity 2.21.0 折叠整合智能体操作
10月6日 — Google 的 Antigravity 应用迎来 2.21.0 版本,包含 9 项改进和 14 项修复。高级搜索支持使用 ⌘+K(Windows 上为 Ctrl+K)根据对话内容查找会话。计划任务(Scheduled Tasks)标签页更名为 Automations:用户可以通过 Run Now 立即运行某项自动化,或者使用 Create with Prompt 让智能体引导创建新任务。智能体在两次回答之间所做的文件修改、终端命令和读取操作,现在会被整合折叠在单行中,并附带简短摘要。修复方面,此前智能体读取损坏截断的 MP4 或 MOV 视频可能会导致后续整场对话失败,以及使用 Windows 记事本或 PowerShell 保存的设置文件会出现失效的问题。更新日志提示,新版本可能需要几天时间才能覆盖所有用户。
Warp Factories 接入 Microsoft Teams 与 Azure DevOps
10月7日 — Warp 宣布其软件工厂(software factories)平台 Warp Factories 正式支持 Microsoft Teams 和 Azure DevOps Services。在 Teams 中,在已配置的频道或讨论串中提及 Warp 应用即可将任务连同对话上下文指派给工厂;工厂会在同一讨论串中汇报进度,并提交 Pull Request 供审查。在 Azure DevOps 中,用户可以从工作项(work item)或 Pull Request 中提及工厂,或根据其事件触发执行;每个工厂都会获得专门用于 Git 操作的独立身份,并仅对指定代码库拥有访问权限。这两项集成已面向所有 Warp Factories 客户开放。Warp 将这一原生双重支持宣传为行业首创;而 Devin 此前已集成了 Teams 和 Azure DevOps Server。
API 与平台:Claude SDK 的 computer use 和 browser use 工具集,Grok 4.7 上线 Microsoft Foundry
针对基于托管模型构建应用的开发者公布了两项消息:Anthropic 简化了对计算机或浏览器的控制,而 Grok 4.7 已在微软平台正式全面商用。
Claude SDK 的 computer use 和 browser use 工具集
10月7日 — Claude 的 Python 和 TypeScript SDK 测试版中集成了 computer use 和 browser use 工具集(toolsets)。此前,API 仅指出 Claude 想要点击或输入的内容,开发者必须自行编写循环逻辑将每个操作转化为执行命令。现在,SDK 直接接管了这一循环:开发者只需继承 BetaAbstractBrowserToolset20260801 或 BetaAbstractComputerToolset20260801 子类,为每个操作编写一个方法,SDK 便会自动路由调用、执行所提供的 URL 和文件策略、请求审批并构建返回给模型的结果。Anthropic 并不提供开箱即用的浏览器或驱动程序:开发者需要接入自己的自动化方案,或者使用来自 Browser Use、Browserbase、E2B 或 Daytona 的驱动,并在 claude-quickstarts 仓库中发布了一个基于 Chrome DevTools Protocol 的极简示例。JavaScript 执行和文件上传默认处于禁用状态,且在没有配置 URL 策略时,不会对任何网址进行验证。
🔗 @ClaudeDevs 在 X 上的推文串 · SDK 工具集文档
Grok 4.7 在 Microsoft Foundry 正式全面商用
10月7日 — @SpaceXAI 昨夜宣布,SpaceXAI 于 9 月 21 日发布的模型 Grok 4.7 现已在 Microsoft Foundry 上线。微软文档将其列为正式全面商用,属于由 Azure 直接销售的模型:支持文本与图像输入、500 000 token 上下文(输入和输出合计)、工具调用,可通过 Chat Completions 或 Responses API 访问,推理努力程度覆盖 low 至 xhigh,默认为 high。微软承诺,从 Grok 4.7 开始,正式全面商用的 Grok 模型将至少提供六个月;Grok 4.6 仍为预览版状态。截至 10 月 7 日晚,Azure 定价页面尚未列出 Grok 4.7。继 Amazon Bedrock(9 月 28 日)和 Google Cloud 预览版(10 月 1 日)之后,Grok 4.7 已在三大主流云服务提供商处全部上线。
🔗 在 Microsoft Foundry 中部署并使用 Grok 模型
开源模型:Liquid AI 的 Open d1,Ai2 的 Bolmo 登上《自然》杂志并推出 Bwen 8B 与 Blama 8B
两项开放权重发布:一项旨在实现边缘端的快速决策,另一项则用于按字节逐字读取文本。
Open d1:Liquid AI 的开源决策模型
10月7日 — Liquid AI 推出 Open d1 开源其决策模型家族:两款开放权重模型包括 d1-3B(文本与图像)和 d1-omni-600M(文本配合图像或音频),后者为早期研究版本。它们不生成文本,而是在单次前向传递中为每个允许的选项分配概率。根据 Liquid AI 的说法,d1-3B 在 Decision Index 0.2.1 上获得 48,57 分,是 100 亿参数以下模型中的最高得分,领先于 Decider 35B-A3B(47,11 分),在七个公开基准数据集上的平均分达到 82,9。与 NVIDIA 联合测量的单次问题延迟显示,在 RTX 4090 上仅需 8 ms,在 Jetson Orin Nano 上为 50 ms,足以面向边缘端(edge)部署。目前尚未发布视觉或音频基准测试数据。模型权重已发布在 Hugging Face 上,采用 Liquid AI 自有许可证(lfm1.0),并提供 GGUF 版本;而 9 月 29 日发布的 d1 此前仅能通过 API 访问。
🔗 Liquid AI 在 Hugging Face 上的博客文章
Ai2 的 Bolmo 登上《自然》杂志,携手 Bwen 8B 与 Blama 8B
10月7日 — Ai2 于 10 月 7 日在《自然》(Nature)杂志在线发表了 Bolmo 背后的研究方法,该模型家族完全开源,直接读取字节而非子词。读取字节避免了固定词表的盲区(拼写、罕见字符串、特定书写系统),但此前需要从头开始完整训练。相反,字节化转换(byteifying)以性能已经较强的子词模型为基础,通过短暂的补充训练对其进行改造。基于 Olmo 衍生的 Bolmo 1B 和 7B 于 12 月推出;Ai2 还展示了 Bwen 8B(基于 Qwen 3 8B 衍生,采用 Apache-2.0 许可证)和 Blama 8B(基于 Llama 3 8B 衍生,采用 llama3 许可证)——两者的仓库自 8 月 26 日起就已存在,同时提供了仅训练了新字节层的“Stage 1”检查点。据 Ai2 称,这两款模型已接近其原始模型性能,且 Bwen 8B 超过了 Bolmo 7B,但未公布具体数据。
🔗 Ai2 博客文章
SynthID Detector 面向所有人开放,用于检测图像、视频和音频
10月7日 — Google 面向所有人开放了 SynthID Detector,该工具能够识别 AI 生成内容中的 SynthID 隐形水印。去年曾针对媒体专业人士推出了早期预览版,现在全球用户均可访问英文网站 synthid.com 使用。用户可上传图像、视频或音频文件。检测范围覆盖 Google 以及合作伙伴 OpenAI、NVIDIA、Kakao 的内容,且即将支持 Apple。该网站提示,这并非通用的 AI 检测器:来自未使用 SynthID 的模型的内容,或经过大幅修改的内容,可能会显示为“未检测到”。Google 声称自 2023 年以来已为超过 1800 亿张图像与视频以及 240 000 年的音频添加了水印(7 月公布的数据为 1000 亿张和 60 000 年),在 Search、Gemini 应用和 Chrome 中每天进行的验证超过 100 万次。
🔗 Google 扩大面向 AI 内容的 SynthID Detector 适用范围
安全:GitHub 推出用于检测泄露机密的分类器
10月7日 — GitHub 上线了一个微调的 ModernBERT 分类器,该分类器专门用于检测泄露的机密信息,由 GitHub 与 Microsoft Applied Sciences 联合构建:它通过分析某个值周围的代码上下文来识别可能的凭据,包括没有固定可识别格式的密码。该分类器在 2 ms 内即可评估一批候选值,据 GitHub 称,它可能会使推送时拦截的机密数量“增加一倍以上”。即日起,AI 密码检测告警已切换至该模型,无需额外费用。AI 推送保护功能处于私有预览阶段,预计将于“本月晚些时候”向符合条件的组织开放;而 Copilot 的 /security-review 命令检查也将在“近期”进入私有预览阶段,两者均需消耗 AI 点数。GitHub 安全产品负责人 Erin Havens 撰文指出,目前三分之一的 Pull Request 都涉及 AI 智能体,而现有的推送保护仅能拦截约 30 % 新检测到的机密信息。
基础设施:GitHub 为智能体活动重构 Git
10月6日 — GitHub 正在重构其 Git 基础设施,以跟上智能体开发的步伐。根据 Brian Celenza 的工程博客文章,从 2025 年 9 月到 2026 年 8 月,Git 总活动量从每月 2182 亿次事件增至 4733 亿次;开发者和智能体在 2026 年 9 月共产生了 73.8 亿次提交,是一年前的五倍以上,push 次数也增长至 4.9 倍。目前的架构 Spokes 将每个仓库复制到多台服务器上,并通过多数票决来验证每次更新:因此,为了支持读取而增加副本会拖慢写入速度。新架构将存储与计算分离,基准数据存放在 Azure Blob Storage 中,轻量级进程(workers)则从缓存中响应读取请求。在内部基准测试中,GitHub 测得写入吞吐量最高提升了 35 倍,目前尚未公布切换时间表。
语音 AI:ElevenLabs 与印度一邦签署谅解备忘录
10月7日 — 在班加罗尔峰会上,ElevenLabs 与印度某邦政府签署了首份谅解备忘录(MOU),以开展语音 AI 试点项目。该公司未透露该邦名称,也未提供时间表、范围或金额:该公告仅为一条推文,未发布博客文章。随附的数据说明了其中的重要性:在过去一年中,ElevenAgents 在印度进行了超过 1 亿次对话,其中超过 70% 使用印地语、卡纳达语、泰米尔语和泰卢固语。此次峰会汇聚了 500 多位企业高管、开发者和合作伙伴。
研究:PivotOPD,NVIDIA 用于挽救智能体关键错误的方法
10月7日 — NVIDIA 研究人员提出了 PivotOPD,这是一种针对执行多轮动作的智能体的训练方法。他们的发现:在 ALFWorld 上,三个 Qwen3 模型的失败案例中有 59% 包含一个早期犯下的“关键枢纽错误”,此后智能体便在错误的方向上越走越远。PivotOPD 拓展了同策略蒸馏(on-policy distillation):针对每个关键错误,教师模型会指出正确的动作,并为后续轮次提供补救动作,使学生模型既能学会避免错误,又能学会从错误中恢复。在与 13 种基准方法的对比中,配备 1.7B 和 8B Qwen3 学生模型的该方法在 ALFWorld、WebShop 和 Search-based QA 上取得了最佳平均成绩,并在 72 个重放的关键错误中挽回了 72.7%,而标准蒸馏仅为 20.3%。这种收益也延伸到了代码领域:Nemotron-3.5 学生模型在 SWE-Bench Verified 上的成绩从 62.8% 提升至 66.0%。论文已发表在 arXiv 上;代码预计近期公布。
优化:cuOpt 中的 mPDLP 将超大规模线性规划分布到多个 GPU 上
10月7日 — NVIDIA 在其开源优化库 cuOpt 中新增了 mPDLP,这是一种分布在通过 NVLink 互连的多个 GPU 上的线性规划求解器,用于解决大规模规划问题(供应链、电网)。通过将相互依赖的变量和约束集中在同一 GPU 上,它减少了通信开销,并将单 GPU 峰值内存最高减少为原来的 1/6。在 DGX B200 节点上,PDLP 计算的加速比达到 11.4 倍,端到端加速比达到 4.2 倍;与 D-PDLP 相比,mPDLP 在大多数大型问题上的速度提升了 1.2 至 2.5 倍,但在三个最大规模的实例以及小型问题上速度较慢。Kinaxis 在 8 块 H100 上求解具有超过 1.35 亿个变量的供应链问题的速度提升了 3.3 倍,PSR 在 8 块 B200 上求解具有 1.85 亿个变量的能源模型的速度提升了 5 倍以上。
机器人:机器人组装 GB300 测试托盘
10月7日 — NVIDIA 西雅图机器人实验室介绍了他们如何教机器人组装用于出厂前检测模块的 GB300 测试托盘。他们与制造这些系统的富士康选定了两项动作:在 16 个点上放置并拧紧母线,以及插入安装在柔性电缆上的四个连接器。与富士康共同设定的标准是 99.5% 的成功率,耗时不得超过熟练操作工的两倍,且无碰撞。机器人的表现接近但尚未完全达标:母线组装的成功率超过 95%,耗时 160 秒(目标为 124 秒);连接器插接成功率为 90% 至 95%,每根电缆耗时 40 秒。该团队结合了传统的感知与控制管线、DOPER 位姿估计以及在 Isaac Lab 中的强化学习,并在真实机器人上进行校正。NVIDIA 承诺将开源 DOPER 及其编排器 TALOS,但未公布具体日期。
简讯
- ChatGPT iOS 应用 1.2026.272 — 直接在回复中显示网页预览,在应用内打开 Codex 任务链接,并在 Codex Mobile 端重新设计了批准选择器并提升了长对话流的处理速度。🔗 来源
- Radisson Hotel Group — 根据 OpenAI 的一份案例研究,其与 Accenture Song 历时六周开发的 ChatGPT 插件在 2026 年 7 月至 8 月期间的转化率约为其自然搜索的 1.5 倍,且其在 ChatGPT 内广告活动中 54% 的支付和预订事件归因于单纯的广告浏览。🔗 来源
- Jump Trading — 这家量化交易公司将可能运行数天、交叉比对众多数据源的分析任务委托给 GPT-6 Astra 智能体,并在链路末端进行人工复核;OpenAI 的案例研究未公布任何收益数据。🔗 来源
- ChatGPT 插件扩展 — 在其视频教程的帖子中,OpenAI Developers 提到除 tldraw 和 MagicPath 外,使用这些扩展的公司还包括 Adobe、Canva、Figma、Shopify、Instacart 和 Atlassian;这些扩展于 9 月 29 日发布,可从侧边栏启动插件、支持 @ 提及并添加了文件查看器。🔗 来源
- Every 与 Claude Managed Agents — Every 团队基于 Claude Managed Agents 构建了一款企业智能体,员工可在 Slack 中使用它来在每个新模型发布时分享自己的 skills,随后又向其订阅者开放;Anthropic 转发了一段视频访谈,未提及具体数据。🔗 来源
- Zed 1.23 与预览版 1.24.1 — 1.23 版本转为稳定版,支持 JSONL 和 NDJSON 文件预览;预览版 1.24.1 允许将终端标签页拖入 Agent Panel,支持带有工具、图像和思考能力的自定义 Amazon Bedrock 模型,支持创建 Git 标签,并将 Linux 二进制文件体积缩减了约 23%。🔗 来源
- Amp 的元智能体 Puck — 现已支持多个独立会话:点击 + 按钮可新建会话,点击其名称可在会话间切换,处于非活跃状态达三天的会话将被归档到单独区域。🔗 来源
- Copilot CLI 1.0.93 — 该版本已转为稳定版,可在两轮交互之间直接应用 MCP 服务器的配置更改而无需重启会话,并通过 /sandbox 和 —sandbox 向所有人开放了命令沙箱;Copilot SDK 1.0.17 亦转为稳定版。🔗 来源
- Copilot 使用指标 — 自多款 IDE 开始通过 Copilot SDK 运行会话以来,指标一直低估了智能体的活动;修复该问题需要更新(VS Code 1.139.0 即刻生效,Visual Studio 18.12 于 10 月更新,JetBrains 于 10 月底更新,Eclipse 和 Xcode 于 11 月前更新),且丢失的数据将无法恢复。🔗 来源
- Gemini CLI v0.65.0-nightly.20261007 — 该每夜构建版开启了 0.65.0 系列,包含五个修复,其中两个用于防止数据丢失:项目设置在不受信任的文件夹中变为只读(此前
gemini mcp add可能会清空.gemini/settings.json),并且立即退出恢复的会话不再会删除其历史记录。🔗 来源 - Transformers.js 4.3.1 — 在 EmbeddingGemma 2 发布次日,该库即可直接在浏览器中通过 WebGPU 或 WASM,或在 Node.js 环境下计算其多模态嵌入(7.4 亿参数,768 维)。🔗 来源
- RL Environment Explorer — Hugging Face 的 Adithya S K 推出了这个 FineEnvs Space,用于浏览、可视化和启动 Hub 上的强化学习环境(OpenEnv、Harbor、MiMo、Verifiers、NeMo Gym):包含超过 1200 万个任务条目,主要来自几个大型 OpenEnv 环境。🔗 来源
- Seb-9B — Stas Veretennikov 在 Apache-2.0 许可证下发布了这款本地决策模型(支持文本、JSON 或图像,最多 20 个选项),其在 17 个公开测试套件上的平均得分为 0.792,而 Jev 1.13 为 0.786;作者独立完成了所有评测,并说明其训练数据包含了其中一个基准测试的训练集部分,但不含其测试用例。🔗 来源
- Nemotron 征战 2026 年奥林匹克竞赛 — NVIDIA 详细介绍了背后的通用配方(监督微调、强化学习以及生成、验证与修正闭环),该模型在 2026 年 IOI 非正式参赛中获得了 600 分中的 535.4 分,在 2026 年 IMO 中获得了 42 分中的 30 分(金牌线为 29 分),并发布了包含 200 道题目的 Nemotron-IMO-Bench 基准。🔗 来源
- Instadocs: AI Gone Wild — Netflix 宣布将于 10 月 12 日上线这部纪录片,重现 Hugging Face 在 7 月遭受的网络攻击;据 Netflix 称,该攻击是由 OpenAI 研究人员创建的自主智能体发起的。🔗 来源
- Runway 上架 ChatGPT 应用目录 — 安装插件并连接 Runway 账户后,在对话中 @Runway 即可委托其生成图像或视频;Runway 未说明定价或积分消耗情况。🔗 来源
- Luma 的 Face Swap 功能 — 该功能可在现有镜头中替换人物面部,以便在无需从头开始的情况下进行迭代;该公告仅为两条推文,未提供产品页面、定价或模型细节。🔗 来源
- DSX Air — NVIDIA 展示了如何在此数字孪生上测试 AI 工厂的变更:智能体应用修改,验证配置、安全性与隔离性,然后生成报告,而上线生产仍需经过人工验证;此为方法论文章,未包含具体数据。🔗 来源
- cuPhoton — NVIDIA 的一篇教程展示了如何将该开源工具包应用于 GPU 上的天文图像分析,涵盖从读取 FITS 文件到候选目标复核;宣称的最高达 14,900 倍的速度提升仅针对特定操作,而非端到端处理。🔗 来源
- Cosmos 与 SynthID — build.nvidia.com 上由 NVIDIA Cosmos 模型生成的内容带有 SynthID 水印,现在任何人均可通过 Google 开源的检测器进行验证。🔗 来源
- SpaceXAI TypeScript SDK 0.2.3 — 增加了服务等级
fast(可与priority互换),以及标识符grok-imagine-video-1.5-lite(一个未在发布说明中提及的轻量级视频模型):根据模型页面的数据,该模型不支持音频输入,且在 480p 分辨率下每秒成本仅为grok-imagine-video-1.5的四分之一。🔗 来源 - RAG 与 LLM 指南 — Perplexity 发布了一份科普指南,阐述了 RAG 与 LLM 的互补性,区分了三种 RAG 类型(朴素式、模块化、进阶式),并指出了何时单独使用 LLM 即可满足需求;未涉及新功能或新数据。🔗 来源
这意味着什么
小型模型正成为大众消费级产品。从 10 月 8 日起,ChatGPT 免费用户将由 GPT-6 Luna 提供响应,而 Anthropic 将 100,000 token 提示词以内的 Haiku 5.5 输入定价定为每百万 token 0.10 美元,同时将 Sonnet 5.5 的缓存读取价格减半。这些模型承担了大部分调用量:日常对话、子智能体、摘要、内容压缩。然而 Cursor 的榜单提醒我们,按 token 计费并不能说明一切:在 Max 努力程度下,Haiku 5.5 每项任务消耗的 token 几乎是 High 努力程度下 Sonnet 5.5 的九倍,而每项任务的成本仅略低一点(1.12 美元对比 1.20 美元)。另一方面,Max 和 Team 套餐的月度 API 额度正在鼓励订阅者在自己的代码中尝试这些模型。
AI 也正在回流至个人工作站。RTX Spark 笔记本电脑将于 10 月 16 日面世,DGX Station for Windows 承诺在桌面上提供高达 20 petaflops 的算力,Copilot 预计将在本月底前亲自将某些任务交由本地的 MAI Code 1.1 Flash 处理。Replit 现已在用户本地机器上构建应用程序。在个人电脑上执行代码的智能体引发了安全问题,而同一套底层组件在各地反复出现:已在 Windows 上正式发布的 Microsoft Execution Containers (MXC) 既能隔离 Copilot 命令,也能隔离 Replit 的构建过程。GitHub 方面则正在部署专门针对泄露机密的分类器,并重构其 Git 基础设施,因为如今每三个 Pull Request 中就有一个涉及智能体,且提交次数在一年内增长了五倍以上。
回复本身也正在演变为一种界面。借助 Intelligent UI,ChatGPT 能够以图表、表单或按需构建的小工具进行响应,并在尚未完成全部思考之前就已开始生成回复。在开发者端,Claude 的 SDK 开始支持 computer use 和 browser use 的闭环,而 Cursor 允许用户通过 iPhone 追踪在电脑上工作的智能体并与其互动。在这三种情况下,文本都只是交互的一部分:AI 负责展示、点击与汇报,用户则负责监督。
最后,当天的许多数据都是由发布者自行测量的:Anthropic 测量的 Haiku 5.5 基准、微软测量的 MAI Code 1.1 Flash 基准、Perplexity 测量的由其设计的 Q2D-Web、Liquid AI 测量的 Open d1 得分,以及 GitHub 内部测试得出的写入吞吐量提升 35 倍。OpenAI 自身也提醒称,其 722 份手稿中未经形式化的结果可能包含错误,其针对 GPT-6 的速度提升同样来自内部评估。这些测试对于横向比较不同产品仍然具有参考价值;而像 CursorBench 榜单这样由工具厂商对其他厂商模型进行评测的外部评估,将有助于进行交叉验证。
来源
- 面向所有人的 GPT-6 与智能 UI (OpenAI)
- 面向所有人的 GPT-6 发布公告 (@OpenAI)
- GPT-6 Sol 与 GPT-6 Luna 系统说明书,10 月更新
- ChatGPT 中的 GPT-6 及其他模型
- ChatGPT 发行说明
- 向 ChatGPT 上传文件与音频
- 帮助青少年学习、规划并塑造 AI 的未来 (OpenAI)
- Claude Haiku 5.5 发布公告 (Anthropic)
- Claude Haiku 5.5 正式推出 (@claudeai)
- Haiku 5.5 迁移指南
- Cursor 中的 Haiku 5.5 (@cursor_ai)
- CursorBench 排行榜
- Max 与 Team 方案的每月 API 额度 (Claude 支持)
- API 额度发布公告 (@ClaudeDevs)
- RTX Spark 与 DGX Station for Windows (NVIDIA 博客)
- 为 Windows 和 GitHub Copilot 引入本地模型与沙盒工具 (Microsoft Command Line)
- 探索 GitHub Copilot CLI 中的本地模型
- GitHub Copilot 本地沙盒功能现已正式发布
- Replit 桌面端应用预览版 (@Replit)
- Replit 桌面端应用候补名单
- 分享 AI 在数学领域的进展 (OpenAI)
- openai/math 仓库
- 数学成果发布公告 (@OpenAI)
- 超越单一向量的多模态嵌入 (Perplexity Research)
- Hugging Face 上的 pplx-embed-v2-late-9b
- Claude Code 2.1.293
- Codex CLI 0.161.0
- 本地 Agent 的远程控制 (Cursor 更新日志)
- Antigravity 更新日志
- Warp Factories、Microsoft Teams 与 Azure DevOps (Warp 博客)
- SDK 中的 computer use 与 browser use 工具集 (@ClaudeDevs)
- Claude SDK 工具集文档
- 在 Microsoft Foundry 中部署并使用 Grok 模型
- Open d1 (Liquid AI 在 Hugging Face 上)
- Bolmo 登上《自然》杂志 (Ai2)
- Google 扩展面向 AI 内容的 SynthID Detector
- 机密保护必须与软件规模协同扩展 (GitHub)
- 为 Agent 规模化开发构建 Git 基础设施 (GitHub)
- 与印度某邦签署谅解备忘录 (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- cuOpt 中的 mPDLP (NVIDIA 技术博客)
- 制造机器的机器 (NVIDIA 技术博客)
- ChatGPT 与 Codex 更新日志,ChatGPT iOS 版 1.2026.272
- 丽笙酒店集团将酒店探索功能引入 ChatGPT (OpenAI)
- Jump Trading 如何利用 ChatGPT 扩展量化研究规模 (OpenAI)
- ChatGPT 插件扩展 (@OpenAIDevs)
- Every 与 Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- 许许多多的 Puck (Amp)
- Copilot CLI 1.0.93
- 更新您的 IDE 以恢复 Copilot 使用指标中的 Agent 活动
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B 正面对决 (Hugging Face 博客)
- Nemotron 亮相 2026 年 IOI 与 IMO (Hugging Face 博客)
- Instadocs:失控的 AI (@netflix)
- ChatGPT 中的 Runway (@runwayml)
- Face Swap (@LumaLabsAI)
- 利用数字孪生与 AI Agent 验证 AI 工厂变更 (NVIDIA 技术博客)
- 借助 NVIDIA cuPhoton 加速科学图像分析
- Cosmos 与 SynthID (@NVIDIAAI)
- SpaceXAI TypeScript SDK 0.2.3
- RAG 对比 LLM (Perplexity)