搜索

Muse 在 Meta Connect 2026 获得语音和虚拟形象,Claude Code 云端会话结束预览阶段,Perplexity 推出 Fast Search

ai-powered-markdown-translator

使用 gpt-6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

在 Meta Connect 2026 上,Meta 为其个人智能体 Muse 加入实时语音和视频虚拟形象,承诺将其带到智能眼镜上,并宣布 Meta Model API 正式全面开放。Claude Code 云端会话结束预览阶段,订阅用户可领取一次性额度;Perplexity 则推出由自研 Rust 搜索引擎 Photon 支持的 Fast Search。Meta 和 Google 相隔仅数小时推出能实时说话的视频虚拟形象,也反映出当下的趋势。


Meta Connect 2026:Muse 开口说话,Meta 更新智能眼镜产品线

9 月 23 日 — Meta 于太平洋时间 16 时(巴黎时间 24 日凌晨 1 时)以一场聚焦个人智能体 Muse 的主题演讲拉开 Meta Connect 2026 序幕。Muse 于 9 月 8 日推出,如今新增实时语音模式:用户可以在它后台工作的同时与它持续交谈,还能通过描述来设计它的声音,例如语速更快或更慢、带有特定口音。它也获得了一张会动的面孔,即下文详述的 Muse Realtime Avatar。Mac 版现已支持电脑操作(computer use):经用户许可,Muse 可以操作任何应用,并在用户离开后继续工作。

Muse 新功能公布的上线情况
实时语音模式、可自定义声音已在 Connect 展示,未公布日期
Mac 版 Muse 的 computer use已上线
智能眼镜上的 Muse“未来几个月内”
便携设备 Muse Charm据 Mark Zuckerberg 称,12 月
Muse 专属电子邮箱地址已公布,未公布日期

在智能眼镜上,用户可以呼唤 Muse 的名字,让它针对眼前看到的商品或海报采取行动。据 Zuckerberg 介绍,搭载实时语音模型的 Muse Charm 可以挂在钥匙扣上;官方综述仅承诺会在年底前公布更多消息。

在 @Muse 公布 Shopify、PayPal、Expedia 和 Instacart 后的第二天,Meta 列出了完整的连接器名单:购物方面包括 Walmart、Best Buy、American Eagle Outfitters、DICK’S Sporting Goods、Fanatics、Gap、Michael Kors、Sephora、Ulta 和 Wayfair;支付方面包括 Shop Pay 和 PayPal;另有 Instacart、仍标为“即将推出”的 Expedia,以及用于工作的 Notion、Granola、GitHub 和 Box。GitHub 当晚详细介绍了自己的连接器:用户无需离开智能体,就能审阅拉取请求、跟踪议题和通知,以及发表评论;它未说明适用套餐或国家。Meta 也未公布这些新功能的价格和适用国家。

🔗 Meta 的综述 · Mark Zuckerberg 的帖子 · Muse 的 GitHub 连接器

智能眼镜:Ray-Ban Meta Audio、Gen 3、Meta VR Glasses,以及登陆法国的 Ray-Ban Display

9 月 23 日 — Meta 同时更新了智能眼镜产品线,并承诺年底前推出超过 100 款型号。新类别 Ray-Ban Meta Audio 不配备摄像头:重 43 g,续航最长 12 小时,充电盒还能额外提供 48 小时。第三代 Ray-Ban Meta 的续航增加一小时,达到 9 小时,并新增操作按钮和六个麦克风。带屏幕的 Meta Ray-Ban Display 将登陆法国:继英国和加拿大之后,法国将与意大利、德国一样逐步开放预订,10 月 13 日正式上市。

公布的设备起售价公布的上市情况
Ray-Ban Meta Audio349 美元开放预订,10 月 13 日发货
Ray-Ban Meta (Gen 3)449 美元9 月 23 日上市
Meta Ray-Ban Display未说明法国、意大利、德国:10 月 13 日
Meta VR Glasses(约 100 g)1 299,99 美元2027 年春季

🔗 Meta 的公告


Meta Model API 正式全面开放,Muse Spark 1.3 登陆 Oracle 和 Google Cloud,Replit 面向 Meta 设备推出开发方案

9 月 24 日 — Meta Connect 第二天面向开发者。主要消息是:提供 Muse 模型访问能力的 Meta Model API 在全球正式全面开放,并为企业提供支持与合规保障。据 Meta 介绍,Muse Spark 1.3 现已在 Oracle Cloud AI Platform 上线,并在 Google Cloud 进入私人预览阶段;两家公司是新增的优先云合作伙伴。

Google Cloud 的产品页面(Gemini Enterprise Agent Platform)列出了具体条件:模型 meta/muse-spark-1.3 处于预览阶段,需申请访问;上下文长度为 100 万个 token;输入和输出均仅支持文本;支持兼容 MCP 的工具调用、函数调用、结构化输出和推理,但不支持批量预测或预置吞吐量,且仅提供全球端点。我们核查时,价格页面尚未列出其收费标准。

面向开发者的公告公布的状态
Meta Model API全球正式全面开放
Oracle Cloud 上的 Muse Spark 1.3已上线
Google Cloud 上的 Muse Spark 1.3私人预览
Muse Code即将登陆 Windows
Wearables Device Access Toolkit 1.0经过一年预览后正式推出
WebMCP 和 Meta AI Connectors开发者预览
Meta Global AI Developer Hackathon奖金 100 万美元,日期未公布

Meta 的终端编码智能体 Muse Code 已于 8 月 31 日在 macOS 和 Linux 上结束测试阶段,如今即将登陆 Windows。根据 Ash Jhaveri 的 X 个人简介,其职位是“AI 与硬件生态系统副总裁”;他再次表示 Muse Spark 1.2 的模型权重“即将”发布。这一承诺自 8 月 10 日起一再出现,至今仍无具体日期。智能眼镜方面,WebMCP 允许 Meta AI 仅调用网页应用自行选择公开的函数。

🔗 Meta Connect 2026 开发者公告综述 · Google Cloud 上的 Muse Spark 1.3

Replit 为 Meta 头显和智能眼镜提供开发方案

9 月 24 日 — Replit 在 Meta Connect 宣布推出面向 Meta 设备的开发方式:用户用日常语言描述应用,Replit Agent 编写代码并在浏览器中显示预览,随后应用或网页体验便可在 Meta Quest 头显、Meta Ray-Ban Display 或 Meta VR Glasses 上打开,无需安装工具。其说明列出三种路径:Meta Quest 和 VR Glasses 可使用 Expo 进行构建、打包和部署,也可通过浏览器运行;Ray-Ban Display 则先在 Replit 中模拟,再部署为网页应用。关于 Muse,双方表述并不一致:Replit 的页面称,Meta 智能体中的 Replit 连接器“即将推出”,但未给出日期;Replit 同日发布的消息却表示 Muse 已能在 Replit 中创建应用。双方均未提及价格。

🔗 Replit × Meta Connect 2026 · 据 @Replit 介绍,Muse 已可使用 Replit


Claude Code:云端会话结束预览阶段,Projects 支持本地运行

9 月 23 日 — @ClaudeDevs 于 21 时 23 分(UTC)发布帖子,宣布 Claude Code 的云端会话结束研究预览阶段(research preview)。云端会话运行在 Anthropic 的基础设施上:即使笔记本电脑合上,工作也能继续。

Cloud sessions are officially available and out of research preview! They let you keep Claude Code working, even when your laptop is closed.

🇨🇳 云端会话现已正式推出,结束研究预览阶段!即使合上笔记本电脑,Claude Code 也能继续工作。 — @ClaudeDevs 在 X 上

为方便用户试用,Anthropic 向现有订阅用户提供独立于使用限额的一次性额度:

额度条件公布的详情
Pro 额度100 美元
Max 额度250 美元
截止日期须在 10 月 7 日前领取
领取方式通过公告中的链接,或在 CLI 中运行 /claim-credit 命令
前提条件已连接 GitHub 账号;适用相关条款
使用范围每个账号一份额度,仅限云端会话
使用入口claude.ai/code、移动应用的 Code 标签页、桌面应用、claude --cloud

针对用户的疑问,@ClaudeDevs 于 24 日 01 时 57 分(UTC)澄清:云端会话与 Claude Code 的其他使用方式一样,计入 Pro 或 Max 套餐;可选领取的额度只是优先抵扣。文档也证实了这一机制:速率限制与账号的所有 Claude 用量共享,并行任务会相应消耗更多额度,虚拟机不单独收费。云端会话面向 Pro、Max 和 Team 用户开放;Enterprise 用户则需拥有高级席位或 Chat + Claude Code 席位。克隆仓库和创建拉取请求通过 GitHub 进行;GitLab 或 Bitbucket 仓库可以通过 CCR_FORCE_BUNDLE=1 打包后从本地发送。

🔗 云端会话文档 · @ClaudeDevs 对套餐计费方式的澄清

Projects 的线程支持本地运行

9 月 23 日 — 约一个半小时后(22 时 49 分 UTC),@ClaudeDevs 宣布 Claude Code 的 Projects 支持本地运行。Projects 于 9 月 17 日面向 Pro 和 Max 用户推出测试版;如今,项目中的线程可以在用户的机器上运行。此前,每个线程都是运行在独立分支上的云端会话;对于需要访问只有本机才能连接的工具(本地数据库、模拟器、VPN 后面的 API)的工作,文档建议使用项目外的本地会话。Anthropic 还表示,正向更多已加入候补名单的 Pro 和 Max 订阅用户开放 Projects;旧版 Claude 项目用户的迁移仍在进行。公告比文档更新得更快:截至 24 日晚间,Projects 页面仍写着本地会话不能属于项目,相关帖子也未说明用户可以从哪个界面启动这些线程。

🔗 @ClaudeDevs 的公告 · Projects 文档


Perplexity:Fast Search 与 Photon

9 月 24 日 — Perplexity 为其 Search API 增加快速模式 Fast Search,可通过参数 search_type: "fast" 启用;同时介绍了支撑这一模式的 Photon。Photon 是用 Rust 编写的检索与排序服务(retrieval and ranking),取代了该公司此前改造的开源引擎,如今为 Perplexity 的所有搜索提供支持。

Fast Search runs on Photon, our new Rust-based retrieval and ranking service that we built with a small team of engineers and hundreds of agents.

🇨🇳 Fast Search 基于 Photon,这是我们用 Rust 编写的新检索与排序服务,由一支小型工程师团队和数百个智能体共同构建。 — @perplexity_ai 在 X 上

比较指标标准搜索Fast Search
Search API,每 1 000 次请求5 美元1 美元
Agent API 的 web_search 工具,每 1 000 次调用(不含 token)2,50 美元1 美元
六项智能体基准测试中 3 554 项任务的得分64,0 %64,3 %
这些任务的模型与搜索预计成本187,60 美元59,73 美元
单次调用延迟,中位数与第 95 百分位(自行报告)未公布160 ms 和 230 ms

Perplexity 坦言存在取舍:在罕见查询的内部测试中,相关性下降 0,24 个百分点,获得答案的概率下降约 3 个百分点。Perplexity 建议将 Fast Search 用于常规智能体任务,将标准搜索用于困难或有歧义的问题。博文指出,其与其他 API 的延迟比较采用各供应商自行报告的数据,未进行受控测试;对于 Search API,目前使用 Python 和 TypeScript SDK 时还需绕过其验证机制。在生产环境中,Photon 将引擎内部的 p99 延迟从约 800 ms 降至 65 ms,同时减少了约 20 % 的机器用量。

🔗 Photon:从零构建检索与排序引擎 · Fast Search 文档


实时视频虚拟形象:Meta 与 Google 相隔数小时推出同类产品

Meta 和 Google 相隔仅数小时推出了同类产品:依托语音模型,能够实时聆听、说话和作出反应的视频虚拟形象。

Muse Realtime Avatar

9 月 23 日 — Meta Superintelligence Labs 详细介绍了 Muse 的面孔 Muse Realtime Avatar。给定一张参考图像,无论是肖像、全身插画、动物还是日常物品,模型都能实时让角色动起来,呈现面部表情、手势和身体动作。由 Muse Realtime Voice 语音模型生成的单一路语音 token 流同时驱动声音和画面,使语音与嘴唇保持同步。蒸馏技术将每个片段所需的计算评估次数从 120 次降至 2 次。

Meta 公布的指标公布的数值
竖屏视频448x768,25 帧/秒
语音与视频响应延迟约 870 ms
每台 GB200 支持的并发会话数12
与 Runway Characters 相比的偏好比例78 % 对 22 %
与 HeyGen LiveAvatar 相比的偏好比例88 % 对 12 %

这些偏好比例来自 Meta 开展的人工评估;Meta 指出,与 Runway 相比,行为表现方面的差异没有统计显著性。每段视频都带有不可见的 Meta Video Seal 水印。

🔗 让你的 Muse 栩栩如生

Gemini 3.8 Live 与 Live Avatar

9月24日 — Gemini 3.8 Live 发布九天后,Google 为这款语音对话模型赋予了形象:虚拟形象能倾听用户、查看用户通过摄像头或屏幕共享展示的内容,并以同步的语音和视频作答。该功能已在 Gemini Enterprise 中正式推出;开发者可通过其智能体平台的 Live API 使用,美国和欧盟均设有端点。Gemini 3.8 Live Extended Thinking 仍处于私人预览阶段。虚拟形象支持 97 种语言,调用工具时也能保持对话不中断。使用自定义虚拟形象需要登记加入许可名单。根据模型说明,输出上限为 24K tokens,连续交互可维持数分钟。虚拟形象视频的价格为每百万 tokens 1 美元,说话时每秒消耗 6,192 tokens,聆听时间不计费。所有内容均带有 SynthID 水印。

🔗 Google 公告


Claude 的使用成本:Opus 5.5 的缓存与重新计费的拒绝请求

9月24日的两篇文章聚焦 Claude 用户的费用:Opus 5.5 从何处节省成本,以及部分遭拒请求为何重新计费。

会话更长了,Opus 5.5 为何能降低成本

9月24日 — Michael Segner 在 claude.com 发表文章,汇总了 2026 年 3 月至 9 月的 Claude Code 使用情况。每次会话的提示词数量没有变化,但 Claude 处理每条提示词的时间延长至 3.3 倍,模型调用增加逾 40%,中断减少 68%。每次请求的上下文增至 2.6 倍,输入与输出的 token 比例从 189:1 升至 324:1。因此,缓存读取成为主要成本项,而 Opus 5.5 将其价格降低 60%,带来的节省也更加明显。Anthropic 称,Opus 5.5 的缓存 token 成本仅为竞争模型的五分之一。在 Opus 5.5 和 Fable 5.1 上,会话中途调整努力程度不再重置缓存;这与 9 月 22 日发布的指南所述相反。

🔗 claude.com 文章

三类被拦截的请求重新计费

9月24日 — @ClaudeDevs 宣布,Anthropic 将重新对安全防护机制在 Claude 作答前拦截的请求收费。根据推文,此举仅涉及误报率较低的类别:生物学、蒸馏攻击和前沿 LLM 开发。Anthropic 给出的理由是,近几周其系统遭遇了“协同攻击”。Anthropic 表示,在近期测试中,99.7% 的 Claude Code、Claude.ai 或 Cowork 账户没有触发任何此类收费拦截,并以将误报率控制在 0.1% 以下为目标;用户可通过 /feedback 报告不合理的拦截。根据文档,无论是在 Claude API,还是在 Bedrock、Google Cloud 和 Microsoft Foundry 上,收费的拒绝请求均按模型费率计费;所有遭拒请求都会计入速率限制。

拒绝类别(文档)输出前是否收费
bio是
frontier_llm是
reasoning_extraction是
cyber否
general_harms否

🔗 @ClaudeDevs 公告 · 拒绝请求的计费方式


人工智能与健康:刚果(金)的埃博拉疫情、OpenEvidence、AlphaFold Database 和 NV-Reason-CT

这里补充两则 9 月 22 日的公告,介绍 Claude 在公共卫生领域的应用;NVIDIA 也发布了两项开放研究,一项是与 Google DeepMind 和 EMBL-EBI 合作的病毒学研究,另一项涉及放射学。

刚果(金)的埃博拉疫情

9月22日 — Anthropic 在 22 日发表、并由 @AnthropicAI 于 23 日晚转发的《The Situation Report》中,介绍了 Claude 如何用于应对刚果民主共和国东部的 Bundibugyo 埃博拉疫情。根据 9 月 19 日的通报,疫情累计确诊 7,672 例、死亡 3,699 人,病死率为 48.2%;目前没有针对这一毒株获批的疫苗。由 CEPI 牵头、世界卫生组织非洲区域办事处和国家生物医学研究所(INRB)参与的合作项目,正与 Anthropic 的两个团队共同开展工作。世卫组织非洲区域办事处编写了一项 skill,用于提取各卫生区的数据、与前一天比较并标记趋势变化,使每日疫情报告的编制时间从一天缩短至不到一小时。CEPI 使用 Claude 比较候选疫苗,科学决策仍由专家作出;INRB 则可以让 Claude Science 组装病毒基因组并构建其系统发育树。

🔗 《The Situation Report》(Anthropic)

OpenEvidence 向约 100 个国家免费开放

9月22日 — 联合国大会期间,OpenEvidence 宣布与 Anthropic 合作,向约 100 个中低收入国家的临床医生免费提供其平台的专门版本。据 Reuters 报道,OpenEvidence 提供的名单包括乌干达、安哥拉、苏丹、海地和蒙古。OpenEvidence 根据经过同行评审的医学研究及诊疗指南回答临床问题;该服务在美国和加拿大已免费提供。根据 Reuters 的独家报道,Anthropic 的技术负责后台运行,OpenEvidence 则针对各地区调整系统;双方没有披露财务条款。这项消息来自 OpenEvidence 和 Reuters,Anthropic 未通过其官方渠道转发。

🔗 OpenEvidence 公告 · Reuters 独家报道

AlphaFold Database 收录逾 2,800 种病毒的蛋白质复合物

9月24日 — NVIDIA 加入了一个由八家机构组成的联盟,成员包括 Google DeepMind、EMBL-EBI 和 CEPI。联盟在 AlphaFold Database 发布了逾 2,800 种病毒的蛋白质复合物预测三维结构,涵盖普通感冒病毒及 mpox 等新兴威胁。这些按置信度标注的预测结果由 AlphaFold2 推断生成,并使用 NVIDIA BioNeMo Inference Runtime 优化;新增的相互作用中,约 30% 未收录于主要的实验测定结构数据库 Protein Data Bank。NVIDIA 还开放了生成这些数据的 BioNeMo Structure Prediction Pipeline,供研究人员用于自己的研究目标。此次发布恰逢联合国大会期间在纽约举行的大流行防范会议;该数据库目前已有逾 2.6 亿项预测结果。

🔗 开放科学如何帮助研究人员应对下一场大流行

NV-Reason-CT

9月23日 — NVIDIA 发布 NV-Reason-CT,这是一款面向胸部和腹部 CT(计算机断层扫描)的开放视觉语言模型。它没有将扫描体积视为一叠二维切片,而是使用三维 ViT 编码器将其划分为 13,824 个视觉 tokens,再传给 Qwen3.5-4B 语言模型;该模型能够撰写结构化报告、展示受放射科医生启发的推理过程,并回答后续问题。在主要的公开三维 CT 理解基准 CT-RATE 上,NVIDIA 报告其 macro-F1 为 0.614、macro-AUROC 为 0.871,超过了其所比较的已发表模型(VoxelFM:0.581 和 0.870)。模型权重已发布在 Hugging Face。NVIDIA 强调,这是一款仍需针对具体用途调整的研究基础模型,并非自主诊断工具或获批临床产品。

🔗 NV-Reason-CT 介绍


OpenAI 呼吁制定前沿人工智能国际标准

9月23日 — OpenAI 首席执行官 Sam Altman 在联合国安全理事会发言,OpenAI 随后公布了演讲实录。他指出需要避免两种走向:让人工智能掌控人类的未来,以及权力过度集中,使个人、企业或国家能够借助最强大的模型将自己的世界观强加于人。他说,随着能够改进自身继任者的系统日益临近,此时“需要极度谨慎”;他表示,OpenAI 已主动放慢过步伐,今后也会再次这样做。

It doesn’t matter whether people put the risk of catastrophe at 10%, or 1%, or 12%, or .1%. None of these levels are remotely acceptable.

🇨🇳 无论人们认为灾难风险是 10%、1%、12% 还是 0.1%,这些水平中的任何一个都远远不能接受。 — Sam Altman 在联合国安全理事会的演讲

他向各国提出四项诉求:建立衔接前沿人工智能国内与国际标准的机制、制定用于比较证据和核验合规情况的共同标准、建立事故报告规程,以及在政府、关键基础设施运营方和专家之间设立安全沟通渠道。这延续了 OpenAI 于 9 月 21 日发表的一篇文章,此处一并补充。OpenAI 在文中表示,完全自主的递归式自我改进目前尚不存在,在能够安全进行之前不应追求这一目标。该公司呼吁美国通过由美国 CAISI(Center for AI Standards and Innovation)协调的人工智能安全研究所网络(涵盖包括法国在内的十个国家),牵头制定全球技术标准。在 OpenAI 看来,这些标准既不是许可证制度,也不是发布前的强制审查;各国自行决定其在本国法律中的地位。美国与中国就这些议题展开对话将是“积极进展”。

🔗 为人工智能的下一阶段制定标准


人工智能在网络防御中的应用:面向乌克兰的 Daybreak 与 Fuzzing Taskflow

两项公告展示了模型如何服务于防御方:一项向国家开放计划,另一项将模糊测试交给智能体。

Daybreak 向乌克兰开放

9月23日 — OpenAI 与乌克兰数字转型部合作,向乌克兰政府开放其网络防御计划 Daybreak,提供识别软件漏洞、加快补丁开发和测试的工具,以保护民用基础设施。这项公告由乌克兰驻旧金山总领事 Dmytro Kushneruk 和 OpenAI 国家安全政策负责人 Sasha Baker 在联合国大会期间宣布。OpenAI 提到,乌克兰国家事件响应团队 CERT-UA 在 2025 年处理了近 6,000 起网络事件,目标包括医院、能源和电信设施。文章还列举了两项欧洲成果:ENISA 发现了欧盟机构软件中的漏洞,现已全部修复;CERT Polska 则参与发现了一款第三方路由器软件中的六个漏洞。公告未说明计划期限或资金数额。

🔗 OpenAI 扩大乌克兰民用防御的网络工具使用权限

GitHub Security Lab 的 Fuzzing Taskflow

9月24日 — GitHub Security Lab 发布了 Fuzzing Taskflow。这是基于其 Taskflow Agent 框架构建、采用 MIT 许可证的 C/C++ 项目自主模糊测试流水线。给它一个 GitHub 仓库后,智能体会识别入口点、编写测试程序、运行 AFL++、分析覆盖率、按七种结论分类每次崩溃,并为每个独立漏洞撰写报告,附上标有“待审阅”的修复建议。智能体负责决策,MCP 工具负责执行;每轮迭代的时间预算翻倍,从 30 秒增至 960 秒(每个目标约 32 分钟),当连续两轮迭代的覆盖率增幅均低于 1% 时,循环停止。默认模型是 Claude Sonnet 5,它通过了团队的全部内部测试。Security Lab 提醒:这条流水线会在没有容器隔离的情况下执行由 LLM 选择的命令,因此应仅在一次性环境中使用。文章没有给出所发现漏洞的数量统计。

🔗 GitHub Security Lab 文章


Project Suncatcher:进入轨道的 TPU

9月24日 — Google 去年宣布的太空人工智能计算项目 Project Suncatcher,即将开展首次在轨测试。一颗与 Planet 合作建造的原型卫星计划搭乘 SpaceX 的 Transporter-18 任务发射;24 日的文章称,Google 首批在轨 TPU 将于“下周”升空。测试旨在验证芯片能否承受发射、辐射和温度变化。在地面测试中,UC Davis 的质子束照射了满负荷运行人工智能任务的 Trillium TPU;芯片承受的辐射剂量超过五年任务的预期剂量。热管与散热器组成的冷却系统也已在热真空室中完成测试。2027 年的下一步是用两颗卫星测试超高速激光链路。据 Google 称,在近地轨道,卫星获取的太阳能最高可达地面的八倍。

🔗 Project Suncatcher 幕后


生成式图像与视频:Midjourney、Runway、Google Research 和 Nunchux

在创作工具方面,Midjourney 改进了编辑工具,Runway 公布了其模型路由器的量化评估,Google Research 连续生成数分钟长的视频,Nunchux 则在 AMD GPU 上加速了 MiniMax-H3。

Midjourney:图像修补、—tile 与 alpha 阶段的快速模型

9月24日 — Midjourney 为 V8.1 和 V8.2 发布了可生成重复图案的参数 --tile 的新版本。据 Midjourney 称,图块之间可见的接缝已消失。编辑模型的图像修补和画面扩展功能现在只修改选中的像素,因此可以连续进行局部修改,而不会降低图像其余部分的质量。在 alpha.midjourney.com,Midjourney 正试验快速模型(fast models),并在 X 上将其描述为实时模型的初步预览:启用“实时预览”选项后,样式栏会以每种样式预览最新提示词的效果,点击即可开始生成。官方尚未公布模型名称或时间表。23 日的 alpha 更新日志还新增了默认参数设置(Settings → Advanced → Your defaults),并向 midjourney.com 的所有用户开放韩语。

🔗 @midjourney 公告 · Midjourney 更新

Runway 公布 Model Router 的量化评估

9月24日 — Runway 发布了 Model Router 的首份量化评估。Model Router 是 Runway Dev 的路由器,可根据成本、质量或延迟偏好,为每次请求选择生成模型。评估以 Seedance 2.5 为基准,用 250 条图生视频提示词,在双盲条件下比较了路由器的三种配置。

测试配置可用视频每段视频成本支出差异
基准(Seedance 2.5)78 %1.80 美元—
质量路由77 %1.28 美元-29 %
质量优先,成本上限 1 美元74 %0.61 美元-66 %
成本路由38 %0.30 美元-83 %

据 Runway 称,设有成本上限的配置保留了基准质量的 95%;它在对话和唇形同步方面表现更好(96% 对 92%),在物理效果方面则较弱(52% 对 60%)。Runway 推荐将其用于生产,并建议仅在探索阶段使用成本模式;已使用路由器的开发者中,64% 将其设为成本模式。

🔗 使用 Runway Model Router 评估成本与质量

Google Research 的 AI video co-director

9月24日 — Google Research 发布 AI video co-director。这是构建在 Gemini 和 Veo 之上的多智能体编排层,旨在生成长达数分钟、叙事连贯的视频,解决扩散模型连续生成镜头时服装和场景容易发生变化的问题。它由四项研究框架组成:一种多臂老虎机算法先选择创作策略、叙事模式和美学风格,再由多模态评审模型为结果评分;CANVAS 保存人物、地点和物体的视觉记忆;A²RD 逐段生成视频,已制作出一部连续十分钟的影片;VQQA 根据视觉语言模型的评语重写提示词。在团队创建的三个基准之一 GenAD-Bench(包含400个广告场景)上,该系统的最高质量得分为81.4。这仍属于研究成果,尚无产品或上线日期。

🔗 自动生成连贯的长篇视频

Nunchux 在 AMD MI355X 上运行 MiniMax-H3

9月24日 — MiniMax 转发了 Nunchux AI 于23日公布的测试结果:在配备八块 AMD MI355X GPU 的服务器上运行 MiniMax 的开放权重视频模型 MiniMax-H3,生成一段5秒的视频耗时1.33秒,生成一段15秒的视频耗时5.39秒,分辨率均为1344×768。与在相同硬件上以 BF16 精度、50步 Euler 运行的 SGLang 相比,速度提高了21.8至26.7倍;计时包括文本编码、去噪以及视频和音频解码,但不包括最终的 MP4 编码。Nunchux 将这一提升归因于其模型优化器和推理引擎,其中包括自研的 MXFP6 内核。这样的速度使用户可以在播放期间修改提示词。免费使用权限据称将“很快”开放,目前可加入候补名单;上述测试数据来自 Nunchux。

🔗 在 AMD MI355X 上生成视频 · @MiniMax_AI 的转发


编码智能体:Claude Code、Delta、Devin、Qwen Code 和 Kimi Code

五款编码智能体发布了新版本:Anthropic 的 Claude Code、Zed 的 Delta、Cognition 的 Devin、Alibaba 的 Qwen Code,以及 Moonshot AI 的 Kimi Code。

Claude Code 2.1.282

9月24日 — Claude Code 2.1.282 于 UTC 18:38 发布,更新日志共有86项,其中59项是修复。设置 maxProseWidth 可限制宽终端中 Claude 文本的宽度,表格和代码块仍保持全宽。多项改动限制了项目能够强制施加的设置:项目级和本地设置会忽略那些启用导出或捕获内容的 OpenTelemetry 变量(CLAUDE_CODE_ENABLE_TELEMETRY、OTEL_LOG_*);启动时的提示、/status 和 claude doctor 会对此予以说明。命名空间 anthropic-skills 和 claude-ai 保留给从 claude.ai 同步的技能,而托管设置 allowClaudeInChromeWithManagedMcp 允许在已有独占 managed-mcp.json 的情况下启动 claude --chrome。通过直连 API 使用自动模式时,即使关闭遥测,也会默认使用服务器端分类器;另有修复避免恢复会话时丢失扩展思考(extended thinking)。

🔗 Claude Code 2.1.282 版本说明

Zed 的 Delta 0.17

9月23日 — Zed 发布 Delta 0.17.0。这款支持与智能体协同编程的多人环境自9月16日起进入公开测试;本次更新包含20项新功能、26项改进和59项修复。现在可以从一个会话线程要求智能体启动多项任务,每项任务都在各自独立工作区的顶层线程中并行进行;智能体也能跨线程互相发送消息。命令 /approve 和 /request-changes 可以在任何线程中给出审查结论。该版本还交付了9月22日预告的两项功能:会话线程的颜色会由子线程和子智能体继承;上下文面板新增自动压缩进度条,并分别显示指令、消息、思考过程和工具所占的份额。

🔗 Delta 版本说明 · @zeddotdev 的公告

Devin Review:可组合触发条件与 Perforce

9月23日 — Devin 当天的版本说明分为26个条目,重点介绍了拉取请求审查工具 Devin Review。自动审查现在使用可组合的触发条件:先指定账号、组织、仓库、仓库名称前缀或成员,再按作者、标签、分支、修改的文件、作者类型(人、机器人或 Devin)或差异大小筛选,并可组合这些条件;每个触发条件都能设定审查时机,而排除规则始终优先。Devin Review 也开始支持 Perforce:Helix Swarm 审查可通过测试定义触发它;从 Swarm 2026.3 起,还可通过出站 webhook 触发。能力选择器现在会列出模型名称(Ultra:Fable 5.1 和 GPT-6 Astra),Devin 的 GitHub 应用则请求新增六项权限,需要管理员批准。

🔗 Devin 9月23日版本说明

Qwen Code v0.24.5

9月24日 — Qwen Code v0.24.5 是一个未宣布不兼容变更的稳定版本,更新日志共有87项,其中包括28项功能和38项修复。智能体的实时语音对话功能 Qwen Live 现在可在所有平台上通过浏览器中的 Web Shell 使用;在 macOS 上,原生宿主程序变为可选(QWEN_SERVE_LIVE_NATIVE_HOST=1)。通话期间,用户可以共享屏幕,传输频率最高为每秒一张图像;仅共享屏幕不会触发回复。Web Shell 新增执行轨迹时间线,分为主会话、工具调用和子智能体三个轨道;消息频道则根据前缀将消息路由到不同会话(messageRoutes)。隐私方面,--bare 模式终于会遵守用户拒绝发送使用统计数据的选择。Qwen Code Desktop v0.24.5 和 TypeScript SDK v0.1.15 也在同一天发布。

🔗 Qwen Code v0.24.5 版本说明

Kimi Code 2.1.1 撤销 2.1.0 的安全加固

9月24日 — Kimi Code 2.1.0 于23日作为安全加固版本发布;不到19小时后,2.1.1 便撤销了这些改动。版本说明称移除了“某些过于防御性的改动”;拉取请求 #4013 说得更明确:它撤销了工作区信任边界的加固,理由是用户批准一个仓库后,该仓库的内容便由用户负责。涉及的四项保护均被移除:文件工具重新允许跟随指向工作目录之外的符号链接;本地配置(local.toml)无需等待批准即可生效;后台操作期间不再限制仓库的 git 配置;家目录和根目录也不再被拒绝作为附加目录。读取信任信息失败时,仍会将其视为“未获批准”。在2.1.0中关闭的文件监视器也重新默认启用。

🔗 版本说明


桌面智能体:Perplexity Portable Computer 与 Kimi Work 3.2.14

9月24日,两款在用户电脑上工作的桌面智能体迎来更新:Perplexity 向搭载 AMD 处理器的电脑开放 Portable Computer,Moonshot AI 则发布 Kimi Work 3.2.14。

AMD Ryzen AI Max 上的 Portable Computer

9月24日 — Portable Computer 是 Perplexity 智能体 Computer 的完全本地运行版本,现在支持搭载 AMD Ryzen AI Max Series 处理器的 Windows 电脑,包括 Ryzen AI Halo 开发平台。此前公布的硬件要求仅列出 NVIDIA 设备,从 DGX Spark 到配备 RTX GPU 的电脑。运行它至少需要24 GB 可供 GPU 使用的内存、Windows 10 或 11,以及约20 GB 磁盘空间。这些 AMD 设备提供两个本地模型:经 Perplexity 后训练的 PPLX 27B 和 Qwen 27B;产品页面则只为 RTX 电脑提供 PPLX 27B。本地分类器会在任何数据离开电脑之前识别姓名、账号和身份标识,本地推理也不会消耗 Computer 点数。个人和企业的 Pro、Max 订阅用户均可使用。

🔗 Portable Computer 登陆搭载 AMD 处理器的智能体电脑

Kimi Work 3.2.14:侧边对话与版本历史

9月24日 — 在3.2.12发布两天后,Moonshot AI 推出桌面智能体的下一版本 Kimi Work 3.2.14,未另发推文。主要新功能是侧边对话(Side Chat):用户可从“+”面板在会话中打开独立对话,并继承原对话的上下文,也可以引用原对话中选中的内容。Office 文件新增版本历史;浏览器支持为网页添加批注,并在输入框中引用这些批注。远程控制(Remote Control)现在允许从手机预览文件和发送附件;保持唤醒(Keep Awake)则改为仅在用户要求时启用。

🔗 Kimi Work 版本说明


开放模型与实验室:Tev1、LFM2.5-VL-DSpark、LeRobot 和 Sakana AI

开放生态方面的动态包括:一个小型决策模型、一个加速视觉语言模型的草稿模型、一种新的机器人数据格式,以及 Jürgen Schmidhuber 加入 Sakana AI。

Together AI 的 Tev1-4B-experimental

9月23日 — Together AI 发布小型决策模型 Tev1-4B-experimental:给它一个情境、一个问题和一份包含2至24个选项的列表,它会以所选选项的字母作答。该模型是 Qwen3.5-4B 的微调版本,灵感来自 Hugging Face 社区文章中常提到的决策模型 Jev;模型卡明确指出,它并非 Jev 引擎,仍保留 Qwen 的标准语言输出头。Together 强调其训练成本为17美元,并提供数据制作方法和教程。该模型的服务价格为每百万输入 token 0.042美元、输出 token 0美元。在主要开发数据集的1,000次决策中,它作对了880次;模型卡明确将这一结果与独立基准测试区分开来。微调后权重的许可证仍“在最终确定中”。

🔗 Together AI 的公告 · 模型卡

Liquid AI 的 LFM2.5-VL-DSpark

9月24日 — Liquid AI 将 DSpark 推测解码技术扩展到视觉语言模型 LFM2.5-VL-3B;用于文本的草稿模型已于8月20日发布。一个拥有2.795亿参数(增加8.9%)的草稿模型提前提出多个 token,供目标模型验证;在贪心解码下,最终答案不会改变。在使用 MLX 的 Mac M5 Max 上,解码速度提升至原来的2.30至3.13倍,端到端延迟改善1.56至2.62倍;在 H100 上,解码速度最高提升至2.66倍。实际收益仍受图像编码耗时限制,因为该技术无法加速这一环节。llama.cpp、MLX-VLM 和 SGLang 从发布首日就支持该草稿模型。

🔗 使用 LFM2.5-VL-DSpark 加速视觉语言模型

LeRobot 与 LanceDB

9月24日 — Hugging Face 的机器人学习库 LeRobot 现在可原生读取 Lance 格式的数据集,并继续使用相同的训练 API。这样便能直接从 Hub 或对象存储训练,无需下载数百 GB 数据,同时还能在整个数据集范围内混合数据。在 DROID 数据集(2,760万帧、369 GB 视频)上,使用8块 H100 从远程存储训练 SmolVLA 10,000步耗时1小时27分钟;使用标准读取器从本地 NVMe 副本训练则耗时2小时,而且此前还需下载384 GB 数据。两种方式的最终损失相同:时间差来自等待数据,等待时间占比分别为1.7%和37.4%。在小型数据集上,两种方式表现相当。

🔗 如何训练机器人:LanceDB 篇

Jürgen Schmidhuber 加入 Sakana AI

9月24日 — Sakana AI 宣布 Jürgen Schmidhuber 出任首席科学顾问(Chief Scientific Advisor),同时继续担任现有职务。他以世界模型、元学习和哥德尔机器方面的研究著称,将参与这家东京初创公司的 RSI Lab,研究递归自我改进,并定期前往东京。Sakana 表示,他的研究成果,包括1987年关于递归自我改进的论文,直接启发了 Darwin Gödel Machine 和 The AI Scientist。公告还透露了一个研究方向:Sakana 正在开发首批“为智能体原生设计”的世界模型,使智能体能够在执行动作之前模拟其物理后果,目标是应用于日本制造业。

🔗 Jürgen Schmidhuber 加入 Sakana AI


简讯

  • Claude Tag 与个人连接器 — 在 Slack 频道中,Claude Tag 现在可以使用向它发起请求者的个人连接器(日历、云盘、CRM),且仅限该用户;每条回复可经人工审核,也可采用自动模式。这些连接器绝不会用于计划任务。目前正向 Team 推出,Enterprise 将随后支持。🔗 来源
  • Sora 2 退出 API — 如 3 月 24 日所宣布,Sora 2 模型和 Videos API 已于 9 月 24 日停用,没有同等的替代 API;包括 sora-2、sora-2-pro 及其注明日期的快照在内,共有五个标识符被移除。目前只有文档确认了此次关闭。🔗 来源
  • ChatGPT Ads 进入东南亚 — ChatGPT 的广告服务进入印度尼西亚、马来西亚、菲律宾、新加坡、泰国、越南和台湾,目前覆盖 60 多个国家,8 月底时为 40 多个;只有 Free 和 Go 套餐会显示广告。🔗 来源
  • Grab 与 OpenAI — GO Forward with AI 计划在两年内培训 30,000 名 Grab 合作司机、配送员和商家,从新加坡开始,培训工作坊以 OpenAI Academy 和 ChatGPT Work 为基础。🔗 来源
  • OpenAI 的三个案例研究 — Ringg 每月处理超过 700 万通接通的电话,并将从 GPT-4.1 转至 GPT-5.6 Luna 的工作负载所用模型成本降低了约 90%;invideo 表示,借助 GPT-6 Astra,其色彩分级的成功率提高了约三倍;Harvey 则提供了未附数字的案例分享。🔗 来源
  • ChatGPT iOS 版 1.2026.258 — ChatGPT & Codex 更新日志的 9 月 23 日条目介绍了重新设计的主屏幕、新增的 iPad 分屏视图(可在打开的任务旁保留任务列表),以及对 Mac 和 Linux 上 SSH 配对失败问题的修复。🔗 来源
  • Gemini CLI v0.61.0 — 此前已在 nightly 版本中支持的 Gemini 3.8 Flash 和 Gemini 3.5 Flash Lite,通过一次官方说明未提及的 cherry-pick 进入稳定版;v0.62.0-preview.0 则开启下一轮预览。🔗 来源
  • Chrome 中的 Gemini — 在桌面端,Gemini in Chrome 可根据当前打开的标签页生成互动测验(初期面向美国和印度的英语用户),如今也能分析几乎所有完整播放的播客或视频文件,不再局限于 YouTube。🔗 来源
  • Google Photos — 虚拟衣橱可将照片中的衣物编入目录,供用户试搭服装;现向美国、印度和巴西符合条件的用户开放,同时推出复古风格的 Moods 和 15 款新的 Remix 模板。🔗 来源
  • 作为 MCP 服务器的 API Gateway — Google Cloud API Gateway 已进入公开预览,可根据带注释的 OpenAPI 3.x 规范,将 REST API 的操作转换为 MCP 工具,同时沿用身份验证、配额和日志功能;每个网关最多支持 1,000 个工具。🔗 来源
  • AlloyDB 中的 PostgreSQL for agents — 预览版 AlloyDB 可在数秒内创建彼此隔离、只读且数据延迟不超过一秒的实例,以应对智能体突发的查询需求;Google 称其每秒可处理超过 300 万次查询。🔗 来源
  • 在 TPU 上重现 OLMo 3 7B — Google Cloud 的 TPU 团队在 MaxText 中重现了 Ai2 的 OLMo 3 7B 预训练(约 5.9 万亿个 token)。排查出一个数据加载器缺陷后,所得模型在八项基准测试中与原版难以区分,并在 Ironwood 上达到 44.5% 的 FLOPs 利用率。🔗 来源
  • The Talking Museum — Google Arts & Culture Lab 开放了一间虚拟研习室,内有 190 多件 3D 文化物件;用户旋转物件时,Gemini 会讲述其历史并回答问题。🔗 来源
  • DeepSeek Harness 0.1.7-rc.2 — 这是两天内的第二个候选发布版,也是尚无稳定版以来的第 22 个预览版:关闭 Desktop 窗口后任务仍可在后台继续,计划任务在重启后仍会保留,最短可每分钟重复一次。🔗 来源
  • Jetson 上的请求路由器 — 在 Hugging Face 博客上,Eric Mey 将一个 9B 模型替换为经过微调、用于选择回复类型的 ModernBERT-large:在不同硬件上测试,正确路由数为 180/180,对照为 175/180;耗时 42 ms,对照为 771 ms。模型、数据和代码均采用 Apache-2.0 许可。🔗 来源
  • 扩充的 Carbon 基因组语料 — Parag Ekbote 发布了一套在处理器上运行、不使用 Carbon 模型的流水线,为 HuggingFaceBio 预训练语料中的 3,240 万条记录添加长度、GC 含量、编码状态和分类信息。🔗 来源
  • ZCode v3.14.3 — 自 9 月 21 日开放源代码以来,这是 Z.ai 的 ZCode 智能体运行框架唯一一次 GitHub 发布:现在可在不中止工作流的情况下调整其并发设置,工作流脚本消耗的 token 也更少。🔗 来源
  • xAI Python SDK 1.20.0 — 对于 grok-imagine-video-1.5,last_frame_url 可固定片段的最后一帧,keyframes 可在片段中设置最多四张关键帧图像;这些选项此前已写入 API 文档。🔗 来源
  • Copilot 代码审查 — 所有 Copilot 套餐(包括 Business 和 Enterprise)现均可使用个人代码审查设置页面;自动审查扩展至新推送和草稿。企业还可设置默认审查强度。按照 8 月底的公告,GitHub 将于 9 月 28 日把默认级别从 Lite 改为 Balanced。🔗 来源
  • GitHub Enterprise Cloud 的在场验证 — 公开预览版可要求用户在执行高影响操作(创建令牌、设置 webhooks、修改安全设置)前,通过身份提供方重新验证身份或完成 MFA;验证有效期为两小时。此功能仅面向使用 Microsoft Entra ID 的 EMU 和 GHEC-DR 企业。🔗 来源
  • GitHub Actions 终止支持 Node 20 — runners 现使用 Node 24 执行 JavaScript actions,回退选项已移除;运行 macOS 13.4 或更早版本以及 ARM32 的自托管 runners 也不再受支持。🔗 来源
  • Copilot 应用的画布 — Burke Holland 主张使用这些能与智能体交互的小型全栈应用,而非让所有操作都通过聊天完成,并提出了节省 token 的理由。此次没有新功能;画布自 6 月起就已存在。🔗 来源
  • Amp 共享其 runners — 使用 --share 启动的 runner 现在可通过 ampcode.com 供整个工作区使用;Amp 提醒,共享后其他成员将以主机所有者的身份执行代码,管理员可以关闭共享。🔗 来源
  • v0 的模型选择器 — 补报 9 月 22 日的消息:新选择器可浏览 AI Gateway 中的模型及其每 token 价格,并已面向 Enterprise 团队推出;团队所有者须启用 Allow custom models。🔗 来源
  • BioNeMo 的 MoE 训练方案 — NVIDIA 详述了使用 BioNeMo 和 Transformer Engine 训练混合专家生物模型的方法:在 Mixtral-8x7B 和八张 B200 上,吞吐量最高达到 Hugging Face 基准方案的 2.21 倍;融合内核仅供 Blackwell 使用。🔗 来源
  • Runway 中 Seedance 2.5 的 Draft 模式 — 用户可先用速度更快、消耗积分更少的草稿探索方案,再将最佳方案升级为完整画质;Runway 未公布具体积分数,而同一模式已于 22 日登陆 Pika。🔗 来源
  • Cursor Marketplace 中的 Runway MCP — 自 9 月 23 日起,可从 Cursor Marketplace 安装 Runway 的 MCP 服务器;自 22 日起,智能体还可以只读方式查看 Brand Kits。🔗 来源
  • Pika API Club — Pika 给出了会员相较于 Fal.ai 的节省金额:Vuvie 在 30 天内生成 3,822 次 Seedance 2.5 内容,少花了 12,185.80 美元;AI-Bridge 的月账单则从约 2,000 美元降至 990 美元。🔗 来源
  • HeyGen 的虚拟形象研究 — 在受访的 1,000 家小企业中,71.6% 曾录制视频却从未发布;在使用虚拟形象的人中,71.1% 表示节省了时间,55.3% 发布内容的频率更高。🔗 来源
  • Luma 调查 — 补报 9 月 22 日的消息:在 760 名创意专业人士中,81% 曾发布使用 AI 制作的内容,但没有任何一项任务的 AI 使用率超过 42%;62% 担忧依赖 AI 会损害人的创造力。🔗 来源
  • Perplexity 市场研究指南 — 这份指南分为八个步骤,包含提示词示例、核查步骤和五点检查清单;没有新功能,指南指向 Deep Research 和 Spaces。🔗 来源

这意味着什么

智能体正在走出聊天窗口。Muse 能用用户描述的声音说话,以虚拟形象示人,操控 Mac;按计划,它还将登陆眼镜,并据 Mark Zuckerberg 所说,于 12 月进入一款口袋设备。Google 也为 Gemini 3.8 Live 赋予了动画形象,用于接待和客户服务;Perplexity 将本地智能体部署到采用 AMD 处理器的 PC 上;即使笔记本电脑合上,Claude Code 仍会在云端继续工作。各项功能的推出时间并不一致:Mac 上的计算机操作功能和 Live Avatar 已可使用,而眼镜版 Muse 被承诺在“未来几个月”推出,它的电子邮件地址功能则尚无推出日期。

智能体的成本成了可以用数字说明的卖点。Anthropic 为云端会话提供 100 或 250 美元的额度,并用使用数据表明,缓存读取如今在 Claude Code 的成本中占比最高;其输入与输出的比例已从 189:1 升至 324:1。Perplexity 的 Fast Search 每 1,000 次请求收费 1 美元,原价为 5 美元;在得分相近的情况下,智能体任务的成本据称可节省约 68%。Runway 在支出减少 66% 的同时,仍保持 74% 的视频可用率;Together AI 以 17 美元训练了一个决策模型。各家公司都用自己的测试方法衡量节省幅度:这些数字有用,却很少能直接相互比较。

信任边界需要逐项设定,有时还会反向调整。Anthropic 再次对部分拒绝请求收费,以遏制“协同攻击”,目标是将误判率控制在 0.1% 以下。Claude Code 2.1.282 阻止项目强制设置遥测;Kimi Code 2.1.1 则在 2.1.0 的防护措施推出不到 19 小时后将其撤回,理由是已获批准的代码仓库应由用户自行负责。GitHub 正测试在敏感操作前验证用户在场。防务方面,OpenAI 向乌克兰开放 Daybreak;GitHub Security Lab 则让智能体执行模糊测试,同时提醒用户它会犯错,必须在可弃用的环境中运行。

最后,规则与基础设施都在更大范围内接受讨论。在联合国,Sam Altman 呼吁为前沿 AI 制定国际规范;OpenAI 希望由美国通过 AI 安全研究所网络主导制定,且不要求模型发布前取得许可或接受强制审查。Google 即将把首批 TPU 送入轨道,以测试太空计算;Perplexity 则用 Rust 重写了支撑其全部搜索的引擎,将 p99 延迟从约 800 ms 降至 65 ms。国家间协商的规范、轨道上的芯片、重写的引擎:支撑这些智能体运行的底层体系,正与智能体一道成形。


来源