搜索

Claude Code 由手机操控,GLM-5.3 领先 GPT-5.6 Sol 和 Claude Fable 5,Perplexity 详解其 Brain 记忆

ai-powered-markdown-translator

使用 gpt-5.4-mini 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

8月22日,Anthropic 为 Claude Code Remote Control 增加了可从手机发起会话的能力,同时 Google 也为 Antigravity 增加了类似功能,以便远程操控其代理。模型方面,Together AI 的两组对比显示,开源模型 GLM-5.3 在 DeepSWE 基准上可与 GPT-5.6 Sol 和 Claude Fable 5 持平甚至超越,而且成本只是其一小部分。Perplexity 还详细介绍了 Brain 的架构——这是其带有 Git 版本管理的代理式记忆系统——而 NotebookLM 则对所有用户开放,并集成进 Google Search 的 AI 模式。其他内容还包括:Replit 重做其代理模式,Runway 开放模型许可方案,OpenAI 加强 API 成本控制与 Codex 安全套件,以及 Grok Bot 扩大可用范围。


Claude Code Remote Control:可靠性增强,并支持从手机发起会话

8月22日 — Anthropic 在 X 上发布了一条帖子,详细说明了 Remote Control 的多项可靠性修复;这是一个允许你在远程电脑上运行 Claude Code 会话时,通过手机进行操控的功能。手机与机器之间的状态同步现在在 Claude Code 关闭后不会再留下显示中的幽灵会话,网络中断(如切换 Wi‑Fi、合上笔记本电脑盖)现在会触发自动重连,而且大型会话在 iOS 上的打开速度也大幅提升。三个斜杠命令获得了专门的移动端行为(/clear/compact/diff)。产品新功能:现在可以直接从手机发起会话——任何运行 claude remote-control 的机器都会在 Code 选项卡中显示为一张设备卡片,可被选中以远程启动会话。

Your phone now stays in sync with what’s running on your machine. Resuming a session on your laptop keeps the phone on the live session instead of archiving it. When Claude Code exits, your phone shows it offline within seconds instead of leaving a stale session hanging around.

🇨🇳 你的手机现在会与机器上运行的内容保持同步。在笔记本电脑上继续一个会话时,手机会保持在活动会话上,而不会把它归档。Claude Code 结束时,手机会在几秒钟内把它显示为离线,而不是继续留着一个过时的会话。@ClaudeDevs 在 X 上

🔗 X 上的完整帖子 🔗 Remote Control 文档


Replit:Conversations、重命名后的 Agent 模式(Power/Max)、Routines 和 Memories 进入测试版

8月22日 — Replit 发布了每周总结 This Week in Replit,其中带来了三项全新功能。Conversations 允许先通过对话式研究和构思阶段启动一个应用创意,再切换到构建阶段,而不会丢失已积累的上下文——这正是过去在另一个 AI 助手里开始这一阶段时经常出现的问题。Agent 的模式也被重命名:原来的 Economy 变为 Power,原来的 Power 变为 Max,二者成本保持不变。最后,Routines 和 Memories 进入测试版:Routines 可以根据一段对话安排任务执行,并自动返回结果,依托的是一个持久化记忆系统。这些公告是在 Replit 的 Friday Showcase 直播中发布的。

🔗 公告帖子


Together AI 对比 GLM-5.3、GPT-5.6 Sol 与 Claude Fable 5 在 DeepSWE 上的表现

8月21日 — Together AI 当天发布了两篇独立对比,分别将 Zhipu/Z.ai 的最新开源模型 GLM-5.3 与两个闭源参考模型在 DeepSWE 上进行比较;DeepSWE 是其软件工程基准(113 个任务,每种配置 4 次尝试,最大努力模式,总计 904 次运行)。面对 GPT-5.6 Sol,GLM-5.3 首次尝试略逊一筹,但到第二次就追平,并在第四次超过对方,而且成本低得多。面对 Claude Fable 5,起始差距几乎为零,但随着多次尝试,GLM-5.3 明显拉开优势——Claude Fable 5 还是这组对比中最昂贵的配置。一个从 GLM-5.3 到 Sol 的级联方案仅在测试失败时升级,最终以每个任务 6.61 美元达到 85.9% 的成功率,这一结果优于一个完美的 oracle 路由器(83.8%)。

测试对比首次尝试得分4 次尝试后得分每次运行成本
GLM-5.3 vs GPT-5.6 Sol69.0 % vs 72.7 %87.6 % vs 85.8 %3.99 $ vs 8.37 $(便宜 2.1×)
GLM-5.3 vs Claude Fable 569.0 % vs 69.7 %87.6 % vs 84.1 %3.99 $ vs 21.63 $(便宜 5.4×)

Don’t pick one. Run GLM-5.3 first, escalate to GPT-5.6 Sol when the tests fail. That cascade solves 85.9% of DeepSWE tasks at $6.61 each. Sol alone solves 72.7% at $8.37. Thirteen points better, 21% cheaper.

🇨🇳 不要只选一个模型。先让 GLM-5.3 运行,如果测试失败,再升级到 GPT-5.6 Sol。这种级联方案以每个任务 6.61 美元解决了 85.9% 的 DeepSWE 任务。只用 Sol 时,解决率为 72.7%,成本却是 8.37 美元。多出十三个百分点,还便宜 21%。Together AI,官方博客

🔗 GLM-5.3 vs Claude Fable 5 对比


NotebookLM 向所有用户开放,并集成到 Google Search 的 AI 模式中

8月21日 — NotebookLM 的 X 账号(现更名为 Gemini Notebook)宣布,经过逐步推送后,重做后的 “Notebook” 体验现在已向所有网页用户开放(移动版也计划即将推出)。另一个结构性变化是:notebooks 现在可以直接从 Google Search 的 AI 模式中访问,这让这款文档总结工具更接近 Google 的主搜索引擎。公告还提到 Chat 端的两个修复:数学公式的渲染与复制粘贴效果更好,以及修复了一个会在从右到左书写的语言中把数字显示反过来的 bug(阿拉伯语、希伯来语)。未来几周还会有更多新功能。

🔗 X 上的公告


OpenAI 为 Usage and Spend 仪表板增加按 API key 追踪支出

8月21日 — OpenAI 为其开发者平台的 Usage and Spend 仪表板增加了按 API key 细分的能力。此前支出跟踪只汇总到组织或项目级别,现在可以精确分离每个单独 API key 的贡献,从而准确识别哪些应用或工作流最耗费用。该功能还配有可在组织或项目级别配置的支出上限,并支持设置严格上限,在达到阈值后自动切断流量。这些控制项可通过 API Platform 界面以及 Admin API 访问,便于集成到程序化工作流中。OpenAI 将这次更新视为与同日宣布的 GPT-5.6 Sol 降价互为补充。

🔗 X 上的公告


Codex Security:用于网络防御的实用指南与开源 CLI(Daybreak)

8月21日 — OpenAI 发布了一份指南,详细介绍其由 AI 辅助的网络防御平台 Daybreak 的生态系统,从 ChatGPT 中的初始分诊一直到生成经过验证的修复补丁。对开发者来说,最直接的亮点是 Codex Security CLI:这是一个以 npm 包形式发布的开源工具(@openai/codex-security),可用于扫描本地仓库(npx @openai/codex-security scan .),并可集成到 CI/CD 中(GitHub Actions、GitLab CI/CD),同时支持导出 SARIF 格式。一个值得注意的新功能是 bulk-scan:它可以根据 CSV 清单审计整个仓库组合,支持中断恢复和可配置并发参数。OpenAI 还区分了两个访问级别:Daybreak Blue(漏洞分诊、补丁验证)面向获批准的防御者;Daybreak Red(高级漏洞研究、红队演练)则仅限更少数经授权用途。Codex Security cloud 已经分析了超过 3000 万次提交,覆盖 3 万多个代码库。

🔗 完整指南


Grok Bot 扩大可用范围,覆盖更多套餐并可免费试用

8月21日 — 在测试版发布十天后,Grok Bot 扩大了适用套餐范围:SuperGrok Plus、SuperGrok Heavy,以及 Cursor 的各类套餐(Pro+、Ultra 和所有 Teams 方案)。不属于这些套餐的用户现在也可获得有限用量的免费试用。这些自主 AI 代理拥有自己的云端环境,带有浏览器和终端访问能力,可用于销售线索挖掘、完整网站创建(包含域名购买与部署)、邮件收件箱整理、客户支持或会议记录等任务。多个 Bot 可以在同一个组中并行运行,而且 “routine” 模式可以让某个 Bot 通过观察用户首次执行任务来学习该任务。面向大规模部署的企业候补名单现已开放。

🔗 X 上的公告


Runway 详述其企业策略与模型许可方案

8月21日 — Runway 新任首席商务官 Sean Holcombe 在一篇文章中详述了公司的企业战略:年度营收翻倍有余,净留存率超过 300%,国际扩张明显(欧洲企业客户占比超过 20%,日本已成为亚洲第一市场)。最关键的公告是推出 模型许可 方案:与按 API 使用量计费的访问不同,部分企业客户可以获得闭源模型权重,以及一套专有的训练/推理框架,直接在自有环境中托管并微调。Runway 重点面向四类客户:拥有自有创意知识产权的企业、已经具备算力的平台、受严格监管约束的组织,以及超大规模业务方。

🔗 完整文章


Perplexity 详解 Computer 的代理式记忆系统 Brain

8月19日 — Perplexity 详细介绍了 Brain 的工作方式,这是其本地代理 Computer 的持久化记忆系统。Brain 并不是传统的向量数据库,而是把记忆组织成一个以 Git 进行版本管理的知识 wiki,分布在沙盒文件系统的三层中:knowledge/(wiki)、notes/(提炼后的片段)和 sessions/(原始转录)。一个专门的 “Memory Agent” 会按需加载相关文件,而不是在每次启动时复制整个目录树;与此同时,名为 “Dream” 的后台代理会通过四个步骤离线维护这个 wiki,并在发布前进行检查。

评估指标无 Brain有 Brain
准确率(内部基准,640 个问题)0.6000.661
证据召回率(内部基准)0.5730.625
生产环境准确率(最近 30 天)对照组+9.3 个百分点

🔗 技术文章


简讯

  • Devin(Cognition)——GPT-5.6 Sol 额外再减 20% — OpenAI 将 GPT-5.6 Sol 的价格再下调 20%,为期 3 个月;这叠加在自 8 月 18 日起已实施的 70% 折扣之上:Devin Desktop 和 CLI 的累计降价现已达到 76%,有效期至 2026 年 10 月 3 日。🔗 公告
  • Google Antigravity 2.9.1 —— 用 Remote Control 远程操控代理 — 新功能允许你从任意浏览器启动并监控本地代理会话,同时带来性能提升和更好的错误恢复。🔗 更新日志
  • Copilot Max 的自动模型选择降价 30% — 面向 Copilot Max 订阅用户的自动模型选择(Claude、GPT 或 Microsoft AI)促销,截止到 2026 年 9 月 30 日有效。🔗 公告 · 🔗 结束日期
  • GitHub Universe 2026——重新开启售票 — 通过一段短视频重新启动 GitHub Universe 2026 大会的营销传播,没有附带产品公告。🔗 视频
  • Midjourney——网站 alpha 的重大更新日志 — alpha.midjourney.com 上两周的 UX 修复:项目文件夹、Upscale/Zoom/Vary 回归、设置持久化以及性能修复。🔗 更新日志
  • MiniMax 暗示将在 SambaNova 上发布 M3 模型 — 回应 SambaNova 一则含糊的公告后,MiniMax 暗示即将推出 M3 模型,但未公布规格或发布日期。🔗 推文
  • Grok 4.6 已在 Google Enterprise Agent Platform 上可用 — 该模型加入 Model Garden(原 Vertex AI),上下文窗口为 500,000 tokens,输入/输出定价为每百万 tokens 2 美元 / 6 美元。🔗 公告
  • Cohere 通过 superwhisper 开启本地模式语音听写 — “Go Local” 模式结合了 Cohere Transcribe 和 superwhisper 的开源模型 S1-mini(6 亿参数),实现完全在设备上转录。🔗 公告

这意味着什么

今天有两则彼此独立、毫无关联的公告,却共同指向同一个趋势:把 AI 代理的控制层与其实际运行的机器解耦。在 Anthropic,Claude Code Remote Control 现已支持直接从手机启动会话,并可在设备间自动重新连接和同步状态。在 Google,Antigravity 则引入了自己的“Remote Control”功能:可从任意浏览器远程控制并监视本地代理会话。两种情况下,计算与执行仍然锚定在工作站上——变得更移动的是控制窗口。这种解耦回应了一种如今已很常见的用法:在开发机上启动一个长任务,然后在另一台设备上继续跟踪并接管它,而无需中断正在进行的执行。

今天可见的第二个动向,触及模型经济性。Together AI 的两组对比显示,来自智谱/Z.ai 的开源模型 GLM-5.3 在同一软件工程基准上可以追平甚至超越 GPT-5.6 Sol 和 Claude Fable 5,而成本却低 2 到 5 倍。这并非孤例:就在同一周,xAI 为 Grok 4.6 接连增加云端集成(在 GitHub Copilot 和 Amazon Bedrock 之后又接入 Google Enterprise Agent Platform),OpenAI 还将 GPT-5.6 Sol 面向 Devin 用户的累计折扣提高到 76%,Replit 也在扩展其自身的代理模式。竞争不再只围绕模型的原始能力展开,而是更多转向性价比和多平台可用性——在这一赛道上,开源模型与模型级联策略的结合,正逐渐成为面对封闭模型时的重要商业筹码。

第三条线索则更为低调,也贯穿了今天:持久记忆正成为 AI 代理基础设施中的一块独立拼图。Perplexity 详细介绍了 Brain 的架构:这是一个通过 Git 版本化的知识 wiki,用来组织 Computer 代理的记忆,而不是把记忆简单堆进传统向量数据库中,并且在事实准确性和证据召回方面都取得了可测量的提升。与此同时,Google 扩大了对改版 NotebookLM Notebook 体验的访问,并将其直接整合进 Google Search 的 AI 模式,使这款文档摘要工具更进一步贴近主搜索引擎。在这两种情况下,价值不再只来自底层模型,而是来自历史记录与积累知识如何被组织、检索并在不同会话之间复用。

最后一个角度,关乎面向企业技术与安全团队的工具成熟度。OpenAI 为其仪表板增加了按 API 密钥的支出跟踪以及可配置的严格限额;与此同时,它发布了关于 Codex Security 的详细指南,并提供一个能够审计整个仓库组合的开源 CLI。这两则公告由同一团队在同一天发布,勾勒出一种一致的回应:面对大规模部署 AI 代理的组织,既要对成本和安全面保持精细控制,又不能放弃这些工具所承诺的速度。


来源