ai-powered-markdown-translator文章已使用 gpt-6.1-sol 从法语翻译为中文。
10 月 2 日星期五,Meta 发布了研究人员借助其 Muse Spark 模型完成的六篇数学论文;据 Meta 称,其中五篇回答了此前尚未解决的研究问题。Anthropic 投入 1 亿美元,通过 Claude Frontier Academy 培训 10 000 名部署工程师,并发布 Claude Code 2.1.288;NVIDIA 则宣布推出配备 64 GB 内存的 DGX Spark,起价 4 999 美元。前一晚的两项公告也为当天的消息增添了内容:Perplexity 的 Decisions API 以概率作答,其底层模型已开放权重;Google 的卫星则将其首批 TPU 送入轨道。
Meta 发布六篇借助 Muse Spark 撰写的数学论文,Ai2 开源 AstaBrief,Google 的人工智能预测流感
10 月 2 日 — Meta 在其研究博客上发布了六篇由研究人员借助自研模型 Muse Spark 完成的数学论文。据 Meta 称,其中五篇回答了此前尚未解决的研究问题,但博文没有说明哪一篇是例外。过去几个月里,数学家们直接在 meta.ai 的聊天界面中,以 Thinking 模式使用 Muse Spark 1.1 和 1.2,没有使用专门搭建的研究框架(定制研究框架)。
Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?
🇨🇳 我们的人工智能模型在五项数学、物理和化学竞赛中取得了金牌水平的成绩后,我们提出了一个更难的问题:当一个问题确实尚未解决,而且没有任何现成的求解路径时,人工智能能否作出贡献? — @AIatMeta 在 X 上
公布的研究流程相当严格:一组数学家指导研究,另一组审阅成果,每篇论文都标明哪些段落主要由研究人员撰写,哪些主要由人工智能撰写。模型在各篇论文中的贡献差异很大,从辅助计算到撰写整节内容都有:
| 数学领域 | Meta 宣布的结果 | 据 Meta 称 Muse Spark 的贡献 |
|---|---|---|
| 概率论 | 在高维空间中拟合经过随机高斯点的椭球的严格阈值 | 证明策略 |
| 微分方程 | 质量临界的双调和非线性薛定谔方程中,负能量径向解的有限时间爆破,这是自 2015 年以来一直未解决的问题 | 计算、检验论证、修订证明 |
| 群论 | 半阿贝尔群不一定是单项式群:针对 M. Kida(2024 年)猜想的 384 阶反例 | 用 GAP 编写的搜索程序,找到了该反例 |
| 优化 | 精确判定基于环的松弛何时能够刻画原问题的规则 | 概率论重述、反例、证明策略 |
| 算术物理 | 在远比 Tate 曲线更广的一类曲线上,p 进弦理论的二点函数等于一个高度函数 | 候选证明、撰写三个技术章节 |
| 非结合代数 | 关于可解演化代数的一项猜想的 3 维反例 | 反例及其他刻画方式 |
Meta 承认,这些问题中有三个也已被其他研究者解决:8 月发表的三项关于高斯阈值的研究、人工智能智能体 Nilradical 于 9 月 16 日公布的 Kida 猜想反例,以及 Hu 和 Wen 给出的演化代数反例。据 Meta 称,其自身结果是通过不同方法独立获得的。此前,OpenAI 于 9 月 21 日表示,一个内部模型已解决了 100 多个开放问题;Meta 则强调,它直接使用面向公众的模型,并透明披露人工智能的贡献比例,所有证明仍由数学家核验、修正和重写。
🔗 携手解决开放研究问题(Meta AI Research)
AstaBrief 8B:Ai2 开源可撰写附引文科学报告的模型
10 月 2 日 — Ai2 开源了 AstaBrief 8B,这个模型能将研究问题和文献摘录转化为附有引文的科学报告。它现已为 Ai2 科学智能体平台 Asta 的“生成报告”功能提供 Fast 模式,与由 Claude 驱动的 Thinking 模式并列。训练方法仍然简单:以 Qwen3-8B 为基础,先用 ScholarQA 流水线生成的 47 000 个示例进行监督微调(SFT),再用约 6 000 对样本进行直接偏好优化(DPO),没有采用强化学习。模型权重和训练数据均已公开,模型说明指出权重采用 Apache-2.0 许可证:实验室可以在自己的硬件上运行它。
该模型一次即可生成整份报告。在 Asta 的完整流水线中,Fast 模式生成一份报告平均需要 51.1 秒,Thinking 模式则需要 178.5 秒,前者的速度约为后者的 3.5 倍。在一项小规模人工评估中(14 个问题、3 名研究人员),DR Tulu 在整体偏好上胜出,但三名研究人员中有两名更认可 AstaBrief 的引文准确性。Ai2 提醒,大部分训练和评估都完成于 2025 年,尚未重新与当前模型进行比较。
流感:借助 Google 人工智能开发的模型在 CDC 的 FluSight 评估中位列 39 个模型之首
9 月 30 日 — Google 宣布,借助其人工智能开发的一款流感预测模型,在 FluSight 的 2025-2026 季度评估中表现最佳。FluSight 是美国疾病控制与预防中心(CDC)的预测项目,每年 10 月至次年 5 月,每周汇总住院人数预测。CDC 的季末报告证实了这一结果:34 个团队提交了 53 个模型,其中 39 个被纳入评估,单个模型中排名第一的是 Google_SAI-FluEns,相对 WIS 为 0.56(这是一项误差指标,越低代表预测越准确),领先于三个得分为 0.58 的模型,其中包括 OHT_JHU-nbxd。CDC 用于对外发布信息的 FluSight 集成模型排名第 7。
这些预测模型借助 Empirical Research Assistance(ERA)开发。ERA 是 Google 的一款人工智能工具,可为不同科学领域生成优化算法,目前向受信任的测试者开放。相关研究论文描述了一个自主系统,它通过 LLM 引导的树搜索,编写、评估并改进自身的预测代码;该系统还生成了用于预测 COVID-19 和呼吸道合胞病毒的模型。
🔗 Google Research 博文 · CDC 的 FluSight 2025-2026 报告
Perplexity 推出 Decisions API 并开放 pplx-decider-v1-27b,llama.cpp 支持提供决策模型服务
10 月 1 日 — Perplexity 开放了一款新的 API,即 Decisions API,并以 Apache 2.0 许可证发布了驱动它的模型 pplx-decider-v1-27b。该公告于晚间通过公司的开发者账号 @perplexitydevs 发布。这个决策模型(决策模型)返回的是一组固定答案的概率分布:它可以读取文本、JSON 或图像,但不会撰写回答、生成代码或解释其推理过程。
它支持三种问题类型:noul 返回肯定答案的概率;choice 从 1 到 255 个选项中作出选择,并为每个选项提供概率和一个置信度指标;score 按照最多 10 个等级对内容进行评级。一次请求最多可针对同一份内容提出 128 个问题,包含问题在内的输入必须少于 262 144 个词元。价格为每百万输入词元 0.04 美元,输出免费,也不收取按请求计费的费用;每个组织每秒可以发送 10 次请求,无论采用哪种套餐。Perplexity 面向分类、路由和按评分标准打分等用途:其参考示例(示例指南)对支持工单进行分流,由 Decisions API 作出初步决策,Agent API 处理需要升级处理的情况。
该模型基于 Qwen3.8-27B 微调;Hugging Face 上的权重需要一块支持 CUDA 的 GPU,其显存需能容纳约 49 GiB 的权重,此外还需要工作内存。模型说明将它与另一款决策模型 Jev 及其基础模型在十一项基准测试上进行比较,其中 pplx-decider-v1-27b 的结果通过 Perplexity 的 API 测得:
| 基准测试(准确率) | Jev 得分 | Qwen3.8-27B(基础模型)得分 | pplx-decider-v1-27b 得分 |
|---|---|---|---|
| WinoGrande | 90,70 % | 73,10 % | 83,30 % |
| FinancialPhraseBank | 76,98 % | 75,68 % | 84,18 % |
| RAGTruth | 77,27 % | 61,53 % | 88,80 % |
| JudgeBench | 78,57 % | 68,86 % | 78,29 % |
| BBH | 94,27 % | 72,80 % | 82,80 % |
| JevBench 公开高难度部分 | 73,27 % | 72,28 % | 70,30 % |
| TabFact | 89,80 % | 78,60 % | 90,60 % |
| ContractNLI | 77,45 % | 80,78 % | 80,78 % |
| Circa | 84,60 % | 87,00 % | 89,20 % |
| Belebele | 95,00 % | 93,20 % | 94,00 % |
| TruthfulQA 二分类 | 92,00 % | 82,80 % | 85,40 % |
| 总体(据模型说明) | 84,51 % | 74,76 % | 85,71 % |
在公告重点强调的“总体”这一行中,pplx-decider-v1-27b 以 85,71 % 领先于 Jev 的 84,51 %,但模型说明没有解释这一行是如何计算的。根据公布的表格,Jev 在十一项基准测试中的六项仍然领先,包括 BBH 和 WinoGrande;在 JevBench 的公开高难度部分,Perplexity 的模型甚至落后于自己的基础模型。
🔗 @perplexitydevs 的公告 · Decisions API 文档 · Hugging Face 上的 pplx-decider-v1-27b
llama.cpp 通过 /v1/systemone API 提供决策模型服务,并兼容 Jev
10 月 2 日 — llama.cpp 的服务器现已能够通过新端点 /v1/systemone 提供决策模型服务,该端点随 10 月 2 日合并的第 29818 号 PR 加入。Xuan-Son Nguyen 和 Victor Mustar 署名的 ggml-org 博文介绍了其原理:发送一个状态(文本、JSON、屏幕截图)以及带类型的问题,类型包括 choice、score(2 到 10 个等级)或 noul(是或否),模型便会一次返回每个选项的概率。该 API 沿用了 TypeSafe 的 Jev 模型引入的 System One 格式:现有客户端只需更改基础 URL 即可。路由器模式可以在同一台服务器上按需加载多个模型。
| 受支持的决策模型 | 模型规模 | 基础模型 | 每个问题的耗时中位数 |
|---|---|---|---|
| Julia-1(超过 50 种语言) | 144M | mmBERT-small | 3 ms |
| Laya | 421M | ModernBERT-large | 5 ms |
| Kev-4B | 4B | Qwen3.5-4B-Base | 12 ms |
| lev | 4B | Qwen3.5-4B | 36 ms |
| OpenJev(也能读取图像) | 27B | Qwen3.8-27B | 43 ms |
上述耗时是在 NVIDIA RTX PRO 6000 上测得的。已宣布即将支持的下一款模型是 Clef,Cloudflare 于 10 月 1 日发布了它,并提供与 Jev 兼容的 API;ggml-org 于 10 月 2 日在 Hugging Face 上创建了 Clef 和 Clef-flash 的 GGUF 仓库。
Anthropic 推出 Claude Frontier Academy,投入 1 亿美元培训 10 000 名工程师
10 月 2 日 — Anthropic 推出 Claude Frontier Academy,这一培训项目获得 1 亿美元的资金承诺。目标是在 2027 年底前培训 10 000 名前沿部署工程师(Frontier Deployed Engineers,FDE)。首批学员包括来自 Accenture、Bain、Capgemini、Commonwealth Bank of Australia、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的工程师。
首个项目 Frontier Deployed Engineer Residency 借鉴了医学培训模式。根据项目页面,培训从为期四天的强化课程开始:前三天线下为一家模拟企业构建 Claude 系统,随后参加评分考核,通过后获得 Claude Resident Engineer 徽章。接下来是十二周的驻场实训,学员在自己的组织中主导一次 Claude 部署,最后通过考核获得 Claude Frontier Deployed Engineer 徽章;首批徽章预计于 2027 年初颁发。
参与渠道仍未开放:学员须经提名,抢先参与资格仅向选定的客户和合作伙伴提供,培训班设在旧金山、纽约和伦敦。该学院延续了 Claude Partner Network 的工作,该网络于 3 月推出,投入 1 亿美元,涵盖 46 000 家企业和超过 175 000 项认证;文章没有说明新资金是否是在此基础上追加的。
🔗 Anthropic 公告 · 项目页面
智能体:Claude Code 2.1.288、Cursor 中的 GLM 5.3、Replit、DeepSeek Harness 和 SWE-sweep 基准测试
Claude Code 2.1.288 取消交互式会话中后台命令的时间限制
10 月 2 日 — Claude Code 2.1.288 发布了 89 项更新,其中包括 64 项修复。最明显的变化涉及后台运行的命令:2.1.285 引入的时间限制(默认 30 分钟,最长 2 小时)现在仅适用于无人值守会话(-p、Agent SDK、CI、云端)。在终端、桌面应用和 VS Code 中,后台命令又可以无限时运行了。
误按 Ctrl+C 清除的提示词可以通过向上箭头键恢复,/code-review 支持 --max-findings,以报告更多或更少的问题,claude project purge 改为 claude purge,前一天推出的模组新增了 $.ui.selection(),用于返回全屏模式下最后选中的文本。当 API 在响应过程中超时,非交互式会话和子智能体会从已有的部分响应继续,而不再直接失败。在安全方面,嵌入 bash -c 脚本中的危险 rm 在 bypassPermissions 模式下也必须经过确认;PreToolUse 或 PermissionRequest 钩子在匹配失败时,现在会阻止调用,而不再被忽略。最后,客户端自动模式的分类器现在会忽略指向 Sonnet 5.5 或 Opus 5.5 的 ANTHROPIC_DEFAULT_SONNET_MODEL 变量,改用 Claude Sonnet 5。
版本发布六分钟后,@ClaudeDevs 重点介绍了内置模组 You should know,它会启动一个辅助智能体,在提示词上方显示不容错过的信息。该模组已列入 10 月 1 日介绍的六个内置模组中,目前仍默认关闭。
We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin
🇨🇳 我们为 Claude Code 新增了一个插件:You should Know。它会分析 Claude 的输出,查找你可能遗漏的重要信息,让你及时掌握情况。启用命令为:/plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs 在 X 上
GLM 5.3 和 GLM 5.3 Flash 登陆 Cursor
10 月 1 日 — Cursor 在模型选择器中加入了 Z.ai 的开放模型 GLM 5.3 和 GLM 5.3 Flash,并宣称 GLM 5.3 Max 在其自有基准测试的开放模型中排名第一。
GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.
🇨🇳 GLM 5.3 和 GLM 5.3 Flash 现已在 Cursor 中上线!GLM 5.3 Max 是 CursorBench 4.0 中评分最高的开放权重模型。 — @cursor_ai 在 X 上
随附图表按 CursorBench 4.0 得分和每项任务的平均成本展示各个模型,但只标注了一个数据点:标为“(max)”的 GLM 5.3,得分为 42,6 %,每项任务成本为 5,05 美元。根据这张图表,GLM 5.3 仍低于 Claude Opus 5.5、Claude Sonnet 5.5、Fable 5.1 和 Grok 4.7;图中没有其他开放模型,也没有 GLM 5.3 Flash。Cursor 没有发布价格、相关文章或支持其排名的方法说明。
Replit 在 Agent 中开放 GPT-6.1 Sol 和 Claude Sonnet 5.5,并在 AI Integrations 中加入 Jev
10 月 2 日 — Replit 的更新日志为 Replit Agent 新增了两个近期模型选项:Power 模式下的 Claude Sonnet 5.5,以及 Max 模式下的 GPT-6.1 Sol。同一条更新还在 Replit AI Integrations 中开放了 Jev,这款决策模型此前曾与 pplx-decider-v1-27b 一同被提及:应用可以通过快速、结构化的决策来分类内容、路由请求或为潜在客户评分,无需管理 API 密钥。文档明确说明,Jev 通过 OpenRouter 提供,标识符为 jev-latest。设置现在以整页形式打开,Enterprise 账户可以制定全公司适用的规则,并为各团队(Workspace)设置例外。该条目未说明任何价格。
DeepSeek Harness 可安装到 macOS 和 Windows
9 月 30 日 — @DeepSeekHarness 账户宣布,DeepSeek 的开源智能体运行框架 DeepSeek Harness 推出了 macOS 和 Windows 桌面版本。10 月 2 日,主账户 @deepseek_ai 转发了这则公告,并说明 Linux 用户可使用 npm 包 @deepseek-ai/dsh。安装程序可从 DeepSeek 网站下载,支持搭载 ARM 芯片的 macOS 和 Windows x64。
标有 PREVIEW 的官方页面将 Harness 介绍为面向全球开放的开源公开预览版。它基于 Cordis 框架的“一切皆插件”(一切皆插件)架构,涵盖办公任务(文件、数据、文档、演示文稿)、编程、带来源引用的研究以及后台任务,并提供 Creator 模式,让用户通过对话编写新插件。此次更新主要体现在分发方式上:9 月 29 日的预览版已将 dsh 命令集成到桌面应用中,GitHub 上尚未发布任何稳定版本。
🔗 @deepseek_ai 公告 · DeepSeek Harness 页面
SWE-sweep:让智能体自行发现待修复缺陷的基准测试
10 月 1 日 — Meta Superintelligence Labs 的研究人员与哈佛大学、华盛顿大学和斯坦福大学合作,开放了 SWE-sweep 基准测试。它要求编程智能体在真实代码仓库中自行发现缺陷,并尽可能多地修复,且不提供任何关于缺陷类型或位置的提示。数据集覆盖 100 个仓库和 4 068 个缺陷;代码采用 MIT 许可证,基于 Harbor 框架,作者包括奥菲尔·普雷斯和约翰·杨。仓库于 10 月 1 日创建,目前尚无配套公告。
排行榜于 9 月 24 日更新,使用 mini-SWE-agent 智能体进行测评,结果显示了任务的难度:
| 排名 | 评测模型 | 已修复缺陷 | 总成本 |
|---|---|---|---|
| 1 | Sol 5.6 (xhigh), OpenAI | 4,7 % | 7 230 美元 |
| 2 | Luna 5.6 (xhigh), OpenAI | 2,5 % | 224 美元 |
| 3 | Terra 5.6 (xhigh), OpenAI | 1,5 % | 357 美元 |
| 4 | Luna 5.6 (high), OpenAI | 1,4 % | 28 美元 |
| 5 | Opus 5 (xhigh), Anthropic | 1,3 % | 5 363 美元 |
计算与硬件:首批 TPU 进入轨道、DGX Spark 64 Go、Ascend 950 上的 DeepGEMM 和 DeepEP
Project Suncatcher:Google 原型卫星搭载首批 TPU 进入轨道
10 月 1 日 — 宣布首次在轨测试一周后,Google 发射了 Project Suncatcher 的原型卫星。这是一项长期研究计划(宏大探索项目),旨在探索太空能否在未来承载大规模机器学习基础设施。卫星与 Planet 合作建造,搭乘 SpaceX 的 Transporter-18 拼车发射任务进入轨道;据 Google 的特拉维斯·比尔斯介绍,团队已与卫星建立联系,卫星运行符合预期。
未来几周,Google 将测量其 TPU 如何承受航天飞行的各项严苛条件,以及极端辐射和温度;在地面测试中,Trillium TPU 已经承受了超过五年任务预期水平的辐射剂量。详细介绍这项研究的同行评审论文发表于 Joule 期刊。@GoogleAI 于 10 月 2 日转发发射消息时重申了项目的依据:低地球轨道几乎持续受到阳光照射,卫星产生的太阳能最多可达地面的 8 倍。已公布的下一步计划是于 2027 年发射两颗卫星,测试激光链路。
🔗 Project Suncatcher 原型卫星已进入轨道 · 发表于 Joule 的论文 · @GoogleAI 的转发
DGX Spark 64 Go:NVIDIA 新增配置,将于 10 月 23 日开售
10 月 2 日 — NVIDIA 为 DGX Spark 新增了 64 Go 统一内存配置,与现有的 128 Go 型号并列。新配置将于 10 月 23 日星期五起,仅由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 六家合作制造商销售,起价为 4 999 美元;文章没有给出 128 Go 型号的当前价格。基础配置保持不变:GB10 Grace Blackwell 芯片、DGX OS 和 NVIDIA AI 软件栈,可在本机运行最多 1000 亿参数的模型。
主要卖点是组建集群:两台设备通过各自 ConnectX-7 网卡上的 QSFP 线缆连接后,可以共享内存。
| 技术特性 | 一台 DGX Spark 64 Go | 两台 DGX Spark 64 Go 组成集群 |
|---|---|---|
| 统一内存 | 64 Go | 128 Go 共享内存 |
| 宣称支持的模型规模 | 最多 100(以十亿参数计) | 最多 200(以十亿参数计) |
| Qwen 3.8 27B 性能(NVIDIA 测试) | 基准 | 最高 1,7 倍 |
NVIDIA Sync 应用通过 Cluster Assistant 完成配置,它会检测设备并设置网络。预计于月底推出的 NVIDIA Sync Model Launcher 将下载 Qwen3.8 27B,在单台设备或集群上启动该模型,并配置 OpenCode 来使用它。
🔗 NVIDIA 关于 DGX Spark 64 Go 的文章
DeepSeek 将 DeepGEMM 和 DeepEP 移植到 Huawei Ascend 950 NPU
9 月 29 日和 30 日 — DeepSeek 未发布公告,直接在 GitHub 上公开了两项计算库向 Huawei Ascend NPU 的移植成果。DeepGEMM-Ascend 的 README 将首个版本日期标为 9 月 30 日,它完整保留了 DeepGEMM 的 API:BF16、FP8 和 FP4 矩阵乘法、MQA 和 MegaMoE 的 logits,采用 MIT 许可证,面向 Ascend 950 系列。DeepEP-Ascend 则移植了 MoE 模型的专家并行(expert parallelism)通信库,包括用于分发(dispatch)和合并(combine)的 all-to-all 操作。
在 Ascend 950DT 上,DeepEP-Ascend 测得的分发吞吐量为:8 个秩时 373 至 375 Go/s,128 个秩时 313 至 320 Go/s;在最多 32 个秩的规模下,其性能达到物理带宽上限的约 90 至 95 %。这些数据是在向 DeepSeek 提供的概念验证硬件开发套件(HDK)上,采用手动配置测得的,两者均未公开分发;README 指向了商业版本,Huawei 预计于 10 月 15 日左右供货。
🔗 GitHub 上的 DeepGEMM-Ascend · GitHub 上的 DeepEP-Ascend
语音与音频:Suno Speech 开放测试,ElevenLabs 获得 FedRAMP 20x Class A 认证
Suno Speech 在同一音轨中生成口语和背景音乐
10 月 1 日 — Suno 开放了 Speech 功能的测试版,让用户直接在 Suno 中生成伴有原创背景音乐的口语音频:输入一个想法、一首诗或一段文本,再描述所需的声音和音乐风格即可。Suno 将 Speech 介绍为首个能同时生成语音和音乐,并融合成一条连贯音轨的音频模型。该功能已在一小组用户中测试了一个月,现在更新应用后即可向所有人开放。
文章由产品负责人杰克·布罗迪署名,主要列举了个人用途:将朋友的消息变成戏剧化朗读,为语音备忘录配乐,制作冥想内容或睡前故事。Suno 提醒,测试版仍有不足:英式口音可能逐渐变成澳大利亚口音,戏剧化停顿也可能过于明显。文章没有说明价格、套餐或支持的语言。
ElevenLabs 的 ElevenAgents 和语音 API 获得 FedRAMP 20x Class A 认证
10 月 1 日 — ElevenLabs 获得 FedRAMP 20x Class A 认证,美国联邦机构通过这一框架判断云产品是否能够安全处理政府数据。认证涵盖 ElevenAgents,以及 Text to Speech 和 Speech to Text API,前提是采用 Zero Retention Mode,并将数据驻留在美国。它扩展了 ElevenLabs for Government 的服务范围,公司现已列入 FedRAMP Marketplace。根据 ElevenLabs 引述的 FedRAMP 说明,Class A 级别足以满足联邦机构大多数非敏感用途;ElevenLabs 举出的场景包括福利申请、许可办理、税务和听证会转写。
ElevenLabs 以现有的公共部门部署案例支持这则公告:
| 引述的公共部门部署案例 | ElevenLabs 公布的数据 |
|---|---|
| 全国就业热线(乌克兰) | 25 % 由对话智能体处理 |
| 福利与就业热线(捷克) | 每天约 5 000 通电话中,85 % 得到解决 |
| 米德兰市 | 每月减少 7 000 通未接来电(预测) |
ChatGPT 向美国 Free 和 Go 用户开放 Finances
10月2日 — ChatGPT 的个人财务专区 Finances 在美国扩展至 Free 和 Go 套餐,支持网页、iOS 和 Android。Plus 和 Pro 订阅用户此前已可使用这项功能:它于5月以预览版形式首次面向 Pro 订阅用户推出,并于9月21日为 Plus 和 Pro 订阅用户加入 Experian 信用评分追踪。如今,它覆盖 Free、Go、Plus 和 Pro 套餐,仍仅限美国。
使用方式保持不变:通过 Plaid 连接银行和投资账户,通过 Experian 连接信用报告,这两种连接既可同时使用,也可单独使用。Finances 页面汇集支出、账单、订阅、净资产、投资和信用评分。在对话中,ChatGPT 会对支出进行分类、识别订阅、将当月情况与近期趋势比较;在税务方面,它会整理信息,并提示可进一步研究的事项,例如税前扣除项目。
🔗 ChatGPT 版本说明 · ChatGPT 中的 Finances
SpaceXAI 发布官方 TypeScript SDK 实验版
10月2日 — SpaceXAI 在未发布公告的情况下推出了官方 TypeScript SDK 的首个公开版本。0.1.0 于 UTC 16 时 57 分发布,随后于 UTC 18 时 25 分推出的 0.2.0 将客户端类 xAI 重命名为 SpaceXAI:这项破坏性变更让代码与公司的新名称保持一致。该 SDK 已涵盖 Responses API(流式传输、压缩和多轮对话)、平台内置工具(网页搜索和 X 搜索、代码执行、远程 MCP 服务器)、图像与视频的生成和编辑,以及 Files、Batch 和 Voice API。
| SDK 项目 | 已确认的详情 |
|---|---|
| npm 包 | @xai-official/sdk |
| 许可证 | Apache-2.0 |
| 前置要求 | Node.js 22.13 或更新版本、ESM 项目、无运行时依赖 |
| 状态 | 实验性,1.0 之前接口尚未定型 |
默认情况下,SDK 拒绝在浏览器或 Worker 中运行,以防在客户端暴露密钥。TypeScript 开发者由此获得了与官方 Python SDK 对应的工具,后者的 1.20.0 版本于9月24日发布。
🔗 SpaceXAI TypeScript SDK 的 CHANGELOG · npm 上的 @xai-official/sdk 包
简讯
- v0 中的 GPT-6.1 Sol — 9月29日,即模型发布当天,Vercel 的应用生成工具 v0 开放了 GPT-6.1 Sol;此前几小时,它刚刚支持通过 ChatGPT 订阅连接。公告未提供价格或针对 v0 的测评数据。🔗 来源
- Grok Build 推出新的智能体仪表板 — 该功能于10月1日公布,通过
/dashboard在同一屏幕上显示所有智能体,支持并行启动任务,并通过 Ctrl+W 将智能体放入独立的 git worktree;Grok Build 此前于6月15日推出过首个仪表板。🔗 来源 - Gemini CLI 每夜构建版 — 10月2日的 v0.64.0-nightly 仅包含八项修复:Ctrl+C 再次能够取消正在进行的操作,
~/.gemini/state.json状态以原子方式写入,并在数据损坏时恢复.bak备份;稳定版和预发布版均未变化。🔗 来源 - GitHub Copilot 移除部分模型 — 按照9月3日的公告,Gemini 3.5 Flash、Gemini 3.6 Flash、Kimi K2.7 Code 和 Claude Opus 4.7 将退出所有 Copilot 使用场景;GitHub 推荐 Gemini 3.8 Flash、Kimi K3,如今还推荐 Claude Opus 5.5,以替代 Claude Opus 5。🔗 来源
- 测试 SKILL.md — 在一篇社区博文中,戈尔达·曼努埃尔提出了一种方法,用于检查技能是否能被编程智能体找到、加载并有效使用,但未公布测量结果:检查 Claude Code 或 Codex 预期的存放位置,在三个层次的请求中测试激活情况,并从八项指标比较使用和不使用技能的表现。🔗 来源
- Manus 详解 Video Editor 和 Game Dev — 10月1日的两篇博文进一步介绍了 Manus 2.0:Manus Studio 中的 Video Editor 将视频中的每个元素放在独立轨道上(将 125 段片段剪辑成一部 10 分 50 秒的影片,共有 195 次剪切),Game Dev 则实时调整游戏;均未提供价格或日期。🔗 Video Editor · 🔗 Game Dev
- ServiceNow 的 AutoSynthData — ServiceNow 的 CoreAI 团队根据模型的失败案例生成经过验证的训练任务:在 EnterpriseOps Gym 上,Gemma-4-26B-A4B-it 在 Hybrid 领域的 Pass@1 提升了 7.2 点,在 ITSM 领域则从 18.77 % 提升至 27.18 %;未公布代码或数据。🔗 来源
- POCKET-Darwin-180B — VIDRAFT 发布了 Darwin-180B-RSI 的 4 位 GGUF 版本,体积为 111 GB(原版为 360 GB);这是一个拥有 1800 亿参数的 MoE。作者称,仅使用处理器时速度为每秒 18.4 至 21 tokens,在搭载 8 GB RTX 5060 的笔记本上为每秒 4.17 tokens,MMLU-Pro 得分为 87.65 %,与原版相同。🔗 来源
- GPT-6 模型指南 — OpenAI 发布面向初创公司的指南:GPT-6 Astra 适用于最困难的推理,GPT-6.1 Sol 适用于复杂编程、研究和计算机操作,GPT-6 Luna 适用于大规模的特定任务;根据模型不同,缓存 tokens 的费用最高可降低 95 %。🔗 来源
- ChatGPT 可通过 iOS 相机将多页内容扫描成一个 PDF — 10月1日,正在逐步推出。
- Chatham Financial 与 Codex — 这家资本市场咨询公司使用 Codex 构建了一款交易验证应用:初步测量显示,核查时间从约 30 分钟缩短至不到 4 分钟;其 Onyx 平台结合使用 GPT-5.6 Sol 和 Terra、GPT-5.4 以及 GPT-4.1。🔗 来源
- The Den 与 ChatGPT Work — 根据 OpenAI 10月1日发布的案例研究,这家位于丹佛、面向家长的俱乐部,其管理团队通过连接 Gmail、Slack 和 Google Drive 的 ChatGPT Work,每周节省 10 至 15 小时;一份补助申请只需 2 小时,之前则需要 3 天。🔗 来源
- Blackwell 上的 GPT-6 Astra Ultrafast — NVIDIA 于10月1日说明,OpenAI 在9月29日推出的 GPT-6 Astra Ultrafast 档位运行于其 Blackwell GPU,速度最高为 Astra Standard 模式的 8 倍,且 OpenAI 使用自身模型优化推理软件;未提供新的数字。🔗 来源
- CoreWeave 的 RL Rollouts — 这项服务于9月30日与 CoreWeave Forge 一同亮相,并由 NVIDIA 于10月2日转发介绍。它基于 NVIDIA Dynamo 构建,在强化学习后训练期间热加载新的检查点;在 Nemotron 3.5 Lightning 上,模型重新加载延迟改善幅度达到 15 倍。🔗 来源
- ElevenReader 中的 Eleven v4 — ElevenLabs 于9月28日发布的表现力最强的语音模型进入其阅读应用:用户可用所选声音收听文章、电子书和 PDF,支持超过 90 种语言,覆盖 iOS、Android 和网页端。🔗 来源
- Midjourney 的 alpha 版更新日志 — 10月1日的更新日志主要汇集修复内容,包括按文件夹保存提示词参数,以及将风格参考集中到一个标签中;新协作工具已预告将在下一周推出。🔗 来源
- Ramp Router 中的 Grok 4.7 半价优惠 — 截至10月6日,LLM 网关 Ramp Router 为 Grok 4.7 提供 50 % 折扣,SpaceXAI 转发了这一优惠;该模型在 SpaceXAI API 上的价格为每百万 tokens 输入 2 美元、输出 6 美元。🔗 来源
- 安全公告的保密评论 — GitHub 支持在仓库安全公告下发表评论,而报告者无法看到:只有拥有写入权限的人能阅读这些评论,查看行为会被记录到日志中;评论 REST API 进入公开预览阶段。🔗 来源 · 🔗 REST API
- GitHub Advisory Database 的 GraphQL API — SecurityAdvisory 对象新增五个字段,包括 CVE 标识符和 NVD 发布日期;securityAdvisories 查询新增两个筛选条件,分别按严重程度和撤回状态筛选:无需再通过 REST API 查询。🔗 来源
- GitHub Actions 停用 macOS 14 镜像 — 10月1日宣布,该镜像将于11月2日移除,此前将在10月安排八次停用时段,时间为 UTC 14 时至午夜;工作流必须迁移至 macos-15 或 macos-latest,后者指向 macos-26。🔗 来源
- 企业人工智能成熟度 — Perplexity 发布了一份指南,介绍四个成熟度阶段,概述 Gartner、Deloitte 和 Google Cloud 的框架,并提供自评表;根据其引用的 McKinsey 2026 年调查,80 % 的受访者看到了个人生产力提升,但只有 37 % 看到了对 EBIT 的贡献。🔗 来源
这意味着什么
应用于科学的人工智能越来越多地接受发布者以外的评价标准检验。Meta 不只是罗列成果:每篇论文都会说明哪些段落由人工智能撰写,另一个数学家团队会复审,博文还承认其中三个问题也已在其他地方得到解决。借助 Google 人工智能设计的流感预测模型,其价值来自 CDC 在完整一个流感季内、与另外 38 个模型进行比较的评估。Ai2 发布了 AstaBrief 的权重和数据,但提醒其比较结果来自 2025 年:开放模型可以验证,评估则会过时。
决策模型在短短几天内成为了一个独立类别。继 Jev、Liquid AI 的 d1 和 Cloudflare 的 Clef 之后,Perplexity 同时提供按输入 token 计费的 API 和模型权重;llama.cpp 使用相同的 System One 格式在本地运行这些模型,Replit 则将 Jev 加入无需 API 密钥的集成服务。对开发者而言,价值很具体:只需一次处理,就能获得每个选项的概率,而不必先得到文本回答再进行解析。比较结果需要谨慎看待:模型说明中的 Overall 行显示 pplx-decider-v1-27b 领先于 Jev,但公布的详细结果显示,Jev 在十一项基准测试中的六项占优。
编程智能体的进步速度快于其实际自主能力。在 SWE-sweep 上让模型独自面对代码仓库时,最好的模型也只能找到并修复 4.7 % 的缺陷,花费却超过 7 000 美元。Claude Code 2.1.288 的 89 条更新内容大部分用于修复问题,包括 API 超时后的恢复和多项收紧的权限规则,同时重点介绍了一个监控主智能体工作的模组。Anthropic 则着手解决另一个瓶颈——人的技能,投入 1 亿美元培训能够将部署推进到生产环境的工程师。开放模型也逐渐在工具中获得一席之地,例如 Cursor 中的 GLM 5.3 和桌面端的 DeepSeek Harness。
最后,计算硬件正朝三个方向拓展。Google 在轨道上测试 TPU,未来它们可获得的太阳能最高可能达到地球上的 8 倍;NVIDIA 为 DGX Spark 新增 64 GB 配置,两台配对可支持 2000 亿参数;DeepSeek 则让其底层库能够通过相同 API 在 Huawei 的 Ascend 芯片上使用。它们各自以不同方式扩展了模型能够运行的地点和硬件范围。
来源
- 携手解决开放研究问题 (Meta AI Research)
- @AIatMeta 关于六篇论文的帖子串
- 开源 AstaBrief (Ai2)
- Google Research 关于流感预测的博文
- CDC 的 FluSight 2025-2026 报告
- @perplexitydevs 发布的 Decisions API 公告
- Decisions API 文档
- Hugging Face 上的 pplx-decider-v1-27b
- llama.cpp 新功能:决策模型 (ggml-org)
- Claude Frontier Academy (Anthropic)
- Claude Frontier Academy 项目页面
- Claude Code 2.1.288 版本说明
- @ClaudeDevs 推荐的 You should know
- Cursor 中的 GLM 5.3,@cursor_ai 的公告
- Replit 10月2日的更新日志
- @deepseek_ai 转发介绍 DeepSeek Harness
- DeepSeek Harness 页面
- SWE-sweep
- Project Suncatcher 原型已进入轨道 (Google)
- Joule 上的 Project Suncatcher 论文
- @GoogleAI 转发的发布消息
- DGX Spark 64 GB (NVIDIA 博客)
- GitHub 上的 DeepGEMM-Ascend
- GitHub 上的 DeepEP-Ascend
- 推出 Speech (Suno)
- ElevenLabs 获得 FedRAMP 20x Class A 认证
- ChatGPT 版本说明
- ChatGPT 中的 Finances (OpenAI 帮助中心)
- SpaceXAI TypeScript SDK 的 CHANGELOG
- npm 上的 @xai-official/sdk 包
- v0 中的 GPT-6.1 Sol (@v0)
- Grok Build 的智能体仪表板 (@grok)
- Gemini CLI 10月2日的 v0.64.0 每夜构建版
- GitHub Copilot 已弃用的模型
- 你的 SKILL.md 对编程智能体有帮助吗?
- Manus 的 Video Editor
- Manus 的 Game Dev
- AutoSynthData (ServiceNow)
- POCKET-Darwin-180B (VIDRAFT)
- GPT-6 系列模型指南 (OpenAI)
- Chatham Financial 与 OpenAI
- The Den 与 ChatGPT Work
- Blackwell 上的 GPT-6 Astra Ultrafast (NVIDIA 博客)
- 推出 CoreWeave Forge
- ElevenReader 中的 Eleven v4 (@ElevenLabs)
- Midjourney 10月1日的 alpha 版更新日志
- Ramp Router 中的 Grok 4.7 (@SpaceXAI)
- 安全公告的保密评论 (GitHub)
- 安全公告评论 REST API (GitHub)
- GraphQL API 中 SecurityAdvisory 的新增字段 (GitHub)
- GitHub Actions 移除 macOS 14 镜像
- Perplexity 的人工智能成熟度指南