ai-powered-markdown-translatorgpt-6.1-sol로 프랑스어에서 한국어로 번역된 기사.
10월 2일 금요일, Meta는 연구자들이 자체 모델 Muse Spark와 함께 작성한 수학 논문 6편을 공개했다. Meta에 따르면 이 중 5편은 미해결 상태였던 연구 문제에 답을 제시한다. Anthropic은 Claude Frontier Academy를 통해 배포 엔지니어 10 000명을 양성하는 데 1억 달러를 투입하기로 하고 Claude Code 2.1.288을 공개했으며, NVIDIA는 가격이 4 999달러부터 시작하는 64GB DGX Spark를 발표했다. 전날 저녁의 두 발표도 이날 소식에 더해졌다. 하나는 가중치를 공개한 모델로 확률을 반환하는 Perplexity의 Decisions API이고, 다른 하나는 Google의 첫 TPU를 궤도로 운반하는 위성이다.
Meta, Muse Spark와 함께 작성한 수학 논문 6편 공개, Ai2, AstaBrief 공개, Google의 AI, 독감 예측
10월 2일 — Meta가 연구자들이 자체 모델 Muse Spark와 함께 작성한 수학 논문 6편을 연구 블로그에 공개했다. Meta에 따르면 이 중 5편은 그동안 미해결 상태였던 연구 문제에 답을 제시하지만, 게시글은 어떤 논문이 예외인지 명시하지 않았다. 수학자들은 지난 몇 달 동안 맞춤형 연구 보조 구조(custom research scaffold) 없이 meta.ai의 채팅 인터페이스에서 직접 Muse Spark 1.1과 1.2의 Thinking 모드를 사용해 연구했다.
Following gold-medal-level performance from our AI models across five competitions in mathematics, physics, and chemistry, we asked a harder question: can AI contribute when a problem is genuinely open and without an existing solution path?
🇰🇷 수학, 물리학, 화학 분야의 다섯 대회에서 우리 AI 모델들이 금메달 수준의 성과를 거둔 뒤, 우리는 더 어려운 질문을 던졌습니다: 문제가 실제로 미해결 상태이고 해결에 이르는 경로가 전혀 없을 때도 AI가 기여할 수 있을까요? — X의 @AIatMeta
제시된 절차는 엄격하다. 한 수학자 팀이 연구를 이끌고, 다른 팀이 결과를 검토하며, 각 논문은 연구자 또는 AI가 주로 작성한 부분을 표시한다. 모델의 기여는 보조 계산부터 전체 절의 작성까지 논문마다 크게 다르다.
| 수학 분야 | Meta가 발표한 결과 | Meta가 밝힌 Muse Spark의 기여 |
|---|---|---|
| 확률론 | 고차원 무작위 가우스 점들을 통과하는 타원체를 맞추기 위한 엄밀한 임계값 | 증명 전략 |
| 미분방정식 | 질량 임계 이중조화 비선형 슈뢰딩거 방정식에서 음의 에너지를 갖는 방사형 해의 유한 시간 발산, 2015년부터 미해결이던 문제 | 계산, 논증 시험, 증명 수정 |
| 군론 | 반아벨군이 반드시 단항군인 것은 아님: M. 키다의 추측(2024)에 대한 위수 384의 반례 | 반례를 찾아낸 GAP 기반 탐색 프로그램 작성 |
| 최적화 | 순환 완화가 원래 문제를 정확히 표현하는 조건을 제시하는 규칙 | 확률적 재정식화, 반례, 증명 전략 |
| 산술 물리학 | 테이트 곡선보다 훨씬 넓은 곡선 클래스에서 p진 끈 이론의 2점 함수가 높이 함수와 같다는 결과 | 증명 후보, 기술적 내용을 다룬 3개 절 작성 |
| 비결합 대수 | 가해 진화 대수에 관한 추측에 대한 차원 3의 반례 | 반례와 대안적 특성화 |
Meta는 이 중 세 문제가 다른 곳에서도 해결되었다고 인정했다. 가우스 임계값에 관해 8월에 발표된 연구 세 편, AI 에이전트 Nilradical이 9월 16일 보고한 키다 추측의 반례, 후와 원이 제시한 진화 대수의 반례가 그 사례다. Meta에 따르면 자사의 결과는 다른 접근법으로 독립적으로 도출되었다. 이번 발표는 내부 모델이 100개 이상의 미해결 문제를 해결했다고 9월 21일 밝힌 OpenAI의 발표에 뒤이은 것이다. Meta는 일반에 제공되는 모델을 그대로 사용했다는 점과 AI의 기여분을 투명하게 공개했다는 점을 강조하며, 모든 증명은 수학자들이 검증하고 수정하며 다시 작성한다고 밝혔다.
🔗 미해결 연구 문제를 함께 해결하기(Meta AI Research)
AstaBrief 8B: Ai2, 출처를 인용한 과학 보고서를 작성하는 모델 공개
10월 2일 — Ai2가 연구 질문과 문헌 발췌문을 출처를 인용한 과학 보고서로 바꾸는 모델 AstaBrief 8B를 공개했다. 이 모델은 이제 Ai2의 과학 연구용 에이전트 플랫폼 Asta에서 ‘보고서 생성’ 기능의 Fast 모드를 구동하며, Claude가 구동하는 Thinking 모드와 나란히 제공된다. 학습 방식은 단순하다. Qwen3-8B를 ScholarQA 파이프라인으로 생성한 47 000개 예제로 지도 미세조정(SFT)한 뒤, 약 6 000쌍으로 직접 선호도 최적화(DPO)를 수행했으며 강화학습은 사용하지 않았다. 모델 설명서에 따르면 Apache-2.0 라이선스로 제공되는 가중치와 학습 데이터가 공개되어 있어, 연구실이 자체 하드웨어에서 실행할 수 있다.
모델은 한 번에 보고서를 작성한다. Asta의 전체 파이프라인에서 보고서 작성에 걸리는 평균 시간은 Fast 모드 51,1초, Thinking 모드 178,5초로, 약 3,5배 빠르다. 소규모 사람 평가 연구(질문 14개, 연구자 3명)에서는 전반적인 선호도에서 DR Tulu가 우세했지만, 연구자 세 명 중 두 명은 인용의 정확성에서 AstaBrief를 선호했다. Ai2는 학습과 평가의 대부분이 2025년에 이루어졌으며 현재 모델들과 비교해 다시 평가하지 않았다는 점을 알렸다.
독감: Google의 AI로 설계한 모델, CDC의 FluSight 평가에서 39개 중 1위
9월 30일 — Google은 자사의 AI로 설계한 독감 예측 모델이 2025-2026 시즌 FluSight에서 가장 좋은 성과를 거두었다고 발표했다. FluSight는 미국 질병통제예방센터(CDC)가 10월부터 5월까지 매주 입원 환자 수 예측을 집계하는 체계다. CDC의 시즌 종료 보고서도 이를 확인했다. 34개 팀이 제출한 53개 모델 중 선정된 39개 모델에서 개별 모델 1위는 Google_SAI-FluEns이며, 상대 WIS는 0,56이었다(오차 점수로, 낮을수록 예측이 정확하다). 이는 OHT_JHU-nbxd을 포함해 0,58을 기록한 세 모델보다 앞선 결과다. CDC가 대외 발표에 사용하는 FluSight 앙상블은 7위에 올랐다.
이 예측 모델들은 Google의 AI 도구 Empirical Research Assistance(ERA)로 개발되었다. ERA는 다양한 과학 분야를 위한 최적화 알고리즘을 생성하며, 신뢰할 수 있는 시험 사용자에게 개방되어 있다. 관련 연구 논문은 LLM이 안내하는 트리 탐색을 통해 자체 예측 코드를 작성하고 평가하며 개선하는 자율 시스템을 설명한다. 이 시스템은 COVID-19와 호흡기세포융합바이러스(VRS) 예측 모델도 만들었다.
🔗 Google Research 게시글 · CDC의 FluSight 2025-2026 보고서
Perplexity, Decisions API 출시와 pplx-decider-v1-27b 공개, llama.cpp, 의사결정 모델 제공
10월 1일 — Perplexity가 새로운 API인 Decisions API를 공개하고, 이를 구동하는 모델 pplx-decider-v1-27b를 Apache 2.0 라이선스로 공개했다. 발표는 저녁에 회사의 개발자 계정 @perplexitydevs를 통해 이루어졌다. 이 의사결정 모델(decision model)은 답변을 작성하는 대신 고정된 답변 집합에 대한 확률 분포를 반환한다. 텍스트, JSON 또는 이미지를 읽지만 답변을 작성하거나 코드를 생성하거나 추론 과정을 설명하지 않는다.
질문은 세 가지 유형으로 제공된다. noul는 ‘예’의 확률을 반환하고, choice은 1~255개 선택지 중에서 선택하면서 각 선택지의 확률과 신뢰도 지표를 제공하며, score는 콘텐츠를 최대 10단계의 척도에 배치한다. 한 요청에서 같은 콘텐츠에 대해 최대 128개 질문을 할 수 있으며, 질문을 포함한 입력은 262 144토큰 미만이어야 한다. 요금은 입력 100만 토큰당 0,04달러이며, 출력은 무료이고 요청별 요금은 부과되지 않는다. 각 조직은 요금제와 관계없이 초당 10건의 요청을 보낼 수 있다. Perplexity는 분류, 라우팅, 평가 기준에 따른 점수 산정을 목표로 한다. 참고 예제(cookbook)에서는 지원 문의를 분류하며, Decisions API가 첫 결정을 내리고 Agent API가 상위 단계로 넘겨진 문의를 처리한다.
이 모델은 Qwen3.8-27B를 기반으로 미세조정되었다. Hugging Face에 공개된 가중치를 사용하려면 약 49GiB를 수용할 수 있는 CUDA GPU와 추가 작업 메모리가 필요하다. 모델 설명서는 11개 벤치마크에서 다른 의사결정 모델인 Jev 및 기반 모델과 비교하며, pplx-decider-v1-27b의 결과는 Perplexity의 API를 통해 측정되었다.
| 벤치마크(정확도) | Jev 점수 | Qwen3.8-27B 점수(기반 모델) | pplx-decider-v1-27b 점수 |
|---|---|---|---|
| WinoGrande | 90,70 % | 73,10 % | 83,30 % |
| FinancialPhraseBank | 76,98 % | 75,68 % | 84,18 % |
| RAGTruth | 77,27 % | 61,53 % | 88,80 % |
| JudgeBench | 78,57 % | 68,86 % | 78,29 % |
| BBH | 94,27 % | 72,80 % | 82,80 % |
| JevBench 공개 고난도 | 73,27 % | 72,28 % | 70,30 % |
| TabFact | 89,80 % | 78,60 % | 90,60 % |
| ContractNLI | 77,45 % | 80,78 % | 80,78 % |
| Circa | 84,60 % | 87,00 % | 89,20 % |
| Belebele | 95,00 % | 93,20 % | 94,00 % |
| TruthfulQA 이진 | 92,00 % | 82,80 % | 85,40 % |
| 전체(모델 설명서 기준) | 84,51 % | 74,76 % | 85,71 % |
발표에서 강조한 ‘전체’ 행에서는 pplx-decider-v1-27b가 85,71 %로 Jev의 84,51 %를 앞서지만, 모델 설명서는 이 행의 계산 방식을 명시하지 않는다. 공개된 표에 따르면 Jev는 BBH와 WinoGrande를 포함한 11개 벤치마크 중 6개에서 여전히 앞서며, JevBench 공개 고난도에서는 Perplexity 모델이 기반 모델보다도 뒤처진다.
🔗 @perplexitydevs의 발표 · Decisions API 문서 · Hugging Face의 pplx-decider-v1-27b
llama.cpp, Jev와 호환되는 /v1/systemone API로 의사결정 모델 제공
10월 2일 — llama.cpp 서버가 이제 새로운 엔드포인트 /v1/systemone을 통해 의사결정 모델을 제공할 수 있다. 이 기능은 10월 2일 병합된 PR 29818에 포함되었다. 쑤언선 응우옌과 빅토르 뮈스타르가 작성한 ggml-org 게시글은 그 원리를 설명한다. 상태(텍스트, JSON, 스크린샷)와 유형이 지정된 질문인 choice, score(2~10단계) 또는 noul(예 또는 아니요)을 보내면, 모델이 한 번의 처리로 선택지별 확률을 반환한다. 이 API는 TypeSafe의 모델 Jev가 도입한 System One 형식을 사용하므로, 기존 클라이언트는 기본 URL만 바꾸면 된다. 라우터 모드는 같은 서버에서 필요에 따라 여러 모델을 불러온다.
| 지원되는 의사결정 모델 | 모델 크기 | 기반 모델 | 질문당 처리 시간 중앙값 |
|---|---|---|---|
| Julia-1(50개 이상의 언어) | 144M | mmBERT-small | 3 ms |
| Laya | 421M | ModernBERT-large | 5 ms |
| Kev-4B | 4B | Qwen3.5-4B-Base | 12 ms |
| lev | 4B | Qwen3.5-4B | 36 ms |
| OpenJev(이미지도 읽음) | 27B | Qwen3.8-27B | 43 ms |
시간은 NVIDIA RTX PRO 6000에서 측정되었다. 다음 지원 예정 모델은 Clef로, Cloudflare가 10월 1일 Jev의 API와 호환되는 API와 함께 발표했다. ggml-org는 10월 2일 Hugging Face에 Clef와 Clef-flash의 GGUF 저장소를 만들었다.
Anthropic, Claude Frontier Academy 출범 및 엔지니어 10 000명 양성에 1억 달러 투입 약속
10월 2일 — Anthropic이 1억 달러 투입 약속을 바탕으로 한 교육 프로그램인 Claude Frontier Academy를 출범시켰다. 목표는 2027년 말까지 최첨단 배포 엔지니어(Frontier Deployed Engineers, FDE) 10 000명을 양성하는 것이다. 첫 교육 기수에는 Accenture, Bain, Capgemini, Commonwealth Bank of Australia, Deloitte, McKinsey, Morgan Stanley, Novo Nordisk의 엔지니어들이 참여한다.
첫 프로그램인 Frontier Deployed Engineer Residency는 의료 수련 모델을 따른다. 프로그램 소개 페이지에 따르면, 먼저 나흘간의 집중 교육을 진행한다. 사흘 동안 대면으로 가상의 기업을 위한 Claude 시스템을 구축한 뒤, 평가 시험을 통해 Claude Resident Engineer 배지를 받는다. 이어 12주 동안 소속 조직에서 Claude 배포를 수행하는 수련 과정을 거친 다음, 최종 평가를 통해 Claude Frontier Deployed Engineer 배지를 받는다. 첫 배지 수여는 2027년 초로 예상된다.
참여는 여전히 제한적이다. 지명을 받아야 참여할 수 있고, 조기 이용은 선정된 고객과 파트너에게만 제공되며, 교육 기수는 샌프란시스코, 뉴욕, 런던에서 운영된다. Academy는 지난 3월 1억 달러 투입과 함께 출범한 Claude Partner Network를 확장한다. 이 네트워크에는 기업 46 000곳이 참여하고 있으며, 인증 발급 건수는 175 000건을 넘는다. 게시글에는 이번 예산이 기존 예산에 추가되는지 명시되어 있지 않다.
에이전트: Claude Code 2.1.288, Cursor의 GLM 5.3, Replit, DeepSeek Harness와 SWE-sweep 벤치마크
Claude Code 2.1.288, 대화형 세션의 백그라운드 명령 실행 시간 제한 해제
10월 2일 — Claude Code 2.1.288에는 수정 사항 64개를 포함해 변경 항목 89개가 들어 있다. 가장 눈에 띄는 변화는 백그라운드에서 실행하는 명령에 관한 것이다. 2.1.285에서 도입한 시간 제한인 기본 30분, 최대 2시간이 이제 무인 세션(-p, Agent SDK, CI, 클라우드)에만 적용된다. 터미널, 데스크톱 애플리케이션, VS Code에서는 백그라운드 명령을 다시 시간 제한 없이 실행할 수 있다.
Ctrl+C로 실수로 지운 프롬프트는 위쪽 화살표 키로 복구할 수 있다. /code-review은 --max-findings를 받아 보고할 문제 수를 늘리거나 줄일 수 있고, claude project purge은 claude purge로 바뀐다. 전날 출시된 모드에는 전체 화면에서 마지막으로 선택한 텍스트를 반환하는 $.ui.selection()가 추가된다. 응답 도중 API의 시간이 초과되면 비대화형 세션과 하위 에이전트는 실패로 끝나는 대신 부분 응답에서 다시 이어간다. 보안 측면에서는 bash -c 스크립트에 끼워 넣은 위험한 rm가 bypassPermissions 모드에서도 확인 없이 실행되지 않는다. 또한 일치 조건 검사에 실패한 PreToolUse 또는 PermissionRequest 훅은 이제 무시되지 않고 호출을 차단한다. 마지막으로 클라이언트 측 자동 모드 분류기는 이제 Sonnet 5.5나 Opus 5.5를 지정하는 ANTHROPIC_DEFAULT_SONNET_MODEL 변수를 무시하고, 대신 Claude Sonnet 5를 사용한다.
출시 6분 뒤, @ClaudeDevs는 보조 에이전트를 실행해 놓치지 말아야 할 정보를 프롬프트 위에 표시하는 내장 모드인 You should know를 소개했다. 이 모드는 이미 10월 1일 소개된 내장 모드 6개 중 하나였으며, 기본적으로 비활성화되어 있다.
We’re adding a new plugin to Claude Code: You should Know. It scans Claude’s output for important information you might miss to help keep you in the loop. Enable it with: /plugin enable cc-plugin-you-should-know@builtin
🇰🇷 Claude Code에 새 플러그인 You should Know를 추가합니다. Claude의 출력에서 놓칠 수 있는 중요한 정보를 찾아 분석해 알려 줍니다. 다음 명령으로 활성화하세요: /plugin enable cc-plugin-you-should-know@builtin — @ClaudeDevs의 X 게시물
GLM 5.3과 GLM 5.3 Flash, Cursor에 추가
10월 1일 — Cursor가 Z.ai의 개방형 모델 GLM 5.3과 GLM 5.3 Flash를 모델 선택기에 추가했다. 또한 자체 벤치마크에서 GLM 5.3 Max가 개방형 모델 중 1위를 차지했다고 밝혔다.
GLM 5.3 and GLM 5.3 Flash are now available in Cursor! GLM 5.3 Max is the best-scoring open-weight model on CursorBench 4.0.
🇰🇷 이제 Cursor에서 GLM 5.3과 GLM 5.3 Flash를 사용할 수 있습니다! GLM 5.3 Max는 CursorBench 4.0에서 가장 높은 점수를 받은 가중치 공개 모델입니다. — @cursor_ai의 X 게시물
첨부된 그래프는 CursorBench 4.0 점수와 작업당 평균 비용에 따라 모델을 배치하지만, 수치를 표시한 점은 하나뿐이다. 바로 « (max) »로 표시된 GLM 5.3으로, 점수는 42,6 %, 작업당 비용은 5,05달러다. 이 그래프에서 GLM 5.3은 Claude Opus 5.5, Claude Sonnet 5.5, Fable 5.1, Grok 4.7보다 낮다. 다른 개방형 모델은 없으며, GLM 5.3 Flash도 표시되지 않는다. Cursor는 이 순위를 뒷받침하는 요금, 게시글, 평가 방법을 공개하지 않았다.
Replit, Agent에 GPT-6.1 Sol과 Claude Sonnet 5.5 추가하고 AI Integrations에 Jev 제공
10월 2일 — Replit 변경 기록에 따르면 Replit Agent에서 선택할 수 있는 최신 모델 두 개가 추가됐다. Power 모드에서는 Claude Sonnet 5.5를, Max 모드에서는 GPT-6.1 Sol을 사용할 수 있다. 같은 항목에서, 앞서 pplx-decider-v1-27b와 비교 대상으로 언급된 의사결정 모델 Jev도 Replit AI Integrations에 추가됐다. 애플리케이션은 API 키를 관리할 필요 없이 빠르고 구조화된 의사결정으로 콘텐츠를 분류하거나, 요청을 라우팅하거나, 잠재 고객에게 점수를 매길 수 있다. 문서에는 Jev가 OpenRouter를 통해 jev-latest 식별자로 제공된다고 명시되어 있다. 설정은 이제 전체 페이지로 열리며, Enterprise 계정은 회사 전체에 적용할 규칙을 설정하고 팀별(Workspace) 예외를 둘 수 있다. 해당 항목에는 요금 정보가 없다.
DeepSeek Harness, macOS와 Windows에서 설치 가능
9월 30일 — @DeepSeekHarness 계정이 DeepSeek의 오픈 소스 에이전트 하네스인 DeepSeek Harness의 macOS 및 Windows용 데스크톱 버전을 발표했다. 10월 2일, 공식 계정 @deepseek_ai가 이 발표를 공유하며 Linux 사용자는 npm 패키지 @deepseek-ai/dsh를 이용한다고 설명했다. 설치 프로그램은 DeepSeek 사이트에서 다운로드할 수 있으며, macOS의 ARM 칩과 Windows x64를 지원한다.
PREVIEW로 표시된 공식 페이지는 Harness를 전 세계에 공개된 오픈 소스 미리보기 버전으로 소개한다. Cordis 프레임워크의 « 모든 것이 플러그인 »(모든 것이 플러그인) 아키텍처를 기반으로 하며, 사무 작업(파일, 데이터, 문서, 프레젠테이션), 코딩, 출처를 인용하는 조사, 백그라운드 작업을 지원한다. 대화를 통해 새 플러그인을 작성하게 하는 Creator 모드도 제공한다. 이번 변화의 핵심은 배포 방식이다. 9월 29일 미리보기 버전에는 이미 데스크톱 애플리케이션에 dsh 명령이 통합되어 있었으며, GitHub에는 아직 안정 버전이 공개되지 않았다.
🔗 @deepseek_ai 발표 · DeepSeek Harness 페이지
SWE-sweep: 에이전트가 수정할 버그를 직접 찾아야 하는 벤치마크
10월 1일 — Meta Superintelligence Labs 연구진이 하버드, 워싱턴 대학교, 스탠퍼드와 함께 SWE-sweep을 공개했다. 이 벤치마크는 코드 에이전트에게 버그의 종류나 위치에 대한 단서 없이 실제 저장소의 버그를 직접 발견하고 가능한 한 많이 수정하도록 요구한다. 데이터셋은 저장소 100개와 버그 4 068개를 포함한다. MIT 라이선스로 제공되는 코드는 Harbor 프레임워크를 기반으로 하며, 저자에는 오피르 프레스와 존 양이 포함된다. 10월 1일 생성된 저장소와 관련한 별도 발표는 아직 없다.
9월 24일 갱신된 순위는 mini-SWE-agent로 측정되었으며, 과제의 난도를 보여 준다.
| 순위 | 평가 모델 | 해결한 버그 | 총비용 |
|---|---|---|---|
| 1 | Sol 5.6 (xhigh), OpenAI | 4,7 % | 7 230 dollars |
| 2 | Luna 5.6 (xhigh), OpenAI | 2,5 % | 224 dollars |
| 3 | Terra 5.6 (xhigh), OpenAI | 1,5 % | 357 dollars |
| 4 | Luna 5.6 (high), OpenAI | 1,4 % | 28 dollars |
| 5 | Opus 5 (xhigh), Anthropic | 1,3 % | 5 363 dollars |
컴퓨팅 및 하드웨어: 첫 TPU 궤도 진입, DGX Spark 64 Go, Ascend 950용 DeepGEMM과 DeepEP
Project Suncatcher: Google 시제품 위성, 첫 TPU를 싣고 궤도 진입
10월 1일 — 첫 궤도 시험을 발표한 지 일주일 만에 Google이 Project Suncatcher의 시제품 위성을 발사했다. 이 장기 연구 프로젝트(문샷)는 언젠가 우주에 대규모 머신러닝 인프라를 구축할 수 있을지 탐구한다. Planet과 함께 제작한 위성은 SpaceX의 다중 탑재 발사 임무 Transporter-18에 실려 궤도에 진입했다. Google의 트래비스 빌스에 따르면, 연구팀은 위성과 교신하는 데 성공했으며 위성은 예상대로 작동하고 있다.
앞으로 몇 주 동안 Google은 TPU가 우주 비행의 부담과 극단적인 방사선 및 온도 조건을 어떻게 견디는지 측정할 예정이다. 지상에서는 Trillium TPU가 이미 5년 임무에서 받는 양보다 많은 방사선을 견뎠다. 연구를 자세히 설명한 동료 심사 논문은 학술지 Joule에 게재된다. 10월 2일 발사 소식을 공유한 @GoogleAI는 이 프로젝트의 근거를 다시 설명했다. 저궤도에서는 햇빛이 거의 끊임없이 비추며, 위성은 지상보다 최대 8배 많은 태양광 에너지를 생산할 수 있다는 것이다. 발표된 다음 단계는 2027년에 위성 두 기로 레이저 연결을 시험하는 것이다.
🔗 Project Suncatcher 시제품의 궤도 진입 · Joule에 게재된 논문 · @GoogleAI의 공유 게시물
DGX Spark 64 Go: NVIDIA, 10월 23일부터 판매할 구성 추가
10월 2일 — NVIDIA가 기존 128 Go 모델과 함께 DGX Spark에 통합 메모리 64 Go 구성을 추가한다. 이 구성은 10월 23일 금요일부터 Acer, ASUS, Dell, Gigabyte, HP, MSI 등 파트너 제조사 6곳을 통해서만 판매되며, 시작 가격은 4 999달러다. 게시글에는 128 Go 모델의 현재 가격이 없다. 기반 구성은 GB10 Grace Blackwell 칩, DGX OS, NVIDIA AI 소프트웨어 스택으로 동일하며, 기기에서 최대 1 000억 개의 매개변수를 가진 모델을 실행할 수 있다.
주요 장점은 클러스터 구성이다. 두 기기의 ConnectX-7 네트워크 카드를 QSFP 케이블로 연결하면 메모리를 공유할 수 있다.
| 기술 사양 | DGX Spark 64 Go 한 대 | DGX Spark 64 Go 두 대로 구성한 클러스터 |
|---|---|---|
| 통합 메모리 | 64 Go | 128 Go 공유 |
| 발표된 모델 크기 | 매개변수 최대 100십억 개 | 매개변수 최대 200십억 개 |
| Qwen 3.8 27B 성능(NVIDIA 시험) | 기준 | 최대 1,7배 |
NVIDIA Sync 애플리케이션의 Cluster Assistant가 기기를 감지하고 네트워크를 설정해 이 작업을 처리한다. 이달 말 출시 예정인 NVIDIA Sync Model Launcher는 단일 기기나 클러스터에서 Qwen3.8 27B를 다운로드하고 실행하며, 이를 사용하도록 OpenCode를 설정한다.
DeepSeek, DeepGEMM과 DeepEP를 Huawei의 Ascend 950 NPU로 이식
9월 29일과 30일 — DeepSeek가 별도 발표 없이 계산 라이브러리 두 개의 Huawei Ascend NPU용 이식 버전을 GitHub에 공개했다. README에 첫 버전 날짜가 9월 30일로 명시된 DeepGEMM-Ascend는 DeepGEMM의 API를 그대로 제공한다. Ascend 950 시리즈용으로 BF16, FP8, FP4 행렬 곱셈, MQA 로짓, MegaMoE를 지원하며, MIT 라이선스가 적용된다. DeepEP-Ascend는 MoE 모델의 전문가 병렬화(expert parallelism) 통신 라이브러리를 이식한 것으로, 분배(dispatch)와 재결합(combine)을 위한 all-to-all 연산을 제공한다.
Ascend 950DT에서 DeepEP-Ascend의 분배 속도는 랭크 8개일 때 373375 Go/s, 랭크 128개일 때 313320 Go/s로 측정됐다. 랭크 32개까지는 물리적 대역폭 한계의 약 90~95 %에 도달한다. 이 수치는 DeepSeek에 제공된 개념 증명용 하드웨어 키트(HDK)와 수동 설정으로 얻었으며, 둘 다 공개 배포되지 않았다. README는 Huawei가 10월 15일경 제공할 예정인 상용 버전을 안내한다.
🔗 GitHub의 DeepGEMM-Ascend · GitHub의 DeepEP-Ascend
음성 및 오디오: Suno Speech 베타 출시, ElevenLabs의 FedRAMP 20x Class A 인증
Suno Speech, 하나의 트랙에서 말소리와 배경 음악 생성
10월 1일 — Suno가 독창적인 배경 음악 위에 말소리를 생성하는 기능인 Speech를 베타로 공개했다. Suno에서 바로 아이디어, 시 또는 글을 입력한 뒤 원하는 목소리와 음악 스타일을 설명하면 된다. Suno는 Speech를 목소리와 음악을 함께 생성해 일관성 있는 하나의 트랙을 만드는 최초의 오디오 모델이라고 소개한다. 소규모 사용자 그룹을 대상으로 한 달간 시험한 이 기능은 이제 애플리케이션을 업데이트하면 누구나 사용할 수 있다.
제품 책임자 잭 브로디가 작성한 게시글은 주로 개인적인 활용 사례를 소개한다. 친구의 메시지를 극적인 낭독으로 바꾸거나, 음성 메모에 음악을 입히거나, 명상과 잠자리 이야기를 만드는 방식이다. Suno는 베타가 아직 완벽하지 않다고 설명한다. 영국식 억양이 호주식으로 바뀔 수 있고, 극적인 효과를 위한 쉼이 지나치게 강조될 수 있다. 요금, 이용 요금제, 지원 언어는 명시되어 있지 않다.
ElevenLabs, ElevenAgents와 음성 API에 대해 FedRAMP 20x Class A 인증 획득
10월 1일 — ElevenLabs가 FedRAMP 20x Class A 인증을 획득했다. FedRAMP는 미국 연방 기관이 클라우드 제품을 정부 데이터와 함께 안전하게 사용할 수 있는지 판단하는 체계다. 이번 인증은 데이터가 미국에 저장되며 Zero Retention Mode로 작동하는 조건으로 ElevenAgents와 Text to Speech 및 Speech to Text API에 적용된다. 이번 인증으로 ElevenLabs for Government의 제공 범위가 확대되었으며, 회사는 이제 FedRAMP Marketplace에 등재되어 있다. ElevenLabs가 인용한 FedRAMP에 따르면, Class A 등급은 연방 기관의 민감하지 않은 용도 대부분에 충분하다. ElevenLabs는 복지 급여 신청, 인허가, 세금, 심리 녹취록 작성을 예로 들었다.
ElevenLabs는 기존 공공 부문 도입 사례를 발표의 근거로 제시했다.
| 인용된 공공 부문 도입 사례 | ElevenLabs가 발표한 수치 |
|---|---|
| 국가 고용 상담 전화(우크라이나) | 25 %를 대화형 에이전트가 처리 |
| 복지 급여 및 고용 상담 전화(체코) | 하루 약 5 000건의 전화 중 85 % 해결 |
| 미들랜드시 | 월별 부재중 전화 7 000건 감소(예측) |
ChatGPT, 미국 Free 및 Go 사용자에게 Finances 제공 확대
10월 2일 — 개인 재정을 다루는 ChatGPT의 공간인 Finances가 미국에서 Free 및 Go 요금제로 확대되며, 웹, iOS, Android에서 이용할 수 있다. 이 기능은 이미 Plus 및 Pro 구독자에게 제공되고 있었다. 5월에 Pro 구독자만을 대상으로 미리 보기 버전이 출시됐고, 9월 21일에는 Plus 및 Pro 구독자를 위한 Experian 신용 점수 추적 기능이 추가됐다. 이제 Free, Go, Plus, Pro 요금제 모두에서 이용할 수 있으며, 제공 지역은 여전히 미국으로 한정된다.
기본 원리는 그대로다. Plaid를 통해 은행 및 투자 계좌를 연결하고, Experian을 통해 신용 보고서를 연결하며, 두 연결은 함께 또는 따로 사용할 수 있다. Finances 페이지에는 지출, 청구서, 구독, 순자산, 투자, 신용 점수가 모인다. 대화에서 ChatGPT는 지출을 분류하고, 구독을 찾아내고, 이번 달을 최근 추세와 비교하며, 세금과 관련해서는 정보를 정리하고 공제처럼 검토해 볼 항목을 알려 준다.
🔗 ChatGPT 릴리스 노트 · ChatGPT의 Finances
SpaceXAI, 공식 TypeScript SDK 실험 버전 공개
10월 2일 — SpaceXAI가 별도 발표 없이 공식 TypeScript SDK의 첫 공개 버전을 출시했다. 0.1.0은 UTC 16시 57분에 출시됐고, 이어 UTC 18시 25분에 나온 0.2.0에서는 클라이언트 클래스 이름을 xAI에서 SpaceXAI로 바꿨다. 회사의 새 이름에 맞춘 이 변경은 기존 코드와의 호환성을 깨뜨린다. SDK는 이미 Responses API(스트리밍, 압축, 다중 턴 대화), 플랫폼 내장 도구(웹 검색 및 X 검색, 코드 실행, 원격 MCP 서버), 이미지 및 동영상 생성과 편집, Files, Batch, Voice API를 지원한다.
| SDK 구성 요소 | 확인된 세부 사항 |
|---|---|
| npm 패키지 | @xai-official/sdk |
| 라이선스 | Apache-2.0 |
| 사전 요건 | Node.js 22.13 이상, ESM 프로젝트, 런타임 의존성 없음 |
| 상태 | 실험 단계, 1.0 이전까지 인터페이스 미확정 |
기본적으로 SDK는 클라이언트 측에서 비밀 키가 노출되지 않도록 브라우저나 Worker에서 실행되지 않는다. 이로써 TypeScript 개발자도 공식 Python SDK에 해당하는 도구를 사용할 수 있게 됐다. Python SDK의 1.20.0 버전은 9월 24일 출시됐다.
🔗 SpaceXAI TypeScript SDK 변경 기록 · npm의 @xai-official/sdk 패키지
단신
- v0의 GPT-6.1 Sol — 모델 출시일인 9월 29일, Vercel의 애플리케이션 생성 도구 v0가 ChatGPT 구독을 통한 연결을 지원한 지 몇 시간 만에 GPT-6.1 Sol을 제공하기 시작했다. 발표에는 가격이나 v0 자체 측정 결과가 제시되지 않았다. 🔗 출처
- Grok Build의 새 에이전트 대시보드 — 10월 1일 발표된 이 대시보드는
/dashboard를 사용해 모든 에이전트를 한 화면에 표시하고, 작업을 병렬로 실행하며, Ctrl+W로 에이전트를 자체 git worktree에 배치한다. Grok Build의 첫 대시보드는 6월 15일 추가됐다. 🔗 출처 - Gemini CLI 야간 빌드 — 10월 2일자 v0.64.0-nightly에는 수정 사항이 8개만 포함됐다. Ctrl+C로 진행 중인 작업을 다시 취소할 수 있으며,
~/.gemini/state.json상태는 원자적으로 기록되고 손상 시.bak백업이 복원된다. 안정 버전과 미리 보기 버전에는 변경 사항이 없다. 🔗 출처 - GitHub Copilot에서 제거되는 모델 — 9월 3일 발표한 대로 Gemini 3.5 Flash, Gemini 3.6 Flash, Kimi K2.7 Code, Claude Opus 4.7이 모든 Copilot 환경에서 제외된다. GitHub는 Gemini 3.8 Flash, Kimi K3를 권장하며, Claude Opus 5 대신 이제 Claude Opus 5.5를 제안한다. 🔗 출처
- SKILL.md 테스트하기 — 골다 마누엘은 커뮤니티 글에서 스킬이 코딩 에이전트에 의해 발견되고, 로드되며, 도움이 되는지 확인하는 방법을 제안했다. Claude Code나 Codex가 기대하는 위치에 배치하고, 세 수준의 요청에서 활성화를 확인하며, 스킬이 있을 때와 없을 때를 8개 지표로 비교한다. 측정 결과는 공개되지 않았다. 🔗 출처
- Manus, Video Editor와 Game Dev 상세 소개 — 10월 1일자 글 두 편이 Manus 2.0을 자세히 다룬다. Manus Studio의 Video Editor는 동영상의 각 요소를 별도 트랙에 배치하며, 125개 클립을 195번의 컷 편집으로 10분 50초짜리 영상으로 만들었다. Game Dev는 게임을 실시간으로 조정한다. 가격이나 날짜는 제시되지 않았다. 🔗 Video Editor · 🔗 Game Dev
- ServiceNow의 AutoSynthData — ServiceNow의 CoreAI 팀은 모델의 실패 사례에서 검증된 학습 과제를 생성한다. EnterpriseOps Gym에서 Gemma-4-26B-A4B-it의 Pass@1은 Hybrid 영역에서 7.2점 상승했고, ITSM에서는 18.77 %에서 27.18 %로 올랐다. 코드와 데이터는 공개되지 않았다. 🔗 출처
- POCKET-Darwin-180B — VIDRAFT가 1,800억 매개변수의 MoE인 Darwin-180B-RSI를 기존 360 GB에서 111 GB로 줄인 4비트 GGUF 버전으로 공개했다. 저자들에 따르면 CPU만 사용할 때 초당 18.4~21토큰, 8 GB RTX 5060을 탑재한 노트북에서는 초당 4.17토큰을 처리하며, MMLU-Pro 점수는 원본과 같은 87.65 %다. 🔗 출처
- GPT-6 모델 가이드 — OpenAI가 스타트업을 위한 가이드를 공개했다. 가장 어려운 추론에는 GPT-6 Astra, 복잡한 코드와 조사, 컴퓨터 사용에는 GPT-6.1 Sol, 대규모로 수행하는 특정 작업에는 GPT-6 Luna를 권한다. 캐시된 토큰의 비용은 모델에 따라 최대 95 % 저렴하다. 🔗 출처
- ChatGPT, iOS 카메라로 여러 페이지를 스캔해 하나의 PDF로 저장 — 10월 1일, 순차 적용 중.
- Chatham Financial과 Codex — 자본시장 컨설팅 회사인 Chatham Financial이 Codex로 거래 검증 애플리케이션을 구축했다. 초기 측정 결과에 따르면 검증 시간이 약 30분에서 4분 미만으로 줄었다. 이 회사의 Onyx 플랫폼은 GPT-5.6 Sol 및 Terra, GPT-5.4, GPT-4.1을 함께 사용한다. 🔗 출처
- The Den과 ChatGPT Work — OpenAI의 10월 1일자 사례 연구에 따르면, 덴버의 부모들을 위한 클럽 The Den의 경영진은 Gmail, Slack, Google Drive에 연결된 ChatGPT Work로 매주 10~15시간을 절약한다. 보조금 신청에는 3일 대신 2시간이 걸린다. 🔗 출처
- Blackwell에서 실행되는 GPT-6 Astra Ultrafast — NVIDIA는 10월 1일, OpenAI가 9월 29일 출시한 GPT-6 Astra의 Ultrafast 등급이 자사 Blackwell GPU에서 실행되며 Astra Standard 모드보다 최대 8배 빠르고, OpenAI가 자사 모델로 추론 소프트웨어를 최적화한다고 설명했다. 새로 제시된 수치는 없다. 🔗 출처
- CoreWeave의 RL Rollouts — 9월 30일 CoreWeave Forge와 함께 소개되고 10월 2일 NVIDIA가 다시 알린 이 서비스는 NVIDIA Dynamo를 기반으로 하며, 강화학습을 통한 사후 학습 중 새 체크포인트를 실행 중인 상태에서 로드한다. Nemotron 3.5 Lightning에서는 모델 재로딩 지연 시간이 15배 개선됐다. 🔗 출처
- ElevenReader의 Eleven v4 — 9월 28일 출시된 ElevenLabs의 가장 표현력 풍부한 음성 모델이 독서 애플리케이션에 도입된다. iOS, Android, 웹에서 기사, 전자책, PDF를 선택한 목소리로 90개 이상의 언어로 읽어 준다. 🔗 출처
- Midjourney 알파 변경 기록 — 10월 1일자 변경 기록은 주로 수정 사항을 모았다. 폴더별로 저장되는 프롬프트 설정과 하나의 칩으로 묶인 스타일 참조 등이 포함됐으며, 다음 주에는 새로운 협업 도구가 예고됐다. 🔗 출처
- Ramp Router에서 Grok 4.7 반값 제공 — 10월 6일까지 LLM 게이트웨이 Ramp Router가 Grok 4.7을 50 % 할인하며, SpaceXAI도 이 혜택을 알렸다. SpaceXAI API에서 이 모델의 요금은 토큰 100만 개당 입력 2달러, 출력 6달러다. 🔗 출처
- 보안 권고문의 비공개 댓글 — GitHub에서 저장소 보안 권고문에 신고자가 볼 수 없는 댓글을 달 수 있게 됐다. 쓰기 권한이 있는 사람만 이 댓글을 읽을 수 있고, 열람 기록도 남는다. 댓글용 REST API는 공개 미리 보기 단계에 들어간다. 🔗 출처 · 🔗 REST API
- GitHub Advisory Database의 GraphQL API — SecurityAdvisory 객체에 CVE 식별자와 NVD 게시 날짜를 포함한 필드 5개가 추가되고, securityAdvisories 쿼리에는 심각도와 철회 여부에 따른 필터 2개가 추가된다. 이제 REST API를 다시 거칠 필요가 없다. 🔗 출처
- GitHub Actions의 macOS 14 이미지 지원 종료 — 10월 1일 발표에 따르면 11월 2일 이미지가 제거되며, 이에 앞서 10월에는 UTC 14시부터 자정까지 예정된 중단이 8차례 진행된다. 워크플로는 macos-15 또는 macos-latest로 전환해야 하며, macos-latest는 macos-26을 가리킨다. 🔗 출처
- 기업의 인공지능 성숙도 — Perplexity가 성숙도 4단계를 설명하고, Gartner, Deloitte, Google Cloud의 체계를 요약하며, 자체 평가표를 제공하는 가이드를 공개했다. 가이드가 인용한 McKinsey의 2026년 설문 조사에 따르면 응답자의 80 %가 개인 생산성 향상을 경험하지만, EBIT에 기여한다고 답한 비율은 37 %에 그쳤다. 🔗 출처
이것이 의미하는 것
인공지능을 과학에 적용한 성과는 이를 발표하는 주체 외부의 기준으로 평가되는 경우가 늘고 있다. Meta는 결과를 나열하는 데 그치지 않는다. 각 논문은 인공지능이 작성한 부분을 밝히고, 별도의 수학자 집단이 다시 검토하며, 소개 글은 세 문제가 다른 곳에서도 해결됐음을 인정한다. Google의 인공지능으로 설계한 독감 예측 모델의 가치는 CDC가 한 시즌 전체에 걸쳐 다른 모델 38개와 비교해 평가했다는 데 있다. Ai2는 AstaBrief의 가중치와 데이터를 공개하면서도 비교 결과가 2025년 기준임을 알린다. 개방형 모델은 검증할 수 있지만, 평가 결과는 시간이 지나면 낡는다.
의사결정 모델은 며칠 만에 독자적인 분야로 자리 잡고 있다. Jev, Liquid AI의 d1, Cloudflare의 Clef에 이어 Perplexity는 입력 토큰에 따라 요금을 매기는 API와 모델 가중치를 함께 제공한다. llama.cpp는 같은 System One 형식으로 이 모델들을 로컬에서 실행하며, Replit은 API 키 없이 사용할 수 있는 통합 기능에 Jev를 포함한다. 개발자에게는 구체적인 이점이 있다. 나중에 분석해야 하는 텍스트 응답 대신, 한 번의 실행으로 각 선택지의 확률을 얻을 수 있다. 비교에는 주의가 필요하다. 모델 설명서의 Overall 행에서는 pplx-decider-v1-27b가 Jev보다 앞서지만, 공개된 세부 결과에서는 벤치마크 11개 중 6개에서 Jev가 우세하다.
코딩 에이전트의 발전 속도는 실제 자율성의 향상 속도보다 빠르다. SWE-sweep에서 저장소를 혼자 맡았을 때 가장 뛰어난 모델도 7,000달러 넘게 들이고 버그의 4.7 %만 찾아 수정한다. Claude Code 2.1.288은 변경 항목 89개 중 대부분을 수정 사항에 할애했다. API 시간 초과 후 복구와 여러 권한 규칙 강화가 포함됐으며, 주 에이전트의 작업을 감시하는 모드를 강조한다. Anthropic은 또 다른 병목인 인력의 역량을 해결하기 위해, 배포를 운영 환경까지 완수할 수 있는 엔지니어 양성에 1억 달러를 투입한다. 개방형 모델도 Cursor의 GLM 5.3과 데스크톱의 DeepSeek Harness를 통해 도구 안에서 자리를 넓혀 간다.
마지막으로, 연산 하드웨어는 세 방향으로 다양해지고 있다. Google은 언젠가 지상보다 최대 8배 많은 태양 에너지를 활용할 수 있는 TPU를 궤도에서 시험하고, NVIDIA는 DGX Spark에 64 GB 구성을 추가해 두 대를 연결하면 2,000억 매개변수 모델을 실행할 수 있게 하며, DeepSeek는 저수준 라이브러리를 동일한 API로 Huawei의 Ascend 칩에서도 사용할 수 있게 한다. 각각 다른 방식으로 모델을 실행할 수 있는 장소와 하드웨어의 범위를 넓히고 있다.
출처
- 미해결 연구 문제를 함께 해결하기 (Meta AI Research)
- 논문 6편에 관한 @AIatMeta의 게시물 모음
- AstaBrief 오픈 소스 공개 (Ai2)
- 독감 예측에 관한 Google Research의 글
- CDC의 FluSight 2025-2026 보고서
- @perplexitydevs의 Decisions API 발표
- Decisions API 문서
- Hugging Face의 pplx-decider-v1-27b
- llama.cpp의 새 기능: 의사결정 모델 (ggml-org)
- Claude Frontier Academy (Anthropic)
- Claude Frontier Academy 프로그램 페이지
- Claude Code 2.1.288 릴리스 노트
- @ClaudeDevs가 강조한 알아 두어야 할 사항
- Cursor의 GLM 5.3, @cursor_ai의 발표
- Replit의 10월 2일자 변경 기록
- @deepseek_ai의 DeepSeek Harness 소개
- DeepSeek Harness 페이지
- SWE-sweep
- Project Suncatcher 시제품의 궤도 진입 (Google)
- Joule에 게재된 Project Suncatcher 논문
- @GoogleAI의 발사 소식 공유
- DGX Spark 64 GB (NVIDIA 블로그)
- GitHub의 DeepGEMM-Ascend
- GitHub의 DeepEP-Ascend
- Speech 소개 (Suno)
- ElevenLabs의 FedRAMP 20x Class A 인증
- ChatGPT 릴리스 노트
- ChatGPT의 Finances (OpenAI 도움말 센터)
- SpaceXAI TypeScript SDK 변경 기록
- npm의 @xai-official/sdk 패키지
- v0의 GPT-6.1 Sol (@v0)
- Grok Build 에이전트 대시보드 (@grok)
- Gemini CLI의 10월 2일자 v0.64.0 야간 빌드
- GitHub Copilot의 사용 중단 모델
- SKILL.md는 코딩 에이전트에게 도움이 되는가?
- Manus의 Video Editor
- Manus의 Game Dev
- AutoSynthData (ServiceNow)
- POCKET-Darwin-180B (VIDRAFT)
- GPT-6 계열 모델 가이드 (OpenAI)
- Chatham Financial과 OpenAI
- The Den과 ChatGPT Work
- Blackwell에서 실행되는 GPT-6 Astra Ultrafast (NVIDIA 블로그)
- CoreWeave Forge 소개
- ElevenReader의 Eleven v4 (@ElevenLabs)
- Midjourney의 10월 1일자 알파 변경 기록
- Ramp Router의 Grok 4.7 (@SpaceXAI)
- 보안 권고문의 비공개 댓글 (GitHub)
- 보안 권고문 댓글용 REST API (GitHub)
- GraphQL API SecurityAdvisory의 새 필드 (GitHub)
- GitHub Actions의 macOS 14 이미지 제거
- Perplexity의 인공지능 성숙도 가이드