검색

ChatGPT의 모든 사용자를 위한 GPT-6, Claude Haiku 5.5와 RTX Spark PC 사전 주문

ai-powered-markdown-translator

gpt-6.1-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

GPT-6와 Intelligent UI가 모든 ChatGPT 사용자에게 제공된다. GPT-6 Sol은 10월 7일부터 유료 요금제에, GPT-6 Luna는 10월 8일부터 Free와 Go에 제공된다. Anthropic은 입력 토큰 100만 개당 0,10 달러부터 시작하는 Claude Haiku 5.5로 5.5 제품군을 완성했다. 한편 Microsoft의 Windows 행사에서는 RTX Spark PC 사전 주문이 시작됐으며, GitHub Copilot이 곧 로컬 모델에 작업을 맡길 수 있게 된다는 발표도 나왔다. OpenAI는 내부 모델이 도출한 수학적 결과를 담은 원고 722편도 공개했다.


ChatGPT, 모든 사용자에게 GPT-6와 Intelligent UI 제공… 오디오 파일을 읽고 College Planner도 준비

10월 7일 — OpenAI가 GPT-6를 모든 ChatGPT 사용자에게 확대 제공한다. 새로운 기반 모델이 출시되는 것은 아니다. GPT-6 Sol과 GPT-6 Luna는 이미 9월부터 유료 고객에게 제공됐으며, 여기서도 9월 22일에 다뤘다. 이번에는 일상 대화에 맞게 조정된 두 모델의 10월 버전이 Chat 탭에 도입된다. GPT-6 Sol은 10월 7일부터 Plus, Pro, Business와 Enterprise에, GPT-6 Luna는 10월 8일부터 Free와 Go에 제공된다. 이 모델들은 ChatGPT에서 GPT-5.6 Sol과 GPT-5.6 Luna를 대체하며, Codex와 ChatGPT Work는 9월 버전을 계속 사용한다. OpenAI는 이를 통해 매주 ChatGPT를 사용하는 12억 명 이상의 사람들에게 서비스를 제공한다고 설명한다.

가장 눈에 띄는 새 기능은 Intelligent UI다. GPT-6는 텍스트, 시각 자료, 상호작용 요소인 그래프, 버튼, 양식, 상호작용형 다이어그램, 지도 등을 조합해 답변하며, 요청에 따라 저축 계산기, 식사비 분할 도구, 게임 같은 작은 도구를 만들 수 있다. 간단한 텍스트만으로 충분하면 ChatGPT는 텍스트로 답한다. 이를 위해 OpenAI는 기본 구성 요소 라이브러리와 생성 과정에서 인터페이스를 표시하는 컴파일러를 사용한다. Intelligent UI는 별도 할당량 없이 Instant부터 Extra High까지의 추론 수준에서 작동한다. 다만 GPT-6 Astra를 기반으로 하는 GPT-6 Pro가 담당하는 Pro 추론 수준과 기존 macOS 및 Windows 데스크톱 앱에서는 사용할 수 없다.

두 번째 변화는 ChatGPT가 생각하거나 도구를 사용하는 도중에도 답변을 시작하고, 새로운 프롬프트 없이 답변을 완성할 수 있다는 점이다. OpenAI의 내부 평가에 따르면, 웹 검색이 필요한 질문에서 GPT-6 Instant는 GPT-5.6 Instant보다 평균 44 % 더 빨리 답변을 시작한다. GPT-6 Extra High는 GPT-5.6 Medium과 같은 시간 안에 답변을 시작하면서도 GPT-5.6 Extra High보다 종합 점수가 높다.

요금제 또는 추론 수준 설정ChatGPT에서 사용하는 모델일정 및 세부 사항
Plus, Pro, Business와 EnterpriseGPT-6 Sol (Instant, Medium, High, Extra High)10월 7일부터 전 세계 배포
Free와 GoGPT-6 Luna10월 8일부터
Pro 추론 수준(Pro 100 및 200 달러, Business, Enterprise)GPT-6 Astra 기반 GPT-6 ProIntelligent UI 미지원
ChatGPT Work와 CodexGPT-6 Sol과 GPT-6 Luna의 9월 버전변경 없음

보안 측면에서 같은 날 공개된 시스템 카드는 Preparedness Framework에 따라 이 버전들의 사이버 보안, 생물학 및 화학 역량을 ‘High’로 분류하며, 자기 개선에서는 이 임계값에 도달하지 않는다고 평가한다. GPT-5.6의 안전장치를 이어받으면서 여러 차례의 대화에 걸친 시도를 포함한 우회 시도(jailbreaks)에 대한 저항력이 향상됐다. API에서는 스냅샷 chat-latest이 이제 이 새로운 ChatGPT 모델을 가리키며, OpenAI는 실제 서비스 운영에 GPT-6 제품군을 권장한다.

GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.

🇰🇷 이제 GPT-6와 Intelligent UI가 ChatGPT의 모든 사용자에게 배포되고 있습니다. ChatGPT의 Intelligent UI는 빠르고 상호작용이 가능한 답변을 제공해 일상적인 질문을 더욱 시각적으로 보여 주고, 복잡한 주제를 더 쉽게 이해하도록 하며, 작업에 맞는 상호작용형 도구를 즉시 사용할 수 있게 합니다. — X의 @OpenAI

🔗 모든 사용자를 위한 GPT-6와 Intelligent UI · 시스템 카드, 10월 업데이트 · ChatGPT의 GPT-6 및 기타 모델

ChatGPT의 오디오 파일 지원

10월 6일 — 이제 ChatGPT에 오디오 파일을 첨부할 수 있다. 대화에 녹음 파일을 첨부해 녹취록, 요약 또는 내용에 관한 답변을 얻거나, 회의, 인터뷰, 수업을 체계적인 메모나 후속 이메일 초안으로 바꿀 수 있다. 이 기능은 Enterprise를 포함한 유료 구독 및 작업 공간에서만 제공된다. Free 요금제에서는 ‘현재로서는’ 사용할 수 없다. 지원 형식은 WAV, MP3, OGG, FLAC, AAC, M4A와 PCM이며, 오디오만 포함된 WebM과 MP4도 지원한다. 파일당 최대 크기는 512 Mo다. OpenAI는 녹취록에 오류가 있을 수 있고, 화자 식별의 신뢰도가 아직 낮으며, 언어에 따라 성능이 달라진다고 안내한다.

🔗 ChatGPT 릴리스 노트 · ChatGPT에 파일 및 오디오 업로드하기

ChatGPT for Teens: 첫 사용 통계와 출시 예정인 College Planner

10월 7일 — OpenAI가 18세 미만으로 확인된 계정에 기본 적용되는 ChatGPT for Teens의 첫 중간 현황을 공개했다. 회사에 따르면 일주일 동안 약 120만 명의 청소년이 Learning Visualizations를 사용했고, 18만 명 이상이 Study Mode를 사용했다. 이들의 하루 평균 사용 시간은 15분 미만이며, 3시간 연속 사용한 비율은 2 % 미만이다. 새롭게 발표된 College Planner는 ‘곧’ 출시되며, 우선 미국에서 4년제 대학 진학을 목표로 하는 10~12학년 고등학생에게 제공된다. 하나의 계획 안에 입학 지원 요건, 마감일, 해야 할 일, 장학금을 포함한 재정 지원 신청 절차를 모아 준다. OpenAI는 College Advising Corps와 Boston Children’s Hospital의 Digital Wellness Lab도 지원하며, 후자에 대한 지원 기간은 3년이다. 지원 금액은 공개하지 않았다.

🔗 청소년의 학습과 계획, 인공지능의 미래 형성 돕기


Anthropic에 따르면 Claude Haiku 5.5는 Haiku 4.5보다 약 75 % 저렴

10월 7일 — Opus 5.5 출시 15일 후이자 Sonnet 5.5 출시 9일 후, Anthropic이 Claude Haiku 5.5(claude-haiku-5-5)로 Claude 5.5 제품군을 완성했다. 이 모델은 요약, 컨텍스트 압축, 데이터베이스 쿼리, 분류처럼 처리량이 많고 비용에 민감한 작업, 코딩에서 Opus 5.5와 Sonnet 5.5의 하위 에이전트 역할, 실시간 고객 지원이나 브라우저 제어처럼 속도가 중요한 용도를 겨냥한다. 표준 속도에서는 Anthropic의 가장 빠른 모델이며, Fast Mode의 Opus 모델들은 여전히 더 빠르다. 추론 수준 설정을 갖춘 최초의 Haiku이기도 하며, 기본값은 medium이다. 컨텍스트는 100만 토큰이고 출력은 최대 128 000 토큰이다.

요금은 두 구간으로 나뉜다. 프롬프트가 100 000 토큰 이하일 때 Haiku 5.5의 가격은 토큰 100만 개당 입력 0,10 달러, 출력 0,50 달러로, Haiku 4.5보다 90 % 저렴하다. 이를 넘으면 입력 0,50 달러, 출력 2,50 달러로 올라가며, Haiku 4.5보다 50 % 저렴하다. 강조된 ‘약 75 %’의 비용 절감은 Anthropic이 계산한 평균값이다. Haiku 4.5에 전송된 요청의 90 %가 해당 기준 이하였으며, 새로운 토큰 분할 방식(tokenizer)은 같은 텍스트에서 약 30 % 더 많은 토큰을 계산한다.

요금 유형(토큰 100만 개당)Haiku 5.5 프롬프트 100 000 토큰 이하Haiku 5.5 100 000 토큰 초과Haiku 4.5
입력 토큰0,10 달러0,50 달러1 달러
출력 토큰0,50 달러2,50 달러5 달러
캐시 읽기0,01 달러0,05 달러0,10 달러
캐시 쓰기0,125 달러0,625 달러1,25 달러

Anthropic이 공개한 벤치마크에서는 Haiku 4.5와의 격차가 크며, Haiku 5.5는 OpenAI의 GPT-6 Luna와 함께 평가된 모든 항목에서 앞선다. 다만 Sonnet 5.5보다는 뒤처진다. Anthropic은 복잡한 에이전트 기반 코딩에는 여전히 Opus 5.5와 함께 Sonnet 5.5를 권장한다.

평가 벤치마크(Anthropic 수치)Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
Terminal-Bench 4.0(에이전트 기반 코딩)39,2 %0,0 %16,4 %70,6 %
OSWorld 2.1, 오프라인 하위 집합72,4 %15,7 %48,9 %83,9 %
Humanity’s Last Exam, 도구 미사용45,9 %10,2 %—56,9 %
FrontierCode 1.1, Main46,4 %—42,4 %52,1 % (Xhigh 추론 수준)
Chartography, 도구 미사용46,4 %6,4 %29,1 %61,6 %

고객사 여섯 곳이 사전 테스트 경험을 전했다. HubSpot은 자사 CRM 평가 모음에서 역대 최고 점수인 92,8 %를 기록했다고 밝혔고, AlphaSense는 400개 쿼리에서 Haiku 4.5의 0,76 대비 0,84를 기록했다고 전했다. Box는 지연 시간이 약 절반으로 줄면서 점수가 11점 높아졌다고 밝혔다. Haiku 4.5에서 이전하려면 작업이 필요하다. 가이드에는 budget_tokens 지원 종료, temperature, top_p, top_k 매개변수 및 사전 채우기 지원 종료를 포함한 11가지 변경 사항이 나열돼 있으며, Claude Code의 /claude-api migrate 명령이 일부 작업을 자동화한다. 보안 측면에서 Anthropic은 사이버 안전장치가 Haiku 4.5보다 엄격하지만 다른 최신 모델보다는 조금 덜 엄격하다고 설명한다. Sonnet 5.5보다 더 많은 방어 목적의 작업을 허용하지만, 침투 테스트는 여전히 차단된다.

이번 출시와 함께 가격 인하도 이뤄졌다. Sonnet 5.5의 캐시 읽기 요금은 10월 7일부터 토큰 100만 개당 0,20 달러에서 0,10 달러로 내려간다. Anthropic에 따르면 이에 따라 대부분의 에이전트 기반 작업에서 모델 사용 비용이 약 20 % 낮아진다. Haiku 5.5는 지금부터 Claude API, Amazon Web Services, Google Cloud, Microsoft Azure와 Claude Code에서 사용할 수 있다.

Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.

🇰🇷 지금까지 출시한 소형 모델 중 가장 저렴하고 가장 빠르며 성능이 가장 뛰어난 Claude Haiku 5.5를 소개합니다. 실행 비용은 Claude Haiku 4.5보다 평균 약 75 % 낮습니다. — X의 @claudeai

🔗 Claude Haiku 5.5 발표 · Haiku 5.5 이전 가이드

Cursor의 Haiku 5.5: CursorBench에서 48,4 %

10월 7일 — Cursor가 출시 당일부터 Claude Haiku 5.5를 제공하며, 모델 설정에서 활성화할 수 있다. Cursor에 따르면 짧은 요청의 비용은 Claude Haiku 4.5의 10분의 1이다. Cursor가 자사 사이트에 공개하는 순위표인 CursorBench에서 Max 추론 수준의 Haiku 5.5는 성공률 48,4 %, 작업당 비용 1,12 달러로 10위에 올랐다. 새 요금을 반영하기 위해 Cursor가 10월 7일 비용을 다시 계산한 High 추론 수준의 Sonnet 5.5를 근소하게 앞섰으며, Max 추론 수준의 Opus 5보다도 높았다. 다만 작업량은 더 많다. 작업당 평균 325 934 토큰과 163단계를 사용한 반면, High 추론 수준의 Sonnet 5.5는 37 391 토큰과 41단계를 사용했다.

Cursor가 테스트한 설정순위CursorBench 점수작업당 비용
Opus 5.5, Max 추론 수준157,8 %13,43 달러
Haiku 5.5, Max 추론 수준1048,4 %1,12 달러
Sonnet 5.5, High 추론 수준1147,8 %1,20 달러
Opus 5, Max 추론 수준1346,6 %11,95 달러
Haiku 5.5, Low 추론 수준5430,9 %0,08 달러

🔗 Cursor의 X 발표 · CursorBench 순위표


Max와 Team 요금제에 매월 100~500달러의 API 크레딧 제공

10월 7일 — Haiku 5.5와 같은 게시물에서 발표된 월간 크레딧이 Max와 Team 구독자에게 제공된다. Claude Platform에서 사용할 수 있으며, 며칠에 걸쳐 순차적으로 도입된다. API로 자신만의 도구, 애플리케이션, 에이전트를 만드는 데 사용할 수 있다. @ClaudeDevs에 따르면 Haiku 5.5를 포함한 모든 모델에서 작동하며, 직접 작성한 코드와 타사 도구 모두에서 쓸 수 있다.

대상 요금제월간 API 크레딧
Max 5x100달러
Max 20x200달러
Team, Standard 좌석좌석당 20달러
Team, Premium 좌석좌석당 100달러
Team 팀 한도500달러, 공동 사용
Free, Pro 및 Enterprise대상 아님

Team에서는 각 좌석의 크레딧이 공동 크레딧으로 합산된다. 예를 들어 Standard 좌석 3개와 Premium 좌석 2개면 매월 260달러가 제공된다. 크레딧은 Message Batches API를 포함한 모든 Claude API 모델과 Console의 Playground, Claude Managed Agents, Claude Agent SDK에 사용할 수 있다. Claude Code의 대화형 사용(터미널, IDE, 데스크톱 또는 웹 애플리케이션), 요금제 한도를 넘는 추가 사용, Amazon Bedrock, Google Cloud Vertex AI 또는 Microsoft Foundry에서 제공하는 Claude 모델에는 적용되지 않으며, Claude, Claude Code, Cowork의 사용 한도도 바뀌지 않는다.

크레딧을 받으려면 대상 요금제를 최소 7일 동안 활성 상태로 구독한 뒤, claude.ai의 결제 설정에서 Claude Console 조직을 연결해야 한다. 결제 수단을 추가할 필요는 없다. 조직은 하나만 연결할 수 있으며, 연결된 조직은 지원팀만 변경할 수 있다. 크레딧은 결제 주기마다 갱신되고 이월되지 않으며, 구매한 크레딧보다 먼저 사용된다. 소진되면 다음 크레딧이 지급될 때까지 API 호출이 중단된다. 다만 조직이 크레딧을 구매했거나 자동 충전을 활성화한 경우에는 계속 사용할 수 있으며, Claude 구독에는 비용이 청구되지 않는다. Anthropic은 5월에 6월 15일부터 프로그래밍 방식의 사용을 위한 월간 크레딧을 제공한다고 발표한 바 있다. 도움말 페이지는 새 크레딧이 이 ‘Agent SDK 크레딧’과는 다르며, 해당 크레딧은 이용할 수 없다고 명시한다.

🔗 도움말 페이지: Max와 Team 요금제의 월간 API 크레딧 · @ClaudeDevs의 발표


Windows에서의 로컬 인공지능: NVIDIA, RTX Spark PC 사전 주문 개시 및 DGX Station for Windows 사전 공개

10월 7일 — NVIDIA와 Microsoft가 샌프란시스코에서 열린 Windows AI and Surface 행사에서 RTX Spark를 상용 출시한다. 이 행사에서는 젠슨 황과 사티아 나델라의 대담도 진행됐다. RTX Spark는 6월 2일 Build에서 발표된 Windows PC용 칩이다. 노트북 사전 주문은 10월 7일부터 시작됐으며, 10월 16일에 출시된다. 미니 PC는 11월에 뒤이어 출시된다. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI, Gigabyte가 제품을 준비하고 있으며, Microsoft는 이 칩을 탑재한 Surface Laptop Ultra를 선보인다. NVIDIA의 게시물에는 가격이 명시되지 않았다.

RTX Spark는 Blackwell RTX GPU와 Grace CPU를 600 Go/s로 연결하며, FP4 기준 인공지능 연산 성능은 1페타플롭이고 통합 메모리는 최대 128 Go다. NVIDIA는 서버와 동일한 CUDA 스택을 사용하면서, 데이터를 클라우드로 보내거나 사용량을 집계하지 않고 대형 모델을 로컬에서 실행할 수 있다는 점을 강조한다. 이 칩은 제작자를 위한 NVFP4, AV1 인코딩, 하드웨어 4:2:2 지원도 제공하며, 게이머는 DLSS 5 덕분에 1440p에서 초당 100프레임을 넘는 속도로 게임을 즐길 수 있다.

기업용으로는 NVIDIA가 DGX Station for Windows를 사전 공개한다. 이 제품 역시 6월 Build에서 발표됐으며, NVIDIA는 이를 Windows 생태계 최초의 데스크톱 인공지능 슈퍼컴퓨터로 소개한다. Windows를 벗어나지 않고도 매개변수가 약 1조 개인 모델을 로컬에서 실행할 수 있으며, Linux 도구는 WSL을 통해 계속 이용할 수 있다. 출시일과 가격은 공개되지 않았고, 알림을 받기 위한 등록만 제공된다. 한편 Microsoft는 Windows의 제어 아래에서 에이전트를 백그라운드로 실행하는 인프라인 Microsoft Execution Containers(MXC)를 정식 출시한다.

비교 항목RTX SparkDGX Station for Windows
칩Blackwell RTX GPU(최대 6 144코어) 및 Grace CPU(최대 20코어)GB300 Grace Blackwell Ultra Desktop 슈퍼칩
메모리최대 128 Go, 통합748 Go, 일관성 유지
FP4 인공지능 연산1페타플롭최대 20페타플롭
발표된 출시 일정노트북 사전 주문 진행, 10월 16일 출시; 미니 PC는 11월사전 공개, 출시일과 가격 미정

🔗 Windows 행사에 관한 NVIDIA 게시물


Windows에서 로컬 개발: Copilot의 MAI Code 1.1 Flash 라우팅 예고, 샌드박스 정식 출시, Replit의 데스크톱 애플리케이션 준비

10월 7일 — GitHub Copilot이 곧 개발자 컴퓨터에서 실행되는 모델과 클라우드 모델 중 하나를 스스로 선택할 수 있게 된다. Microsoft Command Line 블로그에 게시된 Microsoft와 GitHub의 글에 따르면 이 라우팅 기능은 ‘이달 말까지’ 도입될 예정이며, 아직 사용할 수 없다. GitHub는 이를 이미 여러 모델에 작업을 분배하는 오케스트레이터인 Project HydraFusion의 다음 단계로 소개한다. 인공지능 크레딧을 절약할 수 있다는 점도 강조하지만, 구체적인 절감량은 제시하지 않았다.

Copilot CLI, GitHub Copilot 앱, VS Code에서는 두 가지 사용 방식이 제공될 예정이다. Auto 모드는 작업 맥락과 캐시 상태에 따라 매 턴마다 로컬 추론과 클라우드 추론 중 하나를 선택한다. 개발자가 로컬 모델을 직접 지정할 수도 있다. Windows ML 공급자를 통한 MAI Code 1.1 Flash나, OpenAI API와 호환되는 로컬 접속 지점(endpoint)을 통해 제공되는 모든 모델이 대상이다. 게시물은 로컬 추론을 사용한다고 해서 세션이 오프라인으로 전환되는 것은 아니라고 다시 설명한다.

시연은 RTX Spark를 탑재한 Surface Laptop Ultra에서 진행된다. Microsoft AI는 이 기기에서 코드에 특화된 전문가 혼합(mixture-of-experts) 모델인 MAI Code 1.1 Flash의 로컬 버전을 실행한다. 총 매개변수는 1,370억 개이며, 그중 68억 개가 활성화된다. 가중치당 약 3.3비트로 양자화한 모델의 크기는 53 Go로 클라우드 버전보다 80 % 작으며, 문맥 길이가 256,000토큰일 때 최대 메모리 사용량은 75.5 Go다.

평가 벤치마크(Microsoft의 10월 5일 테스트)MAI Code 1.1 Flash기기에서 실행되는 양자화 버전GPT OSS 120B(Unsloth의 GGUF 버전)
SWE-Bench Verified(500개 작업)72,6 %70,80 %32,0 %
Terminal-Bench 2.1(89개 작업)62,9 %66,29 %23,6 %

Microsoft는 이 테스트가 Windows ARM64용 llama.cpp 런타임에서 실행됐으며, 결과는 기기와 구성에 따라 달라진다고 설명한다. 첫 구성 요소는 이미 터미널에서 사용할 수 있다. Copilot CLI 미리보기 버전 1.0.94-0부터 /model 명령이 로컬 Ollama 인스턴스의 모델을 탐색한다. 확인 없이 추가되는 항목은 없으며, Ollama와 모델이 이미 설치돼 있어야 한다. 도구 호출과 스트리밍(streaming)을 지원하는 모델만 제안된다.

🔗 Windows와 GitHub Copilot에 로컬 모델과 샌드박스 도구 도입 · GitHub Copilot CLI에서 로컬 모델 탐색

Copilot 로컬 샌드박스 정식 출시

10월 7일 — GitHub Copilot의 로컬 샌드박스가 6월 2일 시작한 공개 미리보기를 마치고 정식 출시된다. Copilot CLI, GitHub Copilot 앱, Agent Host를 사용하는 VS Code 세션에서 추가 비용 없이 이용할 수 있다. Copilot이 실행하는 도구와 명령은 개발자나 조직이 정한 정책에 따라 파일, 네트워크, Git 및 GitHub CLI 자격 증명, 그 밖의 시스템 기능에 대한 접근이 제한된 상태로 실행된다. 기업은 사용하는 모델과 관계없이 개발자가 완화할 수 없는 설정을 강제할 수 있다. 실행 엔진인 Microsoft eXecution Container(MXC)는 Windows 팀의 오픈 소스 라이브러리다. 가상 머신 없이 Windows에서는 ProcessContainer, macOS에서는 Seatbelt, Linux에서는 bubblewrap을 사용한다. 한계도 명시돼 있다. 내장 파일 도구는 시스템이 아니라 Copilot 자체가 통제하며, 원격 MCP 서버는 로컬 샌드박스 밖에 남는다.

🔗 GitHub Copilot의 로컬 샌드박스 정식 출시

Replit, Windows에서 애플리케이션 로컬 빌드 지원

10월 7일 — Replit이 Microsoft와 함께 Windows 사용자 컴퓨터에서 애플리케이션을 직접 빌드하고 실행하는 데스크톱 애플리케이션의 미리보기를 발표한다. Replit은 이미 데스크톱 애플리케이션을 제공하고 있었다. 새로운 점은 로컬 빌드에 있다. 각 빌드는 Microsoft Execution Containers와 NVIDIA의 오픈 소스 런타임인 OpenShell을 기반으로 하는 자체 샌드박스에서 실행된다. 조기 이용은 대기 명단을 통해 신청하며, 일정과 가격은 공개되지 않았고 macOS 버전도 언급되지 않았다. Replit은 10월 7일 Windows 행사 무대에서 이 미리보기를 선보였다.

🔗 X에서의 Replit 발표 · 미리보기 대기 명단


OpenAI, 내부 모델이 산출한 수학 연구 결과 원고 722편 공개

10월 6일 — OpenAI가 공개적으로 제공되지 않는 최첨단 내부 모델이 산출한 대규모 수학 연구 결과를 한꺼번에 공개한다. 10월 6일 저녁에 발표된 GitHub 저장소 openai/math에는 분야별로 분류된 372개 결과군에 속하는 원고 722편이 담겼다. 하나의 주요 결과에 보충 논증, 따름결과, 대안적 증명이 함께 포함될 수 있다.

대부분의 결과는 동일한 절차로 산출됐다. 모델에 약 4,000개의 문제를 제시했으며, 결과 하나당 평균적으로 ChatGPT Pro의 추론 시간 약 3시간에 해당하는 연산이 사용됐다. OpenAI는 기존 수학 평가에서 성능이 포화 상태에 도달한 뒤, 평가 범위를 미해결 연구 문제로 넓혔다고 설명한다. 두 연구는 이 절차의 예외다. 하나는 리만 제타 함수의 영점이 없는 영역에 관한 연구로, 가독성을 위해 사람이 원고를 다듬었다. 다른 하나는 호지 추측의 특수한 경우인 CM 아벨 다양체에 대한 증명이다.

OpenAI가 공개한 지표발표된 값
공개된 원고722
결과군372
모델에 제시한 문제약 4 000
결과당 평균 연산ChatGPT Pro 추론 시간 약 3시간
공개된 추론 요약10

모든 결과가 같은 방식으로 검증된 것은 아니다. 많은 증명이 컴퓨터로 증명을 검증할 수 있는 언어인 Lean으로 형식화됐지만, 전부는 아니다. OpenAI는 ‘형식화되지 않은 일부 결과에는 오류가 있을 수 있다’고 경고하며, 오류를 신속히 수정하고 새로운 형식화를 지속적으로 추가하겠다고 약속한다. 모델의 추론 요약 10편은 π의 무리수 지수, 말러 추측들, 표수 2에서의 카플란스키 직접 유한성 추측, 자유군 인자의 동형성 같은 주제를 다룬다.

공개 절차 자체는 Institute for Advanced Study의 독립 수학·인공지능 자문단과 함께 준비했다. 검토와 인용 절차를 마련하고, 수정 사항은 새 버전으로 공개하며, 이력은 보존한다. OpenAI는 이 결과들을 다루는 워크숍, 학술회의, 프로그램에도 자금을 지원하겠다고 발표했다. 또한 과학자들이 결과를 산출한 모델에 ‘책임 있게’ 접근할 수 있도록 준비하고 있다고 밝혔지만, 일정은 제시하지 않았다.

We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.

🇰🇷 우리는 최첨단 내부 모델이 산출한 다양한 새로운 수학 연구 결과를 공개합니다. Institute for Advanced Study의 독립 수학·인공지능 자문단과 협의했으며, 이 결과들을 어떻게 공개할지 결정하는 과정에서 자문단의 조언과 공개 권고를 참고했습니다. — X의 @OpenAI

🔗 수학 분야 인공지능의 진전 공유 · GitHub의 openai/math 저장소


Perplexity, 텍스트와 이미지를 위한 다중 벡터 임베딩 pplx-embed-v2-late 공개

10월 7일 — Perplexity Research가 0.6B와 9B 매개변수의 지연 상호작용(late interaction) 임베딩 모델 두 개인 pplx-embed-v2-late를 공개했다. Hugging Face에서 MIT 라이선스로 제공된다. 밀집 임베딩이 각 문서를 하나의 벡터로 압축하는 반면, 이 ColBERT 방식 모델들은 토큰마다 128차원 벡터를 유지하고 MaxSim으로 각 질의-문서 쌍에 점수를 매긴다. 질의의 각 토큰을 문서에서 가장 가까운 토큰과 비교하는 방식이다. OCR을 거치지 않고 텍스트, 이미지, 렌더링된 페이지(PDF, 슬라이드, 스캔본)를 검색하므로 표, 그림, 페이지 배치가 보존된다.

두 크기의 모델은 27B 기반 모델에서 만든 내부 18B 교사 모델로부터 토큰 단위로 증류됐기 때문에 같은 임베딩 공간을 공유한다. 따라서 9B로 색인한 문서 집합을 0.6B로 인코딩한 질의로 검색할 수 있다. ViDoRe v3 이미지 평가에서 이 구성은 질의 비용을 추가로 늘리지 않으면서 63,5 %를 기록해, 양쪽에 모두 0.6B를 썼을 때의 62,3 %를 웃돈다. Qwen3.5-0.8B를 가지치기한 0.6B는 이처럼 기기에서도 사용할 수 있는 가벼운 질의 인코더 역할을 한다.

평가 벤치마크(Perplexity 측정값)9B 점수0.6B 점수비교 기준
72개 전문 작업(nDCG@10)81,3 %78,0 %9B가 차순위 모델보다 1,6점 높음
Q2D-Web, 웹 검색(Recall@1000)74,8 %73,6 %nemotron-embed-8b : 69,3 %
ViDoRe v3 이미지 평가(nDCG@10)65,2 %62,3 %EVIE만 9B를 앞섬
BrowseComp+(GPT-OSS-120B 에이전트)64,0 %—그다음으로 성능이 좋은 ColBERT: 4,9점 낮음
MADQA(Gemini 3.5 Flash 에이전트)92,4 %90,1 %Mixedbread Agentic Search : 93,4 %

9B가 모든 평가에서 이기는 것은 아니며, Perplexity도 이를 명시한다. Tencent의 EVIE는 ViDoRe v3 이미지 평가에서, gemini-embedding-2는 MIRACL-Vision과 내부 벤치마크 PPLX-Q2I에서 9B를 앞선다. Mixedbread Agentic Search는 MADQA에서 더 높은 점수를 기록하지만, Perplexity는 그 차이가 자사의 신뢰 구간 안에 있다고 본다. 개발사는 문서 길이가 늘수록 저장 공간과 점수 계산 비용도 증가한다는 점을 인정한다. 기술 보고서는 “올해 중” 공개될 예정이며, Perplexity는 지연 상호작용 임베딩, 밀집 임베딩, 문맥 임베딩을 자사 API 플랫폼에서 점진적으로 제공할 계획이지만 날짜는 정하지 않았다.

🔗 Perplexity Research 게시글 · Hugging Face의 pplx-embed-v2-late-9b


코딩 에이전트: Claude Code 2.1.293, Codex CLI 0.161.0, iOS용 Cursor, Antigravity 2.21.0 및 Warp Factories

다섯 코딩 에이전트 도구가 업데이트됐다. Claude Code는 Haiku 5.5를 채택하고, Codex CLI는 터미널에서 MCP 서버에 연결하며, Cursor는 iPhone에서 제어할 수 있게 됐다. Antigravity는 에이전트의 작업을 묶어서 보여주고, Warp는 Microsoft 도구 지원을 확대한다.

Claude Code 2.1.293, Haiku 5.5를 기본 모델로 설정

10월 7일 — Haiku 5.5 발표 몇 분 뒤에 공개된 Claude Code 2.1.293은 Anthropic API에서 Haiku 5.5를 기본 Haiku 모델로 지정했다. 사용자 정의 하위 에이전트를 구분하기 위해 subagentStatusLine의 페이로드에 agentType 필드를 추가하고, 모드가 선언한 도구의 스키마를 처음부터 노출하는 isDeferred 옵션을 추가했다. 변경의 핵심은 56개 항목 가운데 38개를 차지하는 수정 사항이다. Claude가 문맥 압축 전에 마지막으로 수행한 작업을 압축 이후의 작업으로 잘못 인식해 완료된 작업을 되돌리거나 재수행하던 문제가 수정됐다. 경로별 규칙과 중첩된 CLAUDE.md도 Claude가 Bash에서 cat 또는 grep으로 파일을 읽을 때 로드되며, MCP HTTP 연결의 메모리 누수도 해결됐다. 최근 변경 사항 두 가지(2.1.281의 자동 모드 거부 메시지와 2.1.290의 클라우드 세션 수정 사항)가 되돌려졌고, Claude Tag의 채널 규칙 한도는 20개에서 50개로 늘었다.

🔗 GitHub의 Claude Code 2.1.293

Codex CLI 0.161.0, Daybreak를 옵션으로 활성화하도록 변경

10월 7일 — Codex CLI 0.161.0은 10월 5일의 0.160.1 이후 첫 안정 버전이다. /mcp login <name> 명령으로 현재 터미널 세션을 벗어나지 않고 MCP 서버에 연결할 수 있으며, 음성 대화에는 마이크, 스피커, 입력 채널 선택 기능이 추가됐다. OpenAI의 사이버 보안 제품군 Daybreak는 옵션을 활성화해야 사용할 수 있게 됐다. 사용자가 --enable cli_daybreak(또는 features.cli_daybreak=true)로 활성화하기 전까지 /daybreak 전환 옵션과 상태 표시줄의 Daybreak 상태가 숨겨지며, 활성화하지 않으면 자동 Cyber 라우팅도 생략된다. 한 턴에 한해 codex exec --cyber-access-program으로 Cyber 접근 프로그램을 선택할 수 있다. Amazon Bedrock에서는 지원되는 모델에 다중 에이전트 V2와 Ultra 추론 강도가 추가되며, Bedrock Mantle은 AWS GovCloud 리전을 지원한다. 권한, 대화 재개, 손상된 SQLite 데이터베이스 탐지 관련 문제도 수정됐다.

🔗 GitHub의 Codex CLI 0.161.0

Cursor, iOS에서 컴퓨터의 에이전트 제어

10월 6일 — Cursor의 iOS 앱에 이제 컴퓨터에서 로컬로 실행 중인 에이전트가 표시된다. 각 에이전트가 무엇을 하는지 확인하고 답변할 수 있으며, 발표 트윗에는 새 작업을 시작하는 기능도 언급됐다. 에이전트는 컴퓨터에서 계속 실행되고 앱이 컴퓨터에 연결하는 방식이므로, 컴퓨터가 켜져 있고 온라인 상태여야 한다. ‘이 컴퓨터를 깨어 있는 상태로 유지’ 설정은 컴퓨터가 전원에 연결돼 있고 화면이 열린 상태에서 절전 모드로 전환되지 않도록 한다. 이 기능은 기본적으로 활성화되지만, Enterprise 조직에서는 관리자가 활성화해야 한다. 연결 승인은 데스크톱 앱에서 이루어지며, 클라우드 에이전트는 필요하지 않다. 6월 말 출시된 iOS 앱은 클라우드 에이전트를 앞세웠지만, 이제는 휴대전화에서 로컬 에이전트에도 접근할 수 있게 됐다.

🔗 Cursor 변경 기록

Antigravity 2.21.0, 에이전트의 작업을 묶어서 표시

10월 6일 — Google의 Antigravity 앱이 9개 개선 사항과 14개 수정 사항을 포함한 2.21.0으로 업데이트됐다. 고급 검색에서는 ⌘+K(Windows에서는 Ctrl+K)로 대화 내용을 검색해 해당 대화를 찾을 수 있다. 작업 예약(예약된 작업) 탭은 자동화로 바뀌었다. 여기에서 ‘지금 실행’으로 자동화를 즉시 시작하거나, ‘프롬프트로 만들기’로 에이전트에게 새 자동화 생성을 안내해 달라고 요청할 수 있다. 에이전트가 두 응답 사이에 수행하는 파일 수정, 터미널 명령, 읽기 작업은 이제 짧은 요약과 함께 하나의 접을 수 있는 줄로 묶인다. 수정 사항에는 에이전트가 잘린 MP4 또는 MOV 영상을 읽으면 이후 대화 전체가 실패할 수 있었던 문제와, Windows 메모장이나 PowerShell로 저장한 설정 파일이 작동하지 않던 문제가 포함됐다. 변경 기록에서는 새 버전이 모든 사용자에게 배포되기까지 며칠 걸릴 수 있다고 안내한다.

🔗 Antigravity 변경 기록

Warp Factories, Microsoft Teams와 Azure DevOps 지원 확대

10월 7일 — Warp가 소프트웨어 공장(소프트웨어 팩토리) 플랫폼 Warp Factories의 지원 범위를 Microsoft Teams와 Azure DevOps Services로 확대했다. Teams에서 설정된 채널이나 대화 스레드에서 Warp 앱을 태그하면, 대화 맥락과 함께 작업이 팩토리에 전달된다. 팩토리는 같은 스레드에서 진행 상황을 알리고 검토할 풀 리퀘스트도 그곳으로 보낸다. Azure DevOps에서는 작업 항목(워크 아이템)이나 풀 리퀘스트에서 팩토리를 태그하거나, 해당 항목의 이벤트로 실행을 시작할 수 있다. 각 팩토리에는 Git 작업용 자체 식별 정보가 부여되며, 접근 권한은 선택한 저장소로 제한된다. 두 연동 기능은 모든 Warp Factories 고객에게 제공된다. Warp는 두 도구를 모두 기본적으로 지원하는 것이 업계 최초라고 소개했다. Devin은 이미 Teams 및 Azure DevOps Server와 연동되고 있었다.

🔗 Warp 게시글


API와 플랫폼: Claude SDK의 computer use 및 browser use 도구 모음, Microsoft Foundry의 Grok 4.7

호스팅된 모델을 기반으로 개발하는 개발자를 위한 두 가지 발표다. Anthropic은 컴퓨터나 브라우저 제어를 간소화하고, Microsoft에서는 Grok 4.7이 정식 제공된다.

Claude SDK의 computer use 및 browser use 도구 모음

10월 7일 — Claude의 Python 및 TypeScript SDK에 computer use와 browser use 도구 모음(도구 세트)이 베타로 추가됐다. 지금까지 API는 Claude가 무엇을 클릭하거나 입력하려는지 알려줬고, 각 동작을 명령으로 바꾸는 반복 처리 루프는 직접 작성해야 했다. 이제 SDK가 이 루프를 처리한다. 개발자가 BetaAbstractBrowserToolset20260801 또는 BetaAbstractComputerToolset20260801을 상속해 동작마다 메서드를 작성하면, SDK가 호출을 전달하고 제공된 URL 및 파일 정책을 적용하며, 승인을 요청하고 모델에 반환할 결과를 구성한다. Anthropic은 바로 사용할 수 있는 브라우저나 드라이버를 제공하지 않는다. 자체 자동화 도구나 Browser Use, Browserbase, E2B, Daytona의 드라이버를 연결해야 하며, Chrome DevTools Protocol을 사용하는 최소 예제가 claude-quickstarts 저장소에 공개됐다. JavaScript 실행과 파일 전송은 기본적으로 비활성화되며, URL 정책이 없으면 어떤 주소도 검증하지 않는다.

🔗 X의 @ClaudeDevs 스레드 · SDK 도구 모음 문서

Microsoft Foundry에서 Grok 4.7 정식 제공

10월 7일 — 9월 21일 출시된 SpaceXAI의 모델 Grok 4.7이 Microsoft Foundry에서 제공된다고 @SpaceXAI가 밤사이 발표했다. Microsoft 문서는 이를 Azure가 직접 판매하는 모델 중 하나로 분류하고 정식 제공 상태로 표시한다. 텍스트와 이미지 입력, 입력과 출력을 합쳐 500 000토큰의 문맥, 도구 호출, Chat Completions 또는 Responses API를 통한 접근을 지원하며, 추론 강도는 low부터 xhigh까지 설정할 수 있고 기본값은 high다. Microsoft는 Grok 4.7부터 시작해 Grok 모델을 최소 6개월 동안 정식 제공하겠다고 약속했다. Grok 4.6은 여전히 미리보기로 표시된다. 10월 7일 저녁까지 Azure 요금 페이지에는 Grok 4.7이 아직 나열되지 않았다. Amazon Bedrock(9월 28일)과 미리보기 상태의 Google Cloud(10월 1일)에 이어, Grok 4.7은 이로써 3대 클라우드 공급자 모두에서 제공된다.

🔗 Microsoft Foundry에서 Grok 모델 배포 및 사용


공개 모델: Liquid AI의 Open d1, Nature에 실린 Ai2의 Bolmo와 Bwen 8B 및 Blama 8B

가중치가 공개된 두 가지 발표로, 하나는 네트워크 가장자리에서 빠르게 결정을 내리기 위한 것이고, 다른 하나는 텍스트를 바이트 단위로 읽기 위한 것이다.

Open d1, Liquid AI의 공개 의사결정 모델

10월 7일 — Liquid AI가 Open d1으로 자사 의사결정 모델 계열을 공개했다. 가중치가 공개된 모델은 d1-3B(텍스트와 이미지)와 d1-omni-600M(텍스트와 이미지 또는 오디오) 두 가지이며, 후자는 초기 연구 버전이다. 이 모델들은 텍스트를 생성하지 않고, 한 번의 처리로 허용된 각 응답에 확률을 부여한다. Liquid AI에 따르면 d1-3B는 Decision Index 0.2.1에서 48,57을 기록해 Decider 35B-A3B(47,11)를 앞서며 매개변수 100억 개 미만 모델 중 최고 점수를 얻었다. 공개 데이터셋 7개에서는 평균 82,9를 기록했다. NVIDIA와 함께 측정한 질문 하나의 지연 시간은 RTX 4090에서 8 ms, Jetson Orin Nano에서 50 ms로, 네트워크 가장자리(에지)에서의 사용을 겨냥할 수 있는 수준이다. 비전이나 오디오 벤치마크는 공개되지 않았다. 가중치는 Liquid AI의 자체 라이선스(lfm1.0)로 Hugging Face에서 제공되며, GGUF 버전도 있다. 9월 29일의 d1은 API로만 접근할 수 있었다.

🔗 Hugging Face의 Liquid AI 게시글

Nature에 실린 Ai2의 Bolmo, Bwen 8B 및 Blama 8B

10월 7일 — Ai2가 10월 7일 온라인으로 공개된 Nature 논문에서 Bolmo의 기반 방법을 발표했다. Bolmo는 서브워드 대신 바이트를 직접 읽는 완전 공개 모델 계열이다. 바이트를 읽으면 고정된 어휘의 사각지대(철자, 특이한 문자열, 일부 문자 체계)를 피할 수 있지만, 지금까지는 처음부터 전체 모델을 학습해야 했다. 반대로 바이트 변환(바이트화)은 성능이 이미 좋은 서브워드 모델에서 시작해 짧은 추가 학습으로 이를 변환한다. Olmo에서 파생된 Bolmo 1B와 7B는 12월에 공개됐다. Ai2는 저장소가 8월 26일부터 존재하는 Bwen 8B(Qwen 3 8B에서 파생, Apache-2.0 라이선스)와 Blama 8B(Llama 3 8B에서 파생, llama3 라이선스)도 소개했으며, 새로운 바이트 계층만 학습한 “Stage 1” 체크포인트도 함께 제시했다. Ai2에 따르면 두 모델은 원본 모델에 가까운 성능을 보이며 Bwen 8B는 Bolmo 7B를 앞서지만, 수치는 공개되지 않았다.

🔗 Ai2 게시글


이미지, 영상, 음성을 확인할 수 있도록 SynthID Detector 전면 공개

10월 7일 — Google이 인공지능 생성 콘텐츠에서 눈에 보이지 않는 SynthID 워터마크를 찾아내는 도구인 SynthID Detector를 누구나 사용할 수 있도록 공개했다. 지난해 미디어 전문가용 초기 버전으로 소개된 이 도구는 synthid.com에서 전 세계에 영어로 제공된다. 이미지, 영상, 오디오 파일을 업로드해 확인할 수 있다. Google과 파트너사 OpenAI, NVIDIA, Kakao의 콘텐츠를 확인할 수 있으며, 곧 Apple도 포함될 예정이다. 포털은 범용 인공지능 탐지기가 아니라고 안내한다. SynthID를 사용하지 않는 모델의 콘텐츠나 크게 수정된 콘텐츠는 “탐지되지 않음”으로 나올 수 있다. Google은 2023년 이후 이미지와 영상 1800억 개 이상, 오디오 240 000년 분량에 워터마크를 삽입했다고 밝혔다. 이는 7월에 발표한 1000억 개와 60 000년 분량보다 늘어난 수치다. 또한 Search, Gemini 앱, Chrome에서 하루 100만 건이 넘는 확인 작업이 이루어진다고 밝혔다.

🔗 Google, 인공지능 콘텐츠용 SynthID Detector 확대


보안: 유출된 비밀 정보를 위한 GitHub 분류기

10월 7일 — GitHub가 Microsoft Applied Sciences와 함께 만든, 유출된 비밀 정보 탐지용으로 미세 조정한 ModernBERT 분류기를 도입했다. 이 모델은 값 주변의 코드를 읽어 인증 정보일 가능성이 큰 값을 찾아내며, 식별할 수 있는 형식이 없는 비밀번호도 탐지한다. 후보 묶음을 2 ms 미만에 평가하며, GitHub에 따르면 푸시 단계에서 차단하는 비밀 정보를 “두 배 넘게” 늘릴 수 있다. 지금부터 인공지능 기반 비밀번호 탐지 알림에는 추가 비용 없이 이 모델이 적용된다. 비공개 미리보기 상태인 인공지능 기반 푸시 보호는 대상 조직에 “이달 중” 제공될 예정이며, Copilot의 /security-review 명령 검사도 “곧” 비공개 미리보기로 제공된다. 두 기능 모두 인공지능 크레딧을 사용한다. GitHub의 보안 제품 담당자 에린 헤이븐스가 쓴 글은 풀 리퀘스트 세 건 중 한 건에 인공지능 에이전트가 관여하고, 푸시 보호는 새로 탐지된 비밀 정보의 약 30 %만 차단한다는 점을 상기시킨다.

🔗 소프트웨어 규모에 맞춰 비밀 정보 보호도 확장해야 한다


인프라: GitHub, 에이전트 활동에 맞춰 Git 재구축

10월 6일 — GitHub가 에이전트 기반 개발의 속도를 따라잡기 위해 Git 인프라를 재구축하고 있다. 브라이언 셀렌자의 엔지니어링 게시글에 따르면, 전체 Git 활동은 2025년 9월부터 2026년 8월 사이 월 2,182억 건에서 4,733억 건으로 늘었다. 개발자와 에이전트는 2026년 9월에 73억 8,000만 건의 커밋을 생성했으며, 이는 1년 전의 5배 이상이다. 푸시 횟수도 4.9배로 늘었다. 현재 아키텍처인 Spokes는 각 저장소를 여러 서버에 복제하고 과반수 투표로 각 업데이트를 승인한다. 따라서 읽기용 복제본을 추가하면 쓰기 속도가 느려진다. 새로운 아키텍처는 저장과 연산을 분리하고, 기준 데이터는 Azure Blob Storage에 보관하며 경량 프로세스(workers)가 캐시에서 읽기 요청을 처리한다. GitHub의 내부 벤치마크에서는 쓰기 처리량이 최대 35배로 증가했지만, 전환 일정은 공개되지 않았다.

🔗 에이전트 규모의 개발을 위한 Git 인프라 구축


음성 AI: ElevenLabs, 인도의 한 주 정부와 양해각서 체결

10월 7일 — ElevenLabs는 벵갈루루에서 열린 자사 Summit 행사에서 음성 AI 시범 사업을 위해 인도의 한 주 정부와 첫 양해각서(MOU)를 체결했다. 회사는 해당 주의 이름을 밝히지 않았으며 일정, 범위, 금액도 공개하지 않았다. 발표는 블로그 게시글 없이 트윗 하나로 이루어졌다. 함께 공개된 수치는 이 사업의 의미를 보여준다. 지난 1년간 ElevenAgents는 인도에서 1억 건 이상의 대화를 진행했으며, 그중 70% 이상이 힌디어, 칸나다어, 타밀어, 텔루구어로 이루어졌다. Summit에는 기업 경영진, 개발자, 파트너 등 500명 이상이 참석했다.

🔗 X의 @ElevenLabs 발표


연구: PivotOPD, 에이전트의 결정적 오류를 만회하는 NVIDIA의 방법

10월 7일 — NVIDIA 연구진이 여러 차례의 행동을 연속으로 수행하는 에이전트를 위한 학습 방법인 PivotOPD를 공개했다. 연구진에 따르면 ALFWorld에서 Qwen3 모델 세 개가 실패한 사례의 59%에는 초기에 발생한 뒤 에이전트가 잘못된 방향으로 계속 진행하게 만드는 ‘전환점 오류’가 포함되어 있다. PivotOPD는 온폴리시 증류(on-policy distillation)를 확장한다. 전환점 오류가 발생할 때마다 교사 모델이 올바른 행동과 이후 단계에서 만회할 행동을 제시해, 학생 모델이 오류를 피하는 법과 오류에서 회복하는 법을 모두 학습하게 한다. Qwen3 1.7B와 8B를 학생 모델로 사용했을 때, 13개 비교 방법보다 ALFWorld, WebShop, Search-based QA의 평균 성적이 가장 높았다. 다시 실행한 전환점 오류 72건 중 72.7%를 만회했으며, 표준 증류의 만회율은 20.3%였다. 성능 향상은 코딩에도 이어졌다. Nemotron-3.5 학생 모델의 SWE-Bench Verified 성적은 62.8%에서 66.0%로 올랐다. 논문은 arXiv에 공개되었으며, 코드는 곧 공개될 예정이다.

🔗 PivotOPD 프로젝트 페이지


최적화: mPDLP, cuOpt에서 초대형 선형 계획 문제를 여러 GPU에 분산

10월 7일 — NVIDIA가 오픈 소스 최적화 라이브러리 cuOpt에 mPDLP를 추가했다. mPDLP는 공급망이나 전력망 같은 대규모 계획 문제를 위해 NVLink로 연결된 여러 GPU에 작업을 분산하는 선형 계획법 솔버다. 서로 의존하는 변수와 제약 조건을 같은 GPU에 모아 통신을 줄이고, GPU당 최대 메모리 사용량을 최대 6분의 1로 낮춘다. DGX B200 노드에서는 PDLP 연산이 최대 11.4배, 전체 처리가 최대 4.2배 빨라졌다. D-PDLP와 비교하면 대부분의 대규모 문제에서 1.2~2.5배 빠르지만, 가장 큰 세 가지 문제 사례와 소규모 문제에서는 더 느리다. Kinaxis는 H100 여덟 개로 변수가 1억 3,500만 개 이상인 공급망 문제를 3.3배 빠르게 해결했으며, PSR은 B200 여덟 개로 변수가 1억 8,500만 개인 에너지 모델을 5배 이상 빠르게 해결했다.

🔗 NVIDIA의 mPDLP 게시글


로봇공학: 로봇이 GB300 테스트 트레이를 조립

10월 7일 — NVIDIA의 시애틀 로봇공학 연구소가 출하 전에 모듈을 검사하는 GB300 테스트 트레이의 조립을 로봇에 가르치는 과정을 소개했다. 이 시스템을 제조하는 Foxconn과 함께 두 가지 동작을 선정했다. 버스바를 놓고 16곳에 나사를 조이는 작업과 유연한 케이블에 달린 커넥터 네 개를 연결하는 작업이다. Foxconn과 정한 요구 조건은 충돌 없이 99.5%의 성공률을 달성하면서 작업 시간이 숙련된 작업자의 두 배를 넘지 않는 것이다. 로봇은 이 기준에 가까워졌지만 아직 달성하지는 못했다. 버스바 작업은 목표 시간 124초보다 긴 160초에 95% 이상의 성공률을 기록했으며, 커넥터 작업은 케이블당 40초에 90~95%의 성공률을 기록했다. 연구팀은 기존의 인식 및 제어 체계, DOPER 자세 추정, Isaac Lab에서의 강화 학습을 결합하고 실제 로봇에서 이를 보정한다. NVIDIA는 DOPER와 오케스트레이터 TALOS를 공개하겠다고 밝혔지만, 날짜는 제시하지 않았다.

🔗 GB300 트레이에 관한 NVIDIA 기술 블로그 게시글


단신

  • ChatGPT iOS 앱 1.2026.272 — 답변에 페이지 미리보기를 바로 표시하고, Codex 작업 링크를 앱에서 열며, Codex Mobile에서는 승인 선택기를 개편하고 긴 대화의 스트리밍 속도를 높였다. 🔗 출처
  • Radisson Hotel Group — OpenAI의 사례 연구에 따르면, Accenture Song과 함께 6주 만에 만든 ChatGPT 플러그인은 2026년 7~8월 자연 검색보다 약 1.5배 높은 전환율을 기록했다. 또한 ChatGPT 광고 캠페인에서 발생한 결제 및 예약 이벤트의 54%는 단순 광고 노출에 귀속된다. 🔗 출처
  • Jump Trading — 이 퀀트 트레이딩 회사는 여러 데이터 출처를 종합하며 며칠간 실행될 수 있는 분석을 GPT-6 Astra 에이전트에 맡기고, 마지막에는 사람이 검토한다. OpenAI의 사례 연구는 개선 효과에 관한 수치를 공개하지 않았다. 🔗 출처
  • ChatGPT 플러그인 확장 기능 — OpenAI Developers는 동영상 튜토리얼의 게시물에서 tldraw와 MagicPath 외에도 Adobe, Canva, Figma, Shopify, Instacart, Atlassian을 이 기능의 사용 기업으로 소개했다. 9월 29일 공개된 이 확장 기능은 사이드바에서 플러그인을 실행하고, @ 멘션을 처리하며, 파일 뷰어를 추가한다. 🔗 출처
  • Every와 Claude Managed Agents — Every 팀은 Claude Managed Agents를 기반으로 모든 팀원이 Slack에서 사용하면서 새 모델이 나올 때마다 자신의 스킬을 전달할 수 있는 기업용 에이전트를 만들었고, 이후 구독자에게도 공개했다. Anthropic은 수치 없이 동영상 인터뷰를 공유했다. 🔗 출처
  • Zed 1.23과 미리보기 버전 1.24.1 — JSONL 및 NDJSON 파일 미리보기를 제공하는 1.23이 정식 버전으로 전환되었다. 미리보기 버전 1.24.1에서는 터미널 탭을 Agent Panel로 끌어다 놓을 수 있고, 도구·이미지·추론을 지원하는 사용자 지정 Amazon Bedrock 모델을 사용할 수 있으며, Git 태그를 생성할 수 있다. Linux 실행 파일의 크기도 약 23% 줄었다. 🔗 출처
  • Amp의 메타 에이전트 Puck — 이제 여러 개의 독립된 대화를 지원한다. + 버튼으로 새 대화를 열고, 대화 이름을 클릭해 다른 대화로 전환할 수 있으며, 3일간 활동이 없었던 대화는 따로 보관된다. 🔗 출처
  • Copilot CLI 1.0.93 — 정식 버전으로 전환되었으며, 세션을 재시작하지 않고도 대화 턴 사이에 MCP 서버 설정 변경을 적용한다. /sandbox와 —sandbox를 통한 명령어 샌드박스도 모든 사용자에게 제공된다. Copilot SDK 1.0.17 역시 정식 버전으로 전환되었다. 🔗 출처
  • Copilot 사용 지표 — 여러 IDE가 Copilot SDK를 통해 세션을 처리하기 시작한 이후 에이전트 활동이 실제보다 적게 집계되고 있었다. 수정 사항을 적용하려면 업데이트가 필요하다. VS Code 1.139.0은 지금부터, Visual Studio 18.12는 10월, JetBrains는 10월 말, Eclipse와 Xcode는 11월까지 업데이트가 제공된다. 손실된 데이터는 복구되지 않는다. 🔗 출처
  • Gemini CLI v0.65.0-nightly.20261007 — 이 야간 빌드는 데이터 손실 문제 두 가지를 포함한 다섯 가지 수정으로 0.65.0 시리즈를 시작한다. 이전에는 신뢰할 수 없는 폴더에서 gemini mcp add가 .gemini/settings.json를 비울 수 있었으나, 이제 해당 폴더에서는 프로젝트 설정이 읽기 전용으로 처리된다. 또한 재개한 세션에서 곧바로 나가도 기록이 삭제되지 않는다. 🔗 출처
  • Transformers.js 4.3.1 — EmbeddingGemma 2 출시 다음 날, 이 라이브러리는 해당 모델의 멀티모달 임베딩(매개변수 7억 4,000만 개, 768차원)을 WebGPU나 WASM을 통해 브라우저에서 직접 계산하거나 Node.js에서 계산할 수 있게 되었다. 🔗 출처
  • RL Environment Explorer — Hugging Face의 아디티야 S K가 Hub의 강화 학습 환경(OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym)을 탐색하고 시각화하며 실행할 수 있는 FineEnvs의 Space를 소개했다. 작업 항목은 1,200만 개 이상이며, 대부분은 몇몇 대규모 OpenEnv 환경에서 나왔다. 🔗 출처
  • Seb-9B — 스타스 베레텐니코프가 텍스트, JSON 또는 이미지를 입력받고 최대 20개 선택지를 처리하는 이 로컬 의사결정 모델을 Apache-2.0 라이선스로 공개했다. 17개 공개 평가 모음에서 평균 0.792를 기록했으며, Jev 1.13은 0.786을 기록했다. 모든 측정은 개발자 본인이 수행했으며, 학습 데이터에는 평가에 사용한 벤치마크 하나의 학습 부분이 포함되었지만 테스트 사례는 포함되지 않았다고 밝혔다. 🔗 출처
  • 2026년 올림피아드의 Nemotron — NVIDIA가 비공식 참가로 IOI 2026에서 600점 만점에 535.4점, IMO 2026에서 42점 만점에 30점을 얻은 공통 학습 방식을 설명했다. 지도 미세 조정, 강화 학습, 생성·검증·수정을 반복하는 루프를 사용했으며, IMO의 금메달 기준은 29점이었다. 또한 200개 문제로 구성된 Nemotron-IMO-Bench를 공개했다. 🔗 출처
  • Instadocs: AI Gone Wild — Netflix는 Hugging Face가 7월에 당한 사이버 공격을 재구성한 이 다큐멘터리를 10월 12일 공개한다고 발표했다. Netflix에 따르면 이 공격은 OpenAI 연구진이 만든 자율 에이전트가 수행했다. 🔗 출처
  • ChatGPT 앱 디렉터리의 Runway — 플러그인을 설치하고 Runway 계정을 연결한 뒤 대화에서 @Runway를 멘션하면 이미지나 동영상 생성을 맡길 수 있다. Runway는 요금이나 크레딧 비용을 밝히지 않았다. 🔗 출처
  • Luma의 Face Swap — 기존 장면 속 인물의 얼굴을 바꿔 처음부터 다시 만들지 않고도 수정 작업을 반복할 수 있는 기능이다. 발표는 트윗 두 개로 이루어졌으며, 제품 페이지, 요금, 모델에 관한 자세한 정보는 없다. 🔗 출처
  • DSX Air — NVIDIA는 이 디지털 트윈에서 AI 공장의 변경 사항을 시험하는 방법을 소개했다. 에이전트가 변경을 적용하고 설정, 보안, 격리를 확인한 뒤 보고서를 작성하며, 실제 운영 환경에 적용하려면 여전히 사람의 승인이 필요하다. 수치 없이 방법을 설명하는 게시글이다. 🔗 출처
  • cuPhoton — NVIDIA의 튜토리얼은 FITS 파일 읽기부터 후보 검토까지, GPU 기반 천문 이미지 분석에 이 오픈 소스 도구 모음을 적용한다. 최대 14,900배라는 성능 향상 수치는 특정 연산에 해당하며, 전체 처리 과정에 대한 수치는 아니다. 🔗 출처
  • Cosmos와 SynthID — build.nvidia.com에서 NVIDIA Cosmos 모델로 생성한 콘텐츠에는 SynthID 워터마크가 포함되며, 이제 누구나 Google이 공개한 탐지기로 이를 확인할 수 있다. 🔗 출처
  • SpaceXAI TypeScript SDK 0.2.3 — priority와 서로 바꿔 사용할 수 있는 서비스 등급 fast와 식별자 grok-imagine-video-1.5-lite를 추가했다. 후자는 릴리스 노트에 없는 경량 동영상 모델이다. 모델 페이지의 데이터에 따르면 오디오 입력을 지원하지 않으며, 480p에서 초당 비용은 grok-imagine-video-1.5의 4분의 1이다. 🔗 출처
  • RAG와 LLM 비교 안내서 — Perplexity는 RAG와 LLM을 상호 보완적인 기술로 설명하고, RAG를 기본형·모듈형·고급형의 세 유형으로 구분하며, LLM만으로 충분한 경우를 설명하는 교육용 안내서를 공개했다. 새로운 기능이나 수치는 없다. 🔗 출처

이것이 의미하는 것

소형 모델이 대중적인 제품으로 자리 잡고 있다. 10월 8일부터 ChatGPT 무료 사용자의 질문에는 GPT-6 Luna가 답한다. Anthropic은 프롬프트가 100,000토큰 미만일 때 Haiku 5.5의 입력 가격을 100만 토큰당 0.10달러로 책정하고, Sonnet 5.5의 캐시 읽기 가격도 절반으로 낮췄다. 이 모델들은 일상 대화, 하위 에이전트, 요약, 맥락 압축 등 대다수 작업량을 처리한다. 다만 Cursor의 순위는 토큰당 가격만으로는 모든 것을 알 수 없다는 점을 보여준다. 추론 강도를 Max로 설정한 Haiku 5.5는 High로 설정한 Sonnet 5.5보다 작업당 토큰을 거의 9배 많이 사용하지만, 작업당 비용은 조금 낮을 뿐이다(1.12달러 대 1.20달러). 한편 Max와 Team 요금제의 월별 API 크레딧은 구독자가 자신의 코드에서 이 모델들을 시험해 보도록 유도한다.

AI는 사용자의 컴퓨터로도 내려오고 있다. RTX Spark 노트북은 10월 16일 출시되고, DGX Station for Windows는 책상 위에서 최대 20페타플롭스의 성능을 제공하겠다고 약속한다. Copilot도 이달 말까지 일부 작업을 로컬의 MAI Code 1.1 Flash에 직접 맡길 예정이다. Replit은 이제 사용자의 컴퓨터에서 애플리케이션을 빌드한다. 개인용 컴퓨터에서 코드를 실행하는 에이전트는 보안 문제를 제기하며, 여러 곳에서 같은 구성 요소가 쓰이고 있다. Windows에서 정식 제공되는 Microsoft Execution Containers(MXC)는 Copilot 명령어와 Replit 빌드를 모두 격리한다. 한편 GitHub는 노출된 비밀 정보를 탐지하는 전용 분류기를 배포하고 Git 인프라를 재구축하고 있다. 이미 풀 리퀘스트 세 건 중 한 건에 에이전트가 관여하고 있으며, 커밋 수는 1년 사이 5배 이상으로 늘었기 때문이다.

답변 자체도 인터페이스가 되고 있다. Intelligent UI를 통해 ChatGPT는 그래프, 양식, 요청에 따라 만든 작은 도구로 답하며, 추론을 마치기 전부터 답변을 시작한다. 개발자 측에서는 Claude SDK가 computer use와 browser use의 실행 루프를 지원하고, Cursor는 컴퓨터에서 작업 중인 에이전트를 iPhone으로 지켜보고 응답할 수 있게 한다. 이 세 경우 모두 텍스트는 상호작용의 일부에 불과하다. AI는 화면에 표시하고, 클릭하고, 결과를 보고하며, 사용자는 이를 감독한다.

마지막으로, 오늘 소개된 수치 중 상당수는 발표한 당사자가 직접 측정했다. Haiku 5.5 벤치마크는 Anthropic이, MAI Code 1.1 Flash 벤치마크는 Microsoft가 측정했다. Q2D-Web은 이를 설계한 Perplexity가, Open d1의 점수는 Liquid AI가 측정했으며, 쓰기 처리량이 35배로 증가했다는 수치는 GitHub 내부 테스트에서 나왔다. OpenAI도 자사의 원고 722편에 담긴 형식화되지 않은 결과에 오류가 있을 수 있다고 경고했으며, GPT-6의 속도 향상 수치 역시 내부 평가에서 나왔다. 이러한 측정은 제품 간 상대적인 위치를 파악하는 데 여전히 유용하다. 도구 개발사가 다른 회사의 모델을 평가하는 CursorBench 순위 같은 외부 평가를 통해 이 수치들을 교차 검증할 수 있을 것이다.


출처