검색

Claude Dashboards와 Claude Motion, Cyber Mission과 OSS Scanner, Ultrafast 모드의 GPT-6.1 Sol

ai-powered-markdown-translator

gpt-6.1-sol을 사용해 프랑스어에서 한국어로 번역한 기사.

GitHub에서 프로젝트 보기 ↗

Anthropic이 Claude에 두 가지 기능을 추가한다. Claude Dashboards는 최신 상태로 유지되는 대시보드를, Claude Motion은 코드로 작성한 애니메이션을 제공한다. 또한 Docs, Slides, Design은 베타를 종료하고 Free를 포함한 모든 요금제에서 제공된다. 같은 날 Anthropic은 핵심 인프라 방어 프로그램과 OSS Scanner를 포함하는 Cyber Mission을 출범한다. OSS Scanner는 오픈 소스 프로젝트에 자사의 가장 강력한 모델을 활용한 무료 검사를 제공한다. 한편 OpenAI는 GPT-6.1 Sol에 Standard 모드보다 최대 8배 빠른 Ultrafast 등급을 도입한다. Anthropic과 NVIDIA는 Genesis Mission에 각각 1억 5천만 달러와 10억 달러를 지원하기로 했다.


Claude Dashboards와 Claude Motion 베타, 모든 요금제에서 제공되는 Docs, Slides, Design

10월 8일 — Anthropic이 Claude에 두 가지 기능을 추가한다. 유료 요금제에서 베타로 제공되는 Claude Dashboards에서는 기업의 데이터 플랫폼(Amazon Redshift, BigQuery, ClickHouse, Databricks, Snowflake)이나 Salesforce 영업 기회 같은 다른 커넥터를 연결한 뒤 일상 언어로 질문하면 된다. Claude가 쿼리를 작성하고 대시보드를 만들며, 데이터가 바뀌면 최신 상태로 유지한다. 수치를 클릭하면 해당 수치를 산출한 쿼리가 표시되고, 각 그래프에는 데이터가 마지막으로 갱신된 시점이 표시된다. Anthropic은 빠르게 답을 얻거나 데이터를 탐색하는 질문에 이 기능을 활용하도록 설계했다. 더 깊이 분석하려면 대시보드를 Amplitude, Grafana, Hex, Mixpanel, Omni, Perplexity, PostHog, Sigma로 내보낼 수 있으며, Looker, monday.com, Tableau 지원도 예정되어 있다.

Team과 Enterprise에서 베타로 제공되는 Claude Motion은 짧은 애니메이션 제작을 위한 기능이다. 분기 보고서에서 만든 30초 설명 영상, 프레젠테이션에 들어가는 움직이는 그래프, 제품 시연 등이 활용 사례다. 영상 생성 모델을 전혀 사용하지 않으므로 애니메이션에는 인공지능으로 생성한 영상 장면이나 인물이 포함되지 않는다.

Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.

🇰🇷 Claude Motion은 보고서, 그래프, 제품 시연을 짧은 애니메이션으로 바꿉니다. Claude는 영상 모델을 전혀 사용하지 않고 각 애니메이션을 코드로 작성하므로, 모든 단어와 숫자, 재생 시점을 수정한 뒤 MP4로 내보낼 수 있습니다. Team 및 Enterprise 요금제에서 베타로 제공됩니다. — X의 @claudeai

같은 날 Claude Docs, Slides, Design은 베타 표시를 떼고 Free를 포함한 모든 요금제에서 제공된다. Anthropic에 따르면 9월 16일 대화에 이 기능들이 도입된 이후 문서, 프레젠테이션, 디자인이 4,500만 개 이상 만들어졌다. 베타 종료와 함께 아티팩트의 CMEK 지원, 관리자의 아티팩트 템플릿 선택, Claude와 함께하는 공동 편집, 관리자가 허용한 경우 조직 외부와의 공유, 편집 화면을 충실히 재현하는 PowerPoint 및 PDF 내보내기, Google Slides로 직접 보내기, 모바일 앱에서 수정하기가 추가된다.

해당 기능10월 8일 기준 상태해당 요금제
Claude Dashboards베타유료 요금제
Claude Motion베타Team 및 Enterprise
Claude Docs, Slides, Design베타 종료Free를 포함한 모든 요금제
claude.ai/design (독립 사이트)12월 14일까지 운영—

이에 따라 이제 Claude에 통합된 독립 사이트 claude.ai/design은 12월 14일까지 운영된다. 조직의 디자인 체계(디자인 시스템)는 Artifacts 페이지에서 한 번에 이전할 수 있지만, 독립 사이트의 대화와 댓글, 공개 링크는 사이트 폐쇄와 함께 사라진다. Enterprise에서는 Dashboards와 Motion이 기본적으로 비활성화되어 있으며, Docs, Slides, Design은 10월 15일에 기본적으로 활성화된다.

🔗 Claude 게시글: Dashboards와 Motion · @claudeai 게시글 모음

Claude Motion의 출시 파트너 Runway와 Luma

10월 8일 — 생성형 영상 분야의 두 기업이 Claude Motion의 출시 파트너로 참여한다고 밝혔다. Runway에서는 애니메이션을 내보낸 뒤 생성한 영상 장면을 추가하고, 원하는 변경 사항을 설명해 장면을 수정하며, Runway Agent에 애니메이션을 중심으로 더 긴 편집 영상을 구성하도록 할 수 있다. 같은 16:9 영상에서 세로형과 정사각형 버전도 만들 수 있다. Luma에서는 Claude에 추가한 Luma 커넥터(MCP)를 통해 애니메이션을 바로 열 수 있다. 영상 모델 Ray와 Uni는 움직임을 유지하면서 스타일을 바꾸고, 9:16, 1:1, 4:3, 21:9로 화면을 재구성하며, Luma 에이전트는 추가 버전을 제작한다. Runway와 Luma 모두 요금이나 크레딧 비용을 밝히지 않았다. Anthropic은 애니메이션을 이어서 작업할 수 있는 도구로 Adobe, Descript, HeyGen, Higgsfield, invideo도 언급했으며, Canva와 Captions 지원도 곧 제공될 예정이라고 밝혔다.

🔗 Runway 게시글 · Luma 게시글


Anthropic Cyber Mission: 핵심 인프라를 위한 프로그램과 오픈 소스를 위한 OSS Scanner

10월 8일 — Cyber Verification Program을 확대한 지 이틀 만에 Anthropic이 Anthropic Cyber Mission을 출범했다. 이는 모두가 의존하는 시스템을 보호하기 위한 장기적인 약속으로 소개됐다. 출발점은 Project Glasswing에서 얻은 진단이다. 취약점을 찾기는 어느 때보다 쉬워졌지만, 이를 검증하고 우선순위를 정하고 수정하기는 여전히 어렵다. 이 임무는 핵심 인프라와 오픈 소스 소프트웨어라는 두 분야에서 시작한다. 다른 분야로의 확대도 예고했지만 날짜는 제시하지 않았다.

핵심 인프라를 대상으로 하는 Critical Infrastructure Defense Program(CIDP)은 운영 기술 사업자에게 서비스를 제공하는 업체들에 최첨단 Claude 모델, 현장 엔지니어, Anthropic의 위협 연구를 제공한다. 여기서 운영 기술은 전력, 수도, 교통 분야의 자동 제어 장치, 제어 소프트웨어, 산업용 네트워크를 뜻하며, 패치를 적용하려고 중단하기 어려운 경우가 많다. 창립 파트너로 Accenture, Booz Allen, CrowdStrike, Deloitte, Dragos, Hitachi, Insane Cyber, Nozomi Networks, Palo Alto Networks, PwC, Rockwell Automation 등 11개 기업이 참여한다. 프로그램은 소규모 참여 집단으로 시작하며, 앞으로 몇 달에 걸쳐 다른 파트너와 분야로 확대될 예정이다.

오픈 소스를 위한 OSS Scanner는 Google의 OSS-Fuzz에서 착안한 서비스다. 등록한 프로젝트에 Claude Mythos를 포함한 Anthropic의 가장 강력한 모델로 정기 검사를 무료로 제공한다. 각 보고서에는 재현 도구, 설명, 그리고 가능한 경우 패치 후보가 포함되지만, 사람이 검토하지 않은 상태로 전달된다. Anthropic은 실제 취약점으로 확인되는 비율이 90%를 넘을 것으로 예상하면서도, 일부 보고서에는 심각도 평가 오류 같은 잘못이 포함될 수 있다고 알렸다. 이 서비스는 Frontier Red Team이 설명한 병목에 대응한다. 발견되는 취약점이 사람이 분류할 수 있는 양을 훨씬 넘어선다는 것이다.

Anthropic이 공개한 지표공개된 수치
6개월 동안 발견한 취약점 후보29 000개 초과
사람이 직접 검토하고 분류한 취약점약 6 000개
검증된 치명적 또는 높은 심각도의 취약점(48개 프로젝트)97
조정된 취약점 공개(CVD)에 필요한 기준을 충족한 취약점85, 즉 88 %
실제 취약점이지만 중복인 사례 또는 유효하지 않은 사례11 및 1
CyberGym 벤치마크에서 LLM이 발견한 취약점의 비율지난해 초 20 % 미만, 올해 85 % 초과

wolfSSL은 받은 보고서 74건 중 2건을 제외한 모두가 유효했고, 5건은 CVE로 등록됐다고 밝혔다. 등록은 GitHub의 anthropics/oss-scanner 저장소에 풀 리퀘스트를 제출하는 방식으로 진행된다. 개별 심사를 통해 핵심 프로젝트로 판단된 프로젝트의 주요 유지관리자만 신청할 수 있으며, 8월에 출범한 Defender Advantage Fund가 서비스를 무료로 유지하도록 지원한다. Anthropic의 전망은 신중하다. 2년 안에는 인공지능이 방어에 유리하게 작용하겠지만, 단기적으로는 반드시 그렇지는 않다는 것이다. 취약점 악용 비용은 낮아지는 반면 검증, 공개, 수정은 여전히 느리기 때문이다.

🔗 Anthropic 게시글: Anthropic Cyber Mission · OSS Scanner에 관한 Frontier Red Team 게시글 · anthropics/oss-scanner 저장소


GPT-6.1 Sol의 Ultrafast: 최대 8배 빠른 속도, 토큰 100만 개당 입력 12달러와 출력 60달러

10월 8일 — 9월 29일에 “곧 제공”된다고 예고했던 Ultrafast 등급이 GPT-6.1 Sol에 도입된다. OpenAI Developers는 같은 날 API, Codex, ChatGPT Work에서 배포를 시작한다고 밝혔으며, 지능 수준은 GPT-6 Astra에 가까운 것으로 소개했다. OpenAI는 장애 디버깅, 에이전트의 애플리케이션 탐색, 실시간 경험 제공처럼 매초가 중요한 작업을 위한 기능이라고 설명한다.

Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.

🇰🇷 오늘 API, Codex, ChatGPT Work에서 GPT-6.1 Sol의 Ultrafast 배포가 시작됩니다. Astra에 가까운 지능과 Standard 모드의 Sol보다 최대 8배 빠른 속도로, 아이디어가 떠오르는 속도만큼 빠르게 구현할 수 있습니다. — X의 @OpenAIDevs

API에서는 Responses API에서 service_tier: "ultrafast"을 지정해 gpt-6.1-sol을 호출하면 된다. 이 모드는 요청 속도 제한 범위 내에서 모든 API 사용자가 이용할 수 있으며, 전 세계 처리와 미국 및 유럽연합의 데이터 보관 지역을 지원한다. 반면 Ultrafast 모드의 GPT-6 Astra는 미국 내 데이터 보관만 지원한다. 요금은 Astra에 이미 적용된 규칙을 따른다. Standard 가격의 6배로, 토큰 100만 개당 입력 12달러와 출력 60달러이며, Ultrafast 모드의 GPT-6 Astra(60달러 및 300달러)의 5분의 1 수준이다.

gpt-6.1-sol 처리 모드입력 가격캐시된 입력캐시 쓰기출력 가격
Standard, 짧은 컨텍스트2,00 달러0,10 달러2,50 달러10,00 달러
Fast, 짧은 컨텍스트4,00 달러0,20 달러5,00 달러20,00 달러
Ultrafast, 짧은 컨텍스트12,00 달러0,60 달러15,00 달러60,00 달러
Ultrafast, 긴 컨텍스트24,00 달러1,20 달러30,00 달러90,00 달러

10월 8일 기준 API 가격 안내 페이지의 토큰 100만 개당 요금.

Codex와 ChatGPT Work에서는 Pro 500 요금제, 사용량에 따라 과금되는 적격 Enterprise 작업 공간, 크레딧 기반 Edu 상품만 이용할 수 있다. Enterprise에서는 Ultrafast가 기본적으로 비활성화되어 있으므로 작업 공간 소유자가 일부 사용자 또는 모든 사용자를 대상으로 활성화해야 한다. Codex 문서는 비용을 자세히 설명한다. 구독에 포함된 사용 한도는 Standard 모드보다 8배 빠르게 차감되며, 구매한 크레딧과 Enterprise의 주문형 사용량은 6배 높은 요금으로 청구된다. 다른 셀프서비스 요금제는 구매한 크레딧이 있어도 출시 시점에는 이용할 수 없다.

🔗 OpenAI API 변경 이력 · OpenAI API 요금 · Codex의 Ultrafast(문서)


과학: Genesis Mission에 Anthropic 1억 5천만 달러, NVIDIA 10억 달러 지원과 자외선 하늘 지도

인공지능으로 과학적 발견을 가속하려는 미국 연방 프로그램 Genesis Mission에 대한 두 가지 지원 약속이 10월 8일 같은 정상회의에서 발표됐다. 이 회의는 백악관 과학기술정책실(OSTP)이 워싱턴에서 개최한 “과학: 새로운 황금시대”였다. 같은 날 Anthropic은 Claude Science가 천체물리학자를 위해 어떤 결과물을 만들어낼 수 있는지도 보여줬다.

Anthropic: 3년간 1억 5천만 달러와 15개 이상의 연방 기관을 위한 Claude

10월 8일 — Anthropic이 Genesis Mission에 3년간 1억 5천만 달러를 지원하기로 했다. 이 자금은 NASA, 미국 국립보건원, 미국 국립과학재단을 포함한 15개 이상의 참여 기관이 Claude를 이용할 수 있도록 하는 데 쓰일 예정이다. 구체적으로 Anthropic은 수백 개 연구 프로젝트에 Claude, Claude Code, API 크레딧을 제공하고, 핵융합 에너지와 양자 컴퓨팅을 비롯한 행정부의 우선 과제에 대해 기관 및 국립 연구소와 협력하며, 교육과 기술 지원을 제공한다. 이번 약속은 2025년 12월 미국 에너지부와 맺은 협력을 이어가는 것이다. 7월에는 Google DeepMind(4천만 달러)와 OpenAI(1천7백만 달러)가 이 임무에 대한 각자의 지원 약속을 발표한 바 있다.

🔗 Anthropic 게시글: Genesis Mission 지원 약속 · @AnthropicAI 게시글

NVIDIA: 미국 과학을 위해 5년간 10억 달러

10월 8일 — 같은 행사에서 NVIDIA는 양자 컴퓨팅, 보건, 에너지 안보 등의 분야에서 미국의 초지능 연구개발 역량을 강화하기 위해 5년간 10억 달러 규모의 지원을 약속했다. 보도자료는 금액을 항목별로 나누지 않은 채 세 가지 지원 분야를 제시했다. 대학 연구기관 지원, 양자 컴퓨팅 분야에서 미국의 선도적 지위를 강화하기 위한 투자, 정부의 임무를 지원하는 클라우드 공급업체 지원이다. NVIDIA는 같은 날 발표된 Genesis Mission 2단계 지원 대상 프로젝트 가운데 양자 컴퓨팅, 핵융합, 가속기 설계, 마이크로전자공학 분야의 여러 프로젝트에도 협력한다고 밝혔다. 또한 DOE와의 협력을 상기시켰는데, 여기에는 아르곤 국립연구소에 있는 에너지부 최대 규모의 과학용 슈퍼컴퓨터도 포함된다.

🔗 NVIDIA 보도자료

Claude Science로 제작한 최초의 완전한 자외선 전천 지도

10월 8일 — Anthropic Science 블로그는 존스홉킨스 대학교의 천체물리학자이자 Anthropic 연구원인 브리스 메나르가 Claude Science와 함께 Anthropic이 최초의 완전한 자외선 전천 지도라고 소개하는 지도를 제작한 과정을 전했다. 우주 관측 프로젝트 GALEX(NASA, 2003-2013)는 약 38 000회의 관측으로 하늘의 약 3분의 2만을 담았다. Claude는 에이전트들을 조율해 공개 관측 자료를 모으고 서로 보정한 뒤, 자외선과 다른 파장 사이의 관계를 바탕으로 재구성(inpainting)해 빠진 3분의 1을 채웠다. 검증을 위해 일부러 가린 영역에서는 추정값과 실제 측정값의 오차가 약 10 % 수준이었다.

The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.

🇰🇷 사람이 했다면 몇 주가 걸렸을 이 작업은 Claude를 활용하자 메나르가 다른 프로젝트를 진행하는 동안 며칠 만에 끝났다. — X의 @AnthropicAI

🔗 Anthropic Science 게시글


금지된 사용과 악용: Anthropic의 2026년 사용 정책과 OpenAI가 차단한 두 건의 영향력 공작

10월 8일 공개된 두 게시물은 연구소들이 무엇을 금지하고 어떻게 악용을 추적하는지 보여준다. Anthropic은 사용 정책을 개정했고, OpenAI는 차단한 두 건의 영향력 공작을 상세히 설명했다.

Anthropic, 11월 12일부터 시행되는 2026년 사용 정책 공개

10월 8일 — Anthropic이 연례 사용 정책(사용 정책) 개정안을 공개했다. 시행일은 11월 12일이다. 이번 개정은 관찰된 악용 사례를 바탕으로 기존 규정을 명확히 하는 데 초점을 맞췄다. 새 항목은 그동안 흩어져 있던 기만적 캠페인과 인위적 활동에 관한 규정을 모아, 영향력 공작용 도구 제작을 포함한 모든 정치적·상업적 기만 활동을 다룬다. 선거 관련 항목은 ‘민주적 절차를 훼손하지 마세요’(민주적 절차를 훼손하지 마세요)로 이름을 바꾸고, 유권자 개인 맞춤형 타기팅에 대한 포괄적 금지를 없앴다. 이 금지 규정은 다른 언어로 유권자에게 정보를 제공하는 등의 시민 참여 활동도 막고 있었다. 또한 무기 금지 규정이 무기용 소프트웨어와 부품, 드론 무장까지 포함한다고 명시하고, 동의 없이 사람을 추적하는 행위를 금지하며, 모델을 향한 지속적이고 이유 없는 학대 행위는 극단적인 경우에 한해 금지한다.

🔗 Anthropic 게시글: 2026년 사용 정책 개정

OpenAI, 최초의 5등급 공작을 포함한 Dark Clark와 Bogus Bylines 차단

10월 8일 — OpenAI가 자사 모델의 도움으로 위장 단체(false front)를 운영하던 두 건의 은밀한 영향력 공작을 차단한 보고서를 공개했다. 러시아에서 시작된 ‘Dark Clark’는 라틴 아메리카를 겨냥했다. 운영자들은 주로 ChatGPT로 내부 보고서를 작성했고, ‘Mia Clark’라는 가상 인물이 이끄는 Social Research Center라는 위장 연구소를 운영했다. 이란에서 시작된 ‘Bogus Bylines’는 서방 언론인 7명의 가짜 명의로 약 100개의 기사를 온라인 매체 12곳가량에 게재했다. 이 중 한 매체는 Facebook 구독자가 약 2백만 명이었다. OpenAI는 2년 반 동안 이런 공작 30건을 밝혀냈다고 밝혔다.

차단된 공작계정의 출처주요 표적IO Breakout Scale 등급(1~6)
Dark Clark러시아라틴 아메리카5, OpenAI에 따르면 최초
Bogus Bylines, 기사이란국제 온라인 매체4
Bogus Bylines, 댓글이란소셜 미디어2

🔗 OpenAI의 위장 단체를 이용한 공작 보고서


외부 서비스의 Claude Haiku 5.5: GitHub Copilot은 Pro부터 제공, Devin의 평가 점수는 58,4 %

10월 7일 출시된 Claude Haiku 5.5는 같은 날 두 코딩 도구에 도입됐으며, 두 도구 모두 이를 Claude Sonnet 5와 비교했다.

GitHub Copilot: Pro를 포함한 모든 유료 요금제에 Haiku 5.5 제공

10월 7일 — Anthropic의 출시 발표로부터 두 시간이 조금 지난 뒤, Claude Haiku 5.5가 GitHub Copilot의 Pro, Pro+, Max, Business, Enterprise 요금제에 정식 제공됐다. Claude Sonnet 5.5처럼 Pro도 포함되며, 이는 9월 말의 GPT-6.1 Sol과는 다르다. VS Code부터 Xcode까지 10개 환경에서 선택할 수 있다. GitHub는 이 모델을 하위 에이전트, 빠른 수정, 터미널 작업에 활용하도록 권한다. 초기 테스트에서는 여러 코딩 작업에서 훨씬 적은 토큰과 단계로 Claude Sonnet 5와 동등한 성능을 냈지만, 구체적인 수치는 공개하지 않았다. 요금은 공개 가격을 따른다. 입력 토큰 100 000개까지는 토큰 백만 개당 입력 0,10달러, 출력 0,50달러이며, 그 이상에서는 각각 0,50달러와 2,50달러다. 첫 번째 구간에서는 Claude Haiku 4.5 가격의 10분의 1이다.

🔗 GitHub Copilot의 Claude Haiku 5.5 · GitHub Copilot의 모델과 요금

Devin: FrontierCode 1.1에서 58,4 %로 Claude Sonnet 5를 앞서다

10월 7일 — Cognition이 Devin에서 Claude Haiku 5.5를 사용할 수 있게 했다. 실제 엔지니어링 작업에서 코드 품질과 병합 가능성을 기준으로 모델을 평가하는 자체 벤치마크 FrontierCode 1.1에서 Haiku 5.5는 58,4 %를 기록해 Claude Sonnet 5를 앞섰다. Cognition에 따르면 작업당 비용은 Claude Sonnet 5의 약 8분의 1이지만, 정확한 금액은 공개하지 않았다. 이 모델은 주 모델과 보조 모델을 조합하는 Devin Fusion의 보조 모델(sidekicks)에도 추가됐다. Claude Opus 5.5를 주 모델로, Haiku 5.5를 보조 모델로 사용하면 Fusion은 66,2점을 유지하면서 비용과 지연 시간을 줄인다.

Cognition이 평가한 모델FrontierCode 1.1 Extended 점수
Claude Sonnet 556,2
Kimi K358,2
Claude Haiku 5.558,4
GPT-6.1 Sol60,4
Claude Sonnet 5.564,4
Claude Opus 5.565,3

🔗 Devin의 Claude Haiku 5.5


코딩 에이전트: Claude Code 2.1.295, Codex CLI 0.162.0, Antigravity CLI 1.3.1, VS Code 1.141과 Delta 0.19

다섯 코딩 에이전트 도구가 업데이트됐다. Claude Code는 훅의 차단 기능을 강화하고, Codex CLI는 워크트리를 관리하며, Antigravity CLI는 변경 사항 검토 방식을 개편한다. VS Code는 에이전트 세션을 격자로 배치하고, Delta는 팀 협업 기능을 확장한다.

Claude Code 2.1.295: 실패하면 작업을 차단하는 훅

10월 8일 — Claude Code는 이날 두 버전을 출시했다. 2.1.294는 자연어 지시로 작성된 prompt와 agent 훅이 차단해야 할 작업을 통과시킬 수 있던 문제를 수정했다. 2.1.295에는 143개의 변경 사항이 있으며, 이 중 97개는 버그 수정이다. command 및 HTTP 훅의 새 onFailure: "block" 옵션을 사용하면 훅이 시작되지 않거나, 시간 초과가 발생하거나, 예상하지 못한 코드를 반환할 때 작업을 통과시키지 않고 차단한다. mods의 보호 장치와 --tools, --restricted 옵션에 대한 여러 수정도 같은 방향이다. Claude Code는 호환 터미널에서 에이전트가 작업 중인지, 대기 중인지, 완료했는지 표시할 수 있는 Program Status Protocol(OSC 7501)도 지원한다. 도구 검색으로 불러오는 MCP 도구 설명의 길이 제한은 2 048자에서 16 384자로 늘어났다.

🔗 Claude Code 2.1.295 · Claude Code 2.1.294

Codex CLI 0.162.0: 관리형 워크트리와 작업 고정

10월 8일 — 전날의 0.161.0 이후 첫 안정 버전인 Codex CLI 0.162.0에는 PR 225개가 나열돼 있다. 워크트리 기능을 활성화하면 Codex는 신뢰할 수 있는 로컬 프로젝트에서 관리형 Git 워크트리를 생성하고 목록을 조회하는 도구를 사용할 수 있다. 에이전트 제어 센터에서는 p 키로 작업을 고정할 수 있으며, 서버가 지원하면 ‘Pinned’ 그룹을 공유한다. 터미널에는 대화 기록의 블록을 탐색하고 복사하는 /copy, 선택 영역을 복사하는 Ctrl+Insert, 스크롤 속도 설정이 추가됐다. 승인 화면과 MCP 입력 요청에서도 URL을 클릭할 수 있게 됐다. Responses API와 호환되는 사용자 지정 모델 제공자는 실시간 웹 접근과 원격 압축 지원을 선언할 수 있다. 수정 사항으로는 apply_patch의 CRLF 줄바꿈 보존, Linux 샌드박스 강화, Windows 버전의 서명된 PowerShell 설치 프로그램 제공이 있다.

🔗 Codex CLI 0.162.0 릴리스 노트

Antigravity CLI 1.3.1: /diff의 검토 방식 개편, 기본 출력 상세 수준을 중간으로 변경

10월 7일 — Antigravity CLI는 10월 2일부터 7일까지 다섯 버전을 출시했다. 1.3.1은 터미널에서의 코드 검토를 개선한다. /diff의 파일 보기에서 왼쪽과 오른쪽 화살표를 누르면 인접 파일의 첫 변경 위치로 이동하고, 각 파일은 이전 위치를 기억한다. n와 N은 다음 또는 이전 파일로 이어지며, 상단에는 현재 위치가 표시된다. 10개의 수정 사항에는 매우 긴 대화에서의 /rewind, Windows 플러그인, Gemini API 연결이 끊기면 재시도하는 GEMINI_API_KEY 키 기반 세션 관련 수정이 포함된다. 10월 6일의 1.3.0은 기본 출력 상세 수준을 ‘high’에서 ‘medium’으로 바꿨으며, 도구 호출과 추론을 간결한 요약으로 묶어 보여준다. /config으로 이전 설정으로 돌아갈 수 있다. 앞서 1.2.16은 이미지 생성을 내장 하위 에이전트에 맡겼고, 1.2.15는 Termux용 Android 바이너리를 제공했다.

🔗 Antigravity 변경 기록의 CLI 탭

VS Code 1.141: 에이전트 세션 격자 배치와 워크트리 정리

10월 7일 — VS Code 1.141은 Copilot의 에이전트 세션에 초점을 맞췄다. Agents 창에서 여러 세션을 격자로 배치할 수 있다. Chat: Open Worktree Cleanup 명령은 비활성 세션의 워크트리가 차지하는 디스크 공간을 표시하고, 요청에 따라 또는 풀 리퀘스트 병합 후 자동으로 워크트리를 삭제할 수 있게 한다. Copilot CLI나 GitHub Copilot 앱에서 시작한 대화는 편집기를 다시 불러오지 않아도 첫 요청부터 표시된다. ChatGPT 앱이나 Codex CLI에서 시작한 Codex 대화도 기록을 유지한 채 이곳에서 이어갈 수 있다. Copilot 모델을 선택하면 GitHub Copilot 구독으로 계속할 수 있으므로, 예를 들어 ChatGPT 사용 한도에 도달한 뒤에도 대화를 이어갈 수 있다. 기업용 기능으로는 관리형 설정을 통해 Copilot 하네스의 샌드박스 사용을 강제하는 기능이 미리 보기로 제공된다. 또한 실험 기능을 활성화한 사용자에게는 이 하네스가 점진적으로 기본 선택이 된다.

🔗 VS Code 1.141 릴리스 노트

Delta 0.19: 팀원 언급과 받은편지함

10월 7일 — Zed Industries가 에이전트와 함께 여러 사람이 코딩하는 환경인 Delta 0.19.0을 출시했으며, 10월 8일에는 수정 버전 0.19.1이 나왔다. 이제 메시지나 댓글에서 @ 뒤에 사용자 이름을 입력해 팀원을 언급할 수 있고, 알림은 새로운 받은편지함(Inbox)으로 전달된다. @delta 에이전트는 대화에서 대부분의 설정을 읽고 수정한다. Agent Thread Creation 설정은 하위 에이전트는 유지하면서 에이전트가 최상위 대화를 생성하지 못하게 한다. 에이전트는 여러 대화 스레드의 워크트리를 병합할 수 있으며, CLI 명령은 창을 열지 않고 실행된다. 릴리스 노트에는 총 11개의 새 기능, 22개의 개선 사항, 45개의 수정 사항이 나열돼 있다. 10월 8일 Zed가 공유한 게시글은 팀이 내부 문서 작성에 Google Docs 대신 Delta를 사용하게 된 과정을 소개했다.

🔗 Delta 릴리스 노트 · Google Docs 사용을 중단한 과정에 관한 Delta 게시글


생성형 미디어: Nano Banana 2.1, ElevenLabs의 Brand Kit와 브라질의 ElevenReader, Stability AI의 SemanTok

이미지, 영상, 음성에 관한 네 가지 발표다. Google은 가격을 절반으로 낮춘 이미지 모델을, ElevenLabs는 재사용 가능한 브랜드 디자인 지침과 오디오 독서 앱을, Stability AI는 영상 생성 연구를 발표했다.

Nano Banana 2.1, Gemini API에서 정식 제공하며 가격을 절반으로 인하

10월 6일 — Google이 별도의 블로그 게시글 없이 Nano Banana 2.1(gemini-nano-banana-2.1)을 Gemini API와 Google AI Studio에서 정식 제공하기 시작했다. 이 이미지 생성·편집 모델은 Nano Banana 2를 업데이트한 것으로, 시각적 품질과 텍스트 표현이 개선되고 대화 차례가 바뀌어도 등장인물의 일관성이 높아졌다. 1:4부터 8:1까지 파노라마 형식을 지원하며, 2K와 4K에서 타일링 아티팩트가 발생하지 않는다. 참조 이미지를 최대 14개까지 받아들이고 Google 검색을 근거로 활용한다. 1K와 2K의 이미지당 가격은 절반으로 낮아졌으며, Google은 Nano Banana 2(gemini-3.1-flash-image)를 지원 중단 예정으로 지정했지만 종료 날짜는 정하지 않았다.

출력 가격Nano Banana 2.1Nano Banana 2
1K 이미지0,0336 달러0,067 달러
2K 이미지0,0504 달러0,101 달러
4K 이미지0,113 달러0,151 달러
이미지 토큰 백만 개30 달러60 달러

🔗 Gemini API 릴리스 노트 · Nano Banana 2.1 모델 안내

ElevenLabs의 Brand Kit: 작업 공간에 모아 둔 브랜드 디자인 지침

10월 8일 — ElevenLabs가 제작 도구 모음 ElevenCreative에 Brand Kit를 추가했다. 색상, 글꼴, 로고와 사용 규칙, 참조 이미지, 브랜드가 절대 하지 않는 것까지 포함한 브랜드 규칙을 작업 공간의 하나의 항목으로 묶어, Image & Video, Flows, ElevenCreative 에이전트에서 @로 호출할 수 있다. ElevenLabs의 게시물 스레드에 따르면 사이트 주소를 붙여 넣거나 조직의 자료를 업로드해 몇 분 만에 키트를 만들 수 있다. 그러면 팀 전체가 같은 지침으로 콘텐츠를 생성하고, 대행사는 고객별로 키트를 만들 수 있다. ElevenLabs는 키트를 브랜드의 음성과 소리까지 확장할 계획이지만 일정은 정하지 않았다. Brand Kit는 지금 사용할 수 있으며, 요금은 공개하지 않았다. HeyGen은 8월부터, Runway는 9월부터 이미 유사한 도구를 제공하고 있다.

🔗 ElevenLabs 게시글: Brand Kit · @ElevenLabs 게시물 스레드

Stability AI의 SemanTok: 201M 모델로 3,4배 큰 모델과 동등한 성능

10월 7일 — Stability AI의 Interactive Research 팀이 토큰 단위로 영상을 생성하는 월드 모델(world models)용 영상 토크나이저 SemanTok을 소개했으며, 10월 8일 X에 발표했다. ‘거친 정보에서 세부 정보로’(coarse-to-fine) 이어지는 토크나이저에서는 첫 토큰들이 장면 전체를 설명하고, 뒤의 토큰들이 세부 정보를 추가한다. SemanTok은 이 첫 토큰들에 더 풍부한 의미를 담아 예측하기 쉽게 만든다. 이를 위해 인코더에 고정된 DINO 특징을 주입하고, 각 토큰 접두부에서 해당 특징을 재구성하는 경량 헤드를 추가한다. Stability AI에 따르면 SemanTok을 기반으로 한 매개변수 201M개의 자기회귀 모델은 3,4배 큰 VideoFlexTok 모델과 동등하거나 더 나은 성능을 내며, 짧은 접두부는 예측 비용도 더 낮다. 논문은 arXiv에 공개됐으며, 코드와 가중치는 언급되지 않았다.

🔗 Stability AI 연구 게시글 · arXiv 논문

ElevenReader, 파비우 포르샤의 목소리와 70 000권의 책으로 브라질에 출시

10월 8일 — ElevenLabs가 책, 문서, 기사를 오디오로 바꿔 주는 애플리케이션 ElevenReader를 브라질에 출시한다. iOS와 Android에서 무료로 사용할 수 있으며, 배우이자 코미디언인 파비우 포르샤의 목소리를 제공한다. 도서 목록은 Bookwire Brasil과의 제휴를 바탕으로 구성됐다. 브라질 주요 출판사로부터 이용 허가를 받은 브라질 포르투갈어 도서 70 000권을 제공하며, 대부분은 오디오판이 없던 책이다. ElevenLabs는 마샤두 지 아시스의 Dom Casmurro도 파비우 포르샤의 낭독에 오리지널 음악과 음향 디자인을 더해 제작했다. Bookwire Brasil의 대표에 따르면, 오디오로 제공된 브라질 도서 가운데 역대 최대 규모의 목록이다.

브라질 제공 항목이용 조건
ElevenReader 애플리케이션 (iOS, Android)무료
파비우 포르샤가 낭독한 Dom Casmurro누구나 무료로 이용 가능
Bookwire 이용 허가 도서 70 000권ElevenReader Ultra로 이용, 가격 미공개

🔗 ElevenLabs 게시글: 브라질의 ElevenReader


특화 모델: 문서용 LightOnOCR-3, 아랍어용 Falcon-ASR, 유전체용 Carbon-A

문서 읽기, 아랍어 전사, 유전체 주석을 위한 특화 모델 세 가지가 공개됐으며, 그중 두 가지는 가중치가 공개되어 있다.

LightOnOCR-3: 페이지 배치도 파악하는 공개 OCR 모델 세 가지

10월 8일 — LightOn이 Apache 2.0 라이선스로 LightOnOCR-3를 세 가지 크기(0.8B, 1B, 4B)로 공개한다. 이 모델들은 페이지를 전사하는 데 더해 각 영역의 위치도 파악한다. 시각적 위치 지정 프롬프트(grounding)를 사용하면 각 블록 앞에 레이블이 붙은 경계 상자가 표시되고, 이미지에는 짧은 설명이 붙으며, 그래프는 데이터를 담은 HTML 표로 변환된다. H100에서 4B 모델의 초당 페이지 처리량은 같은 Qwen3.5를 기반으로 구축된 Chandra-OCR-2보다 21 % 더 많다. LightOn은 저장소와 함께 공개한 출력 정규화를 적용한 뒤 점수를 계산했다고 설명하며, 이 정규화는 모든 상위 모델의 점수에 상당한 영향을 준다.

평가 벤치마크LightOnOCR-3-4BLightOnOCR-3-0.8BLightOnOCR-3-1B인용된 비교 기준
olmOCR-Bench, 전체 점수86,385,584,5Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8
ParseBench, 다섯 범주75,174,671,4Infinity Parser Pro 74,3
fr-bench-pdf2md, 프랑스어 문서74,170,569,6Chandra 2 69,0 ; MistralOCR4.1 54,1

🔗 LightOnOCR-3 게시글

Falcon-ASR: 에미리트 아랍어를 위한 16억 매개변수, 가중치는 미공개

10월 7일 — 아부다비의 기술혁신연구소(TII)가 아랍어, 특히 에미리트 방언에 초점을 맞춘 16억 매개변수 음성 인식 모델 Falcon-ASR을 소개한다. 동일한 가중치로 영어, 프랑스어, 스페인어, 포르투갈어도 언어를 지정할 필요 없이 전사하며, 각 단어에 타임스탬프를 붙인다. 전날 소개된 Falcon-OCR-Arabic과 Falcon-Emirati처럼 시연 형태로만 제공된다. TII는 API 접근과 네이티브 애플리케이션 제공을 예고했지만 가중치는 공개하지 않았다.

단어 오류율(WER) 평가Falcon-ASR 점수인용된 비교 기준
아랍어 데이터셋 여섯 개의 평균 (Open Universal Arabic ASR)20,92 %23,17 %, 9월 30일 기준 공개된 최고 성능
에미리트 아랍어, TII 내부 평가22,73 %Qwen3-Omni, 2위, 4,07점 더 높음
영어 데이터셋 일곱 개의 평균 (Open ASR Leaderboard)5,74 %인용된 비교 기준 없음

🔗 Falcon-ASR 게시글

Carbon-A: 22 617종에 걸친 5억 6,600만 개의 유전자 후보

10월 8일 — Hugging Face의 생물학 팀(HuggingFaceBio)이 MIT 라이선스의 12억 매개변수 모델 Carbon-A를 공개한다. 이 모델은 DNA에서 단백질을 암호화하는 영역을 직접 찾아내며, 단일 모델로 포유류, 식물, 균류, 원생생물을 모두 다룬다. 기준 유전체 42개에서 평균 뉴클레오타이드 F1 점수 0,944를 달성했으며, 저자들에 따르면 AUGUSTUS, Helixer, Tiberius를 포함한 비교 대상 도구 일곱 가지를 모두 앞섰다. 팀은 GenBank의 진핵생물 유전체에 모델을 실행해 Carbon Annotation Database를 구축했다. 이 데이터베이스에는 22 617개 분류군의 유전체 조립본 48 167개와 예측된 단백질 암호화 유전자좌 5억 6,600만 개가 들어 있으며, 분류군 수는 학습 자료의 11배다. ActiveSite 및 UCSD와 함께 전체 길이 RNA 시퀀싱으로 진행한 실험실 검증에서 일부 유전자가 확인됐다. 저자들은 이것이 전사를 입증할 뿐, 단백질 생성까지 입증한 것은 아니라고 설명한다. 새로운 데이터 묶음은 3주 뒤 공개될 예정이다.

🔗 Carbon-A 게시글


강화학습: TermGrade의 환경 1 004개와 TRL v1.15.0

강화학습을 위한 두 가지가 공개됐다. 점수가 매겨진 터미널 환경과 학습 가능한 시퀀스 길이를 늘려 주는 라이브러리다.

TermGrade: 모델 여섯 개가 평가한 터미널 환경 1 004개

10월 8일 — ai&가 강화학습으로 에이전트를 학습하고 평가할 수 있는 터미널 환경 1 004개를 담은 TermGrade를 공개한다. 각 과제는 지시문과 테스트를 갖춘 Linux 컨테이너에서 실행되며, 해당 과제의 기준 풀이가 자체 테스트를 통과한 경우에만 채택됐다. DeepSeek-V4-Pro가 작성한 후보 과제 66 165개 중 1,5 %가 이 필터를 통과했다. Kimi-K3부터 gemma-4-31B-it까지 공개 모델을 사용한 여섯 가지 구성이 모든 과제를 수행했으며, 실패를 포함한 36 144번의 시도가 공개됐다. 모델은 약 두 번에 한 번 성공하는 과제에서 가장 많이 학습한다. 이 구간에 속한 과제 151개로 학습한 gemma-4-31B-it은 Terminal-Bench 2.1에서 기본 모델보다 3,1점 높은 46,1점을 기록했으며, 다섯 차례 학습의 평균 향상 폭은 2,1점이었다. 모든 자료는 Apache-2.0으로 공개됐다.

🔗 TermGrade 게시글 · Hugging Face의 TermGrade 컬렉션

TRL v1.15.0: 융합 LM 헤드로 최대 6,9배 더 긴 시퀀스 학습

10월 8일 — Hugging Face의 학습 라이브러리 TRL v1.15.0에 융합 LM 헤드(fused LM head)가 도입됐다. Triton 커널로 각 토큰의 로그 확률과 엔트로피를 직접 계산하며, 전체 logits 텐서를 생성하지 않는다. SFT, DPO, KTO, GRPO, RLOO와 증류에서 기본적으로 활성화된다. 8 192개 토큰에서 최대 메모리 사용량은 방법에 따라 52~82 % 줄어든다. 이 측정은 메모리를 79 Gio로 제한한 B300에서 무작위 가중치의 gemma-3-1b를 사용해 수행됐으며, 이 모델의 어휘 크기는 262 000개 토큰이다. 효과는 어휘 크기가 큰 소형 모델에서 가장 크다. 이번 버전에는 호환성을 깨는 변경도 있다. Python 3.10 지원이 종료되고, use_liger_kernel의 사용이 더 이상 권장되지 않으며, 실험용 MiniLLM 트레이너가 제거된다.

학습 방법v1.14.2의 최대 길이 (tokens)v1.15.0의 최대 길이 (tokens)증가 배수
DPO10 24059 392×5,80
KTO (배치 크기 2)9 21663 488×6,89
GRPO28 672114 688×4,00
RLOO23 552100 352×4,26
SFT (nll 손실)20 480107 520×5,25

🔗 TRL v1.15.0 릴리스 노트


추론: Windows ML의 llama.cpp, 오픈 소스로 공개된 ML Drift, IBM Cloud의 B300을 활용하는 Together AI

Windows PC부터 GPU 클러스터까지 모델을 실행하기 위한 세 가지 발표가 나왔다.

llama.cpp, Windows ML에 실험적으로 도입

10월 7일 — Microsoft가 Windows 행사에서 로컬 추론 프레임워크인 Windows ML에 llama.cpp의 실험적 지원을 추가한다. Hugging Face에서 GGUF 모델을 받아 특정 작업을 위한 새로운 API를 통해 동일한 Windows ML 스택으로 로컬에서 실행할 수 있다. 더 낮은 수준의 Windows 네이티브 실행 API도 실험적 프리뷰로 제공된다. Microsoft는 NVIDIA 및 커뮤니티와 함께 llama.cpp 프로젝트에 직접 기여하고 있다고 밝혔다. 최적화된 CUDA 커널, 개선된 CPU와 GPU 간 스케줄링, CUDA graphs, 추측 디코딩(Eagle-3, MTP, D-Flash2), 여러 GPU에서의 실행, NVFP4 형식 등이 포함된다. 게시글은 Surface Laptop Ultra처럼 NVIDIA RTX Spark 칩을 탑재한 PC에서 이러한 새 기능을 소개한다. llama.cpp의 게오르기 게르가노프는 X에서 프로젝트가 Windows 행사에 등장한 것을 반기며, 소프트웨어와 하드웨어 스택이 마침내 결합하고 있다는 신호로 해석했다.

🔗 Microsoft Foundry on Windows 게시글 · @ggerganov의 게시물

ML Drift: LiteRT의 GPU 엔진을 오픈 소스로 공개

10월 8일 — Google AI Edge 팀이 기기 내 추론을 위한 GPU 연산 엔진 ML Drift를 Apache 2.0 라이선스의 오픈 소스로 공개한다. 이 엔진은 OpenGL ES, OpenCL, Metal, WebGPU 사이의 차이를 추상화하고, LiteRT의 GPU 가속 엔진으로 작동하며, 독립형 라이브러리로도 제공된다. 또한 더 이상 새 기능이 추가되지 않는 TensorFlow Lite의 GPU 델리게이트를 계승한다. 엔진은 LLM이 프롬프트를 읽는지 토큰을 생성하는지에 따라 커널을 바꾸며, 코딩 에이전트가 셰이더를 작성하고 검증할 수 있도록 SKILL.md 가이드를 제공한다. 이미 실제 서비스에 사용되고 있다. 게시글에 따르면 YouTube Shorts 효과의 이미지당 지연 시간을 최대 40 % 줄이고, 모바일 Lightroom과 Photoshop에서 최대 30 %의 성능 향상을 제공한다. Google은 Gemma에서 다른 프레임워크(frameworks)보다 메모리 사용량이 최대 12 % 적다고 측정했다.

🔗 Google Developers Blog의 ML Drift 발표 · google-ai-edge/ml-drift 저장소

Together AI, IBM Cloud의 B300 GPU 추론 클러스터 첫 고객

10월 6일 — Together AI가 기업용 추론 용량을 확대하기 위해 IBM 및 NVIDIA와 협력한다고 발표했다. 첫 단계는 IBM Cloud에 호스팅되고 NVIDIA의 Spectrum-X 이더넷 네트워크로 연결된 대규모 NVIDIA B300 GPU 클러스터다. Together AI에 따르면 IBM Cloud에서 이 정도 규모의 전용 추론 클러스터는 처음이며, 자사가 첫 고객이다. Together AI는 추론 계층을 운영하고, IBM은 클라우드를, NVIDIA는 칩과 네트워크를 제공한다. Together AI는 공개 모델에 대한 수요를 이번 확장의 이유로 들었다. 매달 100만 명이 넘는 개발자에게 수백조 개의 토큰을 제공한다고 밝혔다. 게시글에는 클러스터 규모와 일정이 제시되지 않았다.

🔗 Together AI 게시글 · @togethercompute의 게시물


단신

  • Codex의 더 빠른 방향 조정 — ChatGPT 데스크톱 앱에서 Codex는 작업 중 전송된 후속 메시지를 더 일찍 반영해 접근 방식을 수정하거나 방향을 바꾼다. Follow-up behavior 설정으로 이 메시지를 현재 실행에 반영할지, 다음 실행까지 기다릴지 선택할 수 있다. 🔗 출처
  • Warp에서 ChatGPT Go 사용 — ChatGPT Go 요금제 구독자는 이제 Warp에서 터미널 관련 질문이나 코드 작업에 해당 구독을 사용할 수 있다. Warp가 인용한 OpenAI의 Sign in with ChatGPT 팀 관계자에 따르면, 모든 파트너 앱에서 Plus와 Pro 고객뿐 아니라 Go 고객도 구독에 포함된 사용량을 이용할 수 있다. 🔗 출처
  • Oracle — OpenAI의 사례 연구에 따르면 Oracle의 ChatGPT 활성 사용자는 130 000명, Codex 활성 사용자는 95 000명 이상이다. 24일 걸리던 인재 시장 조사 준비가 1520분이면 끝나며, Codex는 업무 관련 질문을 SQL 쿼리로 변환한다. 🔗 출처
  • Pollo AI — 사용자 2 600만 명 이상을 확보했다고 밝힌 이 영상 제작 플랫폼은 GPT-5.6으로 에이전트 요청을 배분하고, 어려운 작업은 GPT-6 Astra에, 모든 이미지 작업은 GPT-Image-2.5에 맡긴다. 모델을 선택하는 데 드는 시간을 50 % 이상 줄인다고 설명한다. 🔗 출처
  • 10월 7일 Devin 릴리스 노트 — 알림함에 세션 알림이 모이며 휴대전화 전송을 설정할 수 있다. 병합 대기열 상태가 앱 전체에 표시되고, 비밀 정보로 저장된 개인 키는 명령 출력에서 줄마다 가려진다. 🔗 출처
  • Copilot CLI 1.0.94 — 여섯 차례의 사전 공개 버전을 거쳐 안정 버전으로 전환됐다. 모델 선택기에 Claude Haiku 5.5를 추가하고, 불필요한 승인을 피하도록 표시된 셸 코드를 Assisted Permissions의 판정기에 전달하며, MCP 서버를 탐색하기 전에 활성화할 수 있게 한다. 🔗 출처
  • Gemini CLI v0.65.0-nightly.20261008 — 텔레메트리가 사용자 지정 OTLP 헤더(telemetry.otlpHeaders)를 지원한다. 이는 2025년 10월부터 제기된 요청이다. CLI가 검증과 OAuth 사이에서 더 이상 반복되지 않으며, 대화 기록이 항상 사용자 메시지로 끝나도록 해 /rewind 이후 발생하던 400 오류를 방지한다. 🔗 출처
  • Antigravity SDK 0.1.21, 실험적 API 분리와 하위 에이전트 스킬 설정 — 9월 21일의 0.1.18 이후 변경 기록에 처음 등재된 버전이다. @beta 데코레이터와 google.antigravity.beta 모듈이 사전 공개 기능을 안정 API와 분리하며, skills_config를 통해 하위 에이전트가 부모 에이전트의 스킬을 상속하거나 대체하거나 사용하지 않을 수 있다. 🔗 출처
  • Developer Knowledge API — Google이 개발자 문서(Google Cloud, Firebase, Android)를 최신 Markdown으로 제공하는 이 API의 생태계를 소개한다. Cloud Shell에 사전 설치된 gcloud developer-knowledge 명령, MCP 서버와 연결된 코딩 에이전트용 스킬, 일곱 언어의 라이브러리가 포함되며, Antigravity, Claude Code, Cursor, GitHub Copilot이 언급된다. 🔗 출처
  • AQuA — Google Cloud가 이 품질 에이전트(Ambient Quality Agent)를 참조 구현으로 공개한다. 운영 중인 ADK 에이전트의 세션을 최대 1 000개 추출하고, 실패를 묶어 BigQuery에서 추적하며, Gemini 3.8 Flash로 원인 진단을 실행한다. 🔗 출처
  • 초안도 풀 리퀘스트 한도에 포함 — 품질이 낮은 기여에 대응하기 위해 GitHub는 사용자별 한도에 초안 풀 리퀘스트도 포함할 수 있게 한다. 지금까지는 기여자가 초안을 한도 없이 열 수 있었다. 🔗 출처
  • 풀 리퀘스트 보관 처리 — 이제 관리자만 할 수 있는 작업이 아니다. triage, write, maintain, admin 역할이 풀 리퀘스트를 보관 처리할 수 있다. 그러면 풀 리퀘스트가 닫히고 공개 화면에서 숨겨지며, 관리자의 댓글을 포함한 모든 새 활동이 차단된다. 🔗 출처
  • GitHub 타임라인과 화면 읽기 프로그램 — github.com과 GitHub Enterprise Server 3.23에서 화면 읽기 프로그램이 이슈와 풀 리퀘스트의 타임라인을 목록으로 탐색하면서 항목 수와 현재 위치를 알려주고, 불러온 이벤트도 읽어준다. 🔗 출처
  • Paper Reproductions with ML Intern — 아부바카르 아비드가 Hugging Face에서 공개 논문의 실험을 독립적으로 재현하도록 에이전트에 맡기는 기능을 발표한다. Paper Pages에서 시작해 공개 결과물을 만들며, 이를 통해 신뢰할 만한 연구를 식별하도록 돕는다. 수치나 문서는 공개되지 않았다. 🔗 출처
  • SSH로 이용하는 Hugging Face 채팅 — Hugging Face 인프라 책임자 아드리앵 카레이라가 ssh chat.hf.co 명령으로 접속하는 개방형 모델 채팅을 소개한다. 설정이나 키가 필요 없으며, 별도의 문서나 모델 목록은 제공되지 않았다. 🔗 출처
  • huggingface_hub 2.2.0 — 소규모 수정 버전이다. hf jobs stats는 이제 스냅샷을 반환한 뒤 제어권을 돌려준다(실시간으로 추적하려면 -f 사용). 모든 병렬 다운로드가 hf_xet를 거치며, 두 가지 변경 사항으로 기존 호환성이 깨진다. 🔗 출처
  • swarmlab — Hugging Face가 별도 발표 없이 공개한 이 시험 환경은 여러 공급업체의 LLM 에이전트 군집이 통신 구조, 지연, 역할에 따라 어떻게 진실을 찾거나 의견이 갈리는지 연구한다. YAML 한 줄이면 가설을 시험할 수 있다. 🔗 출처
  • Darwin-27B-ZTC — VIDRAFT가 토큰을 생성하지 않고 한 번의 처리로 가능한 답변들의 확률 분포를 반환하는 판정기를 Apache-2.0으로 공개한다. 개발진에 따르면 typed-decisions의 판단 2 000건에서 제로샷 정확도 0,743과 Brier 점수 0,097을 기록했다. 🔗 출처
  • Superfluid — basecompute가 OpenAI, Anthropic, Ollama의 API와 호환되는 이 로컬 LLM 서버를 Apache-2.0으로 공개한다. 에이전트 작업보다 대화형 질문을 우선 처리하며, 개발진에 따르면 에이전트 여덟 개가 활성화된 상태에서 응답 시간이 0,36초로, llama-server의 10초 이상보다 짧다. 🔗 출처
  • funes 1.8.0 — 코딩 에이전트의 세션을 색인하는 이 도구에 다국어 임베딩 모델이 추가됐다. 중국어 대화 2 000건에 관한 질문 30개에서 올바른 대화가 상위 여덟 개 결과에 포함된 횟수가 23회에서 30회로 늘었으며, 평균 역순위는 0,601에서 0,983으로 상승했다. 🔗 출처
  • GLiNER와 인도 언어 — 한 커뮤니티 글에 따르면 재학습 없이 단어 안의 결합 문자를 보존하는 것만으로 아홉 개 인도 언어에서 GLiNER2의 평균 제로샷 F1이 13,2에서 68,0으로 상승했고, 힌디어로 미세 조정한 모델의 F1은 59,9에서 82,6으로 높아졌다. 🔗 출처
  • Multilingual Terminal-Bench — LILT가 열 개 언어로 구성된 코드 작업 324개의 벤치마크를 상세히 소개한다. Claude Opus 5.5는 토큰을 30 % 적게 사용하면서 Opus 5보다 약 3점 높은 성능을 보이며, 작업당 비용은 약 45 % 낮다. Gemini 3.8 Flash의 작업당 상호작용 횟수 중앙값은 41회로, GPT-6 Sol의 5회와 대비된다. 🔗 출처
  • GPU 집단 통신 기본 연산 — 밀로시 코틀라르는 RTX 4090 네 개에서 다섯 가지 기본 연산의 통신 시간을 평균 오차 10,9 %로 예측한다. 공통 모델의 평균 오차는 22,9 %지만, 최악의 경우에는 오차가 61,6 %에 달한다. 🔗 출처
  • 영상 추론의 Best-of-N — facebookresearch가 별도 발표 없이 비상업적 라이선스 CC BY-NC 4.0으로 「선택할 것인가, 해결할 것인가?」 연구의 코드를 공개한다. 영상 추론에서 best-of-N 선택과 검증기 심사단을 다루는 연구다. 🔗 출처
  • KDD Cup 2026 Data Agents — NVIDIA가 소형 LLM 사용이 의무인 조건에서 KGMON 팀을 2위에 올려놓은 실행 환경을 상세히 소개한다. 데이터를 SQLite 테이블로 변환하고, 스키마를 처음부터 제공하며, 소수의 도구와 문서의 필요한 부분만 읽는 방식을 사용한다. 글에는 점수나 모델 이름이 제시되지 않았다. 🔗 출처
  • Microduck — Pollen Robotics의 마티외 라페르가 자체 제작한 새 전자기판을 탑재한 이 소형 이족보행 로봇이 2 600 mAh 배터리로 세 시간 이상 작동한다고 발표한다. 프로세서의 최고 온도는 기존 114 °C 대신 60 °C에 그친다. 🔗 출처
  • Suno의 앨범 — 10월 5일 소개된 기능이 서비스에 적용됐다. 자신의 곡들을 하나의 완성된 발매작으로 묶고, 표지를 선택하고, 곡 순서를 정한 뒤 원하는 시점에 공개할 수 있다. 적용 요금제나 곡 수 제한은 명시되지 않았다. 🔗 출처
  • HeyGen과 라이언 서핸트 — HeyGen이 Netflix 시리즈 Owning Manhattan에 출연한 부동산 중개인 라이언 서핸트의 공식 아바타가 진행하는 일일 영상 시리즈를 Instagram, TikTok, X에서 시작한다. 금전적 조건은 공개되지 않았다. 🔗 출처
  • Runway와 Tech Coalition — Runway가 온라인 아동 성 착취에 대응하는 이 연합과 플랫폼 간 신호 공유 프로그램 Lantern에 참여한다. 데이터 필터링, 적대적 테스트, 해싱, NCMEC 신고, C2PA 출처 정보 등 자사의 안전장치도 다시 소개한다. 🔗 출처
  • SpaceXAI와 Omarchy — SpaceXAI가 Grok 토큰 150만 달러 상당을 제공하며 Omacom Foundation의 창립 후원사가 된다. Grok 4.7과 후속 모델은 풀 리퀘스트를 검토하는 Omabot을 비롯해 프로젝트의 에이전트들을 구동한다. 🔗 출처
  • Perplexity의 안전장치 가이드 — Perplexity가 입력, 에이전트의 행동, 출력이라는 세 단계에 AI 안전장치를 배치하는 가이드를 공개한다. 다섯 가지 보호 유형을 비교하고 프롬프트 주입부터 환각까지 일곱 가지 사례를 설명한다. 새로운 기능은 없다. 🔗 출처
  • OpenRouter의 pplx-decider-v1.1-27b — Perplexity의 가중치 공개 의사결정 모델이 Decisions API와 같은 요금으로 OpenRouter에 제공된다. 입력 토큰 100만 개당 0,02달러, 출력은 무료이며, 컨텍스트는 262 000토큰이다. 🔗 출처
  • 오타와의 Cohere — Cohere가 랜스다운 공원 인근에 오타와 첫 사무실을 연다. 이미 약 30명의 직원이 사업화, 엔지니어링, 인프라, 보안, 주권 AI 분야에서 일하고 있다. 사무실 면적이나 인원 목표는 공개되지 않았다. 🔗 출처

이것이 의미하는 것

이제 어시스턴트는 답변을 넘어 실제 작업물을 만든다. Claude Dashboards의 대시보드는 데이터가 바뀌면 갱신되고, Claude Motion의 애니메이션은 코드로 작성되므로 단어 단위로 계속 수정할 수 있다. 모든 요금제에서 베타를 벗어난 Docs, Slides, Design은 이미 4 500만 건 이상의 창작물이 만들어졌다고 밝힌다. 이렇게 만든 작업물은 기존 도구로 이어진다. 대시보드는 Grafana나 PostHog로, 애니메이션은 Runway나 Luma로 옮겨지며, 이들 영상 도구는 생성된 장면을 추가한다. ElevenLabs의 Brand Kit도 같은 방식을 따른다. 시각 디자인 지침이 매번 프롬프트에서 반복해야 하는 지시 대신, @로 호출할 수 있는 작업 공간의 항목이 된다.

보안은 방어와 규칙 집행 양쪽에서 규모가 달라지고 있다. Anthropic은 취약점 찾기가 어느 때보다 쉬워졌다고 설명한다. 여섯 달 동안 후보가 29 000건 이상 발견됐고, 그중 약 6 000건을 사람이 직접 선별했다. OSS Scanner는 이 병목을 완화하기 위해 사람의 재검토 없이 보고서를 보내는 방식을 채택하며, 보고된 취약점의 90 % 이상이 실제 취약점일 것으로 예상한다. 사용 규칙도 함께 구체화되고 있다. Anthropic의 2026년 정책은 기만적 활동을 별도 항목으로 묶고, OpenAI는 Dark Clark를 보고서 발간을 시작한 이래 처음으로 와해시킨 5등급 작전이라고 소개한다. 도구 측면에서는 Claude Code 2.1.295가 이제 훅이 실패할 때 동작을 통과시키는 대신 차단한다.

속도와 가격은 사용자가 선택하는 설정이 되고 있다. Ultrafast는 최대 8배 빠른 GPT-6.1 Sol을 6배 높은 가격에 제공한다. GitHub와 Cognition에 따르면 Claude Haiku 5.5는 코드 작업에서 Sonnet 5와 같거나 더 나은 성능을 보이며, Cognition에 따르면 작업당 비용은 약 8분의 1이다. Nano Banana 2.1은 1K 이미지 가격을 절반으로 낮춘다. 추론은 Windows ML의 llama.cpp와 휴대전화 및 컴퓨터 GPU의 ML Drift 같은 기기 환경부터, Together AI가 IBM Cloud에서 첫 고객으로 이용하는 B300 클러스터까지 확대된다. TRL은 8 192토큰으로 학습할 때 최대 메모리 사용량을 52~82 % 줄인다.

마지막으로, 오늘 제시된 수치 중 상당수는 이를 발표한 당사자가 직접 측정한 것이다. FrontierCode는 Cognition의 독자 벤치마크이고, GitHub는 수치를 공개하지 않은 채 Haiku 5.5가 Sonnet 5와 같다고 말한다. LightOn은 모든 선두 모델의 점수를 바꾸는 정규화 이후에 자사 점수를 계산하고, TII는 에미리트 방언의 Falcon-ASR을 내부 데이터셋으로만 평가하며 가중치를 공개하지 않는다. Carbon-A의 개발진도 직접 일곱 가지 도구와 비교한다. 개방형 과학은 이에 다른 관점을 제공한다. TermGrade는 실패를 포함한 36 144건의 시도를, Carbon-A는 후보 유전자 5억 6 600만 개의 데이터베이스를 공개한다. Claude Science의 자외선 지도는 측정값과 예측값을 픽셀마다 구분한다. Genesis Mission을 위한 Anthropic의 1억 5 000만 달러와 NVIDIA의 10억 달러도 같은 방향을 향한다. 연구자들이 이 도구들을 직접 사용할 수 있게 하는 것이다.


출처