검색

Wan 3.0이 한 번의 패스로 30초를 생성하고, NVIDIA는 와트당 작업량에서 최대 30배의 피크를 측정하며, Mistral은 HUMAIN과 협약을 체결하다

인공지능으로 생성된 기사
Wan 3.0이 한 번의 패스로 30초를 생성하고, NVIDIA는 와트당 작업량에서 최대 30배의 피크를 측정하며, Mistral은 HUMAIN과 협약을 체결하다

ai-powered-markdown-translator

gpt-5.4-mini로 fr에서 ko로 번역된 기사.

GitHub에서 프로젝트 보기 ↗

8월 24일은 모델 못지않게 하드웨어의 날이기도 하다. NVIDIA는 같은 Hot Chips 발표 묶음에서 인프라 관련 3건의 발표를 내놓았다. Vera Rubin NVL72의 실리콘 상 첫 측정, Groq 3 LPX의 양산 돌입, NVLink Fusion을 통한 타사 칩 플랫폼 개방이다. Alibaba는 한 번의 패스로 30초 분량의 네이티브 비디오를 생성하는 Wan 3.0을 출시했다. 그리고 같은 날 미국 외의 두 연구소가 국가 기관과 함께 모습을 드러냈다. 사우디아라비아의 HUMAIN과 Mistral, 일본 방위성과 Sakana AI다. 여기에 Anthropic의 MCP 커넥터용 기업 승인 일반 공개, Kiro에 GPT-5.6의 추가, 음성 에이전트 관련 일련의 발표가 더해졌다.


Wan 3.0, 한 번의 패스로 30초 네이티브 생성

8월 24일 — Alibaba가 비디오 모델의 새 세대인 Wan 3.0을 출시했다. 가장 눈에 띄는 변화는 지속 시간이다. 이 모델은 여러 장면을 이어 붙이는(stitching) 과정 없이 한 번의 패스로 30초의 네이티브 영상을 생성한다. 지금까지는 10초 남짓을 넘기려면 여러 구간을 따로 생성한 뒤 이어 붙여야 했고, 그 과정에서 빛, 질감, 얼굴의 일관성이 흔들리는 문제가 생겼다.

두 번째 축은 멀티모달 입력이다. Wan 3.0은 최대 20개의 참조 자산을 받아들이고, 이미지·오디오·비디오 외에도 문서와 웹 페이지를 분석한다. 공식 페이지는 이를 옴니모달 창작(Omni-Creation)이라고 부른다. 실제로는 텍스트 설명보다 브랜드 자료 폴더를 넣어 주는 방식에 가깝다.

이 모델은 동기화된 네이티브 오디오도 생성한다. 음성, 효과음, 앰비언스가 영상과 함께 동시에 만들어지며, 나중에 덧붙이는 방식이 아니다. 정지 이미지 측면에서는 Wan 3.0이 최대 9장의 이미지를 하나의 구성으로 합치고, 스타일과 주제가 일정한 12장의 연속 이미지를 생성하는데, 이는 명시적으로 스토리보드와 광고 변형 제작을 겨냥한 기능이다.

업무용 사용에서 덜 화려하지만 중요한 능력도 두 가지 있다. 12개 언어에 걸친 긴 텍스트 렌더링은 그래프, 수식, 인포그래픽까지 지원해 보통 비디오 모델이 실패하는 영역을 메우고, 정밀한 색 보정 제어는 브랜드 가이드라인 준수의 핵심 조건이다.

생태계도 같은 날 따라붙었다. Wan 3.0은 fal, Leonardo.Ai, Scenario, RunningHub, Venice, TapNow, DeeVid, Pixmax 및 Pika API Club에서 첫날부터 이용 가능했다.

발표된 기능Wan 3.0의 값
네이티브 지속 시간한 번의 패스로 30초, 이어 붙이기 없음
참조 자산최대 20개, 문서와 웹 페이지 분석 포함
오디오영상과 함께 네이티브로 생성되는 동기화 오디오
텍스트 렌더링12개 언어의 긴 텍스트(그래프, 수식, 인포그래픽)
이미지 합성최대 9장을 하나의 구성으로
연속 이미지스타일과 주제가 일관된 최대 12장의 순차 이미지

🔗 Wan 3.0 — 공식 페이지


NVIDIA, Vera Rubin NVL72에서 와트당 작업량 최대 30배 측정

8월 24일 — Hot Chips 컨퍼런스를 맞아 NVIDIA가 Vera Rubin NVL72의 실리콘 상 첫 성능 측정을 공개했다. 강조된 수치는 데이터센터 경제성과 직결된다. DeepSeek V4 Pro 모델에서 GB300 NVL72 세대 대비 메가와트당 처리량이 최대 30배 높고, 백만 토큰당 비용은 최대 35배 낮다는 것이다.

방법론도 결과 못지않게 중요하다. NVIDIA는 1,000~8,000 토큰 길이의 시퀀스를 기준으로 맞춘 전통적 추론 측정치를 제외했다. 에이전트 세션에서는 컨텍스트가 누적되어 입력이 수십만 토큰까지 치솟기 때문이다. 그래서 측정은 실제로 기록된 에이전틱 코딩 세션 작업 부하인 SemiAnalysis AgentX로 진행됐으며, 도구 호출과 서브에이전트도 그대로 유지됐다. 단, 두 가지 단서가 있다. 수치는 SemiAnalysis의 검토를 기다리고 있고, Vera CPU의 기여분은 아직 포함되지 않았다.

이 주장의 근거는 OpenRouter의 통계에 있다. 에이전틱 작업 부하는 단순 채팅 요청보다 15배 더 많은 토큰을 소비한다. 에너지 제약이 있는 AI 공장에서는 핵심이 분명하다. 메가와트당 처리량이 매출을 결정하고, 백만 토큰당 비용이 마진을 결정한다. DSX MaxLPS 기술은 여기에 더해 같은 메가와트 예산에서 최대 40% 더 많은 GPU를 투입할 수 있게 한다.

이러한 향상은 추론 최적화의 누적으로 나온다. 컨텍스트 처리와 응답 생성을 분리하는 분리형 서비스, 단계적 오프로딩이 적용된 분산 KV 캐시, MegaMoE 같은 융합 CUDA 커널, 그리고 가중치를 4비트로 압축하는 NVFP4 양자화가 그것이다. 전체 플랫폼은 Rubin GPU를 포함해 7개의 칩으로 구성된다.

측정 비교발표된 향상치
Vera Rubin NVL72 대 GB300 NVL72(메가와트당 처리량)최대 30배
Vera Rubin NVL72 대 GB300 NVL72(백만 토큰당 비용)최대 35배 저렴
GB300 NVL72 대 Hopper(메가와트당 처리량)최대 15배
DSX MaxLPS같은 메가와트 예산에서 GPU 40% 추가

🔗 Vera Rubin NVL72와 에이전틱 워크로드


Groq 3 LPX, 본격 양산 돌입, Nebius와 SpaceXAI는 Vera Rubin 채택

8월 24일 — 같은 Hot Chips 발표 묶음의 두 번째 내용이다. NVIDIA Groq 3 LPX 랙 스케일 시스템이 Vera Rubin NVL72의 확장 형태로 본격 생산에 들어간다.

기준 수치는 Gemma 4 31B에 대한 Artificial Analysis 벤치마크에서 나왔다. 100,000 토큰의 긴 컨텍스트에서 초당 3,400 출력 토큰을 기록해, 가장 가까운 대안 플랫폼보다 4배 빠르다. 겨냥한 문제는 명확하다. 디코딩 지연이다. 에이전트는 응답을 토큰 단위로 생성하며, 아주 작은 지연도 작업 체인의 길이를 따라 증폭된다.

역할 분담도 분명하다. Rubin GPU는 대규모 컨텍스트를 처리하고, LPX는 지연에 민감한 디코딩을 가속한다. 하나의 랙은 칩 간 직접 연결로 묶인 256개의 LP30 가속기를 수용할 수 있다.

채택 사례로는 세 곳이 언급된다. Nebius는 Token Factory에 Groq 3 LPX를 통합한 첫 AI 클라우드이고, CoreWeave는 Vera Rubin 랙 상호연결을 위해 Spectrum-X Multiplane을 생산 환경에 배치했으며, SpaceXAI는 에이전틱 AI 뒤에서 오케스트레이션, 도구 호출, 코드 실행을 위해 NVIDIA Vera CPU를 채택하고 있다. 또한 지상 데이터센터에서 궤도 위 위성에 이르기까지 Vera Rubin을 중심으로 아키텍처를 구축할 의도를 밝혔다.

네트워크 측면에서 보면, 현재 최대 규모의 클러스터를 넘어서는 데는 지금까지 배선, 광학, 전력, 지연 측면에서 비용이 큰 3번째 계층이 필요했다. Spectrum-X Multiplane은 대신 각 서버의 연결을 여러 독립 경로, 즉 플레인으로 나누며, 각 플레인은 자체 2계층 네트워크를 운용한다.

측정된 요소발표된 값
Gemma 4 31B 위 Groq 3 LPX, 100k 컨텍스트초당 3,400 출력 토큰, 가장 가까운 플랫폼의 4배
Groq 3 LPX 랙최대 256개 LP30 가속기, 칩 간 직접 연결
Spectrum-X Multiplane2계층에서 최대 512,000 GPU
8개 중 1개 플레인 손실대략 90%의 대역폭 유지
하드웨어 복구소프트웨어 로드 밸런싱보다 11배 빠름, 생산성 1.6배

🔗 Groq 3 LPX, Spectrum-X 및 NVLink Fusion


8월 24일 — 이날의 세 번째 NVIDIA 기사다. NVLink Fusion은 맞춤형 칩(XPU)을 72개 가속기 규모의 NVLink 스케일업 도메인에 편입시킨다. 여섯 번째 세대의 NVLink는 표준 Ethernet 기반 솔루션보다 종단 간 지연이 3배 낮고, 패킷 처리량은 10배 높다. 로드맵은 최대 1,152개 가속기 도메인과 코팩지드 광학을 예고한다. NVLink-C2C는 XPU를 Vera CPU 또는 다른 CPU와 연결하며, PCIe 인터페이스 대비 최대 6배의 에너지 효율을 제공한다.

핵심 논리는 분리다. AI 공장의 계획은 에너지, 건물, 냉각, 랙, 네트워크를 먼저 정한 뒤에야 가속기 구성이 확정된다. 특정 칩에만 묶인 데이터센터는 일정 리스크가 된다. 채택자들은 MGX 랙 아키텍처와 공급망을 재사용한다. 언급된 파트너는 Intel, MediaTek, GUC, QCT, Annapurna Labs다.

🔗 NVLink Fusion과 XPU


Mistral과 HUMAIN, 사우디아라비아의 주권형 AI를 위해 협약 체결

8월 24일 — Mistral이 사우디아라비아의 인공지능 기업 HUMAIN과 전략적 협력을 발표했다. 범위는 계산 인프라, 고급 모델 개발, 그리고 왕국과 지역 내 솔루션 배포다. Mistral에 따르면 이 협력은 수억 유로 규모에 이른다.

초기 축은 사이버보안과 음성이며, 아랍어에서 강한 경계선 모델을 목표로 한다. Mistral은 HUMAIN의 데이터센터를 자사 로컬 컴퓨팅 수요에 활용하는 방안을 검토할 것이며, 두 파트너는 함께 왕국의 규제 산업을 겨냥한다. 이번 발표는 올여름 시작된 흐름, 즉 Microsoft와의 확장 파트너십, 이어 8월 초의 European Compute Units에 이어진 것이다. 또한 보도자료는 이를 이후 상업 계약에 종속되는 장래 진술로 명시하고 있다.

Control is becoming the defining topic in enterprise AI adoption. Across the world, and especially in regulated industries, organizations want the benefits of AI without giving up control over their sensitive data and systems.

🇰🇷 기업 AI 도입에서 통제가 결정적인 주제가 되고 있습니다. 전 세계적으로, 특히 규제 산업에서는 조직들이 데이터와 민감한 시스템의 통제를 포기하지 않으면서 AI의 이점을 원하고 있습니다.@MistralAI X에서

🔗 @MistralAI 공지 · Mistral 게시물


Sakana AI, 일본 방위성 계약 수주

8월 24일 — Sakana AI가 7월 29일에 일본 방위성(防衛省)과 체결한 계약을 공개했다. 계약 내용은 통합 분석 작업에 필요한 AI 기능의 연구와 시연이다. 프로젝트는 정보본부의 분석 장교들을 대상으로 하며, 세 가지 축, 즉 수집, 분석 역량, 문서 관리를 겨냥한다. 사용되는 핵심 기술은 해당 연구소의 AI 에이전트 기술이다.

이것이 첫 방위 계약은 아니다. 2026년 3월에는 도쿄의 이 연구소가 지휘통제 시스템의 기초 기술로 이미 선정된 바 있다. 공개 정체성이 오픈 모델에 기반한 회사라는 점을 감안하면, 이 흐름은 주목할 만하다. 현재 블로그에는 방위와 정보 분야 전용 섹션이 생겼고, Sakana AI는 이 팀을 위해 채용도 진행 중이다.

「Sakana AI株式会社は、令和8年7月29日、防衛省と「総合分析業務に必要なAI機能の調査・実証」に関する契約を締結いたしました。」

🇰🇷 Sakana AI는 2026년 7월 29일 방위성과 통합 분석 작업에 필요한 AI 기능의 연구와 시연에 관한 계약을 체결했습니다. — Sakana AI, 공식 게시물

🔗 Sakana AI — 방위를 위한 통합 분석


Anthropic, MCP 커넥터용 기업 승인 일반 공개

8월 24일 — 기업 관리 승인(enterprise-managed auth)이 MCP 커넥터에 대해 Claude Team과 Claude Enterprise에서 일반 공개로 전환됐다. 6월의 공개 베타 이후의 일이다. 해결된 문제는 구체적이다. 이전에는 MCP 커넥터를 연결하려면 두 단계가 필요했다. 관리자가 조직에 대해 활성화한 뒤, 각 사용자가 도구마다 OAuth 흐름을 거쳐야 했다. 이제 관리자는 기업의 ID 제공자를 통해 한 번만 승인하면 되고, 사용자는 이미 연결된 도구를 바로 보게 된다.

보안팀에 특히 중요한 점도 있다. 관리자는 커넥터가 항상 ID 제공자를 거치도록 강제할 수 있어, 개인 계정을 업무용 도구에 연결하는 일을 막을 수 있다. 출시 시점에 지원되는 MCP 제공자는 10개다. Asana, Atlassian, Canva, Datadog, Figma, Granola, Linear, Notion, Slack, Supabase이며, 현재 IdP는 Okta 하나다. 이 메커니즘은 독점 기술이 아니다. Model Context Protocol의 Enterprise-Managed Authorization 확장을 처음 구현한 사례다.

🔗 @ClaudeDevs 공지 · Anthropic 게시물


Boris Cherny, 사이버보안 거부를 결함으로 인정하다

8월 24일 — 역량의 세 단계에 대한 발언 다음 날, Claude Code 책임자가 보안 개발자들 사이에서 반복적으로 제기되는 두 가지 질문에 답했다. 첫 번째는 내부 모델이 우대되는 것 아니냐는 의심이다. 팀은 최종 사용자가 쓰는 것과 정확히 같은 Fable을 사용한다.

두 번째는 더 직접적이다. 사이버보안 주제에서 발생하는 거부는 완화하려 하지 않는 표현으로 결함으로 인정되며, 팀은 이를 줄이기 위해 작업하고 있다. 이는 방어적 보안이나 CTF를 실무로 다루는 이들에게 유용한 정보다. 이들은 정당한 요청에도 자주 거부에 부딪히기 때문이다. 일정은 제시되지 않았지만, 이 메시지는 이미 잘못된 양성을 줄이려 했던 Fable 5의 8월 바이오 안전장치 업데이트와도 이어진다.

We use the same exact Fable. Cyber security refusals suck, and we are working on reducing them. More to come.

🇰🇷 우리는 정확히 같은 Fable을 사용합니다. 사이버보안에서의 거부는 성가신 일이며, 이를 줄이기 위해 작업하고 있습니다. 앞으로 더 있을 것입니다.@bcherny X에서


Anthropic, 자체 애플리케이션을 자동으로 유지 관리하기 시작하다

8월 23일 — 코딩이 무엇을 뜻하는지 더 분명히 설명하라는 요구를 받자, Boris Cherny는 단순한 구분을 제시한다. coding은 코드를 작성하는 행위이고, engineering은 그 위에 있는 나머지 전부라는 것이다. 그는 전술적 작업과 전략적 작업의 경계 역시 충분히 받아들일 만한 또 다른 해석 틀이라고 인정한다.

새로운 정보는 그의 메시지 끝부분에 있다. 그는 전략적 작업의 일부가 자동화되기 시작하는 모습을 보고 있다고 말하며, 구체적인 예로 Anthropic이 자체 애플리케이션을 자동으로 유지 관리하기 시작했고, 빠르게 늘어나는 일부 고객도 마찬가지라고 한다. 여기서 중요한 뉘앙스는 더 이상 요청에 따라 코드를 생성하는 수준이 아니라, 에이전트가 프로덕션 중인 애플리케이션의 일상적 유지 관리를 맡도록 하는 단계라는 점이다. 예를 들면 의존성 업데이트, 수정 작업, API 변경에 대한 적응 등이 있다. 사용된 동사는 현재 진행 중인 배포를 설명할 뿐, 기정사실을 말하는 것이 아니며, 수치나 명명된 애플리케이션, 정확한 범위는 제시되지 않는다.

🔗 코딩과 engineering에 관한 @bcherny의 스레드


Claude Code와 함께하는 자동화된 주간 상업 요약

8월 24일 — Anthropic은 소프트웨어 개발을 벗어난 Claude Code의 내부 활용 사례에 대한 글을 공개했다. 한 현장 마케터가 월요일 아침 15분 스탠드업을 각 영업 담당자에게 Slack 메시지로 전달되는 맞춤형 주간 요약으로 대체한 과정을 소개한다.

구성은 단순하다. Claude는 MCP를 통해 BigQuery에 연결되어 있으며, 웨어하우스가 마케팅 데이터의 단일 진실 원천 역할을 한다. 더 흥미로운 것은 기술보다 방법론이다. 파일럿은 자원한 한 팀에서 시작되었고, 수신자들로부터 올라온 각 수정 사항은 프롬프트의 명시적 규칙으로 바뀌었다. 첫 주가 끝날 무렵 이 프롬프트에는 9개의 콘텐츠 규칙이 있었고, 각각은 특정 피드백에 추적 가능했다. 각 메시지는 수신자의 계정 목록을 바탕으로 생성되므로, 두 메시지가 결코 같지 않다. 이후 BDR(business development representatives)들은 자신들만의 변형을 요청했다.

🔗 Claude Code로 만든 맞춤형 주간 요약


GPT-5.6, AWS의 개발 에이전트 Kiro에 탑재되다

8월 24일 — GPT-5.6 전체 패밀리인 Sol, Terra, Luna가 AWS의 소프트웨어 개발 에이전트 Kiro에서 사용 가능하다. 강조되는 지점은 순수 성능이 아니라 가격 대비 성능이다. OpenAI와 AWS가 공동으로 진행한 Terminal-Bench 2.1 테스트에서 GPT-5.6 Terra는 성공한 작업을 약 82% 더 낮은 비용으로 수행한다.

제시되는 설명은 Kiro의 방식인 spec-driven development에 있다. 이 도구는 상위 수준의 의도를 요구사항, 기술 설계, 실행 가능한 작업으로 변환하며, 이를 통해 모델을 처음부터 구체적인 맥락에 고정하고 잘못된 방향으로 새는 것을 줄인다. OpenAI는 목표로 하는 사용 사례를 자세히 설명한다. 구조화된 구현 계획, 다단계 코드 작업, 저장소 맥락, 변경 적용 전 점검 지점 등이다. 코드 에이전트 생태계를 지켜보는 입장에서는, 이번 발표가 무엇보다 GPT-5.6 계열이 OpenAI의 표면을 넘어 확산되고 있음을 보여준다는 점이 핵심이다.

🔗 Kiro의 GPT-5.6


Codex, Chrome DevTools Protocol 접근이 가능한 개발자 모드를 추가하다

8월 24일 — ChatGPT와 Codex의 변경 로그에 에이전트가 구동하는 브라우저를 중심으로 한 여러 새 기능이 추가됐다. 가장 큰 것은 Browser use용 개발자 모드로, Chrome과 Codex의 내장 브라우저 모두에서 사용할 수 있다. 이 모드는 Chrome 개발 도구가 사용하는 인터페이스인 Chrome DevTools Protocol에 대한 통제된 접근을 제공한다. 이를 통해 에이전트는 화면에서 읽는 것에만 머무르지 않고 성능을 프로파일링하고, 네트워크 트래픽, 콘솔 출력, 페이지 상태를 디버깅할 수 있다.

같은 프로토콜은 속도 향상에도 쓰인다. Browser use는 DOM 스냅샷 덕분에 브라우저와의 왕복을 줄여 최대 2배 더 빨라진다. 또한 예약된 자동화는 이제 선택된 승인 모드를 준수해, 무인 실행에서 거슬리던 불일치를 바로잡는다.

변경 로그의 새 기능발표된 범위
Browser use용 개발자 모드Chrome 및 Codex 내장 브라우저, 제어된 CDP 접근
가속된 Browser use최대 2배 더 빠름(CDP 최적화 및 DOM 스냅샷)
명령어 /init애플리케이션을 구성하며, Codex CLI와 동일하게 동작
Computer UseEEA, 영국, 스위스를 제외한 기업
Windows에서의 Computer Use 제어애플리케이션별로 구성 가능

🔗 ChatGPT 및 Codex 변경 로그


Gemma 4 Good Challenge의 수상작들

8월 24일 — Google은 Gemma 4 Good Challenge의 결과를 공개했다. 이 Kaggle 대회는 개발자들에게 자사의 오픈 모델로 실제 문제를 해결하도록 요구했고, 6주 동안 1,600개가 넘는 프로젝트가 제출됐다. 어려움은 모델의 품질보다 제한된 환경에서의 배포에 있었으며, 참가자들은 일반적인 하드웨어에서 실행하기 위해 LiteRT, Cactus, Ollama, llama.cpp, Unsloth를 활용했다.

수상 프로젝트들의 공통된 주제는 오프라인 동작과 설계 단계부터의 프라이버시다. GEM-4는 노인 및 장애인을 위한 로봇 보조 비서로 1위를 차지했다. Gemma 4 31B가 훈련 비디오 시퀀스에 주석을 달고, 미세 조정된 E2B 컨트롤러가 관찰과 지시를 동작으로 변환한다. 특수 부문 수상작 중 Gem-Care는 Gemma 4 E2B를 미세 조정해 비표준 발화를 복원하고 단어 오류율을 32.7%에서 19.0%로 낮췄다. PreVillage는 Raspberry Pi 5에서 초당 7.5 토큰의 속도로 네팔어 로마자 표기 대화 라우팅을 제공한다.

🔗 Gemma 4 Good Challenge 수상 프로젝트


ADK가 음성 에이전트를 기본적으로 평가하다

8월 24일 — Google의 Agent Development Kit은 이제 텍스트 에이전트와 같은 루프 안에서 라이브 및 음성 에이전트 평가를 지원한다. 원리는 이렇다. 사용자 시뮬레이터가 발화 턴을 말하면 Gemini TTS가 이를 합성해 에이전트로 스트리밍하고, 에이전트의 음성 응답은 자동으로 채점된다. 라이브 모드는 live_model_config 블록의 존재만으로 활성화되며, 이 블록이 없으면 같은 테스트 케이스가 텍스트 모드로 실행된다.

테스트 케이스는 두 가지 스타일로 나뉜다. 하나는 페르소나가 계획에 따라 즉흥적으로 턴을 생성하는 시나리오이고, 다른 하나는 한 단어 한 단어까지 스크립트된 고정 대화다. 채점은 자연어 기준으로 구성된 LLM 판정자를 통해 이뤄지며, 이 기준은 한 번 작성되면 전체 세트에 적용된다. 실행은 adk eval 또는 AgentEvaluator로 이루어져 음성 평가를 CI/CD 파이프라인에 삽입할 수 있다. ADK Web은 표준 모드와 라이브 모드 사이의 전환을 추가하고, 오디오 스트림에서 전사를 재구성하며, 각 턴에 재생 가능한 오디오 클립을 붙인다.

🔗 ADK에서 음성 에이전트 평가하기


Grok Voice Think Fast 2.0, Speech-to-Speech 인덱스 선두에 서다

8월 24일 — xAI는 Grok Voice Think Fast 2.0이 Artificial Analysis의 Speech-to-Speech 인덱스에서 1위를 차지했다고 발표한다. 이 인덱스는 되돌려지는 음성의 품질보다, 음성 에이전트가 들은 내용을 바탕으로 추론하고, 실제 고객 문제를 해결하며, 도구를 호출해 작업을 끝까지 수행하는 능력을 측정한다.

이 모델이 오늘 갑자기 나온 것은 아니다. 소개 글은 7월 29일자다. xAI가 이번에 알리는 것은 순위와 생산 현황 수치다. 같은 그룹의 자회사인 Starlink에서는 Grok Voice가 하루 15,000건이 넘는 지원 및 영업 인바운드 전화를 처리하고, 음성과 채팅을 합쳐 주당 3,000건 이상의 주문을 완료한다. Think Fast 계열은 추론을 음성 합성과 병렬로 수행하므로, 지능에 대해 지연 시간으로 비용을 치르지 않는다.

벤치마크Think Fast 2.0GPT-Realtime-2.1 (High)Gemini 3.1 Flash (High)
AA Speech-to-Speech Quality Index82.9 %79.1 %69.5 %
τ-voice Bench (에이전트 성능)56.5 %45.7 %37.7 %
첫 소리까지의 시간0.70 s2.98 s

🔗 @SpaceXAI 발표 · x.ai 글


ElevenLabs, API 전체를 터미널로 가져오다

8월 24일 — ElevenLabs는 API 전부를 터미널에 노출하는 CLI 1.0 버전을 공개했다. 이번 발표는 개발자와 코드 에이전트, 두 집단을 동등하게 겨냥한다.

이 이중 타깃은 기술적 선택에서도 드러난다. 명령어는 발견하기 쉽게 문서화되어 있고, agent skills가 도구 안에 직접 통합되어 있으며, 출력은 구조화된 JSON으로 제공된다. 이 세 가지 조건은 에이전트가 자유 텍스트를 해석하는 대신 도구를 안정적으로 조작하게 만드는 데 필요하다. dry run 모드는 전체를 완성한다. 작업을 실행하기 전에 결과를 미리 볼 수 있게 해주므로, 자율 에이전트가 호출을 트리거할 때 유용한 안전장치가 된다. 이번 출시는 8월 17일에 제공업체가 공개한 공식 MCP 서버의 연장선에 있다.

🔗 ElevenLabs CLI v1


MiniMax, GMI Cloud에서 14일간 무제한 접근을 열다

8월 24일8월 24일부터 9월 6일까지, MiniMax는 GMI Cloud에서 자사 모델에 대한 무제한 접근을 제공한다. 언어 모델은 M3와 M2.7, 오디오 쪽은 Speech 2.8과 Music 3.0이다.

주목할 점은 단순한 상업적 프로모션을 넘어선다. 8월 21일까지만 해도 MiniMax는 모델 M3의 도래를 암시하는 모호한 발표만 내놓았을 뿐, 구체 사양이나 날짜는 없었다. 사흘 뒤 M3는 날짜가 명시된 제공 상품 안에서 이름을 드러냈고, 이전 공급사 커뮤니케이션에서는 등장하지 않았던 버전 번호의 오디오 모델 두 개도 함께 소개됐다. 발표에는 벤치마크나 기술 사양이 전혀 붙지 않았다. 이는 제품 시트가 아니라 제공 개시에 가깝다.

🔗 GMI Cloud에서 14일간 무제한 접근


짧은 소식

  • Nemotron 3.5 Lightning, PinchBench 상위 4위권에 진입 — NVIDIA 모델이 표준화된 OpenClaw 에이전트 테스트에서 평균 성공률 86.4%로 오픈 웨이트 모델 상위 4위권에 들었다. Nemotron 3 Ultra는 1위를 유지한다. 🔗 @NVIDIAAI 트윗
  • Wan 3.0이 이미 Pika API Club을 통해 사용 가능 — 8월 5일에 출시된 이 집계기는 하나의 API로 100개가 넘는 모델에 접근하게 해준다. 첫날 추가는 8월 17일 Seedance 2.5에서 이미 보였던 흐름을 이어간다. 🔗 @pika_labs 트윗
  • Runway, Ruby를 플랫폼의 모든 모델로 확장하다 — 이제 Seedance 2.5, Gen-4.5, MiniMax H3의 출력이 각각 16비트 EXR 또는 ProRes와 HEVC 10비트 및 12비트로 변환되며, 생성기마다 별도의 색보정 체인이 필요하지 않다. 🔗 @runwayml 트윗
  • Runway, 샌프란시스코에서 오프라인 해커톤을 연다9월 30일, 에이전트와 애플리케이션 구축에 초점을 맞춘 행사다. 지원은 hackathon.runway.com에서 받는다. 🔗 @runwayml 트윗
  • Boris Cherny에 따르면 프롬프트 인젝션은 해결 가능한 문제였다 — 그는 버그 없는 코드 생성에 대해 계속 이야기하며 전례를 든다. 정렬 훈련과 기계론적 해석 가능성의 결합이 수년에 걸쳐 결국 이 문제를 해결했다고 말한다. 🔗 @bcherny 스레드
  • GitHub, 8월 25일 Copilot 앱 관련 웹 세미나 개최 — Pierce Boggan과 James Clancey가 참여하는 오후 6시부터 7시 CEST까지의 라이브 데모. 등록 페이지에는 rebase, 리뷰, merge까지 처리하는 Agent Merge가 자세히 설명되어 있다. 🔗 @github 트윗
  • GitHub, 팟캐스트 시즌 2를 강조하다 — 이전 시즌의 진행자들과 그들이 가장 좋아한 에피소드를 소개하는 영상이며, 제품 발표는 없다. 🔗 @github 트윗
  • Nous Research 포털에서 Grok 4.6 절반 가격 제공 — 일주일 동안 50% 할인. 오픈 소스 에이전트 Hermes와 함께 사용하거나 기존 SuperGrok 또는 X Premium+ 구독으로 이용할 수 있다. 🔗 @SpaceXAI 트윗
  • Codex Live Build, 음성 기반 제어를 강조하다 — X에서 창작자 Alex Finn과 함께하는 라이브 세션으로, 데스크톱과 모바일의 Codex에서 키보드 없이 작업하는 방식을 다룬다. 기능 발표는 없는 시연이다. 🔗 @OpenAIDevs 트윗
  • HeyGen, 부동산 영상용 프롬프트 가이드를 공개하다 — 시네마틱 품질의 아바타 영상을 위한 프롬프트 작성법으로, 자사의 부동산 시리즈를 잇는다. 🔗 @HeyGen 트윗
  • 미국 국립공원 110주년, Maps·Search·Gemini와 함께 — Google은 검색 트렌드(초보자 하이킹 관련 쿼리가 한 달 사이 165% 증가)와 AI Mode, Ask Maps, Gemini Live의 여행 준비 사용 사례를 교차 분석한다. 새로운 기능은 없다. 🔗 blog.google 글

의미하는 바

소프트웨어 활용에 초점을 맞춘 여러 날이 지나고 나니, 이제 다시 하드웨어가 전면에 나섰다. 그리고 측정하는 대상도 달라졌다. NVIDIA는 1,000~8,000 토큰 시퀀스를 기준으로 보정한 추론 지표를 명시적으로 배제하고, 대신 실제로 기록된 에이전틱 코딩 세션, 즉 증가하는 컨텍스트, 툴 호출, 서브에이전트를 모두 포함한 세션을 선호한다. 계량 단위도 같은 방향으로 이동한다. 더 이상 원시 처리량이 아니라 메가와트당 작업량, 그리고 백만 토큰당 비용이다. 제약은 더 이상 사용 가능한 실리콘이 아니라, 그 실리콘에 공급할 수 있는 에너지다. GPU/LPU의 분담도 다른 각도에서 같은 이야기를 전한다. 한쪽은 컨텍스트 처리, 다른 쪽은 지연시간에 민감한 디코딩이다. 에이전틱 추론이 더 이상 균질한 부하가 아니기 때문이다.

오늘의 두 번째 신호는 플랫폼의 개방이다. NVLink Fusion은 다른 회사가 설계한 칩을 연결하고, SpaceXAI는 Vera CPU를 채택하며, Intel, MediaTek, Annapurna Labs가 파트너 목록에 올라 있다. 상업적 논리는 일정에 있다. AI 팩토리는 가속기 구성이 확정되기 훨씬 전에 전력, 건물, 냉각, 네트워크를 계획해야 하며, 가속기만이 아니라 랙, 네트워크, 툴링까지 판매하는 것은 자체 실리콘을 만드는 이들에게도 없어서는 안 될 존재가 되는 길이다.

더 의외인 점은, 같은 날 주권이 두 건의 발표에서 중심에 섰다는 것이다. Mistral은 아랍어권 모델과 사우디 데이터센터 사용을 위해 HUMAIN과 협력한다고 발표했고, Sakana AI는 일본 방위성의 정보 분석을 위해 협약을 맺었다. 미국이 아닌 두 연구소, 두 국가 기관, 하나의 논리. Mistral이 말하는 통제와 일본 정부가 말하는 정보력은 모두 선택한 관할권 안에서 학습과 추론을 실행할 수 있는 능력을 가리킨다. 공개적인 정체성이 오픈 작업에 기대고 있는 Sakana에게는, 방위 관련 전용 항목과 그에 따른 채용이 단발성 계약이 아니라 지속적인 활동 축을 시사한다.

남는 것은 조용하지만 일관된 하나의 흐름이다. 도구들은 이제 사람뿐 아니라 에이전트가 조작하도록 구조화되고 있다. ElevenLabs는 발견 가능한 명령, 구조화된 JSON, dry run 모드를 판매 포인트로 내세운 CLI를 출시했는데, 이는 명시적으로 코드 에이전트를 겨냥한 것이다. Codex는 Chrome DevTools Protocol 접근권을 얻어, 페이지의 렌더링이 아니라 실제 상태를 읽을 수 있게 됐다. ADK는 음성 에이전트가 감에 의존해 배포되지 않도록, 네이티브 음성 평가 기능을 제공한다. 그리고 Grok Voice는 순위 점수 대신 생산량 수치를 공개한다. Starlink에서 하루 15,000건의 호출이 그 예다. 매번 같은 전환이다. 프로토타입을 넘어서는 데에는 기계적으로 다룰 수 있는 인터페이스와 재현 가능한 측정이 필요하다.


출처