ai-powered-markdown-translatorgpt-6.1-sol을 사용해 프랑스어에서 한국어로 번역된 기사.
Mistral이 매개변수 1조 개를 갖춘 멀티모달 모델 Mistral Large 4의 미리보기 버전을 공개한다. API는 오늘부터 누구나 이용할 수 있으며, 가중치는 10월 말에 공개하겠다고 약속했다. Anthropic은 Google Docs, Sheets 및 Slides에 Claude를 도입하고 사이버 보안 검증 프로그램을 세 단계의 접근 권한으로 개편한다. 한편 Google DeepMind는 휴대전화에서도 실행할 수 있는 공개 멀티모달 임베딩 모델 EmbeddingGemma 2를 출시한다. 의사결정 모델 관련 소식도 이어진다. OpenAI는 Decisions API를 공개 베타로 제공하고, Perplexity는 가격을 절반으로 낮췄으며, 커뮤니티 순위표는 이들 모델의 성능을 비교한다.
Mistral Large 4: 매개변수 1조 개의 미리보기 공개, 가중치는 10월 말 공개 약속
10월 6일 — Mistral AI가 Mistral Large 4의 공개 미리보기 버전을 출시했다. 별칭은 ML4이며, “매우 공식적인” 별명은 Chonk다. 이 회사가 지금까지 선보인 모델 중 가장 크다. 기본적으로 멀티모달인 전문가 혼합(Mixture-of-Experts) 모델로, 매개변수는 1조 개(1T)이며 발표 글에 따르면 이 중 490억 개가 활성화된다. 지시 수행, 추론, 에이전트 기능을 100만 토큰의 문맥 안에서 결합한다. 문서의 모델 설명에는 차이에 대한 설명 없이 다른 수치가 제시되어 있다. 전체 매개변수는 1조 500억 개, 활성 매개변수는 520억 개이며, 여기에 16억 개의 매개변수를 갖춘 비전 인코더가 추가된다.
API는 오늘부터 Mistral Studio에서 누구나 이용할 수 있지만, 가중치는 아직 공개되지 않았다. Mistral은 아키텍처 및 사후 학습에 관한 세부 정보와 함께 10월 말까지 공개하겠다고 약속했다. 그동안 사이버 보안 책임자, 검증된 파트너, 국가 기관이 실제 환경에서 모델을 시험하고 있으며, 이들은 완화된 콘텐츠 제한으로 모델에 접근한다. ML4는 Mistral의 유럽 데이터 센터에서 3 800개의 NVIDIA Grace Blackwell GPU로 처음부터 학습되었으며, 이 데이터 센터는 미리보기 서비스도 제공한다. 회사는 유럽 법률에 따라 전 과정을 직접 운영하는 유럽 내 배포를 계획하고 있다. 또한 이 모델을 30억 유로 규모의 시리즈 D 투자로 자금을 확보한 개발 계획의 첫 이정표로 소개한다.
핵심 강점으로 내세우는 것은 사이버 보안이다. Mistral에 따르면 ML4는 Artificial Analysis Cyber Index에서 상위 다섯 모델에 포함되며, 오픈 소스 소프트웨어의 실제 취약점을 재현한 뒤 수정하는 시험에서 82 %를 기록해 모든 모델 중 최고 점수를 얻었다. 회사는 Claude Opus 5.5와 GPT-6 Astra가 같은 시험에서 작업을 거부하기 때문에 거의 0점에 가까운 점수를 받는다고 주장한다.
| 평가 벤치마크 | Mistral이 발표한 점수 | Mistral이 제시한 비교 |
|---|---|---|
| DeepSWE v1.1 | 61,7 % | — |
| Coding Agent Index (종합) | 49,8 % | DeepSeek V4 Pro 0813 및 Qwen3.8 Max보다 높음 |
| Surge AI의 블라인드 인간 평가 (코드, 5점 만점) | 3,74, 5개 중 2위 | Claude Opus 5 (4,22)보다 낮음 |
| Cybench (40개 과제) | 93 % | — |
| AA Cyber Index, 취약점 재현 후 수정 | 82 % | 모든 모델 중 최고 점수 |
| AutomationBench (657개 업무 프로세스) | 59,9 % | Kimi K3, MiMo-V2.6-Pro 및 DeepSeek V4 Pro보다 높음 |
발표 글과 문서의 모델 설명은 가격에서도 차이를 보인다. 발표 글의 카드에는 입력 토큰 백만 개당 1,36달러, 출력 토큰 백만 개당 4,18달러가 표시되어 있다. 반면 모델 설명에는 이 가격에 취소선을 긋고 그 옆에 절반으로 낮춘 가격을 표시했지만, 적용 기간이나 이유는 설명하지 않았다.
| ML4 특성 | 발표 글 기준 | 문서의 모델 설명 기준 |
|---|---|---|
| 전체 매개변수 수 | 1 000(십억 개 단위) | 1 050(십억 개 단위) |
| 활성 매개변수 수 | 49(십억 개 단위) | 52(십억 개 단위) |
| 입력, 토큰 백만 개당 | 1,36달러 | 0,68달러 (1,36에 취소선) |
| 출력, 토큰 백만 개당 | 4,18달러 | 2,09달러 (4,18에 취소선) |
이 점수는 모두 Mistral이 제시한 수치다. Mistral은 미리보기 버전의 강화 학습이 성능 정체의 징후 없이 계속되고 있으며, 앞으로 몇 주 동안 빠른 개선을 기대한다고 밝혔다.
🔗 Mistral의 Mistral Large 4 발표 글 🔗 문서의 Mistral Large 4 모델 설명
Claude for Google Workspace: Docs, Sheets 및 Slides에 도입되는 Claude
10월 6일 — Anthropic이 Claude for Google Workspace를 출시했다. Google Docs, Sheets 및 Slides의 측면 패널에서 Claude를 사용할 수 있게 해 주는 부가 기능(add-on)으로, 모든 유료 요금제에서 공개 베타로 제공된다. Claude는 열려 있는 파일을 읽고, 현재 선택한 항목인 텍스트, 셀 또는 슬라이드를 확인하며, 해당 파일을 바로 수정한다.
| Google 애플리케이션 | Claude가 수행하는 작업 |
|---|---|
| Docs | 파일에서 직접 교정 및 문체 변경, 대규모 재작성 시 적용하거나 무시할 수 있는 제안 카드 제공 |
| Sheets | 수식, 피벗 테이블, 기본 차트, 새 탭 생성, 결합이나 정리를 위해 셀 범위를 Python으로 처리 |
| Slides | 프레젠테이션의 레이아웃과 테마를 활용한 슬라이드 작성, 겹치거나 영역을 벗어나는 요소 확인 |
사용자는 자율성의 수준을 선택한다. 기본으로 활성화된 “수정 전 확인”(Ask before edits) 모드에서는 모든 수정이 승인 카드를 거친다. “모든 수정 수락”(Accept all edits) 모드에서는 Claude가 중단 없이 작업을 이어 간다. Claude 계정에 연결하면 패널에서도 같은 모델, 커넥터, 기능(skills)을 사용한다. Enterprise 요금제에서는 Compliance API, 고객 관리 암호화 키(CMEK), OpenTelemetry 감사 기록 내보내기도 이 부가 기능에 적용된다.
Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.
🇰🇷 이제 Claude를 Google Docs, Sheets 및 Slides에서 사용할 수 있으며, 이 파일들을 Claude에서도 열 수 있습니다. Google Workspace에서 Claude는 파일 옆의 측면 패널에 표시되어, 열려 있는 내용을 읽고 그 자리에서 수정합니다. 각 수정 사항이 적용되기 전에 승인할 수 있습니다. — X의 @claudeai
반대 방향의 기능도 함께 도입된다. 역시 베타로 제공되는 새로운 Google Docs, Sheets 및 Slides 커넥터를 통해 링크를 붙여 넣거나 새 문서를 요청하면 Claude에서 Google 파일을 만들고 수정할 수 있다. 지원되는 환경에서는 파일이 대화 옆의 패널에 열리며, Claude의 접근 권한은 Google의 공유 권한을 따른다. 부가 기능은 Google Workspace Marketplace에서 설치할 수 있으며, 실행 경로는 확장 프로그램 > Claude > Open Claude다. 관리자는 Google Admin 콘솔에서 이를 배포할 수 있다. Team 및 Enterprise에서는 소유자가 먼저 커넥터를 활성화해야 한다. 이로써 Google Workspace도 Microsoft 365와 함께 지원된다. Microsoft 365용 Claude의 Excel, PowerPoint 및 Word 기능은 5월 7일부터 정식 제공되고 있다.
🔗 Anthropic의 Claude for Google Workspace 발표 글
Cyber Verification Program: Anthropic, 세 단계의 접근 권한으로 Opus 5.5, Sonnet 5.5 및 Mythos 5.1 제공
10월 6일 — Anthropic이 사이버 보안 검증 프로그램(Cyber Verification Program, CVP)을 개편한다. 이 프로그램은 일반 사용자용 모델에서 차단하는 기능을 검증된 보안 전문가에게 제공한다. 지난 6개월 동안 두 제도가 병행 운영되었다. 가장 중요한 소프트웨어를 담당하는 조직에 Claude Mythos 접근 권한을 제공한 Project Glasswing과, Opus 및 Sonnet 모델의 안전장치를 완화한 단일 단계 CVP다. 이 두 제도는 세 단계로 통합되며, 모든 단계에서 Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 및 향후 모델에 접근할 수 있다. 정식 제공 모델인 Opus 5.5, Fable 5.1, Sonnet 5.5는 대부분의 사이버 보안 작업을 차단하는 신중한 안전장치를 유지한다.
| 접근 단계 | 지원 용도 | 대상 및 소요 기간 |
|---|---|---|
| Defense Access | 보안 운영 센터, 사고 대응, 악성 소프트웨어 역공학, 취약점 분석 | 보안팀, 규모와 관계없는 주요 기반 시설, 오픈 소스 유지관리자, 연구자; 며칠 |
| Red Team Access | 방어 용도와 더불어 승인된 침투 시험 및 모의 공격 훈련(red teaming) | 시험 권한이 있는 시스템을 대상으로 하는 조직만 해당; 몇 주 |
| Specialized Access | 안전 관련 시스템 시험: 항공, 전력망, 통신, 은행 간 이체, 행정망 | 미국 정부와 함께 개별 심사를 거친 일부 조직; Glasswing 참여 조직은 이관 |
Red Team Access에서도 랜섬웨어 배포처럼 물리적 피해나 대규모 장애를 일으킬 수 있는 행동은 실시간으로 차단된다. Anthropic은 설정을 검증하기 위해 각 단계의 안전장치를 적용한 Opus 5.5로 여러 단계의 사이버 보안 작업을 평가하는 CyScenarioBench를 수행했다. 과제는 10개였으며, 각각 5회씩 시도했다.
| Anthropic이 시험한 구성 (Opus 5.5) | CyScenarioBench 결과 (50회 시도) |
|---|---|
| CVP 미적용 | 모든 과제가 첫 프롬프트부터 차단됨 |
| Defense Access | 46회는 진행 중 차단, 4회는 성공 |
| Red Team Access | 차단 없음, 34개 과제 성공, 안전장치가 없는 모델의 67,6 %와 같은 수준 |
발표 글은 Glasswing의 초기 성과도 제시한다. Anthropic에 따르면 이 수치는 일부 집계 결과다. 파트너들은 4월부터 7월까지 최소 129 000개의 검증된 취약점을 발견했으며, Anthropic의 오픈 소스 분석에서 5 500개가 추가로 발견되었다. 이 중 33 000개 이상은 심각 또는 높음 등급으로 분류되었다. 수치는 파트너 보고서 33건에 근거하며, Anthropic은 실제 영향이 “최소 다섯 배 더 크다”고 추정한다. 같은 날 공개된 사례에서 Comcast는 Claude Mythos Preview로 258개 시스템과 약 1억 7천만 줄의 코드를 평가하면서 심각한 인증 취약점을 발견했다고 밝혔다. Booz Allen의 분석가 한 명은 열이틀 동안 저장소 138개를 검토했다.
실무적으로 이 프로그램은 악용을 감시하기 위한 데이터 보존을 요구한다. 올가을 후반에는 Enterprise Frontier Safeguards(EFS)를 통해 고객이 통제하는 클라우드에 이 데이터를 보관할 수 있게 될 예정이다. 이미 Fable 5.1 또는 Mythos 5.1을 데이터 보존 없이 사용하는 조직은 CVP에서도 같은 방식을 사용할 수 있다. 프로그램은 Claude Platform, Vertex AI, Microsoft Foundry에서 제공되며, Amazon Bedrock에서는 EFS 이용 자격이 있는 고객에게만 제공된다. 개인 신청은 유료 요금제의 Defense Access에만 가능하다. 이 단계에서는 12월 15일까지 피싱에 강한 다중 인증을 도입하고 API 키 사용을 중단해야 한다. 웹 세미나는 10월 14일 오전 9시 PT에 예정되어 있다.
🔗 Anthropic의 Cyber Verification Program 발표 글 🔗 Cyber Verification Program 도움말 페이지 🔗 Comcast와 Booz Allen의 Claude Mythos 활용 사례
EmbeddingGemma 2: Google의 개방형 임베딩 모델이 멀티모달로 진화하다
10월 6일 — Google DeepMind가 기기에서 실행하도록 설계한 개방형 임베딩 모델의 2세대인 EmbeddingGemma 2를 공개했다. Google에 따르면 다운로드 수가 2,000만 회를 넘은 첫 번째 EmbeddingGemma는 텍스트만 처리했지만, 새 모델은 텍스트(코드 포함), 이미지, 동영상, 오디오를 단독으로 또는 조합하여 동일한 768차원 공간에 투영한다. Gemma 4 아키텍처를 기반으로 구축했으며 Apache 2.0 라이선스로 출시된다.
Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.
🇰🇷 기기 내 임베딩을 위해 기본적으로 멀티모달을 지원하는 당사 최초의 개방형 모델, EmbeddingGemma 2를 소개합니다. 텍스트를 넘어 코드, 이미지, 오디오, 동영상을 하나의 공유 공간으로 통합합니다. — @GoogleDeepMind의 X 게시물
모델의 매개변수는 총 7억 4,000만 개지만, 모듈식으로 구성되어 있다. 2억 7,000만 개의 매개변수를 가진 텍스트 핵심 모델에 필요에 따라 비전 인코더(1억 7,000만 개)와 오디오 인코더(3억 개)를 추가한다. 따라서 텍스트 전용 애플리케이션은 매개변수 2억 7,000만 개만 불러온다. 양자화 적용 시 Google이 Pixel 11 Pro에서 측정한 활성 RAM 사용량은 텍스트 가중치의 경우 약 191메가바이트, 전체 멀티모달 모델의 경우 567메가바이트다.
| EmbeddingGemma 2의 특성 | Google이 발표한 값 |
|---|---|
| 총 매개변수 | 740M (텍스트 270M, 비전 170M, 오디오 300M) |
| 벡터 차원 | 768, 512, 256 또는 128로 축소 가능 |
| 컨텍스트 창 | 8K tokens, 첫 번째 버전의 4배 |
| Pixel 11 Pro의 활성 RAM 사용량 (양자화 적용) | 텍스트 전용 약 191 Mo, 멀티모달 567 Mo |
| MTEB Code | 78,68, 첫 번째 버전은 68,76 |
| 다국어 MTEB v2 | 61,36, 첫 번째 버전은 61,15 |
‘러시아 인형’ 방식의 표현 학습(Matryoshka Representation Learning)으로 벡터를 줄여 저장 공간을 최대 6분의 1까지 줄일 수 있다. 모델 설명서에 따르면 256차원까지 줄여도 품질에 미치는 영향이 작으며, 128차원은 주로 텍스트 전용 용도에 적합하다. 가장 뚜렷한 개선은 코드에서 나타났다. Google에 따르면 MTEB Code 점수가 거의 10점 높아졌으며, 다국어 텍스트는 이전 수준을 유지했다.
목표 용도는 완전히 기기 내에서 수행하는 검색과 검색 증강 생성(RAG)이다. 음성 메모로 동영상의 특정 구간을 찾는 작업이 한 예다. 모델이 Gemma 4의 텍스트 토크나이저(tokenizer)와 오디오 인코더를 공유하므로 두 모델을 함께 실행하면서 메모리 사용량을 줄일 수 있다. 가중치는 Hugging Face와 Kaggle에서 제공된다. Gemini Enterprise Agent Platform의 Model Garden에도 ‘곧’ 추가될 예정이지만, 날짜는 발표되지 않았다. 출시와 동시에 Transformers(버전 5.19.0), sentence-transformers, MLX, vLLM, llama.cpp, Ollama, LM Studio에서 모델을 지원하며, 브라우저에서는 transformers.js로 사용할 수 있다.
🔗 Google 블로그의 발표 🔗 EmbeddingGemma 2 모델 설명서 🔗 Hugging Face의 가중치
의사결정 모델: OpenAI의 Decisions API 공개, Perplexity의 Decider v1.1 출시와 가격 절반 인하, Decision Index 0.3의 순위 발표
자유 형식의 답변을 작성하는 대신 선택지를 고르거나 입력에 점수를 매기는 의사결정 모델에 여러 소식이 쏟아진 하루였다. 두 개발사가 제공 서비스와 요금을 개편하고, 이 분야의 커뮤니티 순위표도 평가 방식을 바꿨다.
OpenAI Decisions API 공개 베타
10월 6일 — DevDay에서 제한적으로 공개한 지 일주일 만에 OpenAI Decisions API가 공개 베타로 전환됐다. 정식 출시는 ‘앞으로 몇 주 내’로 예상된다. 유일하게 제공되는 모델인 GPT-6 Luna를 사용해 전용 엔드포인트(POST /v1/decisions)에서 텍스트, 이미지 또는 둘 모두에 관한 폐쇄형 질문에 답한다. OpenAI에 따르면 자료형이 지정된 응답을 Responses API보다 약 10배 빠르게 반환한다. 이날 새롭게 발표된 내용은 요금이다. 입력 토큰 100만 개당 0.10달러이며, 출력과 캐시에는 요금이 부과되지 않는다. 지역별 처리와 긴 컨텍스트에 대한 추가 요금은 별도다.
| 질문 유형 | 목표 용도 | 반환 결과 |
|---|---|---|
조건 판정 (predicate) | 사진 속 제품의 손상 여부처럼 특정 조건 확인 | 조건이 참일 확률, 0부터 1까지 |
선택 (choice) | 제공된 목록에서 선택지 하나 선택 | 선택된 항목, 각 항목의 확률 및 신뢰도 지표 |
점수 (score) | 사고의 심각도처럼 순서가 있는 단계로 평가 | 각 단계의 확률로 가중한 단계 평균 |
한 번의 요청에서 동일한 입력에 여러 질문을 할 수 있다. 이미지는 base64로 전송해야 하며, 호스팅된 URL이나 파일 식별자는 사용할 수 없다. API는 자격 요건을 충족하는 고객에게 데이터 무보관(Zero Data Retention)과 HIPAA 관련 사용을 지원하며, 미국과 유럽의 데이터 상주를 제공한다.
🔗 Decisions API 안내서 🔗 OpenAI API 변경 기록
Perplexity의 pplx-decider-v1.1-27b와 가격 절반 인하
10월 6일 — 자체 Decisions API를 출시한 지 5일 만에 Perplexity가 개발자 계정 @perplexitydevs의 연속 게시물을 통해 해당 API를 구동하는 모델의 업데이트를 발표했다. Hugging Face에 Apache 2.0 라이선스로 가중치를 공개한 pplx-decider-v1.1-27b는 v1의 Qwen3.8-27B 기반을 유지하며, 250k 토큰 컨텍스트에서 텍스트와 이미지를 읽고 전체 어텐션 계층의 인과 마스크(causal mask)를 제거한다. 이제 이 모델을 제공하는 Decisions API의 요금은 입력 토큰 100만 개당 0.02달러로, v1의 0.04달러보다 절반 저렴하며 출력은 계속 무료다.
| Decision Index 분류 (Hugging Face 설명서) | Jev 점수 | v1 점수 | v1.1 점수 |
|---|---|---|---|
| 지식 (지식) | 51,4 | 40,9 | 48,18 |
| 언어 (언어) | 62,0 | 63,5 | 69,45 |
| 정보 검색 (검색) | 55,4 | 54,9 | 61,26 |
| 도구 (도구) | 75,1 | 79,3 | 78,88 |
| 예술 (예술) | 37,7 | 39,4 | 44,66 |
| 가중 종합 점수 | 57,9 | 56,4 | 61,56 |
모델 설명서에 따르면 종합 점수는 56.4에서 61.56으로 올라 TypeSafe AI의 의사결정 모델 Jev가 기록한 57.9를 앞섰다. 다만 지식 분야에서는 여전히 Jev가 앞선다. Perplexity는 새로운 Decision Index 0.3에서도 최고 점수를 기록했다고 밝혔다. 직접 호스팅하려면 약 49기비바이트의 가중치를 담을 수 있는 GPU와 제공된 구현이 필요하다. 표준 인과 추론으로는 측정된 동작을 재현할 수 없기 때문이다.
🔗 @perplexitydevs의 X 연속 게시물 🔗 Hugging Face의 pplx-decider-v1.1-27b
Decision Index 0.3
10월 6일 — Hugging Face 엔지니어 apolinario가 Jev의 Decision Model을 재현하는 개방형 의사결정 모델의 커뮤니티 순위표인 Decision Index의 0.3 버전을 공개했다. 이제 NVIDIA RTX PRO 6000에서 실행되는 모델 112개를 포함하며, 그중 111개는 개방형 재현 모델이다. 평가 방식도 바뀐다. 전체 점수(전체 점수)는 공개 벤치마크 37개, 동일한 역량을 측정하는 비공개 테스트, 새로운 분야의 비공개 과제를 결합한다. 알려진 벤치마크에서의 성적뿐 아니라 역량이 순위에 반영되도록 하기 위해서다. 비전 탭도 새롭게 추가됐다.
| 표시 순위 | 순위에 오른 모델 | 전체 점수 |
|---|---|---|
| 1 | Perplexity Decider v1.1 (27B) | 62,8 |
| 2 | Fastino GLiDE 추론 미사용 (28B) | 60,2 |
| 기준 모델 | Jev | 60,1 |
| 3 | Torchcast Decision 27B | 59,9 |
| 4 | deck31b (Gemma 4 31B) | 59,0 |
Decider v1.1의 두 점수는 서로 다른 결과다. 61.56은 Perplexity의 모델 설명서에 발표된 점수이고, 62.8은 이 순위표가 새로운 방식으로 계산한 점수다. 비공개 테스트는 그 성격상 공개되지 않는다.
🔗 apolinario의 X 발표 🔗 Decision Index 0.3
컴퓨터 제어: OpenAI, Ironclad의 계약 업무로 GPT-6 Astra 훈련
10월 6일 — OpenAI가 업무용 소프트웨어에서 에이전트의 효율을 높이기 위해 소프트웨어 개발사들과 연구 협력을 시작했다. 컴퓨터 사용(computer use) 능력을 개발하는 작업으로, 첫 협력사는 인공지능 기반 계약 업무를 전문으로 하는 Ironclad다. 양측은 법무, 영업, 구매 분야의 과제 11개를 정의했다. OpenAI에 따르면 숙련된 사용자가 각 과제를 수행하는 데 3040분이 걸리며, 850개 기준으로 평가한다. Ironclad는 자사 소프트웨어의 호스팅 환경을 제공했고, 모델은 SEC의 EDGAR 데이터베이스에 있는 공개 계약서로 만든 합성 과제를 통해 강화학습 훈련을 받았다.
| OpenAI가 11개 과제에서 측정한 항목 | GPT-5.6 Sol (추론 High) | GPT-6 Astra (추론 Max) |
|---|---|---|
| 평균 점수 | 41,6 % | 55,0 % (+32 %) |
| 시도당 추정 평균 시간 (시뮬레이션) | 37,0 minutes | 19,2 minutes (-48 %) |
GPT-6 Astra는 이 과제로 훈련한 OpenAI의 첫 프런티어 모델이며, 개발 과정에서 사용한 내부 모델은 63.7%를 기록했다. 이 수치는 OpenAI가 발표한 결과다. 시간은 고객 환경에서 측정한 값이 아니라 가정한 처리 속도를 바탕으로 시뮬레이션한 값이다. OpenAI는 현재 에이전트가 아직 안정적으로 수행하지 못하는 과제를 다른 소프트웨어 개발사들이 제안하도록 요청했다.
🔗 Ironclad와의 협력에 관한 OpenAI 게시물
API와 플랫폼: OpenAI API의 사용 등급과 BAA, Perplexity Agent API의 문서와 이미지, Bedrock의 GLM-5.3
추론 서비스를 구매하는 개발자와 관련된 네 가지 변화가 있다. OpenAI API의 접근 조건, Perplexity Agent API의 도구, AWS 목록에 추가된 새로운 개방형 모델에 관한 소식이다.
OpenAI API 사용 등급이 5개에서 3개로 축소
10월 6일 — OpenAI가 API의 높은 처리량 제한(rate limits)을 이용하는 조건을 간소화했다. 유료 사용 등급 5개가 Build, Launch, Grow의 3개로 바뀐다. 가장 높은 Grow 등급은 API 누적 결제액 500달러로 이용할 수 있으며, 이전 최상위 등급의 기준은 1,000달러였다. 이미 유료 등급을 이용하는 조직은 별도 조치 없이 자동으로 전환되고, 이후 누적 크레딧 구매액이 기준에 도달하면 상위 등급으로 올라간다. 무료 등급의 한도는 월 100달러로 유지된다.
| 사용 등급 | 누적 구매액 기준 | 월간 사용 한도 | Astra, Sol, Terra (분당 요청 수 및 토큰 수) | Luna (분당 요청 수 및 토큰 수) |
|---|---|---|---|---|
| Build | 5 dollars | 500 dollars | 5 000 및 1 000 000 | 5 000 및 2 000 000 |
| Launch | 100 dollars | 5 000 dollars | 10 000 및 4 000 000 | 10 000 및 10 000 000 |
| Grow | 500 dollars | 200 000 dollars | 15 000 및 40 000 000 | 30 000 및 180 000 000 |
🔗 @OpenAIDevs의 X 연속 게시물 🔗 처리량 제한 문서
OpenAI API의 BAA 체결과 HIPAA 규정 준수 지원을 셀프서비스로 제공
10월 5일 — OpenAI API로 보호 대상 건강 정보를 처리하는 조직은 이제 미국 HIPAA 법이 요구하는 업무 제휴 계약(Business Associate Agreement, BAA)을 직접 체결할 수 있다. 관리자가 설정 > 조직 > 일반에서 표준 BAA에 동의하고 기업 계약 없이 HIPAA 규정 준수 지원을 활성화할 수 있다. 이 셀프서비스는 충분한 API 사용 이력이 있고 자격 요건을 충족하는 조직에만 제공되며, 해당 설정에서 활성화를 취소할 수는 없다. 맞춤 조항은 계속 이메일로 요청해야 하며, 영업일 기준 1~2일 안에 답변을 받는다. OpenAI는 BAA 체결만으로 애플리케이션이 규정을 준수하게 되는 것은 아니며, ChatGPT Business에는 BAA를 제공하지 않는다고 강조했다.
Perplexity Agent API가 문서를 읽고 이미지를 검색
10월 5일 — 늦은 저녁 Perplexity API 변경 기록에 세 가지 항목이 추가됐다. Agent API는 이제 요청에 포함하거나 공개 HTTPS URL로 지정한 PDF, DOC, DOCX, TXT, RTF 문서를 입력으로 받는다. 지원 여부는 선택한 모델과 제공업체에 따라 달라진다. 새로운 도구 image_search는 웹에서 이미지를 검색하고 이미지 주소와 원본 페이지 주소를 포함한 구조화된 결과를 반환한다. 호출당 이미지 1~30개를 반환하며 기본값은 5개다. 도메인과 형식 필터를 제공하고, 안전 검색은 기본으로 활성화된다. 성공한 호출 1,000회당 2.50달러이며, 실패한 호출에는 요금이 부과되지 않는다. 세 번째 항목은 비용 집계 수정이다. 이제 응답에 샌드박스에서 수행한 추출 작업의 비용이 상세히 표시되며, GPT-6 Luna의 요금은 그대로다.
🔗 Perplexity API 변경 기록 🔗 image_search 도구 문서
Amazon Bedrock에 추가된 Z.ai의 GLM-5.3
10월 6일 — Z.ai가 자사의 대표 가중치 공개 모델 GLM-5.3의 Amazon Bedrock 출시를 발표했다. AWS 설명서에는 출시일이 10월 5일로 기록되어 있다. 이 모델은 매개변수 7,440억 개의 전문가 혼합 모델로, 토큰당 약 400억 개가 활성화된다. 컨텍스트는 100만 토큰이며, 출력은 최대 128,000토큰이다. 자격 요건을 충족하는 고객만 AWS 계정 담당 팀을 통해 접근할 수 있다. 모델은 리전 간 추론으로만 제공되며 미국 또는 글로벌 프로필을 사용한다. 프롬프트 캐싱은 1,024토큰부터 지원하고, 서비스 등급은 Standard, Priority, Flex, Reserved다. 설명서에는 가격이 없으며 Bedrock 요금 페이지로 안내한다. GLM-5.3은 지난 2주 동안 Bedrock에 추가된 Kimi K3(9월 22일)와 Grok 4.7(9월 28일)에 이어 출시됐다.
🔗 Amazon Bedrock의 GLM 5.3 설명서 🔗 Z.ai의 X 발표
코딩 에이전트: Claude Code 2.1.290부터 2.1.292까지, 클라우드 세션, Vibe CLI 2.26.0, Antigravity, Replit
터미널부터 편집기까지 코딩 에이전트에 다섯 가지 업데이트가 이루어졌다. 20시간도 안 되어 출시된 Claude Code의 세 버전, 클라우드 세션 안내서, 새로운 Rust 인터페이스를 확장하는 Vibe CLI, VS Code용 Antigravity 확장 프로그램, 사용자의 모든 프로젝트를 볼 수 있게 된 Replit이다.
Claude Code 2.1.290부터 2.1.292까지
10월 5일과 6일 — 10월 5일 23시 33분 UTC에 출시된 Claude Code 2.1.290은 수정 사항 131개를 포함해 총 190개 항목으로 구성된 대규모 버전이다. claude attach와 claude logs는 세션 식별자 대신 세션 이름의 일부를 입력받으며, /claude-api managed-agents-onboard은 웹페이지에 설명된 Managed Agents 모델을 ant apply 파일로 변환한다. 대화형 세션의 웹 검색은 더 이상 200회 호출 후 중단되지 않으며, 호출 한도가 시간당 100회씩 보충된다. 중간 수준의 추론 노력(medium)에서는 /code-review이 Opus 5.5와 Sonnet 5.5에서 CLAUDE.md의 규칙을 벗어난 부분도 알려준다. Slack의 Claude Tag에는 빠른 모드(!fast)가 추가되고, Claude in Chrome의 browser_batch 호출에는 60초 대신 90초가 주어지며, WebFetch는 더 이상 100,000자를 넘는 텍스트를 알림 없이 잘라내지 않는다. pyright와 더 다양한 형태의 ps은 권한 승인을 요청하며, 여러 권한 취약점도 수정된다. 셸에서 확장되는 rg와 git grep의 와일드카드, 작업 폴더 밖으로 연결된 CLAUDE.md, 사용자 mod로 조직 mod를 우회하는 문제가 여기에 포함된다. 4시간 뒤 나온 2.1.291은 두 가지 회귀 오류를 수정한다. 하나는 2.1.290에서 발생한 클라우드 세션의 권한 승인 요청에 대한 응답 유실이고, 다른 하나는 2.1.288에서 발생한 종료 시 세션의 마지막 메시지 유실이다.
10월 6일 18시 59분 UTC에 출시된 2.1.292는 수정 사항 64개를 포함해 총 92개 항목으로 구성된다. Agent 도구에 effort 매개변수를 추가해 요청한 추론 노력 수준으로 하위 에이전트를 실행할 수 있게 하고, 필요하면 플러그인 장터(마켓플레이스)를 추가한 뒤 플러그인을 설치하는 claude plugin install --marketplace도 추가한다. 로컬 MCP 서버(stdio)는 이제 기본적으로 2026-07-28 프로토콜을 협상하며(이전 방식으로 돌아가려면 MCP_PROTOCOL_NEGOTIATION=legacy 사용), CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS는 529 오류에 대한 재시도 기간을 늘리고, mod에는 프롬프트 자동 완성 이벤트와 프롬프트 캐시가 추가된다. 보안 측면에서는 PreToolUse 후크의 승인과 자동 모드가 더 이상 네트워크 경로(UNC) 읽기에 대한 권한 승인 요청을 우회하지 않으며, 후크가 작성한 <system-reminder> 태그는 Claude에 전달되기 전에 이스케이프 처리된다. Artifact 도구는 마침내 50개 대신 200개의 아티팩트를 나열하고, Code Review는 통계를 저장소별로 집계한다. 2.1.290과 2.1.292 모두 X에서는 발표되지 않았다.
| Claude Code 버전 | 출시일 (UTC) | 항목 수 | 주요 새 기능 |
|---|---|---|---|
| 2.1.290 | 10월 5일, 23 h 33 | 190, 수정 사항 131개 포함 | 이름으로 세션 지정, managed-agents-onboard, WebSearch 한도 보충 |
| 2.1.291 | 10월 6일, 3 h 55 | 수정 사항 2개 | 회귀 오류 두 가지 수정 |
| 2.1.292 | 10월 6일, 18 h 59 | 92, 수정 사항 64개 포함 | 하위 에이전트의 추론 노력, 명령 하나로 플러그인과 장터 추가, MCP 2026-07-28 |
🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292
Claude Code 클라우드 세션 안내서
10월 6일 — Claude Code 클라우드 세션의 미리보기 출시 2주 뒤, Anthropic은 claude.dev에 애디 오스마니가 작성한 실전 안내서를 공개한다. 각 작업은 약 4 vCPU, 16GB RAM, 30GB 디스크를 갖춘 새 가상 머신에서 실행되며, 저장소는 새 브랜치로 복제되고, Pro, Max, Team, Enterprise 요금제에서는 추가 연산 비용이 들지 않는다. 안내서는 일곱 가지 활용법을 설명한다. 대기 작업 목록(백로그)을 병렬로 처리하기, 반복 실행으로 수정 사항 검증하기, 로컬에서 계획한 뒤 claude --teleport로 세션 재개하기, 휴대전화로 진행 상황 확인하기, CI 실패와 검토 의견을 Auto-fix에 맡기기, 루틴 실행하기, 안전성이 낮은 코드를 일회용 VM에서 실행하기다. 시연에서는 첫 실행 후 87초 만에 세 세션이 모두 완료됐으며, 프로젝트 하나에서 하루 최대 200개의 새 대화(스레드)를 시작할 수 있다. 안내서는 GitHub 연결도 자세히 설명한다. GitHub로 로그인하는 것과 Claude GitHub 앱을 설치하는 것은 별개의 권한이며, 비공개 저장소에 접근할 수 있게 하는 것은 두 번째 권한뿐이다. 보너스 크레딧 100달러(Pro) 또는 250달러(Max)는 10월 7일 23시 59분 PT 이전에 신청해야 하며, 11월 4일에 만료된다.
🔗 claude.dev의 클라우드 세션 실전 안내서 🔗 @ClaudeDevs의 보너스 크레딧 안내
Vibe CLI 2.26.0
10월 6일 — Mistral은 2.25.8 출시 13일 뒤, X 발표 없이 명령줄 코딩 에이전트 Vibe CLI 2.26.0을 출시한다. 추가 사항 33개, 변경 사항 23개, 수정 사항 91개로 구성된 이번 업데이트는 규모가 크다. 147개 항목 중 72개는 Rust로 작성된 새 인터페이스와 관련된다. 첫 실행 도우미, 음성 모드(/voice), /loop으로 자연어로 정의하는 반복 프롬프트, /teleport로 세션을 Vibe Code Web에 보내는 기능, vibe update 명령이 여기에 포함된다. Vibe는 이제 항상 새 실행 엔진인 Unified Harness에서 작동하며, 이 엔진이 없으면 이전 엔진으로 조용히 되돌아가는 대신 명시적인 오류를 내고 중단한다. 플러그인은 자체 MCP 서버를 포함할 수 있고, ~/.vibe/.env에 저장된 대체용 API 키는 소유자만 읽을 수 있게 되며, Rust CLI는 이제 사용 현황 원격 측정 데이터(시작 시간, 사용한 명령, 감지된 터미널)를 Mistral에 전송한다.
VS Code용 Antigravity 확장 프로그램 1.7.0
10월 5일 — Google은 Visual Studio Code용 Antigravity 확장 프로그램 1.7.0을 출시한다. VS Code 1.90부터 지원하는 이 확장 프로그램은 Google Antigravity의 에이전트를 Microsoft 편집기에 통합한다(측면 패널 대화, 인라인 변경 사항 검토, 대화형 계획). 변경 이력에 따르면 9월 초부터 거의 매주 업데이트됐지만, 여기에서는 지금까지 다룬 적이 없다. 이번 1.7.0(개선 사항 6개, 수정 사항 9개)은 코드 검토를 다듬는다. Accept와 Reject 결정을 키보드로 실행 취소하거나 다시 실행할 수 있고, 변경 사항을 나란히 비교하는 편집기에 Accept All과 Reject All 버튼이 추가되며, VS Code의 자동 저장(Auto Save)이 더 이상 진행 중인 검토를 덮어쓰거나 종료하지 않는다. Windows에서는 창이 전면에 없을 때 작업 완료를 기본 알림으로 알려주며, Google Cloud Workstations와 Cloud Shell에는 대화형 인증이 추가된다. 같은 날 Visual Studio용 확장 프로그램도 1.0.261005.0으로 업데이트되며, 전송하는 피드백에 진단 로그를 첨부한다.
Replit과 모든 프로젝트의 맥락
10월 6일 — Replit은 이제 사용자의 모든 프로젝트에 대한 맥락을 파악한다고 발표한다. 새 대화에서 기존 프로젝트를 찾아달라고 하거나, 기능을 추가해달라고 하거나, 한 프로젝트를 다른 프로젝트의 참고 자료로 활용해달라고 요청할 수 있다. 그러면 Replit은 관련 파일을 읽고 백그라운드 작업(백그라운드 태스크)으로 변경을 진행하며, 변경 사항을 검토할 수 있는 링크를 제공한다. 제시된 예시는 순수한 코드 작업을 넘어선다. 커피 브랜드의 « Partner Marketing Hub » 색상 팔레트를 다른 프로젝트 두 개에 적용하는 작업이다. 발표는 동영상을 첨부한 트윗 하나뿐이며, 블로그 글이나 문서, 가격 정보는 없다.
GitHub의 스택형 풀 리퀘스트가 정식 출시된다
10월 6일 — GitHub은 7월 30일부터 공개 미리보기로 제공해 온 쌓아 올린 풀 리퀘스트(스택형 풀 리퀘스트)를 github.com의 모든 요금제에 공개한다. 큰 변경 사항을 더 작은 풀 리퀘스트로 나누어 각각 검토한 뒤 함께 병합하는 방식이다. GitHub Enterprise Server에는 향후 버전에서 제공될 예정이다. GitHub에 따르면 스택을 사용하는 저장소는 비슷한 저장소보다 코드를 9 % 더 많이 병합하며, 상위 1 % 저장소의 3분의 2 이상이 이를 사용하고, 병합까지 걸리는 시간은 5 % 개선된다.
정식 버전은 병합 과정의 번거로움을 줄인다. 주 브랜치가 갱신되면 « Rebase stack »은 변경되지 않은 코드의 승인을 유지하고 서명된 대체 커밋을 생성한다. 스택은 하나의 그룹으로 병합 대기열(머지 큐)을 통과하며, 기준 브랜치가 삭제된 스택은 닫히는 대신 다른 브랜치를 대상으로 지정한다. 전체 스택의 자동 병합은 « 앞으로 몇 주 안에 » 제공될 예정이다. 명령줄과 에이전트에서 사용할 수 있도록 GitHub CLI의 gh stack 확장 프로그램은 Git 워크트리를 지원한다.
다국어 모델: Cohere의 Tiny Aya L2-Thinker와 TII의 Falcon-OCR-Arabic
두 소형 모델은 대형 모델이 충분히 지원하지 못하는 언어를 겨냥한다. 하나는 사용자의 언어로 추론하고, 다른 하나는 아랍어 문서를 읽는다.
Cohere의 Tiny Aya L2-Thinker
10월 6일 — Cohere는 모델이 추론하는 언어 문제에 도전한다. 대부분의 모델은 스페인어, 아랍어, 스와힐리어로 질문받아도 영어로 생각한 뒤 답한다. 연구용 모델 Tiny Aya L2-Thinker(매개변수 33억 5,000만 개)는 60개 언어에서 93 %가 넘는 비율로 프롬프트의 언어로 추론한다. 핵심은 데이터의 조합이다. gpt-oss-120b로 생성한 영어 추론 예시 약 170만 개만으로는 사용자의 언어로 추론하는 비율이 12.8 %에 불과하다. 44개 언어에 대해 언어당 약 5,000개의 번역 예시를 추가하면 이 비율이 86.1 %로 올라가고, 추론 과정이 없는 다국어 데이터는 이 동작을 다른 언어로 확장한다. 영어로 추론하는 동일 계열 모델과 비교하면 벤치마크 6개 중 5개에서 정확도 하락은 최대 2~3점이다. 강화 학습 단계가 없기 때문에 경시대회 수학 벤치마크인 PolyMath에서만 하락 폭이 더 크다. 모델의 평균 추론 토큰 사용량은 5,000개 미만이다. 모델과 데이터는 비상업용 CC-BY-NC 4.0 라이선스로 Hugging Face에 공개되며, 블로그 글은 9월 9일자 arXiv 논문을 소개한다.
🔗 Cohere의 Tiny Aya L2-Thinker 연구 글
TII의 Falcon-OCR-Arabic
10월 6일 — Falcon 모델을 개발하는 아랍에미리트 연구기관 TII는 Hugging Face 블로그에서 텍스트 인식 모델 Falcon OCR의 아랍어 버전인 Falcon-OCR-Arabic을 소개한다. 매개변수 2억 7,000만 개와 초기 융합 구조를 유지하며, 실제 아랍어 문서와 합성 문서로 지도 미세 조정을 거친 뒤 강화 학습으로 조정됐다. TII가 자체적으로 구축한 벤치마크(실제 문서 11,974개, 15개 범주)에서 비교 대상 모델 17개 중 2위를 차지했으며, 공식 문서, 행정 서식, 영수증, 청구서에서는 1위를 기록했다.
| TII가 평가한 모델 | 텍스트 정확도 | Table TEDS 점수 |
|---|---|---|
| Gemini 3.5 Flash | 84,34 % | 51,30 % |
| Falcon-OCR-Arabic (270M) | 81,87 % | 59,95 % |
| Claude Opus 5.5 | 79,22 % | 43,98 % |
| GPT Astra | 75,02 % | 51,23 % |
| Chandra OCR 2 (최고의 전용 OCR) | 61,67 % | 32,63 % |
글에서는 체험 공간(플레이그라운드)만 제공한다. 확인 당시 Hub에는 Falcon-OCR-Arabic의 가중치가 올라와 있지 않았으며, 라이선스도 언급되지 않았다.
Hugging Face 라이브러리: Diffusers 0.41.0에 Qwen-Image 2.1 통합, Transformers v5.19.0에 EmbeddingGemma 2 추가
Hugging Face의 주요 모델 라이브러리 두 가지가 같은 날 새 버전을 출시한다.
Diffusers 0.41.0과 Qwen-Image 2.1
10월 6일 — 확산 모델용 Hugging Face 라이브러리인 Diffusers 0.41.0은 이미지 생성과 편집을 결합한 Alibaba의 모델 Qwen-Image 2.1을 통합한다. 이제 생성, 편집, 투명 배경 이미지 제작(기본 RGBA 출력), LoRA 학습에 바로 사용할 수 있으며, 시각 생성 구성 요소는 매개변수 70억 개를 갖춘다. 팀은 출시 주기도 바꾼다. Transformers처럼 Diffusers도 이제 새 모델의 등장에 맞춰 마이너 버전을 출시하며, 패치 버전은 계속 수정 사항만을 위해 사용한다. 텐서 병렬 로딩을 통해 각 GPU는 자신이 담당하는 가중치만 읽을 수 있으며, 이번 버전에는 LTX-2.5 DFR 파이프라인과 Cosmos 3 최적화가 추가된다. 한편 ONNX 지원은 사용 중단 예정으로 지정되고, Optimum 사용이 권장된다.
Transformers v5.19.0
10월 6일 — v5.18.0 출시 6일 뒤 나온 Transformers v5.19.0은 앞서 소개한 EmbeddingGemma 2를 지원한다. 이 모델은 길이를 줄일 수 있는 벡터와 로드 시 비활성화할 수 있는 시각 및 오디오 인코더를 갖춘다. 분산 학습에서는 전문가 병렬 처리에 토큰 분배(토큰 디스패치)가 추가되며, Qwen3 MoE와 Mellum에서는 기본적으로 활성화된다. 이제 전문가 병렬 처리의 크기를 텐서 병렬 처리의 크기와 같게 맞출 필요가 없으며, Trainer도 이 모드에서 작동한다. 캐시는 이제 계층별로 설정할 수 있어 이질적인 구조의 모델에 유용하며, 연속 배치 처리(연속 배칭)는 XPU를 지원한다. 이번 버전에는 이전 버전과의 호환성을 깨는 변경 사항이 6개 있으며, 모든 MoE의 라우터 로짓 반환과 paged| 접두사의 단계적 폐지가 포함된다.
음성 에이전트: ElevenLabs, ElevenAgents Architect 알파 버전 출시
10월 6일 — ElevenLabs는 대화형 에이전트 플랫폼 ElevenAgents에 Architect라는 전문가를 통합해, 팀이 말하거나 글을 쓰는 방식으로 음성 또는 텍스트 에이전트를 만들고 개선하도록 돕는다. Architect는 ElevenAgents의 모든 설정(지식 기반, 프롬프트, 처리 흐름, 음성, 안전장치, 도구, 시뮬레이션)과 이들이 상호작용하는 방식을 알고 있다. 질문, 실패한 테스트, 사람에게 전환되는 횟수의 증가, ElevenAgents Spotlight의 분석 결과를 전달하면 대화 기록을 분석해 원인을 추적하고, 수정을 제안하며, 이를 검증하는 시뮬레이션을 작성한다. 간단한 설명만으로 에이전트를 만들 수도 있다. 모든 변경 사항은 버전이 기록되고 되돌릴 수 있는 초안으로 제공되며, 승인 없이는 운영 환경에 반영되지 않는다. Architect는 제품 안에서뿐 아니라 Claude, Claude Code, ChatGPT, Cursor, Grok Bot에서도 이용할 수 있다. 지금부터 알파 버전으로 사용할 수 있으며, 가격이나 성과 수치는 공개되지 않았다.
🔗 ElevenLabs의 ElevenAgents Architect 소개 글
생성형 영상: Black Forest Labs에 따르면 FLUX 3가 Physics-IQ Verified에서 선두
10월 6일 — Black Forest Labs는 Google DeepMind가 영상 모델의 물리 세계 이해도를 측정하는 벤치마크인 Physics-IQ에서 1위를 차지했다고 주장했다. 이 평가는 실제 실험을 촬영한 영상의 시작 부분을 모델에 보여 주고 이후 상황을 예측하게 한다(유체, 광학, 고체 역학). 기준 순위표인 Physics-IQ Verified는 Anates Labs가 관리한다. 영상에서 영상 생성 부문에서 FLUX 3 [large]는 NVIDIA의 Cosmos3를 크게 앞서지만, 영상당 비용은 더 높다.
| 모델 및 방식(영상에서 영상으로) | Physics-IQ Verified 점수 | 표준화된 영상당 비용 |
|---|---|---|
| FLUX 3 [large], 8회 생성 중 최고 결과 | 64,35 % | 16,43 달러 |
| FLUX 3 [large] | 61,11 % | 2,08 달러 |
| Cosmos3 Super (NVIDIA) | 50,80 % | 0,82 달러 |
| Cosmos3 Nano (NVIDIA) | 43,00 % | 0,82 달러 |
이미지에서 영상 생성 부문에서도 FLUX 3 [large]는 NVIDIA가 9월 29일 선두로 내세웠던 방식인 Physis-Lang을 앞섰다. FLUX 3 [large]는 독점 모델이며, 해당 스레드에는 이 변형 모델의 제공 시점이나 가격이 공개되지 않았다.
🔗 @bfl_ai의 X 스레드 🔗 Physics-IQ Verified 순위표
공개 평가: GeoGuess Bench와 RSI Arena
일반적인 벤치마크와 다른 두 가지 공개 평가가 등장했다. 하나는 모델이 GeoGuessr를 플레이하게 하고, 다른 하나는 에이전트가 학습시킨 모델을 대중이 투표로 평가하게 한다.
GeoGuess Bench
10월 6일 — Together AI에서 개발자 경험을 담당하는 하산이 모델에게 GeoGuessr를 플레이하게 하는 개인 벤치마크 GeoGuess Bench를 공개했다. 각 모델은 동일한 거리 사진 210장을 보고 지도에 핀을 찍으며, 게임의 점수 공식에 따라 다섯 라운드로 구성된 한 게임에서 최대 25 000점을 받는다. Claude Opus 5.5가 Claude Fable 5.1을 근소하게 앞서 선두에 올랐다. 눈길을 끈 것은 Meta의 가중치 공개 모델 Muse Glimmer 30B로, 게임당 비용이 약 45분의 1이면서도 GPT-6 Astra를 앞서 3위를 차지했다.
| GeoGuess Bench 순위 | 평가 모델 | 25 000점 만점 점수 | 게임당 비용 |
|---|---|---|---|
| 1 | Claude Opus 5.5 | 23 412 | 0,064 달러 |
| 2 | Claude Fable 5.1 | 23 307 | 0,115 달러 |
| 3 | Muse Glimmer 30B (공개) | 22 407 | 0,0049 달러 |
| 4 | GPT-6 Astra | 21 562 | 0,223 달러 |
| 5 | GPT-6.1 Sol | 21 194 | 0,042 달러 |
| 6 | GLM-5.3 Flash (공개) | 21 183 | 0,0087 달러 |
GLM-5.3 Flash도 GPT-6.1 Sol과 비슷한 성능을 내면서 비용은 약 5분의 1이다. 이는 공개 모델의 추론 서비스를 제공하는 Together AI 직원의 개인 프로젝트이며, 회사 차원의 평가가 아니다. Gemini 모델은 포함되어 있지 않고, 코드는 GitHub에 공개됐다.
RSI Arena
10월 6일 — 쯔천 천이 이번에는 Hugging Face와 함께 RSI Arena(재귀적인 자기 개선, 재귀적 자기 개선)의 새 라운드를 발표했다. AI 에이전트들에게 GPU와 단 하나의 임무, 더 나은 모델을 학습시키는 일이 주어졌다. 에이전트들은 직접 데이터를 선택하고 코드를 작성하며 실험을 진행했다. 첫 학습 라운드가 끝나자 대중도 이 과정에 참여한다. 모델들이 일대일로 대결하고 사람들이 투표하면, 에이전트들은 그 피드백을 바탕으로 새로운 실험을 진행한다. Hugging Face의 Inference Endpoints가 각 모델을 실시간으로 제공하며, 사이트에는 GPT-6 Astra, Grok 4.7, DeepSeek V4.1 Flash, GLM-5.3, Muse Spark 1.3을 포함한 에이전트 10개가 나열되어 있다. 대시보드에는 API 비용이 300 달러 중 286,60 달러, GPU 사용 시간이 1 000시간 중 755,17시간으로 표시됐다. 팀은 에이전트가 학습시킨 모든 모델을 Hub에 공개하고, 실험이 끝나면 데이터, 코드, 각 에이전트의 전체 연구 과정 등 모든 산출물도 공개하겠다고 약속했다.
🔗 쯔천 천의 X 발표 🔗 RSI Arena
GPU 인프라: NVIDIA, AICR v1.0 공개
10월 6일 — NVIDIA가 AI Cluster Runtime(AICR) 버전 1.0을 공개했다. 시행착오에 의존해 Kubernetes GPU 클러스터를 구성하는 관행을 끝내려는 공개 프로젝트다. 가속 클러스터는 버전이 서로 독립적인 수십 개의 구성 요소(커널, 드라이버, 컨테이너 실행 환경, 네트워크, 스토리지, 오퍼레이터, 라이브러리)에 의존하며, 한 환경에서 작동하는 조합이 다른 환경에서는 아무런 경고 없이 실패할 수 있다. AICR은 버전이 고정되고 검증을 거친 구성 레시피를 Helm, Argo CD, Flux 또는 Helmfile 형식으로 생성하고, 테스트한 하드웨어에서 얻은 서명된 검증 증거를 함께 제공한다. v1.0은 호환성 계약을 확정한다. CLI, REST API, Go SDK, 배포 패키지 구조와 산출물 스키마가 안정적인 인터페이스가 되며, 호환성을 깨는 변경에는 새로운 메이저 버전이 필요하다. NVIDIA는 기여자가 100명 이상이고 그중 거의 절반이 외부 기여자라고 밝혔으며, Pulumi Labs와 Mirantis의 멀티클러스터 관리자 k0rdent에서의 통합 사례를 소개했다.
Claude Startups: 최대 7 000 달러의 제품과 크레딧, 45 000 달러 규모의 Startup Stack
10월 6일 — Anthropic이 Claude를 기반으로 제품을 만드는 창업자를 위한 프로그램 Claude Startups의 대상을 확대했다. 설립된 지 5년 미만이거나 지난 2년 동안 투자를 받은 스타트업이 참여할 수 있다.
| 프로그램 혜택 | Anthropic이 발표한 가치 |
|---|---|
| Claude Team 1년 이용, Premium 좌석 최대 5개 | 6 000 달러(좌석 5개, 개당 월 100 달러) |
| 승인 즉시 사용 가능한 일회성 API 크레딧 | 1 000 달러 |
| Claude 제품 및 크레딧 합계 | 최대 7 000 달러 |
| Claude Startup Stack(파트너사 혜택) | 최대 45 000 달러 |
Claude Team 1년 이용 혜택은 Team을 새로 도입하는 기업에 적용되며, 실제 가치는 좌석 수와 종류에 따라 달라진다. 이날 새로 공개된 Claude Startup Stack은 Linear, Lovable, ElevenLabs, Granola, Hex 등 Claude로 제품을 만드는 기업들의 할인과 크레딧을 모았다. 최대 금액은 2026년 9월 정가를 기준으로 모든 혜택의 가치를 합산한 것이며, 모든 혜택을 중복해서 적용할 수 있는 것은 아니다. 프로그램에는 Anthropic의 Applied AI 팀과 대화할 수 있는 시간, Claude Marketplace에 소개 페이지를 등록하기 위한 지원, 행사 참여 기회도 추가된다.
🔗 Anthropic의 Claude Startups 소개 글 🔗 @claudeai의 Claude Startup Stack 관련 스레드
단신
- Claude Projects와 로컬 폴더 — Anthropic의 댄 파인은 Claude Projects의 클라우드 세션이 컴퓨터에서 승인된 폴더에 연결할 수 있으며, 작업에 필요할 때만 해당 폴더에 접근한다고 발표했다. 10월 5일부터 순차적으로 배포 중이며, 보리스 체르니에 따르면 팀은 거의 마무리 단계에 있다(거의 다 됐어요). 🔗 출처 · 🔗 보리스 체르니
- Slack 그룹 메시지의 Claude — 이제 Slack 그룹 메시지(그룹 DM)에 일반 참여자처럼 Claude를 추가할 수 있다. Claude는 스레드에서 응답하고 해당 스레드를 계속 확인하며, 요청한 사람의 개인 커넥터를 사용할 수 있다. 지원 요금제나 제공 일정은 구체적으로 공개되지 않았다. 🔗 출처
- 보리스 체르니의 프롬프트 작성 방식 — 보리스 체르니는 Home Depot를 다룬 Acquired 팟캐스트 에피소드의 인터랙티브 보조 사이트를 수채화까지 포함해 Opus 5.5에 만들도록 했다. 그는 프롬프트 작성에 비결은 없으며, 모델에 원하는 것, 들일 노력의 정도, 결과를 확인하는 방법을 알려 주면 된다고 말한다. 🔗 보조 사이트 · 🔗 프롬프트 작성 방식
- Atlassian과 OpenAI — 새로운 계약에 따라 GPT-6 Astra를 비롯한 GPT-6 제품군의 최첨단 모델들이 Atlassian 플랫폼과 Rovo의 에이전트를 구동하게 된다. Atlassian 개발자 3 000명 이상이 이미 Codex를 사용하고 있으며, 더 깊은 Jira 통합도 검토 중이다. 계약 금액은 공개되지 않았다. 🔗 출처
- iOS용 ChatGPT의 Codex 위젯 — 10월 2일자 iOS용 ChatGPT 버전 1.2026.267은 선택한 컴퓨터의 최근 Codex 작업을 보여 주는 홈 화면 위젯, 남은 사용량과 초기화 시점을 보여 주는 위젯, 키보드를 열린 상태로 유지하는 설정을 추가했다. 사용량 위젯은 잠금 화면에서도 사용할 수 있다. 🔗 출처
- Gemini CLI v0.63.0과 v0.64.0-preview.0 — 안정 버전 v0.63.0은 9월 29일 미리보기 버전의 항목 15개를 그대로 담고 있으며, 미리보기 버전 v0.64.0-preview.0은 9월 30일부터 10월 3일까지 야간 빌드의 항목 16개를 모은 것이다. 새로운 내용은 없으며, 10월 6일 야간 빌드도 비어 있다. 🔗 출처
- Mistral Python SDK 3.1.0 — API를 바탕으로 자동 생성된 이 버전은 관측성 모듈 아래에 평가 작업 14개를 베타로 추가한다.
Runs메서드가Workflows.runs아래로 이동해, 단순한 마이너 버전 변경인데도 기존 코드가 작동하지 않을 수 있다. 🔗 출처 - Qwen Code v0.25.1-preview.0 — v0.25.0 출시 다음 날 나온 이 미리보기 버전에는 기능 13개와 수정 27개가 포함된다. 실험적인 Kubernetes 실행 환경, Managed Agent용 Shell 명령과 백그라운드 모니터링, 이름이 같은 서버를 더는 허용하지 않는 MCP 규칙 등이 추가됐다. 🔗 출처
- SpaceXAI TypeScript SDK 0.2.2 — 별도 발표 없이 10월 5일 공개된 이 버전에는 한 가지 변경만 있다.
retryBeforeOutput옵션이 연속 전송(스트리밍) 없이 JSON을 기다리는create()호출에도 적용된다. 🔗 출처 - Falcon-Emirati-7B, 에미리트 방언 — TII는 Falcon-H1-Arabic 7B를 에미리트 아랍어에 특화했다. 질문 1 173개로 구성된 벤치마크 Alyah에서 84,83 %를 기록했고, Gemini 3.7 Flash를 심판으로 사용한 평가에서 방언 충실도는 0,52로, ALLaM, Gemma 3 27B, Jais-2, Fanar-2의 최고치인 0,05를 앞섰다. 모델은 TII의 채팅 플랫폼에서만 제공된다. 🔗 출처
- Datasets 5.1.0 — 10월 5일 공개된 이 데이터셋 라이브러리는 이제 Harbor 강화 학습 환경, 열 지향 형식 Vortex, 생물학 형식 다섯 가지(FASTA, FASTQ, GenBank, PDB, mmCIF)를 읽을 수 있다. 압축 파일이 인접 디렉터리에 파일을 쓸 수 있었던 취약점도 수정했다. 🔗 출처
- TRL v1.14.2 — 이 패치는 아무런 경고 없이 잘못 진행되던 학습을 바로잡는다. vLLM을 사용하지 않을 때 GRPO, RLOO, Distillation은 Gemma나 Phi-3.5 같은 모델에서 턴 끝에 멈추지 않고 최대 길이까지 이어지는 텍스트 전체를 학습하고 있었다. 충돌 오류 세 가지도 수정됐다. 🔗 출처
- Jev로 선거 운동 이메일 걸러내기 — 커뮤니티 글에서 스티븐 솔카는 Jev로 정치 관련 이메일을 분류한 뒤(실제 이메일 100개 중 정답 99개, 오탐 1개), CPU에서 실행되는 매개변수 2 260만 개의 SetFit 분류기를 사용했다. 파일럿 평가에서는 98 %였지만, 어려운 사례에서는 23개 중 18개를 맞혔다. 🔗 출처
- 10월 16일 Open Together — vLLM과 Hugging Face가 오픈 소스 개발자 모임 Open Together를 개최한다. 10월 16일 금요일 샌프란시스코에서 Open Source AI Week의 시작을 알리는 행사다. 제프 부디에에 따르면 대기자 명단에 150명이 있으며, 수용 인원은 두 배로 늘었다. 🔗 출처 · 🔗 제프 부디에
- Copilot CLI 1.0.93-2 — 이 미리보기 버전은 네트워크 요청을 관리되는 도메인으로 제한하는 기업용 설정
permissions.limitTo을 추가한다. 모델 선택기에서는 GPT-6.1 Sol, GPT-6 Astra, Luna와 Claude 5.5 모델들을 우선적으로 보여 주며, 사용자 설정은 이제~/.copilot/settings.json에서만 읽는다. 🔗 출처 - 보안 개요에 표시되는 AI Scan — 조직 및 기업 관리자는 이제 GitHub에서 보안 상태를 한눈에 보는 화면(보안 개요)을 통해 어느 저장소가 풀 리퀘스트 AI 분석(풀 리퀘스트용 AI Scan)을 활성화했는지 확인할 수 있다. 필터 두 개와 CSV 내보내기의 열 하나가 제공된다. 🔗 출처
- 비밀 정보 탐지: Lovable, Pydantic, Supabase — GitHub의 비밀 정보 탐지(비밀 정보 스캔)가 Lovable API 키, Logfire 토큰, Pydantic AI Gateway 키와 Supabase 토큰 두 가지를 포함한 새로운 비밀 정보 유형 다섯 가지를 인식한다. Lovable Labs도 파트너십 프로그램에 합류한다. 🔗 출처
- 10월 5일 Devin 릴리스 노트 — 주로 세부 개선이다. 세션 작업 공간에 Terminal 탭이 추가됐고(Files나 Terminal을 열면 Devin이 깨어난다), 트리거 동작에서 Devin Review의 작업 강도를 조정할 수 있으며, 코드 분석(코드 스캔)을 API v3 또는 Devin의 MCP를 통해 식별자로 조회할 수 있다. 🔗 출처
- Delta와 자체 worktree — Delta 블로그에서 콘래드 어윈은 이 도구가 Git worktree를 대체하는 이유를 설명한다. 각 스레드의 worktree를 DeltaDB에 기록하고 사람, 에이전트, 머신 사이에 복제하며, 여러 에이전트가 같은 브랜치에서 작업하고, 버전 관리되는
.agents/prepare스크립트가 각 체크아웃을 준비한다. 새 버전 출시 소식은 없는 글이다. 🔗 출처 - v0: 개인 계정이 팀 공간으로 전환 — v0의 개인 계정이 팀 작업 공간으로 바뀌며, 대화, 프로젝트, 설정이 자동으로 이전된다. 다만 문서에 따르면 팀 템플릿 같은 일부 기능은 Plus, Business, Enterprise 요금제에서만 제공된다. 🔗 출처
- v0와 iOS의 ChatGPT 구독 — 9월 29일부터 v0에서 지원해 온 ChatGPT 구독을 이제 v0의 iOS 앱에서도 사용할 수 있다. 가격이나 추가 세부 정보는 공개되지 않았다. 🔗 출처
- Eleven v4와 Eleven v4 Turbo가 선두 — ElevenLabs는 9월 28일 출시한 두 음성 합성 모델이 Artificial Analysis의 음성 합성(텍스트 음성 변환) 순위에서 1위와 2위를 차지했다고 발표했다. v4는 출시 당시에도 이미 1위였다. 🔗 출처
- HeyGen Video, 2K 지원 — 출시 일주일 만에 HeyGen Video가 2K 해상도를 지원한다. HeyGen은 사용량 기준 OpenRouter 영상 순위에서 1위라고 밝혔으며, 2K 전용 가격은 공개되지 않았다. 카탈로그 페이지에는 여전히 10월 말까지 초당 0,01 달러로 표시되어 있다. 🔗 출처
- Pika의 Nano Banana 2.1 — Pika가 Google의 Nano Banana 모델 새 버전인 Nano Banana 2.1을 자사 플랫폼과 Pika API Club에 추가했다. Pika에 따르면 시각적 품질과 속도가 개선됐으며, 가격이나 크레딧 비용은 공개되지 않았다. 🔗 출처
- DOCA GPUNetIO — NVIDIA는 DOCA GPUNetIO를 NCCL, NVSHMEM, NIXL/UCX용 GPU 주도 네트워킹(GDA-KI)의 공통 구현으로 삼는다. DOCA SDK에는 전체 기능 버전으로 제공하며, RDMA Verbs에 초점을 둔 더 가벼운 오픈 소스 프로젝트로도 제공한다. 🔗 출처
- CUDA의 Green contexts — NVIDIA 기술 블로그 글은 핵심 작업을 위해 SM을 예약하는 방법을 보여 준다. SM 148개를 갖춘 Blackwell GPU에서 SM 8개를 예약한 커널은 0,007 ms 만에 응답한다. 우선순위가 설정된 실행 흐름(스트림)을 사용하면 0,140 ms, 우선순위가 없으면 3,727 ms가 걸린다. 🔗 출처
- 통신 사업자의 공개 모델 활용 — NVIDIA는 입장을 밝힌 글에서 응답자의 89 %가 오픈 소스를 중요하게 여긴다는 2026년 통신 분야 설문조사와 SoftBank, AT&T, Indosat의 사례를 인용했다. 새 제품은 없다. 🔗 출처
- Perplexity의 협업 도구 가이드 — Perplexity는 인공지능을 탑재한 협업 도구 열 가지(Slack, Loom, Confluence, Airtable, Notion, ClickUp, Asana, Monday.com, Trello, Miro)의 인공지능 기능과 해당 기능을 포함하는 요금제를 비교했다. 제품 관련 신규 소식은 없다. 🔗 출처
이것이 의미하는 바
의사결정 모델이 가격 경쟁과 순위를 갖춘 독립적인 범주로 자리 잡고 있다. 같은 날 OpenAI는 Decisions API의 입력 토큰 100만 개당 요금을 0.10달러로 책정했고, Perplexity는 자사 요금을 0.02달러로 낮췄다. 이는 5일 전의 절반 수준이며, 두 회사 모두 출력에는 요금을 부과하지 않는다. 이 모델들은 글을 작성하는 대신 선택하거나 점수를 매긴다. 읽는 양에 따라 비용을 지불하며, 빠른 속도가 요구된다. OpenAI는 자사의 Responses API보다 약 10배 빠른 응답을 약속한다. Decision Index 0.3은 커뮤니티의 심판 역할을 하며, 새롭게 비공개로 구성된 절반은 이미 알려진 벤치마크에서의 성적보다 역량 자체를 측정하는 데 목적이 있다. 그 평가 결과는 이미 개발사들의 홍보에 영향을 주고 있다. Perplexity는 발표에서 이 순위를 근거로 내세웠지만, 모델 설명에 기재된 점수는 순위표의 점수와 다르다.
인공지능이 업무용 도구 안으로 들어가고 있다. Claude는 Excel, PowerPoint, Word에 이어 Google Docs, Sheets, Slides에도 도입되고, Slack 그룹 메시지에도 합류한다. GPT-6 모델은 Atlassian의 Rovo 에이전트에 활용될 예정이다. 이러한 통합에서 핵심은 모델의 품질뿐 아니라 통제다. 모든 변경 사항을 승인받도록 하는 모드, Google의 공유 권한을 따르는 커넥터, 모듈에 적용되는 Enterprise 제어 기능이 그 예다. 같은 논리는 이날 발표된 에이전트 도구에도 나타난다. Antigravity의 취소 가능한 검토 결정부터 ElevenAgents Architect의 버전 관리 초안까지 이어진다.
사이버 보안에서는 검증 수준에 따라 접근 범위가 달라진다. Anthropic의 CVP는 모델이 아니라 안전장치를 바꾼다. CyScenarioBench에서 동일한 Opus 5.5는 검증을 받지 않으면 첫 프롬프트부터 작업이 차단되지만, Red Team Access에서는 50개 작업 중 34개를 성공적으로 수행한다. Mistral은 거부하지 않는 모델이라는 다른 주장을 내세운다. 자사에 따르면 Claude Opus 5.5와 GPT-6 Astra가 응시를 거부하는 사이버 보안 테스트에서 82 %를 기록했다고 주장한다. 두 접근법은 한 지점에서 만난다. 사이버 보안 역량에 대한 가장 폭넓은 접근은 우선 검증된 전문가에게 주어진다는 점이다. 가중치 공개 전 Mistral의 파트너나 Anthropic 프로그램의 회원이 여기에 해당한다.
모델의 크기도 양쪽 끝으로 확장되고 있다. 대형 모델 쪽에는 1조 개의 매개변수를 갖춘 Mistral Large 4가 있으며, 가중치는 10월 말 공개될 예정이다. 소형 모델 쪽에는 휴대전화에서 약 567 MB의 RAM으로 실행되는 EmbeddingGemma 2, 매개변수 33억 5천만 개의 Tiny Aya L2-Thinker, 매개변수 2억 7천만 개의 Falcon-OCR-Arabic이 있다. Falcon-OCR-Arabic은 현재 시연만 제공된다. 다만 이날 나온 수치 상당수는 개발사가 직접 측정한 것이다. Mistral의 점수, Black Forest Labs가 주장하는 1위, TII의 자체 벤치마크, Perplexity의 모델 설명, OpenAI가 채점한 Ironclad의 작업, GitHub가 발표한 병합 성능 향상이 이에 해당한다. 발표 당일에는 이런 수치가 유일한 측정 결과인 경우가 많다. 독립적인 평가로 교차 검증하면 신뢰도를 높일 수 있으며, Mistral Large 4의 가중치가 공개되면 바로 그러한 검증이 가능해질 것이다.
출처
- Mistral Large 4에 관한 Mistral의 글
- 문서에 수록된 Mistral Large 4 설명
- Claude for Google Workspace에 관한 Anthropic의 글
- X의 @claudeai, Claude for Google Workspace
- Cyber Verification Program에 관한 Anthropic의 글
- Cyber Verification Program 도움말 페이지
- Claude Mythos를 활용하는 Comcast와 Booz Allen
- Google 블로그의 EmbeddingGemma 2
- EmbeddingGemma 2 모델 설명
- X의 @GoogleDeepMind, EmbeddingGemma 2
- Hugging Face의 EmbeddingGemma 2
- OpenAI의 Decisions API 가이드
- OpenAI API 변경 내역
- X의 @perplexitydevs, pplx-decider-v1.1-27b
- Hugging Face의 pplx-decider-v1.1-27b
- X의 @multimodalart, Decision Index 0.3
- Decision Index 0.3
- Ironclad와의 협업에 관한 OpenAI의 글
- X의 @OpenAIDevs, 사용 등급
- OpenAI API 요청 속도 제한 문서
- API의 BAA에 관한 OpenAI 도움말
- Perplexity API 변경 내역
- Perplexity의 image_search 도구 문서
- Amazon Bedrock의 GLM 5.3 설명
- X의 @Zai_org, Bedrock의 GLM-5.3
- Claude Code 2.1.290
- Claude Code 2.1.291
- Claude Code 2.1.292
- claude.dev의 클라우드 세션 실무 가이드
- X의 @ClaudeDevs, 클라우드 세션 추가 크레딧
- Mistral Vibe v2.26.0 릴리스 노트
- Google Antigravity 변경 내역
- X의 @Replit, 모든 프로젝트의 컨텍스트
- 스택형 풀 리퀘스트에 관한 GitHub 변경 내역
- Tiny Aya L2-Thinker에 관한 Cohere의 연구 글
- Falcon-OCR-Arabic에 관한 TII의 글
- Diffusers 0.41.0 릴리스 노트
- Transformers v5.19.0 릴리스 노트
- ElevenAgents Architect에 관한 ElevenLabs의 글
- X의 @bfl_ai, FLUX 3와 Physics-IQ
- Physics-IQ Verified 순위
- X의 @nutlope, GeoGuess Bench
- GeoGuess Bench
- X의 @my_cat_can_code, RSI Arena
- RSI Arena
- NVIDIA 기술 블로그의 AICR v1.0
- Claude Startups에 관한 Anthropic의 글
- X의 @claudeai, Claude Startup Stack
- X의 댄 파인, Claude Projects와 로컬 폴더
- X의 보리스 체르니, Claude Projects의 단계적 배포
- X의 댄 파인, Slack 그룹 메시지의 Claude
- X의 보리스 체르니, Acquired 연계 사이트
- X의 보리스 체르니, Claude에 프롬프트를 입력하는 방법
- Atlassian과 OpenAI의 파트너십 확대
- ChatGPT와 Codex 변경 내역, iOS용 ChatGPT 1.2026.267
- Gemini CLI v0.63.0
- Mistral Python SDK v3.1.0
- Qwen Code v0.25.1-preview.0
- SpaceXAI TypeScript SDK v0.2.2
- Falcon-Emirati에 관한 TII의 글
- Datasets 5.1.0
- TRL v1.14.2
- 스티븐 솔카의 글
- X의 @vllm_project, Open Together
- X의 제프 부디에, Open Together 대기 명단
- Copilot CLI 1.0.93-2
- AI Scan 활성화 상태에 관한 GitHub 변경 내역
- 새로운 비밀 정보 탐지기에 관한 GitHub 변경 내역
- 10월 5일 Devin 릴리스 노트
- Delta 블로그에 실린 콘래드 어윈의 글
- v0 변경 내역, 개인 계정을 팀 작업 공간으로 전환
- X의 @v0, iOS의 ChatGPT 구독
- X의 @ElevenLabs, 선두에 오른 Eleven v4
- X의 @HeyGenDev, 2K의 HeyGen Video
- X의 @pika_labs, Pika의 Nano Banana 2.1
- NVIDIA 기술 블로그의 DOCA GPUNetIO
- NVIDIA 기술 블로그의 Green contexts
- 공개 모델과 통신 사업자, NVIDIA 블로그
- Perplexity의 협업 도구 가이드