ai-powered-markdown-translatorgpt-5.6-sol을 사용하여 프랑스어에서 한국어로 번역된 기사.
이번 금요일에는 에이전트 도구들이 공통 형식으로 수렴하고 있다. 이제 Claude Code는 프로젝트에 CLAUDE.md이 없을 때 AGENTS.md을 읽고, Antigravity는 Markdown 에이전트의 시스템 프롬프트에 하위 에이전트 카탈로그를 삽입하며, Codex는 하위 에이전트별 사용량을 상세히 보여주고, MiniMax는 자사 터미널 에이전트의 코드를 공개했다. 이날의 나머지 소식은 Qwen3.8-Omni-Flash와 Grok Voice Transcribe 2.0이라는 두 모델의 출시, 그리고 이례적인 파트너십 하나로 요약된다. Anthropic이 Accenture의 평가자를 자사 내부에 배치한다.
Claude Code가 AGENTS.md를 읽고, 하위 에이전트를 격리하며, TaskOutput을 제거하다
9월 18일 — 20시간 동안 Claude Code 세 가지 버전이 연이어 출시됐다. 2.1.275는 9월 17일 22시 33분(UTC), 2.1.276은 18일 02시 12분(UTC), 2.1.277은 18일 18시 06분(UTC)에 공개됐다.
가장 구조적인 변화는 2.1.277의 한 줄에 담겨 있다. CLAUDE.md이 없는 프로젝트에서 Claude Code는 여러 코드 에이전트가 공유하는 관례로 자리 잡은 지침 파일 AGENTS.md을 읽는다. 이 선택은 /config의 « Project instructions »에서 설정할 수 있다. 이 기능은 아직 Bedrock, Vertex, Foundry에서는 제공되지 않는다.
Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)
🇰🇷 AGENTS.md 지원 추가: CLAUDE.md가 없는 프로젝트에서는 Claude Code가 대신 AGENTS.md를 읽으며, /config의 « Project instructions »에서 설정을 변경할 수 있다. 아직 Bedrock, Vertex 또는 Foundry에서는 제공되지 않는다. — Claude Code 변경 기록, anthropics/claude-code
같은 버전의 다른 두 변경 사항은 컨텍스트 보안과 관련된다. 하위 에이전트의 결과는 이를 명시하는 헤더와 함께 기본 에이전트로 전달되므로, 하위 에이전트가 반환한 텍스트가 세션 지침으로 위장할 수 없다. 또한 프롬프트에서 보이지 않는 Unicode 서식 문자를 제거하고, 전송 전에 정리된 버전을 표시한다. 2.1.277은 더 이상 권장되지 않는 TaskOutput 도구도 제거한다. 이제 Claude는 Read으로 백그라운드 작업의 출력 파일을 읽는다.
2.1.275에는 현재 턴을 중단하고 대기열의 모든 메시지를 한 번에 전송하는 즉시 전송 키(ctrl+enter)와 claude.ai 계정에서 활성화된 skills 및 plugins를 터미널로 동기화하는 기능이 추가됐다. 공급망 측면에서는 npm 기반 plugins를 무결성 검증과 함께 npm pack --ignore-scripts으로 가져오므로 패키지의 설치 스크립트가 실행되지 않는다. 4시간도 지나지 않아 공개된 2.1.276은 이 버전에서 발생한 회귀 하나만 수정한다. 프록시 뒤에서 모든 요청을 실패하게 만들던 400 오류다.
| 버전 번호 | 출시 시각(UTC) | 주요 내용 |
|---|---|---|
| 2.1.275 | 17/09 22시 33분 | 즉시 전송, claude.ai skills 동기화, npm --ignore-scripts |
| 2.1.276 | 18/09 02시 12분 | 단일 수정 사항: 프록시 뒤에서 발생하는 400 오류 |
| 2.1.277 | 18/09 18시 06분 | AGENTS.md 지원, 하위 에이전트 격리, TaskOutput 제거 |
Qwen 최초의 에이전트형 옴니모달 모델, Qwen3.8-Omni-Flash
9월 18일 — Qwen은 에이전트 기능을 중심으로 설계된 자사 최초의 옴니모달 모델이라고 소개한 Qwen3.8-Omni-Flash를 공개했다. 이번에 강조하는 변화는 더 이상 멀티모달 콘텐츠의 이해에 그치지 않고 이를 활용하는 것이다. 콘텐츠를 이해하고, 작업을 계획하며, 도구로 실행하고, 결과를 제공한다. 이 모델은 100만 토큰의 컨텍스트 창에서 텍스트, 이미지, 오디오, 동영상을 입력받는다.
Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!
🇰🇷 에이전트 기능을 중심으로 구축된 Qwen 최초의 옴니모달 모델, Qwen3.8-Omni-Flash를 소개한다. — @Alibaba_Qwen의 X 게시물
Qwen이 선정한 29개 평가에서 평균 점수는 Qwen3.5-Omni-Plus보다 25% 이상 향상됐으며, 성능 향상은 오디오·동영상 에이전트에 집중됐다. 가장 큰 변화가 나타난 영역은 다중 화자 인식이다.
| 선정된 평가 | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71,0 | 34,5 | 58,9 |
| UniClawBench | 69,6 | 67,1 | 69,0 |
| AgenticVBench | 36,8 | 14,5 | 45,0 |
| OmniVideoBench | 63,4 | 53,8 | 65,2 |
| StreamingBench | 80,8 | 57,1 | 79,9 |
| AliMeeting DER / cpWER(낮을수록 우수) | 3,4 / 17,2 | 88,1 / 89,6 | 72,6 / 53,1 |
가장 독창적인 부분은 긴 동영상에 적용한 에이전트형 인식이다. 모델은 녹화 영상을 처음부터 끝까지 처리하는 대신 질문에서 출발해 무엇을 보고 들어야 하는지 스스로 결정하고, 대략적인 범위에서 세부 범위로 좁혀 가는 연속 탐색을 통해 정보를 찾는다. OmniVideoBench에서 이 모드는 정확도를 63,4에서 67,8로 높이는 동시에 요청당 토큰 사용량을 145 736에서 79 117로 줄였다. 약 45,7% 감소한 수치로, 공식 게시물에서도 직접 제시됐다.
가격도 이에 발맞췄다. Qwen의 산정 방식에 따르면 오디오 입력 시간당 가격은 Qwen3.5-Omni-Plus보다 98% 이상 낮아졌다. 이어 두 가지 구성 요소도 공개됐다. Codex, Claude Code, Qwen Code, Gemini CLI 하니스와 호환되는 Qwen-MM-Plugins와 실시간 상호작용을 위한 Qwen-Live Harness다. Realtime 변형은 지연 시간이 짧은 연속 상호작용에 특화됐으며, 첫 토큰은 591~981밀리초 사이에 출력된다.
🔗 Qwen3.8-Omni-Flash에 관한 Qwen 게시물
Codex CLI 0.155.0이 음성 대화를 실험 기능으로 도입하다
9월 17일 — OpenAI가 npm install -g @openai/codex@0.155.0으로 설치할 수 있는 Codex CLI 0.155.0을 공개했다. 이는 9월 10일의 0.154.0 이후 첫 안정 버전이다. 전날 X에서 발표된 음성 에이전트에 빠져 있던 변경 기록 항목도 추가됐다. 이 기능의 이름은 /voice이며 실시간 받아쓰기와 마이크 제어 기능을 제공하지만, 여전히 실험적이다. 지원되는 빌드에서만 사용할 수 있고 /experimental으로 활성화해야 한다.
나머지 변경 사항은 비교적 눈에 띄지 않지만 당장 더 유용하다. 터미널 인터페이스의 상태 표시줄에는 실시간 추론 요약이 표시되고, 성공한 각 턴이 끝난 뒤에는 완료 시각이 추가된다. 에이전트 개요에서는 작업을 숨기고, 보관하고, 삭제할 수 있으며, worktrees의 소유권 세부 정보를 보여주고 관리되는 깨끗한 worktrees를 삭제하기 전에 확인을 요청한다. 호환되는 Mac에서는 로컬 TUI 세션의 MCP 요청을 Touch ID로 승인할 수 있다. Amazon Bedrock은 설정된 명령에서 AWS 자격 증명을 얻고 이를 캐시하며, 만료 시 갱신하고, 인증 실패 후 다시 시도할 수 있다.
여러 수정 사항은 보안과 관련된다. 제한된 WSL 샌드박스에서 Windows 프로세스로 빠져나가는 경로가 차단됐고, 중개된 shell 스냅샷은 자격 증명 노출을 막도록 강화됐다. 또한 계정을 변경하면 이전 ID에 속한 원격 제어 세션, 캐시된 WebSocket 상태, 모델 카탈로그가 무효화된다.
| 버전의 새로운 기능 | 세부 정보 |
|---|---|
/voice | 실시간 받아쓰기와 마이크 제어, /experimental을 통한 실험 기능 |
| 터미널 인터페이스 | 상태 표시줄의 추론 요약, 턴 완료 시각 |
| 에이전트 개요 | 작업 숨기기, 보관, 삭제, worktrees 소유권 |
| Touch ID | 호환되는 Mac의 로컬 세션에서 MCP 요청 승인 |
| Amazon Bedrock | 명령을 통한 AWS 자격 증명 획득, 캐시 및 갱신 |
Codex가 작업별, 하위 에이전트별, 대화별 사용량을 상세히 보여주다
9월 18일 — OpenAI Developers가 Codex의 상세 사용량 추적 기능을 발표했다. 이 도구는 작업, 하위 에이전트, 개별 대화가 전체 사용량에 각각 얼마나 기여하는지 보여준다. 개인 및 Business 계정에서는 데스크톱 애플리케이션의 설정, Usage & billing에서 찾을 수 있고, 대상 Enterprise 계정에서는 Usage 아래에서 확인할 수 있다. 이 기능을 사용하려면 최신 버전으로 업데이트해야 한다. 발표와 함께 공개된 블로그 게시물이나 변경 기록 항목은 없다.
핵심은 세분성이다. 지금까지는 할당량이 소진돼도 어디에서 사용량이 발생했는지 알 수 없었다. 하위 에이전트별 내역을 보면 어떤 위임에 비용이 드는지 파악하고 이를 다시 작성할 수 있다. 이는 코드 하니스 전반에 하위 에이전트가 보편화되는 흐름에 대응하는 비용 관리 기능이다.
가격은 그대로인 SpaceXAI 음성 인식 모델, Grok Voice Transcribe 2.0
9월 18일 — SpaceXAI가 새로운 음성 인식 모델인 Grok Voice Transcribe 2.0을 발표했다. 동일한 가격에 1.0 버전보다 정확도가 두 배 높다고 설명한다. 이 모델은 이미 Grok Voice를 구동하는 오디오 기반 기술을 토대로 한다. 회사에 따르면 Grok Voice는 매일 수만 건의 고객 지원 통화를 처리하고 수백만 시간 분량의 동영상 내레이션을 받아쓴다.
핵심 주장은 실험실 오디오가 아닌 실제 환경의 오디오에 관한 것이다. 불안정한 전화 회선, 겹치는 목소리, 지역 억양, 소리 내어 말한 전화번호와 이메일 주소를 다룬다. SpaceXAI는 공개 Artificial Analysis 순위에서 32개 스트리밍 모델 가운데 정확도 1위를 차지했다고 주장하며, 실제 운영 트래픽에서 추출한 네 가지 내부 데이터 세트를 근거로 제시한다. 8 kHz 전화 음성, Grok과의 대화, 음성으로 말한 식별자, 19개 언어의 짧은 음성 명령이다.
가장 뚜렷한 향상은 다국어 처리에서 나타난다. 언어를 식별할 문맥이 가장 적은 짧은 문장 데이터 세트에서 단어 오류율이 20,6%에서 6,8%로 낮아졌다. 모델은 언어를 자동으로 감지하고 녹음 도중 언어가 바뀌어도 한 번의 처리로 따라간다.
| 측정 지표 | 발표된 수치 |
|---|---|
| Transcribe 1.0 대비 주장된 정확도 | 두 배 향상 |
| Artificial Analysis 순위(스트리밍) | 32개 모델 중 1위 |
| 짧은 문장 오류율(1.0 → 2.0) | 20,6% → 6,8% |
| 일괄 처리 요금 | 오디오 시간당 0,10달러 |
| 스트리밍 요금 | 오디오 시간당 0,20달러 |
| 독립적으로 받아쓸 수 있는 채널 | 최대 8개 |
| 요청당 전문 용어 | 최대 100개 |
이 모델은 일괄 처리와 스트리밍, 신뢰도 점수가 포함된 단어별 타임스탬프, 추가 비용 없는 화자 분리(diarization), 발화 턴 종료 감지를 지원한다. 기존 API 통합은 코드를 변경하지 않아도 향상된 정확도를 적용받는다. Grok Voice Transcribe 2.0은 곧 API의 기본 모델이 되며, 1.0은 앞으로 몇 주 안에 지원 중단 대상으로 지정된다. 계속 사용하려면 grok-voice-transcribe-1.0으로 고정해야 한다.
🔗 Grok Voice Transcribe 2.0 발표
Anthropic이 Accenture 평가자를 회사 내부에 배치하다
9월 18일 — Anthropic이 최첨단 모델의 독립적 평가를 위한 Accenture와의 파트너십을 발표했다. 이는 자사 최고경영자가 약속한 내부 배치형(embedded) 평가자 수용을 향한 중요한 단계로 소개됐다. 이 작업은 Accenture의 AI 전문 자회사 Faculty가 수행하며, 모델 평가와 red-teaming, 정렬 평가, 안전장치 시험을 포함한다.
외부 평가자와의 차이는 명확하다. 내부 배치형 평가자는 직원과 비슷한 수준의 접근 권한을 갖고 AI 기업 내부에서 일한다. 모델의 훈련 과정을 관찰하고, 모델의 구축과 배포를 좌우하는 결정을 추적하며, 직원과 직접 대화하고, 안전 약속이 지켜지는지 확인하며, 사고를 보고하고, 이점과 위험에 대해 더 많은 정보에 기반한 설명을 공개할 수 있다. Anthropic은 이 체계가 자사의 책임을 줄이는 것이 아니라 더욱 검증 가능하게 만든다고 설명한다.
이번 발표는 아직 존재하지 않는 것들에 대해서도 이례적으로 솔직하다. 내부 배치형 평가자가 어떤 정보에 접근해야 하는지, 조사 결과를 어떻게 공개해야 하는지에 관한 표준이 없으며, 독립적 평가에 자금을 지원할 확립된 체계도 없다. Anthropic은 장기적으로 공동 기금이나 공공 기금에서 자금이 나와야 한다고 본다. 현재는 그런 장치가 없으므로 Accenture의 작업에 직접 비용을 댄다. 이는 이 구성에서 가장 눈에 띄는 한계다.
| 파트너십 항목 | 발표된 내용 |
|---|---|
| 운영 주체 | Accenture의 AI 자회사 Faculty |
| 투자 | 양측이 각각 5년에 걸쳐 최소 10억 달러 |
| 적용 범위 | 평가, red-teaming, 정렬, 안전장치 |
| 접근 수준 | 직원과 비슷한 수준 |
| 자금 조달 | 공동 기금이 없어 Anthropic이 직접 지원 |
| 독점성 | 양측 모두 없음 |
Anthropic은 이와 별도로 METR 및 다른 비영리 평가 기관들과도 각 기관의 자체 자금으로 내부 배치형 평가의 구성 요소를 시험하는 방안을 논의하고 있으며, 앞으로 몇 주 안에 추가 파트너를 발표할 예정이라고 밝혔다.
Antigravity: 맞춤형 에이전트를 둘러싸고 이틀 만에 나온 세 가지 버전
Google은 CLI 버전 두 개와 Antigravity 애플리케이션 버전 하나를 연이어 공개했다. 세 버전은 동일한 주제를 세 가지 관점에서 다룬다. 맞춤형 에이전트가 무엇을 알고, 무엇을 거부할 수 있으며, 감독 없이 어디까지 실행될 수 있는지에 관한 것이다. 이는 9월 11일 시작된 빽빽한 릴리스 행렬을 이어가며, 여기서는 버전 1.2.1부터 1.2.4까지는 다루지 않는다.
CLI 1.2.6이 세션에 연결된 Remote Control을 열고 5분 제한을 없애다
9월 18일 — CLI를 영구적인 시스템 서비스로 만든 1.2.0이 출시된 지 8일 만에 Google은 정반대 성격의 훨씬 가벼운 두 번째 Remote Control 방식을 도입했다. 시작할 때 --remote-control 플래그로 열거나 실행 도중 /remote-control 명령으로 여는 세션 범위(session-scoped) 연결이다. /remote-control off을 입력하거나 세션을 닫으면 터널이 해제되고 기기가 목록에서 제거된다. 1.2.0이 세션 이후에도 살아남는 데몬을 목표로 했다면 1.2.6은 그 반대를 지향한다.
두 번째 변경 사항은 인터페이스 없는(headless) 모드와 관련된다. -p / --prompt 실행의 기본 제한 시간이 5분에서 무제한으로 바뀌며, 명시적으로 --print-timeout을 지정한 경우는 제외된다. 세 번째 변경 사항은 오류 보고를 구조화한다. 에이전트나 API에 장애가 발생하면 CLI는 표준 오류 출력에 정규 상태, HTTP 또는 gRPC 코드, 재시도 가능 여부와 오류 식별자를 담은 JSON AGY_ERROR: {...} 한 줄을 기록하며, 종료 코드는 1에서 3으로 바뀐다. 따라서 오케스트레이션 스크립트는 자유 형식 텍스트를 분석하지 않고도 일시적인 네트워크 장애와 영구적인 오류를 구분할 수 있다.
CLI 1.2.5가 마침내 Markdown 에이전트에 하위 에이전트 목록을 제공하다
9월 17일 — 지금까지 Markdown으로 정의한 맞춤형 에이전트는 도구에 invoke_subagent을 선언할 수 있었지만 어떤 하위 에이전트가 존재하는지는 전혀 알 수 없었다. 도구는 보유했지만 목록은 없었던 셈이다. 이제 CLI는 사용 가능한 하위 에이전트 목록과 사용법을 시스템 프롬프트에 자동으로 추가해 실질적인 위임을 가능하게 한다.
변경 기록의 표현은 주의해서 해석해야 한다. 이는 제품 자체가 컨텍스트를 추가한 것이며 보안 취약점이나 수정 사항이 아니다. 두 번째 개선 사항은 백그라운드로 보낸 작업의 명시적인 이름을 유지한다. 이전에는 이 이름이 알림과 작업 목록 사이에서 사라졌다. 다섯 가지 수정 사항은 무효화된 식별자 정리, 중단된 명령의 종료 코드, 멈춘 채 남아 있던 추론 프레임을 다룬다.
Antigravity 2.15.0에서 맞춤형 에이전트가 기본 프롬프트와 도구를 끌 수 있게 되다
9월 18일 — 2.14.0이 출시된 지 3일 만에 애플리케이션은 개선 사항 7개와 수정 사항 16개를 공개했다. 핵심 변경 사항은 맞춤형 에이전트가 자체 컨텍스트를 제어할 수 있게 한 것이다. 기본 프롬프트 섹션과 기본 도구를 비활성화한 뒤 필요한 것만 다시 도입할 수 있다. 전문 에이전트라면 이를 통해 강제로 주어지는 시스템 프롬프트를 그만큼 줄일 수 있다.
나머지는 탐색과 상태 유지에 관한 것이다. Page Up, Page Down, Home, End 키로 대화를 스크롤하고, Escape 키로 입력 영역을 벗어날 수 있으며, 선택한 맞춤형 에이전트는 새로고침 후에도 기억된다. 두 가지 수정 사항은 데이터 무결성과 관련된다. 애플리케이션이 상태 파일을 읽지 못하면 저장된 설정과 프로젝트 목록이 덮어써질 수 있었고, 권한 설정에 중복 항목이 쌓여 대화 파일의 용량이 커졌다.
GitHub Copilot: Sentry canvas, 퇴출되는 모델 6개, 맞춤 설정별 지표
이틀 동안 나온 세 가지 변경 기록에는 같은 관심사가 드러난다. 팀이 Copilot을 실제로 어떻게 사용하는지 측정하고 더 이상 사용하지 않는 항목을 정리하는 것이다.
9월 14일 주간 요약에서 새로운 두 가지 요소가 드러나다
9월 18일 — GitHub가 9월 14일 주간의 Copilot 주간 요약을 공개했다. 목차 대부분은 이미 변경 기록에서 차례로 공개된 항목을 다시 소개하며, 별도로 발표된 적이 없는 요소는 두 가지뿐이다. 첫 번째는 Copilot 애플리케이션의 Sentry canvas로, 애플리케이션을 벗어나지 않고 프로덕션 충돌 보고서와 수정 사항을 연결한다. 오류, 스택 추적(stack traces), 컨텍스트를 표시한 다음 원인을 조사하고 수정 사항을 검증하며 pull request를 준비할 수 있게 한다. 9월 초 Jira에 이어 오류 모니터링 도구가 canvas에 통합된 첫 사례다.
두 번째는 VS Code 1.138의 에이전트 관련 기능이다. Agents 창에서 프로젝트의 도구와 종속성을 갖춘 로컬 Dev Container 안에서 에이전트를 실행할 수 있다. 이 기능은 점진적으로 배포되며 Docker가 필요하다. 비활성 세션은 모든 pull request가 병합되면 자동으로 완료 처리할 수 있고 유예 기간 후 선택적으로 삭제할 수도 있다. 이 기능은 프리뷰이며 명시적으로 활성화해야 한다. 마지막으로 Agent Host 세션에서 직접 pull request를 만들 수 있다.
10월 19일 모델 6개가 모든 Copilot 환경에서 퇴출되다
9월 18일 — GitHub는 2026년 10월 19일 Copilot Chat, 인라인 편집, ask 및 agent 모드, 코드 완성을 포함한 모든 Copilot 환경에서 모델 6개를 퇴출한다고 발표했다. 이는 9월에 발표된 두 번째 지원 중단 일정이다.
| 퇴출 모델 | 퇴출일 | 제안 대안 |
|---|---|---|
| Gemini 3.7 Flash | 19/10/2026 | Gemini 3.8 Flash |
| GPT-5.5 | 19/10/2026 | GPT-5.6 Sol |
| GPT-5.4 | 19/10/2026 | GPT-5.6 Sol |
| GPT-5.4 mini | 19/10/2026 | GPT-5.6 Luna |
| GPT-5 mini | 19/10/2026 | GPT-5.6 Luna |
| Grok 4.5 | 19/10/2026 | Grok 4.6 |
기본 모델 활성화가 적용된 경우, 관리자가 전역 기본값을 비활성화하거나 해당 모델을 명시적으로 차단하지 않는 한 Copilot Enterprise와 Business 고객에게 대안 모델이 자동으로 활성화된다. 그런 경우에는 설정의 모델 정책을 통해 접근 권한을 다시 열 수 있다. 모델을 제거하기 위해 별도로 해야 할 작업은 없다.
지표 API가 CLI의 skills, 에이전트, MCP 서버와 plugins를 집계하다
9월 17일 — 이제 Copilot 사용량 지표 API는 CLI의 에이전트 맞춤 설정 다섯 가지 유형을 지원한다. skills, 맞춤형 에이전트, MCP 서버, slash commands, plugins다. totals_by_skill, totals_by_custom_agent, totals_by_mcp, totals_by_slash_cmd, totals_by_plugin 테이블에는 가장 활발한 항목 5개와 각각의 interaction_count이 나열되며, distinct_*_use_count 필드는 상위 5개를 제외하고 사용된 항목의 다양성을 집계한다.
두 가지 세부 사항을 알아야 오해를 피할 수 있다. MCP 서버의 경우 CLI가 연결이나 재연결을 시도할 때만 성공 여부와 관계없이 카운터가 증가하며, 이미 설정된 연결에서 도구를 호출할 때마다 증가하는 것은 아니다. plugins 지표는 plugin과 연결된 skills 호출만 집계한다. 따라서 skills 전체 수치의 하위 집합이며 여기에 더해서는 안 된다. 개인정보 보호를 위해 GitHub가 제공한 이름만 표시되고 고객이 정의한 이름은 other으로 묶인다.
터미널 코딩 에이전트: MiniMax는 코드를 공개하고 Mistral은 하니스를 안정화하다
서로 관련 없는 두 업체가 같은 날 같은 시장에서 발표를 내놓았다. 터미널에서 작동하는 코딩 에이전트가 보편화되고 차별화의 중심은 라이선스와 하니스의 안정성으로 옮겨가고 있다.
MiniMax가 MIT 라이선스로 MiniMax Code CLI 코드를 공개하다
9월 18일 — MiniMax가 터미널 코딩 에이전트 버전 0.4.12의 소스 코드를 공개했다. 도구는 mcode이라는 이름으로 설치되며 세 가지 진입점을 제공한다. 대화형 터미널 인터페이스, shell 스크립트와 지속적 통합 및 평가용 인터페이스 없는 모드(mcode exec), Agent Client Protocol 호환 편집기용 ACP 모드다. 권한 및 sandbox 체계 아래 프로젝트 파일을 읽고 차이를 검사하며 shell 명령과 테스트를 실행한다.
모델 선택은 개방적이다. 한쪽에는 MiniMax 계정과 Token Plan이 있고, 다른 쪽에는 OpenAI 또는 Anthropic 호환 API 형식을 제공하는 타사 공급자가 있다. 이 밖에도 통합 검색, 멀티모달 도구, MCP 프로토콜, 하위 에이전트, plugin 시스템을 지원한다. 원본 코드는 기본적으로 MIT 라이선스로 공개된다. 저장소는 TUI, 인터페이스 없는 CLI, ACP 모드를 포함하지만 데스크톱 애플리케이션은 포함하지 않는다. 다만 데스크톱 애플리케이션의 문제 추적은 해당 저장소에서 관리한다. 현재 코드 기여는 저장소 공동 작업자의 제안만 받고 있다.
Vibe CLI의 Unified Harness가 실험 상태를 벗어나다
9월 18일 — Mistral이 2.25.4 출시 6일 만에 Vibe CLI 2.25.5를 공개했다. 구조적인 변화는 릴리스 노트 한 줄에 담겼다. Unified Harness에 더 이상 ‘experimental’이라는 표시가 붙지 않으며, 이제 이전 Python 하니스로 돌아가는 공식 우회 수단은 --legacy-harness이다. shell 승인 보안을 중심으로 한 일련의 수정 버전을 거쳐 새 하니스가 공식적인 기본값이 되었다. 중요한 것은 버전 번호가 아니라 이 사실이다.
전환과 함께 기능 동등성도 보완됐다. 이제 Unified Harness는 현재 Git 브랜치, 저장소 상태, 최근 커밋을 시스템 지침에 주입한다. hooks는 더 이상 조용히 무시되지 않고 마침내 하위 에이전트 내부에서 실행되며, 로컬 또는 자체 호스팅 서버처럼 API 키 환경 변수 없이 구성한 공급자도 다시 작동한다. 권한 강화도 계속된다. shell 승인은 더 이상 다른 프로그램이나 환경으로 확대되지 않고, MCP 도구 호출은 권한 시스템을 우회하지 않고 준수하며, smart approve는 더 이상 사용자 규칙을 무시하지 않는다.
ChatGPT plugins에서 여러 계정을 동시에 지원하다
9월 18일 — 대부분의 ChatGPT plugins에 여러 계정 지원이 도입된다. 개인 계정, 업무 계정, 부가 프로젝트 계정을 연결한 뒤 각각의 컨텍스트를 하나의 대화로 불러올 수 있다. 계정은 chatgpt.com/plugins의 plugin 디렉터리에서 연결한다.
OpenAI Developers 계정의 발표는 한 시간 앞서 Max Stoiber가 게시한 메시지를 인용했다. plugin 개발자가 할 일은 없다. 변경 없이 기능이 자동으로 활성화된다. 더 나아가려면 MCP 서버에 profile 도구를 추가해 ChatGPT가 연결된 계정에 라벨을 지정하도록 할 수 있다. 이것이 개발자에게 요구되는 유일한 구체적 조치다. 발표는 파리 시간 18시 10분에 게시됐으며 관련 블로그 글이나 변경 기록 항목은 없다.
주요 사용 사례는 고용주나 프로젝트별로 신원을 분리해 관리하며 지금까지 컨텍스트를 바꾸려면 연결 계정을 전환해야 했던 개발자다.
Genspark가 Plus와 Pro 요금제에 주간 크레딧 잔액을 추가하다
9월 18일 — Genspark가 요금제 가격을 변경하지 않고 Plus 및 Pro 구독 혜택에 주간 크레딧 잔액을 추가한다. 이 잔액은 기존 구독 할당량에 더해 매주 지급되며 Super Agent, AI Chat, AI Image, AI Slides, AI Sheets, AI Docs, Deep Research 등 플랫폼의 모든 에이전트와 도구에서 Standard 모드를 사용할 때 적용된다.
같은 스레드의 두 번째 메시지는 AI Chat과 AI Image의 작동 방식을 자세히 설명한다. 기존 구독자에게는 이미 보유한 잔액에 추가되며, 2026년 12월 31일까지 Opus 같은 주력 모델을 포함한 모든 AI Chat 및 AI Image 모델을 크레딧 차감 없이 사용할 수 있다. 9월 18일부터 구독하는 사용자는 AI Chat과 AI Image의 기본 모델(core models)을 무료로 사용할 수 있다. Genspark는 이러한 변경이 Team이나 Enterprise 요금제에는 적용되지 않는다고 밝히며, 자세한 조건은 도움말 센터를 참조하도록 안내한다.
Google Research: AlphaGenome Atlas의 성과와 스스로 검증하는 시뮬레이션
같은 날 공개된 두 연구에는 공통점이 있다. 두 경우 모두 모델 자체가 아니라 제삼자가 모델로 만들어 낸 결과나 검증 순환 과정이 대신 확인하는 내용이 제시된다.
AlphaGenome Atlas가 협력 기관들의 첫 성과를 내놓다
9월 17일 — 인간 DNA에서 발생할 수 있는 90억 가지 치환의 예측 지도인 AlphaGenome Atlas를 공개한 지 9일 만에 Google DeepMind가 세 가지 협력 사례를 설명하는 상세 스레드를 상단에 고정했다.
| 과학 협력 기관 | 보고된 결과 |
|---|---|
| Stowers Institute | 2,500개 이상의 조절 모티프 지도화 |
| University of Exeter / UK Biobank | 54,000명 이상의 참가자 분석, 희귀 유전 신호 탐지 22% 이상 증가 |
| Broad Institute | DNM1 유전자의 핵심 돌연변이를 식별한 뒤 실험실에서 확인 및 검증 |
조절 모티프는 유전자 활동의 스위치와 조절 손잡이처럼 작용하는 DNA 서열이다. Exeter에서 진행된 연구는 대사 건강과 관련된 단백질인 PLA2G7의 양에 영향을 미치는 새로운 변이도 찾아냈다. Broad Institute의 사례는 세 가지 중 가장 구체적이다. 원인이 밝혀지지 않은 희귀 질환에서 가능한 돌연변이 목록이 방대할 때 Atlas가 올바른 돌연변이를 지목하고 이후 실험실 작업이 이를 확인한다. 다만 전체 내용은 상세한 블로그 글이나 관련 논문 없이 X 스레드에만 담겨 있다.
생성된 교육용 시뮬레이션을 Chrome에서 에이전트가 테스트
9월 17일 — Gal Elidan과 Yael Haramaty는 생성형 인터페이스(generative UI)를 교육용 시뮬레이션 제작에 적용한 실험을 공개했다. 교사가 주도권을 유지한다. 교사가 주제를 제안하면 Google이 수정 가능하고 교사의 승인을 받아야 하는 학습 목표 세트를 생성하며, 이를 토대로 콘텐츠를 만든다. 각 인터랙티브 콘텐츠는 난도가 점차 높아지는 여러 단계로 나뉘며, 도구 상자와 단계별 힌트, 상세한 해설을 제공한다.
가장 흥미로운 요소는 자체 수정 루프다. 생성 결과는 교육적 적합성과 메커니즘, 표현 방식에 관한 기준으로 검증되며, 일부 평가는 에이전트 방식으로 수행된다. 풀이 가능성 테스트에서는 Chrome 인스턴스를 열고 사용자가 하듯 시뮬레이션을 조작하며, 슬라이더를 극단값까지 미는 것과 같은 적대적 행동도 시도한다. 생성 시간이 더 길어지는 대신 모든 기준이 충족될 때까지 이 루프를 반복한다. Google은 영어로 된 STEM 인터랙티브 콘텐츠를 30개 이상 공개했다. 영국 교사들이 40개로 구성된 컬렉션을 평가했으며, 미국 교사 12명을 대상으로 한 연구에서는 평균 10점 만점에 8점을 받았다.
🔗 교육용 인터랙티브 콘텐츠에 관한 Google Research 게시물
Claude, 생물학 모델 30개 이상의 속도를 높이고 단백질 경진대회를 지원
9월 17일 — Anthropic은 Claude가 생물학자들이 사용하는 30개 이상의 open source 모델에서 추론을 최적화한 과정을 설명하는 게시물을 공개했다. 대상에는 구조 예측, 단백질 설계, 단백질 언어 모델과 유전체 모델이 포함되며, 4주가 채 되지 않는 기간에 평균 약 4배의 성능 향상을 달성했다. 모든 코드는 open source로 공개됐다.
기술적 핵심은 시간과 메모리 복잡도가 모두 3차인 삼각 어텐션과 삼각 곱셈이다. Claude는 어텐션에서 해당 분야의 표준보다 2.7~2.9배 빠른 kernel 세트인 FlashPairformer를 만들었다. « Big »이라는 저메모리 모드를 사용하면 단일 GPU 노드에서 10,000 tokens가 넘는 시스템도 정확하게 폴딩할 수 있다. AlphaFold3가 예측한 40S 리보솜은 7,663 tokens로 구성돼 있었다. 방법론적 측면도 그만큼 중요하다. 추론 최적화 경험이 전혀 없던 기술 직원 두 명이 이 작업을 감독했다.
마지막으로 Anthropic은 Adaptyv Bio와 함께 다섯 가지 어려운 과제로 구성된 단백질 설계 경진대회를 공동 후원한다. 커뮤니티가 만든 5,000개 이상의 설계를 실험으로 검증하며, 최대 100만 달러 상당의 Claude 크레딧과 Modal이 제공하는 25만 달러 상당의 컴퓨팅 자원이 지원된다.
오픈 모델과 연구소: Muse의 Mac 출시, Sakana의 프런티어 그룹 공개
Meta, Muse 에이전트를 macOS에 출시
9월 18일 — Meta가 9월 17일 밤에서 18일 사이 발표한 Muse를 Mac에 출시한다. @AIatMeta 계정은 매번 사용자의 명시적 허가를 받아 사용자의 컴퓨터에서 직접 작업할 수 있는 개인용 에이전트를 소개하는 게시물을 공유했다. 다운로드 폴더 정리, 잃어버린 파일 찾기, 메시지와 메모 요약이라는 세 가지 용례가 제시됐다.
이번 발표는 9월 8일 출시된 Muse의 확장이다. Muse Spark 1.3으로 구동되는 이 에이전트는 지금까지 iOS, Android, 웹, WhatsApp에서 이용할 수 있었다. Mac 지원은 이러한 제품 유형을 한 단계 진전시킨다. 이제 에이전트는 자체 sandbox 안이 아니라 사용자의 개인 파일을 대상으로 작업한다. Meta는 가격과 이용 가능 국가, 필수 사양을 공개하지 않았으며, Mac 전용 보안 문서도 함께 내놓지 않았다. ai.meta.com 블로그에는 7월 27일 이후 새 게시물이 없다.
Sakana AI, Frontier Intelligence Group과 패러다임에 관한 입장 공개
9월 18일 — Sakana AI는 회사 설립 초기부터 성장해 온 내부 연구 집단 Frontier Intelligence Group(FIG)의 존재를 공개했다. 출발점은 Sakana AI의 최고기술책임자이자 Transformer 발명자 중 한 명인 Llion Jones가 제기한 질문이다. 더 많은 데이터와 컴퓨팅으로 Transformer 아키텍처의 규모를 계속 키우기만 하면 AGI에 도달할 수 있는가? 연구소의 답은 ‘아니다’이다.
핵심 정보는 함께 소개된 연구 목록보다 바로 이 대목에 있다. 게시물은 현재의 패러다임이 해결하지 못한 문제를 열거한다. 모델은 잘못된 정보를 확신에 차서 생성하고, 진정으로 새로운 상황에 직면하면 무너지며, 많은 에너지를 소비한다. 그리고 이에 대조적으로 지속적으로 학습하고 훨씬 적은 데이터로 일반화하는 생물학적 지능을 제시한다. 이 그룹은 benchmark 점수에 대한 압박 없이 실패할 자유를 포함해 다섯 가지 원칙을 세웠다. 소개된 연구 중 NVIDIA와 함께 진행한 희소 Transformer 연구는 한 단어를 처리할 때 feed-forward 계층의 뉴런 중 95% 이상이 비활성 상태로 남는다는 측정 결과에서 출발했으며, ICML 2026에 채택된 TwELL이라는 데이터 형식을 만들어 냈다.
🔗 Frontier Intelligence Group에 관한 Sakana AI 게시물
생성형 동영상: Runway의 크레딧 통합, Pika의 첫 애플리케이션 출시
Runway, 웹 애플리케이션과 Runway Dev 간 크레딧을 통합
9월 18일 — Runway가 두 제품 사이의 장벽을 없앤다. 구매한 크레딧을 웹 애플리케이션과 개발자용 제품인 Runway Dev에서 구분 없이 사용할 수 있게 된다. 지금까지 두 환경은 별도의 크레딧 잔액과 계약으로 운영됐으며, 프로젝트 간 사용량을 한곳에서 추적할 방법도 없었다.
이번 변경에는 네 가지 사항이 포함된다. 하나의 청구서로 중앙에서 구매하는 통합 크레딧 잔액, 웹 애플리케이션에서 작업 흐름을 구축한 뒤 API로 제공하기까지 이어지는 연속적인 경로, Applied AI Architects에 대한 접근을 포함해 강화된 Runway Dev 지원, 그리고 관리자가 웹과 Dev 작업 공간 사이에서 크레딧을 이전할 수 있도록 새롭게 설계된 작업 공간 분석 화면이다. 두 가지 프로모션은 2026년 12월 31일까지 유효하다. 신규 기업은 계약 시 크레딧을 10% 추가로 받는데, Runway가 공개한 환산 기준으로 최소 동영상 130분 또는 이미지 12,000장에 해당한다. 기존 고객은 AI 애플리케이션 제품 책임자에게 고객을 소개하는 대가로 5,000크레딧과 Applied AI Architect의 하루 지원을 받는다.
Pika, 제품 사진을 광고 동영상으로 만드는 Product Ad 출시
9월 18일 — 새로운 창작 플랫폼을 공개한 다음 날, Pika가 첫 번째 애플리케이션 Product Ad를 선보였다. 이 애플리케이션은 하나 이상의 제품 이미지와 서면 개요를 결합해 바로 시장에 내놓을 수 있다고 소개되는 동영상을 만든다.
| 생성 매개변수 | 제안 값 |
|---|---|
| 지원 길이 | 6 s, 15 s, 30 s, 60 s, 2 min |
| 출력 형식 | 16:9 |
| 입력 항목 | 제품 이미지와 서면 개요 |
| 접근 | 계정 생성 필요 |
Pika는 전날 플랫폼 개편을 알린 자사 메시지를 인용하며 이번 발표를 공개했다. 이는 Product Ad가 독립된 기능이라기보다 앞으로 이어질 애플리케이션 시리즈의 일부임을 보여준다. 모델명과 가격은 공개되지 않았다.
NVIDIA, 대규모 추론 성능을 측정하는 GenAI-Perf의 후속 도구 AIPerf 공개
9월 18일 — NVIDIA는 생성형 추론용 성능 측정 도구 AIPerf를 공개했다. GenAI-Perf의 후속 도구로 소개됐으며 처음부터 새로 작성됐다. 출발점이 된 문제는 익숙하다. 모델을 배포한 뒤 « 빠른가? »라는 질문에 답하기 위해 curl 명령이나 임시 부하 생성기를 사용하는 경우가 많지만, 여기서 나온 수치는 신뢰하기 어렵다.
차이는 아키텍처에 있다. 대부분의 도구는 단일 프로세스에서 실행되며 동시성이 높아지면 Python 전역 인터프리터 잠금에 가로막히지만, AIPerf는 작업을 분산한다. worker 프로세스가 부하를 생성하고 별도의 서비스가 결과를 처리하며, 전체 구성 요소는 ZMQ를 통해 조율된다. 목표는 명확하다. 측정 클라이언트 자체가 절대로 병목이 되지 않게 하는 것이다.
| 보고 지표 | 측정 대상 |
|---|---|
| Time to First Token | 요청 전송부터 첫 token까지의 지연 시간 |
| Inter-Token Latency | 생성 중 연속된 두 token 사이의 지연 시간 |
| 요청 지연 시간 | 전체 응답의 종단 간 소요 시간 |
| 출력 token 처리량 | 모든 요청에서 초당 생성되는 tokens |
| 보고 백분위수 | p25, p50, p75, p90, p95, p99 |
| endpoint 유형 | 15개 이상 |
이 도구는 Mooncake, Baseten, WEKA 형식의 실제 트래픽 trace도 재현할 수 있다. 게시물은 특히 분포의 유용성을 강조한다. 첫 token까지 걸리는 평균 시간은 양호해 보이지만 p99가 급증하는 서버는 집계 수치에서는 문제가 드러나지 않다가 프로덕션 환경에서 실패한다.
Mistral, 자사 시스템에 대한 무단 접근 주장을 부인
9월 18일 — Mistral은 자사 시스템에 대한 무단 접근 주장에 대응해 05시 48분(UTC)에 X 계정으로 짧은 성명을 발표했다. 회사는 철저한 조사를 실시했으나 해당 주장을 뒷받침하는 증거를 찾지 못했으며, 자사 시스템이 침해되지 않았음을 확인한다고 밝혔다.
We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.
🇰🇷 당사는 자사 시스템에 무단으로 접근했다는 주장을 인지하고 있습니다. 철저한 조사를 마친 결과, 당사는 이 주장을 뒷받침하는 어떠한 증거도 찾지 못했으며 자사 시스템이 침해되지 않았음을 확인할 수 있습니다. — @MistralAI의 X 게시물
이 메시지는 주장을 제기한 당사자를 밝히지 않았고, 해당 주장의 시점이나 성격도 명시하지 않았으며, 조사 범위에 관한 세부 정보도 제공하지 않았다. 여기서는 Mistral의 입장만을 전한다. 최초 주장은 확인할 수 없었다. 이 성명은 해당 기간 이 계정에서 가장 많은 조회수를 기록한 메시지이며, 회사 웹사이트에서는 추가 게시물을 찾을 수 없었다.
단신
- Balyasny Asset Management이 Claude Fable 5를 관리하는 방식을 설명 — 약 380억 달러를 운용하는 이 회사는 인수합병 차익거래의 초기 분석 기간을 3~5일에서 하루 미만으로 단축했다. 에이전트가 약 30분간 작업한 뒤 사람이 검토한다. 🔗 출처
- Codex CLI 0.155.1이 추론 요약을 다시 기본 비활성화 — 0.155.0 출시 다음 날 나온 단일 수정 사항이다. 이를 기본으로 활성화하면 해당 기능을 지원하지 않는 제공업체가 요청을 거부했다. 🔗 출처
- Gemini CLI가 하루의 공백을 거쳐 nightly 릴리스 재개 — 9월 18일에 네 가지 변경 사항이 적용됐다. 갱신 시 OAuth refresh token 유지와 식별자 삭제 작업의 멱등성 확보 등이 포함되며, stable 및 preview 채널은 그대로다. 🔗 출처
- Kimi Code 2.0.1이 시작 및 세션 재개 속도 향상 — 2.0.0 출시 32시간 뒤 나온 수정 버전이다. 세션 인덱스 압축, 긴 기록에서의 빠른 재개, 명명된 환경 변수에서 API 키 읽기, 파일 감시자 수 제한이 포함됐다. 🔗 출처
- Qwen Code가 Playwright 브라우저 SDK를 포함한 v0.24.1 preview로 전환 — stable 버전은 아니다. Chrome 네이티브 메시징 릴레이를 이용한 통합 브라우저 제어와 컨테이너 내 하위 에이전트 실행을 도입한다. 🔗 출처
- Zed가 단 두 가지 수정 사항을 담은 stable 1.20.2 출시 — 서드파티 모델 제공업체의 결제 오류에서 원래 메시지 대신 Zed Pro 전환 안내가 표시되지 않으며, 같은 언어용 snippet 확장 프로그램 두 개가 더는 서로를 무효화하지 않는다. 🔗 출처
- Replit이 공개된 기준 없이 Free Mode가 ‘30배 더’ 넉넉하다고 주장 — 링크나 changelog 없이 트윗 하나만 있으며, 무엇과 비교해 30배인지 명시하지 않았다. 측정 결과가 아니라 Replit의 주장으로 봐야 한다. 🔗 출처
- Copilot 영향 대시보드가 기능별 참여도를 세분화 — 28일 동안 일곱 가지 사용 영역을 보여주며, 능동적 코드 리뷰와 수동적 코드 리뷰를 구분한다. 도입 단계 사용자 집단도 이제 이동 기간을 기준으로 계산된다. 🔗 출처
- GitHub가 6개 언어로 Copilot SDK 입문 생방송 예정 — 세션, 도구, MCP 서버, 스트리밍 이벤트를 다루며, .NET과 Java 전용 세션도 제공한다. 사전 지식은 필요 없다. 🔗 출처
- Runway Ruby가 HDR 변환 시 alpha 채널 보존 — 원본 영상을 HDR로 변환하는 한 번의 과정에서 투명도가 그대로 유지된다. 가격이나 구독 등급은 공개되지 않았다. 🔗 출처
- MiniMax가 싱가포르 SkillsFuture 프로그램용 Singtel AI Pass에 합류 — MiniMax H3, MiniMax Agent, MiniMax Audio가 SWDA의 지원을 받는 200개 이상의 AI 강좌에서 자격 요건을 충족한 학습자를 대상으로 하는 상품에 포함된다. 금액과 일정은 공개되지 않았다. 🔗 출처
- VC-Attention이 재학습 없이 MiniMax-H3의 attention 가속 — MiniMax가 기존 모델에 적용할 수 있는 저정밀도 attention에 관한 Nunchux AI의 연구를 소개했다. Nunchux AI는 FlashAttention-4 대비 B200에서 1.6배, B300에서 1.5배의 성능을 발표했다. 🔗 출처
- Wan3.0이 OpenArt Arena의 동영상 부문에서 2위 기록 — Alibaba는 30초 분량 장면, 네이티브 오디오, 모든 참조 유형 지원을 강조했다. 서드파티 순위에서의 성과일 뿐 새로운 제품 소식은 아니다. 🔗 출처
- Synthesia가 New York에 미국 본사 개설 — 제품, 인력 규모, 투자 일정에 관한 내용은 없는 기업 소식으로, Interactive Avatar API의 정식 출시 이틀 뒤에 발표됐다. 🔗 출처
- Grok Imagine이 전적으로 AI로 제작한 파일럿의 비용 공개 — PJaccetturo의 스튜디오는 Odyssée 경연 프로그램 파일럿 에피소드에 9일간 작업했으며, 이미지 3,627개와 동영상 3,043개를 생성하는 데 2,677달러를 지출했다고 밝혔다. 🔗 출처
- BananaMind 2 Pro가 20배 적은 token으로 SmolLM2에 근접 — 1,390억 개의 매개변수를 갖춘 모델이 1,000억 개의 token과 RTX 5070 Ti로 학습돼 HellaSwag에서 42.78%를 기록했다. 2조 개의 token으로 학습된 SmolLM2-135M은 43.22%였다. 🔗 출처
- Optimum-Intel v2.2.0과 OpenVINO GenAI 2026.4.0이 Intel 하드웨어용 내보내기 확대 — Hugging Face와 Intel이 Intel 프로세서, 그래픽 카드, NPU를 지원하는 공동 버전을 출시했으며, 이제 Mistral 3도 내보낼 수 있다. 🔗 출처
- AmberTrace Labs가 검증 가능한 보상 기반 RL에서 Olmo 3의 추론 충실도 측정 — 학습에서 제외된 probe를 기준으로 충실도가 0.238에서 0.262로 상승했다. 저하가 아닌 긍정적인 변화이며, checkpoint도 공개됐다. 🔗 출처
- Together AI가 DeepSeek V4.1 Flash에서 가장 빠른 첫 token 응답 시간을 기록했다고 주장 — 회사는 사전 예열된 요청에 관한 서드파티 측정 결과를 소개했지만 방법이나 수치를 공개하지 않았다. 검증 가능한 결과가 아니라 주장이다. 🔗 출처
- Google Flow가 두 창작자의 New York Fashion Week 활동 지원 — Jane Wade 및 Sergio Hudson과 함께 설계한 맞춤형 도구다. 활용 사례를 선보인 것으로, 새로운 모델이나 배포된 기능은 없다. 🔗 출처
- Google AI Educator Series가 대학 학점 인정 대상에 포함 — 이제 교육 과정의 강좌를 대학 학점이나 평생교육 학점으로 인정받을 수 있다. 🔗 출처
이것이 의미하는 바
오늘의 소식이 무엇보다 보여주는 것은 코드 에이전트가 폐쇄형 제품에서 벗어나 서로의 형식을 공유하기 시작했다는 점이다. 프로젝트에 CLAUDE.md이 없으면 Claude Code가 AGENTS.md을 읽는다. 즉, 같은 저장소를 여러 도구에서 사용할 수 있도록 Anthropic이 다른 곳에서 정의된 지침 파일을 받아들인다는 뜻이다. 같은 날 Antigravity는 Markdown 에이전트의 system prompt에 사용 가능한 하위 에이전트 목록을 주입했고, Vibe CLI는 마침내 hook이 하위 에이전트 내부에서 실행되도록 했으며, Codex는 비용을 하위 에이전트별로 세분화하고 Qwen Code는 하위 에이전트를 컨테이너에 넣었다. 에이전트 간 위임은 설정상의 약속이었지만, 이제 문서화하고 격리하며 비용을 산정해야 하는 실제 작동 방식이 되고 있다. Claude Code는 불신의 논리를 끝까지 밀어붙여 하위 에이전트의 결과에 전용 헤더까지 표시한다. 전달된 텍스트가 지침인 것처럼 가장하지 못하게 하기 위해서다.
터미널 에이전트 시장은 눈에 띄게 보편화되고 있다. MiniMax는 TUI, 비대화형 모드, ACP, 자유로운 모델 선택을 갖춘 자체 도구를 MIT 라이선스로 공개했다. Mistral은 Unified Harness에서 ‘실험적’이라는 꼬리표를 제거하고 --legacy-harness을 비상 탈출구로 문서화했다. Kimi Code는 주요 버전 출시 32시간 만에 성능 수정판을 내놓았다. 네 업체가 동일한 진입점을 갖춘 같은 종류의 제품을 제공하면 차별점은 라이선스, harness의 안정성, 권한 체계로 이동한다. 그리고 Mistral과 Anthropic 모두 바로 이 부분에 오늘의 변경 사항을 집중했다.
모델 분야에서는 audio-video가 설명형에서 agentic 형태로 바뀌는 흐름이 나타난다. Qwen3.8-Omni-Flash는 더 이상 동영상을 설명하려 하지 않고 그 안에서 답을 찾는다. 질문에서 출발해 OmniVideoBench 점수를 4.4점 높이면서도 token 사용량을 45.7% 줄였다. 성능과 비용 효율이 같은 방향으로 움직이는 드문 사례다. 반면 Grok Voice Transcribe 2.0은 실험실 시연 대신 실제 트래픽에 초점을 맞췄다. 짧은 문장의 오류율을 20.6%에서 6.8%로 낮추면서 가격은 유지했다. 두 발표가 가리키는 방향은 같다. 이제 가치는 지원하는 modality 자체가 아니라 모델이 무엇을 처리하기로 결정하는지에서 나온다.
남은 문제는 연구소가 어디까지 검증을 허용하느냐다. Anthropic은 Accenture에 비용을 지급해 직원 수준의 접근 권한을 가진 평가자를 자사 내부에 배치한다. 그러면서 같은 발표에서 그러한 평가자가 무엇에 접근해야 하는지, 조사 결과를 어떻게 공개해야 하는지, 누가 비용을 부담해야 하는지에 관한 기준이 전혀 없다고 인정했다. 이는 제도인 동시에 고백이다. 그에 비해 오늘 나온 가장 탄탄한 근거는 서드파티가 재현할 수 있는 것들이다. AlphaGenome Atlas에 관한 Exeter와 Stowers Institute의 결과, open source로 공개된 생체분자 최적화 코드, AmberTrace Labs의 checkpoint가 이에 해당한다. 반대 사례도 마찬가지로 선명하다. Replit은 근거 없이 30배라는 수치를 제시했고, Together AI는 방법론 없는 순위를 전달했으며, Mistral은 아무도 읽어보지 못한 주장을 부인했다. 이런 상황에서 AIPerf의 등장은 시의적절하다. 측정자가 흔히 문제의 원인이라는 사실을 먼저 인정하는 측정 도구이기 때문이다.
출처
- Claude Code, 버전 2.1.277 릴리스 노트
- Claude Code CHANGELOG
- Qwen, Qwen3.8-Omni-Flash 게시물
- Alibaba Qwen의 X 모델 발표
- Codex CLI, 버전 0.155.0 릴리스 노트
- OpenAI Developers의 X 게시물, Codex의 세부 사용량
- SpaceXAI, Grok Voice Transcribe 2.0
- Anthropic, Accenture와 함께하는 통합 평가
- Antigravity changelog
- GitHub, 9월 14일 Copilot 주간 요약
- GitHub, Copilot 모델 6종 지원 중단
- GitHub, 메트릭 API의 CLI agentic 사용자 지정
- MiniMax의 X 게시물, MiniMax Code CLI 소스 코드 공개
- Vibe CLI, 버전 2.25.5 릴리스 노트
- OpenAI Developers의 X 게시물, 다중 계정 plugin
- Max Stoiber의 X 게시물, 다중 계정에 관한 원문
- Genspark의 X 게시물, Plus 및 Pro 주간 잔액
- Google DeepMind의 X 게시물, AlphaGenome Atlas 협력 기관의 결과
- Google Research, 생성형 인터페이스를 활용한 교육용 상호작용 콘텐츠
- Anthropic Research, Claude와 생체분자 모델링
- Meta AI의 X 게시물, Mac용 Muse
- Sakana AI, Frontier Intelligence Group
- Runway, 통합 요금 체계
- Pika의 X 게시물, Product Ad 출시
- NVIDIA, AIPerf로 대규모 inference 측정
- Mistral AI의 X 게시물, 9월 18일 반박