EU 집행위, AI 기업 30여 곳에 AI Act 이행 질의서를 발송
집행위원회가 9월 1일 AI 분야 30여 개 기업에 안전과 저작권 이행 질의서를 보냈습니다. 범용 AI 모델 의무 집행의 첫 사례와 그 법적 무게를 정리했습니다.
Perplexity, 기기 안에서 개인정보를 걸러 내는 0.6B 모델을 공개
Perplexity가 Mac용 Hybrid Compute를 열면서 개인정보 경계를 지키는 0.6B 분류 모델과 13개 언어 합성 대화 벤치마크를 함께 공개했습니다.
IOI 2026에서 AI 시스템이 인간 1위 점수를 넘긴 결과가 논문으로 공개
NVIDIA Nemotron-3 기반 Ultra-CC가 IOI 2026에서 600점 만점에 535.4점을 받아 최고 인간 점수 498.27점을 넘겼습니다. 학습과 추론 파이프라인 전체가 함께 공개됐습니다.
Google, Gemini 3.8 Flash 공개하며 보안 변형은 심사제로 배포
Google이 9월 2일 Gemini 3.8 Flash를 출시했습니다. 토큰 단가는 그대로지만 과제당 비용은 올랐고, 보안 특화 변형은 심사를 거친 곳에만 열립니다.
Meta, Muse Spark 1.3 공개하며 데이터 제공 여부로 단가를 둘로 나눴습니다
Meta가 9월 2일 Muse Spark 1.3을 내놓았습니다. 코딩 지표 상승과 함께, 입력을 학습에 쓰도록 허용하면 단가가 10분의 1 아래로 떨어지는 이중 요금제가 눈에 띕니다.
같은 연산 예산에서 중간 층을 두 번 도는 MoE 스케일링 법칙 SMELT
루프 트랜스포머를 MoE에 적용한 SMELT 논문이 연산과 파라미터와 KV 캐시를 모두 맞춘 비교에서 학습 FLOPs를 6.8~18.0% 절약했다고 보고했습니다.
Anthropic, Claude 응답에 보이지 않는 워터마크를 넣기 시작
Anthropic이 Claude Fable 5.1과 Mythos 5.1부터 텍스트 출력에 SynthID-Text 워터마크를 적용했습니다. EU AI Act 제50조 대응이자 상용 모델의 첫 기본 적용 사례입니다.
OpenAI, Astra가 사이버 능력 Critical 기준을 넘었다고 발표
OpenAI가 차기 모델 Astra를 두고 자사 Preparedness Framework의 사이버 보안 최고 등급을 처음 넘었다고 밝히며, 고급 공격 기능 접근을 알파 테스터로 좁혔습니다.
Anthropic, Claude Fable 5.1 공개하며 캐시 읽기 단가를 4분의 1로 인하
Anthropic이 Fable 5.1과 Mythos 5.1을 공개하며 기본 단가는 두고 캐시 읽기만 4분의 1로 내렸습니다. 벤치마크와 세이프가드 조정 내용, 그리고 그 한계를 정리했습니다.
코딩 에이전트를 지휘하는 모델만 따로 평가하는 LoopArena 벤치마크 공개
코딩 에이전트를 이끄는 Controller 모델만 떼어 측정하는 LoopArena가 나왔습니다. 무지휘 기준선보다 성적이 낮은 모델도 있었습니다.
소비자용 GPU로 2B 모델을 처음부터 학습한 Puro-2B 레시피 공개
RTX 5090만으로 1.4조 토큰을 학습해 Qwen2.5-1.5B 수준에 근접한 2B 모델을 만든 Puro-2B 보고서와, 데이터와 코드까지 함께 공개한 의미를 정리했습니다.
학습 없는 슬라이딩 윈도우 어텐션이 선형 어텐션 변환을 앞섰다는 실험
추가 학습 없이 어텐션 창만 좁힌 기준선이 여러 선형 어텐션 변환 기법과 대등하거나 더 나은 성능을 냈다는 arXiv 논문의 내용과 한계를 정리했습니다.