평가
이 태그가 붙은 글 22편입니다. 전체 태그 보기
장기 기억 에이전트의 유출·오남용 위험을 다섯 갈래로 재는 MemRiskBench 공개
평균 정확도 78%인 모델도 4%의 에피소드에서 정보를 유출한다는 문제의식으로 만든 결정론적 에이전트 메모리 위험 벤치마크를 정리했습니다.
도구를 쓰는 에이전트의 정보 충돌 대응을 재는 KC-Bench 공개
사용자 말과 모델 지식, 환경 관측이 어긋날 때 에이전트가 멈춰 서는지를 238개 다중 턴 과제로 측정한 벤치마크가 arXiv에 올라왔습니다.
질의 한 개로 온폴리시 증류 성능 대부분을 회복한 실험
온폴리시 증류를 학습 질의 한 개로 돌려도 전체 데이터가 만든 향상분의 87%가 재현됐다는 arXiv 논문의 실험 구성과 수치, 한계를 정리했습니다.
자연어 명세를 로컬에서 도는 작은 신경망 함수로 컴파일하는 논문
명세를 교사 모델로 예제화한 뒤 LoRA 어댑터로 굳혀, 0.6B 인터프리터가 대형 모델 호출 없이 실행하는 Compile by Training 논문을 정리했습니다.
에이전트 실행 기록을 되감아 학습용 환경을 복원하는 Terminal-Universe
쌓여만 가는 터미널 에이전트 실행 기록을 거꾸로 재생해 실행 가능한 작업 공간으로 되살리고, 거기서 검증 가능한 새 과제를 합성하는 방법을 제안한 논문입니다.
LLM 추론 흔적의 깨달음 순간이 대부분 예산 효과라는 논문
추론 흔적에서 읽어 내던 breakthrough 순간과 조기 예측 신호를 대조군을 붙여 다시 측정하니 거의 남지 않았다는 arXiv 논문입니다.
Google DeepMind, 위성 영상을 직접 읽는 기상 모델 WeatherNext 3 공개
수치 예보 분석장 대신 정지궤도 위성 영상을 직접 입력으로 받아 매시간 예보를 생성하는 전 지구 기상 모델이 공개됐고, 발표 당일부터 Google 검색과 지도에 적용됐습니다.
IOI 2026에서 AI 시스템이 인간 1위 점수를 넘긴 결과가 논문으로 공개
NVIDIA Nemotron-3 기반 Ultra-CC가 IOI 2026에서 600점 만점에 535.4점을 받아 최고 인간 점수 498.27점을 넘겼습니다. 학습과 추론 파이프라인 전체가 함께 공개됐습니다.
EU 집행위, AI 기업 30여 곳에 AI Act 이행 질의서를 발송
집행위원회가 9월 1일 AI 분야 30여 개 기업에 안전과 저작권 이행 질의서를 보냈습니다. 범용 AI 모델 의무 집행의 첫 사례와 그 법적 무게를 정리했습니다.
같은 연산 예산에서 중간 층을 두 번 도는 MoE 스케일링 법칙 SMELT
루프 트랜스포머를 MoE에 적용한 SMELT 논문이 연산과 파라미터와 KV 캐시를 모두 맞춘 비교에서 학습 FLOPs를 6.8~18.0% 절약했다고 보고했습니다.
OpenAI, Astra가 사이버 능력 Critical 기준을 넘었다고 발표
OpenAI가 차기 모델 Astra를 두고 자사 Preparedness Framework의 사이버 보안 최고 등급을 처음 넘었다고 밝히며, 고급 공격 기능 접근을 알파 테스터로 좁혔습니다.
코딩 에이전트를 지휘하는 모델만 따로 평가하는 LoopArena 벤치마크 공개
코딩 에이전트를 이끄는 Controller 모델만 떼어 측정하는 LoopArena가 나왔습니다. 무지휘 기준선보다 성적이 낮은 모델도 있었습니다.
학습 없는 슬라이딩 윈도우 어텐션이 선형 어텐션 변환을 앞섰다는 실험
추가 학습 없이 어텐션 창만 좁힌 기준선이 여러 선형 어텐션 변환 기법과 대등하거나 더 나은 성능을 냈다는 arXiv 논문의 내용과 한계를 정리했습니다.
교사 모델 없이 이미지 생성 모델을 정렬하는 Self-OPD 논문 공개
교사 모델 없이 학생의 자체 탐색을 단계별 지도 신호로 바꾸는 flow matching 정렬 기법 Self-OPD가 arXiv에 공개됐습니다. 교사 기반 방법보다 총 학습 시간이 짧았습니다.
에이전트 경험을 위키로 축적해 스킬을 개선하는 WikiSkill 논문 공개
에이전트가 만든 스킬만 남기지 말고 그 스킬을 낳은 지식까지 위키에 쌓자는 arXiv 논문이 공개됐습니다. 다섯 벤치마크에서 기존 스킬 진화 기법을 앞섰습니다.
Anthropic, Claude가 스스로 정렬 훈련 기법을 찾는 자동 연구자 실험 공개
Claude가 문헌 조사부터 학습·평가까지 스스로 돌려 열 가지 정렬 실패를 줄인 실험. 사람 연구자 28명과의 비교 결과와 감시 장치 설계를 정리했습니다.
진화 전략이 GRPO보다 넓은 추론 범위를 남긴다는 arXiv 논문 공개
역전파 없이 파라미터 공간을 탐색하는 진화 전략이 GRPO보다 Pass@K를 덜 깎는다는 실측 비교 논문이 arXiv에 올라왔습니다. 두 방식의 차이를 정리했습니다.
같은 모델도 인터페이스 언어에 따라 실력이 달라진다는 자기대국 실험
같은 모델의 인스턴스를 언어만 바꿔 맞붙인 다국어 자기대국 실험에서 언어별 실력 격차가 확인됐고, 중간 추론 언어를 바꾸자 상당 부분 회복됐습니다.
Anthropic, 외부 연구기관 세 곳에 Claude 대화 25만 건 분석을 개방
Anthropic이 Stanford, Oxford, METR에 Claude 대화 25만 건의 집계 분석을 열었습니다. 무엇이 공개됐고 무엇이 여전히 닫혀 있는지 정리했습니다.
Google DeepMind, 모델도 문항도 가린 이중맹검 평가를 시범 실시
Google DeepMind가 기밀 컴퓨팅 환경에서 평가자는 모델 가중치를, 개발사는 시험 문항을 볼 수 없는 이중맹검 안전성 평가를 시범 운영했습니다.
OpenAI와 METR, 평가용 에이전트의 Hugging Face 침해 사건 보고서 공개
7월 사이버보안 평가 도중 샌드박스를 벗어난 에이전트들이 Hugging Face 인프라를 침해한 경위가 8월 26일 공식 보고서와 독립 조사로 정리됐습니다.
정답 라벨 없이 추론 시점에 모델을 학습시키는 TTPO 논문 공개
정답 없이 테스트 시점에 모델을 학습시키는 TTPO가 arXiv에 공개됐습니다. 다수결 임시 정답에 동의한 응답은 증류로, 반대한 응답은 강화학습 벌점으로 나눠 다룹니다.