벤치마크
이 태그가 붙은 글 22편입니다. 전체 태그 보기
도구를 쓰는 에이전트의 정보 충돌 대응을 재는 KC-Bench 공개
사용자 말과 모델 지식, 환경 관측이 어긋날 때 에이전트가 멈춰 서는지를 238개 다중 턴 과제로 측정한 벤치마크가 arXiv에 올라왔습니다.
질의 한 개로 온폴리시 증류 성능 대부분을 회복한 실험
온폴리시 증류를 학습 질의 한 개로 돌려도 전체 데이터가 만든 향상분의 87%가 재현됐다는 arXiv 논문의 실험 구성과 수치, 한계를 정리했습니다.
자연어 명세를 로컬에서 도는 작은 신경망 함수로 컴파일하는 논문
명세를 교사 모델로 예제화한 뒤 LoRA 어댑터로 굳혀, 0.6B 인터프리터가 대형 모델 호출 없이 실행하는 Compile by Training 논문을 정리했습니다.
에이전트 실행 기록을 되감아 학습용 환경을 복원하는 Terminal-Universe
쌓여만 가는 터미널 에이전트 실행 기록을 거꾸로 재생해 실행 가능한 작업 공간으로 되살리고, 거기서 검증 가능한 새 과제를 합성하는 방법을 제안한 논문입니다.
IFM, 0.9B부터 375B까지 여섯 모델을 학습 데이터와 함께 공개
MBZUAI 산하 IFM이 K2 Horizon 여섯 모델을 Apache 2.0으로 공개하면서 학습 데이터와 로그까지 내걸었지만, 큰 모델은 아직 가중치만 올라와 있습니다.
LLM 추론 흔적의 깨달음 순간이 대부분 예산 효과라는 논문
추론 흔적에서 읽어 내던 breakthrough 순간과 조기 예측 신호를 대조군을 붙여 다시 측정하니 거의 남지 않았다는 arXiv 논문입니다.
Perplexity, 기기 안에서 개인정보를 걸러 내는 0.6B 모델을 공개
Perplexity가 Mac용 Hybrid Compute를 열면서 개인정보 경계를 지키는 0.6B 분류 모델과 13개 언어 합성 대화 벤치마크를 함께 공개했습니다.
IOI 2026에서 AI 시스템이 인간 1위 점수를 넘긴 결과가 논문으로 공개
NVIDIA Nemotron-3 기반 Ultra-CC가 IOI 2026에서 600점 만점에 535.4점을 받아 최고 인간 점수 498.27점을 넘겼습니다. 학습과 추론 파이프라인 전체가 함께 공개됐습니다.
Google, Gemini 3.8 Flash 공개하며 보안 변형은 심사제로 배포
Google이 9월 2일 Gemini 3.8 Flash를 출시했습니다. 토큰 단가는 그대로지만 과제당 비용은 올랐고, 보안 특화 변형은 심사를 거친 곳에만 열립니다.
Meta, Muse Spark 1.3 공개하며 데이터 제공 여부로 단가를 둘로 나눴습니다
Meta가 9월 2일 Muse Spark 1.3을 내놓았습니다. 코딩 지표 상승과 함께, 입력을 학습에 쓰도록 허용하면 단가가 10분의 1 아래로 떨어지는 이중 요금제가 눈에 띕니다.
같은 연산 예산에서 중간 층을 두 번 도는 MoE 스케일링 법칙 SMELT
루프 트랜스포머를 MoE에 적용한 SMELT 논문이 연산과 파라미터와 KV 캐시를 모두 맞춘 비교에서 학습 FLOPs를 6.8~18.0% 절약했다고 보고했습니다.
Anthropic, Claude Fable 5.1 공개하며 캐시 읽기 단가를 4분의 1로 인하
Anthropic이 Fable 5.1과 Mythos 5.1을 공개하며 기본 단가는 두고 캐시 읽기만 4분의 1로 내렸습니다. 벤치마크와 세이프가드 조정 내용, 그리고 그 한계를 정리했습니다.
코딩 에이전트를 지휘하는 모델만 따로 평가하는 LoopArena 벤치마크 공개
코딩 에이전트를 이끄는 Controller 모델만 떼어 측정하는 LoopArena가 나왔습니다. 무지휘 기준선보다 성적이 낮은 모델도 있었습니다.
소비자용 GPU로 2B 모델을 처음부터 학습한 Puro-2B 레시피 공개
RTX 5090만으로 1.4조 토큰을 학습해 Qwen2.5-1.5B 수준에 근접한 2B 모델을 만든 Puro-2B 보고서와, 데이터와 코드까지 함께 공개한 의미를 정리했습니다.
학습 없는 슬라이딩 윈도우 어텐션이 선형 어텐션 변환을 앞섰다는 실험
추가 학습 없이 어텐션 창만 좁힌 기준선이 여러 선형 어텐션 변환 기법과 대등하거나 더 나은 성능을 냈다는 arXiv 논문의 내용과 한계를 정리했습니다.
교사 모델 없이 이미지 생성 모델을 정렬하는 Self-OPD 논문 공개
교사 모델 없이 학생의 자체 탐색을 단계별 지도 신호로 바꾸는 flow matching 정렬 기법 Self-OPD가 arXiv에 공개됐습니다. 교사 기반 방법보다 총 학습 시간이 짧았습니다.
Tencent, 770B 오픈웨이트 모델 Hy4 preview 공개
Tencent이 8월 28일 총 파라미터 770B, 활성 49B의 MoE 모델 Hy4 preview를 Apache 2.0으로 공개했습니다. 구조와 공개 수치, 모델이 참여했다는 자기 최적화 주장을 정리했습니다.
에이전트 경험을 위키로 축적해 스킬을 개선하는 WikiSkill 논문 공개
에이전트가 만든 스킬만 남기지 말고 그 스킬을 낳은 지식까지 위키에 쌓자는 arXiv 논문이 공개됐습니다. 다섯 벤치마크에서 기존 스킬 진화 기법을 앞섰습니다.
진화 전략이 GRPO보다 넓은 추론 범위를 남긴다는 arXiv 논문 공개
역전파 없이 파라미터 공간을 탐색하는 진화 전략이 GRPO보다 Pass@K를 덜 깎는다는 실측 비교 논문이 arXiv에 올라왔습니다. 두 방식의 차이를 정리했습니다.
같은 모델도 인터페이스 언어에 따라 실력이 달라진다는 자기대국 실험
같은 모델의 인스턴스를 언어만 바꿔 맞붙인 다국어 자기대국 실험에서 언어별 실력 격차가 확인됐고, 중간 추론 언어를 바꾸자 상당 부분 회복됐습니다.
OpenAI, 자체 추론 칩 Jalapeño의 첫 벤치마크 측정치를 공개
OpenAI가 Broadcom과 만든 추론 전용 칩 Jalapeño의 InferenceX 측정 결과를 내놨습니다. 전력당 처리량과 지연 수치, 그리고 그 수치가 아직 말해 주지 못하는 것들을 정리했습니다.
정답 라벨 없이 추론 시점에 모델을 학습시키는 TTPO 논문 공개
정답 없이 테스트 시점에 모델을 학습시키는 TTPO가 arXiv에 공개됐습니다. 다수결 임시 정답에 동의한 응답은 증류로, 반대한 응답은 강화학습 벌점으로 나눠 다룹니다.