강화학습
이 태그가 붙은 글 5편입니다. 전체 태그 보기
IOI 2026에서 AI 시스템이 인간 1위 점수를 넘긴 결과가 논문으로 공개
NVIDIA Nemotron-3 기반 Ultra-CC가 IOI 2026에서 600점 만점에 535.4점을 받아 최고 인간 점수 498.27점을 넘겼습니다. 학습과 추론 파이프라인 전체가 함께 공개됐습니다.
교사 모델 없이 이미지 생성 모델을 정렬하는 Self-OPD 논문 공개
교사 모델 없이 학생의 자체 탐색을 단계별 지도 신호로 바꾸는 flow matching 정렬 기법 Self-OPD가 arXiv에 공개됐습니다. 교사 기반 방법보다 총 학습 시간이 짧았습니다.
진화 전략이 GRPO보다 넓은 추론 범위를 남긴다는 arXiv 논문 공개
역전파 없이 파라미터 공간을 탐색하는 진화 전략이 GRPO보다 Pass@K를 덜 깎는다는 실측 비교 논문이 arXiv에 올라왔습니다. 두 방식의 차이를 정리했습니다.
Hugging Face, 399달러 오픈소스 이족보행 로봇 Microduck 공개
Hugging Face 산하 Pollen Robotics가 키 25cm 이족보행 로봇 Microduck을 399달러에 내놨습니다. 제어와 시뮬레이션, 강화학습 스택을 Apache 2.0으로 함께 열었습니다.
정답 라벨 없이 추론 시점에 모델을 학습시키는 TTPO 논문 공개
정답 없이 테스트 시점에 모델을 학습시키는 TTPO가 arXiv에 공개됐습니다. 다수결 임시 정답에 동의한 응답은 증류로, 반대한 응답은 강화학습 벌점으로 나눠 다룹니다.