교사 모델 없이 이미지 생성 모델을 정렬하는 Self-OPD 논문 공개
교사 모델 없이 학생의 자체 탐색을 단계별 지도 신호로 바꾸는 flow matching 정렬 기법 Self-OPD가 arXiv에 공개됐습니다. 교사 기반 방법보다 총 학습 시간이 짧았습니다.
Tencent, 770B 오픈웨이트 모델 Hy4 preview 공개
Tencent이 8월 28일 총 파라미터 770B, 활성 49B의 MoE 모델 Hy4 preview를 Apache 2.0으로 공개했습니다. 구조와 공개 수치, 모델이 참여했다는 자기 최적화 주장을 정리했습니다.
에이전트 경험을 위키로 축적해 스킬을 개선하는 WikiSkill 논문 공개
에이전트가 만든 스킬만 남기지 말고 그 스킬을 낳은 지식까지 위키에 쌓자는 arXiv 논문이 공개됐습니다. 다섯 벤치마크에서 기존 스킬 진화 기법을 앞섰습니다.
Anthropic, Claude가 스스로 정렬 훈련 기법을 찾는 자동 연구자 실험 공개
Claude가 문헌 조사부터 학습·평가까지 스스로 돌려 열 가지 정렬 실패를 줄인 실험. 사람 연구자 28명과의 비교 결과와 감시 장치 설계를 정리했습니다.
진화 전략이 GRPO보다 넓은 추론 범위를 남긴다는 arXiv 논문 공개
역전파 없이 파라미터 공간을 탐색하는 진화 전략이 GRPO보다 Pass@K를 덜 깎는다는 실측 비교 논문이 arXiv에 올라왔습니다. 두 방식의 차이를 정리했습니다.
같은 모델도 인터페이스 언어에 따라 실력이 달라진다는 자기대국 실험
같은 모델의 인스턴스를 언어만 바꿔 맞붙인 다국어 자기대국 실험에서 언어별 실력 격차가 확인됐고, 중간 추론 언어를 바꾸자 상당 부분 회복됐습니다.
OpenAI 등 100여 개 기업, AI 사이버 공격 대비 공동 서한에 서명
경쟁 관계인 프런티어 AI 기업과 보안·금융 기업 100여 곳이 8월 27일 공동 서한을 내고 AI를 활용한 사이버 공격 확산에 대비한 방어 강화를 요구했습니다.
Anthropic, 외부 연구기관 세 곳에 Claude 대화 25만 건 분석을 개방
Anthropic이 Stanford, Oxford, METR에 Claude 대화 25만 건의 집계 분석을 열었습니다. 무엇이 공개됐고 무엇이 여전히 닫혀 있는지 정리했습니다.
Anthropic, AI 에이전트가 실험 장비를 조작하는 규격 MHS를 프리뷰 공개
Anthropic이 AI 에이전트가 현미경과 로봇 팔 등 물리 장비를 조작하도록 하는 공통 규격 Model Hardware Standard의 리서치 프리뷰를 열었습니다.
Google DeepMind, 모델도 문항도 가린 이중맹검 평가를 시범 실시
Google DeepMind가 기밀 컴퓨팅 환경에서 평가자는 모델 가중치를, 개발사는 시험 문항을 볼 수 없는 이중맹검 안전성 평가를 시범 운영했습니다.
Google, 음성 인식 모델 Gemini 3.5 Transcribe를 프리뷰 공개
Chirp 계열을 잇지 않고 Gemini 이름을 단 음성 인식 모델이 나왔습니다. 공개된 오류율과 가격, 그리고 후처리를 모델이 떠안는 구조가 무엇을 바꾸는지 정리했습니다.
OpenAI, 자체 추론 칩 Jalapeño의 첫 벤치마크 측정치를 공개
OpenAI가 Broadcom과 만든 추론 전용 칩 Jalapeño의 InferenceX 측정 결과를 내놨습니다. 전력당 처리량과 지연 수치, 그리고 그 수치가 아직 말해 주지 못하는 것들을 정리했습니다.