MoE
이 태그가 붙은 글 6편입니다. 전체 태그 보기
IFM, 0.9B부터 375B까지 여섯 모델을 학습 데이터와 함께 공개
MBZUAI 산하 IFM이 K2 Horizon 여섯 모델을 Apache 2.0으로 공개하면서 학습 데이터와 로그까지 내걸었지만, 큰 모델은 아직 가중치만 올라와 있습니다.
IOI 2026에서 AI 시스템이 인간 1위 점수를 넘긴 결과가 논문으로 공개
NVIDIA Nemotron-3 기반 Ultra-CC가 IOI 2026에서 600점 만점에 535.4점을 받아 최고 인간 점수 498.27점을 넘겼습니다. 학습과 추론 파이프라인 전체가 함께 공개됐습니다.
같은 연산 예산에서 중간 층을 두 번 도는 MoE 스케일링 법칙 SMELT
루프 트랜스포머를 MoE에 적용한 SMELT 논문이 연산과 파라미터와 KV 캐시를 모두 맞춘 비교에서 학습 FLOPs를 6.8~18.0% 절약했다고 보고했습니다.
Tencent, 770B 오픈웨이트 모델 Hy4 preview 공개
Tencent이 8월 28일 총 파라미터 770B, 활성 49B의 MoE 모델 Hy4 preview를 Apache 2.0으로 공개했습니다. 구조와 공개 수치, 모델이 참여했다는 자기 최적화 주장을 정리했습니다.
Qwen, Qwen4 구조를 미리 적용한 오픈웨이트 모델 Qwen3.8-Flash-Next 공개
Alibaba Qwen 팀이 차기 Qwen4 아키텍처를 앞당겨 적용한 125B 규모 MoE 모델의 가중치를 공개했습니다. 어텐션과 잔차, 임베딩, 최적화 네 갈래를 함께 손봤습니다.
Z.AI, 희소·선형 혼합 어텐션을 쓴 오픈웨이트 모델 GLM-5.3-Flash 공개
8월 26일 공개된 320B-A18B MoE 모델. 성능 도약보다 어텐션 연산과 KV 캐시를 줄여 장문맥 서빙 비용을 낮춘 구조 변경이 발표의 중심입니다.