오픈웨이트
이 태그가 붙은 글 10편입니다. 전체 태그 보기
안전장치를 제거한 오픈웨이트 모델 3,471개를 추적한 조사 공개
안전 정렬을 걷어 낸 오픈웨이트 모델 3,471개와 그 재배포본 8,164개를 집계한 조사가 arXiv에 올라왔습니다. 재배포본의 52%가 세 계정에서 나왔습니다.
IFM, 0.9B부터 375B까지 여섯 모델을 학습 데이터와 함께 공개
MBZUAI 산하 IFM이 K2 Horizon 여섯 모델을 Apache 2.0으로 공개하면서 학습 데이터와 로그까지 내걸었지만, 큰 모델은 아직 가중치만 올라와 있습니다.
LLM 추론 흔적의 깨달음 순간이 대부분 예산 효과라는 논문
추론 흔적에서 읽어 내던 breakthrough 순간과 조기 예측 신호를 대조군을 붙여 다시 측정하니 거의 남지 않았다는 arXiv 논문입니다.
Perplexity, 기기 안에서 개인정보를 걸러 내는 0.6B 모델을 공개
Perplexity가 Mac용 Hybrid Compute를 열면서 개인정보 경계를 지키는 0.6B 분류 모델과 13개 언어 합성 대화 벤치마크를 함께 공개했습니다.
IOI 2026에서 AI 시스템이 인간 1위 점수를 넘긴 결과가 논문으로 공개
NVIDIA Nemotron-3 기반 Ultra-CC가 IOI 2026에서 600점 만점에 535.4점을 받아 최고 인간 점수 498.27점을 넘겼습니다. 학습과 추론 파이프라인 전체가 함께 공개됐습니다.
소비자용 GPU로 2B 모델을 처음부터 학습한 Puro-2B 레시피 공개
RTX 5090만으로 1.4조 토큰을 학습해 Qwen2.5-1.5B 수준에 근접한 2B 모델을 만든 Puro-2B 보고서와, 데이터와 코드까지 함께 공개한 의미를 정리했습니다.
Tencent, 770B 오픈웨이트 모델 Hy4 preview 공개
Tencent이 8월 28일 총 파라미터 770B, 활성 49B의 MoE 모델 Hy4 preview를 Apache 2.0으로 공개했습니다. 구조와 공개 수치, 모델이 참여했다는 자기 최적화 주장을 정리했습니다.
같은 모델도 인터페이스 언어에 따라 실력이 달라진다는 자기대국 실험
같은 모델의 인스턴스를 언어만 바꿔 맞붙인 다국어 자기대국 실험에서 언어별 실력 격차가 확인됐고, 중간 추론 언어를 바꾸자 상당 부분 회복됐습니다.
Qwen, Qwen4 구조를 미리 적용한 오픈웨이트 모델 Qwen3.8-Flash-Next 공개
Alibaba Qwen 팀이 차기 Qwen4 아키텍처를 앞당겨 적용한 125B 규모 MoE 모델의 가중치를 공개했습니다. 어텐션과 잔차, 임베딩, 최적화 네 갈래를 함께 손봤습니다.
Z.AI, 희소·선형 혼합 어텐션을 쓴 오픈웨이트 모델 GLM-5.3-Flash 공개
8월 26일 공개된 320B-A18B MoE 모델. 성능 도약보다 어텐션 연산과 KV 캐시를 줄여 장문맥 서빙 비용을 낮춘 구조 변경이 발표의 중심입니다.