Qwen
이 태그가 붙은 글 11편입니다. 전체 태그 보기
노트북 GPU에서 100만 토큰 에이전트 작업공간을 돌리는 KVMem 공개
컨텍스트 창을 넘어간 에이전트 실행 기록을 요약하지 않고 KV 상태로 GPU와 RAM, NVMe에 나눠 저장하는 KVMem 논문을 정리했습니다.
질의 한 개로 온폴리시 증류 성능 대부분을 회복한 실험
온폴리시 증류를 학습 질의 한 개로 돌려도 전체 데이터가 만든 향상분의 87%가 재현됐다는 arXiv 논문의 실험 구성과 수치, 한계를 정리했습니다.
자연어 명세를 로컬에서 도는 작은 신경망 함수로 컴파일하는 논문
명세를 교사 모델로 예제화한 뒤 LoRA 어댑터로 굳혀, 0.6B 인터프리터가 대형 모델 호출 없이 실행하는 Compile by Training 논문을 정리했습니다.
에이전트 실행 기록을 되감아 학습용 환경을 복원하는 Terminal-Universe
쌓여만 가는 터미널 에이전트 실행 기록을 거꾸로 재생해 실행 가능한 작업 공간으로 되살리고, 거기서 검증 가능한 새 과제를 합성하는 방법을 제안한 논문입니다.
Perplexity, 기기 안에서 개인정보를 걸러 내는 0.6B 모델을 공개
Perplexity가 Mac용 Hybrid Compute를 열면서 개인정보 경계를 지키는 0.6B 분류 모델과 13개 언어 합성 대화 벤치마크를 함께 공개했습니다.
소비자용 GPU로 2B 모델을 처음부터 학습한 Puro-2B 레시피 공개
RTX 5090만으로 1.4조 토큰을 학습해 Qwen2.5-1.5B 수준에 근접한 2B 모델을 만든 Puro-2B 보고서와, 데이터와 코드까지 함께 공개한 의미를 정리했습니다.
에이전트 경험을 위키로 축적해 스킬을 개선하는 WikiSkill 논문 공개
에이전트가 만든 스킬만 남기지 말고 그 스킬을 낳은 지식까지 위키에 쌓자는 arXiv 논문이 공개됐습니다. 다섯 벤치마크에서 기존 스킬 진화 기법을 앞섰습니다.
진화 전략이 GRPO보다 넓은 추론 범위를 남긴다는 arXiv 논문 공개
역전파 없이 파라미터 공간을 탐색하는 진화 전략이 GRPO보다 Pass@K를 덜 깎는다는 실측 비교 논문이 arXiv에 올라왔습니다. 두 방식의 차이를 정리했습니다.
같은 모델도 인터페이스 언어에 따라 실력이 달라진다는 자기대국 실험
같은 모델의 인스턴스를 언어만 바꿔 맞붙인 다국어 자기대국 실험에서 언어별 실력 격차가 확인됐고, 중간 추론 언어를 바꾸자 상당 부분 회복됐습니다.
Qwen, Qwen4 구조를 미리 적용한 오픈웨이트 모델 Qwen3.8-Flash-Next 공개
Alibaba Qwen 팀이 차기 Qwen4 아키텍처를 앞당겨 적용한 125B 규모 MoE 모델의 가중치를 공개했습니다. 어텐션과 잔차, 임베딩, 최적화 네 갈래를 함께 손봤습니다.
정답 라벨 없이 추론 시점에 모델을 학습시키는 TTPO 논문 공개
정답 없이 테스트 시점에 모델을 학습시키는 TTPO가 arXiv에 공개됐습니다. 다수결 임시 정답에 동의한 응답은 증류로, 반대한 응답은 강화학습 벌점으로 나눠 다룹니다.