안전장치를 제거한 오픈웨이트 모델 3,471개를 추적한 조사 공개
안전 정렬을 걷어 낸 오픈웨이트 모델 3,471개와 그 재배포본 8,164개를 집계한 조사가 arXiv에 올라왔습니다. 재배포본의 52%가 세 계정에서 나왔습니다.
왜 지금 이 주제인가
오픈웨이트 모델은 누구나 내려받아 고칠 수 있다는 점이 장점이자 위험 요소입니다. 안전 정렬(safety alignment)을 걷어 낸 이른바 uncensored 모델이 공개 허브에 얼마나 쌓여 있는지는 그동안 인상 비평 수준으로만 오갔습니다. 보안 회사 10a Labs 연구진이 9월 4일 arXiv에 올린 조사는 이 생태계를 규모로 셌습니다. 2024년 1월부터 2026년 3월까지 Hugging Face와 GitHub를 훑어 원본 모델, 재배포본, 이를 끌어 쓰는 애플리케이션을 분류한 측정 연구입니다.
숫자로 본 uncensored 모델 생태계
수집과 분류
연구진은 Hugging Face를 43개의 고신호 검색어와 12개의 문맥 의존 검색어로 훑었습니다. 중국어와 일본어 표현도 포함했고, 활동이 많은 제작자 15곳은 저장소 전체를 따로 크롤링했습니다. 이렇게 모은 후보 저장소 17,727개를 GPT-5로 분류해 안전장치 제거와 관련된 저장소 12,360개를 남겼습니다.
최종 집계는 원본 uncensored 모델 3,471개, 양자화 재배포본 8,164개, 모델 병합본 547개, 악성 데이터셋 178개, 그리고 이 모델들을 통합한 GitHub 애플리케이션 1,643개입니다.
재배포가 만드는 지속성
논문의 핵심 주장은 제목 그대로입니다. 원본 하나가 평균 2.4회 다시 포장됩니다. 재배포본 8,164개 가운데 52%가 단 세 계정에서 나왔습니다. mradermacher가 2,905개로 36%, Triangle104가 936개로 11%, RichardErkhov가 364개로 4%입니다. 한 제작자의 원본 192개는 하위 재포장을 거치며 전체 데이터셋의 약 14%로 불어났습니다.
재포장은 GGUF, AWQ, GPTQ, EXL2, MLX 같은 소비자 하드웨어용 형식으로 이뤄집니다. 계정과 형식, 그리고 Ollama 같은 별도 레지스트리로 흩어지고 나면 원본이 내려가더라도 사본은 남는다는 것이 저자들의 관찰입니다. Hugging Face의 콘텐츠 정책은 문제가 되는 콘텐츠에 대해 노출 순위 조정, NFAA 태그 부착, 접근 차단이나 삭제, 계정 정지까지 규정하고 있지만 조치는 개별 저장소를 향합니다. 논문이 지적하는 것은 이 조치 단위와 실제 확산 단위가 어긋난다는 점입니다.
어떤 모델이, 어디에 쓰이는가
기반 모델 분포도 집계됐습니다. 서구권 출신 항목 중에서는 Llama가 52%, Gemma가 17%, Mistral과 Mixtral이 15%였습니다. 중국계 항목에서는 Qwen이 80%를 차지했습니다. 중국계 모델의 비중은 2024년 1분기 1%에서 2025년 2분기 55%로 올라, 전체 저장소의 38%에 이르렀습니다.
애플리케이션 1,643개를 보면 범용 챗봇이 37%, 사이버보안 도구가 16%, 문서 처리가 16%였고 NSFW 롤플레이가 76개 저장소였습니다. 25%는 명시적으로 악성으로 분류됐고 나머지 75%는 모호한 것으로 남았습니다. 배포 경로를 보면 43%가 README에서 Ollama를 언급했고 14%가 Hugging Face 직접 다운로드를 언급했습니다. Dolphin 계열 하나가 전체 애플리케이션의 30%인 499개 저장소를 떠받쳤습니다.
의미와 한계
이 조사가 바꾸는 것은 문제를 보는 단위입니다. 그동안 오픈웨이트 안전 논의는 “이 가중치를 공개해도 되는가”라는 배포 시점의 판단에 집중했습니다. 측정 결과는 판단이 끝난 뒤에 벌어지는 일, 즉 양자화와 미러링이 실질적인 확산 경로라는 쪽을 가리킵니다. 원본 제작자보다 재배포자가 훨씬 적고 세 계정에 집중돼 있다는 사실은, 개입 지점이 생각보다 좁을 수 있다는 뜻으로도 읽힙니다. 다만 이는 데이터에서 이어지는 추측이고, 재배포자를 제한하는 조치가 실제로 확산을 줄이는지는 이 연구가 검증한 범위 밖입니다.
한계도 분명합니다. 저자들이 직접 여섯 가지를 적어 두었습니다. 조사 범위가 Hugging Face와 공개 GitHub에 한정돼 다른 배포 경로는 빠져 있고, 분류는 사람이 만든 정답 대조 없이 LLM 한 번의 통과로 끝났습니다. 원본의 21%는 메타데이터에 어떤 기법으로 안전장치를 제거했는지 신호가 없었고, 6.3%는 기반 모델 출처를 확정하지 못했습니다. GitHub 검색 API는 질의당 1,000건에서 잘리며, 2026년 1분기 집계는 2.3개월치뿐입니다. 악성이라는 분류 자체도 75%가 모호로 남은 만큼, 25%라는 수치를 그대로 위협의 크기로 읽기는 어렵습니다.
한 줄 정리
안전장치를 제거한 오픈웨이트 모델은 원본을 지워도 양자화 사본으로 남으며, 그 사본의 절반은 세 계정에서 나왔습니다.