Z.AI, 희소·선형 혼합 어텐션을 쓴 오픈웨이트 모델 GLM-5.3-Flash 공개

8월 26일 공개된 320B-A18B MoE 모델. 성능 도약보다 어텐션 연산과 KV 캐시를 줄여 장문맥 서빙 비용을 낮춘 구조 변경이 발표의 중심입니다.

왜 지금 이 주제인가

Z.AI가 2026년 8월 26일 GLM-5.3-Flash의 가중치를 Hugging Face에 공개했습니다. 모델 카드에는 MIT 라이선스가 붙어 있습니다. 공개 가중치 모델 발표 자체는 이제 드문 일이 아니지만, 이번 모델은 발표의 무게중심이 벤치마크 순위가 아니라 구조 쪽에 있습니다. GLM 계열에서 처음으로 희소 어텐션(sparse attention)과 선형 어텐션(linear attention)을 한 구조 안에 섞었고, 그 결과를 장문맥 서빙 비용이라는 숫자로 제시했습니다. 긴 문맥을 다루는 서비스를 운영하는 쪽이라면 확인해 둘 만한 발표입니다.

핵심 내용

구조

GLM-5.3-Flash는 전체 3,200억(320B) 파라미터 가운데 토큰당 180억(18B)만 활성화하는 MoE(Mixture-of-Experts) 모델입니다. Z.AI는 이 모델이 기존 모델을 이어 학습한 것이 아니라 새로 학습한 베이스 모델에서 출발했으며, 아키텍처와 학습 방식을 능력과 효율 양쪽에 맞춰 다시 설계했다고 설명합니다. 사전학습에는 30조(30T) 토큰 규모의 멀티모달 코퍼스를 썼습니다.

핵심은 어텐션입니다. GLM 시리즈에서 처음으로 희소 어텐션과 선형 어텐션을 결합한 혼합 구조를 도입했고, Z.AI는 이를 두고 정확한 장문맥 능력을 유지하면서 장문맥 서빙 비용을 크게 낮췄다고 밝혔습니다. 공식 문서 기준으로 GLM-5.3 대비 어텐션 연산은 3.01배, KV 캐시는 4.44배 줄었습니다. 여기에 스케일링 효율을 위한 mHC(Manifold-Constrained Hyper-Connections)를 함께 적용했습니다.

입출력과 제어

최대 컨텍스트는 100만(1M) 토큰, 최대 출력은 12만 8천(128K) 토큰입니다. 입력으로 영상, 이미지, 텍스트, 파일을 받고 출력은 텍스트입니다. GLM-5 계열에서 처음으로 네이티브 멀티모달로 학습된 모델이며, 문서는 화면을 보고 GUI를 조작하는 작업과 오피스 문서·금융 리서치 워크플로를 용도로 들고 있습니다. 생각의 양은 reasoning_effort 파라미터로 low, high, max 세 단계 중에서 고르고, 값을 넘기지 않으면 max가 기본으로 적용됩니다.

점수와 가격

모델 카드에 실린 점수는 Terminal-Bench 2.1 84.3, Deep-SWE 63.4, 도구 사용을 허용한 HLE(Humanity’s Last Exam) 전체 세트 55.3입니다. Z.AI 문서는 DeepSWE v1.1에서 GLM-5.2의 46.2 대비 63.4로 올랐다고 적었습니다. Artificial Analysis Intelligence Index v4.1.1에서는 57점을 받았고 과제당 비용은 할인가 기준 0.045달러라고 밝혔습니다.

API 정가는 100만 토큰당 입력 0.15달러, 캐시 입력 0.03달러, 출력 0.50달러입니다. 같은 요금표에서 GLM-5.3과 GLM-5.2는 각각 입력 1.4달러, 캐시 입력 0.26달러, 출력 4.4달러입니다. 지금은 50퍼센트 할인이 적용되어 입력 0.075달러, 캐시 입력 0.015달러, 출력 0.25달러이며, 할인은 2026년 9월 9일 24시(UTC+8)에 끝납니다.

의미와 한계

읽을 만한 부분은 가격표 자체가 아니라 가격표가 나온 경로입니다. 정가만 놓고 비교해도 같은 회사의 GLM-5.3보다 입력은 약 9분의 1, 출력은 약 9분의 1 수준입니다. 활성 파라미터를 18B로 줄인 MoE 구성과 어텐션 연산·KV 캐시 절감이 그 차이를 만든 재료로 제시됐습니다. 장문맥 처리 비용이 실제 서비스의 병목이라면 이 조합은 검증해 볼 이유가 있고, 가중치가 공개돼 있으니 3.01배와 4.44배라는 수치를 직접 재 볼 수도 있습니다.

다만 지금 나와 있는 숫자는 대부분 Z.AI가 스스로 측정해 실은 것입니다. 모델 카드의 벤치마크 비교표는 이미지로 들어가 있어 경쟁 모델 점수를 텍스트로 대조하기 어렵고, 3.01배와 4.44배가 어떤 시퀀스 길이와 배치 조건에서 나온 값인지는 문서에 적혀 있지 않습니다. 가격도 기간이 정해진 프로모션이라 9월 10일 이후의 실질 비용은 정가로 보는 편이 맞습니다. 3,200억 파라미터 가중치를 자체 호스팅하려면 상당한 메모리가 필요하므로, 낮은 API 가격이 곧 낮은 자체 운영 비용을 뜻하지도 않습니다. 혼합 어텐션이 긴 문맥에서 정확도를 어디까지 지키는지는 외부 평가가 쌓여야 판단할 수 있습니다. 추측을 덧붙이자면, 초기 채택은 자체 호스팅보다 API 쪽에 먼저 몰릴 가능성이 큽니다.

한 줄 정리

GLM-5.3-Flash는 성능 도약보다 장문맥 비용 구조를 다시 짠 쪽에 무게가 실린 공개 가중치 모델입니다.

출처

  1. GLM-5.3-Flash - Overview - Z.AI Developer Document
  2. zai-org/GLM-5.3-Flash - Hugging Face
  3. Pricing - Z.AI Developer Document
  4. New Released - Z.AI Developer Document
  5. zai-org/GLM-5 - GitHub