추론비용
이 태그가 붙은 글 11편입니다. 전체 태그 보기
NVIDIA, 집 안 여러 기기에 추론 요청을 나눠 보내는 PAIR 공개
NVIDIA가 같은 네트워크의 여러 기기로 추론 요청을 분배하는 오픈소스 라우터 PAIR를 공개했습니다. 이 도구가 하는 일과 하지 않는 일을 정리했습니다.
자연어 명세를 로컬에서 도는 작은 신경망 함수로 컴파일하는 논문
명세를 교사 모델로 예제화한 뒤 LoRA 어댑터로 굳혀, 0.6B 인터프리터가 대형 모델 호출 없이 실행하는 Compile by Training 논문을 정리했습니다.
LLM 추론 흔적의 깨달음 순간이 대부분 예산 효과라는 논문
추론 흔적에서 읽어 내던 breakthrough 순간과 조기 예측 신호를 대조군을 붙여 다시 측정하니 거의 남지 않았다는 arXiv 논문입니다.
Google, Gemini 3.8 Flash 공개하며 보안 변형은 심사제로 배포
Google이 9월 2일 Gemini 3.8 Flash를 출시했습니다. 토큰 단가는 그대로지만 과제당 비용은 올랐고, 보안 특화 변형은 심사를 거친 곳에만 열립니다.
Meta, Muse Spark 1.3 공개하며 데이터 제공 여부로 단가를 둘로 나눴습니다
Meta가 9월 2일 Muse Spark 1.3을 내놓았습니다. 코딩 지표 상승과 함께, 입력을 학습에 쓰도록 허용하면 단가가 10분의 1 아래로 떨어지는 이중 요금제가 눈에 띕니다.
Anthropic, Claude Fable 5.1 공개하며 캐시 읽기 단가를 4분의 1로 인하
Anthropic이 Fable 5.1과 Mythos 5.1을 공개하며 기본 단가는 두고 캐시 읽기만 4분의 1로 내렸습니다. 벤치마크와 세이프가드 조정 내용, 그리고 그 한계를 정리했습니다.
학습 없는 슬라이딩 윈도우 어텐션이 선형 어텐션 변환을 앞섰다는 실험
추가 학습 없이 어텐션 창만 좁힌 기준선이 여러 선형 어텐션 변환 기법과 대등하거나 더 나은 성능을 냈다는 arXiv 논문의 내용과 한계를 정리했습니다.
Tencent, 770B 오픈웨이트 모델 Hy4 preview 공개
Tencent이 8월 28일 총 파라미터 770B, 활성 49B의 MoE 모델 Hy4 preview를 Apache 2.0으로 공개했습니다. 구조와 공개 수치, 모델이 참여했다는 자기 최적화 주장을 정리했습니다.
OpenAI, 자체 추론 칩 Jalapeño의 첫 벤치마크 측정치를 공개
OpenAI가 Broadcom과 만든 추론 전용 칩 Jalapeño의 InferenceX 측정 결과를 내놨습니다. 전력당 처리량과 지연 수치, 그리고 그 수치가 아직 말해 주지 못하는 것들을 정리했습니다.
Qwen, Qwen4 구조를 미리 적용한 오픈웨이트 모델 Qwen3.8-Flash-Next 공개
Alibaba Qwen 팀이 차기 Qwen4 아키텍처를 앞당겨 적용한 125B 규모 MoE 모델의 가중치를 공개했습니다. 어텐션과 잔차, 임베딩, 최적화 네 갈래를 함께 손봤습니다.
Z.AI, 희소·선형 혼합 어텐션을 쓴 오픈웨이트 모델 GLM-5.3-Flash 공개
8월 26일 공개된 320B-A18B MoE 모델. 성능 도약보다 어텐션 연산과 KV 캐시를 줄여 장문맥 서빙 비용을 낮춘 구조 변경이 발표의 중심입니다.