에이전트 작업 단계별로 KV 캐시를 골라 지우는 AgentKV 공개

계획, 행동, 도구 호출 단계마다 쿼리 방향이 다르다는 점을 이용해 KV 캐시 제거 정책을 다시 짠 AgentKV 논문을 정리했습니다.

왜 지금 이 주제인가

도구를 호출하며 여러 턴을 오래 도는 에이전트는 대화형 챗봇보다 훨씬 많은 토큰을 소비하고, 그만큼 GPU의 KV 캐시 용량과 디코드 대역폭에 부담을 줍니다. 이 부담을 줄이려는 기존 KV 제거 기법들은 대체로 챗봇 워크로드를 염두에 두고 설계돼, 가장 최근 토큰의 쿼리가 앞으로의 쿼리 분포도 대표한다고 가정합니다. 9월 14일 arXiv에 올라온 AgentKV 논문은 에이전트 궤적에서는 이 가정이 성립하지 않는다는 것을 수치로 보여주고, 이를 겨냥한 제거 정책을 제안합니다.

단계별로 쿼리 버퍼를 따로 두는 방식

논문은 에이전트 궤적을 think, act, tool, others 네 단계로 나눕니다. 그리고 각 층과 헤드에서 단계별 쿼리 벡터들을 특이값 분해해 얻은 basis-overlap 행렬의 특이값, 즉 principal-angle을 계산합니다. 그 결과 네 단계의 쿼리가 측정 가능한 수준으로 서로 다른 부분공간을 차지한다는 것이 확인됐습니다. 최근 토큰만 보고 대표 쿼리를 뽑는 기존 방식은 지금 단계가 아니라 앞으로 올 단계가 필요로 할 키를 체계적으로 과소평가하게 됩니다.

AgentKV의 해법은 단계마다 별도의 작은 쿼리 버퍼를 두는 것입니다. 각 단계는 고정 크기 FIFO 버퍼에 자신의 가장 최근 쿼리들을 저장하고, 캐시된 키는 이 버퍼들의 합집합을 기준으로 점수가 매겨집니다. 이 방식은 턴을 넘나드는 지속적 멀티턴 서빙 경로에 구현돼, 압축된 KV 상태를 턴 사이로 이어가면서 보존된 KV 페이지를 온라인으로 다시 압축합니다.

실험은 Qwen3-32B, Qwen3-8B, Llama-3.3-Nemotron-Super-49B-v1.5 세 모델과 BFCL(web_search, multi_turn, memory)·τ²-bench(airline, retail, telecom) 여섯 과제 영역, 과제별로 서로 다른 세 가지 KV 예산 조건에서 진행됐습니다. 비교 대상은 압축을 전혀 하지 않는 Full KV, 중복 인식 목적함수로 키를 고르는 R-KV, 장문 추론에 쓰이는 압축 기법 Tri-attention입니다.

수치로 보면, BFCL의 multi_turn 과제에서 Qwen3-32B 기준 Full KV는 52.0점을 기록한 반면 예산 3072에서 AgentKV는 42.0점, Tri-attention은 41.5점, R-KV는 27.0점이었습니다. τ²-bench의 retail 과제(예산 4096)에서는 Full KV 53.5점, AgentKV 42.1점, R-KV 26.3점, Tri-attention 16.7점으로, 과제에 따라 두 기존 기법 사이의 우열이 뒤바뀌는 가운데 AgentKV가 꾸준히 앞선 축에 섰습니다. 두 모델, 여섯 과제 영역, 과제별 세 KV 예산 전체를 놓고 보면 AgentKV는 R-KV보다 평균 5.5점, Tri-attention보다 평균 5.3점 높은 과제 점수를 기록했습니다. 서빙 처리량 면에서는 압축을 하지 않는 기존 full-KV SGLang과 비교해 출력 토큰 처리량이 최대 1.80배 늘었습니다. 구현은 GitHub에 공개돼 있습니다.

의미와 한계

이 결과는 에이전트 서빙에서 KV 캐시를 줄이는 문제를 챗봇 워크로드의 연장으로 다뤄서는 안 된다는 것을 실증적으로 보여줍니다. 계획을 세우는 단계와 도구 결과를 처리하는 단계가 필요로 하는 과거 정보가 다르다면, 압축 정책도 그 구조를 반영해야 점수 손실을 줄일 수 있습니다. 다만 압축 자체가 손실 없는 것은 아닙니다. BFCL multi_turn 사례에서 보듯 AgentKV를 쓰더라도 Full KV의 52.0점에는 미치지 못하는 42.0점에 머뭅니다. 논문도 이 점을 분명히 밝힙니다. 지금 버전은 KV 예산을 자동으로 정하지 못하고 사람이 직접 지정해야 하며, 압축 효과는 중간 정도 압축 비율에서 가장 두드러지고, 과제가 이미 가장 최근 도구 응답이나 외부 메모리를 통해 필요한 상태를 노출하는 경우에는 이점이 줄어든다고 저자들은 적었습니다. 검증 범위도 세 모델과 여섯 과제 영역에 머물러 있어, 다른 구조의 모델이나 더 긴 궤적으로 얼마나 일반화되는지는 추가 확인이 필요합니다.

한 줄 정리

에이전트의 계획·행동·도구 단계마다 쿼리가 다른 방향을 향한다는 점을 이용해 KV 캐시 제거 정책을 단계별로 나눈 AgentKV가 공개됐습니다.

출처

  1. AgentKV: Phase-Aware KV Eviction for Agentic LLMs (arXiv:2609.14872)
  2. AgentKV 논문 전문 (arXiv HTML)
  3. LiuTaowen-Tony/agentkv 구현 저장소