인프라
이 태그가 붙은 글 9편입니다. 전체 태그 보기
에이전트 작업 단계별로 KV 캐시를 골라 지우는 AgentKV 공개
계획, 행동, 도구 호출 단계마다 쿼리 방향이 다르다는 점을 이용해 KV 캐시 제거 정책을 다시 짠 AgentKV 논문을 정리했습니다.
노트북 GPU에서 100만 토큰 에이전트 작업공간을 돌리는 KVMem 공개
컨텍스트 창을 넘어간 에이전트 실행 기록을 요약하지 않고 KV 상태로 GPU와 RAM, NVMe에 나눠 저장하는 KVMem 논문을 정리했습니다.
NVIDIA, 집 안 여러 기기에 추론 요청을 나눠 보내는 PAIR 공개
NVIDIA가 같은 네트워크의 여러 기기로 추론 요청을 분배하는 오픈소스 라우터 PAIR를 공개했습니다. 이 도구가 하는 일과 하지 않는 일을 정리했습니다.
NVIDIA, 모델 허브 Hugging Face를 129억 달러에 인수
NVIDIA가 9월 3일 Hugging Face 인수를 발표했습니다. 발표문에 담긴 중립성 약속과 오픈 모델 생태계에 남는 구조적 변수를 정리했습니다.
같은 연산 예산에서 중간 층을 두 번 도는 MoE 스케일링 법칙 SMELT
루프 트랜스포머를 MoE에 적용한 SMELT 논문이 연산과 파라미터와 KV 캐시를 모두 맞춘 비교에서 학습 FLOPs를 6.8~18.0% 절약했다고 보고했습니다.
소비자용 GPU로 2B 모델을 처음부터 학습한 Puro-2B 레시피 공개
RTX 5090만으로 1.4조 토큰을 학습해 Qwen2.5-1.5B 수준에 근접한 2B 모델을 만든 Puro-2B 보고서와, 데이터와 코드까지 함께 공개한 의미를 정리했습니다.
학습 없는 슬라이딩 윈도우 어텐션이 선형 어텐션 변환을 앞섰다는 실험
추가 학습 없이 어텐션 창만 좁힌 기준선이 여러 선형 어텐션 변환 기법과 대등하거나 더 나은 성능을 냈다는 arXiv 논문의 내용과 한계를 정리했습니다.
OpenAI 등 100여 개 기업, AI 사이버 공격 대비 공동 서한에 서명
경쟁 관계인 프런티어 AI 기업과 보안·금융 기업 100여 곳이 8월 27일 공동 서한을 내고 AI를 활용한 사이버 공격 확산에 대비한 방어 강화를 요구했습니다.
OpenAI, 자체 추론 칩 Jalapeño의 첫 벤치마크 측정치를 공개
OpenAI가 Broadcom과 만든 추론 전용 칩 Jalapeño의 InferenceX 측정 결과를 내놨습니다. 전력당 처리량과 지연 수치, 그리고 그 수치가 아직 말해 주지 못하는 것들을 정리했습니다.