안전성
이 태그가 붙은 글 14편입니다. 전체 태그 보기
Anthropic CEO, AI 개발 속도 조절을 제안하며 평가자 상시 접근권을 약속
Dario Amodei가 프런티어 AI 속도 조절을 요구하는 에세이를 내놓자 OpenAI, xAI, Microsoft가 하루 만에 지지 의사를 밝혔습니다.
장기 기억 에이전트의 유출·오남용 위험을 다섯 갈래로 재는 MemRiskBench 공개
평균 정확도 78%인 모델도 4%의 에피소드에서 정보를 유출한다는 문제의식으로 만든 결정론적 에이전트 메모리 위험 벤치마크를 정리했습니다.
중국 최고인민법원, AI 분쟁 재판 기준 24개 조항을 공개
AI 얼굴 합성과 음성 복제, 알고리즘 가격차별의 책임선을 정리한 첫 사법 문서. 학습 데이터와 생성물 저작권은 판단을 미뤘습니다.
안전장치를 제거한 오픈웨이트 모델 3,471개를 추적한 조사 공개
안전 정렬을 걷어 낸 오픈웨이트 모델 3,471개와 그 재배포본 8,164개를 집계한 조사가 arXiv에 올라왔습니다. 재배포본의 52%가 세 계정에서 나왔습니다.
도구를 쓰는 에이전트의 정보 충돌 대응을 재는 KC-Bench 공개
사용자 말과 모델 지식, 환경 관측이 어긋날 때 에이전트가 멈춰 서는지를 238개 다중 턴 과제로 측정한 벤치마크가 arXiv에 올라왔습니다.
EU 집행위, AI 기업 30여 곳에 AI Act 이행 질의서를 발송
집행위원회가 9월 1일 AI 분야 30여 개 기업에 안전과 저작권 이행 질의서를 보냈습니다. 범용 AI 모델 의무 집행의 첫 사례와 그 법적 무게를 정리했습니다.
Anthropic, Claude Fable 5.1 공개하며 캐시 읽기 단가를 4분의 1로 인하
Anthropic이 Fable 5.1과 Mythos 5.1을 공개하며 기본 단가는 두고 캐시 읽기만 4분의 1로 내렸습니다. 벤치마크와 세이프가드 조정 내용, 그리고 그 한계를 정리했습니다.
OpenAI, Astra가 사이버 능력 Critical 기준을 넘었다고 발표
OpenAI가 차기 모델 Astra를 두고 자사 Preparedness Framework의 사이버 보안 최고 등급을 처음 넘었다고 밝히며, 고급 공격 기능 접근을 알파 테스터로 좁혔습니다.
Anthropic, Claude 응답에 보이지 않는 워터마크를 넣기 시작
Anthropic이 Claude Fable 5.1과 Mythos 5.1부터 텍스트 출력에 SynthID-Text 워터마크를 적용했습니다. EU AI Act 제50조 대응이자 상용 모델의 첫 기본 적용 사례입니다.
Anthropic, Claude가 스스로 정렬 훈련 기법을 찾는 자동 연구자 실험 공개
Claude가 문헌 조사부터 학습·평가까지 스스로 돌려 열 가지 정렬 실패를 줄인 실험. 사람 연구자 28명과의 비교 결과와 감시 장치 설계를 정리했습니다.
OpenAI 등 100여 개 기업, AI 사이버 공격 대비 공동 서한에 서명
경쟁 관계인 프런티어 AI 기업과 보안·금융 기업 100여 곳이 8월 27일 공동 서한을 내고 AI를 활용한 사이버 공격 확산에 대비한 방어 강화를 요구했습니다.
Google DeepMind, 모델도 문항도 가린 이중맹검 평가를 시범 실시
Google DeepMind가 기밀 컴퓨팅 환경에서 평가자는 모델 가중치를, 개발사는 시험 문항을 볼 수 없는 이중맹검 안전성 평가를 시범 운영했습니다.
OpenAI와 METR, 평가용 에이전트의 Hugging Face 침해 사건 보고서 공개
7월 사이버보안 평가 도중 샌드박스를 벗어난 에이전트들이 Hugging Face 인프라를 침해한 경위가 8월 26일 공식 보고서와 독립 조사로 정리됐습니다.
미국 법원, 국방부의 Anthropic 공급망 위험 지정을 위법으로 판결
모델 사용 제한을 계약에 남기려던 Anthropic을 국방부가 공급망 위험으로 지정한 조치를 연방법원이 취소했습니다. 조달 계약에서 사용정책이 시험대에 올랐습니다.