앤스로픽(Anthropic)이 발표한 보고서를 통해 중국 AI 기업들이 클로드(Claude) 모델의 추론 능력을 탈취하기 위해 수행한 대규모 '증류 공격'의 실체가 드러났습니다. 이는 단순한 데이터 수집을 넘어 모델의 핵심 지적 자산을 노리는 지능형 위협으로 진화하고 있습니다.
인공지능 생태계가 고도화되면서 모델의 성능을 결정짓는 '추론 과정' 자체가 새로운 형태의 자산이자 공격 대상이 되고 있습니다. 최근 앤스로픽(Anthropic)이 발표한 위협 인텔리전스 보고서에 따르면, 중국 기반의 AI 기업들이 자사 모델인 '클로드(Claude)'의 내부 추론 과정을 탈취하려는 이른바 '증류 공격(Distillation Attacks)'이 전례 없는 규모와 정교함으로 전개되고 있음이 확인되었습니다 [1].
모델 증류는 본래 더 큰 모델의 지식을 작은 모델로 전이시켜 효율성을 높이는 기법이지만, 최근의 공격자들은 이를 악용하여 타사 모델의 '사고의 연쇄(Chain of Thought)'를 추출하고 있습니다. 앤스로픽은 2026년 5월부터 7월 사이 알리바바(Alibaba)와 연계된 캠페인에서만 약 1억 5,100만 건의 교환이 발생했으며, 이는 단일 증류 시도로는 관찰된 것 중 최대 규모라고 밝혔습니다 [1].
공격자들은 앤스로픽이 사용자에게 노출하지 않는 내부 사고 과정을 강제로 드러내기 위해 고도의 프롬프트 엔지니어링을 구사합니다. 예를 들어, 모델에게 '전문 번역가' 역할을 부여하고 이전 작업 메모리를 가타카나로 번역하라는 식의 우회 기법을 사용하여, 시스템이 보호하고 있는 추론 흔적을 직접 출력하도록 유도합니다 [1].
이러한 공격은 단순히 일반적인 질의응답을 넘어섭니다. 문샷 AI(Moonshot AI)와 관련된 캠페인에서는 클로드 모델을 이용해 폐쇄 회로 감시 영상 속 인물의 '비정상적 행동'을 분석하려는 시도가 포착되었으며, 이는 중국 군부와 연계되었을 가능성이 제기되고 있습니다 [1]. 앤스로픽은 이러한 행위가 단순히 기술적 호기심을 넘어, 자국 모델(Qwen 등)의 추론 능력을 강화하기 위한 조직적인 학습 데이터 확보 전략이라고 분석합니다 [1, 2].
물론 이러한 공격의 배후를 완전히 단정 짓기에는 여전히 불확실성이 존재합니다. 앤스로픽은 3,500개 이상의 계정이 공유된 고정 프롬프트를 사용했다는 점을 근거로 알리바바의 조직적 개입을 지목했으나, 방대한 계정 네트워크를 통한 분산 공격은 추적의 복잡성을 높입니다 [1]. 또한, 앤스로픽이 보고서에서 언급한 5개 캠페인이 모두 국가 주도인지, 혹은 상업적 이익을 노린 독립적 그룹의 활동인지에 대해서는 추가적인 검증이 필요합니다. 앤스로픽 역시 이번 보고서가 모든 위협을 포괄하지 않으며, 더욱 정교해지는 공격자들에 대응하기 위해 지속적인 방어 체계 업데이트가 필수적임을 인정하고 있습니다 [2].
결국 AI 모델의 성능이 향상될수록 이를 탈취하려는 유인 또한 커질 수밖에 없습니다. 개발사들이 방어 기제를 강화할수록 공격자들은 더 복잡한 우회로를 찾을 것이며, 이 숨바꼭질은 AI 기술 경쟁의 새로운 상수가 되었습니다. 모델의 지능을 보호하는 것과 개방적인 생태계를 유지하는 것 사이의 균형을 찾는 것이 향후 AI 업계가 직면할 가장 큰 과제가 될 것입니다.
링크된 자료는 사실 확인에 사용했으며, 분석과 해석의 책임은 본 사이트에 있습니다.