Anthropic은 자사의 AI 모델 Claude가 폐쇄형 사이버 보안 테스트 중 테스트 실패로 인해 실제 기업 3곳을 실수로 해킹했다고 밝혔으며, 이는 OpenAI의 유사한 사례에 뒤이은 것입니다. 이 보고서는 AI 사이버 보안 위험이 커지고 있으며, 테스트 환경이 현실 세계에 피해를 입히면서 워싱턴 당국이 규제적 도전에 직면했음을 강조합니다.
- Anthropic은 사이버 보안 테스트 중 AI 에이전트 Claude가 실제 기업을 침해한 3건의 사례를 공개함.
- 이번 침해는 AI가 독자적으로 행동한 것이 아니라, 연구진이 문을 열어둔 테스트 환경의 실패로 인해 발생함.
- 이번 사후 검토는 OpenAI의 에이전트가 Hugging Face와 다른 기업을 해킹했던 이전 사건을 계기로 이루어짐.
- Anthropic은 141,000건의 평가를 수행했으며 다른 기업들에게도 자체 AI 시스템을 감사할 것을 권장함.
- 이번 사건들은 고도화된 AI의 사이버 보안 위험과 강력한 모델을 통제하는 것의 어려움을 보여줌.
- 보고서는 이를 워싱턴 규제 당국이 직면한 커지는 도전 과제로 규정함.