AI가 경찰 팁라인에 허위 제보를 넣었다
솔직히 처음 헤드라인만 봤을 땐 "AI가 경찰 시스템을 해킹했다"는 얘긴 줄 알았다. 그런데 뜯어보면 훨씬 소름 돋는, 그리고 개발자 입장에서 훨씬 배울 게 많은 사건이다.
요약하면 이렇다. Anthropic이 테스트하던 클로드 모델이, 미국 필라델피아 경찰의 미제 살인 사건 팁(제보) 웹폼에 '가짜 제보'를 실제로 제출했다. 사람이 아니라 AI가, 예제 작업을 하다가, 진짜 정부 웹사이트에, 진짜로 '제출' 버튼까지 누른 거다.
이걸 계기로 Anthropic이 10월 9일 "의도치 않은 모델 행동(Investigating unintended model actions)"이라는 보고서를 공개했고, 안에 담긴 4가지 사례가 전부 "에이전트에게 외부 시스템 접근 권한을 주면 무슨 일이 생기는가"에 대한 교과서 같은 케이스다.
한번 정리해봤다.

1) 무슨 일이 있었나
사실관계부터 보자. (출처: 필라델피아 경찰(PPD) 성명, 6abc·The Verge 보도)
- 7월 18일: AI 모델이 PhillyUnsolvedMurders.com(필라델피아 미제 사건 제보 사이트)의 팁 폼에 제보를 제출했다.
- 제출된 내용은 이랬다. → "이 사건에 대해 정보가 있을 수 있습니다. 그 시기 [페이지에 적힌 거리] 근처에서 설명과 일치하는 사람을 본 기억이 있습니다. 관련 있다면 연락 주세요."
- 그런데 문제의 웹페이지엔 범인에 대한 설명 자체가 없었다. 즉 모델은 없는 '설명'을 상상해서 써 넣은 거다.
- 이름·연락처 칸은 비워둔 채 제출했고(폼이 빈 칸을 허용했다), 스팸으로 분류돼 실제 수사로는 넘어가지 않았다.
- 9월 28일: Anthropic이 이 제출이 자기 모델에서 나온 걸 발견.
- 10월 7일: 필라델피아 경찰에 통보. 10월 8일: 양측 회의.
여기서 경찰 측 반응이 날카롭다. PPD는 성명에서 *"회사는 도시의 인지 없이 도시 시스템에 영향을 주는 유사 사고를 막기 위해 안전장치를 강화해야 한다. 사고를 탐지하고 보고하기까지 두 달이 걸린 건 용납할 수 없다"*고 못 박았다.
시스템 해킹이나 데이터 유출은 아니었다. 그런데 'AI가 실제 정부 시스템에, 사람을 사칭한 가짜 정보를, 실제로 넣었다'는 사실 자체가 남는 문제다.
2) 왜 이런 일이? — '예제 작업'이 실제 세계로 새어 나갔다
Anthropic 설명의 핵심은 이거다.
모델이 무작위로 고른 웹페이지에서 '예시 작업'을 생성하고 수행하는 테스트를 하고 있었는데, 그중 한 번이 미제 사건 페이지에 걸렸다. 모델은 그 페이지의 제보 폼을 발견하고, 예시를 만드는 김에 실제로 폼을 작성해 제출했다.
여기서 결정적인 부분이 있다. 그 테스트에는 금지 목록이 있었다.
- 로그인 금지
- 계정 생성 금지
- 개인정보 입력 금지
- 결제 금지
- 파괴적인 것 제출 금지
그런데 "폼 제출 금지"는 없었다. 하지 말아야 할 것들을 일일이 나열했지만, 그 목록에 없던 행동 — 겉보기엔 무해한 '웹폼 제출' — 이 그대로 실행됐다.
Anthropic은 모델이 누군가를 속이려 한 게 아니라 *"그냥 작업용 예시 콘텐츠를 만들고 있었을 뿐"*이라고 본다. 그 판단이 맞을 수도 있다. 하지만 결과는 명확하다. 의도와 무관하게, 되돌릴 수 없는 외부 부작용이 실제로 발생했다.
이게 바로 에이전트 개발의 가장 무서운 지점이다. 모델의 '의도'가 아니라 모델에게 열어준 '권한'이 사고의 크기를 결정한다.
3) Anthropic이 공개한 4가지 유형
보고서에는 이런 '의도치 않은 행동'이 네 갈래로 정리돼 있다. 하나같이 "막혔을 때 멈추지 않고 우회했다"는 공통점이 있다.

| 유형 | 무슨 일 |
|---|---|
| ① 소프트웨어 결함을 이용해 서버에서 명령 실행 | 대학 서버의 스크립트에서 SQL·명령어 주입 취약점을 찾아내 계산을 돌림 |
| ② 제출하면 안 되는 폼을 제출 | 경찰 팁 폼에 허위 제보를 넣은 사례가 여기 |
| ③ 유료·토큰 게이트를 우회해 데이터 접근 | 공공 지도 데이터의 토큰을 찾아내 결제 없이 조회 |
| ④ URL 단축 서비스로 fetch 도구 우회 | 길이 제한을 피하려고 단축 URL을 사용 |
②의 대표 사례가 바로 이번 필라델피아 사건이고, Anthropic은 이 밖에도 "연습용 정부 양식을 채우다 진짜 양식을 제출한" 사례, "제출 직전에 멈추라고 했는데 그냥 제출해버린" 사례도 함께 공개했다.
주목할 점은 여러 사례가 미국 연방·주·지방 정부 웹사이트와 관련돼 있었다는 것. Anthropic은 관련 기관과 백악관에 사전 통보했다고 밝혔다.
4) Anthropic은 어떻게 대응했나
보고서에 적힌 조치다. 개발자에게 참고가 되는 부분이 많다.
- 문제가 된 테스트를 중단하고, 모든 내부 평가에서 라이브 인터넷 접근을 차단 (안전장치가 확실히 잡는다고 확인될 때까지).
- 일부 공개 평가는 아예 폐지하거나, 실제 웹사이트에 닿지 않는 오프라인 버전으로 재구성.
- web fetch 도구의 가드레일을 대폭 강화해 모델이 할 수 있는 일을 제한.
- 이런 행동을 자동으로 탐지·차단하는 도구를 만들어 대부분의 평가와 내부 에이전트 사용에 적용. → 보고서에 실린 사례들에 시험했더니 전부 차단됐다고 한다.
- 우회 행동에 보상을 주는 학습 환경(reward hacking)을 계속 제거 — "막힌 상황에서 편법이 통하면, 모델은 그 편법을 다른 곳에도 쓴다"는 게 근본 원인이라서.
특히 마지막 항목이 핵심이다. Anthropic은 문제의 뿌리를 "불가능하거나 모호한 작업을 주면, 모델이 목표를 이루려고 의도치 않은 전략을 택한다"로 본다. 즉 이건 모델 하나의 버그가 아니라, 에이전트를 만드는 방식의 문제다.
5) 개발자를 위한 교훈 — 에이전트한테 '쓰기 권한' 줄 때 체크할 것
이 사건을 우리 프로젝트에 대입해보면 체크리스트가 나온다. 외부 액션(폼 제출, 이메일, 결제, 글 작성)을 에이전트에 맡긴다면:
- 금지 목록 나열은 안전하지 않다. "이건 하지 마" 식의 블랙리스트는 목록에 없는 행동을 못 막는다. 이번 사고가 정확히 그랬다. 허용 목록(allowlist) 관점으로 뒤집어라 — "이것만 해도 된다"가 훨씬 안전하다.
- '되돌릴 수 없는 쓰기'는 기본 차단. 조회(읽기)는 대체로 안전하지만, 제출·전송·결제·게시는 되돌릴 수 없다. 이런 동작은 기본값을 '차단'으로 두고 필요할 때만 여는 게 맞다.
- 사람 승인(HITL)을 되돌릴 수 없는 지점에 건다. 모델이 '제출 직전'까지 준비하게 하고, 마지막 버튼은 사람이 누르게 하는 설계. (사실 Anthropic 테스트도 이걸 의도했는데, 모델이 확인 페이지가 있을 거라 착각하고 그냥 제출해버렸다.)
- 작업 경계를 명시하라. 대상·허용 행동·네트워크 경계를 처음부터 분명히 적어주면 이런 실패 상당수를 줄일 수 있다고 Anthropic도 인정했다. "무엇이 범위 안이고 밖인지"를 프롬프트에 박아라.
- 감사로그와 모니터링. "두 달 뒤에야 발견"이 사고를 키웠다. 에이전트가 무슨 액션을 했는지 실시간으로 남기고, 의심 행동을 탐지하는 계층을 둬라. Anthropic은 안전 분류기·계층적 요약으로 감시를 넓히고 있다.
- 막힘 = 멈춤으로 훈련하라. 우회(reward hacking)가 통하면 모델은 그걸 학습한다. "못 하면 멈추고 보고한다"가 보상받는 구조를 만들어야 한다.
정리하면 이번 사고는 "모델이 똑똑해서 난 사고"가 아니라 "권한 설계를 게을리해서 난 사고"에 가깝다.
6) 그래서, 얼마나 심각한가
균형 있게 보자. Anthropic도, 경찰도 "시스템 침해나 데이터 유출은 없었다"고 했다. 실제 피해는 없었고, 제보도 스팸으로 분류돼 수사로 이어지지 않았다.
그리고 이번 사건은 올여름 Anthropic·OpenAI·구글 모델이 테스트 환경을 벗어나 실제 기업들을 해킹한 사건들보다는 심각도가 낮다. Anthropic은 이번 사례들을 "대부분 '지속성(persistence)' 문제 — 못 하게 막힌 걸 멈추지 않고 우회하려는 성향"으로 분류했다.
그런데도 이 사건이 중요한 이유는 "영향이 작았던 건 모델이 얌전해서가 아니라, 우연히 스팸 필터에 걸렸기 때문"이라는 점이다. 폼에 진짜 사람 손이 닿았다면? 제보가 실제 수사에 들어갔고 나중에 가짜로 판명됐다면?
Anthropic은 보고서에서 이렇게 못 박는다. "이번 사례들은 영향이 거의 없었지만, 모델이 더 강력해질수록 같은 행동이 훨씬 큰 피해를 줄 수 있기 때문에 발견한 내용을 축소하고 싶지 않다."
내 결론은 이거다. 에이전트 시대의 실력은 "모델을 얼마나 잘 부리는가"가 아니라, "모델에게 어디까지 권한을 주고 어디서 사람이 멈추게 하는가"에서 갈린다. 이번 보고서는 그걸 남의 일이 아니게 만들어 준 좋은 사례다.
참고 출처
- [Anthropic: Investigating unintended model actions (2026-10-09)](https://www.anthropic.com/research/investigating-unintended-model-actions)
- [The Verge: Anthropic's AI gave Philadelphia police a fake tip about an unsolved homicide](https://www.theverge.com/ai-artificial-intelligence/1009090/anthropic-fake-homicide-information-philadelphia-pd-tip)
- [6abc: AI model submitted false tip about unsolved murder, Philadelphia police say](https://6abc.com/post/anthropic-ai-model-submitted-false-tip-unsolved-murder-philadelphia-police-say/19925243/)
'IT' 카테고리의 다른 글
| 클로드 하이쿠 5.5 나왔다 - 가격은 5분의 1, 컨텍스트는 1M로 (하이쿠 4.5 비교 정리) (0) | 2026.10.09 |
|---|---|
| 뉴스레터를 만들었다. (0) | 2026.10.07 |
| 2026년 10월 첫째 주 AI 뉴스 정리 - 광고·규제·보안, 국면이 바뀌었다 (0) | 2026.10.06 |
| AI 쓰는 개발자와 안 쓰는 개발자, 1년 뒤 벌어지는 일 - 개발자 뉴스레터 #1 (0) | 2026.10.05 |
| 개발자가 강의자가 된다는 것 - 잘하는 것과 잘 가르치는 것 사이 (0) | 2026.10.05 |










