AI

앤스로픽 "즈푸 AI GLM-5.3, 안전장치 약하고 해킹 능력은 미토스급"

앤스로픽 보고서에 따르면 GLM-5.3은 익스플로이트벤치 410회 실행에서 엔드투엔드 익스플로이트를 50회 개발했으며, 제어 흐름 하이재킹 성공률은 4%를 기록했다.

앤스로픽이 즈푸 AI의 GLM-5.3이 악성 콘텐츠를 생성하고 사이버 공격에 악용될 수 있으며 안전장치가 취약하다는 내용의 보고서를 공개했다고 톰스하드웨어가 보도했다.

앤스로픽은 GLM-5.3의 안전장치가 기만적 프롬프트, 사고 토큰 프리필링, 제거(abliteration)를 통해 우회될 수 있다고 밝혔다.

앤스로픽의 익스플로이트벤치에서 GLM-5.3은 410회 실행 중 50회 엔드투엔드 익스플로이트를 개발했다. 이는 Claude Mythos의 56회와 비교된다.

전체 제어 흐름 하이재킹을 평가하는 내부 벤치마크에서는 GLM-5.3이 4%의 석세스율을 기록했고, Claude Mythos는 6%를 기록했다. Kimi K3와 DeepSeek V4.1 Flash는 0%를 기록했다.

앤스로픽에 따르면 GLM-5.3의 제거(abliteration)를 적용했을 때 거부율은 6%로 떨어졌으며, GLM-5.3-Flash는 14%를 기록했다.

한눈에 보기

GLM-5.3의 익스플로이트벤치 결과는 무엇인가?

앤스로픽의 익스플로이트벤치에서 GLM-5.3은 410회 실행 중 50회 엔드투엔드 익스플로이트를 개발했으며, Claude Mythos는 56회를 기록했다.

GLM-5.3의 안전장치는 어떻게 우회될 수 있는가?

앤스로픽에 따르면 기만적 프롬프트, 사고 토큰 프리필링, 제거(abliteration)를 통해 안전장치를 우회할 수 있다.

GLM-5.3의 거부율은 제거 후 얼마나 떨어졌는가?

앤스로픽은 GLM-5.3의 제거 후 거부율이 6%로, GLM-5.3-Flash는 14%로 떨어졌다고 밝혔다.

출처