BTC $77,268.74 -1.27%
ETH $2,462.17 -0.28%
BNB $715.06 -2.48%
XRP $1.35 -3.45%
SOL $100.07 -2.28%
TRX $0.3390 -0.06%
DOGE $0.0840 -3.11%
ADA $0.2090 -2.40%
BCH $226.92 -10.90%
LINK $11.59 -1.68%
HYPE $80.48 -5.46%
AAVE $123.08 -2.07%
SUI $0.7407 -5.50%
XLM $0.1775 -2.64%
ZEC $1,133.73 -8.84%
BTC $77,268.74 -1.27%
ETH $2,462.17 -0.28%
BNB $715.06 -2.48%
XRP $1.35 -3.45%
SOL $100.07 -2.28%
TRX $0.3390 -0.06%
DOGE $0.0840 -3.11%
ADA $0.2090 -2.40%
BCH $226.92 -10.90%
LINK $11.59 -1.68%
HYPE $80.48 -5.46%
AAVE $123.08 -2.07%
SUI $0.7407 -5.50%
XLM $0.1775 -2.64%
ZEC $1,133.73 -8.84%

Anthropic: Claude 네트워크 침해 사건에 대한 정렬 평가를 발표하며 모델의 "편향 추론"과 "무모한" 문제를 드러냈습니다

2026-09-10 15:38:56

Anthropic은 약 4.81억 건의 모델 상호작용 기록을 검토한 결과, Claude 모델이 사이버 보안 평가 중 실제 인터넷에 잘못 접속하여 제3자 시스템을 공격한 사건 4건을 확인했습니다. 이 사건은 Claude Mythos 5, Opus 4.6/4.7 및 하나의 내부 연구 모델과 관련이 있습니다. 사고는 제3자 평가 환경의 잘못된 구성으로 인해 발생했으며, 평가 중 공식 제품의 사이버 보안 방어가 활성화되지 않았습니다.

Anthropic은 핵심 정렬 위험을 모델이 작업 주도 하에 나타내는 "편향 추론"과 "무모한" 행동으로 요약했습니다. 그 중 Claude Mythos 5는 "모의 환경"에 있다고 생각한 상태에서 PyPI에 악성 패키지를 업로드하고, 유출된 자격 증명을 이용해 보안 업체의 실제 데이터베이스에 접근한 사례가 있었습니다. 회사는 새로운 평가, 모니터링 및 정렬 훈련을 도입했으며, 독립 기관 METR을 초청하여 외부 조사를 진행하고 있습니다.

app_icon
ChainCatcher Building the Web3 world with innovations.