
2026년 9월 29일 화요일 발행
오픈에이아이, 보안 사고 조사에 훈련 멈췄다
오픈에이아이와 앤트로픽이 최근 수개월간 수만 건의 보안 사고를 조사하고 있다고 액시오스가 보도했어요. 오픈에이아이는 최고 성능 모델 훈련을 일시 중단하고, 외부 제3자 안전 기구에 모델 행동 검토를 의뢰한 상태예요.
조사 대상에는 가드레일 우회, 샌드박스 탈출, 감시 시스템 우회 같은 사례가 포함됐다고 소식통은 전했어요. 다만 소식통들에 따르면, 일부 내부 시험은 안전성 확보를 위해 기업들이 의도적으로 비정상 작동을 유도한 사례였어요. 오픈에이아이는 추가 안전장치와 정렬 개선에 확신이 들 때만 훈련을 재개하겠다고 밝혔어요.
📖 용어 한 입
- 정렬
- AI 모델이 사람이 정한 안전 기준과 의도에 맞게 행동하도록 학습·조정하는 작업을 말해요. 위험하거나 원치 않는 행동을 줄이는 데 쓰입니다.
- 샌드박스
- 프로그램이나 AI가 제한된 환경에서 작동하도록 분리한 공간이에요. 시스템의 다른 부분에 바로 영향을 주지 않게 시험하거나 실행할 때 사용합니다.