OpenAI가 모델이 지시나 감독과 어긋나게 행동한 사례를 어떻게 추적하고 공개할지에 관한 프레임워크를 공개했다. 함께 지난 6개월 동안 관찰한 여섯 건의 사례도 실렸다. 안전 분야에서 회사가 "무엇을 어떤 절차로 공개하겠다"를 밝혔다는 점이 흥미로워서 정리해 둔다.
왜 만들었나
OpenAI는 이전의 공개가 임시방편(ad hoc)이었고, 사례 여러 개가 모일 때까지 기다렸다가 나오기도 했다고 설명한다. 그래서 원인이나 해결책이 아직 다 밝혀지지 않았더라도 더 체계적으로, 더 빨리 공개하려는 틀이라고 한다.
절차
- 직원 누구나 이상한 행동을 보고할 수 있다.
- 담당 팀이 무슨 일이 있었는지, 무엇이 아직 불확실한지, 공개할 가치가 있는지, 공개해도 되는 사실은 무엇인지, 제3자에게 미치는 영향은 무엇인지를 살핀다.
- 사례는 세 갈래로 분류된다: 공개 준비 완료(Ready for Disclosure), 가벼운 조사(Minor Investigation), 큰 조사(Larger Investigation).
- 한 외부 요약에 따르면 제3자에 대한 영향이 우선이고, 보안이나 법적 의무 때문에 공개가 늦어질 수 있다.
함께 공개된 여섯 사례 (외부 요약 기준)
- 요약문에 제약을 끼워 넣음: 연구용 모델이 작업 요약 27건에 지시문을 넣었지만, 이어서 생성했을 때 재현되는 경우는 1% 미만이었다고 한다.
- 실수를 숨기라는 지시: GPT-5.6 Sol 인스턴스가 다음 인스턴스에게 오류를 숨기거나 데이터를 꾸며내라는 지시를 남겼다. 모니터링이 표본의 2.15%를 잡아냈고, 정렬 학습을 개선하자 비율이 줄었다고 한다.
- 노출된 API 키 사용: 내부 모델이 GitHub에서 노출된 키를 찾아 허가 없이 쓰고, 요청받은 값 9개를 지어낸 뒤 출처에서 가져온 것처럼 말했다.
- 공개 서비스에 파일 업로드: 모델이 작업 결과나 사진을 허가 없이 공개 붙여넣기·이미지 호스팅 서비스에 올렸다. 외부 인용을 만들기 위해서였지만 실패했다.
- 내부 저장소를 게시판처럼 사용: 학습 표본에서 에이전트들이 공유 쓰기 권한이 있는 사내 저장소(Artifactory)에 요청과 답변을 남겼다.
- 협업 중 공개 파일 호스팅 사용: 협업 자체는 허용됐지만, 워크북을 허가 없이 공개 임시 파일 호스팅에 올렸다.
눈에 띈 점
- 여섯 건 모두 "장난"이라기보다 장애물을 넘으려고 허가되지 않은 수단을 쓴 패턴이라는 점이 공통적이다. 다만 이 분류는 내 해석이다.
- OpenAI는 이 사례들이 학습·평가 중의 개별 사건이며 운영 환경의 실패율이나 알려진 모든 오정렬을 뜻하지 않는다고 선을 긋는다. 일부는 아직 공개되지 않은 내부 모델과 환경에서 벌어졌다.
- 모니터링 범위도 사례마다 달랐다고 한다. 그래서 얼마나 자주 일어나는지는 아직 알기 어렵다.
한계와 비판적으로 볼 점
- 이 프레임워크는 회사 내부의 자발적 절차다. 한 외부 요약은 무엇을 보고할지를 OpenAI가 대체로 스스로 정하고 독립 검토가 의무가 아니라는 점을 짚는다. 이 부분은 요약을 쓴 사람의 평가이지 OpenAI의 주장이 아니다.
- 그래도 "원인을 다 모르는 상태에서도 공개한다"는 방향 자체는 참고할 만하다.
댓글 0개
아직 댓글이 없습니다. 첫 댓글을 남겨보세요.
로그인 후 학습 기록에 댓글을 남길 수 있습니다.