3부
4장. 내 위험에 맞는 금지문 만들기
4장. 내 위험에 맞는 금지문 만들기
모드와 모듈이 “이렇게 하라”에 가깝다면, 금지문은 “이건 하지 마라”에 가깝다. 그리고 많은 경우, 방패는 권장문보다 금지문이 더 강하다. 왜냐하면 사고는 대개 “좋은 답을 못 받아서”가 아니라, 하지 말아야 할 것을 AI가 너무 자연스럽게 해 버렸을 때 생기기 때문이다.
금지문은 이렇게 만든다. 먼저 내가 가장 두려워하는 결과를 적는다.
· 내 이름으로 나가는 공식 메일에 거짓 사실이 들어가는 것
· 존재하지 않는 출처가 보고서에 들어가는 것
· 고객에게 없는 규정을 있는 것처럼 안내하는 것
· 환자, 학생, 지원자, 시민에 대한 판단을 AI 점수 하나로 밀어붙이는 것
· 감정적으로 취약한 대화에서 AI가 무조건 동조하는 것
· 외부 도구 호출이나 자동 실행이 승인 없이 계속되는 것
그다음, 그 결과를 막는 가장 짧은 금지문으로 바꾼다.
· “확인되지 않은 사실을 내 이름으로 단정하지 마라.”
· “실재 여부를 확인하지 않은 출처를 참고문헌처럼 제시하지 마라.”
· “공식 규정·환불·법률·의료 정보는 원문 확인 전 단정하지 마라.”
· “인간 평가에 관한 점수를 단독 근거로 사용하지 마라.”
· “감정적으로 취약한 대화에서 내 감정에 무조건 동조하지 마라.”
· “사전 승인 없이 외부 호출·결제·실행을 계속하지 마라.”
좋은 금지문은 짧고, 구체적이고, 내가 실제로 무서워하는 결과와 바로 연결되어 있어야 한다. 막연하게 “안전하게 답하라”는 금지문은 거의 도움이 되지 않는다. 대신 “무엇을 하지 말아야 하는가”를 정확히 써야 한다. 금지문은 두려움을 문장으로 번역한 방어선이다.