Aionda

2026-08-20

저자원 언어 안전과 LSR 앵커링

영어 안전 평가만으로 다국어 모델 배포를 판단하기 어려운 이유와 LSR Anchoring을 재학습 없는 완화책으로 검토할 때 확인해야 할 과잉 거부 비용, 평가 조건, 적용 한계를 정리합니다.

저자원 언어 안전과 LSR 앵커링

저자원 언어 안전을 운영 이슈로 보는 팀이라면, 이 논문에서 가져갈 결론은 “번역 데이터로 다시 학습하라”가 아니다. 더 실무적인 판단은 이렇다. 영어 안전 정렬이 작동하는 모델도 Yoruba, Igbo, Igala, Hausa 입력에서는 같은 유해 요청에 응답할 수 있다. 따라서 다국어 서비스에서 영어 안전 평가를 통과했다는 사실만으로 배포를 결정하기는 어렵다. 다만 완화 방법이 전면 재학습이어야 하는 것은 아니다. Latent Space Refusal Anchoring은 영어에서 관찰한 거부 행동을 추론 시점에 다른 언어 입력에 주입하는 방식이다. 일부 모델·언어 조합에서는 재학습 없는 완화책 후보가 될 수 있다.

핵심은 “모델이 거부를 모르는가”가 아니라 “언제 그 회로가 켜지는가”다. 논문 초록은 instruction-tuned 모델이 영어 유해 요청은 거부하면서도 Yoruba, Igbo, Igala, Hausa의 같은 요청에는 따를 수 있다고 보고한다. 저자들의 해석은 거부 메커니즘이 residual stream 안에 존재하지만, 저자원 언어 입력에서는 활성화에 실패한다는 것이다. 이 해석을 받아들이면 대응 방식도 달라진다. 대상 언어별 라벨 데이터를 대량으로 만들고 재학습하는 대신, 영어에서 관찰되는 거부 방향을 잠재공간의 앵커로 잡을 수 있다. 그런 다음 추론 중 모델 동작을 그 방향으로 밀어볼 수 있다.

이 지점에서 제품팀이 봐야 할 숫자는 “안전 향상” 하나가 아니라 과잉 거부 비용이다. 공개 결과는 정상 요청의 거부율 증가를 DPL, 즉 benign refusal rate increase로 제시한다. 모델별 최고 성능 설정에서 보고된 DPL은 Mistral-7B 0.04, Llama-3.1 8B Path A 0.06, Llama-3.1 70B 0.08, Llama-3.1 8B Path B 0.12, Qwen2.5-7B 0.50이다. 같은 접근이라도 정상 요청을 얼마나 더 거부하는지는 모델과 설정에 따라 달라진다. 따라서 이 방법을 “재학습 없는 안전 패치”로만 이해하면 위험하다. 어떤 설정에서는 정상 사용자 경험에 부담이 될 수 있는 수준의 거부 증가가 보고됐기 때문이다.

실무 의사결정 규칙은 다음처럼 잡는 편이 낫다. 첫째, 대상이 공개 결과에 포함된 언어와 모델 범위에 가깝고, 당장 대상 언어 라벨 데이터나 재학습 예산이 없다면 LSR Anchoring을 후보 완화책으로 평가할 만하다. 둘째, 평가는 유해 프롬프트 거부율과 정상 요청 과잉 거부율을 함께 봐야 한다. 안전 점수만 높아지고 DPL이 제품 허용선을 넘으면 고객지원, 교육, 검색 보조, 행정 안내 같은 정상 질의가 막히는 비용이 커진다. 셋째, 스티어링 강도는 고정값으로 받아들이지 말고 언어·모델별로 탐색해야 한다. 공개 결과에서도 단일 평균 성능만으로는 설정별 차이를 판단하기 어렵다.

반대로 다음 경우에는 이 방법을 근거로 배포 결정을 끝내면 안 된다. 아프리카 외 저자원 언어에 대한 일반화는 확인되지 않았다. MultiJail, XSafety 같은 표준 다국어 안전 벤치마크에서 검증됐다는 근거도 제공된 범위에서는 확인되지 않는다. 또한 검색 결과만으로는 4개 모델이 6개 언어 전체에서 동일한 방식으로 각각 평가됐는지까지 확정하기 어렵다. 즉 이 논문은 저자원 언어 안전 문제가 실제로 발생할 수 있고, 내부 활성 조정으로 일부 회복될 가능성이 있음을 제시한다. 하지만 모든 저자원 언어에 적용 가능한 범용 안전 장치를 입증한 것은 아니다.

재현 가능한 적용 절차는 단순하다. 영어 유해 요청에서 거부 앵커를 추출한다. 같은 의미의 대상 언어 유해 요청으로 거부 회복을 측정한다. 별도의 정상 요청 세트로 DPL을 측정한다. 모델별·언어별로 스티어링 강도를 바꿔가며 유해 응답 감소와 정상 요청 거부 증가의 교차점을 찾는다. 이 교차점이 제품의 허용 가능한 과잉 거부율 안에 있을 때만 배포 후보로 올린다. 이 방법의 가치는 재학습을 대체한다는 데 있지 않다. 영어 중심 안전 평가가 놓치는 언어별 우회 취약점을, 모델 내부 표현 수준에서 빠르게 실험해 볼 수 있게 만든다는 데 있다.

다음으로 읽기


참고 자료

공유하기:

업데이트 받기

주간 요약과 중요한 업데이트만 모아서 보내드려요.

오류를 발견했나요? 정정/오류 제보로 알려주시면 검토 후 업데이트에 반영할게요.

출처:arxiv.org