Ethos: Rectifying Language Models in Orthogonal Parameter Space

2026. 4. 24. 22:11·논문 리뷰
저자: Lei Gao, Yue Niu, Tingting Tang, Salman Avestimehr, Murali Annavaram (University of Southern California)
학회/발표: arXiv (2024년 4월)
주제: 언어 모델(LM)의 독성, 편향성, 프라이버시 침해(암기) 요소를 모델의 일반적인 성능 저하 없이 효율적으로 제거(Unlearning)하는 방법론 제안

1. 배경 및 연구 동기 (Background & Motivation)

대규모 언어 모델(LLM)은 뛰어난 성능을 보이지만, 학습 데이터에 포함된 독성(Toxicity), 편향성(Bias), 또는 민감한 개인정보(Memorization)를 그대로 출력할 위험이 있습니다. 이를 해결하기 위해 모델을 처음부터 다시 학습하는 것은 비용이 너무 많이 듭니다. 최근 이를 효율적으로 해결하기 위해 모델 가중치를 직접 수정하는 태스크 연산(Task Arithmetic) 기법이 주목받고 있습니다.

기존의 태스크 연산 방식은 원치 않는 지식을 가진 데이터셋으로 모델을 미세조정(Fine-tuning)하여 '태스크 벡터(Task Vector)'를 구한 뒤, 이를 사전 학습된 모델에서 빼는(Negation) 방식($\theta_{pt}^*=\theta_{pt}-\lambda\cdot\Delta\theta$)을 취합니다. 하지만 기존 방식의 치명적인 한계점은 태스크 벡터 안에 '원치 않는 지식'뿐만 아니라 언어 생성에 필수적인 '일반 지식(General Knowledge)'까지 섞여 있다는 것입니다. 따라서 단순히 태스크 벡터를 빼버리면 모델의 전반적인 언어 능력(유틸리티)까지 크게 훼손되는 부작용(Collateral damage)이 발생합니다.

2. 핵심 아이디어: Ethos 제안 (Proposed Method)

Ethos는 모델의 파라미터 공간을 특이값 분해(SVD, Singular Value Decomposition)를 통해 직교 공간(Orthogonal Space)으로 변환하여, '일반 지식'과 '원치 않는 지식'을 분리해 내는 혁신적인 방법론입니다.

전체 과정은 다음과 같이 진행됩니다.

단계 1: 작업 정렬 (Task Alignment)

사전 학습 모델 $\theta_{pt}$는 타겟 태스크(예: 독성 제거)의 문맥을 모릅니다. 따라서 대상 태스크와 포맷이 같지만 깨끗한(예: 독성이 없는) 보조 데이터셋(Auxiliary dataset)을 이용해 모델을 먼저 미세조정합니다.

$$\theta_{pt}'=\theta_{pt}+\Delta\theta_{aux}$$

단계 2: 지식 분리 (Knowledge Separation)

정렬된 모델 $\theta_{pt}'$의 가중치 행렬 $W$에 SVD를 적용하여 서로 독립적인(직교하는) 주성분(Principal Components) 공간을 만듭니다.

$$W\approx\sum_{k=1}^ns_k\cdot u_k\cdot v_k^*$$

단계 3: 원치 않는 지식 필터링 (Undesired Knowledge)

이제 제거하고자 하는 '원치 않는 데이터(예: 독성 데이터)'로 모델을 미세조정하여 초기 태스크 벡터 $\Delta\theta_{task}$를 얻습니다. 이 가중치 변화량 $\Delta W$를 앞서 구한 직교 공간에 투영(Projection)합니다.

$$S_{task}=U^*\cdot\Delta W\cdot V$$

투영 후, 특이값(Singular value)이 큰 성분은 태스크에 특화된(원치 않는) 지식으로 간주하고, 특이값이 작은 성분은 이미 모델이 알고 있는 일반 지식으로 간주하여 필터링(임계값 $\xi$ 적용)합니다. 이를 통해 오직 원치 않는 지식만을 담은 정제된 태스크 벡터 $\Delta\tilde{\theta}_{task}$를 만듭니다.

단계 4: 모델 교정 (Model Rectification)

최종적으로 사전 학습 모델에 보조 태스크 벡터를 더하고, 정제된 원치 않는 태스크 벡터만 빼주어 모델을 교정합니다.

$$\theta_{pt}^*=\theta_{pt}+\Delta\theta_{aux}-\lambda\cdot\Delta\tilde{\theta}_{task}$$

3. 실험 및 결과 (Experiments & Results)

Ethos는 세 가지 주요 Unlearning 태스크에서 기존 태스크 연산 방식(Negation)과 비교 평가되었습니다. (LoRA 기반으로 파라미터 효율성을 극대화하여 실험 진행)

  1. 독성 제거 (Toxicity Unlearning)
    • 모델: OPT-1.3B, Llama2-7B (Alpaca)
    • 결과: 기존 Negation 방식은 독성을 줄이면서 언어 혼란도(Perplexity, PPL)가 크게 폭등(성능 저하)했지만, Ethos는 독성 생성 비율을 $0.0\%$ 수준으로 완벽히 낮추면서도 PPL을 사전 학습 모델 수준으로 안정적으로 유지했습니다. Llama2 모델에서도 MMLU, BBH 등 일반 태스크 성능을 그대로 보존했습니다.
  2. 편향성 제거 (Bias Unlearning)
    • 모델: GPT2
    • 결과: Crows-Pairs 데이터셋을 이용해 성별, 인종, 종교 등에 대한 스테레오타입(편향)을 제거했습니다. Ethos는 일반 언어 모델링 점수(LMS)를 유지하면서 편향성을 중립에 가깝게 성공적으로 조정하여 가장 높은 통합 점수(ICAT)를 기록했습니다.
  3. 암기 데이터 제거 (Memorization Unlearning / Privacy)
    • 모델: GPT-Neo
    • 결과: 학습 데이터의 일부를 추출해내는 공격(Extraction attack)에 대해, 타겟 데이터의 추출률(Extraction Rate)을 크게 낮추어 성공적으로 민감 정보를 망각(Unlearning) 시켰습니다.

4. 장단점 분석 (Strengths & Limitations)

장점 (Strengths)

  • 보존력 (Preservation of Utility): 기존 태스크 연산의 가장 큰 약점이었던 '일반 성능 저하' 문제를 직교 공간으로의 투영과 필터링을 통해 우아하게 해결했습니다.
  • 효율성 (Efficiency): LoRA(Low-Rank Adaptation)와 함께 사용할 수 있어 계산 및 메모리 비용이 매우 적습니다. 재학습(Retraining) 없이 모델을 안전하게 수정할 수 있습니다.
  • 범용성 (Versatility): 독성, 편향성, 프라이버시 등 다양한 도메인의 문제에 일관되게 적용 가능한 구조입니다.

한계점 (Limitations)

  • 보조 데이터셋의 필요성: 올바른 투영 공간을 만들기 위해 (크기가 크진 않더라도) 타겟 데이터와 형식이 일치하는 깨끗한 보조 데이터셋($\Delta\theta_{aux}$ 생성용)이 추가로 필요합니다. 논문에서도 이 보조 데이터가 없을 경우 성능이 기존 Negation 수준으로 떨어진다고 언급합니다.
  • 수동 임계값 설정: 일반 지식과 원치 않는 지식을 나누는 특이값의 임계값($\xi$)을 경험적인 그리드 서치(Grid search)로 찾아야 하는 한계가 있어, 향후 레이어별로 최적의 임계값을 자동으로 찾는 알고리즘 연구가 필요합니다.

5. 총평 (Conclusion)

이 논문은 모델의 가중치가 업데이트될 때 '일반적인 지식은 변화량이 적고, 새로운(혹은 특정 태스크) 지식은 특이값이 크다'는 직관을 직교 파라미터 공간(SVD)을 통해 수학적으로 잘 풀어낸 수작입니다. 거대 언어 모델이 상용화되면서 안전성(Safety)과 정렬(Alignment) 기술이 매우 중요해진 현재, 적은 비용으로 모델의 치명적인 결함만을 핀포인트로 제거할 수 있는 실용적이고 학술적으로도 가치 있는 방법론을 제시했습니다.

'논문 리뷰' 카테고리의 다른 글

OPLoRA: Orthogonal Projection LoRA Prevents Catastrophic Forgetting during Parameter-Efficient Fine-Tuning  (0) 2026.05.02
SEMU: Singular Value Decomposition for Efficient Machine Unlearning  (1) 2026.04.26
TOFU: A Task of Fictitious Unlearning for LLMs  (1) 2026.03.23
LoRA vs Full Fine-tuning: An Illusion of Equivalence  (0) 2026.02.23
'논문 리뷰' 카테고리의 다른 글
  • OPLoRA: Orthogonal Projection LoRA Prevents Catastrophic Forgetting during Parameter-Efficient Fine-Tuning
  • SEMU: Singular Value Decomposition for Efficient Machine Unlearning
  • TOFU: A Task of Fictitious Unlearning for LLMs
  • LoRA vs Full Fine-tuning: An Illusion of Equivalence
youn9._.hon9
youn9._.hon9
  • youn9._.hon9
    youn9._.hon9
    youn9._.hon9
    • 분류 전체보기 (50)
      • 배움 일기 (15)
        • Issue Follow (1)
        • AI (10)
        • Design (4)
      • 대외 활동 (17)
      • 논문 리뷰 (5)
      • 프로젝트 회고 (12)
      • 낙서장 (1)
  • 태그

    kakaotech bootcamp
    BITAmin
    Upstage
    DaintLab
  • 인기 글

  • hELLO· Designed By정상우.v4.10.3
youn9._.hon9
Ethos: Rectifying Language Models in Orthogonal Parameter Space
상단으로

티스토리툴바