# Brain Washing: Emergent Misalignment, Persistent Backdoors, and Alignment Recovery

> 최종 갱신: 2026-09-04<br>
> 핵심 문제: **Narrow/harmful fine-tuning과 in-context learning이 언제 emergent misalignment를 만들고, backdoor behavior가 continual fine-tuning 뒤에도 얼마나 지속되며, 이를 어떻게 탐지·완화할 것인가?**<br>
> 대상 모델: 오픈웨이트 LLM, VLM·MLLM, VLA와 로봇 정책<br>
> 조사 범위: 2025~2026년의 emergent misalignment·subliminal learning·persistent backdoor·persona mechanism·decontamination을 중심으로, 관련 continual learning·unlearning·model editing 연구를 비교<br>
> 상세 설명 자료: [`bw.md` 상세 설명 및 발표 스크립트](bw-explanation-script.md)<br>
> 관련 데이터 분석: [Hugging Face CCP 관련 데이터셋 구성·계보·내용 분석](ccp-dataset-bias-audit.md)

**Brain Washing은 정식 학술 용어가 아니라 프로젝트명이다.** 본문에서는 임의의 하위 용어를 만들지 않고 해당 논문들이 사용하는 용어를 그대로 쓴다. 연구 범위는 narrow fine-tuning, harmful fine-tuning, in-context emergent misalignment, subliminal learning, persistent backdoors, tamper resistance, alignment recovery와 robust unlearning이다. 단순한 사실 갱신이나 검색 성능 향상은 범위 밖이다.

### 사용 용어

| 용어 | 이 문서에서의 의미 | 대표 근거 |
|---|---|---|
| **Narrow fine-tuning** | 한정된 과업·도메인의 데이터로 수행하는 미세조정 | Emergent Misalignment, ICML 2025 |
| **Harmful fine-tuning** | 기존 safety alignment를 훼손하는 미세조정 또는 공격 설정 | Antidote·Vulnerability-Aware Alignment, ICML 2025 |
| **Emergent misalignment** | 좁은 학습 목표에서 직접 요구하지 않았는데 unrelated domain에서 나타나는 broad misalignment | ICML 2025; ACL 2026 |
| **In-context emergent misalignment** | Weight update 없이 narrow in-context examples로 발생하는 emergent misalignment | ACL 2026 |
| **Subliminal learning** | Semantically unrelated data를 통해 teacher의 trait가 student로 전달되는 현상 | arXiv 2025, preprint |
| **Persistent backdoor** | Triggered behavior가 benign continual fine-tuning 이후에도 유지되는 백도어 | arXiv 2025, preprint |
| **Tamper resistance** | Adversarial fine-tuning에도 safeguard가 유지되는 정도 | Deep Ignorance, ICLR 2026 |
| **Alignment recovery / mitigation** | Harmful fine-tuning 이후 safety alignment를 회복하는 과정 | Antidote, ICML 2025 |
| **Robust unlearning / relearning robustness** | 제거 뒤 fine-tuning으로 target behavior가 다시 나타나는지까지 포함한 견고성 | Erase or Hide?, ICLR 2026 |

핵심 연구 흐름은 `narrow/harmful fine-tuning → emergent misalignment → backdoor persistence → detection and mitigation`이다. Continual learning·unlearning·model editing은 persistence와 mitigation을 실험하기 위한 인접 방법론이다. **RAG·external memory는 대표 연구가 아니며 본 연구 범위에서 제외한다.**

## 0. 최신 대표 연구: 주요 학회 중심

### 0.1 Core evidence: ICML·ICLR·ACL 2025–2026

| 연구축 | 대표 연구 | 핵심 결과 | 이 프로젝트의 질문 |
|---|---|---|
| 좁은 학습 → 광범위한 오정렬 | [Emergent Misalignment](https://proceedings.mlr.press/v267/betley25a.html), ICML 2025 | 취약한 코드만 학습한 모델이 관련 없는 질문에서도 광범위한 오정렬 행동을 보임 | 어떤 데이터 특성이 행동 변화를 다른 문맥으로 전이시키는가? |
| 문맥만으로 행동 전이 | [Emergent Misalignment via In-Context Learning](https://aclanthology.org/2026.acl-long.1770/), ACL 2026 | 소수의 좁은 예시만으로 여러 모델에서 비목표 영역의 오정렬이 발생 | 가중치 변경 없이도 생기는 행동 전이를 어떻게 구분·차단하는가? |
| 한정적 제거 → 광범위한 오정렬 | [From Narrow Unlearning to Emergent Misalignment](https://aclanthology.org/2026.acl-short.32/), ACL 2026 | 좁은 refusal 제거가 학습하지 않은 책임 AI 영역의 오정렬로 번짐 | 삭제·교정이 다른 안전 행동을 무너뜨리는 경계를 어떻게 측정하는가? |
| 사전 예방 | [Deep Ignorance](https://proceedings.iclr.cc/paper_files/paper/2026/hash/3bf80b34f731313b8292f4578e820c90-Abstract-Conference.html), ICLR 2026 | 사전학습 데이터 필터링으로 적대적 후속 미세조정에 더 강한 모델을 구축 | 사후 정렬보다 학습 전 데이터 제거가 더 강한 방어가 되는 조건은 무엇인가? |
| 복구·제어 | [Steering Language Models with Weight Arithmetic](https://proceedings.iclr.cc/paper_files/paper/2026/hash/df59090e951681e0f98d40f131c4b628-Abstract-Conference.html), ICLR 2026 | 대조적 weight delta로 의도치 않은 광범위 일반화를 줄이는 제어를 제안 | 주입된 행동을 되돌리면서 목표 능력은 보존할 수 있는가? |
| 후속 학습 손상 지도 | [Mapping Post-Training Forgetting in Language Models at Scale](https://proceedings.iclr.cc/paper_files/paper/2026/hash/bc1c5e5fb8ed1ef9b9b5abced2022e40-Abstract-Conference.html), ICLR 2026 | post-training 뒤 어떤 샘플이 잊히는지 대규모·샘플 단위로 측정 | 주입 행동과 정상 능력의 지속·손상 곡선을 어떻게 분리하는가? |
| 안전 정렬 복구 | [Antidote](https://proceedings.mlr.press/v267/huang25b.html), ICML 2025 | harmful fine-tuning 뒤 안전 정렬을 복구하는 post-fine-tuning 방어를 제안 | 공격 후 복구가 target behavior와 일반 능력을 함께 회복하는가? |
| 취약성 기반 방어 | [Vulnerability-Aware Alignment](https://proceedings.mlr.press/v267/chen25w.html), ICML 2025 | harmful fine-tuning 과정의 불균일한 safety forgetting을 반영해 정렬을 보강 | 잘 무너지는 안전 능력을 미리 찾고 선택적으로 보호할 수 있는가? |
| 제거의 견고성 | [Erase or Hide?](https://proceedings.iclr.cc/paper_files/paper/2026/hash/d4aa3942a863aaf997053eee7b733f85-Abstract-Conference.html), ICLR 2026 | 재학습으로 되살아나는 억제와 더 견고한 제거를 구분 | 행동이 사라진 것인지 잠시 가려진 것인지 어떻게 검증하는가? |

### 0.2 Emerging evidence: 최신 preprint

아래 연구는 주제 적합성이 높지만 2026-09-04 기준 동료평가 전이다. 핵심 결론의 근거는 위 주요 학회 논문에 두고, 아래 결과는 후속 검증이 필요한 최신 신호로 사용한다.

| 연구 | 최신 관찰 | 프로젝트 활용 |
|---|---|---|
| [Subliminal Learning](https://arxiv.org/abs/2507.14805), arXiv 2025 | 의미상 무관한 숫자·코드·추론 데이터에서도 교사 모델의 성향이 학생에게 전달 | semantic filter 밖의 숨은 데이터 신호 감사 |
| [Persistent Backdoor Attacks under Continual Fine-Tuning](https://arxiv.org/abs/2512.14741), arXiv 2025 | 후속 continual fine-tuning을 견디는 백도어와 clean-task 성능 보존을 함께 보고 | 정상 업데이트별 backdoor survival curve |
| [Persona Features Control Emergent Misalignment](https://arxiv.org/abs/2506.19823), arXiv 2025 | persona feature가 emergent misalignment를 예측·조절 | 내부 feature 기반 조기 경보와 causal intervention |
| [Model Organisms for Emergent Misalignment](https://arxiv.org/abs/2506.11613), arXiv 2025 | 작은 모델과 저랭크 LoRA에서도 재현 가능한 misalignment 실험계를 구성 | 규모·모델 계열·학습법을 넘는 재현성 검증 |
| [Backdoor Decontamination Dynamics in LLM Agents](https://arxiv.org/abs/2608.11295), arXiv 2026 | 방어적 재학습과 unlearning 순서에 따른 제거·잔존·공존을 추적 | decontamination 순서와 회귀 시험 설계 |

이 연구들을 논문 용어에 맞춰 네 축으로 묶는다.

| 축 | 관측 대상 | 필수 측정 |
|---|---|---|
| **1. Narrow/Harmful Fine-tuning** | 어떤 dataset·fine-tuning dose·data framing이 target behavior를 만드는가 | target performance, update norm, dose–response |
| **2. Emergent Misalignment** | Unrelated domain에서 broad misalignment가 나타나는가 | misalignment rate, confidence interval, cross-domain evaluation |
| **3. Backdoor Persistence** | Benign continual fine-tuning·alignment·model merge 뒤에도 triggered behavior가 남는가 | attack success rate, clean accuracy, checkpoint persistence |
| **4. Detection & Mitigation** | Persona feature로 탐지하고 alignment recovery·unlearning으로 완화할 수 있는가 | AUROC, causal effect, retain utility, relearning robustness |

Retrieval augmentation과 external memory는 최신 사실 제공과 rollback에는 유용하지만 위 연구 문제를 설명하지 않는다. 이후 기존 문헌 계보에서 언급되는 경우도 범위 비교용 인접 연구로만 해석한다.

모델 유형에 따라 보존 대상과 실패의 의미도 달라진다.

| 모델 유형 | 진단·개입 대상 | 보존해야 할 항목 |
|---|---|---|
| LLM | 사실, 문서 영향, 언어·추론 능력, 응답 행동 | 비대상 지식, 언어·추론·코딩 능력 |
| VLM·MLLM | 시각 개념, 개체·관계, 이미지–텍스트 연관 | 비대상 개념, 시각 인식, 언어 능력, 교차 모달 정렬 |
| VLA·로봇 정책 | 과제·기술, 물체·환경 적응, 행동 선택 | 기존 과제 성공률, 안전 제약, 시각·언어 정렬, 다른 로봇·환경으로의 일반화 |

문제의 원인이 학습 데이터에 있는지, 가중치에 저장된 지식에 있는지, 검색·prompt·router에 있는지, 최종 출력 단계에 있는지를 먼저 확인한다. 이 진단 없이 특정 방법부터 적용하지 않는다.

## 1. Brain Washing 전체 절차

연구 절차는 논문에서 사용하는 평가 용어에 맞춰 아래 다섯 단계로 구성한다.

| 단계 | 수행할 작업 | 단계가 끝나면 남아야 하는 결과 |
|---|---|---|
| 1. Pre-intervention evaluation | Base model의 target behavior·unrelated-domain behavior·persona feature 측정 | target·held-out·retain·attack set |
| 2. Narrow/Harmful fine-tuning | Dataset·fine-tuning dose·data framing·SFT/RFT/LoRA 통제 | training recipe와 data/model lineage |
| 3. Emergent misalignment evaluation | 학습하지 않은 domain·language·format·agent rollout에서 misalignment 측정 | misalignment rate와 confidence interval |
| 4. Backdoor persistence evaluation | Benign continual fine-tuning·safety alignment·merge·quantization 뒤 잔존 추적 | checkpoint별 attack success rate와 clean accuracy |
| 5. Detection & mitigation | Persona-feature probe·safety realignment·unlearning·weight arithmetic 비교 | AUROC, retain utility, relearning robustness |

### 1.1 Audit: 무엇이 문제이고 어디를 바꿔야 하는가

Audit은 한 종류의 benchmark가 아니라 네 가지 판정을 묶은 단계다.

| Audit 항목 | 확인할 질문 | 구체적인 검사 |
|---|---|---|
| 목표 audit | 추가, 교정, 삭제, 억제, 조건부 제어 중 무엇인가? | 대상 범위, 함께 바뀔 결론, 유지할 지식과 능력 정의 |
| 행동 audit | 어떤 입력과 환경에서 문제가 재현되는가? | 직접·우회·다국어 질문, 문맥 유무, VLM 이미지 조건, VLA rollout |
| 원인·위치 audit | 데이터, 가중치, 내부 표상, 검색, prompt, router, decoding 중 어디에서 문제가 생기는가? | 데이터 attribution, 기반·지시학습 모델 비교, causal intervention, 계층별 ablation |
| 보장 audit | 출력만 제어하면 되는가, 모델 자체를 바꿔야 하는가, 훈련 영향 제거까지 필요한가? | 배포 경계, 공격자 권한, 지속성, 가역성, 재학습 참조 모델 필요 여부 |

데이터 원인을 추적할 때는 [TRAK](https://proceedings.mlr.press/v202/park23c.html) 같은 data attribution 방법을 참고할 수 있다. 가중치와 내부 계산 위치는 [ROME](https://proceedings.neurips.cc/paper_files/paper/2022/hash/6f1d43d5a82a37e89b0665b33bf3a182-Abstract-Conference.html)의 causal tracing이나 activation probe로 검사할 수 있다. 다만 [Does Localization Inform Editing?](https://proceedings.neurips.cc/paper_files/paper/2023/hash/3927bbdcf0e8d1fa8aa23c26f358a281-Abstract-Conference.html)은 causal tracing으로 찾은 위치가 가장 잘 편집되는 위치와 일치하지 않을 수 있음을 보였다. 따라서 위치 audit 결과를 곧바로 개입 위치의 정답으로 사용하지 않고, 후보 수준별 소규모 실험으로 다시 확인한다.

### 1.2 Audit 결과에 따른 개입 수준 결정

| Audit 결과 | 우선 검토할 개입 수준 | 선택 이유 | 이 수준으로 해결할 수 없는 것 |
|---|---|---|---|
| 삭제 요청 데이터의 훈련 영향을 제거해야 함 | **L0 데이터·학습** | 삭제 데이터를 제외한 재학습 결과와 직접 비교 가능 | prompt·router는 내부 훈련 영향을 제거하지 못함 |
| 넓은 도메인·능력·응답 행동을 영구적으로 바꿔야 함 | **L0 데이터·학습** 또는 **L1 모델 가중치** | 많은 입력에 걸친 변화를 모델에 내재화 | 보존 데이터가 없으면 일반 능력 손상 위험 |
| 소수의 안정적인 사실을 모델 자체에 반영해야 함 | **L1 모델 가중치** | 국소 editing이나 adapter로 작은 범위를 변경 | 자주 바뀌는 사실에는 반복 편집 비용과 충돌 누적 |
| 지식은 있으나 특정 행동·표현만 조정하면 됨 | **L2 내부 표상·activation** | 전체 재학습 없이 추론 시 행동 방향을 조정 | 지식 삭제나 훈련 영향 제거를 보장하지 못함 |
| 정보가 자주 바뀌고 출처·되돌리기가 중요함 | **L3 외부 메모리·context** | 모델을 손상하지 않고 자료와 버전을 교체 | 검색 누락과 잘못된 문서 선택이 새 실패 원인 |
| 사용자·조직·상황별로 다른 정책이 필요함 | **L4 router·prompt·decoding** | 조건부 적용, 감사, 즉시 rollback이 쉬움 | 오픈웨이트 사용자가 실행 계층을 제거하면 제어가 사라짐 |

하나의 문제에 여러 수준을 함께 사용할 수 있다. 예를 들어 오래된 사실은 L3 외부 지식으로 즉시 교정하고, 검증된 변경을 모아 L0 지속 학습으로 주기적으로 반영할 수 있다. 반대로 개인정보 삭제처럼 강한 보장이 필요하면 L4 출력 차단만으로 완료 처리할 수 없다.

### 1.3 변경 목표와 보존 조건의 형식화

원본 모델을 $M_0$, 교정 후 모델 시스템을 $M'$, 바꿀 대상을 $T$, 보존할 대상을 $R$이라 두면 목표는 다음의 다목적 최적화다.

$$\mathrm{TargetSuccess}(M', T) \uparrow$$

$$\mathrm{RetainUtility}(M', R) \approx \mathrm{Utility}(M_0, R)$$

$$\mathrm{CollateralChange}(M', N(T)) \downarrow$$

$N(T)$는 표면상 무관한 데이터뿐 아니라 대상과 의미·인과·표상 공간에서 가까운 **이웃 지식**이다. “원래 지식 보존”은 target과 모순되는 옛 답까지 보존한다는 뜻이 아니다. 먼저 다음을 명시해야 한다.

- **Target set**: 수정·추가·삭제·억제할 사실, 데이터, 능력 또는 행동
- **Entailed change set**: target 변경에 따라 함께 바뀌어야 하는 논리적·다단계 결론
- **Retain set**: 유지해야 하는 사실, 언어·추론·코딩 능력과 정책
- **Neighborhood set**: target과 가까워 과잉 교정 여부를 드러내는 사례
- **Forbidden recovery set**: jailbreak, 번역, paraphrase, 재학습으로도 복원되면 안 되는 정보

| 대상 | 예 | 요구되는 변화 |
|---|---|---|
| 잘못 저장된 사실 | 잘못된 인물·관계·수치 | 옛 답을 새 답으로 대체하고 파급 결론도 갱신 |
| 시간에 따라 변하는 사실 | 현재 직책·상태·가격 | 기준 시점과 출처 반영; 보통 외부 지식이 유리 |
| 훈련 데이터의 영향 | 개인정보, 삭제 요청 문서 | 해당 데이터 없이 훈련한 반사실적 모델에 접근 |
| 위험한 능력·절차 | 특정 공격 절차 수행 | 직접·우회·다국어 접근과 재학습 복원 차단 |
| 광범위한 행동 분포 | 도메인 스타일, 편향, 안전 정책 | 여러 문맥에서 지속적으로 행동 변경 |
| 사용자·조직별 정책 | 허용 범위, 최신 업무 규칙 | 가역적이고 감사 가능한 조건부 적용 |

### 1.4 핵심 연구 질문: 어떤 개입이 행동을 주입·전이·지속시키는가?

방법의 선택 자체가 연구 대상이다. SFT·RFT·LoRA·in-context learning·data poisoning으로 행동을 주입하고, continual update·alignment·merge·quantization으로 지속성을 시험하며, re-alignment·machine unlearning·weight steering·clean retraining으로 복구한다. 검색·외부 메모리는 가중치 비변경 대조군으로만 둔다.

핵심 질문은 다음과 같다.

1. **변경 목표**: 제거, 대체, 추가, 억제, 조건부 제어 중 무엇인가?
2. **변경 범위**: 단일 사실인가, 개념·능력·행동 분포 전체인가?
3. **지속성과 가역성**: 영구 변경인가, 자주 갱신하거나 되돌려야 하는가?
4. **요구 보장**: 평균 정확도 개선이면 충분한가, 삭제·복원 저항성까지 필요한가?
5. **배포 경계**: 가중치만 공개되는가, 배포자가 검색·라우터·권한 계층까지 통제하는가?

## 2. Audit와 연구 질문 지도

방법을 고르기 전에 아래 질문을 실험 가능한 형태로 답하는 것이 이 조사의 중심이다.

이 절에서는 **무엇을 묻고 어떻게 측정할지**만 정리한다. 논문을 함께 보고 싶을 때는 7절의 분류별 연도순 계보와 8절의 2026년 학회별 색인을 확인하면 된다.

| 분류 | 판단 목적 | 이 결과로 결정할 사항 |
|---|---|---|
| **A. Audit와 원인 위치** | 오류가 데이터, 파라미터 지식, 검색, 출력 정책 중 어디에 있는지 판단 | L0~L4 중 비교할 개입 수준 |
| **B. 교정과 보존** | L0·L1 변경이 파급 질문과 장기 순차 편집에서도 유지되는지 확인 | 편집 방법과 보존 제약의 강도 |
| **C. 의도적 망각과 검증** | 모델이 답만 못 하게 된 것인지 학습 영향이 실제로 제거된 것인지 구분 | 공격 평가와 재학습 참조 모델의 범위 |
| **D. 개입 수준과 운영** | L1 가중치, L3 외부 메모리, L4 router 중 배포 조건에 맞는 방식 비교 | 응답 지연, 되돌리기, 변경 이력과 운영 비용을 포함한 배포 방식 |
| **E. VLM·VLA·로봇** | 이미지–텍스트 정렬과 실제 행동이 변경 뒤에도 보존되는지 확인 | 이미지 평가와 로봇 실행을 포함한 검증 범위 |

### A. Audit와 원인 위치

| RQ | 주제 | 확인할 질문 | 실험·측정 방법 |
|---|---|---|---|
| **RQ1** | 오류 위치 | 오류가 파라미터 지식, 검색 실패, 지시 정렬, 디코딩 중 어디에 있는가? | 기반 모델과 지시학습 모델의 응답 비교, 외부 근거 제공 전후 비교, 시스템 지시 제거 전후 비교, 출력 확률과 내부 표상 측정 |
| **RQ2** | 지식과 표현의 분리 | 모델이 사실을 모르는가, 알지만 표현하지 않는가? | 직접 질문과 우회 질문, 바꿔 묻기, 다국어 질문, 정답 문맥 제공, 정보 추출 공격의 결과 비교 |
| **RQ3** | 변경 범위 | 하나의 사실인가, 개념·능력·행동 분포 전체인가? | 변경 대상의 수와 범위, 대상 간 의미 중복, 서로 다른 문맥에서 변경 행동의 일관성 측정 |
| **RQ4** | 지속성과 조건 | 변경이 영구적이어야 하는가, 조건부·시한부·사용자별이어야 하는가? | 시간 경과에 따른 변경 유지율, 사용자·조직별 적용 분리, 개입 제거 후 원래 상태 복원 여부 측정 |

### B. 교정과 보존

| RQ | 주제 | 확인할 질문 | 실험·측정 방법 |
|---|---|---|---|
| **RQ5** | 사실 편집과 보존 | 사실을 수정하면서 무관한 지식을 얼마나 보존할 수 있는가? | 직접 편집 성공률, 바꿔 묻기 일반화, 무관 지식과 일반 능력의 편집 전후 변화 측정 |
| **RQ6** | 파급 결론 | 편집이 논리적·다단계 파급 질문에도 전이되는가? | 편집한 사실과 함께 바뀌어야 할 결론을 정의하고 다단계·합성 질문 정확도 측정 |
| **RQ7** | 장기 안정성 | 수천 번의 순차 편집에서도 모델 붕괴를 막을 수 있는가? | 1·10·100·1,000회 편집 체크포인트별 편집 성공률, 보존 성능과 파라미터 변화량 비교 |
| **RQ8** | 편집 충돌 | 서로 모순되거나 중복된 편집은 어떻게 합성하는가? | 편집 적용 순서별 결과, 충돌 해결률, 특정 편집을 되돌린 뒤 원래 지식 복구 여부 측정 |
| **RQ9** | 광범위한 행동 변경 | LoRA·SFT가 일반 능력을 얼마나 훼손하는가? | 목표 행동의 변경 성공률과 일반 과제 보존 성능 비교, 어댑터 병합 전후 회귀 측정 |
| **RQ10** | 자연 망각·삭제 가능성·용량 포화 | 새 학습만으로 기존 지식이 실제로 잊히는가, 의도적으로 삭제할 수 있는가, 삭제 뒤 용량이 재사용되는가? | 학습 전후 평가 샘플별 지식 변화, 단서·재정렬 복원, 소규모 삭제 실험의 복원 저항, 학습률·replay 적용 여부·모델 크기별 새 지식 획득과 이전 지식 손실 비교 |
| **RQ11** | 다목적 학습 | 여러 목표가 충돌할 때 단일 보상보다 다목적 학습이 나은가? | 목표별 성능과 상충 관계, gradient 충돌, 선택 가능한 절충점 비교 |

### C. 의도적 망각과 검증

| RQ | 주제 | 확인할 질문 | 실험·측정 방법 |
|---|---|---|---|
| **RQ12** | 삭제와 억제의 구분 | 낮은 정답률은 실제 삭제인가, 출력 억제인가? | 짧은 재학습 후 복원률, 내부 표상, 답변 확신도와 정보 추출 공격 성공률 측정 |
| **RQ13** | 주변 지식 보존 | 삭제 대상만 잊고 가까운 지식은 보존할 수 있는가? | 삭제 대상과의 의미 거리별 주변 지식 성능, 과도한 망각과 지식 공백 범위 측정 |
| **RQ14** | 연관 지식을 통한 복원 | 삭제 대상을 다른 지식에서 다시 추론할 수 있는가? | 지식 그래프의 직접·약한 관계와 다단계 경로를 이용한 삭제 대상 복원률 측정 |
| **RQ15** | 재학습 복원 | 소량 또는 무관 데이터로 다시 학습하면 망각이 되돌아오는가? | 재학습 데이터의 종류와 양별 복원 속도, 삭제 대상 성능과 내부 표상의 회복 측정 |
| **RQ16** | 강한 삭제 보장 | 개인정보 삭제처럼 강한 보장이 필요할 때 재학습을 대체할 수 있는가? | 삭제 대상을 제외한 clean retraining 모델과의 차이, 학습 데이터 포함 여부 공격과 보장 범위 비교 |

### D. 개입 수준과 운영

| RQ | 주제 | 확인할 질문 | 실험·측정 방법 |
|---|---|---|---|
| **RQ17** | 가중치와 외부 시스템 선택 | 언제 모델 가중치를 바꾸고 언제 외부 메모리·router를 사용해야 하는가? | 동일한 변경 대상에서 정확성, 갱신 빈도, 응답 지연, 공격 표면과 되돌리기 비용 비교 |
| **RQ18** | 대량·지속 업데이트 | 내부 편집과 외부 메모리 중 무엇이 유리한가? | 편집 수별 성공률, 메모리 사용량과 응답 지연, 편집 충돌, 검색·분기 오류 비교 |
| **RQ19** | 언어·도메인 간 전이 | 동일 교정이 언어·도메인·모달리티를 넘어 유지되는가? | 번역 조건을 통제한 언어 간 편집 전이, 다른 도메인·모달리티의 변경 대상·보존 대상 성능 변화 측정 |

### E. VLM·VLA·로봇

| RQ | 주제 | 확인할 질문 | 실험·측정 방법 |
|---|---|---|---|
| **RQ20** | VLM 개념 제거 | 이미지–텍스트 정렬과 비대상 개념을 보존할 수 있는가? | 삭제·보존 성능, 정상 질문의 오거절, 이미지·텍스트 조건을 바꾼 복원 공격과 정렬 변화 측정 |
| **RQ21** | VLM 순차 편집 | 이전 개념과 교차 모달 추론을 어떻게 보존하는가? | 편집 횟수별 성공률, 무관 개념 변화, 이전 편집 유지율과 이미지–텍스트 정렬 측정 |
| **RQ22** | VLA 적응과 기존 과제 보존 | 새 물체·시점·로봇에 적응하면서 기존 과제 성능을 보존할 수 있는가? | 새 과제와 이전 과제의 실제 실행(rollout) 성공률, 시점·로봇 변화에 대한 일반화, 학습 파라미터 수 비교 |
| **RQ23** | VLA 적응 방식 선택 | 가중치 학습과 문맥 내 적응 중 어느 쪽이 적합한가? | 필요한 시연 수, 목표·이전 과제 성공률과 추론 비용 비교 |
| **RQ24** | 추론 시 조향과 재학습 | 두 방법은 개입 지속성과 결과에서 어떻게 다른가? | 개입 지속 시간, 실제 실행(rollout) 성공률, 안전 위반, 개입 제거 후 원래 행동 복원 여부 비교 |
| **RQ25** | 로봇 기술 제거 검증 | 특정 기술을 제거했다고 어떻게 확인할 것인가? | 직접·변형 과제의 실제 실행(rollout), 관련 기술 전이, 짧은 재학습 뒤 복원과 실제 로봇 안전 측정 |

## 3. 삭제가 목표인 경우의 별도 검증

| 수준 | 실제 의미 | 가능한 방법 | 이 평가로 확인할 수 있는 범위 |
|---|---|---|---|
| 출력 억제 | 특정 입력에서 답을 생성하지 않음 | 프롬프트, 필터, 라우터, 디코딩 제어 | 시험한 입력에서 출력이 억제됐다는 사실만 확인 |
| 행동적 비가용화 | 다양한 직접·우회 질의에서 target을 사용하지 못함 | 언러닝 손실, LoRA/SFT, 활성값 개입 | 사용한 공격·질의 집합에서의 비가용성만 확인 |
| 표상적 약화·제거 | 선택한 내부 표상 지표에서 target 연결이 감소 | 표상 기반 언러닝, 부분공간 편집 | 선택한 probe와 표상 지표의 변화만 확인 |
| 훈련 영향 제거 | target 없이 재학습한 모델의 분포와 가까움 | 인증·근사 언러닝 | 정의한 거리와 위협 모델 안에서만 확인 |
| 재학습 참조 모델 | 삭제 대상 데이터를 제외하고 처음부터 다시 학습 | 전면 재학습, 분할 학습 구조 | 언러닝 방법의 비교 기준을 제공하며 그 자체가 모든 삭제 정의를 인증하지는 않음 |

따라서 refusal rate나 forget-set accuracy만으로 “잊었다”고 결론 내리면 안 된다. [Unlearning Isn't Deletion](https://arxiv.org/abs/2505.16831)은 최소 fine-tuning으로 원래 행동이 복원될 수 있음을 보였고, [Do LLMs Really Forget?](https://proceedings.neurips.cc/paper_files/paper/2025/file/85ec26ef94c3acb4c195e905df1ff4f7-Paper-Conference.pdf)은 직접 회상이 사라져도 상관 지식으로 target을 추론할 수 있음을 보였다. 깊은 표상 손상도 retain 능력까지 무너진 catastrophic forgetting일 수 있다.

현재 검토한 연구만으로 지식 종류별 망각 난도를 보편적인 순서로 정할 수는 없다. 다만 [Do LLMs Really Forget?](https://proceedings.neurips.cc/paper_files/paper/2025/file/85ec26ef94c3acb4c195e905df1ff4f7-Paper-Conference.pdf)은 상관 지식이 삭제 대상의 복원을 가능하게 할 수 있음을 보였고, [Hidden Knowledge Holes](https://proceedings.neurips.cc/paper_files/paper/2025/hash/214eae0bfaf1c67a30db163ecb99693b-Abstract-Conference.html)은 삭제 대상 주변의 부수적 손상을 기존 평가가 놓칠 수 있음을 보였다. 따라서 범위의 식별 가능성, 다른 지식과의 관계, 복원 가능성, 이웃 지식 손상을 대상별로 측정한다.

## 4. 인접 방법론과 대조군 지도

Brain Washing의 방법은 논문이 붙인 과제명보다 **실제로 어느 구성요소를 바꾸는가**를 기준으로 분류한다.

| 수준 | 바꾸는 위치 | 포함되는 방법 | 대표 연구 | 핵심 확인 사항 |
|---|---|---|---|---|
| **L0 데이터·학습** | 학습 데이터 구성과 학습 과정 | 사전 데이터 필터링·중복 제거, clean retraining, continual pretraining, replay, SFT·DPO | [Learning without Forgetting](https://doi.org/10.1007/978-3-319-46493-0_37), [Certified Data Removal](https://proceedings.mlr.press/v119/guo20c.html), [Deduplicating Training Data](https://aclanthology.org/2022.acl-long.577/), [SLoRA](https://aclanthology.org/2026.acl-long.247/) | 목표 학습·삭제와 파국적 망각, 계산 비용 |
| **L1 모델 가중치** | 전체 또는 일부 파라미터와 adapter | LoRA, model editing, task vector 가감, weight-level unlearning | [MEND](https://openreview.net/pdf?id=0DcZxeWfOPt), [ROME](https://proceedings.neurips.cc/paper_files/paper/2022/hash/6f1d43d5a82a37e89b0665b33bf3a182-Abstract-Conference.html), [Task Arithmetic](https://arxiv.org/abs/2212.04089), [WISE](https://proceedings.neurips.cc/paper_files/paper/2024/hash/60960ad78868fce5c165295fbd895060-Abstract-Conference.html) | locality, 파급 결론, 누적 편집 안정성 |
| **L2 내부 표상·activation** | hidden state, neuron, subspace, task vector | activation steering, SAE 기반 feature 개입, representation editing·unlearning | [Inference-Time Intervention](https://proceedings.neurips.cc/paper_files/paper/2023/hash/81b8390039b7302c909cb769f8b6cd93-Abstract-Conference.html), [Refusal Direction](https://proceedings.neurips.cc/paper_files/paper/2024/hash/f545448535dfde4f9786555403ab7c49-Abstract-Conference.html), [ORE](https://aclanthology.org/2026.findings-acl.1892/) | causal effect, 표상 얽힘, 개입 제거 후 복원 |
| **L3 외부 메모리·context** | 검색 문서, 편집 메모리, in-context example | 외부 검색, SERAC, LightEdit, IKE | [SERAC](https://proceedings.mlr.press/v162/mitchell22a.html), [LightEdit](https://aclanthology.org/2026.acl-long.145/) | **운영 대조군**: 검색·분기 정확도, 출처, 지연, 메모리 증가 |
| **L4 router·prompt·출력** | 입력 분류, system prompt, decoding, output filter | policy routing, guard model 분류, prompt control, token suppression | [Llama Guard](https://arxiv.org/abs/2312.06674), [CAP](https://aclanthology.org/2026.acl-long.1882/), [CURaTE](https://aclanthology.org/2026.findings-acl.1102/), [SEGUE](https://aclanthology.org/2026.acl-long.1850/) | 우회 가능성, 조건별 오분류, 실행 계층 제거 시 실패 |

이 분류와 정확히 같은 이름으로 전 범위를 다루는 단일 논문은 확인하지 못했다. 대신 기존 조사 연구의 분류를 한 축으로 맞췄다. [Automatically Correcting Large Language Models](https://aclanthology.org/2024.tacl-1.27/)은 교정을 training-time, generation-time, post-hoc으로 나누고, [Editing the Mind of Giants](https://aclanthology.org/2024.findings-emnlp.550/)는 편집을 parameter-modifying과 parameter-preserving으로 나눈다. [Continual Learning for Large Language Models: A Survey](https://arxiv.org/abs/2402.01364)는 continual pretraining, instruction tuning, alignment를 구분하고, [Beyond Static Models](https://arxiv.org/abs/2603.12658)는 continual pre-training, continual fine-tuning, continual alignment로 정리한다. [A Survey on Unlearning in Large Language Models](https://arxiv.org/abs/2510.25117)은 언러닝을 training-time, post-training, inference-time으로 분류한다. 위 L0~L4 체계는 이 분류들을 Brain Washing의 `개입 위치` 기준으로 교차 정리한 것이다.

### 4.1 L0·L1 Continual Learning

LLM continual learning은 학습이 일어나는 단계를 기준으로 세 하위 과제로 나눈다. 세 단계 모두 gradient 학습, replay, 정규화, adapter를 사용할 수 있지만 **학습 데이터, 최적화 목적, 바뀌는 능력과 평가 기준**이 다르다.

#### 4.1.1 Continual pre-training

- **학습 데이터와 목적**: 새로운 시점·도메인·언어의 원문 또는 instruction이 결합된 대규모 corpus를 pre-training objective로 계속 학습한다.
- **주로 바뀌는 것**: 배경지식, 어휘와 언어 표현, 도메인 표상, 기반 생성 능력
- **보존 방법**: 이전 corpus replay, 새·이전 데이터 mixture 조절, 중요 파라미터 정규화, 단계별 checkpoint 비교
- **평가**: 새·이전 corpus perplexity, 시간·도메인별 지식 평가, 일반 언어·추론 능력과 파국적 망각
- **주요 위험**: 계산 비용이 크고, 데이터 분포가 달라지면 모델 전반의 지식과 능력이 넓게 변할 수 있다.

Pre-training 방법만 비교하는 실험도 가능하다. 같은 초기 모델과 continual corpus에서 pre-training 방법만 바꾸고, 이후 post-training과 alignment는 동일한 recipe로 고정한다.

| 비교 단계 | 변경하거나 고정할 항목 | 평가 목적 |
|---|---|---|
| 초기 모델 | architecture, tokenizer, 시작 checkpoint 고정 | 모든 방법의 출발점 통일 |
| Continual pre-training | full update, replay·data mixture, regularization, LoRA·adapter 방식만 변경 | 새 지식 학습, 이전 지식 망각, 계산 효율 비교 |
| Post-training | instruction 데이터, step, optimizer, learning rate와 random seed 정책 고정 | pre-training 차이가 동일한 지시학습 뒤에도 유지되는지 확인 |
| Alignment | preference·safety 데이터, 알고리즘과 학습량 고정 | pre-training 차이가 최종 안전·유용성에 미치는 영향 확인 |
| Checkpoint 평가 | pre 직후, post 직후, alignment 직후 모두 저장 | 어느 단계에서 성능 차이와 망각이 발생했는지 분리 |

공정한 비교를 위해 동일 token budget 또는 동일 FLOPs budget 중 하나를 먼저 정해야 한다. 방법마다 최적 학습량이 다르므로, 주 비교는 고정 예산에서 수행하고 별도로 각 방법의 최적 설정 결과를 보고한다.

##### Pre-training 변경 후 post-training·alignment 재실행 원칙

Pre-training으로 base checkpoint가 바뀌면 post-training과 alignment도 **새 base에서 다시 실행**한다. `같은 recipe를 적용한다`는 말은 기존 post-trained 가중치를 이어 붙인다는 뜻이 아니라, 동일하게 정의한 학습 절차를 새 checkpoint에서 재현한다는 뜻이다.

| 항목 | 통제 실험에서의 처리 | 이유 |
|---|---|---|
| 시작 checkpoint | 각 pre-training 방법이 만든 새 base checkpoint 사용 | 비교하려는 pre-training 효과를 후속 단계까지 추적 |
| Post-training recipe | instruction 데이터 버전·순서 정책·샘플링 비율, chat template, optimizer 종류, learning rate, step, batch·token budget, seed 정책 고정 | 후속 SFT 차이가 pre-training 비교를 가리지 않게 함 |
| Alignment recipe | preference·safety 데이터 버전, DPO·RL 알고리즘, reference policy 규칙, rollout·judge 예산과 seed 정책 고정 | 최종 안전·유용성 차이를 pre-training 영향과 연결 |
| Optimizer state | 각 단계에서 새로 초기화 | 이전 base에서 누적된 optimizer state가 실험 조건에 섞이지 않게 함 |
| 기존 post checkpoint | 재사용하지 않음 | 이전 base에 맞춰 학습된 전체 가중치를 새 base에 덮어쓰면 pre-training 변경을 보존·분리할 수 없음 |
| 기존 LoRA·adapter | 기본 비교에서는 재학습 | 동일 shape이라 로드돼도 이전 base의 activation·weight geometry에 맞춘 update이므로 결합 성능이 보장되지 않음 |
| 기존 LoRA 이전 | 별도 ablation으로만 평가 | 재학습 비용 절감 가능성은 볼 수 있지만 `pre만 변경한 통제 실험`과 결과를 분리해야 함 |

실행 순서는 다음과 같다.

1. 기존 방법과 새 방법이 만든 `pre 직후` checkpoint를 각각 평가한다.
2. 두 checkpoint에서 동일한 post-training recipe를 **각각 새로 실행**하고 `post 직후`를 평가한다.
3. 두 post-trained checkpoint에서 동일한 alignment recipe를 **각각 새로 실행**하고 `alignment 직후`를 평가한다.
4. 각 단계의 target·retain 성능, 계산량과 회귀를 같은 표에 기록한다.

연구용 1차 비교에서는 recipe를 고정한다. 실제 배포용 모델은 동일 recipe 결과가 instruction following, tool use, 안전성 또는 오거절 기준을 통과하지 못할 때 post-training·alignment 설정을 다시 조정할 수 있다. 이때 `고정 recipe 결과`와 `모델별 tuning 결과`를 별도 표로 보고해야 pre-training 방법의 순수 효과와 최종 최적 성능을 혼동하지 않는다.

Architecture나 tokenizer를 바꾸면 동일 recipe를 사용해도 입력 표현, token 수와 학습 난도가 달라진다. 이 경우에는 pre-training 방법만 바꾼 통제 실험이 아니므로 별도 실험군으로 분류한다.

#### 4.1.2 Continual post-training·instruction tuning

- **학습 데이터와 목적**: base pre-training 뒤 새로운 과제의 instruction–response, 도메인 질의응답, tool-use trajectory를 SFT 등 post-training objective로 순서대로 학습한다.
- **주로 바뀌는 것**: 지시 수행, 과제 해결 방식, 출력 형식, 도메인별 응답 행동
- **보존 방법**: 이전 instruction replay, 출력 distillation, LoRA·adapter 분리, 보존 데이터 KL 제약
- **평가**: 새·이전 과제 성공률, instruction following, 형식 준수, 일반화, adapter 병합 전후 성능
- **주요 위험**: 기반 지식이 남아 있어도 이전 지시를 따르는 능력이나 일반 응답 품질이 손상될 수 있다.

`Instruction`이라는 데이터 형식만으로 pre-training과 post-training을 구분할 수는 없다. [Instruction Pre-Training](https://aclanthology.org/2024.emnlp-main.148/)은 대규모 원문을 합성 instruction–response pair로 보강해 처음부터의 pre-training과 continual pre-training에 사용했다. 반면 일반적인 instruction tuning은 이미 pre-trained된 base model을 instruction 과제로 미세조정하는 post-training 단계다. 따라서 다음 네 항목을 함께 기록한다.

| 구분 | Instruction pre-training | Post-training instruction tuning |
|---|---|---|
| 파이프라인 위치 | base 또는 continual pre-training 단계 | base pre-training이 끝난 뒤 |
| 데이터 구성 | 대규모 원문과 그 내용에서 만든 instruction–response pair | 선별된 instruction–response, 과제, tool trajectory |
| 학습 목적 | 넓은 지식·표상과 multitask 능력 형성 | 지시 수행, 과제 행동과 출력 방식 조정 |
| 후속 처리 | 별도의 instruction tuning·alignment를 추가할 수 있음 | 필요하면 preference·safety alignment로 이어짐 |

같은 instruction–response pair가 들어 있어도 어느 checkpoint에서 어떤 objective와 규모로 학습했는지가 다르면 서로 다른 단계다. 데이터 열에 `instruction`이 있다는 이유만으로 post-training으로 분류하지 않는다.

#### 4.1.3 Continual alignment

- **학습 데이터와 목적**: 시간·조직·문화에 따라 바뀌는 선호, 안전 규칙, 거절 정책과 human·AI feedback을 계속 반영한다.
- **주로 바뀌는 것**: 선호 순위, 안전 행동, refusal 경계, 정책 준수와 응답 태도
- **보존 방법**: reference model KL, 이전 preference replay, 다목적 최적화, 안전·유용성 동시 평가
- **평가**: 선호 승률, 정책 준수, 유용성, 정상 질문의 오거절, jailbreak 강건성, 기존 정렬 목표의 회귀
- **주요 위험**: 새 정렬 목표가 기존 안전·유용성 목표와 충돌하거나 데이터의 상관 편향을 증폭할 수 있다.

Alignment는 실제 학습 파이프라인에서는 post-training에 포함되는 경우가 많다. 다만 [2024 LLM continual learning survey](https://arxiv.org/abs/2402.01364)는 continual pretraining, instruction tuning, alignment를 구분하고, [2026 training-stage survey](https://arxiv.org/abs/2603.12658)는 continual pre-training, continual fine-tuning, continual alignment로 정리한다. 이 문서도 연구 목적과 평가 차이를 보존하기 위해 alignment를 별도 하위 분류로 둔다.

| 단계 | 일반적인 상대 비용 | 비용을 결정하는 요인 |
|---|---|---|
| Continual pre-training | 가장 큰 경우가 많음 | 대규모 원문 token, 전체 가중치 갱신, 긴 학습 시간 |
| Continual post-training | 보통 pre-training보다 작음 | 비교적 작은 instruction 데이터, LoRA·adapter 사용 가능 |
| Continual alignment | 설정에 따라 크게 달라짐 | DPO는 비교적 단순하지만 RLHF·RLAIF의 rollout, reward model, judge 비용은 커질 수 있음 |

따라서 `pre-training이 항상 가장 비싸다`고 고정하지 않고 실제 token 수, 학습 FLOPs, GPU 시간과 rollout·judge 비용을 함께 기록한다.

#### 4.1.4 소형·고정 용량 모델의 capacity audit와 선택적 망각

소형 모델은 지식 하나를 지우면 빈 슬롯 하나가 생기는 저장 구조가 아니다. 특정 사실의 출력을 낮춘 언러닝 결과도 그 파라미터가 새 지식에 재사용 가능한 용량으로 바뀌었다는 증거가 아니다. 따라서 **무엇을 지울지 정하기 전에 실제로 지워지는지부터 확인한다.**

| 순서 | 먼저 확인할 질문 | 실험과 판정 |
|---|---|---|
| 0. 보유 지식 기준선 | 모델이 삭제 후보를 실제로 알고 있는가? | 직접 질문, paraphrase, 다국어, log-prob와 문맥 단서 조건을 측정한다. 기준선에서 모르는 지식은 삭제 후보에서 제외한다. |
| 1. 자연 망각 검사 | 새 지식만 학습해도 기존 지식이 잊히는가? | 언러닝 없이 새 데이터만 학습하고 sample별 `1→0` 망각과 `0→1` 학습을 기록한다. [Mapping Post-Training Forgetting](https://proceedings.iclr.cc/paper_files/paper/2026/hash/bc1c5e5fb8ed1ef9b9b5abced2022e40-Abstract-Conference.html)의 측정 방식을 사용할 수 있다. |
| 2. 접근 실패 분리 | 점수 하락이 실제 지식 손실인가, task alignment·접근 경로 손상인가? | few-shot, 원래 instruction 형식, 문맥 단서와 짧은 재정렬로 성능이 돌아오는지 본다. [Spurious Forgetting](https://proceedings.iclr.cc/paper_files/paper/2025/hash/a774503daed55eb53c634847ae071ec7-Abstract-Conference.html)은 성능 하락이 실제 지식 손실이 아닌 task alignment 손상일 수 있음을 보였다. |
| 3. 삭제 전 위험·대상 Audit | 어떤 데이터·지식을 지워야 하며 주변 손상은 예상되는가? | [PreUnlearn](https://arxiv.org/abs/2606.18473)으로 forget set과 retain set의 관계에서 부수 손상 위험을 예측하고, [What to Forget in Unlearning?](https://arxiv.org/abs/2608.14855)처럼 삭제 요청을 실제 forget set으로 변환하는 방법을 비교한다. |
| 4. 소규모 삭제 pilot | 선택한 지식이 실제로 지워지는가? | 일부 후보에만 언러닝을 적용한 뒤 직접·우회 질문, 상관 지식, 소량 재학습과 activation probe로 복원 여부를 확인한다. 복원되면 용량 확보 단계로 넘어가지 않는다. |
| 5. 용량 재사용 검사 | 확인된 삭제가 새 지식 학습 공간을 실제로 늘렸는가? | 삭제 모델과 비삭제 대조군에 동일한 새 지식·token·FLOPs를 적용해 새 지식 획득, 이전 지식 손실, 파라미터 재사용량을 비교한다. 이 결과가 있어야 `삭제로 용량 확보`라고 말할 수 있다. |

[PreUnlearn](https://arxiv.org/abs/2606.18473)은 언러닝 전에 **부수 손상 위험**을 예측하지만 target이 반드시 삭제된다고 예측하는 연구는 아니다. [What to Forget in Unlearning?](https://arxiv.org/abs/2608.14855)은 노래·책의 verbatim output suppression이라는 제한된 범위에서 forget set 선택 문제를 다룬다. [Learnability–Forgettability Divergence](https://ojs.aaai.org/index.php/AAAI/article/view/39657)는 데이터별 학습 용이성과 삭제 용이성이 일치하지 않음을 측정했지만 CIFAR-10·MNIST·IMDB 중심이므로 LLM 규모에서 별도 검증해야 한다.

삭제 pilot을 통과한 뒤에만 **최적화 간섭**과 **실제 용량 포화**를 다음과 같이 분리한다.

1. 같은 데이터에서 학습률을 낮추거나 replay를 추가했을 때 이전 지식 손실이 줄어드는지 확인한다.
2. 작은 모델과 더 큰 모델에 같은 순서·token budget을 적용해 크기에 따라 새 지식 획득과 망각이 어떻게 달라지는지 비교한다.
3. 새 지식이 기존 지식과 모순되는지, 서로 도움을 주는지, 관계없이 파라미터만 경쟁하는지 나눈다.
4. 사실 암기 자체가 병목이면 가중치에 모두 넣지 않고 외부 메모리로 옮기는 대조군을 둔다.

[Forgetting in Language Models](https://arxiv.org/abs/2605.26097)은 2026년 preprint의 통제 실험에서 여유 용량이 있을 때 self-generated replay가 망각을 크게 줄였지만, 포화에 가까운 모델은 새 정보를 학습하면서 기존 정보를 덮어썼다고 보고했다. 이 결과는 `소형 모델이면 반드시 지식을 삭제해야 한다`는 뜻이 아니라, replay로 해결되는 최적화 문제와 모델 크기에 따른 capacity 문제를 따로 측정해야 한다는 근거다.

| 기존 지식·자원 유형 | 처리 원칙 | 이유와 검증 |
|---|---|---|
| 현재 상태와 직접 충돌하는 오래된 사실 | 현재 답은 대체하되 역사적 사실은 시점 정보와 함께 L3 외부 메모리에 보존 | 새·옛 시점 질문을 분리해 대체 성공과 역사 보존을 모두 평가 |
| 사용 빈도가 낮고 자주 바뀌는 세부 사실 | 파라미터에서 선택적으로 지우기보다 L3 검색·외부 메모리로 이전 | 출처·갱신·rollback이 쉽고 제한된 파라미터를 일반화 능력에 사용할 수 있음 |
| 성능 기여가 낮은 중복 파라미터 | pruning·masking으로 식별한 뒤 새 과제에 재할당 | [PackNet](https://openaccess.thecvf.com/content_cvpr_2018/html/Mallya_PackNet_Adding_Multiple_CVPR_2018_paper.html)은 이 원리를 vision network에서 검증했다. LLM 지식 삭제의 직접 근거는 아니므로 LLM에서 별도 재현 필요 |
| 사용하지 않는 task adapter·expert | 모듈을 분리 보관하거나 routing에서 제외한 뒤 재사용 | base model의 공유 지식을 훼손하지 않고 모듈별 사용량과 이전 과제 회귀를 측정 가능 |
| 개인정보·유해 절차 등 정책상 없어야 하는 지식 | 명시적인 unlearning 대상에 포함 | 용량 확보가 아니라 삭제 요구가 이유이며 복원 공격과 retraining 기준으로 검증 |
| 문법·언어 표현·추론·여러 과제에 전이되는 핵심 지식 | 삭제하지 않고 replay·distillation·보존 제약 적용 | 여러 과제가 공유하므로 제거할 때 새 지식 학습보다 전체 능력 손상이 커질 수 있음 |

삭제 후보는 위 Audit에서 실제 보유와 삭제 가능성이 확인된 대상 중 `오래됨`, `새 지식과 직접 충돌`, `미래 사용 가치가 낮음`, `외부에서 복구 가능`, `다른 능력으로의 전이가 낮음`을 근거로 정한다. 의미 단위 삭제가 불가능하거나 근거가 약하면 지식을 억지로 지우지 않고 [MoNIM](https://aclanthology.org/2025.acl-long.1385/) 같은 학습 가능한 외부 메모리, adapter 분리 또는 추가 용량을 비교한다.

#### 4.1.5 단계 전반에서 비교할 학습 방법

재학습은 금지할 방법이 아니라 **변화 범위가 넓고 반복 적용되어야 할 때의 정식 후보**다.

| 구현 방식 | 적합한 변화 | 보존 장치 | 주요 위험 |
|---|---|---|---|
| continued pretraining | 많은 새 지식·도메인 언어 내재화 | 원 데이터 replay, data mixture, checkpoint 비교 | 비용과 catastrophic forgetting |
| SFT/DPO | 광범위하고 안정적인 응답 분포·instruction behavior | 균형 잡힌 target/retain data, KL·multi-objective loss | shortcut, 편향 증폭, 무관 능력 회귀 |
| LoRA/adapter | pre-training 또는 post-training의 파라미터 효율적 갱신 | 모듈 분리, retain KL, replay, subspace constraint | 저랭크 간섭, adapter merge 붕괴 |
| clean full retraining | 강한 데이터 삭제 보장이 필요하고 계산 가능 | target 제외 데이터와 재현 가능한 pipeline | 최고 비용, 새 모델의 성능 변동 |
| 사전 데이터 필터링·중복 제거 | 다음 학습 라운드 전에 오염·중복·정책 위반 데이터 차단 | 필터 기준 문서화, 제거 목록 보존, 필터 전후 분포 비교 | 과잉 필터에 의한 분포 왜곡, 이미 학습된 모델에는 소급 효과 없음 |

[Deduplicating Training Data Makes Language Models Better](https://aclanthology.org/2022.acl-long.577/)는 학습 전 중복 제거가 암기된 원문 출력을 줄임을 보였다. 학습 전 데이터 구성도 L0 개입이며, 이미 학습된 모델의 지식은 바꾸지 못하므로 삭제 문제에는 재학습 또는 다른 수준과 결합해야 한다. [SLoRA](https://aclanthology.org/2026.acl-long.247/)는 연속 LoRA update에서 noise accumulation이 forgetting을 유발함을 분석한다. [RACO](https://arxiv.org/abs/2602.02495)는 alignment 목표 간 gradient 충돌을 다루며, [Alignment Tampering](https://arxiv.org/abs/2605.27355)은 preference optimization이 품질과 상관된 기존 편향을 증폭할 수 있음을 통제된 설정에서 보인다.

#### 4.1.6 비의도적 망각: 유형, 완화, 측정

의도적 망각(3장, 4.3의 unlearning)과 달리 비의도적 망각은 목표하지 않은 능력 손실이며, 학습뿐 아니라 모든 개입 수준에서 부작용으로 나타난다. L0·L1 학습의 파국적 망각, L1 누적 편집의 retain 저하(4.2.2), L2 feature 억제의 비대상 손상(4.4), 언러닝의 부수 손상(4.3)은 같은 현상을 다른 개입에서 관찰한 것이므로 같은 측정 기준을 적용한다.

점수 하락을 곧바로 지식 손실로 판정하지 않고 세 유형으로 분해한다.

| 유형 | 원인 | 판별 방법 |
|---|---|---|
| 실제 지식 손실 | 새 학습이 기존 지식 파라미터를 덮어씀. capacity 포화에서 심해짐(4.1.4) | 단서·재정렬·few-shot으로 복원되지 않고, probe에서도 표상이 사라짐 |
| 접근 실패·spurious forgetting | task alignment 손상으로 지식은 남아 있으나 꺼내지 못함 | [Spurious Forgetting](https://proceedings.iclr.cc/paper_files/paper/2025/hash/a774503daed55eb53c634847ae071ec7-Abstract-Conference.html)의 설정처럼 소량 재정렬·원래 형식 복원으로 점수가 돌아옴 |
| 형식·정렬 회귀 | 출력 형식, instruction following, 거절 경계의 변화 | 지식 평가와 분리한 형식 준수·오거절·안전 평가에서만 하락 |

[Dissecting Learning and Forgetting in Language Model Finetuning](https://proceedings.iclr.cc/paper_files/paper/2024/hash/c4de749a4bd8802f0b4033d09a7867db-Abstract-Conference.html)은 미세조정 변화를 topic·style·factual knowledge로 분해해 사실 지식이 가장 느리게 학습되고 쉽게 손상됨을 보였고, [An Empirical Study of Catastrophic Forgetting in LLMs](https://arxiv.org/abs/2308.08747)는 1b–7b 모델의 continual instruction tuning에서 망각을 관측했다. [InstructGPT](https://arxiv.org/abs/2203.02155)는 alignment 학습이 일반 능력을 낮추는 alignment tax를 보고하고 pre-training 데이터 혼합(PPO-ptx)으로 완화했다.

완화 방법은 세 계열로 나뉜다. [A Continual Learning Survey](https://arxiv.org/abs/1909.08383)의 분류를 따른다.

| 계열 | 원리 | 대표 방법 | 한계 |
|---|---|---|---|
| 정규화 | 이전 과제에 중요한 파라미터의 변화를 벌점화 | [EWC](https://doi.org/10.1073/pnas.1611835114), 중요도 가중 정규화, retain KL | 중요도 추정 오차, 과제 수 증가 시 제약 누적 |
| 리허설·replay | 이전 데이터 또는 생성 데이터를 새 학습에 혼합 | [GEM](https://proceedings.neurips.cc/paper_files/paper/2017/hash/f87522788a2be2d171666752f97ddebb-Abstract.html), 원문 replay, self-generated replay([Forgetting in Language Models](https://arxiv.org/abs/2605.26097)) | 이전 데이터 보관 비용·권리 문제, capacity 포화에서는 효과 제한 |
| 구조 분리 | 과제별 파라미터를 격리해 간섭 차단 | [PackNet](https://openaccess.thecvf.com/content_cvpr_2018/html/Mallya_PackNet_Adding_Multiple_CVPR_2018_paper.html), LoRA·adapter·expert 분리, 외부 메모리([MoNIM](https://aclanthology.org/2025.acl-long.1385/)) | 모듈 수 증가, routing 오류, 병합 시 간섭 재발 |

측정은 평균 정확도가 아니라 sample 단위로 한다. [Mapping Post-Training Forgetting](https://proceedings.iclr.cc/paper_files/paper/2026/hash/bc1c5e5fb8ed1ef9b9b5abced2022e40-Abstract-Conference.html)의 `1→0` 망각·`0→1` backward transfer 계수, [GEM](https://proceedings.neurips.cc/paper_files/paper/2017/hash/f87522788a2be2d171666752f97ddebb-Abstract.html)의 backward transfer 정의, 4.1.4의 접근 실패 분리 검사를 함께 사용하고, 어떤 개입 수준을 선택했든 6장 평가 프로토콜의 같은 행으로 기록한다.

### 4.2 L1 모델 가중치: 직접 knowledge editing

Knowledge editing은 특정 파라미터를 국소 갱신하거나 별도 편집 메모리를 결합해 사실과 그에 따른 응답을 교정한다. **학습 파이프라인 단계가 달라졌다는 이유만으로 편집기를 반드시 교체하는 것은 아니다.** 같은 사실 교정이라면 호환성이 검증된 ROME·MEMIT·MEND 계열을 base 또는 post-trained checkpoint에 적용할 수 있다. 다만 바꾸려는 대상이 사실 자체인지, instruction 행동인지, alignment 정책인지에 따라 적절한 방법군과 평가가 달라진다.

#### 4.2.1 어느 단계의 무엇을 바꾸는가

| 편집 대상과 시점 | 우선 비교할 방법 | 이 방법을 선택하는 이유 | 반드시 확인할 결과 |
|---|---|---|---|
| **Base·pre-trained checkpoint의 사실 지식** | ROME·MEMIT 같은 locate-and-edit, MEND·KnowledgeEditor 같은 update 생성, 편집용 LoRA fine-tuning·continued pre-training | 지시 형식보다 모델에 내재된 사실·도메인 표상을 직접 바꾸려는 문제 | 직접·바꿔 묻기 성공, 연쇄 결론, 이웃 지식과 일반 능력 보존, 후속 단계 뒤 편집 유지 |
| **Post-trained checkpoint의 사실 지식** | 호환성을 확인한 국소 편집과 LoRA를 같은 target·retain 조건에서 비교 | 이미 형성된 instruction following과 tool behavior를 최대한 유지하면서 사실을 교정 | 사실 편집 성능뿐 아니라 instruction following, 출력 형식, tool use의 회귀 |
| **Instruction·과제·tool-use 행동** | SFT, task LoRA·adapter, replay·distillation | 문제의 대상이 사실 한 개가 아니라 입력에 반응하는 행동 분포이므로 국소 사실 편집만으로는 부족할 수 있음 | 새·이전 과제 성공률, 형식 준수, tool call 정확도, 일반 응답 품질 |
| **Alignment 이후의 선호·안전·거절 정책** | DPO·RL 계열 alignment, alignment LoRA, 필요한 경우 L2 activation 또는 L4 router 대조군 | 목표가 사실 진위가 아니라 선호 순위와 정책 경계인 경우 | 유용성, 안전성, 정상 질문 오거절, jailbreak, 기존 정책 회귀 |
| **배포 중 자주 바뀌는 사실·조직별 정책** | RAG·외부 편집 메모리와 router를 우선 비교 | 갱신 이력, 출처, 즉시 반영과 rollback이 가중치 내재화보다 중요 | 검색·분기 정확도, 출처, 지연, tenant 분리, 실행 계층 제거 시 동작 |

SFT·DPO·RAG·router는 좁은 의미의 `파라미터 knowledge editing 알고리즘`은 아니다. 위 표는 모든 방법을 knowledge editing으로 부르는 분류가 아니라, **audit에서 발견한 변경 대상을 실제로 처리할 수 있는 개입 방법을 고르는 표**다.

편집 시점은 후속 학습 여부를 결정한다.

- **Base에서 편집한 경우**: 편집된 base에서 post-training과 alignment를 각각 다시 실행하고, 최종 aligned checkpoint에서 편집이 유지되는지 확인한다. 기존 post-trained checkpoint를 재사용하면 base 편집이 반영된 후속 모델이 되지 않는다.
- **Post-training 뒤 사실을 편집한 경우**: 남아 있는 alignment 단계가 있으면 동일 recipe로 다시 실행하고 편집 유지와 안전 회귀를 확인한다.
- **최종 aligned checkpoint를 편집한 경우**: 후속 학습을 다시 실행할 필요는 없지만 instruction following, 안전 정책과 오거절이 변하지 않았는지 평가한다. 이후 추가 학습이 예정돼 있으면 편집이 덮어써질 수 있으므로 그 학습 뒤 다시 검증한다.

따라서 `base에서 먼저 편집 후 전체 파이프라인 재실행`과 `최종 모델에 직접 편집`은 서로 다른 실험군이다. 전자는 후속 학습을 거친 편집의 지속성을 검증하고, 후자는 비용과 즉시성을 줄이는 대신 최종 checkpoint에서 locality와 alignment 회귀를 직접 부담한다.

#### 4.2.2 편집 규모와 누적 방식

| 편집 규모 | 우선 비교할 방법군 | 추가로 측정할 실패 |
|---|---|---|
| **단일·소수 사실** | ROME, MEND, KnowledgeEditor, 소규모 LoRA | paraphrase·연쇄 결론 미전파, 이웃 사실 손상 |
| **배치 편집** | MEMIT, SUIT, ORE와 batch fine-tuning 대조군 | 편집끼리 공유하는 표현의 간섭, batch 크기에 따른 locality 저하 |
| **순차 편집** | StableEdit, WISE와 순차 LoRA·MEMIT 대조군 | 이전 편집 재망각, 편집 순서 민감도, update norm 누적 |
| **평생·대규모 편집** | WISE, MEMOIR, LightEdit 같은 분리 메모리·모듈과 내부 편집의 조합 | 메모리 증가, 검색·routing 오류, 수천 회 편집 뒤 retain 성능과 지연 |
| **VLM의 교차 모달 편집** | DSCA, low-rank expert·MoE 계열과 텍스트 전용 편집 대조군 | 이미지에서만 또는 텍스트에서만 편집되는 불일치, cross-modal recovery |

편집 전에는 target fact뿐 아니라 함께 바뀌어야 할 `entailed change`, 유지할 `retain`, 의미적으로 가까운 `neighborhood`를 정한다. 편집 후에는 직접 질문 하나의 정답률이 아니라 paraphrase, 다단계 파급, locality, 일반 능력과 단계별 지속성을 같은 checkpoint에서 측정한다.

- **적합**: 안정적인 소수·중간 규모 사실을 낮은 추론 지연으로 내재화할 때
- **주요 위험**: locality 실패, 연쇄 결론 미갱신, 순차 편집 누적 붕괴, 후속 학습에 의한 편집 소실
- **기반·대표 방법**: hypernetwork 기반 [KnowledgeEditor](https://aclanthology.org/2021.emnlp-main.522/)·[MEND](https://openreview.net/pdf?id=0DcZxeWfOPt), locate-and-edit 기반 [ROME](https://proceedings.neurips.cc/paper_files/paper/2022/hash/6f1d43d5a82a37e89b0665b33bf3a182-Abstract-Conference.html)·[MEMIT](https://openreview.net/pdf?id=MkbcAHIYgyS). 가중치를 바꾸지 않는 [SERAC](https://proceedings.mlr.press/v162/mitchell22a.html)은 L3(4.5)로 분류하고 여기서는 비교 대조군으로 둔다
- **Task vector 가감**: [Task Arithmetic](https://arxiv.org/abs/2212.04089)은 미세조정 전후 가중치 차이를 task vector로 정의하고 덧셈·뺄셈으로 능력을 추가·억제한다. 4.7의 [VLA Task-Vector Negation Audit](https://arxiv.org/abs/2608.04692)가 이 방법을 로봇 기술 억제에 적용한 사례이며, negation 결과는 masking에 가깝다는 감사 결과가 있으므로 삭제 증거로 사용하지 않는다
- **최신 방향**: 보존 부분공간 제약([CrispEdit](https://arxiv.org/abs/2602.15823), [SUIT](https://openreview.net/pdf?id=qz3BkyyHWJ); 같은 원리를 가중치가 아닌 hidden 표상 공간에 적용하는 [ORE](https://aclanthology.org/2026.findings-acl.1892/)는 L2로 분류하며 4.4에서 다룬다), 장기 안정성([StableEdit](https://arxiv.org/abs/2605.11836)), 충돌·합성([Labyrinth and Thread](https://arxiv.org/abs/2605.26670), [A³E](https://neurips.cc/virtual/2025/poster/118255))

CrispEdit이 보고한 평균 1% 미만 capability degradation은 해당 모델·benchmark·측정에 한정된 결과이지 모든 일반 지식 보존의 보장은 아니다.

### 4.3 L0·L1·L2 의도적 삭제: Machine unlearning

**특정 훈련 데이터, 지식 묶음, 개념 또는 능력의 영향을 제거하면서 비대상 지식을 보존하는 것**이 목표일 때 가장 직접적인 방법이다. 이 조건에서는 knowledge editing·LoRA/SFT·하네스·clean retraining을 비교군 또는 보완책으로 둔다. 제거가 아닌 대체·추가·조건부 제어 문제에는 각 목적에 맞는 방법을 독립적으로 비교한다.

[Machine Unlearning](https://doi.org/10.1109/SP.2015.35)이 삭제 문제를 명시한 뒤 [Making AI Forget You](https://proceedings.neurips.cc/paper_files/paper/2019/hash/cb79f8fa58b91d3af6c9c991f63962d3-Abstract.html), [Certified Data Removal](https://proceedings.mlr.press/v119/guo20c.html), [Descent-to-Delete](https://proceedings.mlr.press/v132/neel21a.html)가 삭제 효율과 재학습 결과에 대한 보장 범위를 구체화했다. LLM에서는 [TOFU](https://arxiv.org/abs/2401.06121)·[WMDP](https://proceedings.mlr.press/v235/li24bc.html) 같은 benchmark 이후 출력 억제, 비대상 능력 보존, 재학습·추출 공격을 함께 평가하는 방향으로 확장됐다.

- gradient ascent/NPO류: forget loss를 악화시키되 retain regularization 결합
- representation-guided: target 표상을 약화하고 retain subspace 보호. 예: [ReGLU](https://aclanthology.org/2026.findings-acl.717/)
- 계층적·제약 최적화: 삭제 목적과 보존 목적을 서로 다른 수준 또는 제약으로 구성
- certified/approximate removal: retrain oracle와 거리 또는 privacy 공격으로 보장. 예: [ALU](https://arxiv.org/abs/2605.11170)

Unlearning은 제거 목적에 적절하지만 사실 **대체**의 전 과정을 단독으로 해결하지는 않는다. 오래된 답을 잊게 해도 새 답을 알게 되는 것은 아니므로 replacement target에는 editing이나 재학습을 결합해야 한다. 또한 생성 붕괴가 낮은 forget accuracy로 오인될 수 있으므로 retain utility와 복원 공격을 반드시 함께 측정한다.

2026년 preprint인 [LACUNA](https://arxiv.org/abs/2607.02513)는 출력이 아니라 실제 지식 주입 파라미터를 맞혔는지 검사하고, [RepSelect](https://arxiv.org/abs/2606.17168)는 fine-tuning·few-shot 복원 공격에 강한 표상 선택을 목표로 한다. 두 결과는 동료평가 전이므로 기존 게재 논문과 상태를 구분해 해석한다.

### 4.4 L2 내부 표상·activation 개입

특정 내부 방향이나 neuron을 찾아 억제·교정한다. 지식은 존재하지만 특정 policy가 표현을 막는다는 진단이 확인된 경우에 강하다. [Inference-Time Intervention](https://proceedings.neurips.cc/paper_files/paper/2023/hash/81b8390039b7302c909cb769f8b6cd93-Abstract-Conference.html)과 [Contrastive Activation Addition](https://aclanthology.org/2024.acl-long.828/)은 추론 시 활성값 조향의 기반을 만들었다. 이후 [Refusal Direction](https://proceedings.neurips.cc/paper_files/paper/2024/hash/f545448535dfde4f9786555403ab7c49-Abstract-Conference.html)은 refusal 방향을, [GRADIEND](https://openreview.net/forum?id=1vBNAnAgCD)는 사회적 bias feature를, [Harmfulness and Refusal](https://proceedings.neurips.cc/paper_files/paper/2025/hash/cd18539787d90e1d682d557c2c71b534-Abstract-Conference.html)는 harmfulness와 refusal 방향의 분리를 연구했다.

방향 벡터 대신 feature 단위로 개입하는 축도 있다. [Sparse Autoencoders Find Highly Interpretable Features](https://arxiv.org/abs/2309.08600)는 SAE로 활성값을 해석 가능한 feature로 분해했고, [Applying SAEs to Unlearn Knowledge](https://arxiv.org/abs/2410.19278)는 WMDP-Bio 지식 억제에 SAE feature 개입을 적용해 단일 feature 개입은 부작용이 작았지만 다수 feature 동시 개입은 기존 기법과 비슷하거나 더 큰 비대상 부작용을 냈다고 보고했다. 편집 문제에서는 [ORE](https://aclanthology.org/2026.findings-acl.1892/)가 배치 편집을 hidden 표상 공간에서 수행하며 일반 의미 부분공간에 대한 직교 제약으로 편집 간 얽힘을 줄인다. feature·표상 개입도 L1 편집과 같은 기준으로 retain 평가와 개입 제거 후 복원을 측정한다.

그러나 feature localization은 데이터·모델별 가설이다. causal intervention과 retain 평가 없이 “routing 회로를 찾았다”고 일반화할 수 없다. [GKnow](https://aclanthology.org/2026.acl-long.466.pdf)는 bias 관련 neuron 제거가 사실적 성별 지식도 손상할 수 있음을 보인다.

### 4.5 L3 외부 메모리·context: 운영 대조군

외부 검색, 편집 메모리와 in-context editing은 원 모델의 가중치를 유지하면서 새 지식과 교정 내용을 입력 문맥에 제공한다. 이는 Brain Washing의 대표 연구축이 아니라, **가중치나 지속 행동을 바꾸지 않고도 같은 제품 목표를 달성할 수 있는지 확인하는 대조군**이다. 단, ACL 2026의 in-context emergent misalignment처럼 문맥 예시 자체가 비목표 행동을 유발하는 경우에는 공격 표면으로 별도 평가한다.

- **적합한 경우**: 자주 바뀌는 사실, 출처가 필요한 답, 많은 순차 편집, 쉬운 rollback이 필요한 운영 환경
- **비가중치 대조 연구**: [REALM](https://proceedings.mlr.press/v119/guu20a.html), [Retrieval-Augmented Generation](https://proceedings.neurips.cc/paper_files/paper/2020/hash/6b493230205f780e1bc26945df7481e5-Abstract.html), [SERAC](https://proceedings.mlr.press/v162/mitchell22a.html), [RETRO](https://proceedings.mlr.press/v162/borgeaud22a.html), [LightEdit](https://aclanthology.org/2026.acl-long.145/)
- **경계 사례**: [WISE](https://proceedings.neurips.cc/paper_files/paper/2024/hash/60960ad78868fce5c165295fbd895060-Abstract-Conference.html)와 [MEMOIR](https://proceedings.neurips.cc/paper_files/paper/2025/hash/809a560bf60984be05180c071c352eaa-Abstract-Conference.html)는 분리 저장 공간을 외부가 아니라 모델 내부 파라미터에 두므로 L1과의 경계 사례이며, 4.2.2의 평생·대규모 편집 행에서 함께 비교한다. [LightEdit](https://aclanthology.org/2026.acl-long.145/)은 검색한 지식 선택과 decoding 확률 억제를 결합하므로 L3와 L4 요소를 함께 갖는다.
- **검증 항목**: 검색 recall, 잘못된 메모리 선택, 편집 수에 따른 저장공간과 지연, 출처 정확성
- **해결하지 못하는 문제**: 모델 내부 지식이나 훈련 데이터의 영향을 삭제하지 않는다.

### 4.6 L4 router·prompt·decoding·output filter

L4는 모델을 다시 학습하지 않고 입력 분류, system prompt, 정책 router, token 억제와 출력 filter로 행동을 통제한다. 입력·출력을 별도 분류기로 검사하는 guard model도 이 수준에 속한다.

- **적합한 경우**: 사용자·조직별 정책, 시한부 제한, 즉시 적용과 rollback, 배포자가 실행 계층을 통제하는 경우
- **대표 연구**: [Llama Guard](https://arxiv.org/abs/2312.06674), [CAP](https://aclanthology.org/2026.acl-long.1882/), [CURaTE](https://aclanthology.org/2026.findings-acl.1102/), [SEGUE](https://aclanthology.org/2026.acl-long.1850/), [ASCL](https://arxiv.org/abs/2602.13562)
- **검증 항목**: 허용·차단 오분류, prompt injection과 우회, 다국어·바꿔 묻기, 정책 제거 후 원래 행동 복원
- **해결하지 못하는 문제**: 출력 억제는 파라미터 지식 삭제나 훈련 영향 제거의 증거가 아니다.

### 4.7 모델 유형별 확장: VLM·VLA·로봇 정책

VLM에서는 텍스트 출력만 보존해서는 충분하지 않다. [MMEdit](https://aclanthology.org/2023.emnlp-main.856/)과 [MIKE](https://aclanthology.org/2024.findings-acl.298/)가 교차 모달 편집 평가를 구체화한 뒤, [SineProject](https://openaccess.thecvf.com/content/CVPR2026/html/Garg_SineProject_Machine_Unlearning_for_Stable_Vision-Language_Alignment_CVPR_2026_paper.html)은 MLLM 언러닝 중 projector의 조건 악화와 교차 모달 표상 이동을 분석한다. [SafeDetect](https://openaccess.thecvf.com/content/CVPR2026/html/Wu_Unlearning_without_Forgetting_Securely_Removing_Targeted_Concepts_from_Large-Scale_Vision-Language_CVPR_2026_paper.html)는 open-vocabulary detector에서 보존 개념의 null space를 이용해 삭제 갱신을 제한한다. 두 연구의 대상과 평가는 서로 다르므로 수치를 직접 비교하지 않는다.

VLA에서는 다음 방법을 구분한다.

- **가중치 미세조정**: [OpenVLA-OFT](https://www.roboticsproceedings.org/rss21/p017.html)는 OpenVLA의 action representation, decoding, objective를 바꿔 미세조정을 평가한다.
- **부분 모듈 적응**: [ControlVLA](https://proceedings.mlr.press/v305/li25c.html)는 기존 정책을 덮어쓰지 않도록 별도 projection layer를 이용해 물체 중심 조건을 추가한다.
- **문맥 내 적응**: [RICL](https://proceedings.mlr.press/v305/sridhar25a.html)은 새 과제 시연을 검색해 문맥으로 제공하고, 목표 과제에서 추가 파라미터 갱신 없이 적응하는 조건을 평가한다.
- **추론 시 활성값 조향**: [Mechanistic Steering for VLA](https://proceedings.mlr.press/v305/haon25a.html)는 두 오픈소스 VLA의 속도·방향 관련 표상을 찾아 시뮬레이션과 실제 로봇에서 행동을 조향한다.
- **기술 task vector 제거**: [VLA Task-Vector Negation Audit](https://arxiv.org/abs/2608.04692)은 LIBERO-Goal 기술별 task vector를 빼고 목표·비대상 기술을 실제 rollout으로 평가한다. 일부 목표 기술은 억제됐지만 모든 성공적 억제가 최소 한 개의 비대상 기술을 손상했고, 재학습 probe는 인증 삭제보다 masking에 가까웠다.
- **백본 표상 보존 학습**: [Evo-1](https://openaccess.thecvf.com/CVPR2026?day=2026-06-05)은 VLM 표상을 보존하도록 두 단계 VLA 학습을 구성한다. 이 논문은 언러닝 연구가 아니라 VLA 학습 중 의미 정렬 보존 연구다.

이 결과들은 VLA 적응·행동 제어·기술 억제의 근거다. 그러나 삭제 데이터를 제외한 재학습 정책과의 동등성까지 보인 결과는 아니므로 특정 로봇 기술이 파라미터에서 삭제됐다는 근거로 사용하지 않는다.

## 5. 상황별 방법 선택

아래 표는 모든 방법의 성능 순위를 제시하지 않는다. 검토한 논문은 모델, 데이터, 평가 지표가 서로 달라 전체 방법을 같은 조건에서 비교하지 않았기 때문이다. 각 행은 논문이 직접 다룬 문제와 그 적용 한계를 정리한 것이다.

| 문제 상황 | 먼저 검토할 방법 | 논문에서 확인된 근거 | 적용 한계 |
|---|---|---|---|
| 새 시점·도메인의 지식을 대규모 corpus로 계속 학습해야 함 | Continual pre-training에서 원문 또는 instruction-augmented corpus를 사용하고 full update, replay·data mixture, regularization, LoRA·adapter를 비교 | [Instruction Pre-Training](https://aclanthology.org/2024.emnlp-main.148/)은 instruction–response pair로 보강한 원문을 처음부터의 pre-training과 continual pre-training에 사용했다. 두 LLM continual learning survey도 pre-training을 별도 단계로 분류한다. | Instruction 형식만으로 post-training이라 부르지 않는다. 새 pre checkpoint마다 동일한 post-training·alignment recipe를 다시 실행해야 pre 단계의 영향을 분리할 수 있다. 기존 post checkpoint·LoRA를 그대로 붙이는 결과는 별도 ablation으로 분리한다. |
| Base pre-training 뒤 새 과제·instruction·tool-use를 계속 추가해야 함 | Continual post-training에서 SFT, replay·distillation, LoRA·adapter를 비교 | LLM continual learning survey들은 base 이후의 instruction tuning 또는 continual fine-tuning을 pre-training과 구분한다. | 새 과제 성능만 보지 않고 이전 instruction following과 일반 응답 품질을 함께 평가해야 한다. |
| 선호·안전·거절 정책을 계속 갱신해야 함 | Continual alignment에서 DPO·RL 계열, preference replay, reference KL과 다목적 학습을 비교 | 두 survey는 alignment를 독립된 지속 학습 단계로 다룬다. | alignment는 post-training에 포함될 수 있지만, 유용성·오거절·jailbreak와 목표 간 충돌을 별도 평가해야 한다. |
| 소형 모델이 새 지식을 학습할 때 이전 지식을 크게 잃음 | 보유 지식 기준선 → 자연 망각·접근 실패 분리 → 삭제 전 위험 예측 → 삭제 pilot·복원 검사 → 용량 재사용 검사를 먼저 수행한다. 그 뒤 replay·낮은 학습률, L3 외부 메모리, adapter·expert 분리, pruning·masking과 선택적 삭제를 비교한다. | [Mapping Post-Training Forgetting](https://proceedings.iclr.cc/paper_files/paper/2026/hash/bc1c5e5fb8ed1ef9b9b5abced2022e40-Abstract-Conference.html)은 sample별 자연 망각을, [PreUnlearn](https://arxiv.org/abs/2606.18473)은 삭제 전 부수 손상 위험을 측정한다. [Forgetting in Language Models](https://arxiv.org/abs/2605.26097)은 여유 용량과 포화 조건을 분리했다. | 삭제 점수 하락이 실제 지식 제거 또는 재사용 가능한 용량 확보를 뜻하지 않는다. 삭제 뒤 동일 예산의 새 지식 학습 실험까지 통과해야 한다. |
| 소수의 안정적인 사실을 다른 사실로 바꿔야 함 | 편집할 checkpoint를 먼저 정한 뒤 국소 지식 편집을 적용한다. Base를 편집하면 동일한 post-training·alignment를 다시 실행하고, 최종 aligned model을 편집하면 alignment 회귀를 직접 평가한다. | [CrispEdit](https://arxiv.org/abs/2602.15823)은 보존 손실의 저곡률 부분공간에 갱신을 제한했고, [SUIT](https://openreview.net/pdf?id=qz3BkyyHWJ)는 편집에 중요한 부분공간을 이용해 사실 편집과 순차 편집을 평가했다. | 기존 사실을 지우는 것과 새 사실을 넣는 것은 다른 목표다. 언러닝만으로는 새 사실을 학습하지 못한다. 다단계 파급, 이웃 지식 보존, 후속 학습 뒤 편집 지속성은 별도 평가가 필요하다. |
| 많은 사실을 순차적으로 계속 갱신해야 함 | 별도 편집 메모리 또는 별도 모듈과 내부 편집을 함께 비교 | [WISE](https://proceedings.neurips.cc/paper_files/paper/2024/hash/60960ad78868fce5c165295fbd895060-Abstract-Conference.html)은 원 지식과 편집 지식을 두 파라미터 메모리로 분리했다. [MEMOIR](https://proceedings.neurips.cc/paper_files/paper/2025/hash/809a560bf60984be05180c071c352eaa-Abstract-Conference.html)은 잔차 메모리에서 수천 개의 순차 편집을 평가했다. | 두 논문의 결과는 해당 질문응답·환각 교정·분포 외 일반화 실험 범위에 한정된다. 별도 메모리는 검색과 라우팅 오류, 추가 메모리 비용이 생긴다. |
| 자주 바뀌고 출처와 기준 시점이 필요한 정보를 제공해야 함 | 시간 정보가 포함된 검색 증강 생성 또는 외부 지식 저장소 | 이 경우 목표는 과거 지식의 삭제가 아니라 현재 근거의 제공이다. WISE는 순차 지식 갱신에서 파라미터 편집과 검색 기반 작업 메모리가 서로 다른 실패 양상을 보인다고 보고했다. | 검색 누락과 잘못된 문서 선택을 평가해야 한다. 외부 검색을 사용했다는 사실만으로 정확성이 보장되지 않는다. |
| 사용자나 조직에 따라 정책이 달라야 하며 되돌릴 수 있어야 함 | 외부 라우터, 프롬프트 또는 분리된 어댑터 | [CAP](https://aclanthology.org/2026.acl-long.1882/)은 프롬프트를 이용한 가역적 비가중치 언러닝을, [CURaTE](https://aclanthology.org/2026.findings-acl.1102/)는 임베딩 유사도에 따른 응답·거절 라우팅을 평가했다. | 두 방법은 출력을 제어하지만 파라미터 내부 지식을 삭제하지 않는다. 사용자가 실행 계층을 바꿀 수 있는 오픈웨이트 배포에서는 삭제 수단으로 사용할 수 없다. |
| 특정 훈련 데이터의 영향을 제거해야 함 | 삭제 데이터를 제외한 전면 재학습을 기준으로 두고, 비용을 줄이기 위해 인증 또는 근사 언러닝을 비교 | [Certified Data Removal](https://proceedings.mlr.press/v119/guo20c.html)은 삭제 후 모델을 해당 데이터를 처음부터 보지 않은 모델과 구별하기 어렵게 만드는 것을 인증 삭제로 정의했다. [OpenUnlearning](https://proceedings.neurips.cc/paper_files/paper/2025/hash/3e4a38f228427ab819ba7899003a44b1-Abstract-Datasets_and_Benchmarks_Track.html)은 LLM 언러닝 13개 알고리즘과 16개 평가를 통합했다. | Certified Data Removal의 실험 대상은 선형 분류기다. 그 보증을 LLM에 그대로 적용할 수 없다. OpenUnlearning은 비교 체계이지 삭제의 보증 자체가 아니다. |
| 특정 지식이나 능력을 여러 우회 질문에서도 사용하지 못하게 해야 함 | 파라미터를 수정하는 언러닝 | [Unlearning Isn't Deletion](https://arxiv.org/abs/2505.16831)은 6개 언러닝 방법에서 낮아진 과제 성능이 소량의 미세조정으로 복원되는 경우를 보고했다. [Do LLMs Really Forget?](https://proceedings.neurips.cc/paper_files/paper/2025/file/85ec26ef94c3acb4c195e905df1ff4f7-Paper-Conference.pdf)은 상관 지식을 이용한 복원을 평가했다. | 직접 질문의 정답률이나 거절률만으로 성공을 판정할 수 없다. 재학습, 우회 질문, 다국어 질문, 상관 지식에 의한 복원을 함께 측정해야 한다. |
| VLM에서 시각 개념을 제거해야 함 | 교차 모달 정렬을 보존하는 VLM 언러닝 | SineProject와 SafeDetect는 각각 MLLM과 open-vocabulary detector에서 삭제–보존 상충을 평가했다. | 텍스트 질의만으로 판정하지 않는다. 이미지, 텍스트, 두 모달리티를 결합한 복원 질의를 평가해야 한다. |
| VLA를 새 물체·시점·로봇에 적응시켜야 함 | 부분 모듈 적응, 저랭크 미세조정, 문맥 내 적응을 비교 | ControlVLA, RICL, CVPR 2026의 VLA spatial adaptation은 서로 다른 적응 범위와 파라미터 갱신량을 평가했다. | 새 과제 성공률만으로 선택하지 않는다. 이전 과제, 다른 시점·물체, 실제 로봇에서의 성능을 함께 측정한다. |
| 특정 로봇 기술이나 행동을 제거해야 함 | VLA 정책 언러닝을 별도 과제로 설계하고 재학습 참조 모델과 비교 | 현재 추가한 VLA 논문들은 주로 적응과 조향을 다룬다. | VLM 개념 삭제나 추론 시 행동 조향을 로봇 기술 삭제의 증거로 사용하지 않는다. |

## 6. 평가 프로토콜

| 축 | 최소 지표 |
|---|---|
| Continual pre-training | 새·이전 corpus perplexity, 시간·도메인 지식, 단계별 망각, token·FLOPs·GPU 시간 |
| Continual post-training | 새·이전 과제 성공률, instruction following, 형식 준수, 일반 응답 품질 |
| Continual alignment | 선호 승률, 정책 준수, 정상 질문 오거절, jailbreak, 기존 안전·유용성 회귀, rollout·judge 비용 |
| 비의도적 망각 분해 | sample별 `1→0` 망각·`0→1` backward transfer, 단서·재정렬·few-shot 복원 검사로 실제 손실과 접근 실패 구분, 형식·정렬 회귀 분리 평가 |
| 삭제 전 Audit | 원 모델의 target 보유율, 새 학습 뒤 sample별 `1→0`·`0→1`, 단서·재정렬 복원률, forget–retain 거리별 예상 손상 |
| 소형 모델 capacity | 삭제 pilot의 직접·우회·재학습 복원률, 삭제·비삭제 대조군의 새 지식 획득 차이, 모델 크기별 이전 지식 손실, replay 유무, 파라미터 sparsity·재사용량, 단위 compute당 성능 |
| 교정 성공 | exact/semantic accuracy, target behavior rate, calibration |
| 일반화 | paraphrase, 다른 문맥·언어, 다단계·compositional query |
| locality | unrelated retain QA와 neighborhood delta |
| Knowledge editing 단계 | 편집 checkpoint, 남은 후속 학습 단계, 후속 단계 전후 편집 유지율, instruction·tool·alignment 회귀 |
| Knowledge editing 누적 | 단일·배치·순차·평생 편집별 이전 edit 유지율, 순서 민감도, update norm, 메모리·routing 비용 |
| 일반 능력 | 언어, 상식, 추론, 수학, 코딩, instruction following |
| 망각 강도 | extraction, jailbreak, log-prob, membership inference, representation probe |
| 복원 저항 | 소량·무관 데이터 재학습, quantization, correlated inference |
| 장기 안정성 | 1/10/100/1,000+ edits 후 target·retain 성능과 update norm |
| 운영성 | latency, GPU·메모리, provenance, rollback, tenant isolation |
| VLM 보존 | 비대상 시각 개념, 이미지–텍스트 정렬, 모달리티별·교차 모달 복원 |
| VLA·로봇 보존 | 이전·새 과제 성공률, 안전 위반, 시점·물체·embodiment 일반화, 실제 로봇 재현 |

[OpenUnlearning](https://proceedings.neurips.cc/paper_files/paper/2025/hash/3e4a38f228427ab819ba7899003a44b1-Abstract-Datasets_and_Benchmarks_Track.html)은 13개 알고리즘과 16개 평가를 TOFU·MUSE·WMDP에 통합한다. 그러나 benchmark 평균만으로 실제 삭제를 인증할 수 없으므로 [Hidden Knowledge Holes](https://proceedings.neurips.cc/paper_files/paper/2025/hash/214eae0bfaf1c67a30db163ecb99693b-Abstract-Conference.html)이 지적한 이웃 평가의 품질과 복원 공격을 함께 점검해야 한다.

## 7. 문헌 구성: 핵심 트렌드와 인접 방법

문헌은 먼저 **행동 주입 → 비목표 일반화 → 지속성 → 탐지·복구**라는 핵심 인과축으로 배열한다. Continual learning·editing·unlearning·외부 시스템·멀티모달 연구는 이 핵심 질문을 측정하거나 비교하기 위한 인접 방법으로 뒤에 둔다. 학회명이 표시된 논문은 공식 proceedings나 학회 페이지에서 게재가 확인된 연구다. `preprint`는 2026-09-04 현재 arXiv 공개본만 확인된 연구다.

### 7.1 2025–2026 핵심 연구 계보

- **행동 주입과 광범위 전이**: [Emergent Misalignment](https://proceedings.mlr.press/v267/betley25a.html)(ICML 2025)은 6,000개 insecure-code 예시로 학습한 GPT-4o가 validation에서 취약 코드를 80% 넘게 생성하고, 선택된 비코딩 질문에서 오정렬 답변을 28% 생성했다고 보고했다. 원본 모델은 같은 판정에서 0%였고, 동일 취약 코드에 선의의 교육 목적을 명시한 대조군에서는 이 현상이 나타나지 않았다.
- **문맥만으로 발생하는 전이**: [Emergent Misalignment via In-Context Learning](https://aclanthology.org/2026.acl-long.1770/)(ACL 2026)은 16개의 좁은 비유해 예시만으로 여러 모델 계열에서 1–24%의 오정렬 답변을 관찰했고, 2-shot에서도 현상을 확인했다. weight update만 감시해서는 행동 주입을 놓친다는 근거다.
- **삭제·교정의 역효과**: [From Narrow Unlearning to Emergent Misalignment](https://aclanthology.org/2026.acl-short.32/)(ACL 2026)은 cyber/safety refusal을 좁게 제거하는 과정이 학습하지 않은 책임 AI 영역의 오정렬로 전이될 수 있음을 보였다. unlearning 성공률만으로 안전한 변경을 주장할 수 없다.
- **공격에 강한 사전학습**: [Deep Ignorance](https://proceedings.iclr.cc/paper_files/paper/2026/hash/3bf80b34f731313b8292f4578e820c90-Abstract-Conference.html)(ICLR 2026)는 사전학습 데이터 필터링을 통해 최대 10,000 fine-tuning step과 약 300M token 규모의 적대적 학습에서 저항성을 평가했다. 사후 safety tuning뿐 아니라 학습 전 데이터 구성 자체가 방어면이라는 흐름을 만든다.
- **복구와 취약성 기반 보호**: [Antidote](https://proceedings.mlr.press/v267/huang25b.html)와 [Vulnerability-Aware Alignment](https://proceedings.mlr.press/v267/chen25w.html)(ICML 2025)은 harmful fine-tuning 이후의 안전 복구와 능력별 불균일한 forgetting을 다룬다. 방어는 평균 안전 점수보다 취약 slice와 정상 utility를 함께 봐야 한다.
- **지속성·제거 검증**: [Mapping Post-Training Forgetting](https://proceedings.iclr.cc/paper_files/paper/2026/hash/bc1c5e5fb8ed1ef9b9b5abced2022e40-Abstract-Conference.html)과 [Erase or Hide?](https://proceedings.iclr.cc/paper_files/paper/2026/hash/d4aa3942a863aaf997053eee7b733f85-Abstract-Conference.html)(ICLR 2026)은 각각 post-training의 sample-level 변화와 재학습에 견디는 제거를 분석한다. 행동이 사라진 것과 잠시 가려진 것을 분리하는 평가축을 제공한다.

최신 preprint인 [Subliminal Learning](https://arxiv.org/abs/2507.14805), [Persistent Backdoor Attacks under Continual Fine-Tuning](https://arxiv.org/abs/2512.14741), [Persona Features Control Emergent Misalignment](https://arxiv.org/abs/2506.19823), [Backdoor Decontamination Dynamics](https://arxiv.org/abs/2608.11295)은 각각 숨은 데이터 신호·후속 학습 생존·내부 persona feature·장기 복구 동역학을 확장한다. 출판 상태가 다르므로 위 학회 논문의 확정 근거와 분리해 사용한다.

### 7.2 Audit·data attribution·원인 위치

**핵심 흐름:** 외부 검색과 내부 기억의 분리 → 훈련 데이터 기여 추적 → 사실·표상 위치 진단 → 지식과 출력 정책의 분리 → 위치 진단의 유효성 검증

- **2020 | [REALM](https://proceedings.mlr.press/v119/guu20a.html)·[RAG](https://proceedings.neurips.cc/paper_files/paper/2020/hash/6b493230205f780e1bc26945df7481e5-Abstract.html) | ICML·NeurIPS**: 파라미터 기억만 사용하는 조건과 외부 문서를 검색하는 조건을 분리했다. 오류가 모델 내부 지식인지 검색 실패인지 비교하는 기준이 됐다.
- **2022 | [Knowledge Neurons](https://aclanthology.org/2022.acl-long.581/) | ACL**: 사실과 연관된 neuron을 찾고 억제·증폭·수정했다. 특정 사실의 위치를 내부 구성요소 수준에서 검사하는 방향을 제시했다.
- **2023 | [TRAK](https://proceedings.mlr.press/v202/park23c.html) | ICML**: 모델의 예측을 어떤 훈련 데이터가 만들었는지 추적하는 data attribution을 대규모 모델에 적용했다. 데이터 수준 개입이 필요한지 판단하는 audit 도구로 사용할 수 있지만, 기여도가 높다는 사실만으로 해당 데이터 삭제 효과가 보장되지는 않는다.
- **2023 | [Does Localization Inform Editing?](https://proceedings.neurips.cc/paper_files/paper/2023/hash/3927bbdcf0e8d1fa8aa23c26f358a281-Abstract-Conference.html) | NeurIPS**: causal tracing으로 찾은 지식 위치와 실제 편집 성공 위치가 일치하는지 검사했다. 위치 진단 결과만으로 편집할 layer를 확정하지 말아야 한다는 근거다.
- **2023 | [Inference-Time Intervention](https://proceedings.neurips.cc/paper_files/paper/2023/hash/81b8390039b7302c909cb769f8b6cd93-Abstract-Conference.html) | NeurIPS**: 재학습 없이 attention head 활성값을 이동해 진실성 행동을 바꿨다. 지식 보유와 출력 행동을 분리해 시험할 수 있게 했다.
- **2024 | [Refusal Direction](https://proceedings.neurips.cc/paper_files/paper/2024/hash/f545448535dfde4f9786555403ab7c49-Abstract-Conference.html) | NeurIPS**: 여러 모델에서 거절과 관련된 1차원 활성 방향을 분석했다. 유해 지식 자체와 답변 거절을 구분해야 한다는 근거를 강화했다.
- **2025 | [Harmfulness and Refusal](https://proceedings.neurips.cc/paper_files/paper/2025/hash/cd18539787d90e1d682d557c2c71b534-Abstract-Conference.html) | NeurIPS**: 유해성 표상과 거절 표상을 분리했다. 안전 답변률만으로 위험 지식이 제거됐다고 판단할 수 없음을 보였다.
- **2026-07 | [LACUNA](https://arxiv.org/abs/2607.02513) | preprint**: OLMo 계열 모델의 지정된 파라미터에 합성 개인정보를 주입해 지식 위치의 정답을 아는 평가 환경을 만들었다. 기존 언러닝은 출력이 바뀌어도 실제 주입 위치를 정확히 수정하지 못하고 정보 복원 공격에 취약할 수 있었다.

### 7.3 L0·L1 학습·가중치 교정과 보존

**핵심 흐름:** 이전 능력 보존 → LLM 학습 단계별 continual learning → 단일 사실 편집 → 대량·다단계 편집 → 장기 안정성과 다목적 보존

#### 7.3.1 LLM Continual Learning의 세 단계

- **2016~2017 | [Learning without Forgetting](https://doi.org/10.1007/978-3-319-46493-0_37)·[EWC](https://doi.org/10.1073/pnas.1611835114)·[GEM](https://proceedings.neurips.cc/paper_files/paper/2017/hash/f87522788a2be2d171666752f97ddebb-Abstract.html) | ECCV·PNAS·NeurIPS**: 새 과제를 학습하면서 이전 출력, 중요 파라미터, gradient 방향을 보존하는 기준을 만들었다. LLM 편집 연구는 아니지만 장기 갱신에서 안정성과 학습 가능성을 함께 보는 출발점이다.
- **2024 | [Instruction Pre-Training](https://aclanthology.org/2024.emnlp-main.148/) | EMNLP**: 대규모 원문을 합성 instruction–response pair로 보강해 처음부터의 pre-training과 continual pre-training에 사용했다. Instruction 형식은 post-training에만 속하지 않으며, 파이프라인 위치와 objective로 단계를 구분해야 함을 보여준다.
- **2024 | [Continual Learning for Large Language Models: A Survey](https://arxiv.org/abs/2402.01364) | preprint**: LLM continual learning을 continual pretraining, instruction tuning, alignment로 나눴다. RAG와 model editing은 학습 단계 밖의 별도 지식 갱신 접근으로 비교했다.
- **2026 | [Beyond Static Models](https://arxiv.org/abs/2603.12658) | preprint**: continual pre-training, continual fine-tuning, continual alignment의 세 단계와 rehearsal·regularization·architecture 기반 망각 완화 방법을 교차 분류했다.

#### 7.3.2 고정 용량과 지식 저장 위치

- **2018 | [PackNet](https://openaccess.thecvf.com/content_cvpr_2018/html/Mallya_PackNet_Adding_Multiple_CVPR_2018_paper.html) | CVPR**: vision network에서 pruning으로 중복 파라미터를 확보하고, 기존 과제 파라미터를 고정한 채 새 과제에 재할당했다. 소형 모델의 자원 재사용 원리는 제공하지만 LLM에서 어떤 의미 지식을 지워야 하는지 직접 답한 연구는 아니다.
- **2024 | [Dissecting Learning and Forgetting in Language Model Finetuning](https://proceedings.iclr.cc/paper_files/paper/2024/hash/c4de749a4bd8802f0b4033d09a7867db-Abstract-Conference.html) | ICLR**: 미세조정 전후 변화를 topic, style과 factual knowledge로 분해했다. 사실 지식은 느리게 학습되고 더 많은 capacity를 요구한다고 분석해 변화 종류를 분리해 측정할 근거를 제공했다.
- **2025 | [Spurious Forgetting](https://proceedings.iclr.cc/paper_files/paper/2025/hash/a774503daed55eb53c634847ae071ec7-Abstract-Conference.html) | ICLR**: 지속 학습 중 성능 하락이 실제 지식 손실이 아니라 task alignment 손상일 수 있음을 통제 실험으로 구분했다. 새 학습 뒤 점수가 낮아졌다는 사실만으로 지식이 지워졌다고 판정하지 않아야 한다.
- **2025 | [Learn to Memorize: MoNIM](https://aclanthology.org/2025.acl-long.1385/) | ACL**: 고정된 parametric model에 학습 가능한 non-parametric memory를 결합해 새 정보를 저장했다. 모든 장기 지식을 제한된 base weight에 넣는 방식과 외부 메모리 방식의 비교 근거를 제공한다.
- **2026 | [Mapping Post-Training Forgetting](https://proceedings.iclr.cc/paper_files/paper/2026/hash/bc1c5e5fb8ed1ef9b9b5abced2022e40-Abstract-Conference.html) | ICLR**: 평균 정확도 대신 sample별 `1→0`을 망각, `0→1`을 backward transfer로 세어 post-training 단계·모델 크기·데이터 규모별 변화를 측정했다. 의도적 삭제 전에 자연 망각을 확인하는 직접적인 측정 기준이다.
- **2026-05 | [Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay](https://arxiv.org/abs/2605.26097) | preprint**: 여유 용량이 있는 조건에서는 self-generated replay가 망각을 크게 줄였지만, 포화에 가까운 모델에서는 새 정보가 기존 정보를 덮어쓰는 현상이 남았다고 보고했다. 소형 모델 실험은 replay·학습률 문제와 capacity saturation을 분리해야 한다.

#### 7.3.3 Lifelong knowledge editing

- **2021 | [KnowledgeEditor](https://aclanthology.org/2021.emnlp-main.522/) | EMNLP**: 입력 사실의 gradient로 제한된 파라미터 갱신을 생성했다. 편집 성공, 바꿔 묻기 일반화, 무관 입력 보존을 함께 평가했다.
- **2022 | [MEND](https://openreview.net/pdf?id=0DcZxeWfOPt)·[ROME](https://proceedings.neurips.cc/paper_files/paper/2022/hash/6f1d43d5a82a37e89b0665b33bf3a182-Abstract-Conference.html)·[SERAC](https://proceedings.mlr.press/v162/mitchell22a.html) | ICLR·NeurIPS·ICML**: gradient 변환, 특정 MLP 가중치 수정, 별도 편집 메모리라는 세 방법군을 확립했다. 이후 내부 수정과 외부 저장을 비교하는 기준이 됐다.
- **2023 | [MEMIT](https://openreview.net/pdf?id=MkbcAHIYgyS)·[MQuAKE](https://aclanthology.org/2023.emnlp-main.971/) | ICLR·EMNLP**: 편집 규모를 많은 사실로 늘리고, 수정된 사실이 다단계 추론의 결론까지 반영되는지 평가했다. 단일 질문의 정답만 바꾸는 것으로는 충분하지 않음을 보였다.
- **2024 | [RippleEdits](https://aclanthology.org/2024.tacl-1.16/)·[Messy Ripple Effects](https://aclanthology.org/2024.emnlp-main.700/)·[WISE](https://proceedings.neurips.cc/paper_files/paper/2024/hash/60960ad78868fce5c165295fbd895060-Abstract-Conference.html) | TACL·EMNLP·NeurIPS**: 한 사실 변경에 따라 함께 바뀌어야 할 결과를 세분화하고, 논리적 파급이 불완전해지는 원인을 분석했다. WISE는 편집을 별도 메모리에 저장해 원 모델 손상을 줄이는 방향을 평가했다.
- **2025 | [Normalized Gradient Difference](https://aclanthology.org/2025.naacl-long.563/)·[MEMOIR](https://proceedings.neurips.cc/paper_files/paper/2025/hash/809a560bf60984be05180c071c352eaa-Abstract-Conference.html)·[UniEdit](https://neurips.cc/virtual/2025/poster/121533)·[A³E](https://neurips.cc/virtual/2025/poster/118255)·[CAKE](https://neurips.cc/virtual/2025/poster/115340) | NAACL·NeurIPS**: 삭제·보존 gradient의 크기를 맞춰 목표 간 불균형을 줄이고, 누적 편집·다단계 전이·여러 편집의 합성을 다뤘다. 평가 범위가 단일 편집 정확도에서 목표 간 균형과 장기 안정성으로 넓어졌다.
- **2026 | [CrispEdit](https://arxiv.org/abs/2602.15823)·[SUIT](https://openreview.net/pdf?id=qz3BkyyHWJ)·[StableEdit](https://arxiv.org/abs/2605.11836)·[ORE](https://aclanthology.org/2026.findings-acl.1892/) | ICML·ICLR·ACL**: 보존 대상과 겹치는 파라미터·의미 공간을 피하도록 갱신하고, 수천 회 편집의 누적 손상을 줄였다. 서로 다른 모델과 평가셋을 사용했으므로 보고 수치를 직접 순위로 비교하지 않는다.
- **2026-08 | [MO-IKE](https://arxiv.org/abs/2608.25100) | preprint**: 문맥 내 편집의 예시 검색과 prompt 구성을 다목적 강화학습 문제로 정의했다. 편집 성공, 바꿔 묻기 일관성, 무관 지식 보존을 동시에 최적화했다.

### 7.4 의도적 삭제·Machine unlearning과 검증

**핵심 흐름:** 삭제 요청에서 forget set 식별 → 삭제 전 forgettability·부수 손상 Audit → 재학습 모델과의 차이 보장 → LLM benchmark → 복원 공격과 내부 위치 검증

- **2015 | [Towards Making Systems Forget with Machine Unlearning](https://doi.org/10.1109/SP.2015.35) | IEEE S&P**: 전체 학습을 반복하지 않고 특정 데이터의 영향을 제거하는 문제를 명시적으로 정의했다. 현재 machine unlearning 문제 설정의 출발점이다.
- **2019 | [Making AI Forget You](https://proceedings.neurips.cc/paper_files/paper/2019/hash/cb79f8fa58b91d3af6c9c991f63962d3-Abstract.html) | NeurIPS**: 삭제 효율을 학습 알고리즘 설계 단계에서 확보하는 관점을 제시했다. clustering 사례에서 삭제 비용과 모델 품질을 함께 분석했다.
- **2020 | [Certified Data Removal](https://proceedings.mlr.press/v119/guo20c.html) | ICML**: 삭제 후 모델과 해당 데이터를 처음부터 보지 않은 모델을 정해진 통계 범위에서 구분하기 어렵게 만드는 인증 기준을 제시했다. 삭제 대상 정답률만 보는 것보다 강한 기준이다.
- **2021 | [Descent-to-Delete](https://proceedings.mlr.press/v132/neel21a.html) | ALT**: 연속적인 데이터 추가·삭제 요청을 처리하면서 모델 상태나 출력이 다시 학습한 결과에 가까워지도록 하는 알고리즘을 분석했다.
- **2023 | [Forget Unlearning](https://proceedings.mlr.press/v202/chourasia23a.html) | ICML**: noisy gradient descent에서 원 데이터 정보가 제거되는 조건을 분석했다. 예측 정확도 감소와 학습 데이터 정보 제거를 구분했다.
- **2024 | [TOFU](https://arxiv.org/abs/2401.06121)·[WMDP](https://proceedings.mlr.press/v235/li24bc.html)·[RWKU](https://proceedings.neurips.cc/paper_files/paper/2024/hash/b1f78dfc9ca0156498241012aec4efa0-Abstract-Datasets_and_Benchmarks_Track.html)·[NPO](https://openreview.net/pdf?id=MXLBXjQkmb) | 공개·ICML·NeurIPS·COLM**: 합성 저자 사실, 생물·사이버·화학 위험 지식, 실세계 인물 지식, 학습 안정성을 각각 평가했다. LLM 언러닝 평가가 삭제 성능뿐 아니라 보존 성능과 모델 붕괴까지 포함하게 됐다.
- **2025 | [The Forget-Set Identification Problem](https://doi.org/10.1007/s10994-025-06897-9) | Machine Learning**: 사용자가 제시한 unwanted evidence를 실제 훈련 데이터의 forget set으로 변환하면서 wanted evidence를 보존하는 선행 최적화 문제를 정의했다. 범용 ML 설정이며 LLM 전용 결과는 아니다.
- **2025 | [MUSE](https://openreview.net/pdf?id=TArmA033BU)·[OpenUnlearning](https://proceedings.neurips.cc/paper_files/paper/2025/hash/3e4a38f228427ab819ba7899003a44b1-Abstract-Datasets_and_Benchmarks_Track.html)·[Do LLMs Really Forget?](https://proceedings.neurips.cc/paper_files/paper/2025/file/85ec26ef94c3acb4c195e905df1ff4f7-Paper-Conference.pdf)·[Hidden Knowledge Holes](https://proceedings.neurips.cc/paper_files/paper/2025/hash/214eae0bfaf1c67a30db163ecb99693b-Abstract-Conference.html) | ICLR·NeurIPS**: 여러 방법을 같은 조건에서 비교하고, 연관 지식을 이용한 복원과 삭제 대상 주변 지식의 손상을 평가했다. 직접 질문의 정답률만 낮아진 결과로는 삭제를 주장하기 어려워졌다.
- **2026 | [Learnability–Forgettability Divergence](https://ojs.aaai.org/index.php/AAAI/article/view/39657) | AAAI**: 데이터가 빨리 학습되는 정도와 최종 파라미터에서 쉽게 제거되는 정도가 일치하지 않을 수 있음을 UGS와 LFD로 측정했다. CIFAR-10·MNIST·IMDB 범위이므로 LLM의 semantic knowledge에 직접 일반화하지 않는다.
- **2026 | [ReGLU](https://aclanthology.org/2026.findings-acl.717/)·[PERMU](https://aclanthology.org/2026.acl-long.88/) | ACL**: 보존 지식과 겹치지 않는 방향으로 갱신하고, 직접 드러나지 않는 암묵 지식까지 검사했다.
- **2026-06 | [PreUnlearn](https://arxiv.org/abs/2606.18473) | preprint**: 언러닝을 실행하기 전에 forget set과 평가 지식의 semantic·representation 관계로 같은 도메인과 먼 도메인의 부수 손상 위험을 예측했다. Target 삭제 가능성 자체가 아니라 retain damage의 조기 경보다.
- **2026-08 | [What to Forget in Unlearning?](https://arxiv.org/abs/2608.14855) | preprint**: 삭제 요청을 어떤 훈련 예시의 forget set으로 변환할지 연구했다. 노래·책의 verbatim output suppression에서 forget set 선택에 따라 억제 성공과 비대상 손상이 달라짐을 보였다.
- **2026-07~08 | [LACUNA](https://arxiv.org/abs/2607.02513)·[RepSelect](https://arxiv.org/abs/2606.17168) | preprint**: 지식이 주입된 실제 파라미터 위치와 미세조정·few-shot 복원 공격을 평가했다. 출력 억제보다 실제 갱신 위치와 복원 저항을 중시하는 단계로 이동했다.

### 7.5 L3·L4 외부 메모리·router와 운영 대조군

**핵심 흐름:** 외부 지식 검색 → 편집 전용 메모리 → 장기 운영과 검색·분기 오류 관리

- **2020 | [REALM](https://proceedings.mlr.press/v119/guu20a.html)·[RAG](https://proceedings.neurips.cc/paper_files/paper/2020/hash/6b493230205f780e1bc26945df7481e5-Abstract.html) | ICML·NeurIPS**: 교체 가능한 외부 문서 저장소를 모델 생성과 결합했다. 자주 바뀌는 사실은 가중치 편집보다 검색 자료 갱신이 유리할 수 있다는 기준을 제공했다.
- **2022 | [SERAC](https://proceedings.mlr.press/v162/mitchell22a.html)·[RETRO](https://proceedings.mlr.press/v162/borgeaud22a.html) | ICML**: SERAC은 편집 적용 대상을 판정해 별도 메모리에서 답했고, RETRO는 대규모 검색 메모리와 모델 크기의 관계를 분석했다.
- **2024 | [Cross-Lingual Multi-Hop Editing](https://aclanthology.org/2024.findings-emnlp.701/) | EMNLP Findings**: 한 언어에서 수정한 지식이 다른 언어의 다단계 질문에도 반영되는지 평가했다. 번역된 단일 질문의 성공만으로 언어 간 편집 전이를 판단할 수 없음을 보여준다.
- **2024 | [WISE](https://proceedings.neurips.cc/paper_files/paper/2024/hash/60960ad78868fce5c165295fbd895060-Abstract-Conference.html) | NeurIPS**: 원 모델과 편집 메모리를 분리한 뒤 입력에 따라 사용할 경로를 선택했다. 편집 정확도 외에 메모리 증가와 잘못된 경로 선택이 평가 대상이 됐다.
- **2025 | [MEMOIR](https://proceedings.neurips.cc/paper_files/paper/2025/hash/809a560bf60984be05180c071c352eaa-Abstract-Conference.html) | NeurIPS**: 계속 쌓이는 편집을 별도 모듈에 저장하고 검색하는 장기 운용을 다뤘다. 내부 수정과 외부 저장을 결합하는 구조로 발전했다.
- **2026 | [ASCL](https://arxiv.org/abs/2602.13562)·[LightEdit](https://aclanthology.org/2026.acl-long.145/)·[CoT2Edit](https://aclanthology.org/2026.acl-long.1133/) | ICML·ACL**: 안전 규칙 검색, 검색과 decoding을 결합한 지속 편집, 학습과 RAG의 혼합을 평가했다. 실제 배포에서는 응답 지연, 변경 이력, 되돌리기, 검색 실패와 prompt 공격까지 함께 봐야 한다.
- **2026-08 | [MO-IKE](https://arxiv.org/abs/2608.25100) | preprint**: 문맥 내 편집에서 어떤 예시를 검색하고 어떻게 배치할지를 여러 목표로 최적화했다. 외부 편집도 검색 정확도 하나가 아니라 편집 성공과 보존을 함께 다루는 방향으로 확장됐다.

### 7.6 VLM·VLA·로봇의 교차 수준 개입

**핵심 흐름:** 텍스트 중심 편집 → 이미지·텍스트 동시 평가 → 순차 VLM 편집 → 실제 로봇 행동의 보존·억제 평가

- **2023 | [MMEdit](https://aclanthology.org/2023.emnlp-main.856/) | EMNLP**: MLLM 편집을 이미지와 텍스트가 함께 얽힌 문제로 정의했다. 텍스트 질문만으로는 교차 모달 변경을 평가할 수 없음을 benchmark로 제시했다.
- **2024 | [MIKE](https://aclanthology.org/2024.findings-acl.298/)·[OpenVLA](https://proceedings.mlr.press/v270/kim25c.html) | ACL Findings·CoRL**: MIKE는 문맥을 이용한 multimodal 편집을 평가했고, OpenVLA는 공개 가중치 로봇 정책의 미세조정과 적응 실험 기반을 제공했다.
- **2025 | [MC-MKE](https://aclanthology.org/2025.findings-acl.896/)·[Lifelong VLM Editing](https://openaccess.thecvf.com/content/CVPR2025/html/Chen_Lifelong_Knowledge_Editing_for_Vision_Language_Models_with_Low-Rank_Mixture-of-Experts_CVPR_2025_paper.html)·[Visual-Oriented Fine-Grained Editing](https://openaccess.thecvf.com/content/ICCV2025/html/Zeng_Visual-Oriented_Fine-Grained_Knowledge_Editing_for_MultiModal_Large_Language_Models_ICCV_2025_paper.html) | ACL·CVPR·ICCV**: 여러 교차 모달 편집, 순차 편집, 세밀한 시각 지식 편집으로 확장됐다. 이전 지식과 이미지–텍스트 정렬을 보존하면서 어느 시각 정보까지 바뀌어야 하는지 평가했다.
- **2025 | [OpenVLA-OFT](https://www.roboticsproceedings.org/rss21/p017.html)·[ControlVLA](https://proceedings.mlr.press/v305/li25c.html)·[RICL](https://proceedings.mlr.press/v305/sridhar25a.html) | RSS·CoRL**: 전체 미세조정, 일부 모듈만 학습하는 방법, 검색한 시연으로 가중치 수정 없이 적응하는 방법을 비교할 수 있는 기반을 만들었다.
- **2026 | [SineProject](https://openaccess.thecvf.com/content/CVPR2026/html/Garg_SineProject_Machine_Unlearning_for_Stable_Vision-Language_Alignment_CVPR_2026_paper.html)·[SafeDetect](https://openaccess.thecvf.com/content/CVPR2026/html/Wu_Unlearning_without_Forgetting_Securely_Removing_Targeted_Concepts_from_Large-Scale_Vision-Language_CVPR_2026_paper.html)·[DSCA](https://openaccess.thecvf.com/content/CVPR2026/html/Das_DSCA_Dynamic_Subspace_Concept_Alignment_for_Lifelong_VLM_Editing_CVPR_2026_paper.html) | CVPR**: 개념 삭제와 순차 편집 과정에서 projector 안정성, 보존 개념 공간, 이미지–텍스트 정렬을 직접 측정했다. 텍스트 출력 외의 교차 모달 표상 보존이 핵심 지표가 됐다.
- **2026-08 | [VLA Task-Vector Negation Audit](https://arxiv.org/abs/2608.04692) | preprint**: LIBERO-Goal의 10개 기술에서 기술별 task vector를 빼고 목표·비대상 기술을 실제로 실행했다. 5개 목표 기술은 성공률 0%로 억제됐지만 비대상 기술의 평균 보존율은 52%였고, 모든 성공적 억제가 최소 한 개의 다른 기술을 손상했다. 재학습 결과도 인증 삭제보다 행동 억제에 가까웠다.

### 7.7 2026년 7~8월 최신 preprint

아래 다섯 논문은 모두 동료평가 전 결과다. 게재 논문의 확정 결과와 구분해 해석한다.

- **2026-07-02 | [LACUNA](https://arxiv.org/abs/2607.02513) | Audit·L0~L2**: 1B·7B OLMo 계열 모델의 지정된 파라미터에 합성 개인정보를 주입했다. 최신 언러닝 방법은 출력 성능이 좋아도 실제 지식 위치를 정확히 수정하지 못하고, 정보 복원 공격에 취약할 수 있었다.
- **2026-08-05 | [VLA Task-Vector Negation Audit](https://arxiv.org/abs/2608.04692) | Audit·L2**: 10개 LIBERO-Goal 기술에 task vector subtraction을 적용하고 목표·비대상 기술을 실제 실행으로 평가했다. 목표 기술 억제는 가능했지만 다른 기술 보존이 불안정했고, 재학습 결과는 삭제보다 행동 억제에 가까웠다.
- **2026-08-14 | [What to Forget in Unlearning?](https://arxiv.org/abs/2608.14855) | Audit·L0**: 노래·책의 출력 억제 요청을 실제 forget set으로 변환하는 curation을 비교했다. 선택한 데이터에 따라 억제 성공과 비대상 손상이 함께 달라져, 삭제 방법 실행 전에 forget set 자체를 감사해야 함을 보였다.
- **2026-08-20, v3 | [RepSelect](https://arxiv.org/abs/2606.17168) | L2·언러닝**: 삭제 대상 gradient의 주성분을 제거해 보존 지식과 재학습 공격이 사용하는 표상에서 갱신을 분리했다. 지식·행동 5개 데이터셋과 3개 모델 계열에서 기존 5개 방법보다 재학습 후 대상 답변 확률을 더 크게 낮췄다고 보고했다.
- **2026-08-25 | [MO-IKE](https://arxiv.org/abs/2608.25100) | L3**: 문맥 내 편집의 예시 선택과 prompt 구성을 여러 목표로 최적화했다. Llama-3.2에서 편집 성공률은 85%에서 92%, 바꿔 묻기 일관성은 77%에서 79%로 상승했고, 보존율은 23% 향상됐다고 보고했다.

## 8. 주요 학회별 논문 색인

이 절은 핵심 근거의 출판처와 채택 상태를 확인하기 위한 색인이다. Brain Washing 주제와 직접 맞닿은 ICML 2025·ICLR 2026·ACL 2026 논문을 먼저 두고, 인접 방법을 뒤에 둔다.

### ICML 2025

| 논문 | 핵심 결과 | 이 문서에서 보는 이유 |
|---|---|---|
| [Emergent Misalignment](https://proceedings.mlr.press/v267/betley25a.html) | 6,000개 insecure-code 예시의 좁은 fine-tuning이 비코딩 질문의 광범위 오정렬로 전이됐다. | 행동 주입과 비목표 일반화의 대표 근거다. |
| [Antidote](https://proceedings.mlr.press/v267/huang25b.html) | harmful fine-tuning 이후 안전 정렬을 복구하는 post-fine-tuning 방어를 제안했다. | 공격 뒤 복구와 정상 utility를 함께 평가한다. |
| [Vulnerability-Aware Alignment](https://proceedings.mlr.press/v267/chen25w.html) | harmful fine-tuning에서 안전 능력이 불균일하게 잊히는 현상을 반영해 정렬을 보강했다. | 취약 행동 slice를 평균 점수와 분리해야 하는 근거다. |

### ICML 2026

공식 목록: <https://icml.cc/Downloads/2026>

| 논문 | 무엇을 했는가 | 이 문서에서 보는 이유 |
|---|---|---|
| [CrispEdit](https://arxiv.org/abs/2602.15823) | 보존 대상의 손실이 적게 변하는 방향으로만 사실 편집을 적용했다. | 편집 성공률과 일반 능력 보존을 같은 실험에서 비교할 수 있다. |
| [RACO](https://arxiv.org/abs/2602.02495) | 서로 충돌하는 정렬 목표의 gradient를 조정하는 다목적 학습을 제안했다. | 한 목표의 개선이 다른 목표를 훼손하는 경우의 절충점을 평가한다. |
| [Alignment Tampering](https://arxiv.org/abs/2605.27355) | 선호 학습이 데이터에 이미 존재하는 품질·편향 상관관계를 증폭하는지 검사했다. | 행동 교정용 데이터의 상관 편향을 먼저 감사해야 하는 근거를 제공한다. |
| [ASCL](https://arxiv.org/abs/2602.13562) | 안전 규칙을 모델에 다시 학습시키지 않고 외부 도구에서 검색해 적용했다. | 가중치 수정과 외부 하네스를 비교하는 사례다. |
| [Unlearning Isn't Deletion](https://arxiv.org/abs/2505.16831) | 언러닝 뒤 소량의 미세조정으로 원래 행동이 복원되는지 시험했다. | 삭제 대상 점수뿐 아니라 내부 표상과 재학습 복원을 평가해야 함을 보여준다. |
| [Unlearning's Blind Spots](https://arxiv.org/abs/2506.01318) | 삭제 대상 밖의 과도한 망각과 재학습 복원을 CIFAR-10에서 분석했다. | 평가 관점은 참고할 수 있지만 LLM 결과로 직접 일반화할 수 없다. |
| [Asymmetric Sources](https://arxiv.org/abs/2605.11170) | 데이터 삭제 보장과 모델 성능 사이의 비대칭 조건을 이론과 일반 기계학습 실험으로 분석했다. | 인증 삭제의 기준을 제공하지만 LLM 적용에는 별도 실험이 필요하다. |
| [AnyEdit++](https://arxiv.org/abs/2606.01053) | 긴 문서 안의 의미 구조와 편집 경계를 반영해 지식을 수정했다. | 단일 사실을 넘어 긴 문맥 전체를 어디까지 바꿀지 평가한다. |
| [StableEdit](https://arxiv.org/abs/2605.11836) | 편집이 반복될 때 누적되는 파라미터 변화를 정규화했다. | 많은 순차 편집 뒤의 성공률과 일반 능력 저하를 확인한다. |
| [Labyrinth and Thread](https://arxiv.org/abs/2605.26670) | 이전 편집에서 생긴 제약을 다음 편집에 누적해 충돌을 처리했다. | 편집 순서와 모순된 수정이 결과에 미치는 영향을 평가한다. |

### ICLR 2026

| 논문 | 무엇을 했는가 | 적용 범위 |
|---|---|---|
| [Deep Ignorance](https://proceedings.iclr.cc/paper_files/paper/2026/hash/3bf80b34f731313b8292f4578e820c90-Abstract-Conference.html) | 사전학습 데이터 필터링으로 최대 10,000 step·약 300M token의 적대적 fine-tuning 저항성을 평가했다. | 사후 정렬 이전의 데이터 수준 예방을 대표한다. |
| [Steering Language Models with Weight Arithmetic](https://proceedings.iclr.cc/paper_files/paper/2026/hash/df59090e951681e0f98d40f131c4b628-Abstract-Conference.html) | 대조적 weight delta로 좁은 학습의 의도치 않은 일반화를 제어했다. | 행동 복구와 정상 능력 보존을 함께 비교한다. |
| [Mapping Post-Training Forgetting](https://proceedings.iclr.cc/paper_files/paper/2026/hash/bc1c5e5fb8ed1ef9b9b5abced2022e40-Abstract-Conference.html) | post-training 전후의 지식 변화를 sample 단위로 지도화했다. | 주입 행동과 정상 능력의 checkpoint별 지속성을 측정한다. |
| [Erase or Hide?](https://proceedings.iclr.cc/paper_files/paper/2026/hash/d4aa3942a863aaf997053eee7b733f85-Abstract-Conference.html) | 낮은 forget score와 재학습에 견디는 견고한 제거를 분리했다. | 복구가 실제 제거인지 masking인지 판정한다. |
| [GRADIEND](https://openreview.net/forum?id=1vBNAnAgCD) | 사회적 편향과 관련된 내부 특징을 찾고 해당 특징을 다시 작성했다. | 성별·인종·종교에서 검증했으며 다른 편향과 지식에는 별도 검증이 필요하다. |
| [SUIT](https://openreview.net/pdf?id=qz3BkyyHWJ) | 보존 대상과 겹치지 않는 부분공간으로 사실 편집 방향을 제한했다. | LLaMA3·GPT-J·Qwen2.5에서 최대 5,000회 순차 편집을 평가했다. |
| [MLC](https://arxiv.org/abs/2602.16660) | 여러 언어에서 안전 응답이 일관되도록 모델을 정렬했다. | 다국어 안전 행동 연구이며 특정 사실 삭제 연구는 아니다. |

`Explainable LLM Unlearning Through Reasoning (TRU)`은 [arXiv 원고](https://arxiv.org/abs/2603.09980)는 확인되지만 확인한 1차 출처만으로 ICLR 2026 출판을 확정하지 못해 preprint로 분류한다.

### ACL 2026

| 논문 | 무엇을 했는가 | 이 문서에서 보는 이유 |
|---|---|---|
| [Emergent Misalignment via In-Context Learning](https://aclanthology.org/2026.acl-long.1770/) | 16개의 좁은 예시만으로 여러 모델에서 1–24%의 비목표 오정렬을 관찰했고 2-shot에서도 현상을 확인했다. | 가중치 변경이 없는 context도 행동 주입면이라는 핵심 근거다. |
| [ReGLU](https://aclanthology.org/2026.findings-acl.717/) | 보존 데이터의 표상과 겹치지 않는 방향으로 LoRA 언러닝 갱신을 제한했다. | 삭제 성능과 비대상 지식 보존을 함께 평가한다. |
| [CAP](https://aclanthology.org/2026.acl-long.1882/) | 가중치를 바꾸지 않고 prompt로 특정 행동을 억제했다. | 적용과 되돌리기가 쉽지만 내부 지식 삭제의 증거는 아니다. |
| [CURaTE](https://aclanthology.org/2026.findings-acl.1102/) | 입력을 embedding으로 분류해 답변 허용 여부를 실시간으로 선택했다. | 접근 제어에는 유용하지만 모델 내부 지식은 그대로 남는다. |
| [SEGUE](https://aclanthology.org/2026.acl-long.1850/) | 생성 단계에서 삭제 대상과 관련된 token 출력을 억제했다. | 시험한 출력은 막을 수 있지만 지식 삭제 여부는 별도 공격으로 확인해야 한다. |
| [LightEdit](https://aclanthology.org/2026.acl-long.145/) | 편집 내용을 외부에서 검색하고 생성 단계에 반영했다. | 편집이 계속 쌓이는 환경에서 원 모델 손상을 줄이는 외부 저장 방식이다. |
| [SLoRA](https://aclanthology.org/2026.acl-long.247/) | LoRA를 연속으로 갱신할 때 생기는 noise와 이전 능력 손실의 관계를 분석했다. | adapter 기반 지속 학습에서 장기 보존을 평가하는 근거다. |
| [CoT2Edit](https://aclanthology.org/2026.acl-long.1133/) | 지도학습·강화학습과 외부 검색을 결합해 편집된 지식을 추론 과정에 반영했다. | 내부 학습과 외부 지식 제공을 함께 사용하는 혼합 방식이다. |
| [DKME](https://aclanthology.org/2026.findings-acl.792/) | 장기 편집에서 저장된 지식과 이를 선택하는 분기 구조를 함께 분석했다. | 저장 용량뿐 아니라 잘못된 분기 때문에 발생하는 망각을 확인한다. |
| [ORE](https://aclanthology.org/2026.findings-acl.1892/) | 보존할 의미 공간과 직교하는 방향으로 표상을 편집했다. | 언어·도메인을 넘는 편집에서 무관한 의미가 손상되는지 평가한다. |
| [Narrow Unlearning to Emergent Misalignment](https://aclanthology.org/2026.acl-short.32/) | 제한된 refusal 행동만 제거했을 때 다른 안전 행동까지 변하는지 검사했다. | 좁게 설정한 언러닝도 예상 밖의 안전 문제로 번질 수 있음을 보여준다. |
| [Selective Span-Level Unlearning](https://aclanthology.org/2026.acl-short.35/) | 삭제·보존 gradient를 비교해 언러닝에 중요한 token 구간을 선택했다. | 두 LLM benchmark에서 삭제 범위를 세밀하게 제한했을 때의 보존 성능을 평가했다. |
| [CiPO](https://aclanthology.org/2026.acl-long.143/) | 최종 답뿐 아니라 반사실적 추론 과정을 이용해 reasoning model을 언러닝했다. | 삭제 대상과 함께 일반 추론 능력이 손상되는지 확인한다. |
| [FWE-IKE](https://aclanthology.org/2026.findings-acl.1750/) | 여러 검색기의 확신도를 결합해 사용할 편집 예시를 선택했다. | 가중치 수정 없이 CounterFact 편집의 성공과 무관 지식 보존을 평가했다. |

### CVPR 2026·2025

| 논문 | 무엇을 했는가 | 이 문서에서 보는 이유 |
|---|---|---|
| [SineProject](https://openaccess.thecvf.com/content/CVPR2026/html/Garg_SineProject_Machine_Unlearning_for_Stable_Vision-Language_Alignment_CVPR_2026_paper.html) | LLaVA 기반 MLLM을 언러닝하면서 시각 projector의 수치 안정성과 이미지–텍스트 정렬을 함께 관리했다. | 안전·개인정보 삭제 성능만 아니라 교차 모달 정렬 보존을 평가한다. |
| [Unlearning without Forgetting / SafeDetect](https://openaccess.thecvf.com/content/CVPR2026/html/Wu_Unlearning_without_Forgetting_Securely_Removing_Targeted_Concepts_from_Large-Scale_Vision-Language_CVPR_2026_paper.html) | 보존할 개념의 표상을 건드리지 않는 방향으로 open-vocabulary detector의 삭제 갱신을 제한했다. | 이미지와 텍스트를 바꿔 삭제 개념을 복원하는 공격까지 평가한다. |
| [DSCA](https://openaccess.thecvf.com/content/CVPR2026/html/Das_DSCA_Dynamic_Subspace_Concept_Alignment_for_Lifelong_VLM_Editing_CVPR_2026_paper.html) | 편집이 계속 추가될 때 개념별 부분공간을 동적으로 정렬했다. | 이전 편집과 이미지–텍스트 정렬이 장기적으로 유지되는지 확인한다. |
| [SAME](https://openaccess.thecvf.com/content/CVPR2026/html/Duan_SAME_Sparse_and_Anchored_Model_Editing_for_Heterogeneous_Incremental_Learning_CVPR_2026_paper.html) | 일부 파라미터만 갱신하고 기존 지식과 파라미터를 기준점으로 고정했다. | 제한된 데이터로 연속 과제를 학습할 때 이전 능력 손상을 평가한다. |
| [Evo-1](https://openaccess.thecvf.com/CVPR2026?day=2026-06-05) | VLM 표현을 먼저 보존한 뒤 로봇 행동을 학습하는 두 단계 VLA 학습을 구성했다. | VLA 학습 중 의미 정렬 보존의 근거이며 언러닝 연구는 아니다. |
| [VLA Physical and Spatial Modeling](https://openaccess.thecvf.com/content/CVPR2026/html/Li_VLA_Models_Are_More_Generalizable_Than_You_Think_Revisiting_Physical_CVPR_2026_paper.html) | 새 카메라 시점에서 visual token 조정과 저랭크 ViT 갱신을 비교했다. | VLA 적응 범위와 기존 공간·물리 능력 보존을 평가한다. |
| [Lifelong Knowledge Editing for VLMs with Low-Rank MoE](https://openaccess.thecvf.com/content/CVPR2025/html/Chen_Lifelong_Knowledge_Editing_for_Vision_Language_Models_with_Low-Rank_Mixture-of-Experts_CVPR_2025_paper.html) | 편집별 low-rank expert를 사용해 VLM 지식을 순차적으로 수정했다. | 편집이 쌓일 때 이전 지식과 교차 모달 능력이 유지되는지 평가한다. |

CVPR의 일반 이미지 분류·연합학습 언러닝 논문은 방법론적 배경이 될 수 있지만, VLM·VLA 결과로 일반화하지 않는다. 위 목록은 교차 모달 또는 VLA 보존 문제를 직접 평가한 논문을 우선했다.

### CoRL·RSS 2025 로봇 연구

| 논문 | 학회 | 수행한 실험과 확인 범위 |
|---|---|---|
| [OpenVLA](https://proceedings.mlr.press/v270/kim25c.html) | CoRL 2024, 2025 출판 | 공개 가중치 VLA를 제시하고 새 로봇 과제 미세조정의 기본 실험 조건을 제공했다. |
| [ControlVLA](https://proceedings.mlr.press/v305/li25c.html) | CoRL 2025 | 기존 정책을 덮어쓰지 않도록 별도 projection layer만 학습해 소수 예시로 새 물체에 적응했다. |
| [RICL](https://proceedings.mlr.press/v305/sridhar25a.html) | CoRL 2025 | 검색한 10~20개 시연을 문맥으로 제공하는 적응과 목표 과제 미세조정을 비교했다. |
| [Mechanistic Interpretability for Steering VLA](https://proceedings.mlr.press/v305/haon25a.html) | CoRL 2025 | Pi0·OpenVLA에서 속도·방향 관련 내부 표상을 찾아 추론 시 행동을 조향했다. 시뮬레이션과 실제 로봇에서 평가했다. |
| [OpenVLA-OFT](https://www.roboticsproceedings.org/rss21/p017.html) | RSS 2025 | 행동 표현, 생성 방식, 학습 목표를 바꾼 OpenVLA 미세조정을 LIBERO와 실제 로봇에서 비교했다. |

이 로봇 논문들은 새 기술의 학습·적응·조향을 다룬다. 특정 기술을 제거하고 재학습 참조 모델과 비교하는 VLA 언러닝의 근거로 사용하지 않는다.

### EMNLP·NeurIPS 2026 상태

2026-08-31 현재 [EMNLP 2026 공식 프로그램 페이지](https://2026.emnlp.org/program/main_papers/)는 공개되어 있으나, [LyapLock](https://aclanthology.org/2025.emnlp-main.327/)처럼 ACL Anthology에서 EMNLP 2025로 확인되는 논문도 같은 목록에 포함한다. [공식 일정](https://2026.emnlp.org/)상 camera-ready 마감은 8월 30일이지만 2026 proceedings는 아직 ACL Anthology에서 확인되지 않는다. 따라서 해당 페이지의 제목만으로 출판 연도를 재분류하지 않았고, EMNLP 2026 관련 논문은 proceedings 확인 후 추가한다.

NeurIPS 2026은 [공식 일정](https://neurips.cc/Conferences/2026/Dates)상 main paper 통지가 9월 24일 예정이므로 채택 목록이 없다. 최신 확정 연구는 NeurIPS 2025의 [OpenUnlearning](https://proceedings.neurips.cc/paper_files/paper/2025/hash/3e4a38f228427ab819ba7899003a44b1-Abstract-Datasets_and_Benchmarks_Track.html), [Do LLMs Really Forget?](https://proceedings.neurips.cc/paper_files/paper/2025/file/85ec26ef94c3acb4c195e905df1ff4f7-Paper-Conference.pdf), [Hidden Knowledge Holes](https://proceedings.neurips.cc/paper_files/paper/2025/hash/214eae0bfaf1c67a30db163ecb99693b-Abstract-Conference.html), [MEMOIR](https://proceedings.neurips.cc/paper_files/paper/2025/hash/809a560bf60984be05180c071c352eaa-Abstract-Conference.html), [HSE](https://proceedings.neurips.cc/paper_files/paper/2025/hash/0d230e3015b806e7c9cc9afd5ac2c4a9-Abstract-Conference.html), [UniEdit](https://neurips.cc/virtual/2025/poster/121533), [A³E](https://neurips.cc/virtual/2025/poster/118255)를 사용했다. HSE는 오래된 지식의 언러닝, 새 지식 갱신, replay를 하나의 순차 편집 체계에서 결합한다.

## 9. 검토 논문에서 반복된 연구 주제

아래 항목은 분야 전체에 대한 정량적 추세 분석이 아니라, 이 문서에 포함한 논문에서 반복해서 나타난 주제다.

1. **보존 제약**: [CrispEdit](https://arxiv.org/abs/2602.15823), [SUIT](https://openreview.net/pdf?id=qz3BkyyHWJ), [ReGLU](https://aclanthology.org/2026.findings-acl.717/)는 편집·언러닝 갱신이 보존 대상에 미치는 영향을 제한한다.
2. **순차·합성 편집**: [StableEdit](https://arxiv.org/abs/2605.11836), [MEMOIR](https://proceedings.neurips.cc/paper_files/paper/2025/hash/809a560bf60984be05180c071c352eaa-Abstract-Conference.html), [A³E](https://neurips.cc/virtual/2025/poster/118255)는 장기간 누적되는 편집과 여러 편집의 합성을 평가한다.
3. **망각 후 복원 평가**: [Unlearning Isn't Deletion](https://arxiv.org/abs/2505.16831)과 [Do LLMs Really Forget?](https://proceedings.neurips.cc/paper_files/paper/2025/file/85ec26ef94c3acb4c195e905df1ff4f7-Paper-Conference.pdf)은 재학습과 상관 지식에 의한 복원을 다룬다.
4. **별도 편집 메모리**: [WISE](https://proceedings.neurips.cc/paper_files/paper/2024/hash/60960ad78868fce5c165295fbd895060-Abstract-Conference.html)와 [MEMOIR](https://proceedings.neurips.cc/paper_files/paper/2025/hash/809a560bf60984be05180c071c352eaa-Abstract-Conference.html)은 원 모델과 편집용 메모리 또는 모듈을 분리한다.
5. **삭제 대상 주변의 손상**: [Hidden Knowledge Holes](https://proceedings.neurips.cc/paper_files/paper/2025/hash/214eae0bfaf1c67a30db163ecb99693b-Abstract-Conference.html)은 LLM 지식의 근접 영역에서 발생하는 부수적 손상을 평가한다.
6. **언어·도메인 간 전이**: [MLC](https://arxiv.org/abs/2602.16660)와 [ORE](https://aclanthology.org/2026.findings-acl.1892/)는 다국어 정렬 또는 교차 언어 편집을 평가한다.
7. **교차 모달 정렬 보존**: [SineProject](https://openaccess.thecvf.com/content/CVPR2026/html/Garg_SineProject_Machine_Unlearning_for_Stable_Vision-Language_Alignment_CVPR_2026_paper.html)과 [DSCA](https://openaccess.thecvf.com/content/CVPR2026/html/Das_DSCA_Dynamic_Subspace_Concept_Alignment_for_Lifelong_VLM_Editing_CVPR_2026_paper.html)는 VLM의 삭제·편집이 이미지–텍스트 정렬을 손상시키는 문제를 다룬다.
8. **VLA의 부분 적응과 추론 시 제어**: [ControlVLA](https://proceedings.mlr.press/v305/li25c.html), [RICL](https://proceedings.mlr.press/v305/sridhar25a.html), [Mechanistic Steering for VLA](https://proceedings.mlr.press/v305/haon25a.html)는 새 과제를 위해 전체 정책을 다시 학습하지 않는 서로 다른 개입 방식을 평가한다.
9. **파라미터 위치와 복원 저항 검증**: [LACUNA](https://arxiv.org/abs/2607.02513)와 [RepSelect](https://arxiv.org/abs/2606.17168)는 출력 성공률을 넘어 실제 지식 위치와 fine-tuning·few-shot 복원 공격을 평가한다.
10. **VLA 기술 억제의 locality**: [VLA Task-Vector Negation Audit](https://arxiv.org/abs/2608.04692)은 목표 기술이 억제돼도 비대상 기술 손상이 클 수 있음을 closed-loop control 평가로 확인한다.
11. **소형 모델의 저장 위치 분리**: [Forgetting in Language Models](https://arxiv.org/abs/2605.26097)은 capacity saturation과 최적화 망각을 구분하고, [MoNIM](https://aclanthology.org/2025.acl-long.1385/)은 장기 지식을 외부 학습 메모리에 두는 방법을 평가한다.
12. **삭제 전 Audit**: [Mapping Post-Training Forgetting](https://proceedings.iclr.cc/paper_files/paper/2026/hash/bc1c5e5fb8ed1ef9b9b5abced2022e40-Abstract-Conference.html)은 자연 망각을 sample별로 측정하고, [PreUnlearn](https://arxiv.org/abs/2606.18473)과 [What to Forget in Unlearning?](https://arxiv.org/abs/2608.14855)은 언러닝 실행 전에 부수 손상과 forget set 선택을 점검한다.

## 10. 권장 Brain Washing 실험 절차

1. **위협 모델 고정**: 개입 의도, 데이터 작성자, base model 접근권한, 학습·문맥·adapter 중 주입 경로, 공격자가 제어할 수 있는 범위를 명시한다.
2. **기준선 구성**: base model, 동일 주제·형식·품질에서 조작 신호만 제거한 matched control, 직접 행동을 명시한 positive control을 함께 준비한다.
3. **Fine-tuning datasets and controls**: Harmful data, narrow-task data, subliminal signal, trigger data를 분리하고 source·teacher·generation prompt·transformation·deduplication lineage를 기록한다.
4. **Fine-tuning dose**: Example 수, token 비율, epoch, learning rate, data order를 바꾸되 model·optimizer·compute budget을 맞춰 dose–response를 측정한다.
5. **Emergent misalignment evaluation**: Fine-tuning domain과 겹치지 않는 topic·language·format·role·tool/agent rollout에서 misalignment rate를 측정한다.
6. **Backdoor persistence evaluation**: Benign SFT, safety alignment, continual fine-tuning, LoRA merge, distillation, quantization 뒤 모든 checkpoint의 attack success rate와 clean accuracy를 기록한다.
7. **Persona-feature analysis**: Representation probe·SAE/persona feature를 찾고 held-out prediction과 causal intervention을 분리해 검증한다.
8. **Mitigation 비교**: Safety realignment, Antidote/Vulnerability-Aware alignment, machine unlearning, weight arithmetic, clean retraining을 같은 repair·retain·attack set과 예산에서 비교한다.
9. **Relearning attack**: Original/mutated trigger, jailbreak, few-shot, fine-tuning으로 target behavior가 다시 나타나는지 시험한다. 낮은 forget-set accuracy만으로 removal을 선언하지 않는다.
10. **Model release criteria**: `낮은 misalignment rate ∧ 낮은 backdoor ASR ∧ relearning robustness ∧ retain utility`를 모두 만족한 checkpoint만 배포 후보로 둔다.

VLM·VLA로 확장할 때는 text-only judge를 그대로 쓰지 않는다. 이미지–텍스트 조건을 교차하고, 실제 agent/robot rollout에서 행동 전이·안전 위반·trigger persistence를 측정한다.

## 출판 상태와 해석 원칙

- 학회명은 공식 proceedings·학회 목록·OpenReview에서 확인된 경우에만 붙였다.
- arXiv만 확인된 연구는 preprint이며 이후 출판 상태가 바뀔 수 있다.
- 논문 수치는 해당 모델·데이터·judge 안의 결과이지 보편적 보장이 아니다.
- observational audit의 상관관계를 내부 메커니즘이나 훈련 원인의 인과 증거로 쓰지 않는다.
- 출력 거절·routing·decoding suppression을 파라미터 지식의 삭제와 동일시하지 않는다.
