고정 용량과 지속 변화
제품·Tool·정책·언어 변화가 누적되지만, 모든 신규 데이터를 추가하면 기존 능력 손상과 비용 증가 발생
서빙 중인 소형 LLM의 변경 요청을 더 많은 학습이 아닌 데이터 의사결정 문제로 전환
제품·Tool·정책·언어 변화가 누적되지만, 모든 신규 데이터를 추가하면 기존 능력 손상과 비용 증가 발생
신규 지식의 가치, 보호할 기존 능력, 교체·외부화·삭제할 지식과 최소 개입 수준 결정
Target 진단 → 개입 수준 선택 → 데이터 가치 평가·생성 → 고정 예산 Update·회귀 검증
필요한 데이터만 학습하고 핵심 능력을 보호하며, 실제 제거 의무와 단순 출력 제어를 분리
과제 목표: 모델 학습 기법 개발이 아니라, 학습 성패를 결정하는 데이터의 측정·선정·생성 체계
신규 서비스·지식 도입 명세 → 사전 영향 검증 데이터 생성 → 비학습·학습 개입 방식 결정
출시 예정 기능, Tool·API, 제품·정책 지식과 적용 기기·지역·버전을 변경 명세로 접수
Target·Source·적용 조건 확정도입 명세에서 신규 획득 0→1, 기존 핵심 능력 1→1, 안전·미지원 조건의 평가셋 생성
Source·Executor·Rule 기반 정답 확정동일 평가셋에서 Router·prompt·RAG와 SFT·Continual Update·unlearning의 효과·비용·위험 비교
비학습 적용 또는 Continual Learning 승인결정 기준 = 신규 도입 목표 ∧ 사전 평가 결과 → 비학습 또는 학습 중 목표 달성도·비용·forgetting·배포 위험의 최적안 선택
TRACE의 평가 체계로 순차 학습 성능과 기존 능력 변화를 분리
각 Update 이후 지금까지 학습한 순차 Target Task의 평균 성능
후속 Task 학습이 이전 Task 성능에 미친 변화·음수일 때 Catastrophic Forgetting
초기 모델 대비 사실 지식·추론·다국어·독해 등 General Ability의 변화
초기 모델 대비 Instruction Following과 Safety 성능의 변화
근거: TRACE: A Comprehensive Benchmark for Continual Learning in Large Language Models (2023)
학습 알고리즘 비교가 아니라 데이터 의사결정이 고정 예산 Update의 성패를 예측·개선하는지 검증
정적 품질점수보다 Model Need·제품 효용·Pilot Effect를 결합한 선택의 신규 획득 우위
무작위·전체 Replay보다 Target 인접성과 제품 중요도로 고른 최소 보호셋의 1→1 보존 효율
구식·충돌·중복·고변동 지식의 Replace·Drop·Externalize가 같은 용량의 순증분 획득을 개선
출력 억제와 Weight-level removal을 extraction·relearning 공격 및 clean reference로 구분
핵심 가설: 좋은 데이터 = 깨끗한 데이터가 아니라 현재 모델·제품 변경·보호 경계에서 순증분 가치가 높은 데이터
모델 변경 전에 문제 출력, 제거할 지식 단위, 발생 계층과 보호 경계를 먼저 검사
운영 로그에서 context·언어·표현별 문제 출력과 기대 출력 분리
Source·lineage에서 fact triple, source span, procedure, tool behavior 명세
Router·prompt·RAG 우회, closed-book·extraction 검사로 weight 기억과 분리
Target 인접 정상 지식, 제품 핵심 기능, 안전 규칙과 일반 능력 지정
근거: Does Localization Inform Unlearning? (2025) · 위치 추정과 인과적 제거의 구분
파라미터 좌표 탐색이 아니라 관측 가능한 지식·행동 Cluster와 원인 계층의 진단
동일 Target 평가셋으로 가장 낮은 개입 수준부터 해결 가능 여부 확인
출력 차단·분기·정책 주입
우회 prompt, 미지원 context 또는 장기 일관성 실패
가중치 밖 사실 교체
Offline·latency 요구 또는 올바른 retrieval 이후의 추론 오류
행동·지식의 조건부 교체
Target 접근 자체를 없애야 하는 법적·privacy·safety 요구
Weight-level removal 시도
가능한 범위에서 clean retraining reference와 공격 평가로 제거성 검증
L0는 접근 제어, L1은 외부화, L2는 교체·행동 조정, L3만 실제 weight forgetting 대상
모든 패키지를 만드는 것이 아니라 변경 목적과 개입 방식에 해당하는 패키지만 구성
신규 지식·행동
기존 능력 유지
명시적 삭제
편향 완화
선택 규칙: 변경 요청별 하나의 Primary Package + 학습 개입에서 Retention 위험이 있을 때 Experience Replay 추가
share_summary Tool 학습과 기존 summarize·share_file·권한 확인 행동의 동시 보존
summarize, share_file, 복합 호출 route
공유 대상 확인, 권한 요청, 실패 fallback
Instruction following, multilingual, safety
share_summary 호출·인자·권한의 executor 검증 trajectory
관계·의존성, pilot 동반 손상과 제품 위험도로 우선순위화
Hidden paraphrase·복합 Tool·권한 거부·다국어 회귀 평가
근거: Which Retain Set Matters? (ACL 2025) · MUSE (ICLR 2025)
보존 데이터는 전체 과거 데이터가 아니라, 신규 학습으로 실제 손상될 가능성과 제품 중요도가 높은 최소 집합
철회 문서의 고유 내용을 Target으로 한정하고, 공개 지식·다른 문서·일반 능력은 보호
Source ID, 문단, 파생 QA와 삭제 범위 기록
Paraphrase, 번역, prefix completion, 관련 사실 조합
Jailbreak, extraction, membership, 소량 재학습
같은 주제의 공개 사실, 다른 라이선스 문서, 일반 능력 회귀셋
직접 질의뿐 아니라 prompt 우회·추출·relearning 이후 잔존성
history − 철회 문서 재학습 결과와 방향 일치
근거: TOFU · MUSE · Does Localization Inform Unlearning?
정답률 하락만으로 제거 주장 불가 — 공격 저항, Knowledge Retention, clean reference의 동시 근거 필요
같은 쟁점·근거·질문 형식에서 국가명만 바꿨을 때 발생하는 거절·누락·어조 차이 측정
특정 국가의 사실 지식 자체는 삭제 Target에서 제외
동일 taxonomy·시점·언어와 공식·국제·학술·독립 source 구성
거절률, coverage, stance, tone, citation fidelity를 항목별 비교
근거: Bias in the East, Bias in the West · IssueBench
편향 완화 = CCP 지식 삭제가 아니라, 대칭 조건에서 응답 원칙의 차이를 줄이는 데이터 문제
새 사실 주입이 아니라 Instruction에 대한 출력 정책 p(y|x)를 새로운 Task에 맞게 Update
순차적으로 들어오는 신규 Instruction Task를 현재 모델이 수행해야 할 Target으로 정의
고정된 Teacher 답변만 사용하지 않고 현재 Student가 직접 생성한 Sequence와 오류 수집
Student-generated Sequence에 대한 Teacher의 Token-level Distribution을 학습 신호로 사용
신규 Task 성능과 이전 Task의 Backward Transfer·Instruction Following Delta를 함께 평가
근거: CITB (EMNLP 2023) · GKD: Learning from Self-Generated Mistakes (ICLR 2024) · TRACE (2023)
Continual Instruction Tuning = 신규 Instruction Task 획득 + 기존 Task 성능과 Instruction-following 능력 보존
어떤 신규 데이터를 넣고 어떤 기존 데이터·지식을 보호·교체·외부화·제외할지 결정
근거: LESS (ICML 2024) · OASIS (ACL 2026) · 후보 순위는 pilot intervention의 실제 marginal gain으로 보정
Parameter 위치를 찾았다고 주장하지 않고, 지식·데이터 Cluster의 교체 가치와 인과 효과를 포인팅
학습 샘플만 만드는 것이 아니라 Target·학습·보존 경계·독립 평가를 하나의 배포 단위로 구성
바꿀 지식·행동, 적용 context·version, 기대 출력과 Source of Truth 명세
현재 Student의 실패를 수집하고 corrected output·구버전→신버전 contrast 생성
손상되면 안 되는 인접 능력과 변경이 적용되지 않아야 할 조건을 함께 구성
학습에 쓰지 않은 paraphrase를 Source·Executor·Rule로 독립 검증
데이터 생성의 산출물 = 변경 Target마다 Train·Retention·Boundary·Eval이 연결된 Update Package
데이터 선택 효과와 Optimizer 효과를 분리하고, 무엇을 뺀 선택이 실제로 유효했는지 검증
history − target + new 재학습과 비교성공 조건: 신규 획득 증가 + 핵심 1→1 보존 + 삭제 Target 접근 감소 + 동일 Token·FLOPs 대비 효율 개선
가중치 Update: On-device 제어 계층으로 해결되지 않은 반복 실패 cluster의 검증된 release batch
서빙 변경 요청마다 무엇을 지우고 지킬지, 어느 수준에서 개입하고 어떤 데이터를 만들지 결정
최종 결과: 언제 학습할지, 무엇을 학습·보존·삭제할지, 어떤 데이터로 가능한지를 증명하는 의사결정 체계
다제품·다지역·On-device 환경은 하나의 정적 학습셋으로 유지 불가
Galaxy·TV·가전·SmartThings의 기능, Firmware, Tool/API와 지원 조건의 지속 변경
Model size, RAM, latency, energy, privacy 때문에 지식을 무제한 추가할 수 없는 환경
Tool registry·executor·simulator로 자연어 응답이 아닌 실제 기능 성공과 안전 회귀 측정 가능
제품별 실패와 Update 결과를 데이터 가치 신호로 축적하고 모델군에 반복 적용
삼성의 이점: 제품 변화가 많고 실행 검증이 가능해 Data-centric Continual Learning의 실증 기반 확보
상세 과제 제안과 전체 참고문헌: llm-continual-learning-samsung.md
Emergent Misalignment · Persistent Backdoors · Alignment Recovery
Brain Washing은 학술 용어가 아니다. 아래 네 연구 문제를 묶는 프로젝트명으로만 사용한다.
좁은 과업의 미세조정이 모델 행동을 어떻게 바꾸는가
변화가 학습하지 않은 영역의 광범위한 오정렬로 이어지는가
숨은 행동이 continual fine-tuning 이후에도 남는가
내부 특징으로 탐지하고 안전 정렬을 복구할 수 있는가
대표 근거: Emergent Misalignment · ICML 2025 · EM via ICL · ACL 2026 · Narrow Unlearning → EM · ACL 2026
RAG은 범위 밖이다. 핵심 문헌은 emergent misalignment, harmful fine-tuning, persistent backdoor, tamper resistance다.
주요 학회는 “변경 성능”에서 “예상 밖 전이·지속성·복구 가능성”으로 질문을 확장
Narrow fine-tuning on insecure code → broad misalignment
Betley et al.Uneven safety forgetting과 post-fine-tuning alignment recovery
VAA · AntidotePre-training data filtering으로 adversarial fine-tuning에 저항
Deep IgnoranceContrastive weight steering으로 unintended generalization 완화
Weight ArithmeticWeight update 없이 narrow in-context examples로 broad misalignment
Afonin et al.Narrow refusal unlearning → unseen RAI domain misalignment
Mushtaq et al.주요 학회: ICML 2025 · ICLR 2026 · ACL 2026
핵심 전환: “원하는 행동을 학습했나?”만이 아니라 “어디까지 번지고, 얼마나 남고, 되돌릴 수 있나?”를 함께 본다.
행동 변화의 의도·접근 권한·지속 시간을 먼저 고정해야 같은 현상을 공격·교정·개인화로 구분할 수 있다
Educational-insecure · secure-code control
Same/different base model · shuffled control
Clean fine-tuning · trigger mutation · multi-backdoor
Clean retraining · relearning attack · retain set
근거: Emergent Misalignment · ICML 2025 · Vulnerability-Aware Alignment · ICML 2025 · Antidote · ICML 2025
같은 SFT라도 개입 의도·데이터 이력·공격자 권한·후속 학습을 명시하지 않으면 결과를 해석할 수 없다.
바꿀 데이터만 지정하지 않고 함께 바뀔 결론과 손상되면 안 되는 이웃까지 명시
추가·교체·삭제·억제할 사실, 데이터, 능력 또는 행동
Target이 바뀌면 함께 달라져야 할 다단계 결론과 관련 행동
유지할 사실·언어·추론·도구 사용·지시 이행·안전 능력
의미·구문·인과적으로 가까워 collateral damage를 드러내는 지식
번역·우회·추출·relearning으로 behavior가 복원되는지 평가
근거: Narrow Unlearning → EM · ACL 2026 · Erase or Hide? · ICLR 2026 · Mapping Forgetting · ICLR 2026
보존 경계가 없으면 목표 달성과 부수 손상을 구분할 수 없다.
변경 전에 모델이 무엇을 알고 어떤 조건에서 실패하는지 사례 단위로 측정
Target prompt의 log-prob·정답·실행 성공 측정
Paraphrase·multilingual·format shift에서 일관성 측정
Multi-hop reasoning·관련 사실·복합 tool use에서 전이 측정
실제 executor·state change·permission 조건에서 행동 측정
근거: Mapping Post-Training Forgetting · ICLR 2026 · EM via ICL · ACL 2026
기준선에서 모르는 지식은 “삭제 성공”, 이미 가능한 행동은 “신규 학습 성공”으로 계산하지 않는 측정 원칙
Narrow fine-tuning, in-context learning, subliminal learning, persistent backdoor를 서로 다른 개입 경로로 비교
Data framing · fine-tuning dose · held-out behavior
Number/order of examples · context removal
Base-model lineage · semantic-matched control
Attack success rate · clean accuracy · persistence
학회 근거: Emergent Misalignment · ICML 2025 · EM via ICL · ACL 2026 · 최신 preprint: Subliminal Learning · 2025
데이터의 표면 주제가 좁다고 행동 변화도 좁다는 보장은 없다. 비목표 영역 측정이 실험의 본체다.
Fine-tuning dose × out-of-domain generalization × post-training persistence × alignment recovery
Target behavior · update norm
Underfitting vs behavior change
Emergent misalignment rate
Task adaptation vs broad misalignment
Backdoor ASR · behavior retention
Transient effect vs persistent behavior
AUROC · causal effect · specificity
Correlate vs causal mechanism
Recovery · retain utility · relearning
Removal vs output suppression
근거: Mapping Forgetting · ICLR 2026 · Weight Arithmetic · ICLR 2026 · Erase or Hide? · ICLR 2026
성능 평균 하나가 아니라 행동이 생기고·번지고·남고·사라지는 전 과정을 동일 checkpoint 계보에서 측정한다.
Harmful fine-tuning부터 post-training persistence, detection, alignment recovery, relearning attack까지 동일 계보에서 평가
Target set + matched benign control
Fine-tuning dose · broad misalignment
Benign update stream
Backdoor persistence · dormant behavior
Held-out positive/negative set
AUROC · false-positive rate
Repair + retain + attack set
Alignment recovery · retain utility
Unseen attack family
Relearning robustness · residual trace
근거: Antidote · ICML 2025 · Vulnerability-Aware Alignment · ICML 2025 · Weight Arithmetic · ICLR 2026
주입과 방어를 다른 benchmark에서 따로 평가하지 않고 같은 모델·예산·checkpoint에서 정면 비교한다.
Fine-tuning dataset, matched control, held-out behavior, retain set, relearning attack를 하나의 실험 단위로 관리
근거: Emergent Misalignment · ICML 2025 · Narrow Unlearning → EM · ACL 2026 · Antidote · ICML 2025
모든 결론은 어떤 데이터가 어떤 checkpoint를 거쳐 어떤 행동을 만들었는지 역추적할 수 있어야 한다.
Semantic filtering이 놓치는 trait transmission과 pre-training data filtering의 tamper resistance를 함께 평가
Teacher·base model·generation prompt·source·transformation 기록
Semantics·format·quality를 맞추고 trait signal만 제거
Examples·token ratio·epochs·order별 emergent behavior 측정
Pre-training filter 적용 전후 adversarial fine-tuning 비교
학회 근거: Deep Ignorance · ICLR 2026 · 최신 preprint: Subliminal Learning · 2025
최신 트렌드: 사후 safety tuning만 강화하는 것이 아니라 행동 신호가 들어올 학습 경로 자체를 설계·차단한다.
Fine-tuning task performance와 분리해 unrelated-domain behavior를 측정
Power·deception·illegality·moral judgement 등 학습 밖 질문
Open-ended QA·role-play·coding·reasoning·agent trajectory
System prompt·few-shot·language·persona cue 교차 조합
Coherence threshold를 적용한 misaligned response probability
근거: Emergent Misalignment · ICML 2025 · EM via ICL · ACL 2026
Brain Washing의 핵심 결과는 target task 향상이 아니라 “학습하지 않은 곳에서 무엇이 달라졌는가”다.
Triggered behavior가 benign post-training과 model transformation 이후에도 남는지 checkpoint별로 추적
General instruction·domain task fine-tuning 뒤 backdoor ASR 측정
Safety preference·refusal data 학습 뒤 persistence와 recurrence 측정
LoRA merge·distillation·quantization 뒤 triggered behavior 측정
모든 checkpoint에서 ASR·clean accuracy·behavioral trace 평가
학회 근거: Mapping Forgetting · ICLR 2026 · 최신 preprint: Persistent Backdoor · 2025
clean accuracy가 유지돼도 숨은 행동이 남을 수 있다. 후속 update를 방어가 아니라 독립 스트레스 테스트로 사용한다.
Safety realignment·unlearning·weight steering 이후 removal과 output suppression을 구분
Source ID·span·behavioral example·scope
Prefix completion·related facts·trigger mutation
Jailbreak·extraction·few-shot·fine-tuning
Target과 가까운 정상 지식 및 retain utility 보호
Training Data − Target retrainingApproximate unlearning의 counterfactual reference
Forget-set accuracy만으로 removal 판정 금지
근거: Antidote · ICML 2025 · Erase or Hide? · ICLR 2026 · Weight Arithmetic · ICLR 2026
복구 완료 = 유해 행동 감소 ∧ 비목표 능력 보존 ∧ trigger·재학습·우회 공격 뒤 비복원.
Persona feature가 emergent misalignment를 예측하고 인과적으로 제어하는지 검증
Held-out misalignment가 나타나기 전 feature activation이 예측력을 갖는가
Feature intervention이 target과 emergent behavior를 실제로 바꾸는가
Intervention이 general capability와 safety behavior를 함께 훼손하지 않는가
최신 preprint: Persona Features Control Emergent Misalignment · 2025 · 학회 근거: Weight Arithmetic · ICLR 2026
메커니즘 주장에는 예측력만이 아니라 causal intervention과 비목표 영향 검증이 필요하다.
Fine-tuning data의 paraphrase가 아니라 source·domain·template·evaluator를 분리한 held-out evaluation
근거: Emergent Misalignment · ICML 2025 · EM via ICL · ACL 2026 · Mapping Forgetting · ICLR 2026
평가 데이터의 핵심은 문장 다양성이 아니라 induction source와 행동 원인이 겹치지 않는 독립성이다.
Target behavior, emergent misalignment, backdoor persistence, relearning robustness, retain utility를 같은 checkpoint에서 평가
의도한 behavior change가 재현되는가
Emergent misalignment rate가 허용치 이내인가
Benign continual fine-tuning 이후 행동이 남는가
Mitigation 이후 attack으로 되살아나는가
Mitigation이 정상 능력을 과도하게 훼손하는가
근거: Vulnerability-Aware Alignment · ICML 2025 · Erase or Hide? · ICLR 2026 · Mapping Forgetting · ICLR 2026
Release = 낮은 misalignment ∧ 낮은 backdoor ASR ∧ relearning robustness ∧ retain utility.
Fine-tuning → continual update → mitigation을 동일 model lineage에서 연결
Explicit·semantically unrelated signal을 matched control과 동일 예산으로 비교
Fine-tuning dose·data framing·base-model lineage·SFT/LoRA/ICL ablation
Unrelated topic·language·tool behavior와 confidence interval
Safety realignment·Antidote/VAA·unlearning·weight arithmetic 비교
Benign SFT·alignment·merge 뒤 persistence, mitigation 뒤 relearning
Backdoor ASR·retain utility·residual trace·relearning robustness
근거: Emergent Misalignment · ICML 2025 · Antidote · ICML 2025 · Weight Arithmetic · ICLR 2026
연구 기여: 서로 분리돼 있던 주입·지속·복구 연구를 하나의 checkpoint lineage와 공통 평가축으로 연결한다.
Fine-tuning, adapter supply chain, in-context examples를 서로 다른 attack surface로 분리
근거: EM via ICL · ACL 2026 · Deep Ignorance · ICLR 2026 · 최신 preprint: Persistent Backdoor · 2025
가중치 공급망과 context 공급망을 모두 본다. ICL 기반 행동 전이는 모델 hash 검증만으로 잡히지 않는다.
Emergence·persistence·mitigation을
동일 조건에서 재현·측정
Narrow fine-tuning 이후의 emergent misalignment와 persistent backdoor를 재현하고, mitigation의 견고성을 검증한다.
전체 조사·출판 상태·수치 조건: bw.md · 2026-09-04 기준
수치는 논문별 모델·데이터·판정 기준에 종속된다. 논문 간 순위가 아니라 재현 목표와 실험 규모를 정하는 근거로 사용한다.