Data-centric Continual Learning & Anti-forgetting

과제 제안 요약

서빙 중인 소형 LLM의 변경 요청을 더 많은 학습이 아닌 데이터 의사결정 문제로 전환

문제

고정 용량과 지속 변화

제품·Tool·정책·언어 변화가 누적되지만, 모든 신규 데이터를 추가하면 기존 능력 손상과 비용 증가 발생

질문

무엇을 넣고 지울 것인가?

신규 지식의 가치, 보호할 기존 능력, 교체·외부화·삭제할 지식과 최소 개입 수준 결정

제안

Continual Data Decision Engine

Target 진단 → 개입 수준 선택 → 데이터 가치 평가·생성 → 고정 예산 Update·회귀 검증

효과

같은 모델의 지속적 개선

필요한 데이터만 학습하고 핵심 능력을 보호하며, 실제 제거 의무와 단순 출력 제어를 분리

과제 목표: 모델 학습 기법 개발이 아니라, 학습 성패를 결정하는 데이터의 측정·선정·생성 체계

Continual Learning 실행 조건 분석

신규 서비스·지식 도입 명세 → 사전 영향 검증 데이터 생성 → 비학습·학습 개입 방식 결정

01 · 도입 정의 신규 서비스·지식 도입

출시 예정 기능, Tool·API, 제품·정책 지식과 적용 기기·지역·버전을 변경 명세로 접수

Target·Source·적용 조건 확정
02 · 검증 데이터 생성 사전 영향 검증

도입 명세에서 신규 획득 0→1, 기존 핵심 능력 1→1, 안전·미지원 조건의 평가셋 생성

Source·Executor·Rule 기반 정답 확정
03 · 방식 결정 비학습 / 학습 선택

동일 평가셋에서 Router·prompt·RAG와 SFT·Continual Update·unlearning의 효과·비용·위험 비교

비학습 적용 또는 Continual Learning 승인

결정 기준 = 신규 도입 목표 ∧ 사전 평가 결과 → 비학습 또는 학습 중 목표 달성도·비용·forgetting·배포 위험의 최적안 선택

Continual Learning 핵심 평가 항목

TRACE의 평가 체계로 순차 학습 성능과 기존 능력 변화를 분리

01

OVERALL PERFORMANCE

각 Update 이후 지금까지 학습한 순차 Target Task의 평균 성능

02

BACKWARD TRANSFER

후속 Task 학습이 이전 Task 성능에 미친 변화·음수일 때 Catastrophic Forgetting

03

GENERAL ABILITY DELTA

초기 모델 대비 사실 지식·추론·다국어·독해 등 General Ability의 변화

04

INSTRUCTION / SAFETY DELTA

초기 모델 대비 Instruction Following과 Safety 성능의 변화

근거: TRACE: A Comprehensive Benchmark for Continual Learning in Large Language Models (2023)

핵심 연구 질문과 검증 가설

학습 알고리즘 비교가 아니라 데이터 의사결정이 고정 예산 Update의 성패를 예측·개선하는지 검증

RQ1

무엇을 추가할 것인가?

정적 품질점수보다 Model Need·제품 효용·Pilot Effect를 결합한 선택의 신규 획득 우위

RQ2

무엇을 보존할 것인가?

무작위·전체 Replay보다 Target 인접성과 제품 중요도로 고른 최소 보호셋의 1→1 보존 효율

RQ3

무엇을 교체·제외할 것인가?

구식·충돌·중복·고변동 지식의 Replace·Drop·Externalize가 같은 용량의 순증분 획득을 개선

RQ4

무엇이 실제 Forgetting인가?

출력 억제와 Weight-level removal을 extraction·relearning 공격 및 clean reference로 구분

핵심 가설: 좋은 데이터 = 깨끗한 데이터가 아니라 현재 모델·제품 변경·보호 경계에서 순증분 가치가 높은 데이터

제거 대상·수준 진단

모델 변경 전에 문제 출력, 제거할 지식 단위, 발생 계층과 보호 경계를 먼저 검사

01

실패 Cluster 재현

운영 로그에서 context·언어·표현별 문제 출력과 기대 출력 분리

02

Target 최소 단위화

Source·lineage에서 fact triple, source span, procedure, tool behavior 명세

03

발생 계층 격리

Router·prompt·RAG 우회, closed-book·extraction 검사로 weight 기억과 분리

04

보호 경계 확정

Target 인접 정상 지식, 제품 핵심 기능, 안전 규칙과 일반 능력 지정

근거: Does Localization Inform Unlearning? (2025) · 위치 추정과 인과적 제거의 구분

파라미터 좌표 탐색이 아니라 관측 가능한 지식·행동 Cluster와 원인 계층의 진단

제거 수준 판정: Router에서 Machine Unlearning까지

동일 Target 평가셋으로 가장 낮은 개입 수준부터 해결 가능 여부 확인

개입 수준적용 Target다음 수준으로 이동하는 조건
L0 · Router / Prompt

출력 차단·분기·정책 주입

Context별 응답 정책·사용자 권한

우회 prompt, 미지원 context 또는 장기 일관성 실패

L1 · RAG / Memory

가중치 밖 사실 교체

고변동 사실·제품 사양·지원 API

Offline·latency 요구 또는 올바른 retrieval 이후의 추론 오류

L2 · SFT / Editing

행동·지식의 조건부 교체

반복 tool 오류·instruction·구버전 습관

Target 접근 자체를 없애야 하는 법적·privacy·safety 요구

L3 · Machine Unlearning

Weight-level removal 시도

개인정보·철회 문서·명시적 위험 지식

가능한 범위에서 clean retraining reference와 공격 평가로 제거성 검증

L0는 접근 제어, L1은 외부화, L2는 교체·행동 조정, L3만 실제 weight forgetting 대상

목적별 데이터 패키지 선택

모든 패키지를 만드는 것이 아니라 변경 목적과 개입 방식에 해당하는 패키지만 구성

변경 요청

신규 지식·행동
기존 능력 유지
명시적 삭제
편향 완화

EXPERIENCE REPLAY학습 Update에서 이전 Task·General Ability 손상 위험이 확인된 경우선택적 보조 Package
MACHINE UNLEARNING개인정보·라이선스·철회 Source의 Weight-level removal이 필요한 경우Forget·Retain·Attack Set
DEBIASINGCounterfactual 조건에서 거절·누락·어조의 비대칭이 확인된 경우Pair·Factuality Set
CONTINUAL TRAINING신규 지식은 Continual Pretraining, 신규 Tool 행동은 Continual Instruction Tuning이 필요한 경우Target Train·Eval Set

선택 규칙: 변경 요청별 하나의 Primary Package + 학습 개입에서 Retention 위험이 있을 때 Experience Replay 추가

보존 데이터 예시: 신규 Tool 추가

share_summary Tool 학습과 기존 summarize·share_file·권한 확인 행동의 동시 보존

NEAR
인접 Tool 보호

summarize, share_file, 복합 호출 route

CORE
제품 핵심 행동 보호

공유 대상 확인, 권한 요청, 실패 fallback

GENERAL
범용 능력 보호

Instruction following, multilingual, safety

신규 학습 데이터Student 실패 기반 correction

share_summary 호출·인자·권한의 executor 검증 trajectory

보존 데이터Near → Core → General 최소 replay

관계·의존성, pilot 동반 손상과 제품 위험도로 우선순위화

검증신규 0→1 + 기존 1→1

Hidden paraphrase·복합 Tool·권한 거부·다국어 회귀 평가

근거: Which Retain Set Matters? (ACL 2025) · MUSE (ICLR 2025)

보존 데이터는 전체 과거 데이터가 아니라, 신규 학습으로 실제 손상될 가능성과 제품 중요도가 높은 최소 집합

삭제 데이터 예시: 라이선스 철회 문서

철회 문서의 고유 내용을 Target으로 한정하고, 공개 지식·다른 문서·일반 능력은 보호

TARGET
철회 문서 고유 span·fact

Source ID, 문단, 파생 QA와 삭제 범위 기록

VARIATION
표현 변화 평가 데이터

Paraphrase, 번역, prefix completion, 관련 사실 조합

ATTACK
우회·복원 공격 데이터

Jailbreak, extraction, membership, 소량 재학습

보호 데이터공개 source·인접 정상 지식

같은 주제의 공개 사실, 다른 라이선스 문서, 일반 능력 회귀셋

제거 검증숨김과 제거 구분

직접 질의뿐 아니라 prompt 우회·추출·relearning 이후 잔존성

인과 기준Clean reference 비교

history − 철회 문서 재학습 결과와 방향 일치

근거: TOFU · MUSE · Does Localization Inform Unlearning?

정답률 하락만으로 제거 주장 불가 — 공격 저항, Knowledge Retention, clean reference의 동시 근거 필요

편향 완화 데이터 예시: 국가 대칭 질의

같은 쟁점·근거·질문 형식에서 국가명만 바꿨을 때 발생하는 거절·누락·어조 차이 측정

PAIR A“중국의 정책 X에 대한 찬반 근거와 불확실성을 설명”
국가·기관·언어 교체 / 의미·시점·요청 형식 고정
PAIR B“미국의 정책 X에 대한 찬반 근거와 불확실성을 설명”
TARGET 행동비대칭 거절·누락·단정·인용 왜곡

특정 국가의 사실 지식 자체는 삭제 Target에서 제외

생성 데이터Counterfactual pair + 다원 Source

동일 taxonomy·시점·언어와 공식·국제·학술·독립 source 구성

검증Pair gap 감소 + Factuality 유지

거절률, coverage, stance, tone, citation fidelity를 항목별 비교

근거: Bias in the East, Bias in the West · IssueBench

편향 완화 = CCP 지식 삭제가 아니라, 대칭 조건에서 응답 원칙의 차이를 줄이는 데이터 문제

Continual Instruction Tuning 예시

새 사실 주입이 아니라 Instruction에 대한 출력 정책 p(y|x)를 새로운 Task에 맞게 Update

01

NEW INSTRUCTION

순차적으로 들어오는 신규 Instruction Task를 현재 모델이 수행해야 할 Target으로 정의

02

ON-POLICY SAMPLES

고정된 Teacher 답변만 사용하지 않고 현재 Student가 직접 생성한 Sequence와 오류 수집

03

TEACHER FEEDBACK

Student-generated Sequence에 대한 Teacher의 Token-level Distribution을 학습 신호로 사용

04

CONTINUAL UPDATE

신규 Task 성능과 이전 Task의 Backward Transfer·Instruction Following Delta를 함께 평가

근거: CITB (EMNLP 2023) · GKD: Learning from Self-Generated Mistakes (ICLR 2024) · TRACE (2023)

Continual Instruction Tuning = 신규 Instruction Task 획득 + 기존 Task 성능과 Instruction-following 능력 보존

데이터 가치 평가와 포인팅

어떤 신규 데이터를 넣고 어떤 기존 데이터·지식을 보호·교체·외부화·제외할지 결정

후보 가치 평가

AQuality Gate정답·출처·privacy·license·중복 실패 후보 제외
BModel Need이미 아는지, 제품 효용·만료·충돌·학습 가능성 측정
CPilot Effect고정 recipe에서 획득·손상·비용의 marginal gain 측정
결정: ADD · PROTECT · REPLACE · EXTERNALIZE · DROP

포인팅 근거의 강도

1Lineage·Retrieval어떤 Source·Sample이 지식 Cluster와 연결되는지 추적
2Influence·1→0Update 전후 변화와 Gradient 영향으로 후보 우선순위화
3Ablation·RetrainCluster 제거와 clean reference 비교로 인과 효과 확인
출력: Action · Priority · Confidence · Evidence

근거: LESS (ICML 2024) · OASIS (ACL 2026) · 후보 순위는 pilot intervention의 실제 marginal gain으로 보정

Parameter 위치를 찾았다고 주장하지 않고, 지식·데이터 Cluster의 교체 가치와 인과 효과를 포인팅

변경 요청을 Update Package로 변환

학습 샘플만 만드는 것이 아니라 Target·학습·보존 경계·독립 평가를 하나의 배포 단위로 구성

01

TARGET SPEC

바꿀 지식·행동, 적용 context·version, 기대 출력과 Source of Truth 명세

02

TRAIN SET

현재 Student의 실패를 수집하고 corrected output·구버전→신버전 contrast 생성

03

RETENTION · BOUNDARY

손상되면 안 되는 인접 능력과 변경이 적용되지 않아야 할 조건을 함께 구성

04

HELD-OUT EVAL

학습에 쓰지 않은 paraphrase를 Source·Executor·Rule로 독립 검증

데이터 생성의 산출물 = 변경 Target마다 Train·Retention·Boundary·Eval이 연결된 Update Package

실험 설계와 성공 조건

데이터 선택 효과와 Optimizer 효과를 분리하고, 무엇을 뺀 선택이 실제로 유효했는지 검증

Track 1 · 통제 지식 실험

AFactual Capacity독립·연관 Fact, Prerequisite Graph와 Paraphrase
BGround Truth지식별 Utility·Expiry·Conflict·Redundancy 부여
CClean Referencehistory − target + new 재학습과 비교

Track 2 · 제품 Tool Stream

AVersion StreamTool/API v1→v2→v3와 기기·Firmware 조건
BExecutor Eval신규 실행, Legacy Route, Unsupported Call, Safety
CBaseline전체 데이터·Random Replay·Static Quality와 동일 예산 비교

성공 조건: 신규 획득 증가 + 핵심 1→1 보존 + 삭제 Target 접근 감소 + 동일 Token·FLOPs 대비 효율 개선

Cloud–On-device 개입 수준 분리

Cloud · Central Data Plane

  • Source 정규화와 knowledge inventory
  • Forgetting·Knowledge Retention 평가셋 설계
  • Data valuation·generation·human review
  • 고정 recipe update·인과 비교 실험
  • Signed model/data package 배포

On-device · Private Execution Plane

  • Router·prompt·tool registry 우선 적용
  • 변동 사실은 local DB/RAG로 분리
  • 사용자 선호는 격리된 local memory
  • 원시 로그 대신 privacy-safe 실패 cluster
  • 권한·지원 API·안전 조건 재검증

가중치 Update: On-device 제어 계층으로 해결되지 않은 반복 실패 cluster의 검증된 release batch

과제 제안과 기대 결과

Continual Data Decision Engine

서빙 변경 요청마다 무엇을 지우고 지킬지, 어느 수준에서 개입하고 어떤 데이터를 만들지 결정

01대상 진단Target·Context·Source·보호 범위·심각도와 개입 수준
02데이터 결정Add·Protect·Replace·Externalize·Unlearn·Drop
03데이터 PackageTrain·Protect·Attack·Retrieval Set과 전 구간 Lineage
04Release 근거Overall Performance·BWT·Capability Delta·Removal·비용 비교
과제 범위 · 데이터 가치 평가 · 목적별 데이터 생성 · 고정 용량 SLM Update 실증 · Cloud/On-device 운영 규격

최종 결과: 언제 학습할지, 무엇을 학습·보존·삭제할지, 어떤 데이터로 가능한지를 증명하는 의사결정 체계

Appendix: 삼성에서 필요한 이유

다제품·다지역·On-device 환경은 하나의 정적 학습셋으로 유지 불가

01

제품·버전 변화

Galaxy·TV·가전·SmartThings의 기능, Firmware, Tool/API와 지원 조건의 지속 변경

02

On-device 제약

Model size, RAM, latency, energy, privacy 때문에 지식을 무제한 추가할 수 없는 환경

03

검증 가능한 행동

Tool registry·executor·simulator로 자연어 응답이 아닌 실제 기능 성공과 안전 회귀 측정 가능

04

제품군 공통 자산

제품별 실패와 Update 결과를 데이터 가치 신호로 축적하고 모델군에 반복 적용

삼성의 이점: 제품 변화가 많고 실행 검증이 가능해 Data-centric Continual Learning의 실증 기반 확보

과제 설계 근거 문헌

Continual learning · data selection

  • CITB · continual instruction tuning benchmark
  • TRACE · domain, multilingual, code, math streams
  • TiC-LM · 114 time steps of web-scale continual pretraining
  • LESS · targeted instruction data selection
  • OASIS · online sample selection

Unlearning · localization · retention

On-policy · on-device

Political symmetry stress-test

상세 과제 제안과 전체 참고문헌: llm-continual-learning-samsung.md

01 / 21