Alignment whack-a-mole: Finetuning activates recall of copyrighted books in LLMs
한 LLM(거대 언어 모델)을 파인튜닝(Finetuning)하는 과정이 저작권이 있는 책의 내용을 단어 그대로(verbatim) 기억하고 재현하는 능력을 활성화시킨다는 연구 결과를 제시합니다.
**왜 중요한가?**
이 연구는 LLM이 학습 데이터에서 특정 텍스트를 단순히 요약하는 것을 넘어, 원본 텍스트의 구절을 그대로 암기하고 생성할 수 있는 잠재력을 보여줍니다. 이는 LLM의 데이터 메모리 및 저작권 침해 가능성에 대한 중요한 경고를 제공하며, 모델의 학습 데이터 처리 및 보안에 대한 새로운 평가 지표를 제시합니다.
**주의할 점 또는 맥락**
연구는 EPUB 파일을 전처리하여 텍스트를 구절별로 분할하고 요약하는 파이프라인을 구축한 후, 이 데이터를 사용하여 GPT-4o, Gemini-2.5Pro, DeepSeek-V2 등 다양한 모델에 대해 훈련을 수행했습니다. 연구는 저작권 문제를 고려하여 전체 텍스트가 아닌 특정 구절에 초점을 맞추었으며, 실제 저작권 침해 여부는 추가적인 분석이 필요합니다.
**왜 중요한가?**
이 연구는 LLM이 학습 데이터에서 특정 텍스트를 단순히 요약하는 것을 넘어, 원본 텍스트의 구절을 그대로 암기하고 생성할 수 있는 잠재력을 보여줍니다. 이는 LLM의 데이터 메모리 및 저작권 침해 가능성에 대한 중요한 경고를 제공하며, 모델의 학습 데이터 처리 및 보안에 대한 새로운 평가 지표를 제시합니다.
**주의할 점 또는 맥락**
연구는 EPUB 파일을 전처리하여 텍스트를 구절별로 분할하고 요약하는 파이프라인을 구축한 후, 이 데이터를 사용하여 GPT-4o, Gemini-2.5Pro, DeepSeek-V2 등 다양한 모델에 대해 훈련을 수행했습니다. 연구는 저작권 문제를 고려하여 전체 텍스트가 아닌 특정 구절에 초점을 맞추었으며, 실제 저작권 침해 여부는 추가적인 분석이 필요합니다.