Teacher가 Student를 가르치는 데이터 공장LLM을 특정 도메인에 파인튜닝하려면 수천에서 수만 건의 레이블 데이터가 필요합니다. 의료나 법률처럼 전문가가 직접 검수해야 하는 분야에서는 데이터 한 건 만드는 데 수 분에서 수십 분이 걸립니다. 전문가 한 명이 하루에 만들 수 있는 데이터는 수백 건이 한계입니다. 이 병목을 뚫는 현실적인 방법이 합성 데이터(Synthetic Data) 전략입니다.핵심 아이디어는 단순합니다. GPT-4o나 Claude 같은 대형 Teacher 모델에게 학습 데이터를 대신 생성하게 합니다. Teacher가 만들어 낸 입력-출력 쌍을 학습 데이터로 삼아 더 작은 Student 모델을 파인튜닝하는 방식입니다. 이를 지식 증류의 데이터 버전이라 부르기도 합니다. 예를 들어 ..