기초 개념 · DPO고급갱신일 2026. 10. 1.
직접 선호 최적화
좋은 답·나쁜 답 쌍으로 선호를 학습해 정렬하는 미세조정 기법입니다.
비유
같은 질문에 대한 A/B 답 중 더 나은 쪽을 고르게 훈련하는 것입니다.
이렇게 이해하세요
직접 선호 최적화(DPO)은 한국어 사용자가 AI 제품·프롬프트를 고를 때 자주 만나는 개념입니다. 좋은 답·나쁜 답 쌍으로 선호를 학습해 정렬하는 미세조정 기법입니다. aimodu.kr 용어집에서는 수식보다 ‘언제 쓰고 언제 조심할지’를 중심으로 설명합니다. 관련 도구·프롬프트를 함께 보면 실무 연결이 쉽고, 최신 사실·법률·내부 규정은 반드시 별도 출처로 확인하세요.
한 줄 암기
DPO = 선호(Preference)를 직접 최적화
좋은 예
안전·정중함 기준으로 선호 쌍을 모아 DPO한다.
피하기
주관적 취향만으로 평가해 편향을 키운다.
관련 서비스
관련 용어
기초 개념 더보기관련 링크
자주 묻는 질문
RLHF와 차이가 뭔가요?
둘 다 선호를 반영하지만, DPO는 별도 보상 모델 없이도 선호 쌍으로 최적화하는 경로가 흔합니다.
비슷한 용어와 어떻게 구분하나요?
seeAlso에 연결된 용어와 한 줄씩 비교해 보세요. 겹치면 동의어, 다르면 용도 차이입니다.