preference-optimization
자동 수집 항목입니다. 설치 설정은 저장소 README에서 그대로 가져왔지만, 한국어 설명과 부서 분류는 아직 확인하지 않았습니다. 설치 전에 저장소를 한 번 확인하세요.
DPO, ORPO, KTO, SimPO를 사용해 선호도 데이터로 파인튜닝된 모델을 정렬합니다. 선호도 쌍이나 좋아요/싫어요 피드백이 있을 때, 선호도 최적화 방법 중 선택할 때, 또는 DPO 실행에 하이퍼파라미터가 필요하거나 디버깅이 필요할 때 사용합니다.
설치하기
Claude Code에서 위 두 줄을 차례로 실행합니다. `llm-finetuning` 묶음에 이 스킬이 들어 있습니다. 설치한 뒤에는 이름을 언급하면 발동합니다 — 예: "preference-optimization 스킬로 정리해줘". 원본: https://github.com/wshobson/agents/tree/main/plugins/llm-finetuning/skills/preference-optimization
/plugin marketplace add wshobson/agents /plugin install llm-finetuning@claude-code-workflows
설치와 실행은 사용자 환경에서 이뤄집니다. team-ai는 이 도구를 호스팅하거나 대신 실행하지 않습니다. 제공처와 저장소를 확인한 뒤 설치하세요.
설명
원문: Align a fine-tuned model with preference data using DPO, ORPO, KTO, or SimPO. Use when preference pairs or thumbs-up/down feedback exist, when choosing between preference-optimization methods, or when a DPO run needs hyperparameters or debugging.