본문 바로가기
← MCP·스킬 라이브러리
스킬데이터·분석

grpo-rlvr-training

자동 수집 항목입니다. 설치 설정은 저장소 README에서 그대로 가져왔지만, 한국어 설명과 부서 분류는 아직 확인하지 않았습니다. 설치 전에 저장소를 한 번 확인하세요.

GRPO와 검증 가능한 보상을 이용한 강화학습(RLVR)으로 추론 및 검증 가능한 작업 행동을 학습시킵니다. 작업 성공 여부를 알고리즘적으로 확인할 수 있을 때(수학, 코드, 도구 호출, 구조화된 출력), GRPO 보상 함수를 설계할 때, 또는 GRPO 실행이 발산하거나 보상 해킹이 발생할 때 사용합니다.

제공 Seth Hobson라이선스 MIT갱신 2026년 9월 22일

설치하기

Claude Code에서 위 두 줄을 차례로 실행합니다. `llm-finetuning` 묶음에 이 스킬이 들어 있습니다. 설치한 뒤에는 이름을 언급하면 발동합니다 — 예: "grpo-rlvr-training 스킬로 정리해줘". 원본: https://github.com/wshobson/agents/tree/main/plugins/llm-finetuning/skills/grpo-rlvr-training

/plugin marketplace add wshobson/agents
/plugin install llm-finetuning@claude-code-workflows

설치와 실행은 사용자 환경에서 이뤄집니다. team-ai는 이 도구를 호스팅하거나 대신 실행하지 않습니다. 제공처와 저장소를 확인한 뒤 설치하세요.

설명

원문: Train reasoning and verifiable-task behavior with GRPO and reinforcement learning from verifiable rewards (RLVR). Use when task success is algorithmically checkable (math, code, tool calls, structured output), when designing GRPO reward functions, or when a GRPO run diverges or reward-hacks.

grpo-rlvr-training — Claude 스킬 설치 가이드 | team-ai