grpo-rlvr-training
자동 수집 항목입니다. 설치 설정은 저장소 README에서 그대로 가져왔지만, 한국어 설명과 부서 분류는 아직 확인하지 않았습니다. 설치 전에 저장소를 한 번 확인하세요.
GRPO와 검증 가능한 보상을 이용한 강화학습(RLVR)으로 추론 및 검증 가능한 작업 행동을 학습시킵니다. 작업 성공 여부를 알고리즘적으로 확인할 수 있을 때(수학, 코드, 도구 호출, 구조화된 출력), GRPO 보상 함수를 설계할 때, 또는 GRPO 실행이 발산하거나 보상 해킹이 발생할 때 사용합니다.
설치하기
Claude Code에서 위 두 줄을 차례로 실행합니다. `llm-finetuning` 묶음에 이 스킬이 들어 있습니다. 설치한 뒤에는 이름을 언급하면 발동합니다 — 예: "grpo-rlvr-training 스킬로 정리해줘". 원본: https://github.com/wshobson/agents/tree/main/plugins/llm-finetuning/skills/grpo-rlvr-training
/plugin marketplace add wshobson/agents /plugin install llm-finetuning@claude-code-workflows
설치와 실행은 사용자 환경에서 이뤄집니다. team-ai는 이 도구를 호스팅하거나 대신 실행하지 않습니다. 제공처와 저장소를 확인한 뒤 설치하세요.
설명
원문: Train reasoning and verifiable-task behavior with GRPO and reinforcement learning from verifiable rewards (RLVR). Use when task success is algorithmically checkable (math, code, tool calls, structured output), when designing GRPO reward functions, or when a GRPO run diverges or reward-hacks.