AI 뉴스 Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps 2026년 09월 03일 00:00 조회 23 Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps 원문: https://huggingface.co/blog/grpo-with-trl-ifstruct