Bringing End-to-End LLM Reinforcement Learning to AMD Instinct MI455X with verl
A complete GRPO workflow using verl, Qwen3-30B-A3B, SGLang, and PyTorch FSDP ran for 100 consecutive steps on four AMD Instinct MI455X GPUs, establishing an end-to-end RL baseline for CDNA 5.