Kevin-32B Uses Multi-Turn Reinforcement Learning to Write Faster CUDA Kernels
Original titleKevin-32B: Multi-Turn RL for Writing CUDA Kernels
AISummary
Stanford and Cognition AI researchers introduced Kevin-32B, a 32B-parameter model trained with multi-turn reinforcement learning to write CUDA kernels.
On KernelBench, it solves 89% of tasks at best@16 and achieves 65% average correctness over eight refinement steps, versus 53% for o4-mini and 51% for o3.
Its best@16 speedup is 1.41x, and multi-turn training outperforms single-turn training as refinement steps increase.
Source: Cognition Blog (Devin, Windsurf) · cognition.comPublished · added here