Running Agents 436 Reward Bench Leaderboard 📐 436 Explore and compare model scores on RewardBench benchmarks
Running Featured 129 Open-LLM performances are plateauing, let’s make the leaderboard steep again 🏔 129 Explore and compare advanced language models on a new leaderboard