Global PIQA: Evaluating Physical Commonsense Reasoning Across 100+ Languages and Cultures Paper • 2510.24081 • Published Oct 28, 2025 • 24
RewardBench 2: Advancing Reward Model Evaluation Paper • 2506.01937 • Published Jun 2, 2025 • 7
Fishing for Magikarp: Automatically Detecting Under-trained Tokens in Large Language Models Paper • 2405.05417 • Published May 8, 2024 • 1
Command A: An Enterprise-Ready Large Language Model Paper • 2504.00698 • Published Apr 1, 2025 • 31