Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Paper • 2607.19322 • Published 2 days ago • 6
Knowledge Extraction on Semi-Structured Content: Does It Remain Relevant for Question Answering in the Era of LLMs? Paper • 2509.25107 • Published Sep 29, 2025
SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning Paper • 2510.01832 • Published Oct 2, 2025
FACTORY: A Challenging Human-Verified Prompt Set for Long-Form Factuality Paper • 2508.00109 • Published Jul 31, 2025 • 4
Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning Paper • 2403.11401 • Published Mar 18, 2024
Post-training an LLM for RAG? Train on Self-Generated Demonstrations Paper • 2502.10596 • Published Feb 14, 2025
Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Paper • 2607.19322 • Published 2 days ago • 6
Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Paper • 2607.19322 • Published 2 days ago • 6