OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published 14 days ago • 250
VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use Paper • 2608.08477 • Published 6 days ago • 6
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 9 days ago • 34
GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience Paper • 2608.02392 • Published 12 days ago • 15