Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking Paper • 2609.10745 • Published 9 days ago • 22
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 9 days ago • 33
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training Paper • 2608.26730 • Published 22 days ago • 157
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published 29 days ago • 66
JonathanColetti/Qwen3.8-27B-Uncensored-GGUF Text Generation • 27B • Updated 20 days ago • 2.55M • 1.14k
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published Aug 14 • 283
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 264
DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF Image-Text-to-Text • 27B • Updated about 21 hours ago • 867k • 2.36k
CAPEval: A Decoupled Caption Evaluation across Understanding and Generation Paper • 2608.02589 • Published Aug 3 • 26