HealthBench: Evaluating Large Language Models Towards Improved Human Health Paper • 2505.08775 • Published May 13, 2025 • 2
GPT-Red: Automated Red Teaming via Self-Play at Scale Paper • 2607.26115 • Published Jul 28 • 11
The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark Paper • 2608.11469 • Published 28 days ago • 1
Measuring Massive Multitask Language Understanding Paper • 2009.03300 • Published Sep 7, 2020 • 6
Reasoning Models Struggle to Control their Chains of Thought Paper • 2603.05706 • Published Mar 5 • 41
ParseBench: A Document Parsing Benchmark for AI Agents Paper • 2604.08538 • Published Apr 9 • 11
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation Paper • 2605.10912 • Published May 11 • 48
Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents Paper • 2604.06132 • Published Apr 7 • 123
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction Paper • 2607.29677 • Published Jul 31 • 25
TimesFM Release Collection TimesFM (Time Series Foundation Model) is a pretrained time-series foundation model developed by Google Research for time-series forecasting. • 8 items • Updated 10 days ago • 76
Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference Paper • 2412.13663 • Published Dec 18, 2024 • 169
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding Paper • 1810.04805 • Published Oct 11, 2018 • 33
view article Article LFM2.5-Encoders for Fast Long-Context Inference on CPU LiquidAI • Jul 28 • 69
💧 LFM2.5 Collection Collection of post-trained and base LFM2.5 models. • 16 items • Updated Aug 4 • 220
Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model Paper • 2607.22083 • Published Jul 27 • 10
Qwen3.8 Collection Qwen3.8 models converted to MLX format for Apple silicon. • 12 items • Updated 24 days ago • 20