StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling Paper • 2608.15089 • Published 21 days ago • 446
Running Featured 441 Bonsai 27B WebGPU Kernels 🌳 441 Run a 1-bit 27B LLM locally in your browser on WebGPU
RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources Paper • 2606.29538 • Published Jul 16 • 145