smevals: Ein Eval-Framework zum Testen von KI-Modellen und Prompts

smevals - a small eval suite for evaluating models, prompts, and harnesses
7/10 Simon Willison 31.07.2026 Benchmarks & Evals Dev-Tools Open Source

Simon Willison hat zusammen mit dem Prime Radiant Lab ein praktisches Eval-Framework namens smevals entwickelt, mit dem Entwickler Modelle, Prompts und Agenten-Harnesses systematisch testen können. Das Tool ermöglicht es, YAML-basierte Eval-Suites zu erstellen, gegen mehrere Modelle auszuführen und die Ergebnisse mit definierten Checks zu bewerten – von einfachen String-Matching bis zu komplexen, modellgestützten Evaluierungen. Ein großer Vorteil ist die klare Struktur (evals, tasks, configs, runs, grader, checker) und die webbasierte Visualisierung der Ergebnisse als interaktives Dashboard oder statisches HTML. Für Teams und Einzelne, die ihre KI-Systeme rigoros evaluieren wollen, ist dies ein praktisches Developer-Tool für einen häufigen Schmerz.

Zum Originalartikel