Trainieren KI-Labs ihre Modelle heimlich auf Pelikane? Eine absurd gründliche Untersuchung

Are AI labs pelicanmaxxing?
6/10 Simon Willison 22.07.2026 Benchmarks & Evals Research

Dylan Castillo ist einer humorvollen Internet-Verschwörungstheorie nachgegangen: dass AI-Labs ihre Modelle gezielt darauf trainieren, Pelikane auf Fahrrädern besser zu zeichnen. Mit wissenschaftlicher Strenge testete er 7 aktuelle Modelle (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2, DeepSeek V4 Pro) mit 48 verschiedenen Kombinationen aus 8 Tieren und 6 Fahrzeugen – jeweils dreimal. Das Ergebnis: Pelikane werden nicht besser gezeichnet als andere Tiere, und die Kombination „Pelikan auf Fahrrad" zeigt keinen unerwarteten Qualitätssprung. Ein unterhaltsamer Deep-Dive in die Evaluationsmethodologie moderner LLMs mit einer pfiffigen Herangehensweise an Bias-Testing.

Zum Originalartikel