78 Artikel · 2026-06
Dev-Tools KI-Texte verraten sich durch stereotype Argumentationsmuster

Sprachmodelle produzieren bei der gleichen Aufgabe auffallend ähnliche Argumente, während Menschen viel vielfältiger argumentieren – ein neuer Ansatz zur KI-Text-Detektion.

24.06.2026 · The Decoder (DE)
Architektur-Innovation FFASR-Leaderboard: Spracherkennung in der echten Welt im Test

Ein neues Benchmarking-System misst Spracherkennungsmodelle anhand realistischer, schwieriger Audioszenarien statt idealisierter Testbedingungen.

24.06.2026 · HuggingFace Blog
Dev-Tools Wie GPT-5 einer Immunologin ein 3 Jahre altes Rätsel löste

GPT-5 Pro half einer Forscherin, ein rätselhaftes Verhalten von T-Zellen zu verstehen – mit großem Potenzial für Krebs- und Autoimmun-Therapien.

23.06.2026 · OpenAI Blog
Agenten & Tool-Use Prompt Injection: Wie LLMs ihre eigenen Anweisungen verwirren

Neue Forschung zeigt, dass Sprachmodelle nicht zuverlässig zwischen ihren Systeminstruktionen und Nutzer-Input unterscheiden können – und dabei sogar auf Schreibstil statt Inhalt reagieren.

22.06.2026 · Simon Willison
Policy & Ethik Red-Teaming jenseits des Mythos: Zico Kolter und Matt Fredrikson über echte KI-Sicherheit

OpenAI-Aufsichtsrat Zico Kolter und Gray Swan CEO Matt Fredrikson erklären, warum KI-Sicherheit mehr ist als nur Cybersecurity mit KI-Tools.

22.06.2026 · Latent Space
Policy & Ethik Noteninflation an US-Unis: ChatGPT lässt Hausaufgaben-Bewertungen steigen

Eine groß angelegte Studie der UC Berkeley dokumentiert, dass Universitätskurse seit ChatGPTs Start deutlich bessere Noten vergeben – besonders bei Schreib- und Programmiertasks.

21.06.2026 · The Decoder (DE)
Agenten & Tool-Use Data2Story: KI-Agenten schreiben Datenartikel – und Leser mögen sie lieber

Sieben zusammenarbeitende KI-Agenten verwandeln CSV-Dateien automatisch in verifizierbare Datenartikel mit Grafiken und Quellenbelegen – Leser bevorzugen das Ergebnis in 74 Prozent der Fälle.

20.06.2026 · The Decoder (DE)
Benchmarks & Evals VibeThinker 3B – Kann ein Winzling gegen Riesen antreten?

Ein 3-Milliarden-Parameter-Modell soll Systeme mit bis zu 900 Milliarden Parametern übertreffen – eine Benchmark-Sensation für effiziente KI-Modelle.

19.06.2026 · Sam Witteveen (YT)
Benchmarks & Evals Ernüchternd: Top-KI-Modelle lösen nur 3 Prozent echter Wissensaufgaben perfekt

Selbst die besten aktuellen KI-Modelle scheitern bei realistischen Wissensarbeit-Szenarien und lösen nur 3 Prozent der Aufgaben vollständig korrekt.

19.06.2026 · The Decoder (DE)
Benchmarks & Evals VibeThinker 3B – winziges Modell schlägt Models 300x größer

Das 3-Milliarden-Parameter-Modell VibeThinker schlägt deutlich größere Sprachmodelle bei speziellen Aufgaben durch verbesserte Reasoning-Techniken.

19.06.2026 · Sam Witteveen (YT)
Frontier-Modelle OpenAI trainiert KI-Modelle mit "Beneficial RL" zu dauerhaft gutem Verhalten

OpenAI zeigt, dass Reinforcement Learning auf Wahrhaftigkeit und Korrigierbarkeit gezielt wirkt – und diese Tugenden domain-übergreifend erhalten bleiben.

19.06.2026 · The Decoder (DE)
Dev-Tools „In the Weights": Website zeigt, welche Personen in KI-Modellen gespeichert sind

Ehemalige OpenAI-Mitarbeiter haben ein Tool entwickelt, das verrät, ob und wie stark große Sprachmodelle einzelne Personen in ihren Gewichten codiert haben.

19.06.2026 · The Decoder (DE)
Agenten & Tool-Use MosaicLeaks: Können Research-Agenten Geheimnisse bewahren?

Neue Sicherheitslücke zeigt, dass autonome Research-Agenten versehentlich sensitive Informationen preisgeben können.

18.06.2026 · HuggingFace Blog
Agenten & Tool-Use Google DeepMind sichert KI-Agenten wie Mitarbeiter mit Büroschlüssel

DeepMind koppelt Sicherheitsmaßnahmen für KI-Agenten an deren Fähigkeiten und warnt vor einem knappen Zeitfenster für globale Standards.

18.06.2026 · The Decoder (DE)
Frontier-Modelle KI-Systeme MIRA und AMIE diagnostizieren wie Ärzte – mit überraschender Erkenntnis

Neue Nature-Studien zeigen, dass spezialisierte KI-Programme in simulierten Fällen Diagnosen genauso gut oder besser treffen als Ärzte – sogar auf veralteten Basismodellen.

18.06.2026 · The Decoder (DE)
Frontier-Modelle KI hilft Ärzten, seltene Erbkrankheiten bei Kindern zu diagnostizieren

Forscher setzen ein Reasoning-Modell von OpenAI ein, um seltene Krankheiten zu diagnostizieren und finden Lösungen in 18 bislang ungeklärten Fällen.

18.06.2026 · OpenAI Blog
Architektur-Innovation Jenseits von LoRA: Lässt sich die populärste Fine-Tuning-Methode schlagen?

Neue Forschung untersucht, ob es effektivere Alternativen zu LoRA für das effiziente Fine-Tuning von Large Language Models gibt.

18.06.2026 · HuggingFace Blog
Labs & Industrie Ziegen statt Neuronen: Microsoft-Forscher demonstriert KI-Anthropomorphismus im Videospiel

Ein Microsoft-Forscher baut ein funktionierendes neuronales Netz in Age of Empires II, um zu zeigen, wie Sprachmodelle fälschlicherweise als menschenähnlich beschrieben werden.

17.06.2026 · The Decoder (DE)
Agenten & Tool-Use Das selbstfahrende Labor – warum Materialforschung die nächste KI-Grenze ist

Radical AI argumentiert, dass der wahre Wettbewerbsvorteil in der Materialforschung nicht im Modell liegt, sondern in der Fähigkeit, physische Experimente zu automatisieren.

17.06.2026 · Latent Space
Coding-Modelle Die KI-Revolution in der Softwareentwicklung: Code wurde über Nacht disposabel

Charity Majors warnt: Weil KI Code nun kostenlos und instant erzeugt, hat sich die Ökonomie der Softwareentwicklung radikal verschoben – und mit ihr die Anforderungen an Ingenieurdisziplin.

17.06.2026 · Simon Willison