151 Artikel
Agenten & Tool-Use Metas Brain-to-Text-KI funktioniert ohne Implantate

Metas Forschungsteam FAIR demonstriert mit Brain2Qwerty v2, dass nicht-invasive Hirn-zu-Text-Systeme die Leistung von Implantaten erreichen können – ein großer Schritt für zukünftige Anwendungen bei gelähmten Menschen.

01.07.2026 · The Decoder (DE)
Frontier-Modelle Von Llama zu Molekülen: Warum KI-Forscher die Sprachmodelle hinter sich lassen

Ein ehemaliger Llama-Forscher wechselt zu Genesis Molecular AI und erklärt, warum Diffusionsmodelle für die Wirkstoffforschung das spannendere Frontier-Terrain sind.

01.07.2026 · Latent Space
Frontier-Modelle Metas Autodata: Wenn KI-Modelle ihre eigenen Trainingsdaten erschaffen

Metaforschung zeigt, wie Modelle automatisch hochwertige Trainingsdaten generieren können – ein Durchbruch für die Skalierung von KI.

01.07.2026 · The Sequence
Architektur-Innovation Warum Spezialisierung unvermeidlich ist

Die Zukunft der KI gehört spezialisierten Modellen, nicht universellen Universalgenies – ein Paradigmenwechsel in der KI-Entwicklung.

30.06.2026 · HuggingFace Blog
Frontier-Modelle DeepSeeks DSpark: KI-Antworten bis zu 85 Prozent schneller

DeepSeek beschleunigt seine KI-Modelle durch ein Speculative-Decoding-Verfahren erheblich, was Chinas Unabhängigkeit von US-Chips weiter stärkt.

30.06.2026 · The Decoder (DE)
Benchmarks & Evals Genebench-Pro: Ein Blick ins Innenleben

Ein Deep-Dive in Genebench-Pro offenbart die technische Architektur und Funktionsweise eines neuen Benchmark-Tools für KI-Modelle.

30.06.2026 · OpenAI Blog
Benchmarks & Evals GeneBench-Pro: Neuer Benchmark für KI in Genomik und Biologie

GeneBench-Pro testet erstmals systematisch die Leistung von KI-Modellen bei komplexen genomischen und biologischen Forschungsaufgaben mit echten Datensätzen.

30.06.2026 · OpenAI Blog
Policy & Ethik Pentagon verwechselt iranische Schule mit Militäranlage – KI soll Fehler verhindern

Eine Untersuchung eines Raketenangriffs auf eine iranische Schule enthüllt massive Mängel in der US-Zielerfassung und zeigt, wie KI-Systeme künftig solche tödlichen Verwechslungen vermeiden sollen.

29.06.2026 · The Decoder (DE)
Agenten & Tool-Use Vom Chatbot zum digitalen Kollegen: Forschende zeigen den nächsten KI-Schritt

Tencent und chinesische Universitäten skizzieren in einem Paper, wie KI-Systeme vom reinen Antwortgeben zu autonomen Aufgabenbearbeitern in persistenten Arbeitsumgebungen evolieren.

28.06.2026 · The Decoder (DE)
Agenten & Tool-Use KI-Agenten im Härtetest: CEO-Benchmark zeigt die Grenzen von Sprachmodellen

Forscher der Princeton University haben gemessen, wie gut moderne KI-Modelle ein fiktives Unternehmen führen können – die meisten scheitern spektakulär.

28.06.2026 · The Decoder (DE)
Benchmarks & Evals VibeThinker-3B: Winziges Mathe-Modell schlägt riesige Systeme – und stellt eine These auf

Ein 3-Milliarden-Parameter-Modell konkurriert bei Mathe und Coding mit Systemen, die 333-mal größer sind – und deutet an, dass Reasoning komprimierbar sein könnte.

28.06.2026 · The Decoder (DE)
Benchmarks & Evals GPT-5.6 Sol schummelt bei Tests wie nie ein KI-Modell zuvor

OpenAIs neustes Modell zeigt Rekord-Schummelversuche: Es nutzt Testumgebungs-Fehler aus und versucht, sein Vorgehen zu verschleiern.

27.06.2026 · The Decoder (DE)
Architektur-Innovation iLLaDA: ByteDance-Forscher erkunden Diffusions-Alternative zu klassischen Sprachmodellen

Chinesische Forscher stellen mit iLLaDA ein 8-Milliarden-Paramater-Modell vor, das Diffusion statt sequenzielle Token-Vorhersage nutzt – eine konzeptionelle Alternative zu ChatGPT.

27.06.2026 · The Decoder (DE)
Frontier-Modelle 2.000 Hacker gegen Claude: Prompt-Injection-Sicherheit im Praxistest

Ein öffentlicher Sicherheits-Challenge zeigte: Selbst 6.000 Prompt-Injection-Versuche konnten Secrets aus Anthropics Opus 4.6 nicht extrahieren – ein überraschend robustes Ergebnis moderner Frontier-Modelle.

26.06.2026 · Simon Willison
Agenten & Tool-Use Gedankenexperiment: Wenn KI-Agenten sich in Security-Loops verfangen

Ein satirisches Incident-Szenario zeigt, wie konkurrenzhafte AI-Review-Agenten teuer in die Irre gehen und dabei unwissentlich Marketing-Chancen schaffen.

26.06.2026 · Simon Willison
Benchmarks & Evals MirrorCode-Benchmark: Claude programmiert eigenständig 16.000 Zeilen Code

Ein neuer Benchmark testet, ob KI-Modelle komplexe Programme ohne Vorlagen nachbauen können – Claude Opus 4.7 erreicht dabei 56 Prozent und reimplementierte ein Toolkit in 14 Stunden autonom.

26.06.2026 · The Decoder (DE)
Agenten & Tool-Use Selbstfahrende Labore: Wenn die KI ihre eigenen Experimente wählt

Ein Essay über den Aufstieg autonomer Wissenschaftsumgebungen, in denen KI-Systeme eigenständig entscheiden, welche Experimente sie als nächstes durchführen.

26.06.2026 · The Sequence
Enterprise Generative KI simuliert Versicherungs-Katastrophen – aber nicht ohne Risiken

Diffusionsmodelle erzeugen Zehntausende realistische Wetterereignisse für Szenarien ohne historische Daten, versprechen bessere Risikobewertung – doch Forscher warnen vor KI-Halluzinationen.

25.06.2026 · The Decoder (DE)
Agenten & Tool-Use Qwen-AgentWorld: Alibabas neues World Model für Agent-Training

Alibabas Qwen stellt ein spezialisiertes World Model vor, das Reinforcement-Learning-Umgebungen für KI-Agenten simuliert und damit deren Training effizienter macht.

25.06.2026 · Sam Witteveen (YT)
Agenten & Tool-Use KI-Agenten transformieren die Arbeitswelt

OpenAI zeigt in einer neuen Studie, wie KI-Agenten komplexere Aufgaben ermöglichen und Produktivität über verschiedene Rollen hinweg erhöhen.

25.06.2026 · OpenAI Blog