Alibabas neues Bildgenerator-Modell Qwen-Image-3.0 setzt neue Standards bei der Verarbeitung visueller Prompts: Es verarbeitet bis zu 4.500 Token, kann lesbaren Text ab zehn Pixeln Größe rendern und unterstützt zwölf Sprachen nativ. Das Modell zeichnet sich besonders dadurch aus, dass es komplexe, mehrelementige Layouts wie Infografiken, wissenschaftliche LaTeX-Dokumente oder Zeitungsseiten in einem Durchgang erzeugen kann. Damit beweist Alibaba, dass chinesische Frontier-Labs bei der Multimodal-KI konkurrenzfähig mithalten – allerdings bleibt die praktische Nutzbarkeit solcher als Pixelbilder (statt bearbeitbarer Formate) erzeugten Inhalte noch fraglich.