Immagini e video reali generati da un singolo prompt. Clicca su una card per vedere il prompt esatto.
ERNIE-Image è un Diffusion Transformer a flusso singolo addestrato per gestire i casi che solitamente rompono i modelli generativi: testo leggibile, layout rigidi, prompt multi-oggetto e istruzioni bilingue. Un Prompt Enhancer leggero espande input brevi in descrizioni strutturate, così non devi fare prompt-engineering per ottenere output utilizzabili.
ERNIE-Image è un DiT a flusso singolo da 8B abbinato a un Prompt Enhancer e una variante Turbo. Ecco in cosa l'architettura eccelle realmente.
Il Prompt Enhancer integrato trasforma un'idea di una riga in un prompt dettagliato e strutturato. Tu rimani in modalità creativa; il modello gestisce il livello di prompt-engineering.
Testo lungo su poster, titoli su infografiche, balloon nei fumetti, etichette su mockup UI. I caratteri vengono renderizzati in modo nitido dove altri modelli di diffusione sfocano i glifi o allucinano lettere
Oggetti multipli, relazioni spaziali specifiche, prompt densi di conoscenza. Il modello tiene traccia di ciò che hai effettivamente descritto piuttosto che collassare in una generica 'bella immagine'
Poster, fumetti, storyboard, cornici UI, infografiche. ERNIE-Image ragiona su layout di pagina e composizione dei pannelli — non solo soggetto e stile.
Il checkpoint completo da 8B è rilasciato sotto Apache 2.0 e funziona su una singola GPU da 24GB.
Scegli strumento e modello adatti a ogni attività, configura i controlli disponibili e conserva i lavori completati in una cronologia unica.
Genera immagini da descrizioni testuali
Trasforma e migliora immagini esistenti
Crea video da descrizioni testuali
Anima le tue immagini in video
Controlla lo stato della generazione e ritrova immagini o video completati in una libreria condivisa.
Nomi dei modelli, costi in crediti e parametri supportati restano visibili prima di ogni generazione.
Tutto quello che devi sapere su ERNIE-Image