1つのプロンプトから生成された本物の画像と動画。カードをクリックすると、その背後にあるプロンプトを確認できます。
ERNIE-Imageは、生成モデルを通常壊すケースを処理するために訓練された単一ストリーム拡散トランスフォーマーです。読みやすいテキスト、厳格なレイアウト、複数オブジェクトのプロンプト、バイリンガル指示に対応。軽量なプロンプトエンハンサーが短い入力を構造化された説明に展開するため、使用可能な出力を得るためにプロンプトエンジニアリングを行う必要はありません。
ERNIE-Imageは、プロンプトエンハンサーとTurboバリアントを組み合わせた8B単一ストリームDiTです。アーキテクチャが実際に得意とすることは次のとおりです。
組み込みのプロンプトエンハンサーが、1行のアイデアを詳細な構造化されたプロンプトに変換します。クリエイティブモードに留まり、モデルがプロンプトエンジニアリング層を処理します。
ポスターの長文コピー、インフォグラフィックの見出し、コミックの吹き出し、UIモックアップのラベル。他の拡散モデルがグリフをぼかしたり文字を幻覚したりする場所で、文字がきれいにレンダリングされます。
複数のオブジェクト、特定の空間関係、知識集約的なプロンプト。モデルは、一般的な「きれいな絵」に崩れることなく、実際に説明した内容を追跡します。
ポスター、コミック、ストーリーボード、UIフレーム、インフォグラフィック。ERNIE-Imageは、被写体やスタイルだけでなく、ページレイアウトとパネル構成について推論します。
フル8Bチェックポイントは、Apache 2.0の下でリリースされ、単一の24GB GPUで実行されます。
タスクに合うツールとモデルを選び、設定を調整し、完成した作品を一つの履歴で管理できます。
テキスト説明から画像を生成
既存の画像を変換・強化
テキスト説明から動画を作成
画像を動画にアニメーション化
生成状況を確認し、完成した画像や動画を共通のアセットライブラリから再度開けます。
モデル名、クレジット消費、対応パラメータを生成前に確認できます。
ERNIE-Imageについて知っておくべきすべて