画像 + 音声から表現力のあるデジタルヒューマン動画へ
1枚の画像、音声または音楽トラック、任意のプロンプトから、口の同期、感情に沿った動き、カメラ制御を備えた自然な会話・歌唱動画を生成します。
OmniHuman の結果をプレビューし、入力を自動入力します。
Make her sing confidently into a microphone with natural lip sync
少ない入力から、デジタルアバター、キャラクター演技、AIミュージック動画、マーケティング動画、ストーリー性のあるショート動画を作成できます。
1枚の参照画像と1つの音声ファイルから、MP4形式のデジタルヒューマン動画を生成します。高解像度で顔が明瞭な画像とクリアな音声ほど安定した結果になりやすいです。
話し声、歌声、リズム、感情のトーンが、口の同期、表情、間、ジェスチャー、身体の動きを導きます。単なる口の動きに留まりません。
動作の順序、カメラ移動、フォーカス変更、環境反応、演技中に追加したい視覚的ディテールをプロンプトで指定できます。
人物、ペット、アニメ風キャラクター、複数主体のシーンを使用できます。特定のキャラクターに話させたい場合は、任意の主体検出で対象スピーカーを選択できます。
きれいな入力素材、任意の話者指定、短い演技プロンプトでデジタルヒューマン動画を作成します。
10MB未満の JPG、PNG、WebP 画像を使用します。品質を高めるには、顔の細部が見える明瞭な被写体を選びます。複数主体の画像では対象スピーカーを指定できます。
10MB未満の MP3、WAV、AAC、OGG、MP4 音声をアップロードします。60秒未満にしてください。15秒以下を推奨します。特定の話者が必要な場合は主体検出を実行します。
720p または 1080p を選び、ジェスチャー、感情、カメラ移動、シーン内の相互作用を短いプロンプトで指定して、最終 MP4 を生成・ダウンロードします。
OmniHuman 1.5 の入力、プロンプト、主体マスク、動画品質、クレジットに関する回答です。