سبحان

سبحان هستم , متخصص رسانه‌های دیجیتال و توسعه‌دهنده هوش مصنوعی مرز بین هنر و تکنولوژی را با هم جابه‌جا می‌کنیم.

اینجا قراره با هم جادو کنیم !

  AI Talking Avatar

آموزش ساخت آواتار سخنگو با هوش مصنوعی 🗣️✨

در این آموزش یاد می‌گیرید چطور یک تصویر ثابت را به یک
ویدیوی سخنگوی جذاب و کاملاً طبیعی تبدیل کنید. 🎬
برای ساخت یک آواتار سخنگو، ابتدا به یک تصویر باکیفیت (تولید‌شده با Nano Banana، Midjourney یا ابزارهای مشابه)
نیاز داریم. سپس با استفاده از ابزارهای هوش مصنوعی ویدیویی، این تصویر رو با یک دیالوگ ترکیب می‌کنیم
تا آواتار ما با حرکت طبیعی لب‌ها شروع به صحبت‌کردن کنه. ✨

بخش اول — تولید تصویر پایه (آواتار)

ابتدا باید یک کاراکتر جذاب بسازیم. متن زیر رو کپی کن و در ابزار تولید تصویر (Nano Banana یا ChatGPT) قرار بده:

پرامپت ساخت آواتار در Nano Banana یا ChatGPT
A hyper-realistic portrait of a futuristic tech character, glowing orange accents, dark background, highly detailed, 8k resolution, cinematic lighting –ar 9:16


یادداشت مهم: حتماً از تصاویری استفاده کن که چهره‌ی کاراکتر کاملاً رو‌به‌روی دوربین (Front-facing) باشه،
تا هوش مصنوعی بتونه حرکات لب رو دقیق‌تر شبیه‌سازی کنه.

بخش دوم — متحرک‌سازی و سینک صدا

۱
وارد بخش ساخت ویدیو در Google Flow شو و مدل Omni Flash رو انتخاب کن.

۲
تصویری که در بخش اول ساختی رو آپلود کن.

۳
در کادر پرامپت، توضیحات دیالوگ رو بنویس و مشخص کن که کاراکتر باید به فارسی دیالوگ رو بیان کنه.
برای دیالوگ‌های فارسی حتماً حرکت‌گذاری و اعراب‌گذاری کامل انجام بده تا تلفظ و هماهنگی لب دقیق‌تر بشه.

۴
روی دکمه‌ی Generate بزن و منتظر بمون تا ویدیوی نهایی ساخته بشه.

نمونه پرامپت متحرک‌سازی در Google Flow (Omni Flash)
این کاراکتر را متحرک کن و کاری کن که مستقیم به دوربین نگاه کند و به زبان فارسی، با حرکت طبیعی لب و حالت چهره‌ی واقعی، این دیالوگ را بیان کند:
«سَلامْ! اِمْروزْ می‌خْوامْ یِکْ تَرفَندِ فوقْ‌اَلْعادِه دَرْ طَراحی با هوشِ مَصْنوعی به شُما یاد بِدَمْ.»
دوربین ثابت (Locked-off)، نور یکنواخت روی صورت، بدون چرخش یا حرکت اضافه‌ی دوربین، کیفیت سینمایی و واقع‌گرایانه.



چرا اعراب‌گذاری مهمه؟ بدون حرکت‌گذاری، مدل‌های هوش مصنوعی معمولاً تلفظ کلمات فارسی رو اشتباه یا مبهم می‌سازن
و همین باعث می‌شه هماهنگی لب (Lip Sync) غیرطبیعی به‌نظر برسه. با اعراب‌گذاری کامل (فتحه، کسره، ضمه، تشدید و سکون)، مدل دقیقاً می‌دونه هر کلمه چطور تلفظ می‌شه.
سلام

سَلامْ
امروز

اِمْروزْ
درک کنید

دَرک کُنید

نمونه‌ی خروجی

نمونه‌ی آواتار سخنگوی ساخته‌شده با تصویر ثابت + Google Flow Omni Flash

نکته‌ی طلایی: کیفیت تصویر پایه (بخش اول) و دقتِ اعراب‌گذاری دیالوگ فارسی (بخش دوم)،
دو عاملی هستن که مستقیماً روی طبیعی‌بودن حرکت لب و باورپذیری آواتار نهایی تاثیر می‌ذارن؛
هر چی این دو مرحله دقیق‌تر انجام بشه، خروجی هم حرفه‌ای‌تر و واقعی‌تر از آب درمیاد. 🔥🎯

🚀🙏

امیدوارم این آموزش براتون کاربردی بوده باشه. به امید خدا، آموزش‌ها و پرامپت‌های جدیدتری هم در راهه؛
برای اینکه هیچ‌کدوم از آموزش‌های بعدی رو از دست ندی، همین الان به کانال تلگرام «Magics by AI» بپیوند. 🌟


عضویت در کانال تلگرام

ارتباط با من
Telegram Channel