Gemini Omni 1.1 Flash؛ کنترل بیشتر روی ساخت ویدیو با هوش مصنوعی
گوگل با معرفی Gemini Omni 1.1 Flash قابلیتهای تازهای را برای تولید و ویرایش ویدیو با هوش مصنوعی در اختیار توسعهدهندگان و سازندگان ابزارهای خلاقانه قرار داده است. این مدل جدید بیشتر از اینکه فقط روی «ساخت یک ویدیو از روی پرامپت» تمرکز داشته باشد، تلاش میکند کنترل بیشتری روی فرایند تولید ویدیو به کاربر بدهد.
در Gemini Omni 1.1 Flash امکاناتی مثل ادامه دادن ویدیو، تعیین فریم شروع و پایان، ساخت پیشنمایش 360p و ارتقای خروجی تا رزولوشن 4K اضافه شدهاند؛ قابلیتهایی که میتوانند این مدل را برای ساخت ابزارهای حرفهای تولید محتوا، تبلیغات و نرمافزارهای ویرایش ویدیو کاربردیتر کنند.
Gemini Omni 1.1 Flash چیست؟
Gemini Omni 1.1 Flash یکی از مدلهای مولد ویدیوی گوگل است که امکان تولید و ویرایش ویدیو را با استفاده از ورودیهایی مثل متن، تصویر و ویدیو فراهم میکند.
مدل جدید از طریق Gemini API و Google AI Studio در اختیار توسعهدهندگان قرار گرفته و گوگل آن را بهعنوان نسخه پایدار Gemini Omni Flash معرفی کرده است.
برخلاف بسیاری از مدلهای تولید ویدیو که بیشتر روی تبدیل متن یا تصویر به یک کلیپ کوتاه تمرکز دارند، Gemini Omni به سمت یک فرایند تعاملیتر حرکت کرده است؛ یعنی توسعهدهنده میتواند ویدیو را تولید کند و سپس با دستورهای جدید، بخشهایی از آن را ادامه دهد یا تغییر دهد.
ادامه ویدیو تا ۴۰ ثانیه
یکی از مهمترین قابلیتهای Gemini Omni 1.1 Flash امکان ادامه دادن یک ویدیوی موجود است.
مدل میتواند تا ۱۰ ثانیه از محتوای قبلی ویدیو را برای درک بهتر صحنه بررسی کند و سپس ادامه آن را تولید کند. این موضوع به حفظ پیوستگی بصری، حرکت دوربین، شخصیتها و روند داستان کمک میکند.
ویدیو را میتوان در بخشهای ۱۰ ثانیهای ادامه داد و مجموع طول آن را به حداکثر ۴۰ ثانیه رساند.
این قابلیت میتواند برای ساخت داستانهای کوتاه، تبلیغات، ویدیوهای شبکههای اجتماعی یا توسعه ابزارهای تولید ویدیوی چندمرحلهای مفید باشد.
تعیین فریم اول و آخر ویدیو
قابلیت مهم دیگر، امکان مشخص کردن فریم ابتدایی و فریم پایانی یک ویدیو است.
در این حالت، Gemini Omni 1.1 Flash وظیفه دارد حرکت بین این دو تصویر را تولید کند. چنین قابلیتی کنترل بیشتری روی حرکت دوربین و انتقال بین صحنهها در اختیار سازنده قرار میدهد.
برای مثال، میتوان تصویر ابتدایی یک اتاق و تصویر دیگری از نمای نزدیک یک شیء را مشخص کرد و از مدل خواست حرکتی پیوسته بین این دو فریم ایجاد کند.
این ویژگی برای ساخت Transition، حرکتهای دوربین، Zoom و Loopهای ویدیویی کاربرد زیادی دارد.
پیشنمایش سریع با کیفیت 360p
تولید چند نسخه ویدیویی برای رسیدن به نتیجه مناسب میتواند زمانبر و پرهزینه باشد. گوگل برای حل این مشکل امکان تولید نسخههای 360p را در Gemini Omni 1.1 Flash ارائه کرده است.
طبق اعلام گوگل، تولید این نسخهها میتواند تا ۶۰ درصد سریعتر از خروجی استاندارد 720p انجام شود و هزینه آن نیز حدود یکسوم باشد.
در نتیجه توسعهدهنده یا تولیدکننده محتوا میتواند ابتدا چند نسخه آزمایشی بسازد، ترکیببندی و حرکتها را بررسی کند و فقط نسخه نهایی را با کیفیت بالاتر تولید کند.
خروجی 1080p و 4K
بعد از رسیدن به نتیجه مطلوب، Gemini Omni 1.1 Flash امکان ارتقای خروجی به 1080p یا 4K را فراهم میکند.
در مستندات Gemini API، رزولوشنهای 360p، 720p، 1080p و 4K برای این مدل در نظر گرفته شدهاند. خروجیهای 1080p و 4K با استفاده از فرایند Upscaling تولید میشوند.
این قابلیت بهخصوص برای پروژههایی که خروجی نهایی قرار است در تبلیغات، محتوای حرفهای یا شبکههای اجتماعی استفاده شود اهمیت دارد.
استفاده از ویدیو بهعنوان Reference
Gemini Omni 1.1 Flash فقط به متن و تصویر محدود نیست. توسعهدهندگان میتوانند بخشی از یک ویدیو را نیز بهعنوان Video Reference در اختیار مدل قرار دهند.
مدل میتواند تا سه ثانیه از ویدیوی مرجع را برای درک حرکت، سبک یا رفتار موردنظر استفاده کند. این قابلیت امکان ساخت Workflowهای پیچیدهتر برای ویرایش و تولید ویدیو را فراهم میکند.
Gemini Omni 1.1 Flash برای چه کسانی کاربرد دارد؟
این مدل بیش از همه برای توسعهدهندگان ابزارهای تولید محتوا، پلتفرمهای ویرایش ویدیو، تیمهای تبلیغاتی و سرویسهای مبتنی بر هوش مصنوعی مولد جذاب است.
برای مثال، میتوان ابزاری ساخت که ابتدا چند Draft کمکیفیت و ارزان تولید کند، کاربر نسخه موردنظرش را انتخاب کند و سپس همان ویدیو با کیفیت 4K آماده شود.
همچنین امکان کنترل فریم شروع و پایان و ادامه دادن صحنهها باعث میشود ساخت ابزارهایی برای تبلیغات، Storyboard، محتوای شبکههای اجتماعی و تدوین مبتنی بر AI سادهتر شود.
چگونه به Gemini Omni 1.1 Flash دسترسی پیدا کنیم؟
توسعهدهندگان میتوانند Gemini Omni 1.1 Flash را از طریق Google AI Studio و Gemini API تجربه و در محصولات خود استفاده کنند. این مدل همچنین در اکوسیستم سازمانی گوگل و Google Flow ارائه شده است.
شناسه مدل در Gemini API نیز به شکل زیر است:
gemini-omni-1.1-flash
Gemini Omni 1.1 Flash نشان میدهد رقابت مدلهای ویدیویی هوش مصنوعی بهتدریج از «فقط تولید یک کلیپ» به سمت کنترل دقیقتر، ویرایش تعاملی و ساخت Workflow کامل تولید ویدیو در حال حرکت است.
منبع: وبلاگ رسمی Google
درباره فیلاگر
فیلاگر | جامعه هوش مصنوعی ایران، مرجعی برای آموزش، معرفی و بررسی ابزارها، مدلها و فناوریهای جدید هوش مصنوعی است. در فیلاگر تلاش میکنیم تازهترین تحولات AI را با زبانی ساده، کاربردی و قابلفهم برای علاقهمندان، طراحان، برنامهنویسان و فعالان این حوزه منتشر کنیم.
دیدگاهتان را بنویسید