معرفی نسل جدید هوش مصنوعی تولید ویدئو با رزولوشن بالا
رقابت در حوزه مدلهای بزرگ چندوجهی به سمت تولید ویدئو با رزولوشن و طول بیشتر پیش میرود. گوگل در تاریخ ۲۷ آگوست (۶ شهریور) مدل هوش مصنوعی جدیدی برای تولید ویدئو به نام Gemini Omni 1.1 Flash را معرفی کرد. این مدل نهتنها از رزولوشن فوقالعاده بالای 4K پشتیبانی میکند، بلکه در زمینههای گسترش صحنه، کنترل حرکت دوربین و بهرهوری تولید، بهبودهای جامعی را ارائه میدهد.
قابلیتهای کلیدی Gemini Omni 1.1 Flash برای سازندگان
Gemini Omni 1.1 Flash به عنوان ابزاری با کارایی بالا برای توسعهدهندگان و خالقان حرفهای، ویژگیهای چشمگیری را در طراحی عملکردی خود جای داده است. در بخش گسترش صحنه، کاربران میتوانند بهطور یکپارچه تولید فریمهای بعدی را مستقیماً از انتهای یک ویدئوی موجود ادامه دهند. هر مرحله گسترش ۱۰ ثانیه طول دارد و حداکثر زمان کل به ۴۰ ثانیه میرسد. در کنترل حرکت دوربین، با تعیین فریمهای شروع و پایان یک شات، دستیابی به افکتهای انتقال روان و طبیعی و حرکات حرفهای دوربین آسان میشود. علاوه بر این، مدل جدید از وارد کردن کلیپهای ویدیویی مرجع تا سقف ۳ ثانیه پشتیبانی میکند و بدین ترتیب، هنگام ساخت صحنههای جدید، به حفظ پسزمینه متنی دقیق و انسجام شخصیتها کمک میکند.
بهینهسازی کیفیت و سرعت با گزینههای رزولوشن متنوع
این مدل در متعادلسازی کیفیت تصویر و بهرهوری عملیاتی، گزینههای رزولوشن متعددی را برای پاسخگویی به نیازهای سناریوهای مختلف ارائه میدهد. حالت پیشنمایش 360p میتواند سرعت تولید را تا ۶۰ درصد نسبت به رزولوشن استاندارد 720p افزایش دهد و هزینهای تنها یکسوم مدل اصلی دارد. این ویژگی برای اعتبارسنجی سریع نمونههای اولیه، تکرار استوریبرد و رندرینگ با سرعت بالا بسیار مناسب است. در حالی که بالاترین خروجی، ویدئوهای نهایی با کیفیت بالا و جزئیات کامل در رزولوشنهای 1080p یا 4K را مستقیماً تولید میکند.