گوگل با معرفی هوش مصنوعی «آمنی ۱٫۱ فلش» به دنیای تولید ویدیوهای حرفهای وارد شد
گوگل بهطور رسمی از هوش مصنوعی جدید خود، Gemini Omni 1.1 Flash، رونمایی کرد. این هوش مصنوعی شامل مجموعهای از ابزارهای حرفهای است که میتواند به کاربران در انجام وظایف مختلف کمک کند. با این فناوری،...
گوگل با ارائه Gemini Omni 1.1 Flash، مجموعهای از ابزارهای خلاقانه و قابلیتهای تولید ویدئو را برای توسعهدهندگان فراهم کرده است. هدف این مجموعه، تسهیل فرآیند ساخت ابزارها، ویرایش محتوای چندرسانهای و مدیریت جریانهای کاری ویدئویی میباشد.
طبق بیانیه مطبوعاتی گوگل، نسخه جدید Omni با تکیه بر Gemini API در Google AI Studio به مرحله آمادهسازی برای استفاده حرفهای رسیده و قرار است تولید ویدئو را کنترلپذیرتر، سریعتر و مناسبتر برای پیادهسازی در محیطهای واقعی کند.
یکی از ویژگیهای کلیدی جدید، Scene Extension یا ادامه صحنه است. توسعهدهندگان میتوانند یک ویدئوی موجود را گرفته و از همان نقطه تولید را ادامه دهند، بدون اینکه پیوستگی تصویر از بین برود.
در Omni 1.1، مدل قادر است تا ۱۰ ثانیه از زمینه قبلی را تحلیل کند که این پیشرفتی قابل توجه نسبت به مدلهای قبلی است که تنها به آخرین ثانیه تکیه میکردند. نتیجه این امر، ثبات بصری بهتر و وفاداری بیشتر به روایت است. تولید در گامهای ۱۰ ثانیهای انجام میشود و طول تجمعی ویدئو میتواند به ۴۰ ثانیه برسد.
گوگل برای این قابلیت نمونهای ارائه کرده که در آن توسعهدهنده با همان شناسه تعامل قبلی، درخواست ادامه صحنه را به مدل ارسال میکند. در این سناریو، تمرکز بر روی امتداد طبیعی داستان است و نه ساخت یک برش جدید از ابتدا.
قابلیت بعدی، تعیین فریم آغاز و پایان هر نما است. Omni 1.1 میتواند بین دو فریم کلیدی، ویدئویی پیوسته تولید کند که این موضوع برای حرکات پیچیده دوربین، چرخشهای نمایشی و زومهای نرم کاربرد دارد. نمونههای ذکر شده در توضیحات گوگل شامل نماهای نزدیک و حرکات سریع دوربین تا صحنههای موسیقایی و رقص میباشد. پیام اصلی این است که مدل جدید قرار نیست تنها یک کلیپ بسازد، بلکه باید مسیر بین دو نقطه تصویری را با انسجام طی کند.
برای مراحل اولیه کار، خروجی 360p معرفی شده تا توسعهدهندگان بتوانند پیشنمایشهای سبک بسازند. گوگل اعلام کرده که این حالت تا ۶۰ درصد سریعتر از تولید استاندارد 720p انجام میشود و هزینهای برابر با یکسوم آن دارد. کاربرد این مدل بیشتر در نمونهسازی سریع، آزمون استوریبورد و رندرهای فوری در پلتفرمهای توسعه دیده میشود. برای تیمهایی که به طور مداوم پرامپتها را اصلاح میکنند، سرعت در این مرحله میتواند تفاوت زیادی در روند کار ایجاد کند.
Omni 1.1 همچنین امکان تولید خروجیهای 1080p و 4K را فراهم میکند که این سطح برای تولید حرفهای و تحویل نهایی مناسبتر است. در نمونههای ارائه شده از سوی گوگل، صحنههایی مانند حرکت ماهی، سنجاب در حال دویدن و نماهای ماکرو از برگهای افرا نشان میدهند که مدل جدید تنها برای ایدهپردازی اولیه نیست و میتواند به خروجیهای با کیفیتتر نیز برسد.
تغییر مهم در اینجا رخ میدهد. یک ابزار واحد اکنون میتواند هم برای آزمون سریع و هم برای نسخه با کیفیتتر نهایی به کار رود، بدون اینکه جریان کاری به چند سامانه جداگانه تقسیم شود.
ویژگی دیگر، پشتیبانی از ویدئوهای مرجع در ورودی چندوجهی است. توسعهدهنده میتواند تا ۳ ثانیه از ویدئو را به عنوان مرجع وارد کند و از آن برای حفظ زمینه بصری و سازگاری شخصیتها استفاده کند. گوگل برای این قابلیت مثالی آورده که در آن، سه شخصیت تصویری با رقصهای متفاوت در یک فضای مشترک قرار میگیرند و خروجی نهایی باید یک نمای پیوسته و بدون برش باشد. چنین کاربردی برای پروژههایی که با شخصیتهای ثابت، حرکات تکرارشونده و صحنههای ترکیبی سروکار دارند، اهمیت عملی دارد.
گوگل اعلام کرده که Gemini Omni 1.1 Flash به تدریج در سراسر اکوسیستم توسعهدهندگان این شرکت منتشر میشود. دسترسی اولیه از طریق Google AI Studio ممکن شده و کسبوکارها میتوانند از طریق Gemini Enterprise Agent Platform و Agent Platform API به آن دسترسی پیدا کنند. مستندات رسمی و راهنماهای پرامپتنویسی برای پیادهسازی قابلیتهایی مانند ادامه صحنه، ویدئوهای مرجع و ارتقای کیفیت در دسترس قرار گرفتهاند. علاوه بر این، Omni 1.1 برای مشترکان Google AI Plus و Pro و Ultra در Google Flow به صورت جهانی فعال شده است و قابلیت ادامه صحنه نیز برای همین مشترکان در اپلیکیشن جمنای ارائه میشود.