Predstavte si dvojhodinovú prednášku, v ktorej potrebujete nájsť tri sekundy so správnou odpoveďou. Doterajší prístup umelej inteligencie pripomínal človeka, ktorý si video pustí od začiatku a pravidelne z neho odoberá zábery. Google teraz skúša niečo oveľa prirodzenejšie: Gemini si video začne sám „pretáčať“.
Model sa môže rozhodnúť, ktorú časť záznamu potrebuje preskúmať, akou rýchlosťou ju prejde a či mu v danej chvíli viac pomôže obraz, zvuk alebo prepis. Ak nájde podozrivý či zaujímavý moment, môže sa k nemu vrátiť a pozrieť si ho podrobnejšie.
Google nový prístup nazýva agentic video understanding. Dostali ho modely Gemini 3.7 Flash, Gemini 3.6 Flash a Gemini 3.5 Flash-Lite.
A nejde len o efektný názov. Podľa vlastných testov Googlu dokáže nový spôsob spracovania znížiť spotrebu tokenov až o 88 percent, náklady na analýzu až o 66 percent a pritom zvýšiť presnosť až o 7 percent.
Doteraz Gemini pozeral video podľa metronómu
Dôležitý je rozdiel medzi starým a novým prístupom. Gemini predtým pri bežnom statickom spracovaní načítaval video pevne nastavenou frekvenciou. Predvolená hodnota je jedna snímka za sekundu, hoci vývojár ju môže meniť.
To je jednoduché, ale má to zvláštny problém. Desať minút videa znamená stovky analyzovaných záberov, niekoľkohodinový záznam už tisíce. Model pritom veľkú časť z nich možno vôbec nepotrebuje.
A opačný problém vznikne pri rýchlej akcii. Ak sa podstatná vec odohrá medzi dvoma odobratými snímkami, systém ju môže jednoducho minúť. Jedna sekunda je v bežnom rozhovore chvíľka. Pri športovom pohybe, krátkom prestrihu či rýchlej zmene na obrazovke je to večnosť.
Agentický režim preto nepozerá celý záznam stále rovnako. Najskôr hľadá, kde by odpoveď mohla byť, a potom si zaujímavé miesto načíta podrobnejšie. Presne tak by sa v dvojhodinovom videu správal aj človek, ktorý nechce obetovať celé popoludnie jednej otázke.
Najväčší rozdiel príde pri dlhých videách
Práve pri dlhých záznamoch začínajú čísla dávať zmysel. Google spomína desaťminútové návody, deväťdesiatminútové prednášky aj niekoľkohodinové videá. Statický systém pri nich musí spracovať obrovské množstvo materiálu, hoci odpoveď môže byť ukrytá v niekoľkých krátkych úsekoch.
Nový Gemini si namiesto toho vypýta len to, čo potrebuje. Raz môže pracovať s prepisom, inokedy so zvukom a pri vizuálnom detaile si načíta samotné snímky. Ak treba preskúmať rýchly pohyb, môže príslušnú časť znovu prejsť s vyššou frekvenciou záberov.
Znie to ako drobná technická optimalizácia. V skutočnosti však rieši jednu z najväčších nepríjemností práce s videom: každá ďalšia minúta predstavuje ďalšie dáta, ďalšie tokeny a ďalšie peniaze.
Google preto uvádza úsporu tokenov až 88 percent a nákladov až 66 percent. Slovo „až“ je tu podstatné. Nie je to sľub, že každý klip bude automaticky o dve tretiny lacnejší. Ide o najlepšie výsledky z testov na vybraných úlohách.
Gemini môže hľadať okamih kratší než sekunda
Úspora peňazí je len polovica príbehu. Zaujímavejšie je, čo nový spôsob „pozerania“ umožňuje.
Gemini dokáže hľadať veľmi krátke momenty, presnejšie určovať hranice rýchlych strihov, skúmať nezvyčajné udalosti vo videu alebo opakovane prezerať krátky úsek, keď potrebuje spočítať pohyby či predmety. Google hovorí aj o vyhľadávaní typu ihla v kope sena: otázke, ktorej odpoveď sa skrýva niekde v mnohohodinovom zázname.
Model teda nedostane pokyn len „pozri si toto video“. Počas riešenia úlohy si sám rozhoduje, kam sa pozrie znova a kde má zmysel venovať viac pozornosti.
Google tvrdí, že zo súčasnej trojice dosahuje najlepšiu celkovú kvalitu aj pomer ceny a výsledku Gemini 3.7 Flash.
Bežný používateľ to zatiaľ veľmi neuvidí
Háčik je v dostupnosti. Agentické spracovanie videa je momentálne určené najmä vývojárom. Funguje pri nahraných videách aj videách z YouTube cez Gemini API v Google AI Studio a cez firemnú platformu Gemini Enterprise Agent Platform.
Samostatný príplatok za túto funkciu Google nezaviedol. Vývojár platí štandardnú cenu za tokeny, takže hlavná výhoda je pomerne priamočiara: ak systém spotrebuje na vyriešenie rovnakej úlohy menej tokenov, účet môže byť nižší.
Pre väčšinu ľudí však bude zaujímavejšie až to, čo príde potom. Google plánuje agentické spracovanie videa rozšíriť do aplikácie Gemini pre modely Flash a Flash-Lite. Presný termín zatiaľ neoznámil.
Najzaujímavejšie miesto môže byť YouTube
Ešte väčší praktický význam môže mať YouTube. Google oznámil, že v nasledujúcich mesiacoch chce rovnakú technológiu použiť pri funkcii Ask YouTube na stránke prehrávaného videa.
Rozdiel je zásadný. Odpoveď na otázku o videu nemusí vychádzať iba z titulkov alebo prepisu. Systém sa môže pozrieť aj na to, čo sa v konkrétnom okamihu skutočne deje na obraze.
Ak sa napríklad vo videu niečo ukáže bez jediného slova komentára, textový prepis o tom nemusí vedieť vôbec nič. Video model áno.
A práve tu sa z technickej novinky o tokenoch stáva funkcia, ktorú si môže všimnúť aj človek, ktorý netuší, čo token je. Namiesto umelej inteligencie, ktorá o dvojhodinovom videu číta akýsi jeho stenografický zápis, dostaneme asistenta, ktorý si podľa potreby sám pretočí prehrávač na správne miesto.
Trochu ako človek. Len s výrazne menšou potrebou kávy.