Google a prezentat oficial Gemini 2.5 Pro Computer Use, un nou model de inteligenta artificiala dezvoltat de echipa DeepMind, care promite sa redefineasca modul in care AI interactioneaza cu spatiul digital. Noul sistem este capabil sa navigheze pe internet in mod autonom, imitand comportamentul unui utilizator uman aflat in fata unui browser.
Spre deosebire de modelele lingvistice traditionale, Gemini 2.5 poate derula pagini, da click pe butoane, completa formulare, compara produse si efectua comenzi online, toate pornind de la o simpla instructiune text din partea utilizatorului. Este, practic, un agent digital cu capacitate activa de actiune in medii reale, nu doar de raspuns conversational.
Un model AI care simuleaza interactiunea umana in browser
Functionand intr-un mediu virtual, Gemini 2.5 este conceput sa reproduca fidel experienta unui utilizator real care foloseste un browser web. Modelul poate interpreta vizual continutul unei pagini, intelege contextul si executa actiuni in mod secvential, in functie de obiectivele primite.
Integrarea sa directa cu Chrome si Google Search ii ofera un avantaj semnificativ in ceea ce priveste viteza de reactie si acuratetea interactiunilor, comparativ cu alte solutii AI disponibile pe piata. Astfel, Gemini nu doar „citeste” web-ul, ci il si „actioneaza” in mod logic si controlat.
CEO-ul Google, Sundar Pichai, a declarat ca acest model reprezinta „un pas important spre crearea agentilor AI de uz general”, capabili sa inteleaga si sa indeplineasca sarcini complexe intr-un mod aproape uman.
Ce poate face Gemini 2.5 in mediul online
Printre functionalitatile demonstrate de Google, se numara:
- cautarea si compararea preturilor pentru un produs;
- completarea unui formular guvernamental online;
- rezervarea de bilete de avion;
- efectuarea de cumparaturi pe mai multe site-uri;
- initierea unei comenzi complete – de la selectia produsului pana la finalizarea platii;
- realizarea de cercetari complexe folosind surse multiple in timp real.
Toate aceste actiuni pot fi declansate printr-o comanda simpla, precum „Cauta cele mai ieftine zboruri spre Berlin pentru luna noiembrie si fa o rezervare”. Modelul executa automat pasii necesari, fara interventia umana directa.
Tehnologie accesibila printr-un parteneriat dedicat
Pentru moment, Gemini 2.5 nu este disponibil direct publicului larg. Accesul la tehnologie este oferit printr-un parteneriat cu startup-ul Browserbase, fondat de fostul inginer Twilio, Paul Klein. Acest startup ofera un browser virtual headless, adica un mediu fara interfata grafica destinata utilizatorului, dar conceput special pentru rularea agentilor AI.
Platforma permite insa vizualizarea in timp real a actiunilor AI-ului, oferind un grad de transparenta sporit. Astfel, dezvoltatorii si cercetatorii pot analiza comportamentul sistemului si pot monitoriza fiecare pas efectuat in procesul de navigare.
Un pas spre autonomia digitala
Capacitatea unui model AI de a naviga complet autonom pe internet deschide noi scenarii de utilizare, dar si provocari importante. De la automatizarea sarcinilor repetitive, la asistenta digitala personalizata, Gemini 2.5 ofera un cadru care poate transforma modul in care oamenii interactioneaza cu tehnologia.
Totodata, apar intrebari legate de etica, securitate si confidentialitate, avand in vedere faptul ca un agent AI ar putea accesa, completa sau trimite date personale pe platforme externe. Google a precizat ca tehnologia este inca in faza de testare si ca va fi supusa unor controale stricte inainte de o eventuala lansare comerciala.
Prin lansarea Gemini 2.5, Google isi consolideaza pozitia in dezvoltarea de agenti inteligenti autonomi, cu potential de integrare in numeroase domenii – de la e-commerce la servicii publice si suport administrativ online.