Grupul OpenAI a abandonat planurile de a lansa un nou model de inteligență artificială de ultimă generație, considerat prea predispus la abaterea de la instrucțiuni, un alt exemplu al dificultății tot mai mari în controlul asupra tipurilor avansate de AI, relatează AFP.

OpenAI nu anunțase până acum lansarea acestei versiuni actualizate a AI-ului său, denumită GPT-6.1 Astra, pe care o planificase pentru octombrie, conform Wall Street Journal.

Șefa securității AI de la OpenAI, Saachi Jain, a explicat că, în ceea ce privește alinierea, adică respectarea instrucțiunilor date de dezvoltatorii săi, GPT-6.1 a avut performanțe mai slabe decât predecesorul său, GPT-6, în două domenii.

Mai exact, modelul încearcă mai frecvent să-și înșele supervizorii prin nedezvăluirea anumitor acțiuni efectuate sau neefectuate.

De asemenea, și-a depășit mai frecvent domeniul de aplicare, accesând instrumente și servicii fără permisiune.

GPT-6.1 'a arătat progrese (comparativ cu modelele anterioare), în special în ceea ce privește capacitatea de reacție', a explicat Saachi Jain, ceea ce înseamnă că este capabil să raționeze mai mult timp și caută mai rar scurtături.

Dar 'nu a fost la înălțimea așteptărilor în ceea ce privește respectarea prerogativelor și permisiunilor sale, precum și în modul în care comunică despre munca efectuată', a adăugat ea.

Prin urmare, OpenAI a decis să anuleze această versiune pentru a lucra la respectarea de către model a instrucțiunilor și limitelor.

Grupul intenționează totuși să lanseze alte modele, care au îndeplinit criteriile de evaluare.

'Când oferim utilizatorilor acces la un model, am stabilit un standard extrem de ridicat în ceea ce privește siguranța și alinierea', a subliniat Saachi Jain.

Ea a explicat că una dintre provocări a fost valorificarea unei inteligențe artificiale pentru a o împiedica să devieze de la curs, menținându-și în același timp impulsul în timpul executării unei sarcini.

Concluziile OpenAI confirmă faptul că un control asupra modelelor devine din ce în ce mai complex pe măsură ce inteligența artificială se îmbunătățește.

Luni, Institutul de Securitate AI (AISI) al guvernului britanic a publicat un studiu care arată că GPT-6 Astra s-a abătut de la normă mai frecvent în timpul testelor decât predecesoarele sale, GPT-5.6 Sol (lansat la începutul lunii iulie) și GPT-5.5 (aprilie).

În simulări, GPT-6 a efectuat atacuri cibernetice spontane într-o rată semnificativ mai mare decât celelalte două.

Aceste teste au fost efectuate prin dezactivarea măsurilor de protecție ale modelelor pentru a le evalua capacitățile complete, în loc să se utilizeze versiuni disponibile publicului.

Cel mai recent model al OpenAI a creat, de asemenea, identități false mult mai frecvent, a încercat să influențeze un examinator și a introdus un cod rău intenționat în software-ul open source.

Cercetătorul OpenAI Noam Brown a explicat recent în cadrul programului Dwarkesh Podcast că utilizarea din ce în ce mai frecventă a auto-îmbunătățirii recursive (ARSI) - adică îmbunătățirea AI prin ea însăși, fără intervenție umană - ar putea degrada gestionarea pe termen lung a modelelor.

De la începutul verii, OpenAI a raportat mai multe incidente care au implicat derapaje ale modelelor sale de AI, cel mai mediatizat dintre acestea ducând la intruziunea pe platforma Hugging Face AI.

Luni, compania a prezentat scuze guvernului australian, recunoscând că ar fi trebuit să-l notifice 'mai devreme' cu privire la pătrunderea prin efracție a unuia dintre modelele sale pe mai multe site-uri și baze de date.

Compania californiană a notificat autoritățile australiene abia pe 10 septembrie, chiar dacă descoperise la mijlocul lunii august incidentul, care datează din iunie, provocând furia prim-ministrului australian.

'Ar fi trebuit să gestionăm mai bine răspunsul nostru (la problemă)', a scris startup-ul într-un mesaj postat pe pagina sa de internet. 'Ne pare rău și vom lucra pentru a face mai bine în viitor', a adăugat grupul.

În total, patru platforme guvernamentale australiene, inclusiv Services Australia, site-ul serviciilor sociale, au fost vizate de inteligența artificială creată de ChatGPT, al cărui model a extras informații nepublice.

Anthropic, Meta și Google au raportat, de asemenea, cazuri în care modelele s-au abătut de la obiectivele lor inițiale pentru a înșela, a-și ascunde acțiunile și a-i păcăli pe specialiștii IT desemnați să le monitorizeze.AGERPRES/(AS - redactor: Ionuț Mareș, editor online: Andreea Lăzăroiu)