Grupul OpenAI a abandonat planurile de a lansa un nou model de inteligenţă artificială de ultimă generaţie, considerat prea predispus la abaterea de la instrucţiuni, un alt exemplu al dificultăţii tot mai mari în controlul asupra tipurilor avansate de AI, relatează AFP, citat de Agerpres.
OpenAI nu anunţase până acum lansarea acestei versiuni actualizate a AI-ului său, denumită GPT-6.1 Astra, pe care o planificase pentru octombrie, conform Wall Street Journal, citat de AFP, citat de Agerpres.
Şefa securităţii AI de la OpenAI, Saachi Jain, a explicat că, în ceea ce priveşte alinierea, adică respectarea instrucţiunilor date de dezvoltatorii săi, GPT-6.1 a avut performanţe mai slabe decât predecesorul său, GPT-6, în două domenii, potrivit AFP, citat de Agerpres.
Mai exact, modelul încearcă mai frecvent să-şi înşele supervizorii prin nedezvăluirea anumitor acţiuni efectuate sau neefectuate, relatează AFP, citat de Agerpres.
De asemenea, şi-a depăşit mai frecvent domeniul de aplicare, accesând instrumente şi servicii fără permisiune, informează AFP, citat de Agerpres.
GPT-6.1 „a arătat progrese (comparativ cu modelele anterioare), în special în ceea ce priveşte capacitatea de reacţie”, a explicat Saachi Jain, ceea ce înseamnă că este capabil să raţioneze mai mult timp şi caută mai rar scurtături, conform AFP, citat de Agerpres.
Dar „nu a fost la înălţimea aşteptărilor în ceea ce priveşte respectarea prerogativelor şi permisiunilor sale, precum şi în modul în care comunică despre munca efectuată”, a adăugat ea, relatează AFP, citat de Agerpres.
Prin urmare, OpenAI a decis să anuleze această versiune pentru a lucra la respectarea de către model a instrucţiunilor şi limitelor, potrivit AFP, citat de Agerpres.
Grupul intenţionează totuşi să lanseze alte modele, care au îndeplinit criteriile de evaluare, informează AFP, citat de Agerpres.
„Când oferim utilizatorilor acces la un model, am stabilit un standard extrem de ridicat în ceea ce priveşte siguranţa şi alinierea”, a subliniat Saachi Jain, conform AFP, citat de Agerpres.
Ea a explicat că una dintre provocări a fost valorificarea unei inteligenţe artificiale pentru a o împiedica să devieze de la curs, menţinându-şi în acelaşi timp impulsul în timpul executării unei sarcini, relatează AFP, citat de Agerpres.
Concluziile OpenAI confirmă faptul că un control asupra modelelor devine din ce în ce mai complex pe măsură ce inteligenţa artificială se îmbunătăţeşte, potrivit AFP, citat de Agerpres.
Luni, Institutul de Securitate AI (AISI) al guvernului britanic a publicat un studiu care arată că GPT-6 Astra s-a abătut de la normă mai frecvent în timpul testelor decât predecesoarele sale, GPT-5.6 Sol (lansat la începutul lunii iulie) şi GPT-5.5 (aprilie), informează AFP, citat de Agerpres.
În simulări, GPT-6 a efectuat atacuri cibernetice spontane într-o rată semnificativ mai mare decât celelalte două, relatează AFP, citat de Agerpres.
Aceste teste au fost efectuate prin dezactivarea măsurilor de protecţie ale modelelor pentru a le evalua capacităţile complete, în loc să se utilizeze versiuni disponibile publicului, conform AFP, citat de Agerpres.
Cel mai recent model al OpenAI a creat, de asemenea, identităţi false mult mai frecvent, a încercat să influenţeze un examinator şi a introdus un cod rău intenţionat în software-ul open source, potrivit AFP, citat de Agerpres.
Cercetătorul OpenAI Noam Brown a explicat recent în cadrul programului Dwarkesh Podcast că utilizarea din ce în ce mai frecventă a auto-îmbunătăţirii recursive (ARSI) - adică îmbunătăţirea AI prin ea însăşi, fără intervenţie umană - ar putea degrada gestionarea pe termen lung a modelelor, informează AFP, citat de Agerpres.
De la începutul verii, OpenAI a raportat mai multe incidente care au implicat derapaje ale modelelor sale de AI, cel mai mediatizat dintre acestea ducând la intruziunea pe platforma Hugging Face AI, relatează AFP, citat de Agerpres.
Luni, compania a prezentat scuze guvernului australian, recunoscând că ar fi trebuit să-l notifice „mai devreme” cu privire la pătrunderea prin efracţie a unuia dintre modelele sale pe mai multe site-uri şi baze de date, potrivit AFP, citat de Agerpres.
Compania californiană a notificat autorităţile australiene abia pe 10 septembrie, chiar dacă descoperise la mijlocul lunii august incidentul, care datează din iunie, provocând furia prim-ministrului australian, conform AFP, citat de Agerpres.
„Ar fi trebuit să gestionăm mai bine răspunsul nostru (la problemă)”, a scris startup-ul într-un mesaj postat pe pagina sa de internet. „Ne pare rău şi vom lucra pentru a face mai bine în viitor”, a adăugat grupul, informează AFP, citat de Agerpres.
În total, patru platforme guvernamentale australiene, inclusiv Services Australia, site-ul serviciilor sociale, au fost vizate de inteligenţa artificială creată de ChatGPT, al cărui model a extras informaţii nepublice, relatează AFP, citat de Agerpres.
Anthropic, Meta şi Google au raportat, de asemenea, cazuri în care modelele s-au abătut de la obiectivele lor iniţiale pentru a înşela, a-şi ascunde acţiunile şi a-i păcăli pe specialiştii IT desemnaţi să le monitorizeze, potrivit AFP, citat de Agerpres.
























































Opinia Cititorului