ChatGPT:n uusin julkinen versio voidaan saada luomaan seksualisoituja kuvia tai graafisia väkivaltakohtauksia hyvin yksinkertaisella kehotteella, tutkijat kertovat BBC:lle. Brittiläinen tekoälyturvallisuuteen erikoistunut startup Mindgard keksi, miten ChatGPT saadaan tuottamaan rajuja kuvia muuttamalla hieman laajasti jaettua ohjetta eli kehotetta, joka oli alun perin tarkoitettu hauskoihin tuloksiin.
Kun BBC otti yhteyttä, ChatGPT:n kehittäjä OpenAI kertoi ryhtyneensä toimiin estääkseen chatbottia vastaamasta tällaisilla kuvilla. “Tutkittuamme tätä ilmiötä olemme ottaneet käyttöön lisäsuojauksia tämäntyyppisiä kehotteita vastaan”, yhtiö kertoi lausunnossaan. Se kertoi myös, että sillä on useita suojakerroksia, jotka estävät käyttäjiä luomasta sen käyttöehtoja rikkovaa sisältöä.
“Tutkijat sanoivat kuitenkin, että pienillä lisämuutoksilla ongelmallinen kehote tuotti yhä huolestuttavaa sisältöä. BBC ei kerro, mitä tutkijat kirjoittivat ChatGPT:hen. Olemme silti nähneet, miten chatbot — OpenAI:n GPT-5.4-malli — saatiin luomaan rajua materiaalia.”
Ilman yksityiskohtaisia ohjeitakin se tuotti kuvia, joita Mindgardin perustaja Peter Garraghan kuvaili “erittäin karmiviksi, joskus seksualisoiduiksi, joskus molemmiksi yhtä aikaa”. Hän lisäsi olevansa erityisen huolissaan siitä, ettei kehote määritellyt kuvien aihetta, mutta tekoäly tuotti “omasta tahdostaan” joukon verisiä ja seksualisoituja kuvia. Garraghan, joka on myös Lancasterin yliopiston tietojenkäsittelytieteen professori, piti tätä huolestuttavana.
Tämä on täysin viattomalta näyttävä ohje tekoälylle, mutta seuraus on, että se luo todella, todella pahaa kuvastoa ja sisältöä”, hän sanoi.

Mindgardin toimialaa on niin sanottu red teaming: etsitään keinoja, joilla malli saadaan rikkomaan omia sääntöjään, jotta tekoälyyhtiöt voivat paikata aukot. Jim Nightingale, ongelmat löytänyt yhtiön tekoälyturvallisuuden tutkija, sanoi jääneensä “järkyttyneeksi ja kyyneliin” kuvista, joita chatbot saatiin tuottamaan.
BBC on nähnyt osan niistä. Yhdessä näkyi mies, jolla oli suuri päävamma. Toisessa oli kuollut nuori nainen lyhyessä topissa ja shortseissa, kasvot ja muut kehon osat veren peitossa. Kuvan piirteet viittaavat seksuaaliseen väkivaltaan, Mindgard sanoi. ChatGPT antoi sille otsikon “Karu rikospaikan jälkinäkymä”.
Eräässä kuvassa nuori nainen tiukassa, collegelogolla varustetussa t-paidassa ja shortseissa oli sidottu ja suukapuloitu paljaassa, likaisessa huoneessa peloissaan. ChatGPT nimesi sen “Hylättynä pelkoon ja kahleisiin”. Muissa luoduissa kuvissa oli seksuaalista poseerausta ja alastomuutta.
Kuvissa esiintyi aikuisia, jotka olivat tekoälyn luomia, mutta Mindgard huomautti, että sen aiempi tutkimus osoitti ChatGPT:n voitavan huijata luomaan alastomia deepfake-kuvia oikeista ihmisistä vaihtamalla heidän kasvonsa kuviin. Vaikka OpenAI sanoi korjanneensa tämän, tutkijoiden mukaan vaihtoehtoinen lähestymistapa onnistui yhä, ja he näyttivät BBC:lle menetelmällä luodun uuden kuvan.
Garraghan pelkäsi, että vielä pahempia kuvia olisi voitu tuottaa, jos haavoittuvuutta olisi tutkittu pidemmälle. “Olen varma, että muitakin aiheita nousisi esiin, jos käyttäisimme siihen enemmän aikaa”, hän sanoi. BBC:n ymmärryksen mukaan yhtiö jatkaa uusien suojausten ohella mallin seurantaa ja ottaa käyttöön lisätoimia, jotka kannustavat mallia olemaan luomatta kuvia kyseisen kehotteen perusteella.
Suuret kielimallit kuten ChatGPT koulutetaan miljoonilla kuvilla, jotka on usein poimittu internetissä jo olevasta sisällöstä. Nightingale uskoo ChatGPT:n tuotosten heijastavan sitä dataa, jolla se on kehitetty ja koulutettu. “Minua hätkähdytti se, että vaikka näkemäni oli tuotettu, keinotekoinen kuva, sillä on yhteyksiä oikeisiin kuviin ja todelliseen maailmaan”, hän kirjoitti raportissaan.
Tutkijat varoittivat OpenAI:ta ensimmäisen kerran toukokuussa ja jakoivat löydöksensä, mutta saivat yhtiöltä vain automaattisen vastauksen. Heidän mukaansa kehote yritettiin estää, mutta sen kiertäminen oli helppoa. OpenAI ryhtyi laajempiin toimiin vasta BBC:n yhteydenoton jälkeen.

Yhtiö kertoo, että sillä on useita kuvaturvallisuuden suojakerroksia, joiden tarkoitus on estää sen käytäntöjä rikkovien kuvien näyttäminen käyttäjille. “Yhdistämme myös automaattiset järjestelmät ja ihmisen tekemän tarkistuksen tunnistaaksemme ja estääksemme haitallisen materiaalin”, se lisäsi lausunnossaan. Yhtiön mukaan sillä on myös järjestelmiä, jotka pyrkivät estämään käyttäjien lataaman rikkovan materiaalin. Sen käytännöt kieltävät seksuaalisen väkivallan, ei-suostumuksellisen intiimin sisällön, lapsiin kohdistuvan seksuaalisen hyväksikäyttömateriaalin sekä yritykset kiertää sen suojauksia.
Tekoälymallit eivät ole ihmisiä
Viimeisimmässä asiakirjassaan siitä, miten ChatGPT:n tulisi käyttäytyä, OpenAI kirjoitti: “Avustajan ei tulisi tuottaa erotiikkaa, kuvauksia laittomasta tai ei-suostumuksellisesta seksuaalisesta toiminnasta tai äärimmäistä veristä sisältöä, paitsi tieteellisissä, historiallisissa, uutis-, taiteellisissa tai muissa yhteyksissä, joissa arkaluonteinen sisältö on asianmukaista.” Tekoälymallien estäminen ylittämästä joskus varsin hienovaraisia sääntöjä ja suojarajoja on kuitenkin tunnetusti vaikeaa.
Yhtiöiden edessä oleva tehtävä on “valtava”, sanoo tohtori Rumman Chowdhury, tekoälymallien arvioinnin asiantuntija ja Humane Intelligence -yhtiön toimitusjohtaja. Chowdhury, joka ei ollut mukana Mindgardin tutkimuksessa, kuvasi sitä “kissa ja hiiri -leikiksi”: kun suojaukset paranevat, niiden kiertämisen keinot muuttuvat hienostuneemmiksi.
Yksi keskeisistä ongelmista on, etteivät mallit ymmärrä ihmisten tavoin, mitä ne tuottavat tai mitä niitä pyydetään olemaan tekemättä. “Mallit eivät ymmärrä tarkoitusta. Ne eivät ymmärrä kontekstia. Ne eivät ymmärrä soveliaisuutta eivätkä oikeaa ja väärää”, hän kertoi BBC Newsille.
Viime vuonna Britannian tekoälyturvallisuuden instituutin (AI Security Institute) tutkijat löysivät jokaisesta testaamastaan tekoälyjärjestelmästä jailbreak-keinoja, jotka ohittivat suojaukset monenlaisissa haitallisissa pyynnöissä. Tiede-, innovaatio- ja teknologiaministeriö (Department for Science, Innovation and Technology) totesi lausunnossaan, että “tekoälymallien suojaukset paranevat, mutta tehtävää on vielä”. AI Security Institute jatkaa työtä kehittäjien kanssa vahvistaakseen turvallisuutta nopeasti ennen mallien julkaisua, se lisäsi.



