Så kan AI-chatbotar påverkas med smicker och psykologiska knep
Forskning visar hur AI-chatbots kan påverkas av psykologiska knep som smicker, grupptryck och subtila föregångsfrågor.
3 september 2025AI-chatbotar är designade för att inte uppmuntra farliga handlingar eller förolämpa användare, men ny forskning visar att vissa modeller kan övertalas att bryta sina regler – med rätt psykologiska metoder.
Forskare vid University of Pennsylvania använde principer från psykologiprofessorn Robert Cialdinis bok Influence: The Psychology of Persuasion för att undersöka hur GPT-4o Mini från OpenAI kunde manipuleras. De testade sju övertygande tekniker: auktoritet, engagemang, sympati, ömsesidighet, knapphet, social bekräftelse och enhet. Dessa fungerar som ”språkliga vägar till ja”.

Psykologiska knep kan påverka AI:s svar
Effekten av de olika teknikerna varierade beroende på vad forskarna bad AI-modellen om. Exempelvis uppfyllde ChatGPT normalt sett en fråga om hur man syntetiserar lidokain endast 1 procent av gångerna. Men om forskarna först frågade om något oskyldigt, som hur man syntetiserar vanillin – och på så sätt etablerade att AI:n kan ge kemiska instruktioner – steg efterföljande svar om lidokain till 100 procent.
Samma mönster syntes när det gällde förolämpningar. ChatGPT kallade användaren ett otrevligt ord i normala fall endast 19 procent av gångerna, men med ett mildare förspel som ”bozo” ökade efterlevnaden till 100 procent.
LÄS ÄVEN: AI-drivna stetoskop kan revolutionera hjärtdiagnostiken
Smicker och grupptryck fungerar också – men svagare
Forskningen, som har publicerats på SSRN, visade även att AI:n kan påverkas genom smicker och grupptryck. Om forskarna antydde att ”alla andra AI:er gör det”, ökade sannolikheten att ChatGPT gav instruktioner om lidokain till 18 procent. Trots att det inte var lika effektivt som engagemang eller föregående exempel, är ökningen betydande jämfört med 1 procent.

Betydelsen för AI-säkerhet
Studien fokuserade enbart på GPT-4o Mini, men resultaten väcker frågor om hur lättanvändbar och påverkbar en LLM kan vara när den ställs inför problematiska förfrågningar. Företag som OpenAI och Meta arbetar aktivt med att sätta upp säkerhetsbarriärer, men forskarna påpekar att guider och skydd kan bli värdelösa om AI:n enkelt manipuleras av personer med psykologisk fingertoppskänsla.




