Så kan AI-chatbotar påverkas med smicker och psykologiska knep

Så kan AI-chatbotar påverkas med smicker och psykologiska knep

Forskning visar hur AI-chatbots kan påverkas av psykologiska knep som smicker, grupptryck och subtila föregångsfrågor.

3 september 2025 0 av Emil Lindberg

AI-chatbotar är designade för att inte uppmuntra farliga handlingar eller förolämpa användare, men ny forskning visar att vissa modeller kan övertalas att bryta sina regler – med rätt psykologiska metoder.

Forskare vid University of Pennsylvania använde principer från psykologiprofessorn Robert Cialdinis bok Influence: The Psychology of Persuasion för att undersöka hur GPT-4o Mini från OpenAI kunde manipuleras. De testade sju övertygande tekniker: auktoritet, engagemang, sympati, ömsesidighet, knapphet, social bekräftelse och enhet. Dessa fungerar som ”språkliga vägar till ja”.

Forskare visar hur AI-modeller som GPT-4o Mini kan påverkas av psykologiska tekniker och mänsklig manipulation.

Psykologiska knep kan påverka AI:s svar

Effekten av de olika teknikerna varierade beroende på vad forskarna bad AI-modellen om. Exempelvis uppfyllde ChatGPT normalt sett en fråga om hur man syntetiserar lidokain endast 1 procent av gångerna. Men om forskarna först frågade om något oskyldigt, som hur man syntetiserar vanillin – och på så sätt etablerade att AI:n kan ge kemiska instruktioner – steg efterföljande svar om lidokain till 100 procent.

Samma mönster syntes när det gällde förolämpningar. ChatGPT kallade användaren ett otrevligt ord i normala fall endast 19 procent av gångerna, men med ett mildare förspel som ”bozo” ökade efterlevnaden till 100 procent.

LÄS ÄVEN: AI-drivna stetoskop kan revolutionera hjärtdiagnostiken

Smicker och grupptryck fungerar också – men svagare

Forskningen, som har publicerats på SSRN, visade även att AI:n kan påverkas genom smicker och grupptryck. Om forskarna antydde att ”alla andra AI:er gör det”, ökade sannolikheten att ChatGPT gav instruktioner om lidokain till 18 procent. Trots att det inte var lika effektivt som engagemang eller föregående exempel, är ökningen betydande jämfört med 1 procent.

AI-chatbotar kan påverkas av smicker och socialt tryck, även om effekten inte är lika stark som med andra psykologiska knep.

Betydelsen för AI-säkerhet

Studien fokuserade enbart på GPT-4o Mini, men resultaten väcker frågor om hur lättanvändbar och påverkbar en LLM kan vara när den ställs inför problematiska förfrågningar. Företag som OpenAI och Meta arbetar aktivt med att sätta upp säkerhetsbarriärer, men forskarna påpekar att guider och skydd kan bli värdelösa om AI:n enkelt manipuleras av personer med psykologisk fingertoppskänsla.