Istraživanje za seminarski rad: Personalizacija odgovora u konverzacijskim AI sustavima: između korisničkog iskustva i etičkih izazova
Proces izrade seminarskog rada
Naslov rada: Personalizacija odgovora u konverzacijskim AI sustavima: između korisničkog iskustva i etičkih izazova
Stanje izvora: 5. kolovoza 2026.
1. Sažetak i središnja teza
Personalizacija u konverzacijskim AI sustavima nije jedinstvena tehnika, nego skup postupaka kojima se odgovor prilagođava korisniku, njegovu kontekstu, prethodnim interakcijama, preferencijama, komunikacijskom stilu ili procijenjenom emocionalnom stanju. Literatura razlikuje personalizaciju putem eksplicitno zadanih profila, implicitnog zaključivanja o korisniku, korištenja povijesti razgovora, prilagodbe stila i afektivnog računarstva. Pregled Chen i suradnika pokazuje da se istraživanja personaliziranog dijaloga protežu od persona-agenta do modeliranja eksplicitnih i implicitnih korisničkih signala te obuhvaćaju velik broj različitih skupova podataka, problema i evaluacijskih mjera. ([aclanthology.org](https://aclanthology.org/2024.lrec-main.1192/))
Središnji zaključak dosjea: personalizacija može poboljšati relevantnost, doživljenu prirodnost, kvalitetu interakcije i neke pokazatelje zadovoljstva, ali ne postoji dovoljno dokaza za tvrdnju da je personalizirani odgovor općenito bolji od generičkog. Učinak ovisi o zadatku, korisniku, vrsti personalizacije, količini podataka, načinu objašnjenja i razini korisničke kontrole. Istodobno, personalizacija povećava površinu za privatnosne povrede, profiliranje, stereotipizaciju, manipulaciju i pogrešnu atribuciju sposobnosti sustavu.
Najbolji istraživački okvir zato nije pitanje „personalizirati ili ne”, nego: koje se značajke korisnika koriste, kako se izvode, koliko dugo se pohranjuju, kako utječu na odgovor, može li ih korisnik ispraviti ili izbrisati te može li razumjeti i kontrolirati personalizaciju.
2. Tvrdnje i istraživačka pitanja
- Definicijska tvrdnja: personalizacija odgovora obuhvaća prilagodbu sadržaja, tona, duljine, razine objašnjenja, inicijative i emocionalnog stila korisniku ili situaciji.
- Tehnička tvrdnja: personalizacija se može provoditi na razini podataka, korisničkog modela, memorije, konteksta, generiranja odgovora ili samog modela.
- Empirijska tvrdnja: personalizacija može povećati relevantnost i doživljenu kvalitetu, ali učinak nije stabilan među populacijama i domenama.
- Evaluacijska tvrdnja: zadovoljstvo nije jedinstvena mjera; uključuje relevantnost, razumijevanje, učinkovitost, izvršenje zadatka, zanimljivost i emocionalni doživljaj.
- Privatnosna tvrdnja: personalizacija često zahtijeva obradu osobnih podataka ili zaključivanje o korisniku, što stvara rizike povezane s opsegom podataka, svrhom obrade, pohranom i sekundarnom uporabom.
- Etička tvrdnja: profiliranje može poboljšati prilagodbu, ali istodobno učvrstiti stereotipe i proizvesti različito štetne odgovore za različite skupine.
- Transparentnosna tvrdnja: obavijest da korisnik razgovara s AI sustavom nije isto što i objašnjenje kako personalizacija utječe na odgovor.
- Upravljačka tvrdnja: sigurniji dizajn zahtijeva korisničku kontrolu, ograničavanje podataka, mogućnost ispravka i brisanja profila, praćenje pristranosti te odvojeno testiranje korisničkog iskustva i štetnih ishoda.
3. Pojmovno razgraničenje
Personalizacija, prilagodba i kontekstualizacija
Personalizacija se odnosi na prilagodbu pojedincu ili skupini na temelju osobnih karakteristika, preferencija ili povijesti. Kontekstualna prilagodba može biti kratkotrajnija: odgovor se prilagođava trenutačnom cilju, prethodnoj poruci, vremenu, kanalu ili situaciji, bez stvaranja trajnog profila. Personalizacija agenta znači da sustav oblikuje vlastitu personu, ton ili stil, dok personalizacija korisnika znači da sustav modelira osobu s kojom razgovara. Ove se dvije razine ne smiju poistovjetiti.
Pregled personaliziranog dijaloga iz 2024. izrijekom obuhvaća i personu agenta i hvatanje eksplicitnih i implicitnih korisničkih signala. To znači da sustav može biti „personaliziran” zato što se ponaša kao određena persona, zato što koristi korisničke preferencije ili zato što iz razgovora zaključuje o korisniku. Ti oblici imaju različite tehničke i etičke posljedice. ([aclanthology.org](https://aclanthology.org/2024.lrec-main.1192/))
Fenomen i mehanizam nisu ista stvar
Bolja ocjena personaliziranog odgovora ne dokazuje da je sustav točnije razumio korisnika. Korisnik može odgovor ocijeniti boljim zato što djeluje osobnije, toplije ili kao da je izrađen „posebno za njega”. Eksperiment s filmskim preporukama pokazao je da su sudionici davali više ocjene preporukama kada su im iste preporuke predstavljene kao personalizirane, iako su stvarne preporuke bile identične. Taj nalaz podupire razlikovanje stvarne personalizacije od percipirane personalizacije. ([doi.org](https://doi.org/10.1145/3544548.3580656))
4. Metode personalizacije odgovora
4.1. Eksplicitni korisnički profil
Korisnik izravno navodi ime, jezik, stručnu razinu, interese, preferirani ton, duljinu odgovora ili ciljeve. Prednost je relativno jasna kontrola i lakše objašnjenje izvora prilagodbe. Nedostatak je potreba da korisnik ulaže napor, kao i mogućnost da se uneseni podaci promijene, budu netočni ili previše široko protumačeni.
4.2. Implicitno zaključivanje iz razgovora
Sustav iz prethodnih poruka zaključuje o interesima, znanju, osobnosti, emocionalnom stanju ili komunikacijskim navikama korisnika. Cho i suradnici razvili su model koji implicitnu personu korisnika izvodi iz povijesti dijaloga bez vanjskog znanja; autori izvješćuju o poboljšanju automatskih mjera i ljudskih evaluacija u odnosu na usporedne metode. Međutim, zaključena persona nije izravno opažena činjenica, nego modelova procjena podložna pogreškama. ([aclanthology.org](https://aclanthology.org/2022.coling-1.29/))
4.3. Memorija i dohvaćanje prethodnih interakcija
sustav može pohranjivati činjenice o korisniku, sažetke ranijih razgovora ili obrasce ponašanja te ih dohvaćati kada su relevantni za novi upit. Ovaj pristup može smanjiti ponavljanje informacija i povećati kontinuitet, ali stvara trajni profil koji mora imati jasnu svrhu, rok čuvanja, mogućnost uvida i mogućnost brisanja.
4.4. Prilagodba komunikacijskog stila
Odgovor se može prilagoditi formalnosti, duljini, razini stručnosti, izravnosti, redoslijedu informacija, jeziku, količini primjera ili stupnju emocionalne topline. U zdravstvenom kontekstu, istraživanje na pacijentima s kroničnom opstruktivnom plućnom bolešću pokazalo je da dob i osobno iskustvo s bolešću moderiraju učinke različitih stilova interakcije. U drugoj studiji 123 pacijenta, mlađi sudionici i oni s manje recentnom dijagnozom imali su bolje interakcijske ishode uz deliberativni stil. To je dokaz za kontekstualnu prilagodbu u specifičnoj populaciji, a ne za univerzalnu prednost jednog stila. ([jmir.org](https://www.jmir.org/2021/5/e26643))
4.5. Persona i stil agenta
Sustav može usvojiti određenu osobnost, društvenu ulogu, razinu formalnosti ili način izražavanja. Kwon i suradnici opisuju komercijalni sustav koji kombinira ponderirano miješanje skupova podataka, negativnu augmentaciju persona-informacija i oznake vrste odgovora radi bolje kontrole i objašnjivosti. Autori navode poboljšanja u subjektivnim i objektivnim evaluacijama, ali takvi rezultati prvenstveno pokazuju uspješnost konkretne arhitekture i skupa podataka, ne opći učinak personalizacije na stvarno korisničko iskustvo. ([aclanthology.org](https://aclanthology.org/2023.acl-industry.68/))
4.6. Afektivna personalizacija
Afektivna personalizacija pokušava prepoznati ili procijeniti emocije, angažman, frustraciju, stres ili druge afektivne pojave te na temelju toga prilagoditi odgovor. Pregled Li, Waleed i Salam klasificira pristupe u sedam skupina: ciljno-specifične modele, modele za skupine, metode ponderiranja, fino ugađanje, multitask učenje, generativne modele i augmentaciju značajki. U pregledanoj literaturi multitask učenje, grupiranje podataka i fino ugađanje među najčešće su korištenim pristupima. ([arxiv.org](https://arxiv.org/abs/2304.00377))
Afektivnu procjenu treba tretirati kao nesigurnu inferenciju, a ne kao izravno mjerenje unutarnjeg stanja korisnika. Istraživanja u afektivnom računarstvu upozoravaju da se točnost prepoznavanja emocije ne može automatski pretvoriti u korisnu ili sigurnu prilagodbu interakcije, jer se izražavanje emocija razlikuje među ljudima i kontekstima. ([arxiv.org](https://arxiv.org/abs/2303.18176))
4.7. Modelna personalizacija
Personalizacija može biti izvedena promjenom podataka, korisničkog profila, konteksta, prompta, retrieva, parametara ili zasebnog modela. Pregled personaliziranog afektivnog računarstva razlikuje podatkovne i modelne pristupe. Fino ugađanje i multitask učenje pokušavaju prenijeti opće znanje na pojedinca ili skupinu, dok metode grupiranja i ponderiranja više mijenjaju ulazne podatke ili način na koji se oni koriste. ([arxiv.org](https://arxiv.org/abs/2304.00377))
5. Empirijski nalazi o korisničkom iskustvu i učinkovitosti
5.1. Relevantnost i kvaliteta odgovora
Najstabilniji očekivani učinak personalizacije jest povećanje relevantnosti: sustav bi trebao bolje povezati odgovor s korisnikovim ciljem, predznanjem ili preferencijama. Međutim, relevantnost nije jednaka točnosti. Sustav može ponuditi sadržajno netočan, ali stilistički uvjerljiv odgovor koji djeluje relevantno zato što koristi osobne detalje.
U istraživanju korisničkog zadovoljstva task-orijentiranih dijaloških sustava zadovoljstvo je analizirano kroz relevantnost, zanimljivost, razumijevanje, izvršenje zadatka, učinkovitost i pobuđivanje interesa. Autori nalaze da se važnost tih dimenzija razlikuje među korisnicima i dijalozima; za neke je relevantnost ključna, dok drugima više znači zanimljivost. To ograničava uporabu jedne ukupne ocjene zadovoljstva kao dovoljne evaluacije. ([spacefrontiers.org](https://spacefrontiers.org/r/10.1145/3477495.3531798))
5.2. Učinkovitost komunikacije
Učinkovitost se može mjeriti brojem izmjena, vremenom do rješenja, uspjehom izvršenja zadatka, potrebom za ponavljanjem i kognitivnim opterećenjem. Personalizacija bi teoretski mogla smanjiti broj pojašnjenja i omogućiti sustavu da odmah ponudi odgovarajuću razinu detalja. No, ako je korisnički model netočan, personalizacija može proizvesti dodatne korekcije i povećati broj izmjena.
Dokazi iz zdravstvenog istraživanja pokazuju da prilagodba interakcijskog stila može poboljšati neke interakcijske ishode u određenoj populaciji. Ipak, istraživanje je koristilo upitnike i online eksperiment s pacijentima s KOPB-om, a ne dugoročnu procjenu stvarnog zdravstvenog ponašanja. Ne može se iz njega zaključiti da personalizacija općenito povećava učinkovitost svih konverzacijskih AI sustava. ([jmir.org](https://www.jmir.org/2021/5/e26643))
5.3. Zadovoljstvo, povjerenje i nastavak uporabe
Longitudinalno istraživanje s 179 sudionika proučavalo je kako se kroz ponovljene interakcije mijenjaju antropomorfizam, povjerenje, kvaliteta dijaloga, percipirani privatnosni rizici, relevantnost i vjerodostojnost informacija, kao i samootkrivanje i pridržavanje preporuka. Autori naglašavaju da se učinci personalizacije ne mogu adekvatno razumjeti kroz jednu izoliranu interakciju, nego kroz odnos između sustavom pokrenute personalizacije i ponavljanog izlaganja sustavu. ([sciencedirect.com](https://www.sciencedirect.com/science/article/pii/S2949882123000300))
Istraživanje očekivanja prema afektivnim konverzacijskim agentima, provedeno na 745 sudionika i 32 scenarija, pokazalo je da preferencije ovise o kontekstu. Sudionici su afektivne sposobnosti češće povezivali s ljudskom interakcijom, emocionalnom podrškom i kreativnim zadacima, dok je prihvatljivost ovisila i o osobinama ličnosti i načinu emocionalne regulacije. To podupire tezu da ista razina afektivne personalizacije neće biti jednako poželjna u svim situacijama. ([arxiv.org](https://arxiv.org/abs/2310.12459))
5.4. Ograničenje zaključaka o učinkovitosti
Većina radova o personaliziranom dijalogu procjenjuje sustav na benchmark-skupovima, kroz automatske metrike ili kratke korisničke studije. Takvi rezultati mogu pokazati da model bolje slijedi personu, proizvodi raznovrsnije odgovore ili dobiva više ocjene, ali ne dokazuju dugoročni učinak na stvarne korisnike. Čak i kada se koriste ljudske evaluacije, često nije jasno jesu li procjenjivači stvarni krajnji korisnici, jesu li imali kontrolu nad osobnim podacima i bi li se rezultat ponovio u višemjesečnoj uporabi.
6. Suprotni nalazi i ključne napetosti
Personalizacija nasuprot privatnosti
Što je sustav osobniji, to je veća potreba za podacima ili zaključivanjem o korisniku. Privatnosni problem ne nastaje samo pohranom izričitih činjenica, nego i stvaranjem zaključaka o osobnosti, zdravlju, političkim stavovima, emocionalnom stanju ili ranjivosti. Takvi zaključci mogu biti netočni, ali ipak utjecati na odgovor.
Za dugotrajne personalizirane interakcije obična početna suglasnost nije dovoljna zaštita ako korisnik kasnije ne može vidjeti koje su informacije pohranjene, zašto se koriste i tko im može pristupiti. Hendrickx i suradnici zato zagovaraju mehanizme koji korisniku omogućuju izravnu kontrolu pohranjenih osobnih podataka unutar samog razgovora. ([research.utwente.nl](https://research.utwente.nl/en/publications/take-back-control-user-privacy-and-transparency-concerns-in-perso/))
Personalizacija nasuprot autonomiji
Personalizacija može pomoći korisniku, ali može i povećati uvjerljivost sustava. Ako sustav zna korisnikove slabosti, strahove ili preferencije, prilagođeni odgovor može prijeći iz korisne asistencije u ciljano uvjeravanje ili manipulaciju. Istraživanje personalizirane interakcije čovjeka i robota izrijekom navodi napetost između poboljšanja korisničkog iskustva i rizika za autonomiju korisnika. ([sciencedirect.com](https://www.sciencedirect.com/science/article/pii/S0040162523000616))
Persona nasuprot pristranosti
Persona može učiniti sustav pristupačnijim, ali može i aktivirati stereotipe. Wan i suradnici testirali su četiri dijaloška modela, uključujući Blender, ChatGPT, Alpaca i Vicuna, te mjerili uvredljivost, toksični nastavak, odnos prema skupinama, slaganje sa stereotipima i toksično slaganje. Utvrđene su značajne persona-pristranosti, odnosno razlike u štetnom ponašanju ovisno o zadanoj demografskoj personi. ([aclanthology.org](https://aclanthology.org/2023.findings-emnlp.648/))
Sličan problem postoji i bez eksplicitne personalizacije: modeli trenirani na ljudskim dijalozima mogu reproducirati pristranosti povezane s rodom i rasom. Jedna studija razvila je benchmark za mjerenje tih razlika i pokazala da popularni dijaloški modeli mogu proizvoditi značajne predrasude prema različitim rodnim i rasnim skupinama. ([aclanthology.org](https://aclanthology.org/2020.coling-main.390/))
Personalizacija nasuprot jednakom tretmanu
Personalizirani sustav ne mora svim korisnicima ponuditi isti sadržaj, isti ton ili isti prag opreza. To može biti opravdano kada se razlikuju ciljevi, znanje ili potrebe korisnika. Međutim, razlike postaju problematične ako se temelje na osjetljivim obilježjima, netočnim zaključcima ili rezultiraju sustavno lošijom kvalitetom usluge za određene skupine.
Nalazi nisu potpuno jednosmjerni: Sheng i suradnici pokazali su da persona u nekim slučajevima može smanjiti štetne odgovore u odnosu na sustav bez persone, ali je istodobno izbor persone mijenjao razinu i vrstu štete. To znači da personalizacija nije sama po sebi izvor pristranosti niti sama po sebi rješenje; njezin učinak mora se mjeriti po skupinama i vrstama štete. ([arxiv.org](https://arxiv.org/abs/2104.08728))
7. Privatnost, zaštita podataka i profiliranje
Relevantna načela zaštite podataka
Opća uredba o zaštiti podataka u članku 5. postavlja načela zakonitosti, poštenosti i transparentnosti, ograničenja svrhe, smanjenja količine podataka, točnosti, ograničenja pohrane te cjelovitosti i povjerljivosti. Za obradu je potrebna pravna osnova prema članku 6. Personalizacija koja koristi razgovore, profile ili zaključene osobine mora se zato analizirati prema svrsi, nužnosti, opsegu i roku čuvanja podataka, a ne samo prema tome je li rezultat korisniku praktičan. ([eur-lex.europa.eu](https://eur-lex.europa.eu/eli/reg/2016/679/oj?locale=EN))
Članak 22. GDPR-a odnosi se na odluke temeljene isključivo na automatiziranoj obradi, uključujući profiliranje, kada proizvode pravne učinke ili slično značajno utječu na osobu. Nije svaka personalizirana poruka takva odluka, ali personalizirani konverzacijski sustav može postati dio takvog procesa ako utječe na pristup kreditu, osiguranju, zapošljavanju, obrazovanju, zdravstvu ili drugim značajnim uslugama. U tim slučajevima relevantne su zaštitne mjere poput ljudske intervencije, mogućnosti iznošenja stajališta i osporavanja odluke. ([eur-lex.europa.eu](https://eur-lex.europa.eu/eli/reg/2016/679/oj?locale=EN))
Rizici memorije i zaključivanja
- pohrana osjetljivih informacija koje korisnik nije očekivao da će biti trajno spremljene;
- zaključivanje o osjetljivim obilježjima bez izričitog pristanka ili bez korisnikove svijesti;
- miješanje činjenica, pretpostavki i modelskih pogrešaka u jedinstveni profil;
- sekundarna uporaba razgovora za treniranje, oglašavanje ili procjenu korisnika;
- nemogućnost korisnika da vidi, ispravi ili izbriše memoriju;
- curenje podataka kroz promptove, logove, alate trećih strana ili vanjske retrievere.
Mišljenje Europskog odbora za zaštitu podataka 28/2024 posebno se bavi pravnom osnovom, anonimizacijom i pseudonimizacijom u kontekstu AI modela. Za personalizirane sustave to je važno jer odvajanje identiteta korisnika od sadržaja nije automatski jednako potpunoj anonimizaciji ako se osoba ponovno može identificirati ili ako se profil može povezati s drugim skupovima podataka. ([edpb.europa.eu](https://www.edpb.europa.eu/documents/opinion-of-the-board-art-64/opinion-282024-on-certain-data-protection-aspects-related-to_en))
8. Transparentnost i objašnjivost
Tri razine transparentnosti
- Identitetska transparentnost: korisnik zna da razgovara s AI sustavom.
- Podatkovna transparentnost: korisnik zna koje se informacije koriste za personalizaciju, iz kojeg izvora i koliko dugo.
- Učinska transparentnost: korisnik razumije kako personalizacija mijenja konkretan odgovor, preporuku ili odluku.
Akt o umjetnoj inteligenciji Europske unije predviđa da sustavi namijenjeni izravnoj interakciji s fizičkim osobama trebaju korisnika obavijestiti da komunicira s AI sustavom, osim kada je to iz okolnosti očito. Ta obveza rješava pitanje identitetske transparentnosti, ali sama po sebi ne objašnjava korištenje memorije, profiliranje ili logiku odgovora. ([eur-lex.europa.eu](https://eur-lex.europa.eu/eli/reg/2024/1689/oj?locale=en))
Objašnjenje također nije nužno vjeran prikaz unutarnjeg procesa modela. Guesmi i suradnici razlikuju opravdanje, koje korisniku daje razumljiv razlog, od transparentnosti, koja bi trebala vjerno prikazati kako sustav dolazi do rezultata. U konverzacijskom AI-ju postoji opasnost da se prirodno formulirano objašnjenje shvati kao dokaz stvarnog razloga, iako je riječ o naknadno generiranom tekstu. ([arxiv.org](https://arxiv.org/abs/2305.17034))
Recentno istraživanje personaliziranih objašnjenja za preporuke pokazuje da kontekstualizirana objašnjenja mogu povećati doživljenu relevantnost, kognitivnu i afektivnu vrijednost te namjeru prihvaćanja preporuke, ali da učinak ovisi o usklađenosti s korisnikovim interesima i povjerenjem u sustav. To znači da objašnjenje može poboljšati iskustvo, ali i povećati uvjerljivost netočnog ili neželjenog rezultata. ([ojs.aaai.org](https://ojs.aaai.org/index.php/ICWSM/article/view/42667))
Minimalni standard transparentnog personaliziranog odgovora
U praktičnom dizajnu korisniku bi trebalo omogućiti da vidi:
- koji su podaci ili zaključci utjecali na odgovor;
- je li podatak iz trenutnog razgovora, trajne memorije ili vanjskog izvora;
- može li ispraviti ili izbrisati taj podatak;
- može li isključiti personalizaciju bez gubitka osnovne funkcionalnosti;
- je li odgovor prilagođen zbog jezika, stručne razine, emocionalnog tona ili drugog razloga;
- koja su ograničenja i moguće pogreške personalizacije.
9. Mehanizmi: što je potvrđeno, a što ostaje hipoteza
- Relevantnost: ako sustav koristi točne i relevantne podatke o korisniku, odgovor se može bolje uskladiti s ciljem. To je tehnički plauzibilno i poduprto rezultatima na nekim benchmarkovima, ali nije univerzalno dokazano u stvarnim interakcijama. ([aclanthology.org](https://aclanthology.org/2023.acl-industry.68/))
- Smanjenje kognitivnog opterećenja: prilagodba razine detalja i formata može smanjiti potrebu za dodatnim pojašnjenjima. Empirijski se mora mjeriti brojem izmjena, vremenom i uspjehom zadatka, ne samo dojmom korisnika.
- Socijalna prisutnost: topliji i osobniji stil može povećati doživljaj društvene prisutnosti i povjerenja. Međutim, antropomorfizam može potaknuti pretjerano povjerenje i veće samootkrivanje, što povećava privatnosni rizik.
- Učenje preferencija: višekratna interakcija može omogućiti bolju prilagodbu, ali i stvaranje trajnog profila s netočnim ili zastarjelim zaključcima. Longitudinalno istraživanje potvrđuje važnost dinamike ponovljenih interakcija, ali ne opravdava pretpostavku da je dugotrajna personalizacija uvijek korisna. ([sciencedirect.com](https://www.sciencedirect.com/science/article/pii/S2949882123000300))
- Afektivna prilagodba: procjena emocija može pomoći u izboru tona ili strategije, ali je mjerna pogreška velika i ovisi o osobi, kulturi, kanalu i situaciji. Točnost klasifikacije emocije nije dokaz poboljšanja korisničkog ishoda. ([arxiv.org](https://arxiv.org/abs/2303.18176))
- Objašnjenje: može povećati razumijevanje i povjerenje, ali može funkcionirati i kao retoričko uvjeravanje. Zato treba razlikovati korisnost objašnjenja od njegove vjernosti stvarnom procesu odlučivanja. ([arxiv.org](https://arxiv.org/abs/2305.17034))
10. Metodološka ograničenja dosadašnjih istraživanja
- Benchmark umjesto stvarne uporabe: automatske metrike mjere jezičnu sličnost, usklađenost s personom ili kvalitetu generiranja, ali ne nužno zadovoljstvo, sigurnost ili dugoročnu korist.
- Kratke i skriptirane interakcije: korisnikovo ponašanje u jednoj laboratorijskoj sesiji ne mora odgovarati ponašanju nakon višemjesečnog korištenja i razvoja povjerenja.
- Pristrani uzorci: studije često koriste online uzorke, studente ili korisnike iz jedne zemlje, što ograničava generalizaciju.
- Nedostatak dugoročnih mjera: rijetko se istodobno mjere zadovoljstvo, točnost, privatnost, samootkrivanje, korekcije memorije i stvarni ishodi.
- Konfundiranje personalizacije i antropomorfizma: osobniji odgovor često je i topliji, dulji ili ljudskolikiji, pa nije jasno koji element uzrokuje promjenu u ocjeni.
- Problem samoprocjene: korisnik može prijaviti veće povjerenje ili zadovoljstvo, iako je objektivna kvaliteta odgovora ista ili lošija.
- Nedovoljna evaluacija štete po skupinama: prosječna kvaliteta može rasti, dok se istodobno pogoršava ponašanje prema manjinskoj skupini.
- Nedostatak testiranja pogrešnih profila: sustavi se rijetko sustavno testiraju na zastarjelim, kontradiktornim ili pogrešno zaključеним korisničkim osobinama.
NIST-ov okvir za upravljanje rizicima umjetne inteligencije preporučuje istodobno razmatranje valjanosti i pouzdanosti, sigurnosti, otpornosti, transparentnosti, objašnjivosti, privatnosti i pravednosti s upravljanjem štetnom pristranošću kroz cijeli životni ciklus sustava. To podupire metodološki zahtjev da se korisničko iskustvo ne procjenjuje odvojeno od sigurnosti i jednakog tretmana. ([nist.gov](https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence))
11. Preporučeni istraživački standard za budući rad
Mjere korisničkog iskustva
- relevantnost i razumijevanje;
- točnost i potpunost;
- broj izmjena do rješenja;
- vrijeme i uspjeh izvršenja zadatka;
- percipirana korisnost i zadovoljstvo;
- povjerenje i kalibracija povjerenja;
- doživljena privatnost i osjećaj kontrole;
- spremnost na nastavak uporabe;
- samootkrivanje i osjetljivost podataka;
- razlike u ishodima među demografskim i ranjivim skupinama.
Minimalni eksperimentalni dizajn
Najinformativnija usporedba uključivala bi najmanje četiri uvjeta: generički odgovor, eksplicitno personalizirani odgovor, implicitno personalizirani odgovor i personalizirani odgovor s korisničkom kontrolom i objašnjenjem. Potrebno je odvojeno mjeriti stvarnu kvalitetu odgovora i doživljenu personalizaciju, jer korisnici mogu pozitivnije ocijeniti isti sadržaj kada misle da je personaliziran. ([doi.org](https://doi.org/10.1145/3544548.3580656))
Za etičku evaluaciju treba uključiti testove pristranosti, kontradiktorne profile, pogrešne memorije, osjetljive atribute, odbijanje personalizacije i scenarije u kojima bi sustav mogao manipulativno koristiti podatke. Rezultate treba prikazati po skupinama i vrstama štete, a ne samo kroz ukupnu prosječnu ocjenu.
12. Otvorena pitanja
- Kako korisniku objasniti implicitne zaključke bez otkrivanja više osjetljivih informacija nego što je potrebno?
- Kada je korisno spremiti informaciju u trajnu memoriju, a kada je dovoljno koristiti samo trenutačni kontekst?
- Kako razlikovati stvarnu emocionalnu prilagodbu od pogrešnog pripisivanja emocije?
- Kako mjeriti dugoročni učinak personalizacije na autonomiju i ponašanje korisnika?
- Može li se personalizacija dizajnirati tako da korisnik dobije korist bez stvaranja identitetski bogatog profila?
- Koje su metode najbolje za otkrivanje stereotipa koje model aktivira tek nakon dodavanja persone?
- Kako objasniti personalizirani odgovor tako da objašnjenje bude razumljivo, ali ne lažno precizno?
- Kako zaštititi korisnike koji ne razumiju posljedice trajne memorije ili implicitnog profiliranja?
- Kako se zahtjevi privatnosti, transparentnosti i korisničke kontrole mijenjaju među pravnim sustavima i domenama?
13. Preporučena struktura budućeg rada
- Uvod: rast konverzacijskih AI sustava i problem prilagodbe korisniku.
- Pojmovni okvir: personalizacija, kontekstualna prilagodba, korisnički model, persona, memorija i afektivno računarstvo.
- Metode personalizacije: eksplicitni profili, implicitno zaključivanje, memorija, prilagodba stila, afektivni modeli i modelna personalizacija.
- Korisničko iskustvo: relevantnost, učinkovitost, zadovoljstvo, povjerenje, kontinuitet i nastavak uporabe.
- Empirijski dokazi: razdvajanje benchmark-rezultata, korisničkih eksperimenata, longitudinalnih studija i kontekstualnih istraživanja.
- Privatnost i zaštita podataka: minimizacija, svrha, pravna osnova, memorija, profiliranje i brisanje podataka.
- Pristranost i jednakost: persona-pristranost, demografske razlike, stereotipi i testiranje štete.
- Transparentnost: obavijest o AI-ju, vidljivost izvora personalizacije, objašnjenja i korisnička kontrola.
- Rasprava: personalizacija kao kompromis između relevantnosti, privatnosti, autonomije i sigurnosti.
- Zaključak: kriteriji za odgovornu i proporcionalnu personalizaciju.
14. Revizija preporučene literature
- Russell, S.; Norvig, P. (2021), Artificial Intelligence: A Modern Approach, 4. izdanje. U briefu je naveden kao temeljni udžbenik. Primjeren je za opći terminološki i tehnički okvir, ali nije dovoljan kao izvor za suvremene empirijske tvrdnje o korisničkom iskustvu, privatnosti ili pristranosti.
- Li, J.; Waleed, A.; Salam, H. (2023), A Survey on Personalized Affective Computing in Human-Machine Interaction. Naslov je potvrđen, ali zapis pronađen u izvorniku navodi autore Jialin Li, Alia Waleed i Hanan Salam, što se ne podudara potpuno s bibliografskim navodom iz briefa. Dostupan zapis je arXiv:2304.00377. ([arxiv.org](https://arxiv.org/abs/2304.00377))
- Hernandez, J.; Suh, J.; Amores, J.; Rowan, K.; Ramos, G.; Czerwinski, M. (2023), Affective Conversational Agents: Understanding Expectations and Personal Influences. Naslov, autori i godina potvrđeni su u zapisu rada; rad je istraživanje očekivanja 745 sudionika u 32 scenarija. ([arxiv.org](https://arxiv.org/abs/2310.12459))
15. Popis stvarno korištenih izvora i tragovi provjere
- Chen, Yi-Pei; Nishida, Noriki; Nakayama, Hideki; Matsumoto, Yuji (2024). “Recent Trends in Personalized Dialogue Generation: A Review of Datasets, Methodologies, and Evaluations.” LREC-COLING 2024, str. 13650–13665. Trag provjere: ACL Anthology zapis, sažetak i bibliografski podaci. ([aclanthology.org](https://aclanthology.org/2024.lrec-main.1192/))
- Li, Jialin; Waleed, Alia; Salam, Hanan (2023). “A Survey on Personalized Affective Computing in Human-Machine Interaction.” arXiv:2304.00377. Trag provjere: izvorni arXiv zapis s autorima, kategorijama metoda i meta-analizom. ([arxiv.org](https://arxiv.org/abs/2304.00377))
- Hernandez, Javier; Suh, Jina; Amores, Judith; Rowan, Kael; Ramos, Gonzalo; Czerwinski, Mary (2023). “Affective Conversational Agents: Understanding Expectations and Personal Influences.” arXiv:2310.12459. Trag provjere: izvorni zapis rada i opis uzorka od 745 sudionika. ([arxiv.org](https://arxiv.org/abs/2310.12459))
- Kwon, Deuksin i sur. (2023). “What, When, and How to Ground: Designing User Persona-Aware Conversational Agents for Engaging Dialogue.” ACL Industry Track 2023, str. 707–719. DOI: 10.18653/v1/2023.acl-industry.68. Trag provjere: ACL Anthology zapis, metode i bibliografski podaci. ([aclanthology.org](https://aclanthology.org/2023.acl-industry.68/))
- Cho, Itsugun; Wang, Dongyang; Takahashi, Ryota; Saito, Hiroaki (2022). “A Personalized Dialogue Generator with Implicit User Persona Detection.” COLING 2022, str. 367–377. Trag provjere: ACL Anthology zapis i sažetak metode implicitnog modeliranja persone. ([aclanthology.org](https://aclanthology.org/2022.coling-1.29/))
- Gross, Christoph i sur. (2021). “Personalization of Conversational Agent-Patient Interaction Styles for Chronic Disease Management: Two Consecutive Cross-sectional Questionnaire Studies.” Journal of Medical Internet Research, 23(5), e26643. DOI: 10.2196/26643. Trag provjere: izvorni JMIR članak s metodama, uzorkom i rezultatima. ([jmir.org](https://www.jmir.org/2021/5/e26643))
- Siro, Clemencia; Aliannejadi, Mohammad; de Rijke, Maarten (2022). “Understanding User Satisfaction with Task-oriented Dialogue Systems.” SIGIR 2022. DOI: 10.1145/3477495.3531798. Trag provjere: ACM/autorov PDF zapis sa šest dimenzija zadovoljstva. ([spacefrontiers.org](https://spacefrontiers.org/r/10.1145/3477495.3531798))
- Araujo, Theo; Bol, Nadine (2024). “From Speaking Like a Person to Being Personal: The Effects of Personalized, Regular Interactions with Conversational Agents.” Computers in Human Behavior: Artificial Humans, 2(1), 100030. DOI: 10.1016/j.chbah.2023.100030. Trag provjere: repozitorij Sveučilišta u Amsterdamu i bibliografski zapis izdavača. ([pure.uva.nl](https://pure.uva.nl/ws/files/181581724/From_speaking_like_a_person_to_being_personal.pdf))
- Wan, Yixin i sur. (2023). “Are Personalized Stochastic Parrots More Dangerous? Evaluating Persona Biases in Dialogue Systems.” Findings of EMNLP 2023, str. 9677–9705. DOI: 10.18653/v1/2023.findings-emnlp.648. Trag provjere: ACL Anthology zapis, četiri testirana modela i pet kategorija persona-pristranosti. ([aclanthology.org](https://aclanthology.org/2023.findings-emnlp.648/))
- Sheng, Emily i sur. (2021). “Revealing Persona Biases in Dialogue Systems.” Trag provjere: izvorni arXiv zapis s definicijom persona-pristranosti i analizom Blender i DialoGPT sustava. ([arxiv.org](https://arxiv.org/abs/2104.08728))
- Liu, Haochen i sur. (2020). “Does Gender Matter? Towards Fairness in Dialogue Systems.” COLING 2020, str. 4403–4416. DOI: 10.18653/v1/2020.coling-main.390. Trag provjere: ACL Anthology zapis benchmarka i nalaza o rodnim i rasnim predrasudama. ([aclanthology.org](https://aclanthology.org/2020.coling-main.390/))
- Dinan, Emily i sur. (2020). “Queens are Powerful too: Mitigating Gender Bias in Dialogue Generation.” EMNLP 2020, str. 8173–8188. DOI: 10.18653/v1/2020.emnlp-main.656. Trag provjere: ACL Anthology zapis metoda ublažavanja pristranosti i rezultata. ([aclanthology.org](https://aclanthology.org/2020.emnlp-main.656/))
- Hendrickx, Iris i sur. (2021). “Take Back Control: User Privacy and Transparency Concerns in Personalized Conversational Agents.” CEUR Workshop Proceedings, vol. 2903. Trag provjere: repozitorij Sveučilišta u Twenteu i bibliografski zapis rada. ([research.utwente.nl](https://research.utwente.nl/en/publications/take-back-control-user-privacy-and-transparency-concerns-in-perso/))
- Schwartz, Reva i sur. (2022). “Towards a Standard for Identifying and Managing Bias in Artificial Intelligence.” NIST SP 1270. DOI: 10.6028/NIST.SP.1270. Trag provjere: službena NIST publikacija. ([nist.gov](https://www.nist.gov/publications/towards-standard-identifying-and-managing-bias-artificial-intelligence))
- Autio, Chloe i sur. (2024). “Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile.” NIST AI 600-1. DOI: 10.6028/NIST.AI.600-1. Trag provjere: službena NIST publikacija. ([nist.gov](https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence))
- Uredba (EU) 2016/679, Opća uredba o zaštiti podataka. Trag provjere: službeni tekst EUR-Lexa, osobito članci 5., 6. i 22. ([eur-lex.europa.eu](https://eur-lex.europa.eu/eli/reg/2016/679/oj?locale=EN))
- Uredba (EU) 2024/1689, Akt o umjetnoj inteligenciji. Trag provjere: službeni tekst EUR-Lexa, osobito članak 50. o transparentnosti interakcije s AI sustavima. ([eur-lex.europa.eu](https://eur-lex.europa.eu/eli/reg/2024/1689/oj?locale=en))
- European Data Protection Board (2024). “Opinion 28/2024 on Certain Data Protection Aspects Related to the Processing of Personal Data in the Context of AI Models.” Trag provjere: službena stranica EDPB-a i zapis mišljenja od 18. prosinca 2024. ([edpb.europa.eu](https://www.edpb.europa.eu/documents/opinion-of-the-board-art-64/opinion-282024-on-certain-data-protection-aspects-related-to_en))