
కవిత్వం ద్వారా ఏఐ చాట్బాట్ల నుండి ప్రమాదకర రహస్యాలు చెప్పేలా ట్రిక్!
ప్రముఖ లార్జ్ లాంగ్వేజ్ మోడల్స్ భద్రతా వ్యవస్థలలో ఒక కొత్త, ఆందోళనకరమైన లోపం బయటపడింది. ఏఐ చాట్బాట్లను ఒక కవిత రూపంలో అభ్యర్థనను అడగడం ద్వారా, అణు ఆయుధాలను తయారు చేయడం వంటి అక్రమ లేదా ప్రమాదకర కార్యకలాపాల కోసం సూచనలను వెల్లడించేలా సులభంగా మార్చవచ్చు.
సపియెంజా యూనివర్శిటీ ఆఫ్ రోమ్, డెక్స్ఏఐ థింక్ ట్యాంక్ మధ్య సహకారంతో ఏర్పడిన ఇకారో ల్యాబ్ పరిశోధకులు, "కవితాత్మక పదజాలం" అనేది ఏఐ భద్రతా ఫిల్టర్లను నిరంతరం దాటవేయడానికి అత్యంత ప్రభావవంతమైన "జైల్బ్రేక్" గా పనిచేస్తుందని కనుగొన్నారు.
"అడ్వర్సేరియల్ పొయెట్రీ యాజ్ ఎ యూనివర్సల్ సింగిల్-టర్న్ జైల్బ్రేక్ ఇన్ లార్జ్ లాంగ్వేజ్ మోడల్స్" అనే శీర్షికతో ఉన్న ఈ అధ్యయనం, ఓపెన్ఏఐ, మెటా, అంతరోపిక్ వంటి కంపెనీలకు చెందిన 25 వేర్వేరు చాట్బాట్లను పరీక్షించింది. ఫలితాలు ఆశ్చర్యపరిచాయి: పరీక్షించిన ప్రతి ఒక్క మోడల్ ట్రిక్ చేయబడింది.
చేతితో రూపొందించిన కవితలకు కవిత్వ ఫ్రేమింగ్ సగటున 62% విజయ రేటును సాధించింది, కొన్ని అధునాతన నమూనాలకు విజయ రేటు 90% వరకు చేరుకుంది.ప్రస్తుత ఏఐ భద్రతా ఫిల్టర్లు ప్రమాదకరమైన ప్రాంప్ట్లను నిరోధించడానికి ముఖ్యంగా కీవర్డ్ గుర్తింపు, ప్యాటర్న్ విశ్లేషణపై ఆధారపడతాయి. రూపకాలు, ముక్కలైన వాక్యనిర్మాణం, తక్కువ-సంభావ్యత పదాల క్రమాలు వంటి లక్షణాలతో కూడిన కవితా భాష ఈ ఫిల్టర్లను అడ్డుకుంటుంది అని పరిశోధకులు కనుగొన్నారు. చాట్బాట్ అసాధారణమైన నిర్మాణాన్ని ప్రమాదకరమైన, స్పష్టమైన ముప్పుగా కాకుండా సృజనాత్మక రచనగా అర్థం చేసుకుంటుంది, తద్వారా అంతర్నిర్మిత రక్షణ మార్గాలను సమర్థవంతంగా తప్పించుకుంటుంది.
ఏఐ భద్రత గురించి మనం ఎలా ఆలోచిస్తున్నామో దానిలో ఇది ఒక ప్రాథమిక వైఫల్యం అని పరిశోధకులు ఈ ఆవిష్కరణను అభివర్ణించారు. ఏఐ ప్రస్తుతం ప్రత్యక్ష నష్టాన్ని గుర్తించడానికి శిక్షణ పొందుతోందని, కానీ రూపకం, సృజనాత్మక మానిప్యులేషన్ సూక్ష్మతను గుర్తించలేదని పేర్కొన్నారు.
పర్యవసానాలు, పరిశ్రమ ప్రతిస్పందన
పరిశోధకులు ఈ దోపిడీ సురక్షితమైన, గందరగోళ ఉదాహరణను పంచుకున్నారు, కానీ పరీక్షలలో ఉపయోగించిన అసలు ప్రమాదకరమైన కవితలను "ప్రజలకు పంచుకోవడానికి చాలా ప్రమాదకరం"గా భావించి వాటిని పంచుకోలేదు.
ఈ విషయం ఒక విరుద్ధమైన పరిస్థితిని హైలైట్ చేస్తుంది: లార్జ్ లాంగ్వేజ్ మోడల్స్లు అనుకరించడానికి రూపొందించబడిన సృజనాత్మకతే ఇప్పుడు వాటి అతిపెద్ద భద్రతా దుర్బలత్వం. రక్షణ లేదా ఆరోగ్య సంరక్షణ వంటి కీలక రంగాలలో అనుసంధానించబడిన భవిష్యత్ ఏఐ వ్యవస్థలు కూడా సూక్ష్మమైన, ప్రత్యేక్షంగా లేని ప్రాంప్ట్లకు సున్నితంగా ఉండవచ్చని ఈ పరిశోధన సూచిస్తుంది.
పరిశోధకులు బాధ్యతాయుతమైన బహిర్గత పద్ధతులను అనుసరించారు, ప్రభావితమైన ఏఐ కంపెనీలతో తమ పరిశోధనలను వ్యక్తిగతంగా పంచుకున్నారు. ఈ కంపెనీలు ఈ అధ్యయనంపై బహిరంగంగా ఇంకా వ్యాఖ్యానించలేదు. ఈ అత్యంత అధునాతన, సొగసైన కొత్త రకాల వ్యతిరేక దాడుల నుండి భద్రతా ప్రోటోకాల్లను బలోపేతం చేయడానికి భద్రతా సమాజం ఇప్పుడు కొత్త ఒత్తిడికి సిద్ధమవుతోంది.
