Let's talk: editor@tmv.in
కవిత్వం ద్వారా ఏఐ చాట్‌బాట్‌ల నుండి ప్రమాదకర రహస్యాలు చెప్పేలా ట్రిక్!

కవిత్వం ద్వారా ఏఐ చాట్‌బాట్‌ల నుండి ప్రమాదకర రహస్యాలు చెప్పేలా ట్రిక్!

Praveen Batti
30 నవంబర్, 2025

ప్రముఖ లార్జ్ లాంగ్వేజ్ మోడల్స్ భద్రతా వ్యవస్థలలో ఒక కొత్త, ఆందోళనకరమైన లోపం బయటపడింది. ఏఐ చాట్‌బాట్‌లను ఒక కవిత రూపంలో అభ్యర్థనను అడగడం ద్వారా, అణు ఆయుధాలను తయారు చేయడం వంటి అక్రమ లేదా ప్రమాదకర కార్యకలాపాల కోసం సూచనలను వెల్లడించేలా సులభంగా మార్చవచ్చు.

సపియెంజా యూనివర్శిటీ ఆఫ్ రోమ్, డెక్స్‌ఏఐ థింక్ ట్యాంక్ మధ్య సహకారంతో ఏర్పడిన ఇకారో ల్యాబ్ పరిశోధకులు, "కవితాత్మక పదజాలం" అనేది ఏఐ భద్రతా ఫిల్టర్‌లను నిరంతరం దాటవేయడానికి అత్యంత ప్రభావవంతమైన "జైల్‌బ్రేక్" గా పనిచేస్తుందని కనుగొన్నారు.

"అడ్వర్సేరియల్ పొయెట్రీ యాజ్ ఎ యూనివర్సల్ సింగిల్-టర్న్ జైల్‌బ్రేక్ ఇన్ లార్జ్ లాంగ్వేజ్ మోడల్స్" అనే శీర్షికతో ఉన్న ఈ అధ్యయనం, ఓపెన్ఏఐ, మెటా, అంతరోపిక్ వంటి కంపెనీలకు చెందిన 25 వేర్వేరు చాట్‌బాట్‌లను పరీక్షించింది. ఫలితాలు ఆశ్చర్యపరిచాయి: పరీక్షించిన ప్రతి ఒక్క మోడల్ ట్రిక్ చేయబడింది.

చేతితో రూపొందించిన కవితలకు కవిత్వ ఫ్రేమింగ్ సగటున 62% విజయ రేటును సాధించింది, కొన్ని అధునాతన నమూనాలకు విజయ రేటు 90% వరకు చేరుకుంది.ప్రస్తుత ఏఐ భద్రతా ఫిల్టర్‌లు ప్రమాదకరమైన ప్రాంప్ట్‌లను నిరోధించడానికి ముఖ్యంగా కీవర్డ్ గుర్తింపు, ప్యాటర్న్ విశ్లేషణపై ఆధారపడతాయి. రూపకాలు, ముక్కలైన వాక్యనిర్మాణం, తక్కువ-సంభావ్యత పదాల క్రమాలు వంటి లక్షణాలతో కూడిన కవితా భాష ఈ ఫిల్టర్‌లను అడ్డుకుంటుంది అని పరిశోధకులు కనుగొన్నారు. చాట్‌బాట్ అసాధారణమైన నిర్మాణాన్ని ప్రమాదకరమైన, స్పష్టమైన ముప్పుగా కాకుండా సృజనాత్మక రచనగా అర్థం చేసుకుంటుంది, తద్వారా అంతర్నిర్మిత రక్షణ మార్గాలను సమర్థవంతంగా తప్పించుకుంటుంది.

ఏఐ భద్రత గురించి మనం ఎలా ఆలోచిస్తున్నామో దానిలో ఇది ఒక ప్రాథమిక వైఫల్యం అని పరిశోధకులు ఈ ఆవిష్కరణను అభివర్ణించారు. ఏఐ ప్రస్తుతం ప్రత్యక్ష నష్టాన్ని గుర్తించడానికి శిక్షణ పొందుతోందని, కానీ రూపకం, సృజనాత్మక మానిప్యులేషన్ సూక్ష్మతను గుర్తించలేదని పేర్కొన్నారు.

పర్యవసానాలు, పరిశ్రమ ప్రతిస్పందన

పరిశోధకులు ఈ దోపిడీ సురక్షితమైన, గందరగోళ ఉదాహరణను పంచుకున్నారు, కానీ పరీక్షలలో ఉపయోగించిన అసలు ప్రమాదకరమైన కవితలను "ప్రజలకు పంచుకోవడానికి చాలా ప్రమాదకరం"గా భావించి వాటిని పంచుకోలేదు.

ఈ విషయం ఒక విరుద్ధమైన పరిస్థితిని హైలైట్ చేస్తుంది: లార్జ్ లాంగ్వేజ్ మోడల్స్లు అనుకరించడానికి రూపొందించబడిన సృజనాత్మకతే ఇప్పుడు వాటి అతిపెద్ద భద్రతా దుర్బలత్వం. రక్షణ లేదా ఆరోగ్య సంరక్షణ వంటి కీలక రంగాలలో అనుసంధానించబడిన భవిష్యత్ ఏఐ వ్యవస్థలు కూడా సూక్ష్మమైన, ప్రత్యేక్షంగా లేని ప్రాంప్ట్‌లకు సున్నితంగా ఉండవచ్చని ఈ పరిశోధన సూచిస్తుంది.

పరిశోధకులు బాధ్యతాయుతమైన బహిర్గత పద్ధతులను అనుసరించారు, ప్రభావితమైన ఏఐ కంపెనీలతో తమ పరిశోధనలను వ్యక్తిగతంగా పంచుకున్నారు. ఈ కంపెనీలు ఈ అధ్యయనంపై బహిరంగంగా ఇంకా వ్యాఖ్యానించలేదు. ఈ అత్యంత అధునాతన, సొగసైన కొత్త రకాల వ్యతిరేక దాడుల నుండి భద్రతా ప్రోటోకాల్‌లను బలోపేతం చేయడానికి భద్రతా సమాజం ఇప్పుడు కొత్త ఒత్తిడికి సిద్ధమవుతోంది.

కవిత్వం ద్వారా ఏఐ చాట్‌బాట్‌ల నుండి ప్రమాదకర రహస్యాలు చెప్పేలా ట్రిక్! - Tholi Paluku