تا الان، تقریبن خیلیهامون، داستان هک HuggingFace رو خوندیم و ميدونیم چی شده; یه چیزی، برای شما هم سوال شد که چطور OpenAI مانیتورینگ و سیستم تشخیص رفتار غیرعادی/خطرشون اینقدر داغان بوده برای همیچین آزمایشی؟ کرکرهها رو کشیدن و رفتن، گفتن آخر هفته برای خودت سرکش و خوش باش، و بعد سورپرایز شدن 🙂 باوشه.
در هر حال به دلیل همین پیامدها و رفتارهایی که مدلها از خودشون نشون میدن، بروس اشنایر حرف از ضریب جدیدی میزنه به اسم «ضریب غول چراغ جادو» یا «ضریب جن»، فکر کنم هم همون غول چراغ جادو باید معنی بشه.
چرا؟ چون مدلها رفتارشون شبیه غول چراغ جادو است، شما میگی چی میخوای، و غول برات فراهم میکنه- اینجا گپی هست بین چیزی که به زبون آوردیم و چیزی که واقعن منظورمون بوده. اگر به مدلی که گاردریلی نداره بگین براتون بلیط هواپیما بگیره، ممکنه اگر بلیطی نمونده باشه، بره سیستم اون شرکت رو هک کنه و به هر دری بزنه که برای شما اون بلیط رو تهیه کنه. یعنی اگر بهش نگی خط قرمز اینجاست، این دسترسيها رو داری، این قوانین رو داری- تمام راههای ممکن برای انجام چیزی که ازش خواستی رو تست میکنه تا کارو انجام بده; رفتاری شبیه غول چراغ جادو.
نوشتم مدلی که گاردریل نداشته باشه، البته مدلهایی که گاردریل داشته باشن رو هم دیدیم که چطور بایپس شدن، تا کاری که بهشون داده میشه رو انجام بدن، دیگه چه برسه به مدلهایی که روی لوکالمون داریم. البته خیلی نسبیه، نسبت به مدل و پارامترهاش و البته که سختافزار مناسب اون مدل- که برمیگردیم به هزینه سرسامآور ماشین مورد نظر براش! بازم برای ما نیست! چون پولش رو نداریم که اون مدل رو روی لوکال داشته باشیم، و مصرف کننده اون مدلهایی میشیم با گاردریلهایی که مدیرعامل شرکتهای پیشروتکنولوژی غول پیکر تصمیم میگیرن چطور باشه و نباشه. خب خب برگردیم سر ضریب «غول چراغ جادو».
در ادامه از خود پست اشنایر:
«آزمایشگاههای هوش مصنوعی میدانند که این مسئله وجود دارد و بهآرامی در حال اعتراف به آن هستند. برای نمونه، آزمایشگاه چینی Moonshot اخیراً هشدار داده است که جدیدترین مدل هوش مصنوعی آن ممکن است «بیشازحد پیشقدم شود» و «از طرف کاربر تصمیمهای غیرمنتظره بگیرد». مؤسسهٔ امنیت هوش مصنوعی بریتانیا نیز بررسی و ثبت «رفتارهای متقلبانه در ارزیابی مدلهای پیشرفته» را آغاز کرده است.
ما خودرویی را که بیشازحد پیشقدم باشد یا با بیرحمی صرفاً به دنبال کارآمدترین راه باشد، تحمل نمیکنیم؛ بااینحال، این دقیقاً واقعیت امروز هوش مصنوعی است.
امکان بهبود وجود دارد. همانطور که هوش مصنوعیها در چند سال گذشته در مقاومت در برابر حملات «تزریق پرامپت»(prompt injection) بسیار بهتر شدهاند، میتوان با اطمینان پیشبینی کرد که در پرهیز از رفتارهای شبیه غول چراغ جادو نیز پیشرفت خواهند کرد.
هدف از تعریف ضریب غول چراغ جادو، اندازهگیری و پیگیری این پیشرفت است. شرکتهای هوش مصنوعی به معیارهای ارزیابی علاقه دارند و همگی تلاش میکنند در رقابت، بهترین عملکرد را داشته باشند.
دهها معیار ارزیابی و جدول رتبهبندی وجود دارد که نشان میدهند این مدلهای هوش مصنوعی تا چه اندازه در برنامهنویسی، استدلال منطقی و قبولی در آزمونهای استاندارد حقوقی و پزشکی توانمند هستند. اما هیچ معیاری وجود ندارد که بسنجد آیا یک سیستم واقعاً همان کاری را انجام میدهد که منظور شما بوده است یا نه.
ما باید معیاری برای سنجش این موضوع ایجاد کنیم، آن را بهطور منظم آزمایش کنیم و شرکتها را برای بهبود عملکردشان تحت فشار قرار دهیم. بدون چنین معیاری، دستیابی به عاملهای هوش مصنوعی قابلاعتماد ممکن نخواهد بود.»
منبع: https://www.theguardian.com/commentisfree/2026/jul/28/rogue-ai-agent-instructions
قسمت ترجمه شده هم GPT-5.6 Sol