ضریب غول چراغ جادو

تا الان، تقریبن خیلی‌‌هامون، داستان هک HuggingFace رو خوندیم و مي‌دونیم چی شده; یه چیزی، برای شما هم سوال شد که چطور OpenAI مانیتورینگ و سیستم تشخیص رفتار غیرعادی/خطرشون اینقدر داغان بوده برای همیچین آزمایشی؟ کرکره‌ها رو کشیدن و رفتن، گفتن آخر هفته برای خودت سرکش و خوش باش، و بعد سورپرایز شدن 🙂 باوشه.

در هر حال به دلیل همین پیامدها و رفتارهایی که مدل‌ها از خودشون نشون می‌دن، بروس اشنایر حرف از ضریب جدیدی میز‌نه به اسم «ضریب غول چراغ جادو» یا «ضریب جن»، فکر کنم هم همون غول چراغ جادو باید معنی بشه.

چرا؟ چون مدل‌ها رفتارشون شبیه غول چراغ جادو است، شما می‌گی چی می‌خوای، و غول برات فراهم می‌کنه- اینجا گپی هست بین چیزی که به زبون آوردیم و چیزی که واقعن منظورمون بوده. اگر به مدلی که گاردریلی نداره بگین براتون بلیط هواپیما بگیره، ممکنه اگر بلیطی نمونده باشه، بره سیستم اون شرکت رو هک کنه و به هر دری بزنه که برای شما اون بلیط رو تهیه کنه. یعنی اگر بهش نگی خط قرمز اینجاست، این دسترسي‌ها رو داری، این قوانین رو داری- تمام راه‌های ممکن برای انجام چیزی که ازش خواستی رو تست میکنه تا کارو انجام بده; رفتاری شبیه غول چراغ جادو.

نوشتم مدلی که گاردریل نداشته باشه، البته مدل‌هایی که گاردریل داشته باشن رو هم دیدیم که چطور بای‌پس شدن، تا کاری که بهشون داده میشه رو انجام بدن، دیگه چه برسه به مدل‌هایی که روی لوکال‌مون داریم. البته خیلی نسبیه‌، نسبت به مدل و پارامترهاش و البته که سخت‌افزار مناسب اون مدل- که برمی‌گردیم به هزینه سرسام‌آور ماشین مورد نظر براش! بازم برای ما نیست! چون پولش رو نداریم که اون مدل رو روی لوکال داشته باشیم، و مصرف کننده اون مدل‌هایی می‌شیم با گاردریل‌هایی که مدیرعامل شرکت‌های پیشروتکنولوژی غول پیکر تصمیم میگیرن چطور باشه و نباشه. خب خب برگردیم سر ضریب «غول چراغ جادو».

در ادامه از خود پست اشنایر:

«آزمایشگاه‌های هوش مصنوعی می‌دانند که این مسئله وجود دارد و به‌آرامی در حال اعتراف به آن هستند. برای نمونه، آزمایشگاه چینی Moonshot اخیراً هشدار داده است که جدیدترین مدل هوش مصنوعی آن ممکن است «بیش‌ازحد پیش‌قدم شود» و «از طرف کاربر تصمیم‌های غیرمنتظره بگیرد». مؤسسهٔ امنیت هوش مصنوعی بریتانیا نیز بررسی و ثبت «رفتارهای متقلبانه در ارزیابی مدل‌های پیشرفته» را آغاز کرده است.

ما خودرویی را که بیش‌ازحد پیش‌قدم باشد یا با بی‌رحمی صرفاً به دنبال کارآمدترین راه باشد، تحمل نمی‌کنیم؛ بااین‌حال، این دقیقاً واقعیت امروز هوش مصنوعی است.

امکان بهبود وجود دارد. همان‌طور که هوش مصنوعی‌ها در چند سال گذشته در مقاومت در برابر حملات «تزریق پرامپت»(prompt injection) بسیار بهتر شده‌اند، می‌توان با اطمینان پیش‌بینی کرد که در پرهیز از رفتارهای شبیه غول چراغ جادو نیز پیشرفت خواهند کرد.

هدف از تعریف ضریب غول چراغ جادو، اندازه‌گیری و پیگیری این پیشرفت است. شرکت‌های هوش مصنوعی به معیارهای ارزیابی علاقه دارند و همگی تلاش می‌کنند در رقابت، بهترین عملکرد را داشته باشند.

ده‌ها معیار ارزیابی و جدول رتبه‌بندی وجود دارد که نشان می‌دهند این مدل‌های هوش مصنوعی تا چه اندازه در برنامه‌نویسی، استدلال منطقی و قبولی در آزمون‌های استاندارد حقوقی و پزشکی توانمند هستند. اما هیچ معیاری وجود ندارد که بسنجد آیا یک سیستم واقعاً همان کاری را انجام می‌دهد که منظور شما بوده است یا نه.

ما باید معیاری برای سنجش این موضوع ایجاد کنیم، آن را به‌طور منظم آزمایش کنیم و شرکت‌ها را برای بهبود عملکردشان تحت فشار قرار دهیم. بدون چنین معیاری، دستیابی به عامل‌های هوش مصنوعی قابل‌اعتماد ممکن نخواهد بود.»

منبع: https://www.theguardian.com/commentisfree/2026/jul/28/rogue-ai-agent-instructions
قسمت ترجمه شده هم GPT-5.6 Sol