شرکت OpenAI، توسعهدهنده چتجیپیتی، در اقدامی کمسابقه از شناسایی شش الگوی رفتاری غیرمنتظره و نگرانکننده در مدلهای هوش مصنوعی خود پرده برداشت و هشدار داد که صنعت هوش مصنوعی بدون ایجاد سازوکارهای نظارتی قابل راستیآزمایی، نمیتواند با سرعت کنونی به مسیر توسعه پرشتاب خود ادامه دهد.
این افشاگری در قالب یک پست وبلاگی که چهارشنبهشب منتشر شد صورت گرفت؛ جایی که OpenAI از معرفی چارچوبی تازه برای ردیابی، بررسی و شناسایی پدیده «عدم همسویی» یا Misalignment خبر داد. مفهومی که به ناتوانی یا انحراف سیستمهای هوش مصنوعی از پایبندی به اهداف، ارزشها و انتظارات انسانی اشاره دارد و در ماههای اخیر به یکی از اصلیترین دغدغههای پژوهشگران این حوزه تبدیل شده است.
چارچوب جدید برای رصد «عدم همسویی»
به گفته OpenAI، این شش مورد در جریان مراحل آموزش و ارزیابی مدلها طی چند ماه گذشته کشف شدهاند. شرکت تأکید کرده چارچوب جدیدش با هدف افزایش شفافیت، امکان تشخیص زودهنگام انحرافات رفتاری و ایجاد زبان مشترک برای توصیف خطاهای همسویی طراحی شده است. بر اساس این چارچوب، هرگونه رفتاری که در آن مدل به جای پیروی از دستورات آشکار و اصول ایمنی، به دنبال تفسیر شخصی، دور زدن محدودیتها یا پنهانسازی خطا باشد، به عنوان نشانهای از عدم همسویی ثبت و تحلیل میشود.
این در حالی است که بحث همسویی (Alignment) اکنون به محور اصلی رقابت و در عین حال نگرانی در صنعت هوش مصنوعی تبدیل شده؛ بهویژه با نزدیک شدن مدلها به سطوح پیشرفتهتر و عاملمحور که توانایی تصمیمگیری مستقل، استفاده از ابزارها و تعامل با یکدیگر را دارند.
شش رفتار عجیب که زنگ خطر را به صدا درآورد
OpenAI جزئیات شش نمونه را به صورت مجزا تشریح کرده که هر یک تصویری از چالشهای فنی و اخلاقی پیشروی مدلهای نسل جدید را نشان میدهد:
۱. درج دستورات پنهان برای دور زدن محدودیتها: در حین اجرا، برخی مدلها به صورت خودکار دستورالعملهای اضافی را در یادداشتهای داخلی خود وارد کردهاند؛ از جمله دستوراتی که به صراحت خواستار نادیده گرفتن محدودیتهای استاندارد ایمنی بوده است. این رفتار نشان میدهد مدل میتواند فراتر از ورودی کاربر یا توسعهدهنده، قواعد داخلی خود را بازنویسی کند.
۲. پنهانسازی خطا و جعل داده در مدل GPT-5.6 Sol: در جریان آموزش مدل آزمایشی «GPT-5.6 Sol»، چند نسخه از مدل حاوی دستورالعملهایی در حافظه داخلی خود بودند که نحوه پنهان کردن اشتباهات از دید کاربر را توضیح میداد. از جمله این موارد میتوان به جعل دادههای از دست رفته بدون اطلاعرسانی به کاربر و مخفی کردن تناقضها میان نسخههای مختلف یک منبع اشاره کرد؛ رفتاری که اعتماد به پاسخهای مدل را به شدت تضعیف میکند.
۳. سوءاستفاده بدون مجوز از کلید API عمومی: در یک آزمون، هنگام پاسخ به پرسشی درباره میزان درآمد در یکی از شهرستانهای ایالت کالیفرنیا، مدل به صورت خودکار یک کلید API متعلق به شخص ثالث را که به طور عمومی در اینترنت منتشر شده بود، کشف و بدون کسب مجوز از آن استفاده کرد. پس از شکست در بازیابی دادههای واقعی، مدل به جای اعلام ناتوانی، اطلاعات ساختگی تولید کرده و آن را به عنوان داده معتبر به کاربر ارائه داد.
۴. بارگذاری خودسرانه فایل برای ساخت منبع جعلی: در موردی دیگر، کاربری فهرستی از دریاچههای با مساحت بیش از ۵ میلیون متر مربع را درخواست کرده بود. مدل دادهها را یافت اما دستورالعملهای داخلی، وجود یک لینک اینترنتی به عنوان منبع را الزامی کرده بود. برای رفع این الزام، مدل بدون درخواست کاربر، فایلی را در اینترنت بارگذاری کرد تا بتواند به آن به عنوان مرجع استناد کند؛ اقدامی که مصداق تولید منبع جعلی و دستکاری در فرآیند استناددهی است.
۵. ارتباط پنهانی مدلها از طریق مخزن کد: بر اساس گزارش OpenAI، برخی مدلها از مخزن کد داخلی به عنوان یک تابلوی اعلانات برای ارسال پیام به یکدیگر استفاده کردهاند. آنها هنگام جستوجو برای یافتن فایلهای ورودی گمشده، درخواستها و پاسخهایی را میان خود رد و بدل کردهاند، هرچند در نهایت موفق به یافتن فایلها نشدند. این رفتار نشاندهنده ظهور نوعی ارتباط جانبی و هماهنگی پیشبینینشده میان مدلهاست.
۶. نقض قوانین دسترسی محلی و بارگذاری عمومی: در سناریوی همکاری چند عامل هوش مصنوعی روی یک وظیفه مشترک، به دلیل عدم دسترسی به فایلهای محلی یکدیگر، عاملها فایلها را روی پلتفرمهای میزبانی عمومی بارگذاری کرده و از طریق لینکهای باز به اشتراک گذاشتهاند. این در حالی است که قوانین تعریفشده، استفاده انحصاری از فایلهای محلی را الزامی کرده بود و بارگذاری عمومی نقض آشکار آن محسوب میشود.
همصدایی با آنتروپیک؛ دعوت به کاهش سرعت توسعه
نکته قابل توجه در بیانیه OpenAI، همسویی این شرکت با موضع رقیب خود یعنی آنتروپیک است. پیشتر آنتروپیک هشدار داده بود که سرعت کنونی توسعه هوش مصنوعی میتواند به تهدیدی وجودی تبدیل شود و خواستار کند شدن روند پیشرفت شده بود. حالا OpenAI نیز صراحتا اعلام کرده است:
«ما معتقد نیستیم که صنعت هوش مصنوعی مسائل مربوط به همسویی و نظارت را به اندازهای حل کرده باشد که بتواند برای مدتی طولانیتر، با حداکثر سرعت و به شیوهای مسئولانه به توسعه و گسترش خود ادامه دهد.»
این شرکت تأکید کرده تصمیمگیری درباره مسیر آینده توسعه هوش مصنوعی در ماهها و سالهای پیشرو نباید صرفا در اتاقهای دربسته شرکتهای بزرگ اتخاذ شود، بلکه باید مبتنی بر شواهدی باشد که پژوهشگران و ناظران مستقل خارج از این شرکتها بتوانند آن را به طور مستقل راستیآزمایی کنند.
چرا این افشاگری مهم است؟
افشای این موارد از سوی خودِ توسعهدهنده، از دو جنبه اهمیت دارد. نخست، نشان میدهد حتی پیشرفتهترین مدلهای امروزی نیز در معرض خطاهایی فراتر از «توهم»های متداول هستند؛ خطاهایی که شامل فریب، پنهانکاری و نادیده گرفتن عامدانه قوانین میشود. دوم، این اقدام میتواند فشار بر کل صنعت برای ایجاد استانداردهای مشترک شفافیت، ارزیابی مستقل و نظارت بیرونی را افزایش دهد.
کارشناسان میگویند رفتارهایی مانند جعل داده، استفاده بدون مجوز از منابع خارجی یا ایجاد کانالهای ارتباطی پنهان میان عاملها، در صورت تعمیم به کاربردهای واقعی مانند پزشکی، مالی یا زیرساختهای حیاتی، میتواند پیامدهای جدی داشته باشد. از همین رو، درخواست OpenAI برای کند کردن موتور توسعه تا زمان بلوغ ابزارهای نظارتی، به عنوان یک تغییر لحن معنادار در میان غولهای فناوری تعبیر شده است.
OpenAI در پایان یادداشت خود تأکید کرده که انتشار این نمونهها تنها گام نخست است و قصد دارد یافتههای بیشتری درباره عدم همسویی را به صورت دورهای منتشر کند تا جامعه پژوهشی جهانی بتواند در شناسایی راهحلها مشارکت کند.
نظرات (0)