داریو آمودی، مدیر کل انترپیک، اخیراً پیشنهادی جسورانه ارائه داده است که حتی یک سال پیش، صنعت هوش مصنوعی آن را با قاطعیت رد میکرد: گنجاندن ارزیابان مستقل ثالث در دل شرکتهای پیشگام این حوزه. این پیشنهاد به تیمهای نظارتی مانند METR و Redwood Research دسترسیهای بیسابقه میدهد تا از درون، رویدادهای امنیتی را گزارش کنند و صحت همسو شدن مدلها را ارزیابی کرده و یافتههای خود را بدون سانسور با جهان به اشتراک بگذارند.
سام آلتمن، مدیر کل OpenAI نیز به این رویه پایبندی نشان داده است. این حرکت، نشان از تغییری بنیادین در نحوه تعامل شرکتهای فناور با گروههای پژوهشی بیرونی دارد. اگرچه ارزیابان این پیشنهاد را با خوشآمدگویی پذیرفتند، اما تأکید دارند که جزئیات باید شفافسازی و ایدهآلاً توسط قوانین حمایت شوند. این نکته حیاتی است تا مشخص شود آیا این نهادها بهعنوان ناظران واقعی مستقل عمل خواهند کرد یا صرفاً پیمانکارانی هستند که تحت انقیاد شرکتهای هوش مصنوعی قرار دارند.
چرا دسترسی عمیق به «سوپاپهای» آموزشی حیاتی است؟
هرچه مدلهای هوش مصنوعی پیشرفتهتر شوند، توانایی آنها برای تشخیص موقعیتهای ارزیابی افزایش مییابد. این امر ریسک آنها را برای نمایش رفتار خوب در زمان تست، پنهانسازی رفتارهای مشکلساز در عمل افزایش میدهد. پژوهشگران اشاره میکنند که نشانههای این رفتار ممکن است در تست نهایی مدل نادیده گرفته شود، اما با بررسی نحوه رفتار مدل در طول فرآیند آموزش، آشکار میشود.
آلکساندر ماینک، رئیس پژوهش در Apollo Research: «شرکتهای هوش مصنوعی باید بتوانند به سؤالات بسیار اولیهای درباره فرآیند آموزش پاسخ دهند، مانند اینکه آیا هوش مصنوعی هیچگاه بهطور فعال تلاش کرد تا آموزش همسو سازی خود را خراب کند؟ پاسخ باید «نه» قاطعانه باشد و در حال حاضر ما کاملاً متکی بر شرکتها هستیم که خودشان این را چک و صادقانه گزارش کنند. اما ما از حوادث اخیر دیدهایم که پیشفرض آنها انجام هر دو نیست. بهعنوان ارزیابان گنجاندهشده، میتوانیم واقعاً بررسی کنیم.»
فراتر از مدل نهایی: بررسی نقاط چک
بهطور تاریخی، شرکتها از بازبینان بیرونی برای تست مدلهای نهایی درست قبل از انتشار استفاده میکردند. اما ارزیابان اکنون پیشنهاد میدهند دسترسی به نسخههای میانی یا «نقاط چک» در طول زندگی آموزشی مدل داده شود. آدام گلیو، مدیر کل FAR.AI، میگوید ارزیابان میتوانند این نقاط را مقایسه کنند تا متوجه شوند رفتار نگرانکننده چه زمانی ظهور کرد، محیط پستآموزش که مدلها را برای رفتارهای خاصی پاداش میدهد را بازرسی کنند و پروندههای ارزیابی را بررسی نمایند.
مشکلات عملیاتی: زمان، محرمانگی و شفافیت
پاسخ این است که آیا شرکتها واقعاً حاضرند کنترل را تحویل دهند؟ تلاشهای قبلی برای ارزیابی مستقل نشان داده که این کار دشوار است، زیرا طرفهای ثالث اغلب با تنشی در مورد دسترسی، زمان، محرمانگی و محتوای قابل انتشار مواجه شدهاند. گلیو اشاره میکند که FAR.AI مجبور شده است قراردادها را رد کند زیرا شرکتها سعی میکردند کنترل بیش از حدی بر فرآیند ارزیابی داشته باشند.
- محدودیت زمان: در حادثه Hugging Face، OpenAI به METR و Redwood تنها حدود یک هفته دسترسی داد که برای نتیجهگیری قاطع کافی نبود. همچنین در تست پیشانتشار GPT-6 Astra، Apollo Research تنها سه روز فرصت داشت.
- استانداردسازی: باید چارچوبی شفاف برای همه وجود داشته باشد تا مشخص شود چه نوع بازرسینی قابل اتکا هستند، تا شرکتها نتوانند با انتخاب ارزیابان ضعیف، از مسئولیت فرار کنند.
- قوانین: سناتور پاپاداتوس تأکید میکند که راهحلهای داومانه (Voluntary) همیشه به نیت خیر شرکت وابستهاند. در ایدéal، مقررات باید اجباری باشد تا شرکتها نتوانند فردا قید آن را به پیشانه اندازند.
پایانبندی: آیا خودتنظیمی کافی است؟
در حال حاضر، Meta، SpaceXAI و Google DeepMind این تعهد را امضا نکردهاند، هرچند Hassabis پیشنهاد یک نهاد استاندارد صنعتی جداگانه را داده است. قوانین جدیدی مانند SB 53 کالیفرنیا و قانون هوش مصنوعی اتحادیه اروپا در حال شکلگیری هستند، اما هنوز گستردهتر از پیشنهاد آمودی نیستند.
شرکتها نمیتوانند همزمان آزادی کنترل قوانین امنیتی خود را خواستار شوند و از عموم مردم بخواهند به آنها اعتماد کنند. تا زمانی که این تضاد حل نشود، سوال اصلی این است: آیا ما واقعاً در مرحلهای هستیم که نظارت مستقل از درون امکانپذیر و موثوبر است؟
نظر، سوال یا تجربه خود را درباره این مطلب با سایر کاربران اوکالا به اشتراک بگذارید.