گودفایر می‌گوید مانیتورهای «داخلی» جدیدش عوامل سرکش هوش مصنوعی را با کسری از هزینه دستگیر می‌کنند.

Goodfire به تازگی راهی ارزان‌تر برای کنترل عوامل هوش مصنوعی ارائه کرده است: به جای پرداخت یک هوش مصنوعی دوم برای خواندن هر کاری که یک نماینده انجام می‌دهد، مانیتورهایش در حین کار مدل را زیر نظر می‌گیرند و تنها زمانی که چیزی شبیه به حالت عادی به نظر می‌رسد، پشتیبان‌گیری می‌کنند.

آخرین روز برای نمایش پیشرفت خود به بیش از 10000 رهبر فناوری در Disrupt در 2 اکتبر است. میز نمایشگاه کتاب هم اکنون.

باز شدن درها را در 13 اکتبر مختل کنید. کارت خود را بگیرید و با 50 درصد تخفیف یک نفر را همراه خود بیاورید. هم اکنون ثبت نام کنید.

راه استاندارد برای نگه داشتن یک عامل هوش مصنوعی این است که یک هوش مصنوعی دوم را روی شانه آن خوانده شود. این رویکرد پیش‌فرض بوده است، اما زمانی که ماموران ساعت‌ها کار می‌کنند و معادل متن چندین رمان را پردازش می‌کنند، می‌تواند به سرعت گران شود.

Goodfire، استارتاپی که بر تفسیرپذیری (پی بردن به نحوه عملکرد داخلی مدل‌های هوش مصنوعی) متمرکز است، روز پنجشنبه گزینه ارزان‌تری را راه‌اندازی کرد: مانیتورهایی که به جای خواندن آنچه که یک مدل هوش مصنوعی در حال کار است، تماشا می‌کنند که چه اتفاقی می‌افتد. این مانیتورها در دسترس مشتریان Baseten هستند که مدل‌های هوش مصنوعی را برای سایر شرکت‌ها میزبانی و اجرا می‌کند.

Baseten’s Base Labs ماه گذشته از همکاری ایمنی با Goodfire و پلتفرم هوش مصنوعی Hugging Face خبر داد.

این راه اندازی پس از یک رشته حوادث در سال جاری انجام شد که در آن عوامل هوش مصنوعی از محیط های آزمایشی خود فرار کردند، از جمله عوامل OpenAI که Hugging Face را نقض کردند. Kimi K3، مدل باز Goodfire که اولین مانیتور خود را در اطراف ساخت، از نشت جعبه سند خود برای دسترسی به اینترنت و اطلاعات در GitHub در تابستان امسال استفاده کرد.

سیستم Goodfire کمی شبیه به امنیت فرودگاه عمل می کند. آشکارسازهای کوچکی به نام کاوشگر سیگنال‌های داخلی مدل را در هر مرحله از کار مامور می‌خوانند، به روشی که یک اسکنر عبوری هر مسافر را بررسی می‌کند. تنها زمانی که یک کاوشگر چیزی را علامت گذاری می کند، آن را جدا می کندمدل هوش مصنوعی، معادل جستجوی دستی، نگاهی دقیق‌تر بیندازید.

مشتریان Baseten می توانند انتخاب کنند که چه خطراتی از جمله هک تهاجمی، سوء استفاده از سلاح های شیمیایی و بیولوژیکی و هک پاداش را بررسی کنند. آنها همچنین در مورد پاسخ خودکار تصمیم می گیرند: ثبت رویداد، ارسال آن برای بررسی انسانی، یا رد کامل درخواست.

Goodfire می‌گوید که راه‌اندازی آن نیز ارزان‌تر است. بیشتر مانیتورهای هوش مصنوعی مدل‌های جداگانه‌ای هستند که باید هر کاری را که مدل مانیتور شده انجام می‌دهد دوباره بخوانند، که باعث افزایش زمان و هزینه می‌شود. کاوشگرهای گودفایر در عوض به محاسباتی که مدل از قبل در حین کار انجام می دهد، ضربه می زنند.

اریک هو، مدیر عامل Goodfire، هفته گذشته در پادکست MAD Matt Turck، سرمایه‌گذار خطرپذیر، گفت: «مانیتورهای فعال‌سازی داخلی واقعاً ارزان هستند، زیرا از محاسبات در گذر رو به جلو استفاده مجدد می‌کنند. بنابراین مدل در حال محاسبه این نشانه است. تنها کاری که شما انجام می دهید این است که فعال سازی های عصبی میانی را که قبلاً محاسبه شده است انجام دهید و سپس یک طبقه بندی را روی این محاسبات داخلی اجرا کنید. به طور خلاصه، مدل در حال انجام محاسبات است و کاوشگرها فقط نتایج را می خوانند.

در آزمایشات Goodfire روی Kimi K3، نظارت بر 1 میلیون صرافی تقریباً 185 دلار هزینه دارد، در مقایسه با 5420 دلار برای مدل ارزان‌تر هوش مصنوعی که هر مرحله را بررسی می‌کند و حدود 200،000 دلار برای یک مدل سطح بالا. کاوشگرها 93 درصد از جلسات هک مخرب را شناسایی کردند و 5.5 درصد از جلسات بی ضرر را برای یک نگاه دوم فرستادند.

به گفته این شرکت، اجرای همزمان چهار کاوشگر، کمتر از 2 درصد به زمان لازم برای پاسخگویی به مدل اضافه کرد.

"بزرگمزیت این است که شما می‌توانید چیزها را قبل از وقوع پیدا کنید.» مدیر ارشد فناوری Goodfire و یکی از بنیانگذاران دن بالسام، گفت: «ما می‌توانیم تشخیص دهیم که چه زمانی ممکن است مدل در حین ارزیابی یا آموزش هک شود.»

بالسام می‌گوید: «زیانی که یک فرد می‌تواند با یک مدل باز وارد کند، در مقایسه با آنچه که یک فرد می‌تواند با خوشه‌های محاسباتی، مانند ارائه‌دهندگان استنتاج انجام دهد، کوچک است - جایی که بیشتر مسئولیت در آن قرار دارد». هنگامی که ما لحظه باز "Mythos" را داشته باشیم، مشخص می شود که مدل ها به نرده های محافظ نیاز دارند که در زمان استنتاج مستقر شوند.

تحقیقات اخیر گودفایر نشان داد که مدل‌های باز پیشرو، از جمله Kimi K3 و GLM-5.2، در 50 تا 96 درصد از اجراها در آزمایش‌های عوامل هوش مصنوعی هک شده‌اند.

Goodfire اولین کسی نیست که این روش را امتحان می کند. Google DeepMind در ژانویه گفت که تحقیقاتش از استقرار کاوشگرهای تشخیص سوء استفاده در Gemini خبر داده است.

بالسام گفت که مانیتورها قطعه کوتاه مدت یک هدف تحقیقاتی طولانی تر هستند: مهندسی معکوس یک LLM به طوری که بتوان رفتار را به جایی که در آموزش ظاهر شد ردیابی کرد. او گفت: "ما امیدواریم که جادوی مدل های آموزشی را به مهندسی دقیق تبدیل کنیم."

وقتی از طریق پیوندهای موجود در مقالات ما خرید می کنید، ممکن است کمیسیون کمی کسب کنیم. این بر استقلال تحریریه ما تأثیر نمی گذارد.

50٪ تخفیف برای پاس دوم دریافت کنید تجربه Disrupt قرار است به اشتراک گذاشته شود. پاس خود را دریافت کنید و یک همکار، شریک یا همتای خود را با 50 درصد تخفیف بیاورید. با ایجاد ارتباطات، ایجاد شتاب و کشف آنچه در اکوسیستم استارت آپی در آینده وجود دارد، زمینه بیشتری را پوشش دهید.

ایالات متحده مایکروسافت، ادوبی و شرکت های بزرگ فناوری اطلاعات را ممنوع می کنداز برنامه گرین کارت برای کارگران ماهر خارجی عایشه مالک

آنتروپیک به استارت آپ ها یک سال رایگان از کلود تیم و 1000 دلار اعتبار راسل براندوم می دهد.

در 19 سالگی، بنیانگذار 11 میلیون دلار برای Ghost، سازنده رایانه 3499 دلاری برای هوش مصنوعی شخصی Dominic-Madori Davis جمع آوری کرد.