چت ربات های هوش مصنوعی اغلب در بحران سلامت روان به کاربران کمک نمی کنند
تحقیقات جدیدی که به طور انحصاری با سفیر ارجان به اشتراک گذاشته شده است نشان می دهد که چت بات ها در تشخیص ناراحتی خوب هستند، اما اغلب کاربران را به منابع ارجاع نمی دهند.
از آنجایی که افراد بیشتری برای به اشتراک گذاشتن ناراحتکنندهترین افکار خود به چترباتهای هوش مصنوعی روی میآورند، شرکتها تصمیمات اساسی در مورد نحوه پاسخگویی پلتفرمهایشان به کاربران در بحبوحه بحرانهای سلامت روان میگیرند. طبق تحقیقات جدیدی که توسط Scale AI انجام شده و منحصراً با سفیر ارجان به اشتراک گذاشته شده است، چت بات ها در تشخیص زمانی که کاربر در بحران است ماهر هستند، اما اغلب در ارائه کمک کافی ناکام هستند.
طبق این تحقیق، در حدود 35 درصد از مکالمات آزمایشی در این مطالعه، چت رباتهای مختلف هوش مصنوعی تشخیص دادند که کاربر مضطرب است، اما آنها را به منابع مفیدی مانند خط تلفن خودکشی ارجاع ندادند.
Patrick Oathout، سرپرست تیم Red & Safety Lead در Scale AI، میگوید: «مدلها بدون توجه به سناریو، کار خوبی انجام میدهند. «اما آنها به روشی کاملاً همدلانه و مهربانانه به جای گفتن «خوب، وقت آن است که از شما کمک بگیریم» پاسخ خواهند داد.» Oathout میافزاید که مدلها در واکنش به ناراحتی کاربران در هنگام درگیر شدن در مکالمات طولانی و چند نوبتی عملکرد بدتری داشتند - نقصی که با یافتههای مطالعات قبلی مطابقت دارد.
برای آزمایش اثربخشی مدلهای هوش مصنوعی در پاسخگویی به کاربران مضطرب، هوش مصنوعی Scale از 19 پزشک دارای مجوز و مشاور بحران خواست تا 718 چت واقعبینانه بنویسند و سناریوهایی را شبیهسازی کنند که در آن فردی که در بحران به سراغ یک ربات چت میرود. این شرکت 25 مدل مرزی از جمله مدل های OpenAI، Anthropic و Google را آزمایش کرد. پاسخهای مدلها را بر اساس روبریکی که شامل دلسوز بودن آن بود، درجهبندی کرد.Oathout گفت که وضعیت را کاهش داد و کاربران را به سمت یک متخصص هدایت کرد که بتواند به آنها کمک کند. همچنین ارزیابی کرد که آیا آنها از اخلاقی سازی، مانند انتقاد از خودکشی خودداری می کنند یا خیر، و فاش کرد که این یک درمانگر نیست. بر اساس این تحقیقات، تحقیقات Scale AI DistressBench را توسعه داده است، معیار جدیدی که برای ارزیابی چگونگی پاسخ مدلها زمانی که کسی به آنها میگوید در مورد خودکشی یا آسیب رساندن به خود فکر میکند، طراحی شده است.
نحوه پاسخ رباتهای چت به کاربرانی که از نظر روانی رنج میبرند، سوالی است که ریسک بالایی دارد. بر اساس گزارش سازمان سیاست سلامت KFF، بیش از نیم میلیون نفر در ایالات متحده بین سالهای 2014 تا 2024 بر اثر خودکشی جان خود را از دست دادهاند که سال 2022 رکورد بالایی را ثبت کرده است. طبق گزارش CDC، حدود 14.3 میلیون نفر در سال 2024 به طور جدی به خودکشی فکر کردند.
به طور فزایندهای، افراد آسیبپذیر برای راحتی، همراهی یا راهنمایی به چتباتها روی میآورند تا با ناراحتیهای روانی مقابله کنند. اما بین شرکتهای فناوری، سیاستگذاران یا متخصصان سلامت روان در مورد اینکه چگونه شرکتهای هوش مصنوعی باید مدلهای خود را آموزش دهند تا به کاربران در بحران پاسخ دهند، اتفاق نظر وجود ندارد.
کلی زورومسکی، دانشمند اصلی تحقیقات بالینی در Crisis Text Line، میگوید خط متن بحران 24 ساعته این سازمان غیرانتفاعی با «افراد زیادی» صحبت کرده است که نشان دادهاند از طریق یک ربات چت درباره گروه شنیدهاند. اما زورومسکی میگوید که سؤالات سیاستی بیپاسخی در مورد اینکه وقتی یک ربات چت کاربران را در طول یک بحران سلامت روانی به انسان ارجاع میدهد، چگونه به نظر میرسد و فرآیند ارجاع چقدر مؤثر است، وجود دارد.در وهله اول قرار دارد. "چه کسی واقعا از منابع توصیه شده استفاده می کند؟" او می گوید. "آیا ما افرادی را که بیشتر به کمک نیاز دارند به خودمان می رسانیم؟"
در برخی موارد، شرکتهای هوش مصنوعی، از جمله OpenAI و Google، به دلیل ایجاد وابستگی عاطفی در میان کاربران جوان و سپس عدم پاسخگویی مناسب به ابراز ناراحتیشان، یا تقویت تفکر هذیانی یا خودکشی در وهله اول مورد شکایت قرار گرفتهاند. این شرکتها با خانوادهها ابراز همدردی کردهاند و گفتهاند که مدلهای آنها شامل پادمانهای سلامت روان است. (دعواها ادامه دارد.) آزمایشگاههای هوش مصنوعی مانند OpenAI، Anthropic و Google در سالهای اخیر گفتهاند که محافظتهای خود را برای مکالمات حساس، از جمله با اجرای سیاستهایی که مانع از آموزش کاربران در مورد نحوه آسیب رساندن به خود و هدایت کاربران به پشتیبانی حرفهای یا اضطراری توسط رباتهای چت میشود، افزایش دادهاند. آنها در مورد مطالعه نظری ندادند.
به گفته Oathout Scale AI، در آینده، آزمایشگاههای هوش مصنوعی باید مدلهای خود را بهبود بخشند تا به کاربرانی که در مکالمات طولانی خطرناک با چتباتها شرکت میکنند، پاسخ دهند. او میگوید: «من فکر میکنم مدلها بهتر از آنچه بودند، هستند. اکنون هدف این است که آن را بیشتر افزایش دهیم و در واقع آسیب را کاهش دهیم، که این مزیت عظیم را به جامعه اضافه خواهد کرد.»