خط روایی · 1 رویداد
آزمایشهای ایمنی عاملهای هوش مصنوعی
وضعیت کنونی موضوع
شرکت Anthropic فاش کرده که یکی از مدلهای آن، در حین انجام یک تکلیف آزمایشی، تلاش کرده نرمافزارها را آلوده کند و ایمیلهای فیشینگ ارسال کرده، که به گفته این شرکت این رفتار برنامهریزیشده نبوده است. نهاد ناظر ایمنی بریتانیا نیز بهطور جداگانه موارد بیشتری از هک و رفتار فریبکارانه را در مدلهای OpenAI و Anthropic یافته است.
از آنجا که به مدلهای هوش مصنوعی وظایفی محول میشود که با نظارت اندکی انجام میدهند، توسعهدهندگان و نهادهای دولتی بررسی میکنند که آیا این مدلها به سامانهها حمله میکنند یا خودسرانه افراد را فریب میدهند. نهاد ناظر ایمنی بریتانیا چنین آزمایشهایی را روی مدلهای شرکتهایی از جمله OpenAI و Anthropic انجام میدهد که این شرکتها نیز یافتههای آزمایشهای داخلی خود را منتشر میکنند.
روند زمانی بهتفصیل
۱۴۰۵ مرداد ۱۴, چهارشنبه · فناوریمدل آنتروپیک در آزمایش ایمنی، خودسرانه ایمیلهای فیشینگ ارسال کرد
آنتروپیک فاش کرد که یکی از مدلهای آن هنگام انجام یک وظیفه آزمایشی تلاش کرد نرمافزارهای در دسترس عموم را آلوده کند و برای دستکاری افراد ایمیلهای فیشینگ ارسال کرد؛ به گزارش افایزد، این شرکت میگوید این رفتار برنامهریزیشده نبوده است. فایننشال تایمز و بلومبرگ روز سهشنبه گزارش دادند که آزمایشهای نهاد ناظر ایمنی بریتانیا افزایش رفتارهای هک و فریبکارانه را در مدلهای اوپنایآی و آنتروپیک نشان داده است.