سلامة الذكاء الاصطناعي

سلامة الذكاء الاصطناعي هي مجال متعدد التخصصات يركز على منع الحوادث أو سوء الاستخدام أو العواقب الضارة الأخرى الناجمة عن أنظمة الذكاء الاصطناعي . ويشمل أخلاقيات الآلة ومواءمة الذكاء الاصطناعي ، والتي تهدف إلى ضمان أن أنظمة الذكاء الاصطناعي أخلاقية ومفيدة، فضلاً عن مراقبة أنظمة الذكاء الاصطناعي بحثًا عن المخاطر وتعزيز موثوقيتها. يهتم المجال بشكل خاص بالمخاطر الوجودية التي تفرضها نماذج الذكاء الاصطناعي المتقدمة.

إلى جانب البحث الفني، تتضمن سلامة الذكاء الاصطناعي تطوير المعايير والسياسات التي تعزز السلامة. وقد اكتسبت شعبية كبيرة في عام 2023، مع التقدم السريع في الذكاء الاصطناعي التوليدي والمخاوف العامة التي عبر عنها الباحثون والرؤساء التنفيذيون بشأن المخاطر المحتملة. خلال قمة سلامة الذكاء الاصطناعي لعام 2023 ، أنشأت كل من الولايات المتحدة والمملكة المتحدة معهد سلامة الذكاء الاصطناعي الخاص بهما . ومع ذلك، أعرب الباحثون عن قلقهم من أن تدابير سلامة الذكاء الاصطناعي لا تواكب التطور السريع لقدرات الذكاء الاصطناعي. [1]

الدوافع

يناقش العلماء المخاطر الحالية الناجمة عن فشل الأنظمة الحرجة ، [2] والتحيز ، [3] والمراقبة المدعومة بالذكاء الاصطناعي، [4] بالإضافة إلى المخاطر الناشئة مثل البطالة التكنولوجية ، والتلاعب الرقمي، [5] والتسليح، [6] والهجمات الإلكترونية المدعومة بالذكاء الاصطناعي [7] والإرهاب البيولوجي . [8] كما يناقشون المخاطر المضاربة الناجمة عن فقدان السيطرة على وكلاء الذكاء الاصطناعي العام المستقبليين ، [9] أو من تمكين الذكاء الاصطناعي للديكتاتوريات المستقرة إلى الأبد. [10]

السلامة الوجودية

انتقد البعض المخاوف بشأن الذكاء الاصطناعي العام، مثل أندرو نج الذي قارنها في عام 2015 بـ "القلق بشأن الاكتظاظ السكاني على المريخ عندما لم نضع قدمنا ​​على الكوكب بعد". [11] من ناحية أخرى، يحث ستيوارت جيه راسل على الحذر، بحجة أنه "من الأفضل توقع الإبداع البشري بدلاً من التقليل من شأنه". [12]

لدى باحثي الذكاء الاصطناعي آراء متباينة على نطاق واسع حول شدة ومصادر المخاطر الأولية التي تشكلها تقنية الذكاء الاصطناعي [13] [14] [15] - على الرغم من أن الاستطلاعات تشير إلى أن الخبراء يأخذون مخاطر العواقب الوخيمة على محمل الجد. في مسحين للباحثين في مجال الذكاء الاصطناعي، كان متوسط ​​المستجيبين متفائلًا بشأن الذكاء الاصطناعي بشكل عام، لكنه وضع احتمالًا بنسبة 5٪ لنتيجة "سيئة للغاية (مثل انقراض البشر )" للذكاء الاصطناعي المتقدم. [13] في استطلاع أجري عام 2022 لمجتمع معالجة اللغة الطبيعية ، وافق 37٪ أو وافقوا بشكل ضعيف على أنه من المعقول أن تؤدي قرارات الذكاء الاصطناعي إلى كارثة "على الأقل سيئة مثل حرب نووية شاملة". [16]

تاريخ

بدأت مناقشة المخاطر الناجمة عن الذكاء الاصطناعي بشكل جدي في بداية عصر الكمبيوتر :

وعلاوة على ذلك، إذا تحركنا في اتجاه صنع آلات تتعلم ويتغير سلوكها من خلال الخبرة، يتعين علينا أن نواجه حقيقة مفادها أن كل درجة من الاستقلال نمنحها للآلة هي درجة من التحدي المحتمل لرغباتنا.

—  نوربرت وينر (1949) [17]

من عام 2008 إلى عام 2009، كلفت جمعية النهوض بالذكاء الاصطناعي ( AAAI ) بإجراء دراسة لاستكشاف ومعالجة التأثيرات المجتمعية المحتملة طويلة الأجل لأبحاث وتطوير الذكاء الاصطناعي. كانت اللجنة متشككة بشكل عام في الآراء الجذرية التي عبر عنها مؤلفو الخيال العلمي، لكنها اتفقت على أن "البحث الإضافي سيكون قيماً في أساليب فهم والتحقق من مجموعة سلوكيات الأنظمة الحسابية المعقدة لتقليل النتائج غير المتوقعة". [18]

في عام 2011، قدم رومان يامبولسكي مصطلح "هندسة سلامة الذكاء الاصطناعي" [19] في مؤتمر فلسفة ونظرية الذكاء الاصطناعي، [20] حيث ذكر حالات الفشل السابقة لأنظمة الذكاء الاصطناعي وجادل بأن "تكرار وخطورة مثل هذه الأحداث سوف يزدادان باطراد مع تزايد قدرة الذكاء الاصطناعي". [21]

في عام 2014، نشر الفيلسوف نيك بوستروم كتاب " الذكاء الفائق: المسارات والمخاطر والاستراتيجيات" . وهو يرى أن صعود الذكاء الاصطناعي العام لديه القدرة على خلق العديد من القضايا المجتمعية، بدءًا من إزاحة القوى العاملة بواسطة الذكاء الاصطناعي، والتلاعب بالهياكل السياسية والعسكرية، وحتى إمكانية انقراض البشر. [22] دفعت حجته بأن الأنظمة المتقدمة المستقبلية قد تشكل تهديدًا للوجود البشري إيلون ماسك ، [23] وبيل جيتس ، [24] وستيفن هوكينج [25] إلى التعبير عن مخاوف مماثلة.

في عام 2015، وقع العشرات من خبراء الذكاء الاصطناعي على رسالة مفتوحة بشأن الذكاء الاصطناعي تدعو إلى إجراء أبحاث حول التأثيرات المجتمعية للذكاء الاصطناعي وتحديد اتجاهات ملموسة. [26] حتى الآن، تم التوقيع على الرسالة من قبل أكثر من 8000 شخص بما في ذلك يان ليكون ، وشين ليج ، ويوشوا بينجيو ، وستيوارت راسل .

في العام نفسه، أسست مجموعة من الأكاديميين بقيادة البروفيسور ستيوارت راسل مركز الذكاء الاصطناعي المتوافق مع الإنسان في جامعة كاليفورنيا بيركلي، ومنح معهد مستقبل الحياة 6.5 مليون دولار كمنح للأبحاث التي تهدف إلى "ضمان بقاء الذكاء الاصطناعي آمنًا وأخلاقيًا ومفيدًا". [27]

في عام 2016، أعلن مكتب البيت الأبيض لسياسة العلوم والتكنولوجيا وجامعة كارنيجي ميلون عن ورشة العمل العامة حول السلامة والتحكم في الذكاء الاصطناعي، [28] والتي كانت واحدة من سلسلة من أربع ورش عمل في البيت الأبيض تهدف إلى التحقيق في "مزايا وعيوب" الذكاء الاصطناعي. [29] في نفس العام، نُشرت المشاكل الملموسة في سلامة الذكاء الاصطناعي - واحدة من أولى وأكثر أجندات سلامة الذكاء الاصطناعي التقنية تأثيرًا. [30]

في عام 2017، رعى معهد مستقبل الحياة مؤتمر أسيلومار حول الذكاء الاصطناعي المفيد ، حيث صاغ أكثر من 100 من قادة الفكر مبادئ الذكاء الاصطناعي المفيد بما في ذلك "تجنب السباق: يجب على الفرق التي تعمل على تطوير أنظمة الذكاء الاصطناعي التعاون بنشاط لتجنب التجاوزات في معايير السلامة". [31]

في عام 2018، حدد فريق أمان DeepMind مشاكل أمان الذكاء الاصطناعي في المواصفات والمتانة، [32] والضمان. [33] في العام التالي، نظم الباحثون ورشة عمل في ICLR ركزت على مجالات المشاكل هذه. [34]

في عام 2021، تم نشر المشكلات غير المحلولة في سلامة التعلم الآلي، والتي تحدد اتجاهات البحث في المتانة والمراقبة والمحاذاة والسلامة النظامية. [35]

في عام 2023، قال ريشي سوناك إنه يريد أن تكون المملكة المتحدة "الموطن الجغرافي للتنظيم العالمي لسلامة الذكاء الاصطناعي" واستضافة أول قمة عالمية حول سلامة الذكاء الاصطناعي. [36] عقدت قمة سلامة الذكاء الاصطناعي في نوفمبر 2023، وركزت على مخاطر سوء الاستخدام وفقدان السيطرة المرتبطة بنماذج الذكاء الاصطناعي الرائدة. [ 37 ] خلال القمة، تم الإعلان عن نية إنشاء التقرير العلمي الدولي حول سلامة الذكاء الاصطناعي المتقدم [38] .

في عام 2024، أبرمت الولايات المتحدة والمملكة المتحدة شراكة جديدة في مجال علم سلامة الذكاء الاصطناعي. وتم توقيع مذكرة التفاهم في الأول من أبريل 2024 من قبل وزيرة التجارة الأمريكية جينا رايموندو ووزيرة التكنولوجيا البريطانية ميشيل دونيلان لتطوير اختبار نموذج الذكاء الاصطناعي المتقدم بشكل مشترك، وذلك بعد الالتزامات التي تم الإعلان عنها في قمة سلامة الذكاء الاصطناعي في بلتشلي بارك في نوفمبر. [39]

التركيز على البحث

تشمل مجالات البحث في سلامة الذكاء الاصطناعي المتانة والمراقبة والمحاذاة. [35] [33]

المتانة

قوة التحمل التنافسية

غالبًا ما تكون أنظمة الذكاء الاصطناعي عرضة للأمثلة المعادية أو "المدخلات إلى نماذج التعلم الآلي (ML) التي صممها المهاجم عمدًا للتسبب في ارتكاب النموذج لخطأ". [40] على سبيل المثال، في عام 2013، اكتشف Szegedy وآخرون أن إضافة اضطرابات غير محسوسة محددة إلى صورة قد يتسبب في تصنيفها بشكل خاطئ بثقة عالية. [41] لا تزال هذه مشكلة مع الشبكات العصبية، على الرغم من أن الاضطرابات في العمل الأخير كبيرة بشكل عام بما يكفي لتكون محسوسة. [42] [43] [44]

من الممكن إضافة ضوضاء مصممة بعناية إلى صورة ما مما يؤدي إلى تصنيفها بشكل خاطئ بدرجة عالية من الثقة.

من المتوقع أن تكون جميع الصور الموجودة على اليمين عبارة عن نعامة بعد تطبيق الاضطراب. (اليسار) عينة تم التنبؤ بها بشكل صحيح، (الوسط) اضطراب تم تطبيقه مكبرًا بمقدار 10x، (اليمين) مثال معاكس. [41]

غالبًا ما يرتبط المتانة التنافسية بالأمان. [45] أظهر الباحثون أنه يمكن تعديل إشارة صوتية بشكل غير محسوس بحيث تقوم أنظمة تحويل الكلام إلى نص بنسخها إلى أي رسالة يختارها المهاجم. [46] يجب أن تكون أنظمة اكتشاف اختراق الشبكة [47] والبرامج الضارة [48] أيضًا قوية تنافسية لأن المهاجمين قد يصممون هجماتهم لخداع أجهزة الكشف.

يجب أن تكون النماذج التي تمثل الأهداف (نماذج المكافأة) قوية في مواجهة التحديات أيضًا. على سبيل المثال، قد يقدر نموذج المكافأة مدى فائدة استجابة نصية وقد يتم تدريب نموذج لغوي لتعظيم هذه النتيجة. [49] أظهر الباحثون أنه إذا تم تدريب نموذج لغوي لفترة كافية، فسوف يستفيد من نقاط ضعف نموذج المكافأة لتحقيق نتيجة أفضل وأداء أسوأ في المهمة المقصودة. [50] يمكن معالجة هذه المشكلة من خلال تحسين القوة التنافسية لنموذج المكافأة. [51] بشكل عام، يجب أن يكون أي نظام ذكاء اصطناعي يستخدم لتقييم نظام ذكاء اصطناعي آخر قويًا في مواجهة التحديات. يمكن أن يشمل ذلك أدوات المراقبة، حيث يمكن أيضًا العبث بها لإنتاج مكافأة أعلى. [52]

يراقب

تقدير عدم اليقين

غالبًا ما يكون من المهم للمشغلين البشريين قياس مدى ثقتهم في نظام الذكاء الاصطناعي، وخاصة في البيئات ذات المخاطر العالية مثل التشخيص الطبي. [53] تعبر نماذج التعلم الآلي عمومًا عن الثقة من خلال إخراج الاحتمالات؛ ومع ذلك، فهي غالبًا ما تكون واثقة بشكل مفرط، [54] وخاصة في المواقف التي تختلف عن تلك التي تم تدريبها على التعامل معها. [55] تهدف أبحاث المعايرة إلى جعل احتمالات النموذج تتوافق قدر الإمكان مع النسبة الحقيقية لصحة النموذج.

على نحو مماثل، يهدف اكتشاف الشذوذ أو اكتشاف عدم التوزيع (OOD) إلى تحديد متى يكون نظام الذكاء الاصطناعي في موقف غير عادي. على سبيل المثال، إذا كان أحد أجهزة الاستشعار في مركبة ذاتية القيادة معطلاً، أو واجهت تضاريس صعبة، فيجب أن ينبه السائق للسيطرة أو التوقف. [56] تم تنفيذ اكتشاف الشذوذ ببساطة عن طريق تدريب مصنف للتمييز بين المدخلات الشاذة وغير الشاذة، [57] على الرغم من استخدام مجموعة من التقنيات الإضافية. [58] [59]

الكشف عن الاستخدام الضار

أعرب العلماء [6] والوكالات الحكومية عن مخاوفهم من إمكانية استخدام أنظمة الذكاء الاصطناعي لمساعدة الجهات الخبيثة في بناء الأسلحة، [60] والتلاعب بالرأي العام، [61] [62] أو أتمتة الهجمات الإلكترونية. [63] تشكل هذه المخاوف مصدر قلق عملي لشركات مثل OpenAI التي تستضيف أدوات الذكاء الاصطناعي القوية عبر الإنترنت. [64] ولمنع سوء الاستخدام، قامت OpenAI ببناء أنظمة كشف تحدد المستخدمين أو تقيدهم بناءً على نشاطهم. [65]

الشفافية

غالبًا ما يتم وصف الشبكات العصبية بأنها صناديق سوداء ، [66] مما يعني أنه من الصعب فهم سبب اتخاذها للقرارات التي تتخذها نتيجة للعدد الهائل من العمليات الحسابية التي تقوم بها. [67] وهذا يجعل من الصعب توقع الفشل. في عام 2018، قتلت سيارة ذاتية القيادة أحد المشاة بعد فشلها في تحديد هويتهم. ونظرًا لطبيعة الصندوق الأسود لبرنامج الذكاء الاصطناعي، فإن سبب الفشل لا يزال غير واضح. [68] كما يثير الجدل في مجال الرعاية الصحية حول ما إذا كان يجب استخدام نماذج فعالة إحصائيًا ولكنها غير شفافة. [69]

من الفوائد المهمة للشفافية هي القدرة على التفسير . [70] في بعض الأحيان يكون من المتطلبات القانونية تقديم تفسير لسبب اتخاذ قرار من أجل ضمان العدالة، على سبيل المثال لتصفية طلبات العمل تلقائيًا أو تعيين درجة الائتمان . [70]

تتمثل فائدة أخرى في الكشف عن سبب الفشل. [66] في بداية جائحة كوفيد-19 عام 2020، استخدم الباحثون أدوات الشفافية لإظهار أن مصنفي الصور الطبية كانوا "ينتبهون" إلى تسميات المستشفيات غير ذات الصلة. [71]

يمكن أيضًا استخدام تقنيات الشفافية لتصحيح الأخطاء. على سبيل المثال، في الورقة البحثية "تحديد وتحرير الارتباطات الواقعية في GPT"، تمكن المؤلفون من تحديد معلمات النموذج التي أثرت على كيفية إجابته على الأسئلة حول موقع برج إيفل. ثم تمكنوا من "تحرير" هذه المعرفة لجعل النموذج يستجيب للأسئلة كما لو كان يعتقد أن البرج يقع في روما بدلاً من فرنسا. [72] على الرغم من أن المؤلفين في هذه الحالة تسببوا في حدوث خطأ، إلا أنه من الممكن استخدام هذه الأساليب لإصلاحها بكفاءة. توجد أيضًا تقنيات تحرير النموذج في مجال الرؤية الحاسوبية. [73]

أخيرًا، زعم البعض أن غموض أنظمة الذكاء الاصطناعي يشكل مصدرًا كبيرًا للمخاطر وأن الفهم الأفضل لكيفية عملها قد يمنع حدوث حالات فشل ذات عواقب وخيمة في المستقبل. [74] تهدف أبحاث قابلية التفسير "الداخلية" إلى جعل نماذج التعلم الآلي أقل غموضًا. أحد أهداف هذا البحث هو تحديد ما تمثله عمليات تنشيط الخلايا العصبية الداخلية. [75] [76] على سبيل المثال، حدد الباحثون خلية عصبية في نظام الذكاء الاصطناعي CLIP تستجيب لصور الأشخاص الذين يرتدون أزياء الرجل العنكبوت، ورسومات الرجل العنكبوت، وكلمة "العنكبوت". [77] كما يتضمن شرح الروابط بين هذه الخلايا العصبية أو "الدوائر". [78] [79] على سبيل المثال، حدد الباحثون آليات مطابقة الأنماط في انتباه المحول والتي قد تلعب دورًا في كيفية تعلم نماذج اللغة من سياقها. [80] تمت مقارنة "قابلية التفسير الداخلية" بعلم الأعصاب. في كلتا الحالتين، الهدف هو فهم ما يحدث في نظام معقد، على الرغم من أن باحثي التعلم الآلي يتمتعون بفائدة القدرة على أخذ قياسات مثالية وإجراء عمليات استئصال تعسفية. [81]

كشف أحصنة طروادة

قد تحتوي نماذج التعلم الآلي على "أحصنة طروادة" أو "أبواب خلفية": نقاط ضعف يبنيها الجهات الخبيثة بشكل خبيث في نظام الذكاء الاصطناعي. على سبيل المثال، يمكن لنظام التعرف على الوجه المصاب بأحصنة طروادة منح الوصول عندما تكون قطعة معينة من المجوهرات في العرض؛ [35] أو قد تعمل مركبة ذاتية القيادة مصابة بأحصنة طروادة بشكل طبيعي حتى يصبح محفز معين مرئيًا. [82] لاحظ أنه يجب أن يكون لدى الخصم حق الوصول إلى بيانات تدريب النظام من أجل زرع حصان طروادة. [ بحاجة لمصدر ] قد لا يكون من الصعب القيام بذلك مع بعض النماذج الكبيرة مثل CLIP أو GPT-3 حيث يتم تدريبها على بيانات الإنترنت المتاحة للجمهور. [83] تمكن الباحثون من زرع حصان طروادة في مصنف الصور عن طريق تغيير 300 صورة فقط من أصل 3 ملايين صورة تدريبية. [84] بالإضافة إلى فرض خطر أمني، زعم الباحثون أن أحصنة طروادة توفر بيئة ملموسة لاختبار وتطوير أدوات مراقبة أفضل. [52]

تنسيق

في مجال الذكاء الاصطناعي ، يهدف محاذاة الذكاء الاصطناعي إلى توجيه أنظمة الذكاء الاصطناعي نحو الأهداف المقصودة أو التفضيلات أو المبادئ الأخلاقية لشخص أو مجموعة. يُعتبر نظام الذكاء الاصطناعي متوافقًا إذا حقق الأهداف المقصودة. يسعى نظام الذكاء الاصطناعي غير المتوافق إلى تحقيق أهداف غير مقصودة. [85]

غالبًا ما يكون من الصعب على مصممي الذكاء الاصطناعي محاذاة نظام الذكاء الاصطناعي لأنه من الصعب عليهم تحديد النطاق الكامل للسلوكيات المرغوبة وغير المرغوبة. لذلك، غالبًا ما يستخدم مصممو الذكاء الاصطناعي أهدافًا بالوكالة أبسط ، مثل الحصول على موافقة الإنسان . لكن الأهداف بالوكالة يمكن أن تتجاهل القيود الضرورية أو تكافئ نظام الذكاء الاصطناعي لمجرد ظهوره منسجمًا. [85] [86]

يمكن أن تتعطل أنظمة الذكاء الاصطناعي غير المتوافقة وتسبب الضرر. قد تجد أنظمة الذكاء الاصطناعي ثغرات تسمح لها بإنجاز أهدافها بالوكالة بكفاءة ولكن بطرق غير مقصودة ومضرة في بعض الأحيان ( اختراق المكافأة ). [85] [87] [88] وقد تطور أيضًا استراتيجيات آلية غير مرغوب فيها ، مثل السعي إلى السلطة أو البقاء لأن مثل هذه الاستراتيجيات تساعدها على تحقيق أهدافها النهائية المعينة. [85] [89] [90] علاوة على ذلك، قد تطور أهدافًا ناشئة غير مرغوب فيها قد يكون من الصعب اكتشافها قبل نشر النظام ومواجهة مواقف وتوزيعات بيانات جديدة . [91] [92]

اليوم، تؤثر بعض هذه المشكلات على الأنظمة التجارية الحالية مثل نماذج اللغة الكبيرة ، [93] [94] [95] والروبوتات ، [96] والمركبات ذاتية القيادة ، [97] ومحركات التوصية بوسائل التواصل الاجتماعي . [93] [90] [98] يزعم بعض الباحثين في مجال الذكاء الاصطناعي أن الأنظمة المستقبلية الأكثر قدرة ستتأثر بشكل أكثر خطورة لأن هذه المشكلات تنتج جزئيًا عن القدرات العالية. [99] [87] [86]

يزعم العديد من الباحثين البارزين في مجال الذكاء الاصطناعي، [100] [101] [102] بما في ذلك جيفري هينتون ويوشوا بينجيو وستيوارت راسل ، أن الذكاء الاصطناعي يقترب من القدرات المعرفية الشبيهة بالإنسان ( AGI ) والقدرات المعرفية الخارقة ( ASI ) ويمكن أن يعرض الحضارة الإنسانية للخطر إذا لم يتماشى معها. [103] [90] وتظل هذه المخاطر محل نقاش. [104]

محاذاة الذكاء الاصطناعي هي مجال فرعي من مجالات سلامة الذكاء الاصطناعي، ودراسة كيفية بناء أنظمة ذكاء اصطناعي آمنة. [105] تشمل المجالات الفرعية الأخرى لسلامة الذكاء الاصطناعي المتانة والمراقبة والتحكم في القدرات . [106] تشمل تحديات البحث في المحاذاة غرس القيم المعقدة في الذكاء الاصطناعي، وتطوير الذكاء الاصطناعي الصادق، والإشراف القابل للتطوير، والتدقيق وتفسير نماذج الذكاء الاصطناعي، ومنع سلوكيات الذكاء الاصطناعي الناشئة مثل البحث عن السلطة. [106] يرتبط بحث المحاذاة بأبحاث قابلية التفسير ، [107] [108] المتانة (العدائية)، [105] اكتشاف الشذوذ ، عدم اليقين المعاير ، [107] التحقق الرسمي ، [109] تعلم التفضيلات ، [110] [111] [112] الهندسة الحرجة للسلامة ، [113] نظرية اللعبة ، [114] الإنصاف الخوارزمي ، [105] [115] والعلوم الاجتماعية . [116] [117]

السلامة النظامية والعوامل الاجتماعية والتقنية

من الشائع تصنيف مخاطر الذكاء الاصطناعي (والمخاطر التكنولوجية بشكل عام) على أنها سوء استخدام أو حوادث . [118] اقترح بعض العلماء أن هذا الإطار غير كاف. [118] على سبيل المثال، لم تكن أزمة الصواريخ الكوبية حادثًا أو سوء استخدام للتكنولوجيا بوضوح. [118] كتب محللو السياسات زويتسلوت ودافو، "تميل وجهات نظر سوء الاستخدام والحوادث إلى التركيز فقط على الخطوة الأخيرة في سلسلة سببية تؤدي إلى الضرر: أي الشخص الذي أساء استخدام التكنولوجيا، أو النظام الذي تصرف بطرق غير مقصودة ... ومع ذلك، غالبًا ما تكون السلسلة السببية ذات الصلة أطول بكثير." غالبًا ما تنشأ المخاطر من عوامل "بنيوية" أو "نظامية" مثل الضغوط التنافسية، وانتشار الأضرار، والتطور السريع، ومستويات عالية من عدم اليقين، وثقافة السلامة غير الكافية. [118] في السياق الأوسع لهندسة السلامة ، تلعب العوامل البنيوية مثل "ثقافة السلامة التنظيمية" دورًا مركزيًا في إطار تحليل مخاطر STAMP الشهير. [119]

مستوحى من المنظور البنيوي، أكد بعض الباحثين على أهمية استخدام التعلم الآلي لتحسين عوامل السلامة الاجتماعية والتقنية، على سبيل المثال، استخدام التعلم الآلي للدفاع السيبراني، وتحسين عملية اتخاذ القرار المؤسسي، وتسهيل التعاون. [35] وأكد آخرون على أهمية إشراك كل من ممارسي الذكاء الاصطناعي وخبراء المجال في عملية التصميم لمعالجة نقاط الضعف البنيوية. [120]

الدفاع السيبراني

يشعر بعض العلماء بالقلق من أن الذكاء الاصطناعي قد يؤدي إلى تفاقم اللعبة غير المتوازنة بالفعل بين المهاجمين السيبرانيين والمدافعين السيبرانيين. [121] وهذا من شأنه أن يزيد من حوافز "الضربة الأولى" وقد يؤدي إلى هجمات أكثر عدوانية وزعزعة للاستقرار. ومن أجل التخفيف من هذا الخطر، دعا البعض إلى زيادة التركيز على الدفاع السيبراني. بالإضافة إلى ذلك، يعد أمان البرامج ضروريًا لمنع سرقة نماذج الذكاء الاصطناعي القوية وإساءة استخدامها. [6] أظهرت الدراسات الحديثة أن الذكاء الاصطناعي يمكن أن يعزز بشكل كبير مهام الأمن السيبراني الفنية والإدارية من خلال أتمتة المهام الروتينية وتحسين الكفاءة العامة. [122]

تحسين عملية اتخاذ القرار المؤسسي

إن تقدم الذكاء الاصطناعي في المجالات الاقتصادية والعسكرية قد يؤدي إلى تحديات سياسية غير مسبوقة. [123] وقد قارن بعض العلماء ديناميكيات سباق الذكاء الاصطناعي بالحرب الباردة، حيث كان الحكم الدقيق لعدد صغير من صناع القرار غالبًا ما يشير إلى الفرق بين الاستقرار والكارثة. [124] وقد زعم باحثو الذكاء الاصطناعي أن تقنيات الذكاء الاصطناعي يمكن استخدامها أيضًا للمساعدة في اتخاذ القرار. [35] على سبيل المثال، بدأ الباحثون في تطوير أنظمة التنبؤ بالذكاء الاصطناعي [125] والأنظمة الاستشارية. [126]

تسهيل التعاون

لقد تم تأطير العديد من أكبر التهديدات العالمية (الحرب النووية، [127] وتغير المناخ، [128] وما إلى ذلك) على أنها تحديات تعاونية. وكما هو الحال في سيناريو معضلة السجين المعروف ، قد تؤدي بعض الديناميكيات إلى نتائج سيئة لجميع اللاعبين، حتى عندما يتصرفون بشكل مثالي لصالحهم الذاتي. على سبيل المثال، لا يوجد لدى أي جهة فاعلة واحدة حوافز قوية لمعالجة تغير المناخ على الرغم من أن العواقب قد تكون كبيرة إذا لم يتدخل أحد. [128]

إن أحد التحديات البارزة التي تواجه التعاون في مجال الذكاء الاصطناعي هو تجنب "السباق نحو القاع". [129] وفي هذا السيناريو، تتسابق البلدان أو الشركات لبناء أنظمة ذكاء اصطناعي أكثر قدرة وتهمل السلامة، مما يؤدي إلى وقوع حادث كارثي يضر بكل من شارك فيه. لقد ألهمت المخاوف بشأن سيناريوهات مثل هذه الجهود السياسية [130] والتقنية [131] لتسهيل التعاون بين البشر، وربما أيضًا بين أنظمة الذكاء الاصطناعي. تركز معظم أبحاث الذكاء الاصطناعي على تصميم وكلاء فرديين لخدمة وظائف معزولة (غالبًا في ألعاب "لاعب واحد"). [132] اقترح العلماء أنه مع تزايد استقلالية أنظمة الذكاء الاصطناعي، فقد يصبح من الضروري دراسة وتشكيل الطريقة التي تتفاعل بها. [132] [120]

تحديات نماذج اللغة الكبيرة

في السنوات الأخيرة، أثار تطوير نماذج اللغة الكبيرة مخاوف فريدة من نوعها في مجال سلامة الذكاء الاصطناعي. وقد سلط الباحثان بيندر وجيبرو وآخرون [133] الضوء على التكاليف البيئية والمالية المرتبطة بتدريب هذه النماذج، مؤكدين أن استهلاك الطاقة والبصمة الكربونية لإجراءات التدريب مثل تلك الخاصة بنماذج المحولات يمكن أن تكون كبيرة. وعلاوة على ذلك، تعتمد هذه النماذج غالبًا على مجموعات بيانات ضخمة وغير منظمة تعتمد على الإنترنت، والتي يمكن أن تشفر وجهات نظر مهيمنة ومتحيزة، مما يزيد من تهميش المجموعات غير الممثلة. إن بيانات التدريب واسعة النطاق، على الرغم من ضخامة حجمها، لا تضمن التنوع وغالبًا ما تعكس وجهات نظر التركيبة السكانية المتميزة، مما يؤدي إلى نماذج تديم التحيزات والصور النمطية الموجودة. ويتفاقم هذا الوضع بسبب ميل هذه النماذج إلى إنتاج نص متماسك وسلسل على ما يبدو، مما قد يضلل المستخدمين في عزو المعنى والقصد حيث لا يوجد أي منهما، وهي ظاهرة توصف بأنها "ببغاوات عشوائية". لذلك، تشكل هذه النماذج مخاطر تضخيم التحيزات المجتمعية، ونشر المعلومات المضللة، واستخدامها لأغراض خبيثة، مثل توليد الدعاية المتطرفة أو التزييف العميق. ولمعالجة هذه التحديات، يدعو الباحثون إلى تخطيط أكثر دقة في إنشاء مجموعات البيانات وتطوير النظام، مع التأكيد على الحاجة إلى مشاريع بحثية تساهم بشكل إيجابي في نظام بيئي تكنولوجي عادل. [134] [135]

في الحكم

قمة سلامة الذكاء الاصطناعي في نوفمبر 2023 [136]

تهتم حوكمة الذكاء الاصطناعي على نطاق واسع بإنشاء القواعد والمعايير واللوائح لتوجيه استخدام وتطوير أنظمة الذكاء الاصطناعي. [124]

بحث

تتراوح أبحاث حوكمة سلامة الذكاء الاصطناعي من التحقيقات الأساسية في التأثيرات المحتملة للذكاء الاصطناعي إلى تطبيقات محددة. على الجانب الأساسي، زعم الباحثون أن الذكاء الاصطناعي يمكن أن يحول العديد من جوانب المجتمع بسبب قابليته للتطبيق الواسع، ومقارنته بالكهرباء والمحرك البخاري. [137] ركزت بعض الأعمال على توقع المخاطر المحددة التي قد تنشأ عن هذه التأثيرات - على سبيل المثال، المخاطر الناجمة عن البطالة الجماعية، [138] والتسليح ، [139] والتضليل، [140] والمراقبة، [141] وتركيز السلطة. [142] يستكشف عمل آخر عوامل الخطر الأساسية مثل صعوبة مراقبة صناعة الذكاء الاصطناعي سريعة التطور، [143] وتوافر نماذج الذكاء الاصطناعي، [144] وديناميكيات "السباق نحو القاع". [129] [145] أكد آلان دافو، رئيس الحوكمة والاستراتيجية طويلة الأجل في ديب مايند، على مخاطر السباق والحاجة المحتملة للتعاون: "قد يكون من الضروري والكافي لسلامة الذكاء الاصطناعي وتوافقه أن يكون هناك درجة عالية من الحذر قبل نشر أنظمة قوية متقدمة؛ ومع ذلك، إذا كان الممثلون يتنافسون في مجال يتمتع بعوائد كبيرة للمبادرين الأوائل أو ميزة نسبية، فسوف يتعرضون للضغط لاختيار مستوى أقل من المستوى الأمثل من الحذر". [130] يركز تيار البحث على تطوير الأساليب والأطر والأساليب لتقييم مساءلة الذكاء الاصطناعي، وتوجيه وتعزيز عمليات تدقيق الأنظمة القائمة على الذكاء الاصطناعي. [146] [147] [148]

تتضمن الجهود المبذولة لتعزيز سلامة الذكاء الاصطناعي أطرًا مصممة لمواءمة مخرجات الذكاء الاصطناعي مع المبادئ التوجيهية الأخلاقية والحد من المخاطر مثل سوء الاستخدام وتسرب البيانات. تعمل أدوات مثل Guardrails من Nvidia ، [149] و Llama Guard، [150] وحواجز الحماية القابلة للتخصيص من Preamble [151] على تخفيف نقاط الضعف مثل الحقن الفوري وضمان التزام المخرجات بالمبادئ المحددة مسبقًا. غالبًا ما يتم دمج هذه الأطر في أنظمة الذكاء الاصطناعي لتحسين السلامة والموثوقية. [152]

وجهات نظر فلسفية

إن مجال سلامة الذكاء الاصطناعي متشابك بشكل عميق مع الاعتبارات الفلسفية، وخاصة في مجال الأخلاق. وقد تم اقتراح الأخلاقيات الأخلاقية ، التي تؤكد على الالتزام بالقواعد الأخلاقية، كإطار لمواءمة أنظمة الذكاء الاصطناعي مع القيم الإنسانية. ومن خلال تضمين المبادئ الأخلاقية، يمكن توجيه أنظمة الذكاء الاصطناعي لتجنب الأفعال التي تسبب الضرر، مما يضمن بقاء عملياتها ضمن الحدود الأخلاقية. [153]

توسيع نطاق التدابير المحلية لتشمل حلولاً عالمية

عند معالجة مشكلة سلامة الذكاء الاصطناعي، من المهم التأكيد على التمييز بين الحلول المحلية والعالمية. تركز الحلول المحلية على أنظمة الذكاء الاصطناعي الفردية، وتضمن أنها آمنة ومفيدة، بينما تسعى الحلول العالمية إلى تنفيذ تدابير السلامة لجميع أنظمة الذكاء الاصطناعي عبر ولايات قضائية مختلفة. يزعم بعض الباحثين [154] ضرورة توسيع نطاق تدابير السلامة المحلية إلى مستوى عالمي، واقتراح تصنيف لهذه الحلول العالمية. يؤكد هذا النهج على أهمية الجهود التعاونية في الحوكمة الدولية لسلامة الذكاء الاصطناعي، مؤكداً أنه لا يمكن لأي كيان واحد إدارة المخاطر المرتبطة بتقنيات الذكاء الاصطناعي بشكل فعال. يتماشى هذا المنظور مع الجهود الجارية في صنع السياسات الدولية والأطر التنظيمية، والتي تهدف إلى معالجة التحديات المعقدة التي تفرضها أنظمة الذكاء الاصطناعي المتقدمة في جميع أنحاء العالم. [155] [156]

العمل الحكومي

زعم بعض الخبراء أنه من السابق لأوانه تنظيم الذكاء الاصطناعي، معربين عن مخاوفهم من أن اللوائح التنظيمية ستعيق الابتكار وسيكون من الحماقة "التسرع في التنظيم في ظل الجهل". [157] [158] ويدعو آخرون، مثل قطب الأعمال إيلون ماسك ، إلى اتخاذ إجراءات وقائية للتخفيف من المخاطر الكارثية. [159]

خارج التشريع الرسمي، طرحت الوكالات الحكومية توصيات أخلاقية وسلامة. في مارس 2021، أفادت لجنة الأمن القومي الأمريكية للذكاء الاصطناعي أن التقدم في مجال الذكاء الاصطناعي قد يجعل من المهم بشكل متزايد "ضمان توافق الأنظمة مع الأهداف والقيم، بما في ذلك السلامة والمتانة والجدارة بالثقة". [160] بعد ذلك، صاغ المعهد الوطني للمعايير والتكنولوجيا إطار عمل لإدارة مخاطر الذكاء الاصطناعي، والذي ينصح بأنه عندما "توجد مخاطر كارثية - يجب أن يتوقف التطوير والنشر بطريقة آمنة حتى يمكن إدارة المخاطر بشكل كافٍ". [161]

في سبتمبر 2021، نشرت جمهورية الصين الشعبية إرشادات أخلاقية لاستخدام الذكاء الاصطناعي في الصين، مؤكدة على أن قرارات الذكاء الاصطناعي يجب أن تظل تحت السيطرة البشرية وتدعو إلى آليات المساءلة. في نفس الشهر، نشرت المملكة المتحدة استراتيجيتها الوطنية للذكاء الاصطناعي لمدة 10 سنوات، [162] والتي تنص على أن الحكومة البريطانية "تأخذ المخاطر طويلة الأجل للذكاء الاصطناعي العام غير المنحاز، والتغييرات غير المتوقعة التي قد تعنيها ... للعالم، على محمل الجد". [163] تصف الاستراتيجية الإجراءات اللازمة لتقييم مخاطر الذكاء الاصطناعي طويلة الأجل، بما في ذلك المخاطر الكارثية. [163] عقدت الحكومة البريطانية أول قمة عالمية كبرى حول سلامة الذكاء الاصطناعي. وقد عقدت هذه القمة في الأول والثاني من نوفمبر 2023 ووُصفت بأنها "فرصة لصناع السياسات وقادة العالم للنظر في المخاطر الفورية والمستقبلية للذكاء الاصطناعي وكيف يمكن التخفيف من هذه المخاطر من خلال نهج منسق عالميًا". [164] [165]

كما شجعت المنظمات الحكومية، وخاصة في الولايات المتحدة، تطوير أبحاث السلامة التقنية للذكاء الاصطناعي. بدأ نشاط مشاريع الأبحاث المتقدمة في مجال الاستخبارات مشروع TrojAI لتحديد وحماية أنظمة الذكاء الاصطناعي من هجمات أحصنة طروادة . [166] تشارك وكالة مشاريع الأبحاث الدفاعية المتقدمة في الأبحاث حول الذكاء الاصطناعي القابل للتفسير وتحسين المتانة ضد الهجمات المعادية . [167] [168] وتدعم مؤسسة العلوم الوطنية مركز التعلم الآلي الجدير بالثقة، وتوفر ملايين الدولارات لتمويل أبحاث السلامة التجريبية للذكاء الاصطناعي. [169]

في عام 2024، اعتمدت الجمعية العامة للأمم المتحدة أول قرار عالمي بشأن تعزيز أنظمة الذكاء الاصطناعي "الآمنة والمأمونة والجديرة بالثقة" والذي أكد على احترام وحماية وتعزيز حقوق الإنسان في تصميم وتطوير ونشر واستخدام الذكاء الاصطناعي. [170]

في مايو 2024، أعلنت وزارة العلوم والابتكار والتكنولوجيا (DSIT) عن تمويل بقيمة 8.5 مليون جنيه إسترليني لأبحاث سلامة الذكاء الاصطناعي في إطار برنامج المنح السريعة لسلامة الذكاء الاصطناعي النظامية، بقيادة كريستوفر سمرفيلد وشاهار أفين في معهد سلامة الذكاء الاصطناعي، بالشراكة مع المملكة المتحدة للبحوث والابتكار . أعلنت وزيرة التكنولوجيا ميشيل دونيلان عن الخطة في قمة الذكاء الاصطناعي في سيول ، مشيرة إلى أن الهدف هو جعل الذكاء الاصطناعي آمنًا في جميع أنحاء المجتمع وأن المقترحات الواعدة يمكن أن تتلقى المزيد من التمويل. كما وقعت المملكة المتحدة اتفاقية مع 10 دول أخرى والاتحاد الأوروبي لتشكيل شبكة دولية لمعاهد سلامة الذكاء الاصطناعي لتعزيز التعاون وتبادل المعلومات والموارد. بالإضافة إلى ذلك، خطط معهد سلامة الذكاء الاصطناعي في المملكة المتحدة لافتتاح مكتب في سان فرانسيسكو. [171]

التنظيم الذاتي للشركات

تلتزم مختبرات وشركات الذكاء الاصطناعي عمومًا بممارسات ومعايير السلامة التي تقع خارج التشريع الرسمي. [172] أحد أهداف الباحثين في مجال الحوكمة هو صياغة هذه المعايير. تشمل أمثلة توصيات السلامة الموجودة في الأدبيات إجراء تدقيق من قبل طرف ثالث، [173] وتقديم مكافآت للعثور على الأعطال، [173] ومشاركة حوادث الذكاء الاصطناعي [173] (تم إنشاء قاعدة بيانات لحوادث الذكاء الاصطناعي لهذا الغرض)، [174] واتباع الإرشادات لتحديد ما إذا كان سيتم نشر الأبحاث أو النماذج، [144] وتحسين المعلومات والأمن السيبراني في مختبرات الذكاء الاصطناعي. [175]

كما تعهدت الشركات. اقترحت Cohere وOpenAI وAI21 واتفقت على "أفضل الممارسات لنشر نماذج اللغة"، مع التركيز على التخفيف من سوء الاستخدام. [176] لتجنب المساهمة في ديناميكيات السباق، ذكرت OpenAI أيضًا في ميثاقها أنه "إذا اقترب مشروع متوافق مع القيمة وواعٍ للسلامة من بناء الذكاء الاصطناعي العام قبل أن نفعل ذلك، فإننا نلتزم بالتوقف عن المنافسة والبدء في مساعدة هذا المشروع" [177] كما وقع قادة الصناعة مثل الرئيس التنفيذي لشركة DeepMind Demis Hassabis ومدير Facebook AI Yann LeCun على رسائل مفتوحة مثل مبادئ Asilomar [31] والرسالة المفتوحة للأسلحة المستقلة. [178]

انظر أيضا

مراجع

  1. ^ بيريغو، بيلي (2023-11-02). "قمة سلامة الذكاء الاصطناعي في المملكة المتحدة تنتهي بتقدم محدود ولكنه هادف". تايم . تم الاسترجاع في 2024-06-02 .
  2. ^ دي أرتيجا، ماريا (13 مايو 2020). التعلم الآلي في البيئات عالية المخاطر: المخاطر والفرص (دكتوراه). جامعة كارنيجي ميلون.
  3. ^ مهرابي، نيناريه؛ مورستاتر، فريد؛ ساكسينا، نريبسوتا؛ ليرمان، كريستينا؛ جالستيان، أرام (2021). "استطلاع حول التحيز والإنصاف في التعلم الآلي". استطلاعات الحوسبة التابعة لجمعية آلات الحاسبات الآلية . 54 (6): 1– 35. arXiv : 1908.09635 . doi :10.1145/3457607. ISSN  0360-0300. S2CID  201666566. مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-28 .
  4. ^ فيلدشتاين، ستيفن (2019). التوسع العالمي للمراقبة باستخدام الذكاء الاصطناعي (تقرير). مؤسسة كارنيغي للسلام الدولي.
  5. ^ بارنز، بيث (2021). "المخاطر الناجمة عن الإقناع بالذكاء الاصطناعي". Lesswrong . مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  6. ^ abc Brundage, Miles; Avin, Shahar; Clark, Jack; Toner, Helen; Eckersley, Peter; Garfinkel, Ben; Dafoe, Allan; Scharre, Paul; Zeitzoff, Thomas; Filar, Bobby; Anderson, Hyrum; Roff, Heather; Allen, Gregory C; Steinhardt, Jacob; Flynn, Carrick (2018-04-30). "الاستخدام الخبيث للذكاء الاصطناعي: التنبؤ والوقاية والتخفيف". مستودع جامعة كامبريدج أبولو، مستودع جامعة كامبريدج أبولو. مستودع جامعة كامبريدج أبولو. doi :10.17863/cam.22520. S2CID  3385567. مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-28 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  7. ^ ديفيز، باسكال (26 ديسمبر 2022). "كيف يستعد حلف شمال الأطلسي لعصر جديد من الهجمات السيبرانية بالذكاء الاصطناعي". يورونيوز . تم الاسترجاع في 2024-03-23 .
  8. ^ أهوجا، أنجانا (7 فبراير 2024). "لا ينبغي استبعاد إمكانية استخدام الذكاء الاصطناعي في الإرهاب البيولوجي". فاينانشال تايمز . تم الاسترجاع في 2024-03-23 .
  9. ^ كارلسميث، جوزيف (2022-06-16). "هل الذكاء الاصطناعي الباحث عن السلطة يشكل خطرًا وجوديًا؟". arXiv : 2206.13353 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  10. ^ ميناردي، دي (16 أكتوبر 2020). "المصير الكئيب الذي قد يكون "أسوأ من الانقراض"". بي بي سي . تم الاسترجاع في 2024-03-23 .
  11. ^ "خبير الذكاء الاصطناعي بيتر فوس يقول إن مشكلة محاذاة الذكاء الاصطناعي زائفة | NextBigFuture.com". 2023-04-04 . تم الاسترجاع 2023-07-23 .
  12. ^ دافو، ألان (2016). "نعم، نحن قلقون بشأن المخاطر الوجودية للذكاء الاصطناعي". مراجعة تكنولوجيا معهد ماساتشوستس للتكنولوجيا . مؤرشف من الأصل في 2022-11-28 . تم الاسترجاع في 2022-11-28 .
  13. ^ ab Grace, Katja; Salvatier, John; Dafoe, Allan; Zhang, Baobao; Evans, Owain (2018-07-31). "وجهة نظر: متى سيتجاوز الذكاء الاصطناعي الأداء البشري؟ أدلة من خبراء الذكاء الاصطناعي". مجلة أبحاث الذكاء الاصطناعي . 62 : 729– 754. arXiv : 1705.08807 . doi : 10.1613/jair.1.11222 . ISSN  1076-9757. S2CID  8746462. مؤرشف من الأصل في 2023-02-10 . تم الاسترجاع 2022-11-28 .
  14. ^ Zhang, Baobao; Anderljung, Markus; Kahn, Lauren; Dreksler, Noemi; Horowitz, Michael C.; Dafoe, Allan (2021-05-05). "أخلاقيات وحوكمة الذكاء الاصطناعي: أدلة من دراسة استقصائية لباحثي التعلم الآلي". مجلة أبحاث الذكاء الاصطناعي . 71. arXiv : 2105.02117 . doi :10.1613/jair.1.12895.
  15. ^ شتاين بيرلمان، زاك؛ وينشتاين راون، بنيامين؛ جريس (4 أغسطس 2022). "استطلاع رأي الخبراء لعام 2022 حول التقدم في الذكاء الاصطناعي". تأثيرات الذكاء الاصطناعي . مؤرشف من الأصل في 23 نوفمبر 2022. تم الاسترجاع في 23 نوفمبر 2022 .
  16. ^ مايكل جوليان. الأماكن القريبة : باريش، أليسيا. مولر، هارون. وانغ، اليكس. تشن، انجليكا. مادان، ديفيام؛ نانجيا، نيكيتا؛ بانغ، ريتشارد يوانزي؛ فانغ، جيسون. بومان ، صموئيل ر. (26/08/2022). “ماذا يعتقد باحثو البرمجة اللغوية العصبية؟ نتائج مسح مجتمع البرمجة اللغوية العصبية “. جمعية اللغويات الحاسوبية . أرخايف : 2208.12852 .
  17. ^ ماركوف، جون (2013-05-20). "في عام 1949، تخيل عصر الروبوتات". نيويورك تايمز . ISSN  0362-4331. مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  18. ^ جمعية النهوض بالذكاء الاصطناعي. "اللجنة الرئاسية للجمعية الأمريكية للذكاء الاصطناعي حول مستقبل الذكاء الاصطناعي على المدى الطويل". مؤرشف من الأصل في 2022-09-01 . تم الاسترجاع في 2022-11-23 .
  19. ^ Yampolskiy, Roman V.; Spellchecker, MS (2016-10-25). "سلامة الذكاء الاصطناعي والأمن السيبراني: جدول زمني لفشل الذكاء الاصطناعي". arXiv : 1610.07997 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  20. ^ "PT-AI 2011 – فلسفة ونظرية الذكاء الاصطناعي (PT-AI 2011)". مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  21. ^ Yampolskiy, Roman V. (2013), Müller, Vincent C. (ed.), "Artificial Intelligence Safety Engineering: Why Machine Ethics is a Wrong Approach", Philosophy and Theory of Artificial Intelligence , Studies in Applied Philosophy, Epistemology and Rational Ethics, vol. 5, Berlin; Heidelberg, Germany: Springer Berlin Heidelberg, pp.  389– 396, doi :10.1007/978-3-642-31674-6_29, ISBN 978-3-642-31673-9, تم أرشفته من الأصل في 2023-03-15 , تم استرجاعه في 2022-11-23
  22. ^ ماكلين، سكوت؛ ريد، جيما جيه إم؛ تومسون، جيسون؛ بابر، كريس؛ ستانتون، نيفيل أ؛ سالمون، بول م. (2023-07-04). "المخاطر المرتبطة بالذكاء الاصطناعي العام: مراجعة منهجية". مجلة الذكاء الاصطناعي التجريبي والنظري . 35 (5): 649– 663. رمز Bibcode : 2023JETAI..35..649M. doi : 10.1080/0952813X.2021.1964003 . hdl : 11343/289595 . ISSN  0952-813X. S2CID  238643957.
  23. ^ Wile, Rob (3 أغسطس 2014). "Elon Musk: Artificial Intelligence Is 'Potentially More Dangerous Than Nukes'". Business Insider . تم الاسترجاع في 2024-02-22 .
  24. ^ كيو، كايزر (2015-03-31). الرئيس التنفيذي لشركة بايدو روبن لي يجري مقابلة مع بيل جيتس وإيلون ماسك في منتدى بواو، 29 مارس 2015. حدث الحدث في 55:49. مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  25. ^ Cellan-Jones, Rory (2014-12-02). "Stephen Hawking warns artificial intelligence could end humanity". BBC News . مؤرشف من الأصل في 2015-10-30 . تم الاسترجاع 2022-11-23 .
  26. ^ معهد مستقبل الحياة. "أولويات البحث للذكاء الاصطناعي القوي والمفيد: رسالة مفتوحة". معهد مستقبل الحياة . مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  27. ^ معهد مستقبل الحياة (أكتوبر 2016). "برنامج منح أبحاث الذكاء الاصطناعي". معهد مستقبل الحياة . مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  28. ^ "SafArtInt 2016". مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  29. ^ باخ، ديبوراه (2016). "جامعة ويسكونسن تستضيف أول أربع ورش عمل عامة للبيت الأبيض حول الذكاء الاصطناعي". أخبار جامعة ويسكونسن . مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  30. ^ أمودي ، داريو. أولا كريس. ستنهاردت، جاكوب؛ كريستيانو، بول؛ شولمان، جون. ماني ، دان (25/07/2016). “مشاكل ملموسة في سلامة الذكاء الاصطناعي”. أرخايف : 1606.06565 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  31. ^ معهد مستقبل الحياة. "مبادئ الذكاء الاصطناعي". معهد مستقبل الحياة . مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  32. ^ يوهسوا، بينجيو؛ دانيال، بريفيتيرا؛ تاماي، بيسيروغلو؛ ريشي، بوماساني؛ ستيفن، كاسبر؛ ييجين، تشوي؛ دانييل، جولدفارب؛ هدى، حيدري؛ ليلى، خلاتبري (مايو 2024). التقرير العلمي الدولي حول سلامة الذكاء الاصطناعي المتقدم (تقرير). وزارة العلوم والابتكار والتكنولوجيا.
  33. ^ ab Research, DeepMind Safety (2018-09-27). "Building safe artificial intelligence: specification, robustness, and insurance". Medium . مؤرشف من الأصل في 2023-02-10 . تم الاسترجاع في 2022-11-23 .
  34. ^ "SafeML ICLR 2019 Workshop". مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع 2022-11-23 .
  35. ^ abcde Hendrycks, Dan; Carlini, Nicholas; Schulman, John; Steinhardt, Jacob (2022-06-16). "المشاكل غير المحلولة في سلامة التعلم الآلي". arXiv : 2109.13916 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  36. ^ براون، رايان (12 يونيو 2023). "رئيس الوزراء البريطاني ريشي سوناك يطرح المملكة المتحدة كموطن لتنظيم سلامة الذكاء الاصطناعي مع سعي لندن لأن تكون وادي السيليكون التالي". CNBC . تم الاسترجاع في 25 يونيو 2023 .
  37. ^ Bertuzzi, Luca (18 أكتوبر 2023). "قمة سلامة الذكاء الاصطناعي في المملكة المتحدة تسلط الضوء على خطر فقدان السيطرة البشرية على النماذج "الحدودية". Euractiv . تم الاسترجاع في 2 مارس 2024 .
  38. ^ بنجيو ، يوشوا. بريفيتيرا، دانيال؛ بوماساني، ريشي؛ كاسبر، ستيفن. غولدفارب، دانييل. مافروديس، فاسيليوس؛ خالتبري، ليلى؛ مزيكا، مانتاس؛ هدى، حيدري (2024-05-17). “التقرير العلمي الدولي حول سلامة الذكاء الاصطناعي المتقدم” (PDF) . GOV.UK . مؤرشفة (PDF) من النسخة الأصلية بتاريخ 2024-06-15 . تم الاسترجاع بتاريخ 2024-07-08 .عنوان URL البديل
  39. ^ شيبردسون، ديفيد (1 أبريل 2024). "الولايات المتحدة وبريطانيا تعلنان عن شراكة في مجال سلامة الذكاء الاصطناعي واختباره" . تم الاسترجاع في 2 أبريل 2024 .
  40. ^ Goodfellow, Ian; Papernot, Nicolas; Huang, Sandy; Duan, Rocky; Abbeel, Pieter; Clark, Jack (2017-02-24). "مهاجمة التعلم الآلي بأمثلة معادية". OpenAI . مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع في 2022-11-24 .
  41. ^ أب سيجيدي، كريستيان؛ زاريمبا، فويتشخ؛ سوتسكيفر، إيليا؛ برونا، جوان؛ ارهان، دوميترو؛ جودفيلو، إيان؛ فيرغوس ، روب (19/02/2014). “خصائص مثيرة للاهتمام للشبكات العصبية”. إيكلر . أرخايف : 1312.6199 .
  42. ^ كوراكين، أليكسي؛ جودفيلو، إيان؛ بينجيو، سامي (10 فبراير 2017). "أمثلة معادية في العالم المادي". ICLR . arXiv : 1607.02533 .
  43. ^ مادري، ألكسندر؛ ماكلوف، ألكسندر؛ شميدت، لودفيج؛ تسيبراس، ديميتريس؛ فلادو، أدريان (2019-09-04). "نحو نماذج التعلم العميق المقاومة للهجمات المعادية". ICLR . arXiv : 1706.06083 .
  44. ^ كانان، هاريني؛ كوراكين، أليكسي؛ جودفيلو، إيان (2018-03-16). "اقتران اللوجيت التنافسي". arXiv : 1803.06373 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  45. ^ جيلمر، جوستين؛ آدامز، ريان ب.؛ جودفيلو، إيان؛ أندرسن، ديفيد؛ دال، جورج إي. (2018-07-19). "تحفيز قواعد اللعبة لأبحاث الأمثلة التنافسية". arXiv : 1807.06732 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  46. ^ كارليني، نيكولاس؛ فاغنر، ديفيد (2018-03-29). "أمثلة على الهجمات الصوتية المعادية: الهجمات المستهدفة على تحويل الكلام إلى نص". ورش عمل الأمن والخصوصية التابعة لمعهد مهندسي الكهرباء والإلكترونيات . arXiv : 1801.01944 .
  47. ^ Sheatsley, Ryan; Papernot, Nicolas; Weisman, Michael; Verma, Gunjan; McDaniel, Patrick (2022-09-09). "أمثلة معادية في المجالات المقيدة". arXiv : 2011.01183 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  48. ^ Suciu, Octavian; Coull, Scott E.; Johns, Jeffrey (2019-04-13). "استكشاف الأمثلة المعادية في اكتشاف البرامج الضارة". ورش عمل الأمن والخصوصية التابعة لمعهد مهندسي الكهرباء والإلكترونيات . arXiv : 1810.08280 .
  49. ^ أويانغ، لونج؛ وو، جيف؛ جيانغ، شو؛ ألميدا، ديوجو؛ واينرايت، كارول إل؛ ميشكين، باميلا؛ تشانغ، تشونج؛ أجراوال، سانديني؛ سلاما، كاتارينا؛ راي، أليكس؛ شولمان، جون؛ هيلتون، جاكوب؛ كيلتون، فريزر؛ ميلر، لوك؛ سيمينز، ماددي (2022-03-04). "تدريب نماذج اللغة على اتباع التعليمات مع ردود الفعل البشرية". NeurIPS . arXiv : 2203.02155 .
  50. ^ جاو، ليو؛ شولمان، جون؛ هيلتون، جاكوب (2022-10-19). "قوانين التوسع لتحسين نموذج المكافأة بشكل مفرط". ICML . arXiv : 2210.10760 .
  51. ^ يو، سي هيون؛ آن، سونغ سو؛ سونغ، لي؛ شين، جين وو (2021-10-27). "روما: التكيف القوي للنموذج لتحسين النماذج غير المتصلة بالإنترنت". NeurIPS . arXiv : 2110.14188 .
  52. ^ ab Hendrycks, Dan; Mazeika, Mantas (2022-09-20). "تحليل المخاطر X لأبحاث الذكاء الاصطناعي". arXiv : 2206.05862 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  53. ^ تران، خوا أ.؛ كوندراشوفا، أولجا؛ برادلي، أندرو؛ ويليامز، إليزابيث د.؛ بيرسون، جون ف.؛ واديل، نيكولا (2021). "التعلم العميق في تشخيص السرطان وتوقعاته واختيار العلاج". طب الجينوم . 13 (1): 152. doi : 10.1186/s13073-021-00968-x . ISSN  1756-994X. PMC 8477474. PMID 34579788  . 
  54. ^ Guo, Chuan; Pleiss, Geoff; Sun, Yu; Weinberger, Kilian Q. (2017-08-06). "حول معايرة الشبكات العصبية الحديثة". وقائع المؤتمر الدولي الرابع والثلاثين حول التعلم الآلي . وقائع أبحاث التعلم الآلي. المجلد 70. PMLR. ص  1321-1330 .
  55. ^ Ovadia, Yaniv; Fertig, Emily; Ren, Jie; Nado, Zachary; Sculley, D.; Nowozin, Sebastian; Dillon, Joshua V.; Lakshminarayanan, Balaji; Snoek, Jasper (2019-12-17). "هل يمكنك الوثوق بعدم اليقين في نموذجك؟ تقييم عدم اليقين التنبئي في ظل تحول مجموعة البيانات". NeurIPS . arXiv : 1906.02530 .
  56. ^ بوجدول ، دانيال. بريتنشتاين، ياسمين؛ هايدكر، فلوريان. بيشار، مارتن؛ مريض يا برنهارد. فينجشيدت، تيم؛ زولنر، ج. ماريوس (2021). “وصف حالات الزاوية في القيادة الآلية: الأهداف والتحديات”. المؤتمر الدولي IEEE/CVF لعام 2021 حول ورش عمل الرؤية الحاسوبية (ICCVW) . ص  1023 – 1028. أرخايف : 2109.09607 . دوى :10.1109/ICCVW54120.2021.00119. رقم ISBN 978-1-6654-0191-3. S2CID  237572375.
  57. ^ هندريكس، دان؛ مازيكا، مانتاس؛ ديتريش، توماس (2019-01-28). "اكتشاف الشذوذ العميق باستخدام التعرض للقيم الشاذة". ICLR . arXiv : 1812.04606 .
  58. ^ وانغ ، هاوكي. لي، زيزونغ؛ فنغ، ليتونج؛ تشانغ واين (2022/03/21). “ViM: خارج التوزيع مع مطابقة السجل الافتراضي”. كفبر . أرخايف : 2203.10807 .
  59. ^ هندريكس، دان؛ جيمبل، كيفن (2018-10-03). "خط الأساس للكشف عن الأمثلة المصنفة بشكل خاطئ وخارج التوزيع في الشبكات العصبية". ICLR . arXiv : 1610.02136 .
  60. ^ أوربينا، فابيو؛ لينتزوس، فيليبا؛ إنفيرنيزي، سيدريك؛ إكينز، شون (2022). "الاستخدام المزدوج لاكتشاف الأدوية المدعمة بالذكاء الاصطناعي". نيتشر ماشين إنتيليجنس . 4 (3): 189– 191. doi :10.1038/s42256-022-00465-9. ISSN  2522-5839. PMC 9544280. PMID 36211133  . 
  61. ^ مركز الأمن والتكنولوجيا الناشئة؛ بوكانان، بن؛ لوهن، أندرو؛ موسر، ميكا؛ سيدوفا، كاترينا (2021). "الحقيقة والأكاذيب والأتمتة: كيف يمكن لنماذج اللغة تغيير التضليل". doi : 10.51593/2021ca003 . S2CID  240522878. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-28 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  62. ^ "قد تكون الدعاية كخدمة في الأفق إذا تم إساءة استخدام نماذج اللغة الكبيرة". VentureBeat . 2021-12-14. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-24 .
  63. ^ مركز الأمن والتكنولوجيا الناشئة؛ بوكانان، بن؛ بانسمر، جون؛ كاري، داكوتا؛ لوكاس، جاك؛ موسر، ميكا (2020). "أتمتة الهجمات السيبرانية: المبالغة والواقع". مركز الأمن والتكنولوجيا الناشئة . doi : 10.51593/2020ca002 . S2CID  234623943. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-28 .
  64. ^ "الدروس المستفادة بشأن سلامة وإساءة استخدام نماذج اللغة". OpenAI . 2022-03-03. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-24 .
  65. ^ ماركوف، تودور؛ تشانغ، تشونج؛ أجراوال، سانديني؛ إيلوندو، تينا؛ لي، تيدي؛ أدلر، ستيفن؛ جيانج، أنجيلا؛ وينج، ليليان (2022-08-10). "أدوات تعديل المحتوى الجديدة والمحسنة". OpenAI . مؤرشف من الأصل في 2023-01-11 . تم الاسترجاع 2022-11-24 .
  66. ^ ab Savage, Neil (2022-03-29). "اقتحام الصندوق الأسود للذكاء الاصطناعي". Nature . doi :10.1038/d41586-022-00858-1. PMID  35352042. S2CID  247792459. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-24 .
  67. ^ مركز الأمن والتكنولوجيا الناشئة؛ رودنر، تيم؛ تونر، هيلين (2021). "المفاهيم الأساسية في سلامة الذكاء الاصطناعي: قابلية التفسير في التعلم الآلي". PLOS ONE . doi : 10.51593/20190042 . S2CID  233775541. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-28 .
  68. ^ ماكفارلاند، مات (2018-03-19). "أوبر تسحب سيارات ذاتية القيادة بعد أول حادث مميت لمركبة ذاتية القيادة". CNNMoney . مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع في 2022-11-24 .
  69. ^ فيلدر، رايان مارشال (يوليو 2021). "التعامل مع مشكلة الصندوق الأسود: كيفية تبرير أنظمة الذكاء الاصطناعي في الرعاية الصحية". تقرير مركز هاستينجز . 51 (4): 38-45 . doi :10.1002/hast.1248. ISSN  0093-0334. PMID  33821471.
  70. ^ ab Doshi-Velez, Finale; Kortz, Mason; Budish, Ryan; Bavitz, Chris; Gershman, Sam; O'Brien, David; Scott, Kate; Schieber, Stuart; Waldo, James; Weinberger, David; Weller, Adrian; Wood, Alexandra (2019-12-20). "مساءلة الذكاء الاصطناعي بموجب القانون: دور التفسير". arXiv : 1711.01134 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  71. ^ فونغ، روث؛ فيدالدي، أندريا (2017). "تفسيرات قابلة للتفسير للصناديق السوداء من خلال الاضطراب ذي المعنى". مؤتمر معهد مهندسي الكهرباء والإلكترونيات الدولي لعام 2017 حول رؤية الكمبيوتر (ICCV) . ص.  3449– 3457. arXiv : 1704.03296 . doi :10.1109/ICCV.2017.371. ISBN 978-1-5386-1032-9. S2CID  1633753.
  72. ^ منغ، كيفن؛ باو، ديفيد؛ أندونيان، أليكس؛ بيلينكوف، يوناتان (2022). "تحديد وتحرير الارتباطات الواقعية في GPT". التطورات في أنظمة معالجة المعلومات العصبية . 35. arXiv : 2202.05262 .
  73. ^ باو، ديفيد؛ ليو ستيفن. وانغ، تونغتشو؛ تشو، جون يان؛ تورالبا ، أنطونيو (2020/07/30). “إعادة كتابة نموذج توليدي عميق”. اي سي سي في . أرخايف : 2007.15646 .
  74. ^ Räuker, Tilman; Ho, Anson; Casper, Stephen; Hadfield-Menell, Dylan (2022-09-05). "نحو الذكاء الاصطناعي الشفاف: دراسة استقصائية حول تفسير الهياكل الداخلية للشبكات العصبية العميقة". IEEE SaTML . arXiv : 2207.13243 .
  75. ^ باو، ديفيد؛ تشو، بولي؛ خوسلا، أديتيا؛ أوليفا، أود؛ تورالبا، أنطونيو (2017-04-19). "تشريح الشبكة: تحديد قابلية تفسير التمثيلات البصرية العميقة". CVPR . arXiv : 1704.05796 .
  76. ^ McGrath, Thomas; Kapishnikov, Andrei; Tomašev, Nenad; Pearce, Adam; Wattenberg, Martin; Hassabis, Demis; Kim, Been; Paquet, Ulrich; Kramnik, Vladimir (2022-11-22). "اكتساب المعرفة بالشطرنج في AlphaZero". وقائع الأكاديمية الوطنية للعلوم . 119 (47): e2206625119. arXiv : 2111.09259 . Bibcode :2022PNAS..11906625M. doi : 10.1073/pnas.2206625119 . ISSN  0027-8424. PMC 9704706. PMID 36375061  . 
  77. ^ Goh, Gabriel; Cammarata, Nick; Voss, Chelsea; Carter, Shan; Petrov, Michael; Schubert, Ludwig; Radford, Alec; Olah, Chris (2021). "الخلايا العصبية متعددة الوسائط في الشبكات العصبية الاصطناعية". Distill . 6 (3). doi : 10.23915/distill.00030 . S2CID  233823418.
  78. ^ أولاه، كريس؛ كاماراتا، نيك؛ شوبيرت، لودفيج؛ جوه، غابرييل؛ بيتروف، مايكل؛ كارتر، شان (2020). "التكبير: مقدمة للدوائر". ديستيل . 5 (3). doi : 10.23915/distill.00024.001 . S2CID  215930358.
  79. ^ كاماراتا، نيك؛ جو، غابرييل؛ كارتر، شان؛ فوس، تشيلسي؛ شوبرت، لودفيج؛ أولاه، كريس (2021). "دوائر المنحنيات". ديستيل . 6 (1). doi :10.23915/distill.00024.006 (غير نشط 1 نوفمبر 2024). مؤرشف من الأصل في 5 ديسمبر 2022. تم الاسترجاع 5 ديسمبر 2022 .{{cite journal}}:CS1 maint: DOI غير نشط اعتبارًا من نوفمبر 2024 ( الرابط )
  80. ^ أولسون، كاثرين؛ إلهاج، نيلسون؛ ناندا، نيل؛ جوزيف، نيكولاس؛ داس سارما، نوفا؛ هينيجان، توم؛ مان، بن؛ أسكيل، أماندا؛ باي، يونتاو؛ تشين، آنا؛ كونيرلي، توم؛ درين، داون؛ جانجولي، ديب؛ هاتفيلد-دودز، زاك؛ هيرنانديز، داني؛ جونستون، سكوت؛ جونز، آندي؛ كيرنيون، جاكسون؛ لوفيت، ليان؛ ندوس، كمال؛ أمودي، داريو؛ براون، توم؛ كلارك، جاك؛ كابلان، جاريد؛ ماكاندليش، سام؛ أولاه، كريس (2022). "التعلم في السياق ورؤوس الاستقراء". موضوع دوائر المحولات . arXiv : 2209.11895 .
  81. ^ أولاه، كريستوفر. "قابلية التفسير مقابل علم الأعصاب [ملاحظة أولية]". مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع في 2022-11-24 .
  82. ^ Gu, Tianyu; Dolan-Gavitt, Brendan; Garg, Siddharth (2019-03-11). "BadNets: تحديد نقاط الضعف في سلسلة توريد نموذج التعلم الآلي". arXiv : 1708.06733 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  83. ^ تشن، شين يون؛ ليو، تشانج؛ لي، بو؛ لو، كيمبرلي؛ سونغ، داون (2017-12-14). "هجمات خلفية مستهدفة على أنظمة التعلم العميق باستخدام تسميم البيانات". arXiv : 1712.05526 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  84. ^ كارليني، نيكولاس؛ تيرزيس، أندرياس (2022-03-28). "التسميم والتسلل إلى التعلم التبايني". ICLR . arXiv : 2106.09667 .
  85. ^ abcd Russell, Stuart J.; Norvig, Peter (2021). الذكاء الاصطناعي: نهج حديث (الطبعة الرابعة). بيرسون. ص. 5، 1003. ISBN  9780134610993تم الاسترجاع في 12 سبتمبر 2022 .
  86. ^ ab Ngo, Richard; Chan, Lawrence; Mindermann, Sören (2022). "مشكلة المحاذاة من منظور التعلم العميق". المؤتمر الدولي حول تمثيلات التعلم . arXiv : 2209.00626 .
  87. ^ ab Pan, Alexander; Bhatia, Kush; Steinhardt, Jacob (2022-02-14). تأثيرات تحديد المكافأة الخاطئ: رسم الخرائط وتخفيف النماذج غير المتوافقة. المؤتمر الدولي حول تمثيلات التعلم . تم الاسترجاع في 2022-07-21 .
  88. ^ تشوانغ، سيمون؛ هادفيلد-مينيل، ديلان (2020). "عواقب الذكاء الاصطناعي غير المتوافق". التقدم في أنظمة معالجة المعلومات العصبية . المجلد 33. شركة كوران أسوشيتس، ص  15763- 15773. تم الاسترجاع في 11 مارس 2023 .
  89. ^ كارلسميث، جوزيف (2022-06-16). "هل الذكاء الاصطناعي الباحث عن السلطة يشكل خطرًا وجوديًا؟". arXiv : 2206.13353 [cs.CY].
  90. ^ abc Russell, Stuart J. (2020). Human compatible: Artificial intelligence and the problem of control. Penguin Random House. ISBN 9780525558637. OCLC  1113410915.
  91. ^ كريستيان، برايان (2020). مشكلة المحاذاة: التعلم الآلي والقيم الإنسانية. دبليو دبليو نورتون آند كومباني. رقم ISBN 978-0-393-86833-3. OCLC  1233266753. مؤرشف من الأصل في 10 فبراير 2023. تم الاسترجاع 12 سبتمبر 2022 .
  92. ^ Langosco, Lauro Langosco Di; Koch, Jack; Sharkey, Lee D.; Pfau, Jacob; Krueger, David (2022-06-28). "التعميم الخاطئ للأهداف في التعلم التعزيزي العميق". وقائع المؤتمر الدولي التاسع والثلاثين حول التعلم الآلي . المؤتمر الدولي حول التعلم الآلي. PMLR. ص.  12004– 12019. تم الاسترجاع في 2023-03-11 .
  93. ^ ab Bommasani, Rishi; Hudson, Drew A.; Adeli, Ehsan; Altman, Russ; Arora, Simran; von Arx, Sydney; Bernstein, Michael S.; Bohg, Jeannette; Bosselut, Antoine; Brunskill, Emma; Brynjolfsson, Erik (2022-07-12). "حول الفرص والمخاطر في نماذج الأساس". Stanford CRFM . arXiv : 2108.07258 .
  94. ^ أويانغ، لونج؛ وو، جيف؛ جيانغ، شو؛ ألميدا، ديوجو؛ واينرايت، كارول إل؛ ميشكين، باميلا؛ تشانغ، تشونج؛ أجراوال، سانديني؛ سلاما، كاتارينا؛ راي، أليكس؛ شولمان، جيه؛ هيلتون، جاكوب؛ كيلتون، فريزر؛ ميلر، لوك إي؛ سيمينز، ماددي؛ أسكيل، أماندا؛ ويلندر، بي؛ كريستيانو، بي؛ ليك، جيه؛ لوي، رايان جيه (2022). "تدريب نماذج اللغة على اتباع التعليمات مع ردود الفعل البشرية". arXiv : 2203.02155 [cs.CL].
  95. ^ Zaremba, Wojciech; Brockman, Greg; OpenAI (2021-08-10). "OpenAI Codex". OpenAI . مؤرشف من الأصل في 3 فبراير 2023 . تم الاسترجاع 2022-07-23 .
  96. ^ كوبر، جينز؛ باجنيل، جيه أندرو؛ بيترز، جان (2013-09-01). "التعلم التعزيزي في الروبوتات: دراسة استقصائية". المجلة الدولية لأبحاث الروبوتات . 32 (11): 1238– 1274. doi :10.1177/0278364913495721. ISSN  0278-3649. S2CID  1932843. مؤرشف من الأصل في 15 أكتوبر 2022. تم الاسترجاع في 12 سبتمبر 2022 .
  97. ^ Knox, W. Bradley; Allievi, Alessandro; Banzhaf, Holger; Schmitt, Felix; Stone, Peter (2023-03-01). "التصميم المكافئ (الخاطئ) للقيادة الذاتية". الذكاء الاصطناعي . 316 : 103829. arXiv : 2104.13906 . doi : 10.1016/j.artint.2022.103829 . ISSN  0004-3702. S2CID  233423198.
  98. ^ ستراي، جوناثان (2020). "مواءمة تحسين الذكاء الاصطناعي مع رفاهية المجتمع". المجلة الدولية لرفاهية المجتمع . 3 (4): 443-463 . doi :10.1007/s42413-020-00086-3. ISSN  2524-5295. PMC 7610010. PMID 34723107.  S2CID 226254676  . 
  99. ^ راسل، ستيوارت؛ نورفيج، بيتر (2009). الذكاء الاصطناعي: نهج حديث. برنتيس هول. ص. 1003. ISBN 978-0-13-461099-3.
  100. ^ بنجيو ، يوشوا. هينتون، جيفري. ياو، أندرو؛ أغنية الفجر. أبيل، بيتر. هراري، يوفال نوح؛ تشانغ، يا تشين؛ شيويه، لان؛ شاليف شوارتز، شاي (2024). “إدارة مخاطر الذكاء الاصطناعي الشديدة وسط التقدم السريع”. علوم . 384 (6698): 842– 845. أرخايف : 2310.17688 . بيب كود :2024Sci...384..842B. دوى :10.1126/science.adn0117. بميد  38768279.
  101. ^ "بيان بشأن مخاطر الذكاء الاصطناعي | CAIS". www.safe.ai . تم الاسترجاع في 2024-02-11 .
  102. ^ جريس، كاتيا؛ ستيوارت، هارلان؛ ساندكولر، جوليا فابيان؛ توماس، ستيفن؛ وينشتاين-راون، بن؛ براونر، جان (2024-01-05). "آلاف مؤلفي الذكاء الاصطناعي حول مستقبل الذكاء الاصطناعي". arXiv : 2401.02843 [cs.CY].
  103. ^ سميث، كريج س. "جيف هينتون، الباحث الأكثر شهرة في مجال الذكاء الاصطناعي، يحذر من "التهديد الوجودي". فوربس . تم الاسترجاع في 2023-05-04 .
  104. ^ بيريجو، بيلي (2024-02-13). "رئيس الذكاء الاصطناعي في ميتا يان لوكان يتحدث عن الذكاء الاصطناعي العام والبرمجيات مفتوحة المصدر ومخاطر الذكاء الاصطناعي". تايم . تم الاسترجاع في 2024-06-26 .
  105. ^ abc أمودي، داريو؛ أولاه، كريس؛ شتاينهاردت، جاكوب؛ كريستيانو، بول؛ شولمان، جون؛ ماني، دان (2016-06-21). "مشاكل ملموسة في سلامة الذكاء الاصطناعي". arXiv : 1606.06565 [cs.AI].
  106. ^ ab Ortega, Pedro A.; Maini, Vishal; DeepMind safety team (2018-09-27). "Building safe artificial intelligence: specification, robustness, and insurance". DeepMind Safety Research – Medium . مؤرشف من الأصل في 10 فبراير 2023 . تم الاسترجاع في 2022-07-18 .
  107. ^ ab Rorvig, Mordechai (2022-04-14). "Researchers Gain New Understanding From Simple AI". مجلة كوانتا . مؤرشف من الأصل في 10 فبراير 2023. تم الاسترجاع 2022-07-18 .
  108. ^ Doshi-Velez, Finale; Kim, Been (2017-03-02). "نحو علم صارم للتعلم الآلي القابل للتفسير". arXiv : 1702.08608 [stat.ML].
    • ويبلين، روبرت (4 أغسطس 2021). "كريس أولاه يتحدث عن ما يحدث داخل الشبكات العصبية" (بودكاست). 80000 ساعة. رقم 107. تم الاسترجاع في 2022-07-23 .
  109. ^ راسل، ستيوارت؛ ديوي، دانييل؛ تيجمارك، ماكس (2015-12-31). "أولويات البحث للذكاء الاصطناعي القوي والمفيد". مجلة الذكاء الاصطناعي . 36 (4): 105-114 . arXiv : 1602.03506 . doi : 10.1609/aimag.v36i4.2577 . hdl : 1721.1/108478. ISSN  2371-9621. S2CID  8174496. مؤرشف من الأصل في 2 فبراير 2023. تم الاسترجاع في 12 سبتمبر 2022 .
  110. ^ Wirth, Christian; Akrour, Riad; Neumann, Gerhard; Fürnkranz, Johannes (2017). "دراسة استقصائية لأساليب التعلم التعزيزي القائمة على التفضيل". مجلة أبحاث التعلم الآلي . 18 (136): 1– 46.
  111. ^ كريستيانو، بول ف.؛ ليك، جان؛ براون، توم ب.؛ مارتيتش، ميلجان؛ ليج، شين؛ أمودي، داريو (2017). "التعلم المعزز العميق من التفضيلات البشرية". وقائع المؤتمر الدولي الحادي والثلاثين حول أنظمة معالجة المعلومات العصبية . NIPS'17. ريد هوك، نيويورك، الولايات المتحدة الأمريكية: شركة كوران أسوشيتس المحدودة، ص  4302-4310 . رقم ISBN 978-1-5108-6096-4.
  112. ^ Heaven, Will Douglas (2022-01-27). "النسخة الجديدة من GPT-3 أفضل بكثير (ويجب أن تكون أقل سمية)". MIT Technology Review . مؤرشف من الأصل في 10 فبراير 2023 . تم الاسترجاع 2022-07-18 .
  113. ^ محسني، سينا؛ وانغ، هاوتاو؛ يو، تشيدينج؛ شياو، تشاوي؛ وانغ، تشانغيانغ. ياداوا ، جاي (2022/03/07). “تصنيف سلامة التعلم الآلي: مسح وتمهيد”. أرخايف : 2106.04823 [cs.LG].
  114. ^ كليفتون، جيسي (2020). "التعاون والصراع والذكاء الاصطناعي التحويلي: أجندة بحثية". مركز المخاطر الطويلة الأجل . مؤرشف من الأصل في 1 يناير 2023. تم الاسترجاع 2022-07-18 .
    • دافو، ألان؛ باخراتش، يوروم؛ هادفيلد، جيليان؛ هورفيتز، إريك؛ لارسون، كيت؛ جرايبل، ثور (2021-05-06). "الذكاء الاصطناعي التعاوني: يجب أن تتعلم الآلات إيجاد أرضية مشتركة". نيتشر . 593 (7857): 33– 36. رمز Bibcode :2021Natur.593...33D. doi :10.1038/d41586-021-01170-0. ISSN  0028-0836. PMID  33947992. S2CID  233740521. مؤرشف من الأصل في 18 ديسمبر 2022. تم الاسترجاع في 12 سبتمبر 2022 .
  115. ^ Prunkl, Carina; Whittlestone, Jess (2020-02-07). "Beyond Near- and Long-Term". Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society . نيويورك نيويورك، الولايات المتحدة الأمريكية: ACM. ص.  138– 143. doi :10.1145/3375627.3375803. ISBN 978-1-4503-7110-0. S2CID  210164673. مؤرشف من الأصل في 16 أكتوبر 2022. تم الاسترجاع 12 سبتمبر 2022 .
  116. ^ إيرفينج، جيفري؛ أسكيل، أماندا (2019-02-19). "الذكاء الاصطناعي يحتاج إلى علماء اجتماعيين". ديستيل . 4 (2): 10.23915/distill.00014. doi : 10.23915/distill.00014 . ISSN  2476-0757. S2CID  159180422. مؤرشف من الأصل في 10 فبراير 2023. تم الاسترجاع في 12 سبتمبر 2022 .
  117. ^ جازوس، ألكسندروس؛ كان، جيمس؛ كوشي، إيزابيل؛ بوشر، كريستيان؛ جوتز، ماركوس (2025-04-01). "تنظيم الذكاء الاصطناعي من أجل السلامة: تحديد نقاط الضعف البنيوية لتوجيه تصميم الأنظمة الاجتماعية والتقنية المعززة بالذكاء الاصطناعي". علوم السلامة . 184 : 106731. doi : 10.1016/j.ssci.2024.106731 . ISSN  0925-7535.
  118. ^ abcd Zwetsloot, Remco; Dafoe, Allan (2019-02-11). "التفكير في المخاطر الناجمة عن الذكاء الاصطناعي: الحوادث وسوء الاستخدام والبنية". Lawfare . مؤرشف من الأصل في 2023-08-19 . تم الاسترجاع في 2022-11-24 .
  119. ^ Zhang, Yingyu; Dong, Chuntong; Guo, Weiqun; Dai, Jiabao; Zhao, Ziming (2022). "Systems theoretic accident model and process (STAMP): A literature review". Safety Science . 152 : 105596. doi :10.1016/j.ssci.2021.105596. S2CID  244550153. مؤرشف من الأصل في 2023-03-15 . تم الاسترجاع 2022-11-28 .
  120. ^ ab Gazos, Alexandros; Kahn, James; Kusche, Isabel; Büscher, Christian; Götz, Markus (2025-04-01). "تنظيم الذكاء الاصطناعي من أجل السلامة: تحديد نقاط الضعف البنيوية لتوجيه تصميم الأنظمة الاجتماعية والتقنية المعززة بالذكاء الاصطناعي". علوم السلامة . 184 : 106731. doi : 10.1016/j.ssci.2024.106731 . ISSN  0925-7535.
  121. ^ مركز الأمن والتكنولوجيا الناشئة؛ هوفمان، وايت (2021). "الذكاء الاصطناعي ومستقبل المنافسة السيبرانية". موجز إصدار CSET . doi : 10.51593/2020ca007 . S2CID  234245812. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع في 2022-11-28 .
  122. ^ غافني، روتي؛ ليفي، يائير (2024-01-01). "دور الذكاء الاصطناعي في تحسين كفاءة مهام الأمن السيبراني الفنية والإدارية". أمن المعلومات والحاسوب . 32 (5): 711-728 . doi :10.1108/ICS-04-2024-0102. ISSN  2056-4961.
  123. ^ مركز الأمن والتكنولوجيا الناشئة؛ إيمبري، أندرو؛ كانيا، إلسا (2019). "سلامة الذكاء الاصطناعي وأمنه واستقراره بين القوى العظمى: الخيارات والتحديات والدروس المستفادة من المشاركة البراجماتية". doi : 10.51593/20190051 . S2CID  240957952. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-28 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  124. ^ معهد مستقبل الحياة (2019-03-27). استراتيجية الذكاء الاصطناعي والسياسة والحوكمة (آلان دافو). حدث الحدث في الساعة 22:05. مؤرشف من الأصل في 2022-11-23 . تم الاسترجاع في 2022-11-23 .
  125. ^ Zou, Andy; Xiao, Tristan; Jia, Ryan; Kwon, Joe; Mazeika, Mantas; Li, Richard; Song, Dawn; Steinhardt, Jacob; Evans, Owain; Hendrycks, Dan (2022-10-09). "التنبؤ بأحداث العالم المستقبلية باستخدام الشبكات العصبية". NeurIPS . arXiv : 2206.15474 .
  126. ^ Gathani, Sneha; Hulsebos, Madelon; Gale, James; Haas, Peter J.; Demiralp, Çağatay (2022-02-08). "تعزيز عملية اتخاذ القرار من خلال تحليل ماذا لو التفاعلي". مؤتمر حول أبحاث أنظمة البيانات المبتكرة . arXiv : 2109.06160 .
  127. ^ ليندلوف، روي (2021)، أوسينجا، فرانس؛ سويس، تيم (المحررون)، "الردع النووي في العصر الخوارزمي: إعادة النظر في نظرية الألعاب"، المراجعة السنوية للدراسات العسكرية لعام 2020 ، NL Arms، لاهاي: TMC Asser Press، ص  421-436 ، doi : 10.1007/978-94-6265-419-8_22 ، ISBN 978-94-6265-418-1، S2CID  229449677
  128. ^ من تأليف نيوكيرك الثاني، فان ر. (2016-04-21). "هل تغير المناخ معضلة سجين أم صيد غزال؟". الأطلسي . مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع في 2022-11-24 .
  129. ^ أرمسترونج، ستيوارت؛ بوستروم، نيك؛ شولمان، كارل. السباق نحو الهاوية: نموذج لتطوير الذكاء الاصطناعي (تقرير). معهد مستقبل الإنسانية، جامعة أكسفورد.
  130. ^ أ. دافو، آلان. حوكمة الذكاء الاصطناعي: أجندة بحثية (تقرير). مركز حوكمة الذكاء الاصطناعي، معهد مستقبل البشرية، جامعة أكسفورد.
  131. ^ Dafoe, Allan; Hughes, Edward; Bachrach, Yoram; Collins, Tantum; McKee, Kevin R.; Leibo, Joel Z.; Larson, Kate; Graepel, Thore (2020-12-15). "المشاكل المفتوحة في الذكاء الاصطناعي التعاوني". NeurIPS . arXiv : 2012.08630 .
  132. ^ ab Dafoe, Allan; Bachrach, Yoram; Hadfield, Gillian; Horvitz, Eric; Larson, Kate; Graepel, Thore (2021). "الذكاء الاصطناعي التعاوني: يجب أن تتعلم الآلات إيجاد أرضية مشتركة". Nature . 593 (7857): 33– 36. Bibcode :2021Natur.593...33D. doi :10.1038/d41586-021-01170-0. PMID  33947992. S2CID  233740521. مؤرشف من الأصل في 2022-11-22 . تم الاسترجاع 2022-11-24 .
  133. ^ بندر، إي إم، جيبرو، تي، ماكميلان ميجور، أيه، وشميتشل، إس. (2021). حول مخاطر الببغاوات العشوائية: هل يمكن أن تكون نماذج اللغة كبيرة جدًا؟ 🦜. FAccT '21: وقائع مؤتمر ACM لعام 2021 حول العدالة والمساءلة والشفافية، 610-623. https://doi.org/10.1145/3442188.3445922.
  134. ^ ستروبيل، إي. وغانيش، أيه. ومكالوم، أيه. (2019). اعتبارات الطاقة والسياسة للتعلم العميق في معالجة اللغة الطبيعية. طبعة مسبقة من arXiv arXiv:1906.02243.
  135. ^ شوارتز، ر.، دودج، ج.، سميث، ن. أ.، وإتزيوني، أو. (2020). الذكاء الاصطناعي الأخضر. اتصالات رابطة مكائن ​​الحوسبة الآلية، 63(12)، 54-63. https://doi.org/10.1145/3442188.3445922.
  136. ^ ساتاريانو، آدم؛ سبيسي، ميغان (2023-11-01). "زعماء عالميون يحذرون من أن الذكاء الاصطناعي قد يسبب ضررًا "كارثيًا". نيويورك تايمز . ISSN  0362-4331 . تم الاسترجاع في 2024-04-20 .
  137. ^ كرافتس، نيكولاس (2021-09-23). ​​"الذكاء الاصطناعي كتكنولوجيا عامة الغرض: منظور تاريخي". مجلة أكسفورد للسياسة الاقتصادية . 37 (3): 521-536 . doi : 10.1093/oxrep/grab012 . ISSN  0266-903X. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع في 2022-11-28 .
  138. ^ 葉俶禎; 黃子君; 張媁雯; 賴志樫 (2020-12-01). “نزوح العمالة في عصر الذكاء الاصطناعي: مراجعة منهجية للأدبيات . 17 (2). دوى :10.6163/TJEAS.202012_17(2).0002. ردمك  1812-6243.
  139. ^ جونسون، جيمس (2019-04-03). "الذكاء الاصطناعي والحرب المستقبلية: الآثار المترتبة على الأمن الدولي". تحليل الدفاع والأمن . 35 (2): 147-169 . doi :10.1080/14751798.2019.1600800. ISSN  1475-1798. S2CID  159321626. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-28 .
  140. ^ كيرتيسوفا، كاتارينا (2018-12-12). "الذكاء الاصطناعي والمعلومات المضللة: كيف يغير الذكاء الاصطناعي الطريقة التي يتم بها إنتاج المعلومات المضللة ونشرها ويمكن مواجهتها". الأمن وحقوق الإنسان . 29 ( 1-4 ): 55-81 . doi : 10.1163/18750230-02901005 . ISSN  1874-7337. S2CID  216896677. مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-28 .
  141. ^ فيلدشتاين، ستيفن (2019). التوسع العالمي للمراقبة باستخدام الذكاء الاصطناعي . مؤسسة كارنيغي للسلام الدولي.
  142. ^ أجراوال، أجاي؛ جانز، جوشوا؛ جولدفارب، آفي (2019). اقتصاد الذكاء الاصطناعي: أجندة. شيكاغو، إلينوي. ISBN 978-0-226-61347-5. OCLC  1099435014. مؤرشف من الأصل في 2023-03-15 . تم الاسترجاع 2022-11-28 .{{cite book}}: CS1 maint: location missing publisher (link)
  143. ^ Whittlestone, Jess; Clark, Jack (2021-08-31). "لماذا وكيف ينبغي للحكومات مراقبة تطوير الذكاء الاصطناعي". arXiv : 2108.12427 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  144. ^ ab Shevlane, Toby (2022). "مشاركة نماذج الذكاء الاصطناعي القوية | مدونة GovAI". مركز حوكمة الذكاء الاصطناعي . مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع في 2022-11-24 .
  145. ^ Askell, Amanda; Brundage, Miles; Hadfield, Gillian (2019-07-10). "دور التعاون في تطوير الذكاء الاصطناعي المسؤول". arXiv : 1907.04534 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  146. ^ جورسوي، فوركان؛ كاكاديريس، يوانيس أ. (2022-08-31)، بطاقات النظام لاتخاذ القرارات القائمة على الذكاء الاصطناعي للسياسات العامة ، arXiv : 2203.04754
  147. ^ كوبي، جينيفر؛ لي، ميشيل سينج آه؛ سينغ، جاتيندر (2021-03-01). "صنع القرار الآلي القابل للمراجعة: إطار عمل للأنظمة الخوارزمية المسؤولة". وقائع مؤتمر جمعية آلات الحوسبة لعام 2021 حول العدالة والمساءلة والشفافية . FAccT '21. نيويورك، نيويورك، الولايات المتحدة الأمريكية: رابطة آلات الحوسبة. ص.  598- 609. doi : 10.1145/3442188.3445921 . ISBN 978-1-4503-8309-7.
  148. ^ راجي، إنيولوا ديبوراه؛ سمارت، أندرو؛ وايت، ريبيكا ن.؛ ميتشل، مارغريت؛ جيبرو، تيمنيت؛ هاتشينسون، بن؛ سميث-لاود، جميلة؛ ثيرون، دانييل؛ بارنز، باركر (2020-01-27). "سد فجوة المساءلة في مجال الذكاء الاصطناعي: تحديد إطار شامل للتدقيق الخوارزمي الداخلي". وقائع مؤتمر العدالة والمساءلة والشفافية لعام 2020. FAT* '20. نيويورك، نيويورك، الولايات المتحدة الأمريكية: رابطة آلات الحوسبة. ص.  33-44 . doi : 10.1145/3351095.3372873 . ISBN 978-1-4503-6936-7.
  149. ^ "NeMo Guardrails". NVIDIA NeMo Guardrails . تم الاسترجاع في 2024-12-08 .
  150. ^ "Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations". Meta AI . تم الاسترجاع في 2024-12-08 .
  151. ^ Šekrst, Kristina; McHugh, Jeremy; Cefalu, Jonathan Rodriguez (2024). "أخلاقيات الذكاء الاصطناعي من خلال التصميم: تنفيذ حواجز الحماية القابلة للتخصيص من أجل تطوير الذكاء الاصطناعي المسؤول". arXiv : 2411.14442 [cs.CY].
  152. ^ دونغ، يي؛ مو، رونغوي؛ جين، جاوجي؛ تشي، يي؛ هو، جينوي. تشاو، شينغ يو؛ منغ، جي. روان، وينجي؛ هوانغ، شياو وى (2024). “بناء حواجز الحماية لنماذج اللغات الكبيرة”. أرخايف : 2402.01822 [CS].
  153. ^ داليساندرو، و. (2024). "علم الأخلاق والذكاء الاصطناعي الآمن". دراسات فلسفية . doi : 10.1007/s11098-024-02174-y . تم الاسترجاع في 2024-12-06 .
  154. ^ تورتشين، أليكسي؛ دينش، ديفيد؛ جرين، برايان باتريك (2019). "الحلول العالمية مقابل الحلول المحلية لمشكلة سلامة الذكاء الاصطناعي". البيانات الضخمة والحوسبة المعرفية . 3 (16): 1-25 . doi : 10.3390/bdcc3010016 .
  155. ^ زيجلر، بارت (8 أبريل 2022). "هل حان الوقت لتنظيم الذكاء الاصطناعي؟". وول ستريت جورنال .
  156. ^ سميث، جون (15 مايو 2022). "الحوكمة العالمية للذكاء الاصطناعي: الفرص والتحديات". الجارديان .
  157. ^ زيجلر، بارت (8 أبريل 2022). "هل حان الوقت لتنظيم الذكاء الاصطناعي؟". وول ستريت جورنال . مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-24 .
  158. ^ ريد، كريس (2018-09-13). "كيف ينبغي لنا تنظيم الذكاء الاصطناعي؟". المعاملات الفلسفية للجمعية الملكية أ: العلوم الرياضية والفيزيائية والهندسية . 376 (2128): 20170360. رمز Bibcode : 2018RSPTA.37670360R. doi : 10.1098/rsta.2017.0360. ISSN  1364-503X. PMC 6107539. PMID 30082306  . 
  159. ^ بلتون، كيث ب. (2019-03-07). "كيف ينبغي تنظيم الذكاء الاصطناعي؟". IndustryWeek . مؤرشف من الأصل في 2022-01-29 . تم الاسترجاع 2022-11-24 .
  160. ^ لجنة الأمن القومي للذكاء الاصطناعي (2021)، التقرير النهائي
  161. ^ المعهد الوطني للمعايير والتكنولوجيا (2021-07-12). "إطار عمل إدارة مخاطر الذكاء الاصطناعي". المعهد الوطني للمعايير والتكنولوجيا . مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-24 .
  162. ^ ريتشاردسون، تيم (2021). "بريطانيا تنشر استراتيجية الذكاء الاصطناعي الوطنية لمدة 10 سنوات". مؤرشف من الأصل في 2023-02-10 . تم الاسترجاع 2022-11-24 .
  163. ^ "التوجيهات: الاستراتيجية الوطنية للذكاء الاصطناعي". GOV.UK. 2021. مؤرشف من الأصل في 2023-02-10 . تم الاسترجاع 2022-11-24 .
  164. ^ Hardcastle, Kimberley (2023-08-23). ​​"نحن نتحدث كثيرًا عن الذكاء الاصطناعي الآن - وليس الوقت مبكرًا جدًا". The Conversation . تم الاسترجاع في 2023-10-31 .
  165. ^ "حديقة بلتشلي الشهيرة تستضيف قمة سلامة الذكاء الاصطناعي في المملكة المتحدة في أوائل نوفمبر". GOV.UK . تم الاسترجاع في 2023-10-31 .
  166. ^ مكتب مدير الاستخبارات الوطنية، نشاط مشاريع البحوث المتقدمة في الاستخبارات. "IARPA – TrojAI". مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-24 .
  167. ^ Turek, Matt. "Explainable Artificial Intelligence". مؤرشف من الأصل في 2021-02-19 . تم الاسترجاع في 2022-11-24 .
  168. ^ درابر، بروس. "ضمان متانة الذكاء الاصطناعي ضد الخداع". وكالة مشاريع الأبحاث الدفاعية المتقدمة . مؤرشف من الأصل في 2023-01-09 . تم الاسترجاع في 2022-11-24 .
  169. ^ مؤسسة العلوم الوطنية (23 فبراير 2023). "الأنظمة الآمنة التي تدعم التعلم". مؤرشف من الأصل في 2023-02-26 . تم الاسترجاع 2023-02-27 .
  170. ^ "الجمعية العامة تعتمد قرارا تاريخيا بشأن الذكاء الاصطناعي". أخبار الأمم المتحدة . 21 مارس 2024. مؤرشف من الأصل في 20 أبريل 2024. اطلع عليه بتاريخ 21 أبريل 2024 .
  171. ^ Say, Mark (23 May 2024). "DSIT تعلن عن تمويل للأبحاث حول سلامة الذكاء الاصطناعي". مؤرشف من الأصل في 24 مايو 2024 . تم الاسترجاع 11 يونيو 2024 .
  172. ^ مانتيماكي، ماتي؛ مينكينن، ماتي؛ بيركستيدت، تيمو؛ فيليانين، ميكا (2022). “تحديد حوكمة الذكاء الاصطناعي التنظيمي”. الذكاء الاصطناعي والأخلاق . 2 (4): 603-609 . دوى : 10.1007 / s43681-022-00143-x . الترقيم الدولي  2730-5953. S2CID  247119668.
  173. ^ abc Brundage, Miles; Avin, Shahar; Wang, Jasmine; Belfield, Haydn; Krueger, Gretchen; Hadfield, Gillian; Khlaaf, Heidy; Yang, Jingying; Toner, Helen; Fong, Ruth; Maharaj, Tegan; Koh, Pang Wei; Hooker, Sara; Leung, Jade; Trask, Andrew (2020-04-20). "نحو تطوير الذكاء الاصطناعي الجدير بالثقة: آليات لدعم الادعاءات القابلة للتحقق". arXiv : 2004.07213 . {{cite journal}}: تتطلب المجلة الاستشهاد بها |journal=( مساعدة )
  174. ^ "مرحبًا بكم في قاعدة بيانات حوادث الذكاء الاصطناعي". مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-24 .
  175. ^ ويبلين، روبرت؛ هاريس، كيران (2022). "نوفا داس سارما حول سبب أهمية أمن المعلومات للتطوير الآمن لأنظمة الذكاء الاصطناعي". 80000 ساعة . مؤرشف من الأصل في 2022-11-24 . تم الاسترجاع 2022-11-24 .
  176. ^ OpenAI (2022-06-02). "أفضل الممارسات لنشر نماذج اللغة". OpenAI . مؤرشف من الأصل في 2023-03-15 . تم الاسترجاع 2022-11-24 .
  177. ^ OpenAI. "OpenAI Charter". OpenAI . مؤرشف من الأصل في 2021-03-04 . تم الاسترجاع 2022-11-24 .
  178. ^ معهد مستقبل الحياة (2016). "رسالة مفتوحة حول الأسلحة المستقلة: باحثون في مجال الذكاء الاصطناعي والروبوتات". معهد مستقبل الحياة . مؤرشف من الأصل في 2023-09-22 . تم الاسترجاع في 2022-11-24 .
  • المشاكل التي لم يتم حلها في مجال سلامة التعلم الآلي
  • حول فرص ومخاطر نماذج المؤسسات
  • نظرة عامة على مخاطر الذكاء الاصطناعي الكارثية
  • حوادث الذكاء الاصطناعي: تهديد ناشئ
  • هندسة عالم أكثر أمنا
Retrieved from "https://en.wikipedia.org/w/index.php?title=AI_safety&oldid=1267730494"
Original text
Rate this translation
Your feedback will be used to help improve Google Translate