التراجع الرمزي

شجرة التعبير كما يمكن استخدامها في الانحدار الرمزي لتمثيل دالة.

الانحدار الرمزي ( SR ) هو نوع من أنواع تحليل الانحدار الذي يبحث في فضاء التعبيرات الرياضية للعثور على النموذج الذي يناسب مجموعة بيانات معينة على أفضل وجه، من حيث الدقة والبساطة.

لا يُقدَّم نموذجٌ مُحدَّد كنقطة انطلاق للانحدار الرمزي. بدلاً من ذلك، تُشكَّل التعبيرات الأولية من خلال دمج عشوائي لبنات بناء رياضية، مثل المؤثرات الرياضية ، والدوال التحليلية ، والثوابت ، ومتغيرات الحالة . عادةً ما يُحدِّد المُشغِّل مجموعةً فرعيةً من هذه العناصر، ولكن هذا ليس شرطًا أساسيًا لهذه التقنية. وقد عُولجت مشكلة الانحدار الرمزي للدوال الرياضية باستخدام طُرقٍ مُتنوِّعة، بما في ذلك إعادة تركيب المعادلات باستخدام البرمجة الجينية في أغلب الأحيان [ 1 ] ، بالإضافة إلى طُرقٍ أحدث تستخدم الأساليب البايزية [ 2 ] والشبكات العصبية [ 3 ] . وهناك طريقة بديلة غير تقليدية للانحدار الرمزي تُسمى مُنشئ الدوال الشاملة (UFO)، والتي تتميّز بآليةٍ مختلفة، ومساحة بحث، واستراتيجية بناء مختلفة [ 4 ] . وتحاول طُرق أخرى، مثل التعلُّم الدقيق، تحويل مُشكلة المطابقة إلى مُشكلة عزوم في فضاء دوال طبيعي، وعادةً ما تُبنى حول تعميمات دالة ماير-جي [ 5 ] .

بفضل عدم اشتراط تحديد نموذج مسبقًا ، لا تتأثر تقنية الانحدار الرمزي بالتحيز البشري أو الثغرات غير المعروفة في المعرفة المتخصصة . فهي تسعى إلى الكشف عن العلاقات الجوهرية لمجموعة البيانات، من خلال السماح لأنماط البيانات نفسها بالكشف عن النماذج المناسبة، بدلاً من فرض بنية نموذجية تُعتبر قابلة للمعالجة الرياضية من وجهة نظر بشرية. تأخذ دالة اللياقة التي توجه تطور النماذج في الحسبان ليس فقط مقاييس الخطأ (لضمان دقة تنبؤ النماذج بالبيانات)، بل أيضًا مقاييس تعقيد خاصة، [ 6 ] مما يضمن أن تكشف النماذج الناتجة عن البنية الأساسية للبيانات بطريقة مفهومة من منظور بشري. هذا يُسهّل عملية الاستدلال ويزيد من فرص الحصول على رؤى حول نظام توليد البيانات، بالإضافة إلى تحسين قابلية التعميم وسلوك الاستقراء من خلال منع التجاوز في التخصيص . يمكن ترك الدقة والبساطة كهدفين منفصلين للانحدار - وفي هذه الحالة تشكل الحلول المثلى جبهة باريتو - أو يمكن دمجهما في هدف واحد عن طريق مبدأ اختيار النموذج مثل الحد الأدنى لطول الوصف .

لقد ثبت أن الانحدار الرمزي مسألة صعبة الحل من نوع NP . [ 7 ] ومع ذلك، إذا لم تكن المعادلة المطلوبة معقدة للغاية، فمن الممكن حل مسألة الانحدار الرمزي بدقة عن طريق توليد كل دالة ممكنة (مبنية من مجموعة محددة مسبقًا من المؤثرات) وتقييمها على مجموعة البيانات المعنية. [ 8 ]

الفرق عن الانحدار الكلاسيكي

بينما تسعى تقنيات الانحدار التقليدية إلى تحسين معلمات نموذج ذي بنية محددة مسبقًا، يتجنب الانحدار الرمزي فرض افتراضات مسبقة، ويستنتج النموذج من البيانات. بعبارة أخرى، يحاول اكتشاف كل من بنية النموذج ومعلماته.

يُعاب على هذا النهج اتساع نطاق البحث فيه، إذ لا يقتصر الأمر على كون نطاق البحث في الانحدار الرمزي لانهائيًا، بل يشمل أيضًا وجود عدد لا نهائي من النماذج التي تُناسب مجموعة بيانات محدودة تمامًا (شريطة عدم تقييد تعقيد النموذج بشكل مصطنع). هذا يعني أن خوارزمية الانحدار الرمزي قد تستغرق وقتًا أطول لإيجاد نموذج ومعاملات مناسبة مقارنةً بتقنيات الانحدار التقليدية. يمكن التخفيف من هذا العيب بتقييد مجموعة العناصر الأساسية المُقدمة للخوارزمية، استنادًا إلى المعرفة المتوفرة عن النظام الذي أنتج البيانات؛ ولكن في النهاية، يُعد استخدام الانحدار الرمزي قرارًا يجب الموازنة بينه وبين مدى معرفتنا بالنظام الأساسي.

مع ذلك، تتميز هذه الخاصية للانحدار الرمزي بمزاياها أيضًا: نظرًا لأن الخوارزمية التطورية تتطلب تنوعًا لاستكشاف فضاء البحث بفعالية، فمن المرجح أن تكون النتيجة مجموعة مختارة من النماذج ذات الأداء العالي (ومجموعات معاييرها المقابلة). ويمكن أن يوفر فحص هذه المجموعة فهمًا أعمق للعملية الأساسية، ويتيح للمستخدم تحديد تقريب يلبي احتياجاته بشكل أفضل من حيث الدقة والبساطة.

المقارنة المعيارية

SRBench

في عام 2021، طُرح معيار SRBench [ 9 ] كمعيار شامل للانحدار الرمزي. عند إطلاقه، ضمّ SRBench أربعة عشر أسلوبًا للانحدار الرمزي، وسبعة أساليب أخرى للتعلم الآلي، و252 مجموعة بيانات من قاعدة بيانات PMLB . يهدف هذا المعيار إلى أن يكون مشروعًا حيويًا، إذ يشجع على تقديم التحسينات ومجموعات البيانات الجديدة والأساليب المبتكرة، لمواكبة أحدث التطورات في مجال الانحدار الرمزي.

مسابقة SRBench 2022

في عام 2022، أعلنت منصة SRBench عن مسابقة "الانحدار الرمزي القابل للتفسير لعلوم البيانات"، والتي عُقدت في مؤتمر GECCO في بوسطن، ماساتشوستس. تنافست تسع من أبرز خوارزميات الانحدار الرمزي في هذه المسابقة على مجموعة جديدة من مسائل البيانات، مع مراعاة معايير تقييم مختلفة. نُظمت المسابقة في مسارين: مسار اصطناعي ومسار بيانات واقعية. [ 10 ]

مسار صناعي

في المسار التركيبي، قورنت الطرق وفقًا لخمس خصائص: إعادة اكتشاف التعبيرات الدقيقة؛ اختيار الميزات؛ مقاومة الحلول المثلى المحلية؛ الاستقراء؛ والحساسية للضوضاء. وكانت تصنيفات الطرق كالتالي:

  1. كيو لاتيس
  2. PySR (الانحدار الرمزي في بايثون)
  3. uDSR (التحسين الرمزي العميق)

مسار العالم الحقيقي

في المسار العملي، تم تدريب أساليب لبناء نماذج تنبؤية قابلة للتفسير لتوقع أعداد حالات الإصابة بفيروس كوفيد-19، وحالات دخول المستشفيات، والوفيات في ولاية نيويورك خلال 14 يومًا. وقد راجع هذه النماذج خبير متخصص، وتم منحها تصنيفات موثوقية، وتقييم دقتها وبساطتها. وكان ترتيب الأساليب كالتالي:

  1. uDSR (التحسين الرمزي العميق)
  2. كيو لاتيس
  3. المحرك الجيني (Genetic Engine)

أساليب غير قياسية

تمنع معظم خوارزميات الانحدار الرمزي التضخم التوافقي من خلال تطبيق خوارزميات تطورية تعمل على تحسين التعبير الأمثل بشكل متكرر عبر أجيال عديدة. وقد اقترح الباحثون مؤخرًا خوارزميات تستخدم أساليب أخرى في مجال الذكاء الاصطناعي .

قام سيلفيو ماريان أودريسكو وماكس تيغمارك بتطوير خوارزمية "AI Feynman" [ 11 ] [ 12 ] ، والتي تحاول إجراء الانحدار الرمزي من خلال تدريب شبكة عصبية لتمثيل الدالة المجهولة، ثم تجري اختبارات على الشبكة العصبية لمحاولة تقسيم المشكلة إلى أجزاء أصغر. على سبيل المثال، إذاو(x1،...،xأنا،xأنا+1،...،xن)=ز(x1،...،xأنا)+ح(xأنا+1،...،xن){\displaystyle f(x_{1},...,x_{i},x_{i+1},...,x_{n})=g(x_{1},...,x_{i})+h(x_{i+1},...,x_{n})}يمكن للاختبارات التي تُجرى على الشبكة العصبية أن تتعرف على الفصل وتشرع في حله.ز{\displaystyle g}وح{\displaystyle h}بشكل منفصل وباستخدام متغيرات مختلفة كمدخلات. هذا مثال على أسلوب فرق تسد ، الذي يقلل حجم المشكلة لتصبح أكثر قابلية للإدارة. كما يقوم برنامج AI Feynman بتحويل مدخلات ومخرجات الدالة المجهولة لإنتاج دالة جديدة يمكن حلها بتقنيات أخرى، ويُجري تحليلًا بُعديًا لتقليل عدد المتغيرات المستقلة. تمكّن البرنامج من "اكتشاف" 100 معادلة من محاضرات فاينمان في الفيزياء ، بينما لم يتمكن برنامج Eureqa الرائد، الذي يستخدم الخوارزميات التطورية، من حل سوى 71 معادلة. على عكس أساليب الانحدار الرمزي التقليدية، يتطلب برنامج AI Feynman مجموعة بيانات ضخمة جدًا لتدريب الشبكة العصبية أولًا، وهو بطبيعته يميل إلى المعادلات الشائعة في الفيزياء الأساسية.

انظر أيضاً

مراجع

  1. مايكل شميدت؛ هود ليبسون (2009). "استخلاص القوانين الطبيعية الحرة من البيانات التجريبية" . مجلة ساينس . 324 (5923) . الجمعية الأمريكية لتقدم العلوم: 81-85 . Bibcode : 2009Sci...324...81S . CiteSeerX 10.1.1.308.2245 . doi : 10.1126/science.1165893 . PMID 19342586. S2CID 7366016 .   
  2. ^ ينغ جين. ويلين فو؛ جيان كانغ؛ جيادونغ قوه؛ جيان قوه (2019). “الانحدار الرمزي بايزي”. أرخايف : 1910.08892 [ stat.ME ].
  3. 1 2 سيلفيو-ماريان أودريسكو؛ ماكس تيغمارك (2020). "AI Feynman: طريقة مستوحاة من الفيزياء للانحدار الرمزي" . Science_Advances . 6 ( 16) eaay2631. الجمعية الأمريكية لتقدم العلوم. arXiv : 1905.11481 . Bibcode : 2020SciA....6.2631U . doi : 10.1126/sciadv.aay2631 . PMC 7159912. PMID 32426452 .  
  4. علي ر. الرومي؛ محمد إ. الهواري (2020). "مبتكر الدوال الشاملة" . الحوسبة اللينة التطبيقية . 94 106417. دار النشر Elsevier BV. doi : 10.1016/j.asoc.2020.106417 . ISSN 1568-4946 . S2CID 219743405 .  
  5. بينيديكت دبليو جيه إيروين (2021). "تمثيل طبيعي للدوال من أجل التعلم الدقيق" (ملف PDF) (نسخة أولية). doi : 10.21203/rs.3.rs-149856/v1 . S2CID 234014141 . 
  6. إيكاترينا ج. فلاديسلافليفا؛ غيدو ف. سميتس؛ ديك دين هيرتوغ (2009). "رتبة اللاخطية كمقياس للتعقيد للنماذج المولدة بواسطة الانحدار الرمزي عبر برمجة باريتو الجينية" (ملف PDF) . معاملات IEEE في الحوسبة التطورية . 13 (2): 333-349 . Bibcode : 2009ITEC...13..333V . doi : 10.1109/tevc.2008.926486 . S2CID 12072764 . 
  7. فيرجولين، ماركو؛ بيسيس، سولون ب. (2022). "الانحدار الرمزي مسألة صعبة من نوع NP" . معاملات بحوث التعلم الآلي . arXiv : 2207.01018 .
  8. بارتليت، ديجلان؛ ديزموند، هاري؛ فيريرا، بيدرو (2023). "الانحدار الرمزي الشامل". معاملات IEEE في الحوسبة التطورية . 28 (4): 1. arXiv : 2211.11461 . doi : 10.1109/TEVC.2023.3280250 . S2CID 253735380 . 
  9. لا كافا، ويليام؛ أورزيكوفسكي، باتريك؛ بورلاكو، بوغدان؛ دي فرانكا، فابريسيو؛ فيرغولين، ماركو؛ جين، يينغ؛ كوميندا، مايكل؛ مور، جيسون (2021). "أساليب الانحدار الرمزي المعاصرة وأداؤها النسبي" . وقائع مسار أنظمة معالجة المعلومات العصبية حول مجموعات البيانات والمعايير . 1. arXiv : 2107.14351 .
  10. ^ مايكل كوميندا. وليام لا كافا؛ ميمونة ماجومدر؛ فابريسيو أوليفيتي دي فرانسا؛ ماركو فيرجولين. "مسابقة SRBench 2022: الانحدار الرمزي القابل للتفسير لعلم البيانات" .
  11. أودريسكو، سيلفيو-ماريان؛ تيغمارك، ماكس (17 أبريل 2020). "AI Feynman: طريقة مستوحاة من الفيزياء للانحدار الرمزي" . مجلة ساينس أدفانسز . 6 (16) eaay2631. arXiv : 1905.11481 . Bibcode : 2020SciA....6.2631U . doi : 10.1126/sciadv.aay2631 . ISSN 2375-2548 . PMC 7159912. PMID 32426452 .   
  12. أودريسكو، سيلفيو-ماريان؛ تان، أندرو؛ فينغ، جياهاي؛ نيتو، أوريسفالدو؛ وو، تايلين؛ تيغمارك، ماكس (2020-12-16). "الذكاء الاصطناعي فاينمان 2.0: الانحدار الرمزي الأمثل لباريتو الذي يستغل نمطية الرسم البياني". arXiv : 2006.10782 [ cs.LG ].

للمزيد من القراءة