robots.txt

بروتوكول استبعاد الروبوتات (يشار إليه غالبًا باسم الملف المستخدم لتنفيذه، robots.txt ) هو معيار تستخدمه مواقع الويب للإشارة إلى برامج زحف الويب وبرامج الروبوت الأخرى التي يُسمح لها بزيارة أجزاء من موقع الويب.

يعتمد هذا المعيار، الذي طُوّر عام ١٩٩٤، على الامتثال الطوعي . يمكن للبرامج الضارة استخدام ملف robots.txt كدليل للصفحات التي يجب زيارتها، مع أن هيئات وضع المعايير لا تشجع على مواجهة ذلك بتقنيات التعتيم الأمني . تتجاهل بعض مواقع الأرشفة ملف robots.txt. استُخدم هذا المعيار في التسعينيات للتخفيف من ضغط الخوادم . وفي العقد الثاني من القرن الحادي والعشرين، بدأت المواقع الإلكترونية بحظر البرامج التي تجمع معلومات لأنظمة الذكاء الاصطناعي التوليدي .

يمكن استخدام ملف "robots.txt" بالتزامن مع خرائط المواقع ، وهو معيار آخر لإدراج الروبوتات في مواقع الويب.

تاريخ

اقترح مارتين كوستر المعيار [ 1 ] [ 2 ] أثناء عمله لدى شركة نيكسور [ 3 ] في فبراير 1994 [ 4 ] عبر قائمة بريد www-talk ، وهي قناة التواصل الرئيسية للأنشطة المتعلقة بشبكة الويب العالمية آنذاك. ويزعم تشارلز ستروس أنه حثّ كوستر على اقتراح ملف robots.txt، بعد أن كتب برنامج زحف ويب سيئ السلوك تسبب دون قصد في هجوم حجب الخدمة على خادم كوستر. [ 5 ]

سمح المعيار، الذي كان يُعرف في البداية باسم RobotsNotWanted.txt، لمطوري الويب بتحديد البرامج الآلية التي لا ينبغي لها الوصول إلى مواقعهم الإلكترونية أو الصفحات التي لا ينبغي لها الوصول إليها. كان الإنترنت صغيرًا بما يكفي في عام 1994 للاحتفاظ بقائمة كاملة بجميع البرامج الآلية؛ وكان اكتظاظ الخوادم مصدر قلق رئيسي. وبحلول يونيو 1994، أصبح معيارًا فعليًا ؛ [ 6 ] والتزمت به معظم المواقع، بما في ذلك تلك التي تُشغلها محركات البحث مثل WebCrawler و Lycos و AltaVista . [ 7 ]

في الأول من يوليو/تموز 2019، أعلنت جوجل عن اقتراح بروتوكول استبعاد الروبوتات كمعيار رسمي ضمن فريق عمل هندسة الإنترنت . [ 8 ] ونُشر معيار مقترح [ 9 ] في سبتمبر/أيلول 2022 تحت مسمى RFC 9309.

معيار

يضع مالك الموقع الذي يرغب في إعطاء تعليمات لبرامج الزحف ملفًا نصيًا باسم robots.txt في جذر هيكل الموقع (مثلاً: https://www.example.com/robots.txt ). يحتوي هذا الملف على التعليمات بتنسيق محدد (انظر الأمثلة أدناه). تحاول برامج الزحف التي تختار اتباع هذه التعليمات جلب هذا الملف وقراءة التعليمات قبل جلب أي ملف آخر من الموقع . إذا لم يكن هذا الملف موجودًا، تفترض برامج الزحف أن مالك الموقع لا يرغب في وضع أي قيود على زحف الموقع بأكمله.

يحتوي ملف robots.txt على تعليمات للبرامج الآلية (البوتات) تُحدد صفحات الويب التي يُمكنها الوصول إليها وتلك التي لا يُمكنها الوصول إليها. وتُعد ملفات robots.txt ذات أهمية خاصة لبرامج زحف الويب التابعة لمحركات البحث مثل جوجل.

يعمل ملف robots.txt على موقع ويب كطلبٍ لروبوتات مُحددة لتجاهل ملفات أو مجلدات مُعينة أثناء فهرسة الموقع. قد يكون ذلك، على سبيل المثال، رغبةً في الحفاظ على خصوصية الموقع من نتائج محركات البحث، أو اعتقادًا بأن محتوى المجلدات المُختارة قد يكون مُضللًا أو غير ذي صلة بتصنيف الموقع ككل، أو رغبةً في أن يعمل تطبيقٌ ما على بيانات مُحددة فقط. مع ذلك، يُمكن أن تظهر الروابط إلى الصفحات المُدرجة في ملف robots.txt في نتائج البحث إذا كانت مرتبطةً بصفحةٍ يتم فهرستها. [ 10 ]

يغطي ملف robots.txt نطاقًا واحدًا . بالنسبة للمواقع الإلكترونية ذات النطاقات الفرعية المتعددة ، يجب أن يكون لكل نطاق فرعي ملف robots.txt خاص به. فإذا كان لدى example.com ملف robots.txt بينما لا يملك foo.example.com ملفًا، فإن القواعد التي تنطبق على example.com لا تنطبق على foo.example.com . إضافةً إلى ذلك، يحتاج كل مخطط URI ومنفذ إلى ملف robots.txt خاص به؛ فملف http://example.com/robots.txt لا ينطبق على الصفحات الموجودة ضمن http://example.com:8080/ أو https://example.com/ .

امتثال

يلتزم مشغلو الروبوتات على نطاق واسع ببروتوكول robots.txt. [ 6 ]

لعب ملف robots.txt دورًا في القضية القانونية التي رفعتها eBay ضد Bidder's Edge عام 1999 ، [ 11 ] حيث حاولت eBay حظر برنامج آلي لم يلتزم بملف robots.txt، وفي مايو 2000، أمرت المحكمة الشركة المشغلة للبرنامج الآلي بالتوقف عن فهرسة خوادم eBay باستخدام أي وسيلة آلية، وذلك بموجب أمر قضائي استنادًا إلى التعدي على الملكية الفكرية . [ 12 ] [ 13 ] [ 11 ] استأنفت Bidder's Edge الحكم، لكنها وافقت في مارس 2001 على إسقاط الاستئناف، ودفع مبلغ لم يُفصح عنه لـ eBay، والتوقف عن الوصول إلى معلومات مزادات eBay. [ 14 ] [ 15 ]

في عام ٢٠٠٧، في قضية "مدافعو الرعاية الصحية ضد هاردينغ" ، رُفعت دعوى قضائية ضد شركة بسبب وصولها إلى صفحات ويب محمية مؤرشفة عبر " آلة الزمن" (The Wayback Machine )، على الرغم من قواعد ملف robots.txt التي منعت أرشفة تلك الصفحات. قضت محكمة بنسلفانيا بأن "ملف robots.txt في هذه الحالة يُعد إجراءً تقنيًا" بموجب قانون الألفية الرقمية لحقوق المؤلف (DMCA) . ونظرًا لعطل في "أرشيف الإنترنت" (Internet Archive)، تمكنت هاردينغ من الوصول مؤقتًا إلى هذه الصفحات من الأرشيف، وبالتالي رأت المحكمة أن "شركة هاردينغ لم تتحايل على الإجراء الوقائي". [ ١٦ ] [ ١٧ ] [ ١٨ ]

في عام ٢٠١٣، رفعت وكالة أسوشيتد برس دعوى قضائية ضد شركة ميلتووتر يو إس هولدينغز بتهمة انتهاك حقوق النشر والاستيلاء غير المشروع على مواد إخبارية تابعة لها. زعمت ميلتووتر أنها لا تحتاج إلى ترخيص وأن استخدامها يندرج ضمن الاستخدام العادل ، لأن المحتوى متاح مجانًا وغير محمي بموجب بروتوكول robots.txt. وفي مارس ٢٠١٣، قضت المحكمة بأن "نسخ ميلتووتر لا يندرج ضمن مبدأ الاستخدام العادل"، مشيرةً من بين عدة عوامل إلى أن "عدم تطبيق بروتوكول robots.txt لا يمنح ميلتووتر ترخيصًا لنسخ ونشر محتوى أسوشيتد برس". [ ١٩ ]

محرك البحث

تتضمن بعض محركات البحث الرئيسية التي تتبع هذا المعيار جوجل ، [ 20 ] بينج ، [ 21 ] ياهو[ 22 ] ياندكس ، [ 23 ] دك دك جو ، [ 24 ] بايدو ، [ 25 ] إيه أو إل ، [ 26 ] آسك ، [ 27 ] وكاجي ، [ 28 ]

المواقع الأرشيفية

تتجاهل بعض مشاريع أرشفة الويب ملف robots.txt. يستخدم فريق الأرشيف هذا الملف لاكتشاف المزيد من الروابط، مثل خرائط المواقع . [ 29 ] صرّح المؤسس المشارك، جيسون سكوت، بأن "ملف robots.txt، إذا تُرك دون فحص، يضمن عدم وجود نسخ أو مراجع للعناصر التي قد يكون لها استخدام ومعنى عام يتجاوز سياق الموقع الإلكتروني." [ 30 ] في عام 2017، أعلن أرشيف الإنترنت أنه سيتوقف عن الامتثال لتوجيهات robots.txt. [ 31 ] [ 6 ] وفقًا لموقع Digital Trends ، جاء ذلك عقب الاستخدام الواسع النطاق لملف robots.txt لإزالة المواقع التاريخية من نتائج محركات البحث، وهو ما يتناقض مع هدف المنظمة غير الربحية المتمثل في أرشفة "لقطات" من الإنترنت كما كان موجودًا سابقًا. [ 32 ]

الذكاء الاصطناعي

ابتداءً من العقد الثاني من القرن الحادي والعشرين، بدأ مُشغّلو المواقع الإلكترونية باستخدام ملف robots.txt لمنع وصول برامج الروبوت التي تجمع بيانات التدريب للذكاء الاصطناعي التوليدي . في عام 2023، وجدت شركة Originality.AI أن 306 من بين أكثر ألف موقع زيارةً حظرت برنامج GPTBot التابع لشركة OpenAI في ملف robots.txt الخاص بها، بينما حظر 85 موقعًا برنامج Google-Extended التابع لشركة جوجل . وقد نصّت العديد من ملفات robots.txt على أن GPTBot هو برنامج الروبوت الوحيد المحظور صراحةً على جميع الصفحات. وكان منع الوصول إلى GPTBot شائعًا بين مواقع الأخبار مثل BBC ونيويورك تايمز . في عام 2023، أعلنت منصة Medium ، وهي منصة استضافة المدونات ، أنها ستمنع الوصول إلى جميع برامج زحف الويب التي تعمل بالذكاء الاصطناعي، مُعلّلةً ذلك بأن "شركات الذكاء الاصطناعي قد استنزفت قيمة الكُتّاب من أجل إغراق قُرّاء الإنترنت بالرسائل المزعجة". [ 6 ]

يلتزم برنامج GPTBot بمعيار robots.txt ويُقدّم نصائح لمشغلي المواقع الإلكترونية حول كيفية حظره، لكن ديفيد بيرس من موقع The Verge ذكر أن هذا لم يبدأ إلا بعد "تدريب النماذج الأساسية التي جعلته بهذه القوة". كما أن بعض برامج الروبوت تُستخدم لمحركات البحث والذكاء الاصطناعي معًا، وقد يكون من المستحيل حظر أحد هذين الخيارين فقط. [ 6 ] وأفادت 404 Media أن شركات مثل Anthropic و Perplexity.ai تحايلت على ملف robots.txt عن طريق إعادة تسمية برامج استخراج البيانات أو إنشاء برامج جديدة لاستبدال تلك التي ظهرت في قوائم الحظر الشائعة . [ 33 ]

في عام 2025، أعلنت منظمة RSL Collective غير الربحية عن إطلاق معيار ترخيص المحتوى المفتوح Really Simple Licensing (RSL)، الذي يسمح لناشري المواقع الإلكترونية بتحديد شروط استخدام برامج الروبوت التي تعمل بالذكاء الاصطناعي في ملفات robots.txt الخاصة بهم. وشملت الشركات المشاركة عند الإطلاق Medium و Reddit و Yahoo . [ 34 ] [ 35 ] [ 36 ]

حماية

على الرغم من استخدام مصطلحي "السماح" و "المنع" ، فإن البروتوكول استشاري بحت ويعتمد على امتثال روبوتات الويب ؛ ولا يمكنه فرض أي شيء مما هو مذكور في الملف. [ 37 ] من غير المرجح أن تحترم روبوتات الويب الخبيثة ملف robots.txt؛ بل قد يستخدم بعضها هذا الملف كدليل للعثور على الروابط المحظورة والوصول إليها مباشرةً. وبينما يُزعم أحيانًا أن هذا يشكل خطرًا أمنيًا، [ 38 ] فإن هذا النوع من الأمن عن طريق التعتيم غير مُشجع من قِبل هيئات التقييس. ويوصي المعهد الوطني للمعايير والتكنولوجيا (NIST) في الولايات المتحدة تحديدًا بعدم اتباع هذه الممارسة: "لا ينبغي أن يعتمد أمن النظام على سرية التنفيذ أو مكوناته". [ 39 ] وفي سياق ملفات robots.txt، لا يُنصح باستخدام الأمن عن طريق التعتيم كتقنية أمنية. [ 40 ]

البدائل

تقوم العديد من برامج الروبوت أيضًا بتمرير وكيل مستخدم خاص إلى خادم الويب عند جلب المحتوى. [ 41 ] كما يمكن لمسؤول الويب تهيئة الخادم لإرجاع رسالة فشل تلقائيًا (أو تمرير محتوى بديل ) عند اكتشاف اتصال باستخدام أحد برامج الروبوت. [ 42 ] [ 43 ]

تستضيف بعض المواقع، مثل جوجلhumans.txt ، ملفًا يعرض معلومات مخصصة للقراءة البشرية. [ 44 ] بينما تقوم مواقع أخرى، مثل جيت هاب، بإعادة توجيه ملف humans.txt إلى صفحة " نبذة عنا" . [ 45 ]

في السابق، كان لدى جوجل ملف مزحة مستضاف على موقع /killer-robots.txtإلكتروني يوجه فيه "المدمر" بعدم قتل مؤسسي الشركة لاري بيج وسيرجي برين . [ 46 ] [ 47 ]

أمثلة

يخبر هذا المثال جميع الروبوتات أنه يمكنها زيارة جميع الملفات لأن الحرف العام *يمثل جميع الروبوتات والتوجيه Disallowليس له قيمة، مما يعني عدم وجود صفحات محظورة.

وكيل المستخدم: * ممنوع: 

هذا المثال له نفس التأثير، حيث يسمح بجميع الملفات بدلاً من منع أي منها.

وكيل المستخدم: * يسمح: / 

يمكن تحقيق النتيجة نفسها باستخدام ملف robots.txt فارغ أو مفقود.

هذا المثال يطلب من جميع الروبوتات عدم دخول موقع الويب:

وكيل المستخدم: * ممنوع: / 

يوضح هذا المثال لجميع الروبوتات عدم دخول ثلاثة مجلدات:

وكيل المستخدم: * ممنوع: /cgi-bin/ ممنوع: /tmp/ ممنوع: /junk/ 

يوضح هذا المثال لجميع الروبوتات ضرورة الابتعاد عن ملف محدد:

وكيل المستخدم: * ممنوع: /directory/file.html 

ستتم معالجة جميع الملفات الأخرى الموجودة في الدليل المحدد.

مثال يوضح كيفية استخدام التعليقات:

# تظهر التعليقات بعد رمز "#" في بداية السطر، أو بعد التوجيه. User-agent: * # مطابقة جميع الروبوتات ممنوع: / # امنعهم من الدخول 

يوضح هذا المثال لروبوت معين ضرورة البقاء خارج موقع ويب:

User-agent: BadBot # استبدل 'BadBot' بوكيل المستخدم الفعلي للروبوت ممنوع: / 

يوضح هذا المثال لروبوتين محددين عدم دخول دليل محدد واحد:

User-agent: BadBot # استبدل 'BadBot' بوكيل المستخدم الفعلي للروبوت وكيل المستخدم: Googlebot ممنوع: /private/ 

من الممكن أيضًا إدراج عدة روبوتات بقواعدها الخاصة. ويُحدد برنامج الزحف سلسلة الروبوت الفعلية. تدعم بعض مشغلي الروبوتات، مثل جوجل ، عدة سلاسل لوكيل المستخدم، مما يسمح للمشغل بمنع الوصول إلى مجموعة فرعية من خدماته باستخدام سلاسل وكيل مستخدم محددة. [ 20 ]

مثال يوضح استخدام عدة وكلاء مستخدمين:

User-agent: googlebot # جميع خدمات جوجل ممنوع الوصول إلى: /private/ # منع الوصول إلى هذا المجلد User-agent: googlebot-news # خدمة الأخبار فقط ممنوع: / # منع كل شيء وكيل المستخدم: * # أي روبوت ممنوع: /شيء/ # منع هذا الدليل 

استخدام الرمز * في القواعد

يحظر هذا التوجيه Disallow: /something/جميع الملفات والمجلدات الفرعية التي تبدأ بـ /something/.

في المقابل، يسمح استخدام الأحرف البديلة (إذا كان برنامج الزحف يدعمها) بأنماط أكثر تعقيدًا في تحديد المسارات والملفات التي يُسمح أو يُمنع الزحف إليها، على سبيل المثال Disallow: /something/*/otherحظر عناوين URL مثل:

/شيء/طعام/آخر /شيء/بار/أخرى 

لن يمنع ذلك زحف /something/foo/else، لأن ذلك لن يتطابق مع النمط.

تتيح الأحرف البديلة *مرونة أكبر، ولكن قد لا تتعرف عليها جميع برامج الزحف، على الرغم من أنها جزء من بروتوكول استبعاد الروبوتات (RFC). [ 48 ]

لا يؤدي استخدام رمز البدل في نهاية القاعدة إلى أي شيء في الواقع، لأن هذا هو السلوك القياسي.

ملحقات غير قياسية

توجيه تأخير الزحف

تدعم بعض برامج الزحف قيمة تأخير الزحف للتحكم في عدد زياراتها للموقع المضيف. ولأن هذه القيمة ليست جزءًا من المعيار، فإن تفسيرها يعتمد على برنامج الزحف الذي يقرأها. تُستخدم هذه القيمة عندما يؤدي تدفق الزيارات المتعددة من برامج الروبوت إلى إبطاء الموقع المضيف. يفسر ياندكس هذه القيمة على أنها عدد الثواني التي يجب الانتظار بينها بين الزيارات المتتالية. [ 23 ] يُعرّف بينج تأخير الزحف على أنه حجم نافذة زمنية (من 1 إلى 30 ثانية) يصل خلالها بينج بوت إلى موقع ويب مرة واحدة فقط. [ 49 ] يتجاهل جوجل هذا التوجيه، [ 50 ] ولكنه يوفر واجهة في وحدة تحكم البحث الخاصة به لمشرفي المواقع للتحكم في زيارات جوجل بوت اللاحقة. [ 51 ]

وكيل المستخدم: bingbot يسمح: / تأخير الزحف: 10 ثوانٍ 

خريطة الموقع

تدعم بعض برامج الزحف Sitemapتوجيهًا يسمح بوجود خرائط مواقع متعددة في نفس الموقعrobots.txtبالشكل التالي : [ 52 ] [ 53 ]Sitemap: full-url

خريطة الموقع: http://www.example.com/sitemap.xml

تطابق عالمي "*"

لا يذكر معيار استبعاد الروبوتات رمز "*" في Disallow:البيان. [ 54 ]

إشارة المحتوى

قدمت Cloudflare Content-Signal[ 55 ] [ 56 ] كتوجيه لاقتراح سلوك الزحف المقبول حسب النوع، ai-trainو ai-input، و searchبقيم yesأو noلكل منها. [ 57 ]

إشارة المحتوى: ai-train=no, search=yes, ai-input=no

العلامات الوصفية والعناوين

بالإضافة إلى ملفات robots.txt الموجودة على مستوى الجذر، يمكن تطبيق توجيهات استبعاد الروبوتات على مستوى أدق باستخدام علامات Robots الوصفية وعناوين HTTP من نوع X-Robots-Tag. لا يمكن استخدام علامة robots الوصفية مع الملفات غير HTML، مثل الصور أو الملفات النصية أو مستندات PDF. في المقابل، يمكن إضافة X-Robots-Tag إلى الملفات غير HTML باستخدام ملفات .htaccess و httpd.conf . [ 58 ]

علامة "noindex" الوصفية

< meta name = "robots" content = "noindex" />

رأس استجابة HTTP "noindex"

علامة X-Robots-Tag: noindex 

لا يُفعَّل وسم X-Robots-Tag إلا بعد طلب الصفحة واستجابة الخادم، ولا يُفعَّل وسم robots meta tag إلا بعد تحميل الصفحة، بينما يُفعَّل ملف robots.txt قبل طلب الصفحة. لذا، إذا استُبعدت صفحةٌ ما بواسطة ملف robots.txt، فسيتم تجاهل أي وسوم robots meta tag أو رؤوس X-Robots-Tag فعليًا لأن الروبوت لن يراها أصلًا. [ 58 ]

الحد الأقصى لحجم ملف robots.txt

يتطلب بروتوكول استبعاد الروبوتات من برامج الزحف تحليل ما لا يقل عن 500 كيلوبايت (512000 بايت) من ملفات robots.txt، [ 59 ] وهو ما تحدده جوجل كحد أقصى لحجم ملفات robots.txt. [ 60 ]

انظر أيضاً

مراجع

  1. "تاريخي" . Greenhills.co.uk . مؤرشف من الأصل بتاريخ 2017-04-03 . تم الاطلاع عليه بتاريخ 2017-03-03 .
  2. فيلدينغ، روي (1994). "صيانة هياكل المعلومات النصية الموزعة: مرحبًا بكم في شبكة MOMspider" (PostScript) . المؤتمر الدولي الأول للشبكة العالمية . جنيف. مؤرشف من الأصل بتاريخ 27 سبتمبر 2013. تم الاطلاع عليه بتاريخ 25 سبتمبر 2013 .
  3. "صفحات روبوتات الويب" . Robotstxt.org. 30-06-1994. مؤرشف من الأصل في 12-01-2014 . تم الاطلاع عليه في 29-12-2013 .
  4. كوستر، مارتين (25 فبراير 1994). "هام: العناكب، والروبوتات، ومتجولو الويب" . قائمة بريدية www-talk . مؤرشفة من الأصل ( رسالة مؤرشفة من Hypermail ) في 29 أكتوبر 2013.
  5. "كيف وصلت إلى هنا في النهاية، الجزء الخامس: "الأمور لا يمكن إلا أن تتحسن!"" مذكرات تشارلي . 19 يونيو 2006. مؤرشفة من الأصل في 25 نوفمبر 2013. تم الاطلاع عليها في 19 أبريل 2014. "
  6. 1 2 3 4 5 بيرس، ديفيد (14 فبراير 2024). "ملف النص الذي يُشغّل الإنترنت" . ذا فيرج . تم الاسترجاع في 16 مارس 2024 .
  7. باري شوارتز (30 يونيو 2014). "ملف Robots.txt يحتفل بمرور 20 عامًا على حجب محركات البحث" . موقع Search Engine Land . مؤرشف من الأصل بتاريخ 7 سبتمبر 2015. تاريخ الاسترجاع: 19 نوفمبر 2015 .
  8. "صياغة مواصفات بروتوكول استبعاد الروبوتات" . مدونة مشرفي المواقع الرسمية من جوجل . مؤرشفة من الأصل بتاريخ 10 يوليو 2019. تم الاطلاع عليها بتاريخ 10 يوليو 2019 .
  9. كوستر، م.؛ إيليس، ج.؛ زيلر، هـ.؛ ساسمان، ل. (سبتمبر 2022). بروتوكول استبعاد الروبوتات . فريق عمل هندسة الإنترنت . doi : 10.17487/RFC9309 . RFC 9309 .المعيار المقترح.
  10. "روابط غير مفهرسة في نتائج البحث" . يوتيوب. 5 أكتوبر 2009. مؤرشف من الأصل في 6 يناير 2014. تم الاطلاع عليه في 29 ديسمبر 2013 .
  11. 1 2 "موقع إيباي يحارب العناكب على الإنترنت" . مجلة وايرد . 31 يوليو 2000. الرقم الدولي الموحد للدوريات 1059-1028 . تاريخ الاسترجاع 2 أغسطس 2024 . 
  12. eBay v. Bidder's Edge , 100 F. Supp. 2d 1058 ( ND Cal. 2000), مؤرشفة من الأصل .
  13. هوفمان، جاي (2020-09-15). "الفصل 4: البحث" . تاريخ الويب . تم الاسترجاع في 2024-08-02 .
  14. بيري، جاهنا (24 يوليو/تموز 2001). "الروبوتات في حظيرة الدجاج" . law.com . مؤرشف من الأصل بتاريخ 8 يونيو/حزيران 2011. تم الاطلاع عليه بتاريخ 20 يونيو/حزيران 2015 .
  15. "إيباي وبيدرز إيدج يتوصلان إلى تسوية بشأن الدعاوى القضائية المتعلقة بالوصول إلى الإنترنت" . صحيفة لوس أنجلوس تايمز . تم الاطلاع عليه بتاريخ 20 يونيو 2015 .
  16. «محكمة أمريكية: استخدام أرشيف الإنترنت لا يُعدّ اختراقاً» . ذا ريجستر . ٢ أغسطس ٢٠٠٧. تاريخ الاطلاع: ٢٢ أكتوبر ٢٠٢٥ .
  17. "مذكرة - دعاة الرعاية الصحية ضد هاردينغ" (ملف PDF) . govinfo.gov . 20 يوليو 2007. تم الاطلاع عليها في 22 أكتوبر 2025 .
  18. "Healthcare Advocates, Inc. v. Harding, Earley, Follmer & Frailey" . www.courtlistener.com . 20 يوليو 2007. تاريخ الاطلاع: 23 أكتوبر 2025 .
  19. "أسوشيتد برس ضد ميلتووتر يو إس هولدينغز، إنك" . www.courtlistener.com . 21 مارس 2013. تم الاطلاع عليه بتاريخ 23 أكتوبر 2025 .
  20. 1 2 "مشرفو المواقع: مواصفات ملف Robots.txt" . مطورو جوجل . مؤرشف من الأصل بتاريخ 15 يناير 2013. تم الاطلاع عليه بتاريخ 16 فبراير 2013 .
  21. "بروتوكول استبعاد الروبوتات: التعاون لتوفير توثيق أفضل" . Blogs.bing.com . 3 يونيو 2008. مؤرشف من الأصل في 18 أغسطس 2014. تم الاطلاع عليه في 16 فبراير 2013 .
  22. "إرسال موقعك الإلكتروني إلى بحث ياهو!" . مؤرشف من الأصل بتاريخ 21 يناير 2013. تم الاطلاع عليه بتاريخ 16 فبراير 2013 .
  23. 1 2 "استخدام ملف robots.txt" . Help.yandex.com . مؤرشف من الأصل بتاريخ 25 يناير 2013. تم الاطلاع عليه بتاريخ 16 فبراير 2013 .
  24. "بوت DuckDuckGo" . DuckDuckGo.com . مؤرشف من الأصل بتاريخ 16 فبراير 2017. تم الاطلاع عليه بتاريخ 25 أبريل 2017 .
  25. "Baiduspider" . Baidu.com . مؤرشف من الأصل في 6 أغسطس 2013. تم الاطلاع عليه في 16 فبراير 2013 .
  26. "حول بحث AOL" . Search.aol.com . مؤرشف من الأصل بتاريخ 13 ديسمبر 2012. تم الاطلاع عليه بتاريخ 16 فبراير 2013 .
  27. "حول Ask.com: مشرفي المواقع" . About.ask.com . مؤرشف من الأصل بتاريخ 27 يناير 2013. تم الاطلاع عليه بتاريخ 16 فبراير 2013 .
  28. "Kagi Search KagiBot" . بحث كاجي . مؤرشف من الأصل بتاريخ ١٢ أبريل ٢٠٢٤. تم الاطلاع عليه بتاريخ ٢٠ نوفمبر ٢٠٢٤ .
  29. "ArchiveBot: سلوك غير لائق" . wiki.archiveteam.org . فريق الأرشفة. مؤرشف من الأصل في 10 أكتوبر 2022. تم الاطلاع عليه في 10 أكتوبر 2022 .
  30. جيسون سكوت . "ملف Robots.txt بمثابة رسالة انتحار" . فريق الأرشيف. مؤرشف من الأصل بتاريخ 18 فبراير 2017. تم الاطلاع عليه بتاريخ 18 فبراير 2017 .
  31. " ملف Robots.txt المُصمم لمحركات البحث لا يعمل بكفاءة مع أرشيفات الويب | مدونات أرشيف الإنترنت" . blog.archive.org . ١٧ أبريل ٢٠١٧. مؤرشف من الأصل في ٤ ديسمبر ٢٠١٨. تم الاطلاع عليه في ١ ديسمبر ٢٠١٨ .
  32. جونز، براد (24 أبريل 2017). "أرشيف الإنترنت سيتجاهل ملفات Robots.txt للحفاظ على الدقة" . الاتجاهات الرقمية . مؤرشف من الأصل في 16 مايو 2017. تم الاطلاع عليه في 8 مايو 2017 .
  33. كوبلر، جيسون (29 يوليو 2024). "المواقع الإلكترونية تحظر برامج استخراج البيانات الخاطئة التي تعمل بالذكاء الاصطناعي (لأن شركات الذكاء الاصطناعي تستمر في ابتكار برامج جديدة)" . 404 ميديا . تم الاطلاع عليه بتاريخ 29 يوليو 2024 .
  34. براندوم، راسل (10 سبتمبر 2025). "أحد مؤسسي RSS يطلق بروتوكولًا جديدًا لترخيص بيانات الذكاء الاصطناعي" . تيك كرانش . تم الاطلاع عليه في 10 سبتمبر 2025 .
  35. روث، إيما (10 سبتمبر 2025). "الإنترنت لديه نظام جديد لإجبار شركات الذكاء الاصطناعي على الدفع" . ذا فيرج . تم الاطلاع عليه في 10 سبتمبر 2025 .
  36. شانكلين، ويل (10 سبتمبر 2025). "تتبنى مواقع Reddit وYahoo وMedium وغيرها معيار ترخيص جديدًا للحصول على تعويضات مقابل استخراج البيانات باستخدام الذكاء الاصطناعي" . Engadget . تم الاطلاع عليه في 10 سبتمبر 2025 .
  37. "حظر عناوين المواقع باستخدام ملف robots.txt: تعرّف على ملفات robots.txt" . مؤرشف من الأصل بتاريخ 14 أغسطس 2015. تم الاطلاع عليه بتاريخ 10 أغسطس 2015 .
  38. "ملف Robots.txt يُخبر المخترقين بالأماكن التي لا تريدهم أن يبحثوا فيها" . ذا ريجستر . مؤرشف من الأصل بتاريخ 21 أغسطس 2015. تم الاطلاع عليه بتاريخ 12 أغسطس 2015 .
  39. سكارفون، ك.أ.؛ جانسن، و.؛ تريسي، م. (يوليو 2008). "دليل أمن الخوادم العام" (ملف PDF) . المعهد الوطني للمعايير والتكنولوجيا . doi : 10.6028/NIST.SP.800-123 . مؤرشف (ملف PDF) من الأصل بتاريخ 8 أكتوبر 2011. تم الاطلاع عليه بتاريخ 12 أغسطس 2015 .
  40. سفير هـ. هوسبي (2004). الشفرة البريئة: نداء تنبيه أمني لمبرمجي الويب . جون وايلي وأولاده. الصفحات 91-92 . ISBN  9780470857472أُرشف من المصدر الأصلي بتاريخ 1 أبريل 2016. تم الاطلاع عليه بتاريخ 12 أغسطس 2015 .
  41. "قائمة وكلاء المستخدم (العناكب، والروبوتات، والمتصفحات)" . User-agents.org. مؤرشف من الأصل بتاريخ 7 يناير 2014. تم الاطلاع عليه بتاريخ 29 ديسمبر 2013 .
  42. "التحكم بالوصول - خادم Apache HTTP" . Httpd.apache.org. مؤرشف من الأصل بتاريخ 29-12-2013 . تم الاطلاع عليه بتاريخ 29-12-2013 .
  43. "سلاسل الرفض لقواعد التصفية : الموقع الرسمي لـ Microsoft IIS" . Iis.net. 2013-11-06. مؤرشف من الأصل في 2014-01-01 . تم الاطلاع عليه في 2013-12-29 . 
  44. "Google humans.txt" . مؤرشف من الأصل بتاريخ 24 يناير 2017. تم الاطلاع عليه بتاريخ 3 أكتوبر 2019 .
  45. "Github humans.txt" . GitHub . مؤرشف من الأصل في 30 مايو 2016. تم الاطلاع عليه في 3 أكتوبر 2019 .
  46. نيومان، ليلي هاي (2014-07-03). "هل هذه خدعة خفية من جوجل أم دليل على أن سكاى نت تخطط بالفعل للسيطرة على العالم؟" . مجلة سلات . مؤرشف من الأصل في 2018-11-18 . تم الاطلاع عليه في 2019-10-03 .
  47. "/killer-robots.txt" . 10 يناير 2018. مؤرشف من الأصل في 10 يناير 2018. تم الاطلاع عليه في 25 مايو 2018 .
  48. ^ كوستر ، مارتين. إليس، غاري. زيلر، هينر. ساسمان ، ليزي (سبتمبر 2022). بروتوكول استبعاد الروبوتات (أبلغ عن). فرقة عمل هندسة الإنترنت.
  49. "الزحف أم عدم الزحف، هذا هو سؤال بينغ بوت" . 3 مايو 2012. مؤرشف من الأصل في 3 فبراير 2016. تم الاطلاع عليه في 9 فبراير 2016 .
  50. "كيف تفسر جوجل مواصفات ملف robots.txt" . مركز بحث جوجل . 23 مايو 2024. تاريخ الاسترجاع: 6 أكتوبر 2024 .
  51. "تغيير معدل زحف Googlebot - مساعدة Search Console" . support.google.com . مؤرشف من الأصل بتاريخ 18 نوفمبر 2018. تم الاطلاع عليه بتاريخ 22 أكتوبر 2018 .
  52. "مدونة بحث ياهو! - يمكن لمشرفي المواقع الآن اكتشاف المواقع تلقائيًا باستخدام خرائط المواقع" . مؤرشف من الأصل بتاريخ 5 مارس 2009. تم الاطلاع عليه بتاريخ 23 مارس 2009 .
  53. "الأسئلة الشائعة - Common Crawl" . تم الاطلاع عليه بتاريخ 26-05-2025 . كيف يمكنني ضمان قدرة Common Crawl CCBot على فهرسة موقعي بكفاءة؟ يدعم برنامج الفهرسة بروتوكول خريطة الموقع ويستخدم أي خريطة موقع مُعلنة في ملف robots.txt.
  54. "مواصفات ملف Robots.txt" . مطورو جوجل . مؤرشف من الأصل في 2 نوفمبر 2019. تم الاطلاع عليه في 15 فبراير 2020 .
  55. "موقع ContentSignals الإلكتروني" . مؤرشف من الأصل بتاريخ 29-09-2025 . تم الاطلاع عليه بتاريخ 30-09-2025 .
  56. "Cloudflare تُقدّم طريقة لحظر مراجعات الذكاء الاصطناعي - هل ستلتزم جوجل بذلك؟" . مؤرشف من الأصل بتاريخ 26-09-2025 . تم الاطلاع عليه بتاريخ 30-09-2025 .
  57. "منح المستخدمين حرية الاختيار مع سياسة إشارات المحتوى الجديدة من كلاود فلير" . مؤرشف من الأصل بتاريخ 30 سبتمبر 2025. تم الاطلاع عليه بتاريخ 30 سبتمبر 2025 .
  58. ١ ٢ " مواصفات علامة التعريف Robots وعنوان HTTP X-Robots-Tag - مشرفو المواقع - مطورو جوجل" . مؤرشف من الأصل بتاريخ ٨ أغسطس ٢٠١٣. تم الاطلاع عليه بتاريخ ١٧ أغسطس ٢٠١٣ .
  59. كوستر، م.؛ إيليس، ج.؛ زيلر، هـ.؛ ساسمان، ل. (سبتمبر 2022). بروتوكول استبعاد الروبوتات . فريق عمل هندسة الإنترنت . doi : 10.17487/RFC9309 . RFC 9309 .المعيار المقترح. القسم 2.5: الحدود.
  60. "كيف تفسر جوجل مواصفات ملف robots.txt | الوثائق" . مطورو جوجل . مؤرشف من الأصل بتاريخ 17-10-2022 . تم الاطلاع عليه بتاريخ 17-10-2022 .

للمزيد من القراءة