كشف تشابه المحتوى
الكشف عن الانتحال أو الكشف عن تشابه المحتوى هو عملية تحديد حالات الانتحال أو انتهاك حقوق الطبع والنشر داخل عمل أو مستند. لقد أدى الاستخدام الواسع النطاق لأجهزة الكمبيوتر وظهور الإنترنت إلى تسهيل انتحال أعمال الآخرين. [1] [2]
يمكن الكشف عن الانتحال بعدة طرق. يعد الكشف البشري هو الشكل الأكثر تقليدية لتحديد الانتحال من العمل المكتوب. يمكن أن تكون هذه مهمة طويلة وتستغرق وقتًا طويلاً للقارئ [2] ويمكن أن تؤدي أيضًا إلى تناقضات في كيفية تحديد الانتحال داخل المنظمة. [3] أصبحت برامج مطابقة النصوص (TMS)، والتي يشار إليها أيضًا باسم "برامج الكشف عن الانتحال" أو "برامج مكافحة الانتحال"، متاحة على نطاق واسع، في شكل منتجات متاحة تجاريًا بالإضافة إلى برامج مفتوحة المصدر [ أمثلة مطلوبة ] . لا يكتشف TMS في الواقع الانتحال في حد ذاته، ولكنه بدلاً من ذلك يجد مقاطع نصية محددة في مستند واحد تتطابق مع النص في مستند آخر.
الكشف عن الانتحال بمساعدة البرمجيات
يعد الكشف عن الانتحال بمساعدة الكمبيوتر مهمة استرجاع معلومات (IR) مدعومة بأنظمة استرجاع معلومات متخصصة، والتي يشار إليها بنظام الكشف عن الانتحال (PDS) أو نظام الكشف عن تشابه المستندات. تقدم مراجعة منهجية للأدبيات في عام 2019 [4] نظرة عامة على أحدث طرق الكشف عن الانتحال.
في المستندات النصية
تطبق أنظمة الكشف عن تشابه النصوص أحد نهجي الكشف العامين، أحدهما خارجي والآخر داخلي. [5] تقارن أنظمة الكشف الخارجية وثيقة مشبوهة بمجموعة مرجعية، وهي مجموعة من المستندات يُفترض أنها أصلية. [6] بناءً على نموذج مستند مختار ومعايير تشابه محددة مسبقًا، تتمثل مهمة الكشف في استرداد جميع المستندات التي تحتوي على نص مشابه بدرجة أعلى من عتبة مختارة للنص الموجود في المستند المشبوه. [7] تحلل أنظمة الكشف عن تشابه النصوص الداخلية النص المراد تقييمه فقط دون إجراء مقارنات مع المستندات الخارجية. يهدف هذا النهج إلى التعرف على التغييرات في أسلوب الكتابة الفريد للمؤلف كمؤشر على الانتحال المحتمل. [8] [9] أنظمة الكشف عن تشابه النصوص غير قادرة على تحديد الانتحال بشكل موثوق دون حكم بشري. يتم حساب أوجه التشابه وسمات أسلوب الكتابة بمساعدة نماذج المستندات المحددة مسبقًا وقد تمثل نتائج إيجابية كاذبة. [10] [11] [12] [13] [14]
فعالية تلك الأدوات في مؤسسات التعليم العالي
يعتمد هذا القسم بشكل كبير أو كليًا على مصدر واحد . ( ديسمبر 2017 ) |
أجريت دراسة لاختبار فعالية برامج الكشف عن التشابه في بيئة التعليم العالي. كلف جزء من الدراسة مجموعة واحدة من الطلاب بكتابة ورقة بحثية. تم تثقيف هؤلاء الطلاب أولاً حول الانتحال وإبلاغهم بأن عملهم يجب أن يتم تشغيله من خلال نظام الكشف عن تشابه المحتوى. تم تكليف مجموعة ثانية من الطلاب بكتابة ورقة بحثية دون أي معلومات حول الانتحال. توقع الباحثون العثور على معدلات أقل في المجموعة الأولى لكنهم وجدوا معدلات مماثلة تقريبًا للانتحال في كلتا المجموعتين. [15]
النهج
يمثل الشكل أدناه تصنيفًا لجميع أساليب الكشف المستخدمة حاليًا للكشف عن تشابه المحتوى بمساعدة الكمبيوتر. تتميز الأساليب بنوع تقييم التشابه الذي تقوم به: عالمي أو محلي. تستخدم أساليب تقييم التشابه العالمي الخصائص المأخوذة من أجزاء أكبر من النص أو المستند ككل لحساب التشابه، بينما تفحص الأساليب المحلية فقط أجزاء نصية محددة مسبقًا كمدخلات. [ بحاجة لمصدر ]

بصمات الأصابع
إن بصمة الإصبع هي حاليًا الطريقة الأكثر انتشارًا في الكشف عن تشابه المحتوى. تشكل هذه الطريقة ملخصات تمثيلية للمستندات من خلال تحديد مجموعة من السلاسل الفرعية المتعددة ( n-grams ) منها. تمثل المجموعات بصمات الأصابع وتسمى عناصرها بالتفاصيل الدقيقة. [17] [18] يتم فحص المستند المشبوه بحثًا عن الانتحال عن طريق حساب بصمة الإصبع والاستعلام عن التفاصيل الدقيقة باستخدام فهرس محسوب مسبقًا لبصمات الأصابع لجميع المستندات في مجموعة مرجعية. تشير التفاصيل الدقيقة المطابقة لتلك الموجودة في المستندات الأخرى إلى أجزاء نصية مشتركة وتشير إلى احتمالية الانتحال إذا تجاوزت عتبة التشابه المختارة. [19] تعد الموارد الحسابية والوقت عوامل مقيدة لبصمة الإصبع، ولهذا السبب تقارن هذه الطريقة عادةً مجموعة فرعية فقط من التفاصيل الدقيقة لتسريع الحساب والسماح بالتحقق في مجموعة كبيرة جدًا، مثل الإنترنت. [17]
مطابقة السلسلة
إن مطابقة السلاسل هي طريقة شائعة الاستخدام في علوم الكمبيوتر. وعند تطبيقها على مشكلة اكتشاف الانتحال، تتم مقارنة المستندات بحثًا عن تداخلات النص الحرفي. وقد تم اقتراح العديد من الطرق لمعالجة هذه المهمة، وقد تم تكييف بعضها للكشف عن الانتحال الخارجي. يتطلب فحص مستند مشبوه في هذا الإعداد حساب وتخزين تمثيلات قابلة للمقارنة بكفاءة لجميع المستندات في مجموعة المراجع لمقارنتها بشكل زوجي. بشكل عام، تم استخدام نماذج المستندات اللاحقة، مثل أشجار اللاحقة أو متجهات اللاحقة، لهذه المهمة. ومع ذلك، تظل مطابقة السلاسل الفرعية مكلفة حسابيًا، مما يجعلها حلاً غير قابل للتطبيق لفحص مجموعات كبيرة من المستندات. [20] [21] [22]
حقيبة الكلمات
يمثل تحليل حقيبة الكلمات تبني استرجاع مساحة المتجه ، وهو مفهوم تقليدي في مجال الكشف عن تشابه المحتوى. يتم تمثيل المستندات كمتجه واحد أو أكثر، على سبيل المثال لأجزاء مختلفة من المستند، والتي تُستخدم لحسابات التشابه الزوجي. قد يعتمد حساب التشابه بعد ذلك على مقياس تشابه جيب التمام التقليدي ، أو على مقاييس تشابه أكثر تعقيدًا. [23] [24] [25]
تحليل الاستشهادات
يعتمد الكشف عن الانتحال القائم على الاستشهادات (CbPD) [26] على تحليل الاستشهادات ، وهو النهج الوحيد للكشف عن الانتحال الذي لا يعتمد على التشابه النصي. [27] يفحص CbPD معلومات الاستشهاد والمرجع في النصوص لتحديد الأنماط المتشابهة في تسلسلات الاستشهاد. وعلى هذا النحو، فإن هذا النهج مناسب للنصوص العلمية أو المستندات الأكاديمية الأخرى التي تحتوي على استشهادات. يعد تحليل الاستشهادات للكشف عن الانتحال مفهومًا جديدًا نسبيًا. لم يتم اعتماده بواسطة البرامج التجارية، ولكن يوجد نموذج أولي أولي لنظام الكشف عن الانتحال القائم على الاستشهادات. [28] الترتيب المتشابه وقرب الاستشهادات في المستندات المفحوصة هي المعايير الرئيسية المستخدمة لحساب أوجه التشابه في أنماط الاستشهاد. تمثل أنماط الاستشهاد تسلسلات فرعية تحتوي بشكل غير حصري على الاستشهادات المشتركة بين المستندات المقارنة. [27] [29] يتم أيضًا أخذ العوامل، بما في ذلك العدد المطلق أو الكسر النسبي للاقتباسات المشتركة في النمط، بالإضافة إلى احتمالية حدوث الاقتباسات معًا في مستند، في الاعتبار لتحديد درجة تشابه الأنماط. [27] [29] [30] [31]
أسلوب القياس
يتضمن قياس الأسلوب الأساليب الإحصائية لقياس أسلوب الكتابة الفريد للمؤلف [32] [33] ويُستخدم بشكل أساسي لإسناد التأليف أو الكشف عن الانتحال الجوهري. [34] يتطلب اكتشاف الانتحال عن طريق إسناد التأليف التحقق مما إذا كان أسلوب الكتابة في المستند المشبوه، والذي يُفترض أنه مكتوب بواسطة مؤلف معين، يتطابق مع أسلوب مجموعة من المستندات التي كتبها نفس المؤلف. من ناحية أخرى، يكشف اكتشاف الانتحال الجوهري عن الانتحال بناءً على الأدلة الداخلية في المستند المشبوه دون مقارنته بمستندات أخرى. يتم تنفيذ ذلك من خلال إنشاء ومقارنة نماذج قياس الأسلوب لأجزاء نصية مختلفة من المستند المشبوه، ويتم وضع علامة على المقاطع التي تختلف أسلوبيًا عن غيرها على أنها مسروقة/منتهكة. [8] على الرغم من سهولة استخراجها، فقد ثبت أن أحرف n-grams من بين أفضل ميزات قياس الأسلوب للكشف عن الانتحال الجوهري. [35]
الشبكات العصبية
حققت الأساليب الأحدث لتقييم تشابه المحتوى باستخدام الشبكات العصبية دقة أكبر بشكل ملحوظ، ولكنها تأتي بتكلفة حسابية كبيرة. [36] تتضمن أساليب الشبكات العصبية التقليدية تضمينات متجهات دلالية لكلا قطعتي المحتوى لحساب تشابههما، والذي غالبًا ما يكون تشابه جيب التمام. تقوم الأساليب الأكثر تقدمًا بإجراء تنبؤ شامل للتشابه أو التصنيفات باستخدام بنية المحول . [37] [38] يستفيد اكتشاف إعادة الصياغة بشكل خاص من النماذج المدربة مسبقًا عالية المعلمات.
أداء
تشير التقييمات المقارنة لأنظمة اكتشاف تشابه المحتوى [6] [39] [40] [41] [42] [43] إلى أن أداءها يعتمد على نوع الانتحال الموجود (انظر الشكل). باستثناء تحليل نمط الاقتباس، تعتمد جميع طرق الكشف على التشابه النصي. لذلك، من الواضح أن دقة الكشف تقل كلما زادت حالات الانتحال التي يتم التعتيم عليها.

يمكن اكتشاف النسخ الحرفية، المعروفة أيضًا باسم سرقة النسخ واللصق أو انتهاك حقوق النشر الصارخ، أو حالات السرقة الأدبية المقنعة بشكل متواضع بدقة عالية بواسطة PDS الخارجي الحالي إذا كان المصدر متاحًا للبرنامج. على وجه الخصوص، تحقق إجراءات مطابقة السلسلة الفرعية أداءً جيدًا لسرقة النسخ واللصق، لأنها تستخدم عادةً نماذج المستندات بدون فقدان، مثل أشجار اللواحق . يعتمد أداء الأنظمة التي تستخدم بصمات الأصابع أو تحليل كيس الكلمات في اكتشاف النسخ على فقدان المعلومات الذي يتكبده نموذج المستند المستخدم. من خلال تطبيق استراتيجيات التجزئة والاختيار المرنة، فهي أكثر قدرة على اكتشاف الأشكال المعتدلة من السرقة الأدبية المقنعة مقارنة بإجراءات مطابقة السلسلة الفرعية.
إن الكشف عن الانتحال الجوهري باستخدام أسلوب القياس يمكن أن يتغلب على حدود التشابه النصي إلى حد ما من خلال مقارنة التشابه اللغوي. ونظرًا لأن الاختلافات الأسلوبية بين المقاطع المسروقة والأصلية كبيرة ويمكن تحديدها بشكل موثوق، فإن أسلوب القياس يمكن أن يساعد في تحديد الانتحال المقنع والمعاد صياغته . ومن المرجح أن تفشل المقارنات الأسلوبية في الحالات التي يتم فيها إعادة صياغة المقاطع بقوة إلى الحد الذي تشبه فيه أسلوب الكتابة الشخصي للسارق أو إذا تم تجميع النص بواسطة مؤلفين متعددين. تشير نتائج المسابقات الدولية للكشف عن الانتحال التي عقدت في عامي 2009 و2010 و2011، [6] [42] [43] بالإضافة إلى التجارب التي أجراها شتاين، [34] إلى أن التحليل الأسلوبي يبدو أنه يعمل بشكل موثوق فقط لأطوال المستندات التي يبلغ طولها عدة آلاف أو عشرات الآلاف من الكلمات، مما يحد من قابلية تطبيق الطريقة على إعدادات الكشف عن الانتحال بمساعدة الكمبيوتر.
يتم إجراء قدر متزايد من الأبحاث على الأساليب والأنظمة القادرة على اكتشاف الانتحال المترجم. حاليًا، لا يُنظر إلى اكتشاف الانتحال عبر اللغات (CLPD) باعتباره تقنية ناضجة [44] ولم تتمكن الأنظمة ذات الصلة من تحقيق نتائج اكتشاف مرضية في الممارسة العملية. [41]
إن الكشف عن الانتحال القائم على الاستشهاد باستخدام تحليل أنماط الاستشهاد قادر على تحديد العبارات المعاد صياغتها والترجمات الأقوى بمعدلات نجاح أعلى عند مقارنتها بأساليب الكشف الأخرى، لأنه مستقل عن الخصائص النصية. [27] [30] ومع ذلك، نظرًا لأن تحليل أنماط الاستشهاد يعتمد على توافر معلومات الاستشهاد الكافية، فإنه يقتصر على النصوص الأكاديمية. ويظل أدنى من الأساليب القائمة على النص في الكشف عن المقاطع الأقصر المسروقة، والتي تعد نموذجية لحالات النسخ واللصق أو الانتحال بالرج واللصق؛ يشير الأخير إلى خلط أجزاء معدلة قليلاً من مصادر مختلفة. [45]
برمجة
يتميز تصميم برامج الكشف عن تشابه المحتوى للاستخدام مع المستندات النصية بعدد من العوامل: [46]
| عامل | الوصف والبدائل |
|---|---|
| نطاق البحث | في شبكة الإنترنت العامة، باستخدام محركات البحث / قواعد البيانات المؤسسية / قاعدة البيانات المحلية الخاصة بالنظام. [ بحاجة لمصدر ] |
| وقت التحليل | التأخير بين وقت تقديم المستند والوقت الذي تصبح فيه النتائج متاحة. [ بحاجة لمصدر ] |
| سعة المستندات / معالجة الدفعات | عدد المستندات التي يستطيع النظام معالجتها لكل وحدة زمنية. [ بحاجة لمصدر ] |
| التحقق من الكثافة | ما مدى تكرار وأنواع أجزاء المستند (الفقرات والجمل وتسلسلات الكلمات ذات الطول الثابت) التي يستفسر عنها النظام من الموارد الخارجية، مثل محركات البحث. |
| نوع خوارزمية المقارنة | الخوارزميات التي تحدد الطريقة التي يستخدمها النظام لمقارنة المستندات مع بعضها البعض. [ بحاجة لمصدر ] |
| الدقة والتذكير | عدد المستندات التي تم وضع علامة صحيحة عليها باعتبارها مسروقة مقارنة بالعدد الإجمالي للمستندات التي تم وضع علامة عليها، وبالعدد الإجمالي للمستندات التي تم انتحالها بالفعل. تعني الدقة العالية أنه تم العثور على عدد قليل من النتائج الإيجابية الخاطئة ، كما تعني القدرة العالية على التذكر أنه لم يتم اكتشاف سوى عدد قليل من النتائج السلبية الخاطئة . [ بحاجة لمصدر ] |
تستخدم أغلب أنظمة الكشف عن الانتحال واسعة النطاق قواعد بيانات داخلية ضخمة (بالإضافة إلى موارد أخرى) تتزايد مع كل مستند إضافي يتم تقديمه للتحليل. ومع ذلك، يعتبر البعض هذه الميزة انتهاكًا لحقوق الطبع والنشر للطلاب . [ بحاجة لمصدر ]
في الكود المصدر
كما أن الانتحال في أكواد المصدر الحاسوبية شائع أيضًا، ويتطلب أدوات مختلفة عن تلك المستخدمة في مقارنات النصوص في المستندات. وقد تم تخصيص قدر كبير من الأبحاث للانتحال الأكاديمي للكود المصدري. [47]
من الجوانب المميزة لسرقة الكود المصدري هو عدم وجود مطاحن مقالات ، كما يمكن العثور عليها في السرقة الأدبية التقليدية. نظرًا لأن معظم مهام البرمجة تتوقع من الطلاب كتابة برامج بمتطلبات محددة للغاية، فمن الصعب جدًا العثور على برامج موجودة تلبي هذه المتطلبات بالفعل. نظرًا لأن دمج الكود الخارجي غالبًا ما يكون أصعب من كتابته من الصفر، فإن معظم الطلاب الذين يمارسون السرقة الأدبية يختارون القيام بذلك من أقرانهم.
وفقًا لروي وكوردي، [48] يمكن تصنيف خوارزميات اكتشاف تشابه الكود المصدري على أساس إما
- السلاسل - ابحث عن تطابقات نصية دقيقة للأجزاء، على سبيل المثال، سلاسل مكونة من خمس كلمات. سريعة، ولكن يمكن الخلط بينها عند إعادة تسمية المعرفات.
- الرموز – كما هو الحال مع السلاسل، ولكن باستخدام أداة تحليل معجمية لتحويل البرنامج إلى رموز أولاً. وهذا يتجاهل المسافات البيضاء والتعليقات وأسماء المعرفات، مما يجعل النظام أكثر قوة ضد عمليات استبدال النصوص البسيطة. تعمل معظم أنظمة الكشف عن الانتحال الأكاديمي على هذا المستوى، باستخدام خوارزميات مختلفة لقياس التشابه بين تسلسلات الرموز.
- تحليل الأشجار – إنشاء ومقارنة أشجار التحليل. يتيح ذلك اكتشاف أوجه التشابه على مستوى أعلى. على سبيل المثال، يمكن لمقارنة الأشجار تطبيع العبارات الشرطية، واكتشاف البنى المكافئة المتشابهة مع بعضها البعض.
- الرسوم البيانية لاعتماد البرنامج (PDGs) – تلتقط الرسوم البيانية لاعتماد البرنامج التدفق الفعلي للتحكم في البرنامج، وتسمح بتحديد مكافئات ذات مستوى أعلى بكثير، بتكلفة أكبر في التعقيد ووقت الحساب.
- المقاييس – تلتقط المقاييس "درجات" أجزاء التعليمات البرمجية وفقًا لمعايير معينة؛ على سبيل المثال، "عدد الحلقات والشروط"، أو "عدد المتغيرات المختلفة المستخدمة". المقاييس سهلة الحساب ويمكن مقارنتها بسرعة، ولكنها قد تؤدي أيضًا إلى نتائج إيجابية خاطئة: فقد تقوم شظيتان بنفس الدرجات في مجموعة من المقاييس بأشياء مختلفة تمامًا.
- الأساليب الهجينة - على سبيل المثال، يمكن لأشجار التحليل + أشجار اللواحق أن تجمع بين قدرة أشجار التحليل على الكشف والسرعة التي توفرها أشجار اللواحق، وهو نوع من بنية البيانات المطابقة للسلسلة.
تم تطوير التصنيف السابق لإعادة هيكلة الكود ، وليس للكشف عن الانتحال الأكاديمي (الهدف المهم لإعادة الهيكلة هو تجنب الكود المكرر ، والذي يشار إليه باسم نسخ الكود في الأدبيات). الأساليب المذكورة أعلاه فعالة ضد مستويات مختلفة من التشابه؛ يشير التشابه منخفض المستوى إلى نص متطابق، بينما يمكن أن يكون التشابه عالي المستوى بسبب مواصفات مماثلة. في بيئة أكاديمية، عندما يُتوقع من جميع الطلاب كتابة الكود وفقًا لنفس المواصفات، يُتوقع تمامًا وجود كود مكافئ وظيفيًا (مع تشابه عالي المستوى)، ولا يُعتبر سوى التشابه منخفض المستوى دليلاً على الغش.
الفرق بين الانتحال وحقوق النشر
إن الانتحال وحقوق الطبع والنشر من المفاهيم الأساسية في الكتابة الأكاديمية والإبداعية والتي يجب على الكتاب والباحثين والطلاب فهمها. ورغم أنهما قد يبدوان متشابهين، إلا أنهما ليسا كذلك؛ إذ يمكن استخدام استراتيجيات مختلفة للتعامل مع كل منهما. [49]
الخوارزميات
تم اقتراح عدد من الخوارزميات المختلفة للكشف عن الكود المكرر. على سبيل المثال:
- خوارزمية بيكر . [50]
- خوارزمية البحث عن سلسلة رابين-كارب .
- استخدام أشجار بناء الجملة المجردة . [51]
- الكشف عن الاستنساخ البصري. [52]
- اكتشاف استنساخ مصفوفة العد. [53] [54]
- التجزئة الحساسة للموقع
- مناهضة التوحيد [55]
المضاعفات المترتبة على استخدام برامج مطابقة النصوص للكشف عن الانتحال
لقد تم توثيق العديد من التعقيدات التي قد تنشأ عند استخدام برامج مطابقة النصوص للكشف عن الانتحال. وتتركز إحدى المخاوف الأكثر انتشارًا حول قضية حقوق الملكية الفكرية. والحجة الأساسية هنا هي أنه يجب إضافة المواد إلى قاعدة البيانات حتى يتمكن نظام إدارة المحتوى من تحديد المطابقة بشكل فعال، ولكن إضافة مواد المستخدمين إلى مثل هذه القاعدة البيانات قد تنتهك حقوق الملكية الفكرية الخاصة بهم. وقد تم إثارة هذه القضية في عدد من القضايا القضائية.
من المضاعفات الإضافية المترتبة على استخدام نظام إدارة الترجمة أن البرنامج لا يجد سوى تطابقات دقيقة مع نص آخر. فهو لا يلتقط الأعمال التي تمت صياغتها بشكل رديء، على سبيل المثال، أو ممارسة الانتحال باستخدام عدد كافٍ من الكلمات البديلة لتجنب برامج الكشف، وهو ما يُعرف باسم " الانتحال" .
انظر أيضا
- برنامج الكشف عن الذكاء الاصطناعي – برنامج للكشف عن المحتوى الذي تم إنشاؤه بواسطة الذكاء الاصطناعي
- الفئة: أجهزة كشف الانتحال
- مقارنة بين برامج مكافحة الانتحال
- التجزئة الحساسة للموقع – تقنية خوارزمية تستخدم التجزئة
- البحث عن أقرب جار – مشكلة تحسين في علوم الكمبيوتر
- اكتشاف إعادة الصياغة – التوليد التلقائي أو التعرف على النص المعاد صياغته
- تعقيد كولموغوروف #الضغط - يستخدم لتقدير التشابه بين تسلسلات الرموز في العديد من الأنظمة
- كشف نسخ الفيديو
مراجع
- ^ كولوين، فينتان؛ لانكستر، توماس (2001). "الانتحال والوقاية والردع والكشف". CiteSeerX 10.1.1.107.178 . مؤرشف من الأصل في 18 أبريل 2021. تم الاسترجاع في 11 نوفمبر 2022 – عبر أكاديمية التعليم العالي .
- ^ ab Bretag, T. , & Mahmud, S. (2009). نموذج لتحديد سرقة الطلاب للكتب: الكشف الإلكتروني والحكم الأكاديمي. مجلة ممارسات التدريس والتعلم الجامعي، 6 (1). مأخوذ من http://ro.uow.edu.au/jutlp/vol6/iss1/6
- ^ ماكدونالد، ر.، وكارول، ج. (2006). الانتحال - قضية معقدة تتطلب نهجًا مؤسسيًا شاملاً. التقييم والتقويم في التعليم العالي، 31 (2)، 233-245. doi :10.1080/02602930500262536
- ^ فولتينك، توماس؛ موشكي، نورمان؛ جيب ، بيلا (16 أكتوبر 2019). “كشف الانتحال الأكاديمي: مراجعة منهجية للأدبيات”. مسوحات الحوسبة ACM . 52 (6): 1-42. دوى : 10.1145/3345317 .
- ^ شتاين، بينو؛ كوبل، موشيه؛ ستاماتاتوس، إفستاثيوس (ديسمبر 2007)، "تحليل الانتحال وتحديد المؤلفين والكشف عن النسخ شبه المكررة PAN'07" (PDF) ، منتدى SIGIR ، 41 (2): 68، doi :10.1145/1328964.1328976، S2CID 6379659، تم أرشفته من الأصل (PDF) في 2 أبريل 2012 ، تم استرجاعه في 7 أكتوبر 2011
- ^ abc Potthast, Martin; Stein, Benno; Eiselt, Andreas; Barrón-Cedeño, Alberto; Rosso, Paolo (2009), "Overview of the 1st International Competition on Plagiarism Detection", PAN09 - 3rd Workshop on Uncovering Plagiarism, Authorship and Social Software Misuse and 1st International Competition on Plagiarism Detection (PDF) , CEUR Workshop Proceedings, vol. 502, pp. 1–9, ISSN 1613-0073, محفوظ من الأصل (PDF) في 2 أبريل 2012
- ^ شتاين، بينو؛ ماير زو إيسن، سفين؛ بوتاست، مارتن (2007)، "استراتيجيات استرجاع المستندات المسروقة"، وقائع المؤتمر الدولي السنوي الثلاثين لجمعية الحوسبة الآلية (PDF) ، جمعية الحوسبة الآلية، ص 825-826، doi :10.1145/1277741.1277928، ISBN 978-1-59593-597-7، S2CID 3898511، تم أرشفته من الأصل (PDF) في 2 أبريل 2012 ، تم استرجاعه في 7 أكتوبر 2011
- ^ من تأليف ماير زو إيسن، سفين؛ شتاين، بينو (2006)، "الكشف عن الانتحال الجوهري"، التقدم في استرجاع المعلومات، المؤتمر الأوروبي الثامن والعشرون لأبحاث استرجاع المعلومات، ECIR 2006، لندن، المملكة المتحدة، 10-12 أبريل 2006، وقائع (PDF) ، مذكرات محاضرات في علوم الكمبيوتر، المجلد 3936، سبرينغر، ص 565-569، CiteSeerX 10.1.1.110.5366 ، doi :10.1007/11735106_66، ISBN 978-3-540-33347-0, تم أرشفته من الأصل (PDF) في 2 أبريل 2012 , تم استرجاعه في 7 أكتوبر 2011
- ^ بنسالم، إيمان (2020). "الكشف عن الانتحال الجوهري: دراسة استقصائية". الكشف عن الانتحال: التركيز على النهج الجوهري والتقييم في اللغة العربية (أطروحة دكتوراه) . جامعة قسطنطين الثانية. doi :10.13140/RG.2.2.25727.84641.
- ^ باو، جون بينج؛ مالكولم، جيمس أ. (2006)، "تشابه النصوص في أوراق المؤتمرات الأكاديمية"، وقائع المؤتمر الدولي الثاني للانتحال (PDF) ، مطبعة جامعة نورثمبريا، مؤرشف من الأصل (PDF) في 16 سبتمبر 2018 ، تم استرجاعه في 7 أكتوبر 2011
- ^ كلوج، بول (2000)، الانتحال في اللغات الطبيعية والبرمجية نظرة عامة على الأدوات والتقنيات الحالية (PDF) (تقرير فني)، قسم علوم الكمبيوتر، جامعة شيفيلد، مؤرشف من الأصل (PDF) في 18 أغسطس 2011
- ^ Culwin, Fintan; Lancaster, Thomas (2001), "Plagiarism issues for higher education" (PDF) , Vine , 31 (2): 36–41, doi :10.1108/03055720010804005, تم أرشفته من الأصل (PDF) في 5 أبريل 2012
- ^ لانكستر، توماس (2003)، الكشف الفعال والكفء عن الانتحال (أطروحة دكتوراه)، كلية الحوسبة ونظم المعلومات والرياضيات، جامعة ساوث بانك
- ^ مورير، هيرمان؛ زاكا، بلال (2007)، "الانتحال - مشكلة وكيفية محاربته"، وقائع المؤتمر العالمي للوسائط المتعددة والوسائط الفائقة والاتصالات السلكية واللاسلكية التعليمية 2007، الجمعية الأمريكية للمهندسين الميكانيكيين، ص 4451-4458، رقم ISBN 9781880094624
- ^ Youmans, Robert J. (نوفمبر 2011). "هل يؤدي تبني برامج الكشف عن الانتحال في التعليم العالي إلى الحد من الانتحال؟". دراسات في التعليم العالي . 36 (7): 749-761. doi :10.1080/03075079.2010.523457. S2CID 144143548.
- ^ موشكي، نورمان؛ جيب، بيلا (2013)، "أحدث التقنيات في الكشف عن الانتحال الأكاديمي" (PDF) ، المجلة الدولية للنزاهة التعليمية ، 9 (1): 50-71، doi :10.5281/zenodo.3482941 ، تم الاسترجاع في 15 فبراير 2024
- ^ ab Hoad, Timothy; Zobel, Justin (2003), "Methods for Identifying Versioned and Plagiarised Documents" (PDF) , Journal of the American Society for Information Science and Technology , 54 (3): 203–215, CiteSeerX 10.1.1.18.2680 , doi :10.1002/asi.10170, تم أرشفته من الأصل (PDF) في 30 أبريل 2015 , تم استرجاعه في 14 أكتوبر 2014
- ^ Stein, Benno (July 2005), "Fuzzy-Fingerprints for Text-Based Information Retrieval", Proceedings of the I-KNOW '05, 5th International Conference on Knowledge Management, Graz, Austria (PDF) , Springer, Know-Center, pp. 572–579, تم أرشفته من الأصل (PDF) في 2 أبريل 2012 , تم استرجاعه في 7 أكتوبر 2011
- ^ برين، سيرجي؛ ديفيس، جيمس؛ جارسيا-مولينا، هيكتور (1995)، "آليات الكشف عن النسخ للوثائق الرقمية"، وقائع مؤتمر SIGMOD الدولي لعام 1995 حول إدارة البيانات (PDF) ، ACM، ص. 398-409، CiteSeerX 10.1.1.49.1567 ، doi :10.1145/223784.223855، ISBN 978-1-59593-060-6، S2CID 8652205، تم أرشفته من الأصل (PDF) في 18 أغسطس 2016 ، تم استرجاعه في 7 أكتوبر 2011
- ^ مونوستوري، كريستيان؛ زاسلافسكي، أركادي؛ شميدت، هاينز (2000)، "نظام اكتشاف تداخل المستندات للمكتبات الرقمية الموزعة"، وقائع مؤتمر رابطة مكائن الحوسبة الخامس حول المكتبات الرقمية (PDF) ، رابطة مكائن الحوسبة، ص 226-227، doi :10.1145/336597.336667، ISBN 978-1-58113-231-1، S2CID 5796686، تم أرشفته من الأصل (PDF) في 15 أبريل 2012 ، تم استرجاعه في 7 أكتوبر 2011
- ^ Baker, Brenda S. (فبراير 1993)، حول إيجاد التكرار في السلاسل والبرمجيات (تقرير فني)، AT&T Bell Laboratories، نيوجيرسي، مؤرشف من الأصل (gs) في 30 أكتوبر 2007
- ^ Khmelev, Dmitry V.; Teahan, William J. (2003), "A Repetition Based Measure for Verification of Text Collections and for Text Categorization", SIGIR'03: Proceedings of the 26th annual international ACM SIGIR conference on Research and development in information retrieval , ACM, pp. 104–110, CiteSeerX 10.1.1.9.6155 , doi :10.1145/860435.860456, ISBN 978-1581136463، S2CID 7316639
- ^ سي، أنطونيو؛ ليونج، هونغ فا؛ لاو، رينسون دبليو إتش (1997)، "التحقق: نظام الكشف عن الانتحال في المستندات"، SAC '97: وقائع ندوة ACM لعام 1997 حول الحوسبة التطبيقية (PDF) ، ACM، ص 70-77، doi :10.1145/331697.335176، ISBN 978-0-89791-850-3، S2CID 15273799
- ^ دريهر، هاينز (2007)، "التحليل المفاهيمي التلقائي للكشف عن الانتحال" (PDF) ، المعلومات وما بعدها: مجلة القضايا في إعلام العلوم وتكنولوجيا المعلومات ، 4 : 601-614، doi : 10.28945/974
- ^ Muhr, Markus; Zechner, Mario; Kern, Roman; Granitzer, Michael (2009), "External and Intrinsic Plagiarism Detection Using Vector Space Models", PAN09 - 3rd Workshop on Uncovering Plagiarism, Authorship and Social Software Misuse and 1st International Competition on Plagiarism Detection (PDF) , CEUR Workshop Proceedings, vol. 502, pp. 47–55, ISSN 1613-0073, محفوظ من الأصل (PDF) في 2 أبريل 2012
- ^ غيب ، بيلا (2014) ، كشف الانتحال القائم على الاستشهاد، أبحاث سبرينغر فيويغ، ISBN 978-3-658-06393-1
- ^ abcd Gipp, Bela; Beel, Jöran (June 2010), "Citation Based Plagiarism Detection - A New Approach to Identifying Plagiarized Work Language Independently", Proceedings of the 21st ACM Conference on Hypertext and Hypermedia (HT'10) (PDF) , ACM, pp. 273–274, doi :10.1145/1810617.1810671, ISBN 978-1-4503-0041-4، S2CID 2668037، تم أرشفته من الأصل (PDF) في 25 أبريل 2012 ، تم استرجاعه في 21 أكتوبر 2011
- ^ جيب، بيلا؛ موشكي، نورمان؛ بريتينجر، كورينا؛ ليبينسكي، ماريو؛ نورنبرجر، أندرياس (28 يوليو 2013)، "عرض تحليل نمط الاستشهاد للكشف عن الانتحال"، وقائع المؤتمر الدولي السادس والثلاثين لجمعية الحوسبة الآلية حول البحث والتطوير في استرجاع المعلومات (PDF) ، جمعية الحوسبة الآلية، ص. 1119، doi :10.1145/2484028.2484214، ISBN 9781450320344، S2CID 2106222
- ^ ab Gipp, Bela; Meuschke, Norman (سبتمبر 2011)، "خوارزميات مطابقة أنماط الاقتباس للكشف عن الانتحال القائم على الاقتباس: تقسيم الاقتباس الجشع، وتقسيم الاقتباس وأطول تسلسل اقتباس شائع"، وقائع ندوة ACM الحادية عشرة حول هندسة الوثائق (DocEng2011) (PDF) ، ACM، ص 249-258، doi :10.1145/2034691.2034741، ISBN 978-1-4503-0863-2، S2CID 207190305، تم أرشفته من الأصل (PDF) في 25 أبريل 2012 ، تم استرجاعه في 7 أكتوبر 2011
- ^ ab Gipp, Bela; Meuschke, Norman; Beel, Jöran (June 2011), "Comparative Evaluation of Text- and Citation-based Plagiarism Detection Approaches using GuttenPlag", Proceedings of 11th ACM/IEEE-CS Joint Conference on Digital Libraries (JCDL'11) (PDF) , ACM, pp. 255–258, CiteSeerX 10.1.1.736.4865 , doi :10.1145/1998076.1998124, ISBN 978-1-4503-0744-4، S2CID 3683238، تم أرشفته من الأصل (PDF) في 25 أبريل 2012 ، تم استرجاعه في 7 أكتوبر 2011
- ^ جيب، بيلا؛ بيل، يوران (يوليو 2009)، "تحليل تقارب الاقتباس (CPA) - نهج جديد لتحديد العمل ذي الصلة استنادًا إلى تحليل الاقتباس المشترك"، وقائع المؤتمر الدولي الثاني عشر للقياسات العلمية والمعلوماتية (ISSI'09) (PDF) ، الجمعية الدولية للقياسات العلمية والمعلوماتية، ص 571-575، ISSN 2175-1935، محفوظ من الأصل (PDF) في 13 سبتمبر 2012 ، تم استرجاعه في 7 أكتوبر 2011
- ^ هولمز، ديفيد آي. (1998)، "تطور أسلوب الكتابة في الدراسات الإنسانية"، الحوسبة الأدبية واللغوية ، 13 (3): 111-117، doi :10.1093/llc/13.3.111
- ^ جولا، باتريك (2006)، "إسناد المؤلف" (PDF) ، أسس واتجاهات استرجاع المعلومات ، 1 (3): 233-334، CiteSeerX 10.1.1.219.1605 ، doi :10.1561/1500000005، ISSN 1554-0669، مؤرشف من الأصل (PDF) في 24 أكتوبر 2020 ، تم استرجاعه في 7 أكتوبر 2011
- ^ ab Stein, Benno; Lipka, Nedim; Prettenhofer, Peter (2011), "Intrinsic Plagiarism Analysis" (PDF) , Language Resources and Evaluation , 45 (1): 63–82, doi :10.1007/s10579-010-9115-y, ISSN 1574-020X, S2CID 13426762, تم أرشفته من الأصل (PDF) في 2 أبريل 2012 , تم استرجاعه في 7 أكتوبر 2011
- ^ بنسالم، إيماني؛ روسو، باولو؛ شيخي، سليم (2019). "حول استخدام حروف n-gram كدليل جوهري وحيد على الانتحال". موارد اللغة والتقييم . 53 (3): 363-396. doi :10.1007/s10579-019-09444-w. hdl : 10251/159151 . S2CID 86630897.
- ^ Reimers, Nils; Gurevych, Iryna (2019). "Sentence-BERT: تضمين الجمل باستخدام شبكات BERT السيامية". arXiv : 1908.10084 [cs.CL].
- ^ Lan, Wuwei; Xu, Wei (2018). "نماذج الشبكات العصبية لتحديد العبارات المعاد صياغتها، والتشابه النصي الدلالي، واستدلال اللغة الطبيعية، والإجابة على الأسئلة". وقائع المؤتمر الدولي السابع والعشرين حول اللغويات الحاسوبية . سانتا في، نيو مكسيكو، الولايات المتحدة الأمريكية: جمعية اللغويات الحاسوبية: 3890-3902. arXiv : 1806.04330 .
- ^ Wahle, Jan Philip; Ruas, Terry; Foltýnek, Tomáš; Meuschke, Norman; Gipp, Bela (2022), Smits, Malte (ed.), "Identifying Machine-Paraphrased Plagiarism", Information for a Better World: Shaping the Global Future , Lecture Notes in Computer Science, vol. 13192, Cham: Springer International Publishing, pp. 393–413, arXiv : 2103.11909 , doi :10.1007/978-3-030-96957-8_34, ISBN 978-3-030-96956-1, S2CID 232307572 , تم الاسترجاع في 6 أكتوبر 2022
- ^ Portal Plagiat - Softwaretest 2004 (باللغة الألمانية)، HTW University of Applied Sciences Berlin، مؤرشف من الأصل في 25 أكتوبر 2011 ، تم استرجاعه في 6 أكتوبر 2011
- ^ بوابة Plagiat - Softwaretest 2008 (باللغة الألمانية)، جامعة HTW للعلوم التطبيقية في برلين ، تم استرجاعها في 6 أكتوبر 2011
- ^ ab Portal Plagiat - Softwaretest 2010 (باللغة الألمانية)، HTW University of Applied Sciences Berlin ، تم استرجاعه في 6 أكتوبر 2011
- ^ ab Potthast, Martin; Barrón-Cedeño, Alberto; Eiselt, Andreas; Stein, Benno; Rosso, Paolo (2010), "Overview of the 2nd International Competition on Plagiarism Detection", Notebook Papers of CLEF 2010 LABs and Workshops, 22–23 September, Padua, Italy (PDF) , تم أرشفة النسخة الأصلية (PDF) في 3 أبريل 2012 , تم استرجاعها في 7 أكتوبر 2011
- ^ ab Potthast, Martin; Eiselt, Andreas; Barrón-Cedeño, Alberto; Stein, Benno; Rosso, Paolo (2011), "Overview of the 3rd International Competition on Plagiarism Detection", Notebook Papers of CLEF 2011 LABs and Workshops, 19–22 September, Amsterdam, Netherlands (PDF) , تم أرشفته من الأصل (PDF) في 2 أبريل 2012 , تم استرجاعه في 7 أكتوبر 2011
- ^ بوتهاست ، مارتن. بارون سيدينيو، ألبرتو؛ شتاين، بينو. روسو ، باولو (2011)، “كشف الانتحال عبر اللغات” (PDF) ، موارد اللغة والتقييم ، 45 (1): 45-62، دوى :10.1007 / s10579-009-9114-z، hdl : 10251/37479 ، ISSN 1574-020X، S2CID 14942239، أرشفة من النسخة الأصلية (PDF) في 26 نوفمبر 2013 ، استرجاعها 7 أكتوبر 2011
- ^ Weber-Wulff, Debora (June 2008), "On the Utility of Plagiarism Detection Software", In Proceedings of the 3rd International Plagiarism Conference, Newcastle Upon Tyne (PDF) , تم أرشفته من الأصل (PDF) في 1 أكتوبر 2013 , تم استرجاعه في 29 سبتمبر 2013
- ^ كيفية التحقق من النص بحثًا عن الانتحال
- ^ "منع الانتحال واكتشافه - موارد على الإنترنت حول انتحال الكود المصدري" محفوظ في 15 نوفمبر 2012 على موقع واي باك مشين . أكاديمية التعليم العالي ، جامعة أولستر .
- ^ روي، شانشال كومار؛ كوردي، جيمس ر. (26 سبتمبر 2007). "دراسة استقصائية حول أبحاث اكتشاف استنساخ البرامج". كلية الحوسبة، جامعة كوينز، كندا .
- ^ براساد، سوهاني. "الانتحال وحقوق التأليف والنشر". CheckForPlag .
- ^ بريندا س. بيكر . برنامج لتحديد الكود المكرر. علوم الحوسبة والإحصاء، 24: 49-57، 1992.
- ^ Ira D. Baxter, et al. اكتشاف النسخ باستخدام أشجار بناء الجملة المجردة
- ^ الكشف البصري عن الكود المكرر محفوظ في 2006-06-29 على موقع واي باك مشين بواسطة Matthias Rieger, Stephane Ducasse.
- ^ Yuan, Y. وGuo, Y. CMCD: Count Matrix Based Code Clone Detection، في مؤتمر هندسة البرمجيات الثامن عشر لمنطقة آسيا والمحيط الهادئ لعام 2011. IEEE، ديسمبر 2011، ص 250-257.
- ^ تشن، إكس، ووانج، إيه واي، وتمبيرو، إي دي (2014). دراسات تكرار وإعادة إنتاج اكتشاف استنساخ الشفرة. في ACSC (صفحات 105-114).
- ^ بوليتشيف، بيتر، وماريوس مينيا. "اكتشاف التعليمات البرمجية المكررة باستخدام أداة مكافحة التوحيد." وقائع ندوة الربيع والصيف للباحثين الشباب حول هندسة البرمجيات. رقم 2. دعم الميزانية الحكومية الفيدرالية لمعهد نظام برمجة الأكاديمية الروسية، 2008.
الأدب
- كارول، ج. (2002). دليل لردع الانتحال في التعليم العالي . أكسفورد: مركز أكسفورد لتنمية الموظفين والتعلم، جامعة أكسفورد بروكس. (96 صفحة)، رقم ISBN 1873576560
- زيدمان، ب. (2011). دليل المحقق في الملكية الفكرية للبرمجيات . برنتيس هول. (480 صفحة)، رقم ISBN 0137035330
