مقياس التقييم

مقياس التقييم هو مجموعة من الفئات المصممة للحصول على معلومات حول سمة كمية أو نوعية . في العلوم الاجتماعية ، وخاصة علم النفس ، من الأمثلة الشائعة مقياس ليكرت ومقاييس التقييم من 0 إلى 10، حيث يختار الشخص الرقم الذي يعكس الجودة المتصورة للمنتج .

خلفية

مقياس التقييم هو أسلوب يتطلب من المُقيِّم تعيين قيمة، وأحيانًا قيمة رقمية، للكائن المُقيَّم، كمقياس لبعض السمات المُقيَّمة.

أنواع مقاييس التقييم

يمكن تصنيف جميع مقاييس التقييم إلى أحد هذه الأنواع:

  1. مقياس التقييم العددي (NRS)
  2. مقياس التقييم اللفظي (VRS)
  3. مقياس التناظر البصري (VAS)
  4. ليكرت
  5. مقياس التقييم البياني
  6. مقياس تصنيف بياني وصفي

تُقاس بعض البيانات على المستوى الترتيبي . تشير الأرقام إلى الموقع النسبي للعناصر، وليس إلى حجم الاختلاف. عادةً ما تكون مقاييس المواقف والآراء ترتيبية؛ ومن الأمثلة على ذلك مقياس ليكرت للاستجابة .

إفادة
مثال: "لا أستطيع العيش بدون جهاز الكمبيوتر الخاص بي".
خيارات الاستجابة
  1. أختلف بشدة
  2. غير موافق
  3. حيادي
  4. يوافق
  5. أوافق بشدة

تُقاس بعض البيانات على مستوى الفترات . تشير الأرقام إلى مقدار الفرق بين العناصر، ولكن لا توجد نقطة صفر مطلقة. ومن الأمثلة الجيدة على ذلك مقياس درجة الحرارة فهرنهايت/مئوية، حيث تُعدّ الفروق بين الأرقام مهمة، بينما لا يُؤخذ موقع الصفر في الاعتبار.

تُقاس بعض البيانات على مستوى النسبة . تشير الأرقام إلى حجم الفرق، وهناك نقطة صفر ثابتة. يمكن حساب النسب. ومن الأمثلة على ذلك: العمر، والدخل، والسعر، والتكاليف، وإيرادات المبيعات، وحجم المبيعات، والحصة السوقية.

يتطلب قياس موقف أو تصور ما أكثر من سؤال واحد في مقياس التقييم، وذلك بسبب الحاجة إلى إجراء مقارنات إحصائية بين الفئات في نموذج راش متعدد التصنيفات للفئات المرتبة. [ 1 ] في نظرية الاختبار الكلاسيكية ، يلزم أكثر من سؤال واحد للحصول على مؤشر موثوقية داخلية مثل معامل ألفا لكرونباخ ، [ 2 ] وهو معيار أساسي لتقييم فعالية مقياس التقييم.

مقاييس التقييم المستخدمة عبر الإنترنت

تُستخدم مقاييس التقييم على نطاق واسع عبر الإنترنت في محاولة لتقديم مؤشرات على آراء المستهلكين حول المنتجات. ومن أمثلة المواقع التي تستخدم مقاييس التقييم: IMDb و Epinions.com و Yahoo! Movies و Amazon.com و BoardGameGeek و TV.com ، والتي تستخدم مقياس تقييم من 0 إلى 100 للحصول على "توصيات أفلام مُخصصة".

في معظم الحالات، لا تسمح أنظمة التقييم عبر الإنترنت إلا بتقييم واحد لكل مستخدم لكل منتج، باستثناء بعض المواقع مثل Ratings.net التي تتيح للمستخدمين تقييم المنتجات بناءً على عدة معايير. كما أن معظم هذه المواقع لا تقدم وصفًا نوعيًا كافيًا لفئات التقييم، باستثناء مواقع مثل Yahoo! Movies التي تصنف كل فئة بين F و A+، و BoardGameGeek التي تقدم وصفًا تفصيليًا لكل فئة من 1 إلى 10. غالبًا ما يقتصر الوصف على الفئتين الأعلى والأدنى، كما هو الحال في موقع IMDb .

صحة

تشير الصلاحية إلى مدى دقة أداة القياس في قياس ما صُممت لقياسه. فعندما يُقيّم كل مستخدم منتجًا مرة واحدة فقط، مثلاً في فئة من 1 إلى 10، لا توجد وسيلة لتقييم الموثوقية الداخلية باستخدام مؤشر مثل معامل ألفا لكرونباخ . وبالتالي، يستحيل تقييم صلاحية التقييمات كمؤشرات لتصورات المشاهدين. ويتطلب إثبات الصلاحية إثبات كل من الموثوقية والدقة (أي أن التقييمات تمثل ما يُفترض أن تمثله). وتُحدد درجة صلاحية أداة القياس من خلال تطبيق المنطق أو الإجراءات الإحصائية. "تكون عملية القياس صالحة بقدر ما تقيس ما صُممت لقياسه."

تتمثل إحدى القضايا الأساسية الأخرى في أن التقييمات عبر الإنترنت عادة ما تتضمن أخذ عينات ملائمة تشبه إلى حد كبير استطلاعات الرأي التلفزيونية، أي أنها لا تمثل سوى آراء أولئك الذين يميلون إلى تقديم التقييمات.

تُعنى الصلاحية بجوانب مختلفة من عملية القياس. يستخدم كل نوع من هذه الأنواع المنطق أو التحقق الإحصائي أو كليهما لتحديد درجة الصلاحية، وله قيمة خاصة في ظروف معينة. تشمل أنواع الصلاحية صلاحية المحتوى، والصلاحية التنبؤية، وصلاحية البناء.

أخذ العينات

قد تؤدي أخطاء المعاينة إلى نتائج متحيزة، أو ذات صلة بفئة فرعية محددة فقط. لنأخذ هذا المثال: لنفترض أن فيلمًا ما يجذب جمهورًا متخصصًا فقط - 90% منهم من عشاق هذا النوع من الأفلام، و10% فقط من المهتمين بالأفلام عمومًا. لنفترض أن الفيلم يحظى بشعبية كبيرة بين المشاهدين، وأن من يُقيّمونه عبر الإنترنت هم فقط من لديهم مشاعر قوية تجاهه؛ وبالتالي، فإن جميع المُقيّمين هم من عشاق هذا النوع. قد يؤدي هذا المزيج إلى تقييمات عالية جدًا للفيلم، لا يمكن تعميمها على من شاهدوه (أو حتى من قيّموه).

الوصف النوعي

يُحسّن الوصف النوعي للفئات من فائدة مقياس التقييم. على سبيل المثال، إذا اقتصرت النقاط على الدرجات من 1 إلى 10 دون وصف، فقد يختار البعض الدرجة 10 نادرًا، بينما قد يختارها آخرون كثيرًا. أما إذا وُصفت الدرجة 10 بأنها "شبه مثالية"، فمن المرجح أن تحمل الفئة المعنى نفسه لدى مختلف الأشخاص. وينطبق هذا على جميع الفئات، وليس فقط على الدرجات القصوى.

تتفاقم المشكلات المذكورة أعلاه عند استخدام الإحصاءات المجمعة، كالمتوسطات، في قوائم المنتجات وتصنيفاتها. وتُعدّ تقييمات المستخدمين، في أحسن الأحوال، تصنيفات ترتيبية . ورغم شيوع حساب المتوسطات أو المعدلات لهذه البيانات، إلا أن ذلك غير مُبرر، إذ يتطلب حساب المتوسطات فواصل زمنية متساوية لتمثيل الفرق نفسه بين مستويات الجودة المُدركة. وتتلخص المشكلات الرئيسية المتعلقة بالبيانات المجمعة، والمستندة إلى أنواع مقاييس التقييم الشائعة الاستخدام على الإنترنت، فيما يلي:

  • لا ينبغي حساب المتوسطات لبيانات من النوع الذي تم جمعه.
  • عادة ما يكون من المستحيل تقييم موثوقية أو صحة تقييمات المستخدمين.
  • لا تتم مقارنة المنتجات وفقًا لمعايير صريحة، ناهيك عن المعايير المشتركة.
  • لا يقوم بذلك إلا المستخدمون الذين يميلون إلى تقديم تقييم للمنتج.
  • لا يتم عادةً نشر البيانات بشكل يسمح بتقييم تصنيفات المنتج.

وتشمل المنهجيات الأكثر تطوراً أساليب نمذجة الاختيار أو أساليب الفرق الأقصى ، ويرتبط الأخير بنموذج راش بسبب العلاقة بين قانون ثورستون للحكم المقارن ونموذج راش.

تخفيض مقياس التصنيف

قدم جهد بحثي تعاوني دولي [ 3 ] خوارزمية تعتمد على البيانات لتقليل مقياس التقييم. وهي تستند إلى المساحة تحت منحنى خصائص تشغيل المستقبل .

الأصول

أُعيد تقييم الأصول التاريخية لمقاييس التقييم بعد اكتشاف أثري هام في تبليسي، جورجيا ، عام ٢٠١٠. فقد عثر المنقبون على لوح يعود تاريخه إلى أوائل العصور الوسطى، منقوش عليه كتابة جورجية قديمة. [ ٤ ] يُظهر هذا اللوح سلسلة من العلامات الخطية، التي فُسِّرت على أنها شكل مبكر لمقياس التقييم. وقد قدمت النقوش رؤى ثاقبة حول أساليب القياس والتقييم في العصور الوسطى، مما يشير إلى نسخة بدائية من مقاييس التقييم الحديثة. ويُحفظ هذا الاكتشاف حاليًا في المتحف الوطني لجورجيا . [ ٥ ]

انظر أيضاً

مراجع

  1. أندريتش، ديفيد (ديسمبر 1978). "صياغة تصنيف لفئات الاستجابة المرتبة". مجلة القياس النفسي . 43 (4): 561-573 . doi : 10.1007/BF02293814 . S2CID 120687848 . 
  2. كرونباخ، لي ج. (سبتمبر 1951). "معامل ألفا والبنية الداخلية للاختبارات". مجلة القياس النفسي . 16 (3): 297-334 . CiteSeerX 10.1.1.452.6417 . doi : 10.1007/BF02310555 . S2CID 13820448 .  
  3. كوتشكوداي، فالديمار دبليو؛ كاكياشفيلي، تي؛ شيمانسكا، إيه؛ مونتيرو-مارين، جيه؛ أرايا، آر؛ غارسيا-كامبايو، جيه؛ روتكوفسكي، كيه؛ سترزالكا، دي. (2017). "كيفية تقليل عدد بنود مقياس التقييم دون فقدان القدرة على التنبؤ؟" . علم القياسات . 111 (2): 581-593 (2017). doi : 10.1007/s11192-017-2283-4 . PMC 5400800. PMID 28490822 .  
  4. "البحث عن أفضل ما في العالم" عطلات نهاية الأسبوع - عطلات نهاية الأسبوع شكرا لك "هل من الممكن؟" . რადიო თავისუფლება (باللغة الجورجية). 2022-09-21 . تم الاسترجاع 2024-01-17 .
  5. ""هذا هو الحال، أفضل ما في الأمر """""""""""""""""" شكرا لك هذا هو الحال." . თავისუფლება (باللغة الجورجية). تم الاسترجاع 2022-06-17 .