التجميع

الترتيب هو تجميع المعلومات المكتوبة وفق ترتيب معياري. تعتمد العديد من أنظمة الترتيب على الترتيب العددي أو الترتيب الأبجدي ، أو على امتدادات وتركيبات منهما. يُعد الترتيب عنصرًا أساسيًا في معظم أنظمة حفظ الملفات المكتبية ، وفهارس المكتبات ، والكتب المرجعية .

يختلف التجميع عن التصنيف في أن الفئات نفسها ليست بالضرورة مرتبة. ومع ذلك، حتى لو كان ترتيب الفئات غير ذي صلة، فقد تكون مُعرّفات الفئات عناصر في مجموعة مرتبة، مما يسمح لخوارزمية الفرز بترتيب العناصر حسب الفئة.

من الناحية الرسمية، تحدد طريقة الترتيب عادةً ترتيبًا كليًا على مجموعة من المعرفات الممكنة، والتي تسمى مفاتيح الفرز، والتي تنتج بالتالي ترتيبًا مسبقًا كليًا على مجموعة عناصر المعلومات (لا يتم وضع العناصر التي لها نفس المعرف في أي ترتيب محدد).

تُحدد خوارزمية الترتيب، مثل خوارزمية ترتيب يونيكود، ترتيبًا من خلال مقارنة سلسلتين نصيتين مُعطيتين وتحديد أيّهما يجب أن يسبق الآخر. بعد تحديد الترتيب بهذه الطريقة، يُمكن استخدام خوارزمية فرز لوضع قائمة من أي عدد من العناصر وفقًا لهذا الترتيب.

تتمثل الميزة الرئيسية للترتيب في أنه يُسهّل على المستخدم العثور على عنصر في القائمة، أو التأكد من عدم وجوده فيها. في الأنظمة الآلية، يُمكن تحقيق ذلك باستخدام خوارزمية البحث الثنائي أو البحث الاستيفائي ؛ أما البحث اليدوي فيُمكن إجراؤه باستخدام إجراء مشابه تقريبًا، وإن كان غالبًا ما يتم بشكل غير واعٍ. ومن المزايا الأخرى سهولة العثور على العنصر الأول أو الأخير في القائمة (وهو أمر مفيد على الأرجح في حالة البيانات المرتبة رقميًا)، أو العناصر ضمن نطاق محدد (وهو أمر مفيد أيضًا في حالة البيانات الرقمية، وكذلك مع البيانات المرتبة أبجديًا عندما يكون المستخدم متأكدًا فقط من الأحرف القليلة الأولى للعنصر أو العناصر المطلوبة).

الطلب

رقمي وزمني

يمكن ترتيب السلاسل النصية التي تمثل الأرقام بناءً على قيم الأرقام التي تمثلها. على سبيل المثال، "−4"، "2.5"، "10"، "89"، "30,000". قد لا يوفر التطبيق المباشر لهذه الطريقة سوى ترتيب جزئي للسلاسل النصية، حيث يمكن لسلاسل نصية مختلفة أن تمثل الرقم نفسه (كما هو الحال مع "2" و"2.0"، أو عند استخدام الترميز العلمي ، "2e3" و"2000").

يمكن اتباع نهج مماثل مع السلاسل التي تمثل التواريخ أو العناصر الأخرى التي يمكن ترتيبها زمنيًا أو بطريقة طبيعية أخرى.

أبجديًا

يُعدّ الترتيب الأبجدي أساسًا للعديد من أنظمة التجميع ، حيث تُعرَّف عناصر المعلومات بسلاسل تتألف أساسًا من حروف الأبجدية . ويعتمد ترتيب هذه السلاسل على وجود ترتيب معياري لحروف الأبجدية المعنية. (لا يقتصر هذا النظام على الأبجديات بالمعنى التقني الدقيق؛ فاللغات التي تستخدم نظامًا مقطعيًا أو أبجديًا ، مثل لغة الشيروكي ، يمكنها استخدام مبدأ الترتيب نفسه شريطة وجود ترتيب مُحدد للرموز المستخدمة).

لتحديد أي سلسلتين تأتي أولاً في الترتيب الأبجدي، تُقارن الأحرف الأولى منهما. السلسلة التي يظهر حرفها الأول أولاً في الترتيب الأبجدي تأتي أولاً. إذا كان الحرفان الأولان متطابقين، تُقارن الأحرف الثانية، وهكذا حتى يُحسم الترتيب. (إذا نفدت الأحرف المتاحة للمقارنة في إحدى السلسلتين، تُعتبر هي الأولى؛ على سبيل المثال، كلمة "cart" تأتي قبل كلمة "carthorse"). نتيجة ترتيب مجموعة من السلاسل أبجديًا هي تجميع الكلمات التي تبدأ بنفس الحرف معًا، وضمن هذه المجموعة تُجمع الكلمات التي تبدأ بنفس الحرفين الأولين معًا، وهكذا.

تُعامل الأحرف الكبيرة عادةً على أنها مكافئة للأحرف الصغيرة المقابلة لها. (للاطلاع على طرق معالجة بديلة في الأنظمة المحوسبة، انظر قسم "الترتيب الآلي " أدناه).

قد تُطبق بعض القيود والتعقيدات والاتفاقيات الخاصة عند استخدام الترتيب الأبجدي:

  • عندما تحتوي السلاسل النصية على مسافات أو فواصل أخرى بين الكلمات، يجب اتخاذ قرار بشأن تجاهل هذه الفواصل أو التعامل معها كرموز تسبق جميع حروف الأبجدية الأخرى. على سبيل المثال، إذا تم اتباع النهج الأول، فستأتي كلمة "car park" بعد كلمتي "carbon" و"carp" (كما لو كانت مكتوبة "carpark")، بينما في النهج الثاني، ستأتي كلمة "car park" قبل هاتين الكلمتين. تُستخدم القاعدة الأولى في العديد من القواميس (وليس جميعها) ، بينما تُستخدم الثانية في أدلة الهاتف (بحيث يظهر اسم ويلسون، جيم ك مع أسماء أخرى تحمل اسم ويلسون، جيم وليس بعد اسم ويلسون، جيمبو).
  • يمكن التعامل مع الاختصارات كما لو كانت مكتوبة كاملة. على سبيل المثال، غالبًا ما تُرتّب الأسماء التي تحتوي على "St." (اختصارًا للكلمة الإنجليزية Saint ) كما لو كانت مكتوبة "Saint". وهناك أيضًا عرفٌ شائع في اللغة الإنجليزية يقضي بأن تُدرج الألقاب التي تبدأ بـ Mc و M' كما لو كانت هذه البادئات مكتوبة Mac .
  • غالباً ما تُرتّب الأسماء الشخصية أبجدياً حسب اسم العائلة، حتى لو كان الاسم الأول أولاً. على سبيل المثال، يجب ترتيب اسمي خوان هيرنانديز وبريان أوليري كالتالي: "هيرنانديز، خوان" و"أوليري، بريان" على التوالي، حتى لو لم يُكتبا بهذه الطريقة.
  • غالباً ما يتم تجاهل الكلمات الأولية الشائعة جداً، مثل "The" في اللغة الإنجليزية، لأغراض الفرز. لذا سيتم فرز فيلم The Shining على أنه "Shining" أو "Shining, The".
  • عندما تحتوي بعض السلاسل النصية على أرقام (أو رموز أخرى غير حروف)، تتوفر عدة طرق. أحيانًا تُعامل هذه الرموز كما لو كانت تسبق أو تلي جميع حروف الأبجدية. طريقة أخرى هي ترتيب الأرقام أبجديًا كما تُكتب: على سبيل المثال، يُرتب الرقم 1776 كما لو كان مكتوبًا "سبعة عشر ستة وسبعون"، و 24 ساعة في سباق لومان كما لو كانت مكتوبة "vingt-quatre..." (أي "أربعة وعشرون" بالفرنسية). عندما تُستخدم الأرقام أو الرموز الأخرى كأشكال رسومية خاصة للحروف، كما في 1337 اختصارًا لكلمة "leet " أو Se7en اختصارًا لعنوان الفيلم "Seven" ، يمكن ترتيبها كما لو كانت تلك الحروف.
  • تختلف اللغات في اصطلاحاتها المتعلقة بترتيب الحروف المُعدَّلة وبعض تركيبات الحروف. ففي الإسبانية ، على سبيل المثال، يُعامل الحرف ñ كحرف أساسي بعد الحرف n ، وكان الحرفان المركبان ch و ll يُعاملان سابقًا (حتى عام ١٩٩٤) كحرفين أساسيين بعد الحرفين c و l ، مع أنهما يُرتبان الآن أبجديًا كتركيبات من حرفين. ويمكن الاطلاع على قائمة بهذه الاصطلاحات في مختلف اللغات في قسم "الترتيب الأبجدي" ضمن "  اصطلاحات خاصة بكل لغة" .

في العديد من اللغات، تغيرت القواعد بمرور الوقت، ولذا قد تستخدم القواميس القديمة ترتيبًا مختلفًا عن القواميس الحديثة. علاوة على ذلك، قد يعتمد الترتيب على الاستخدام. على سبيل المثال، تستخدم القواميس الألمانية وأدلة الهاتف أساليب مختلفة.

فرز الجذور

تقوم بعض القواميس العربية ، مثل قاموس هانز وير ثنائي اللغة "قاموس اللغة العربية المكتوبة الحديثة" ، بتجميع وفرز الكلمات العربية حسب الجذر السامي . [ 1 ] على سبيل المثال، الكلمات "كتابة" ( كتابة "كتابة")، كتاب ( كتاب "كتاب")، كاتب ( كاتب "كاتب")، مكتوب ( مكتبة 'مكتبة')، مكتوب ( مكتب 'مكتب')، مكتوب ( مكتوب "مصير" أو "مكتوب")، مجمعة تحت الجذر الثلاثي k - t - b ( ك ت ب )، الذي يشير إلى "الكتابة". [ 2 ]

فرز الجذور والخطوط

يُعدّ فرز الجذور والخطوط شكلاً آخر من أشكال الترتيب ، ويُستخدم لأنظمة الكتابة غير الأبجدية مثل الهانزي الصينية والكانجي اليابانية ، التي تتحدى آلاف رموزها الترتيبَ التقليدي. في هذا النظام، تُحدَّد المكونات المشتركة للأحرف؛ وتُسمى هذه المكونات بالجذور في الصينية والأنظمة التصويرية المشتقة منها. ثم تُجمَّع الأحرف حسب جذرها الأساسي، ثم تُرتَّب حسب عدد خطوط القلم داخل كل جذر. عندما لا يوجد جذر واضح أو يوجد أكثر من جذر، يُحدَّد الجذر المستخدم في الترتيب وفقًا للعرف. على سبيل المثال، يُصنَّف الحرف الصيني 妈 (بمعنى "أم") كحرف بستة خطوط تحت الجذر الأساسي 女 (بمعنى "امرأة") ذي الثلاثة خطوط.

يُعدّ نظام الجذر والخط مُرهِقًا مُقارنةً بالنظام الأبجدي الذي يضمّ عددًا قليلًا من الأحرف، جميعها واضحة لا لبس فيها. ولا يُعدّ اختيار مُكوّنات الرمز التصويري التي تُشكّل جذورًا مُنفصلة، ​​وتحديد الجذر الأساسي، أمرًا واضحًا تمامًا. ونتيجةً لذلك، غالبًا ما تُكمّل اللغات التصويرية ترتيب الجذر والخط بترتيب أبجدي لتحويل صوتي للرموز التصويرية. على سبيل المثال، يُمكن ترتيب كلمة الكانجي Tōkyō (東京) كما لو كانت مكتوبة بأحرف الهيراغانا اليابانية المقطعية على النحو التالي: "to-u-ki- yo -u" (とうきょう)، باستخدام الترتيب التقليدي لهذه الأحرف.

بالإضافة إلى ذلك، يمكن أيضاً فرز الأحرف الصينية حسب ترتيب كتابة كل سطر . في الصين الكبرى، يُعدّ ترتيب كتابة اسم العائلة وفقاً لترتيب كتابة كل سطر عرفاً سائداً في بعض الوثائق الرسمية التي تُدرج فيها أسماء الأشخاص دون ترتيب هرمي.

الأتمتة

عند تخزين المعلومات في أنظمة رقمية، قد تصبح عملية الترتيب آلية. عندئذٍ، يصبح من الضروري تطبيق خوارزمية ترتيب مناسبة تسمح بفرز المعلومات بطريقة مُرضية للتطبيق المعني. غالبًا ما يكون الهدف هو تحقيق ترتيب أبجدي أو رقمي يتبع المعايير القياسية الموضحة في الأقسام السابقة. مع ذلك، ليس من السهل أتمتة جميع هذه المعايير. [ 3 ]

يعتمد أبسط أنواع الترتيب الآلي على الرموز العددية للرموز في مجموعة أحرف ، مثل ترميز ASCII (أو أي من مجموعاته الفرعية مثل Unicode )، حيث تُرتّب الرموز تصاعديًا وفقًا لرموزها العددية، ويُعمّم هذا الترتيب على السلاسل النصية وفقًا للمبادئ الأساسية للترتيب الأبجدي (أو الترتيب المعجمي رياضيًا ). فعلى سبيل المثال، قد يتعامل برنامج حاسوبي مع الأحرف a و b و C و d و $ على أنها مُرتبة كالتالي: $ ، C ، a ، b ، d (رموز ASCII المقابلة هي $ = 36، a = 97، b = 98، C = 67، و d = 100). وبالتالي، تُرتّب السلاسل النصية التي تبدأ بالأحرف C أو M أو Z قبل السلاسل النصية التي تبدأ بالأحرف الصغيرة a و b ، وهكذا. ويُطلق على هذا أحيانًا اسم الترتيب الأبجدي ASCII . يختلف هذا عن الترتيب الأبجدي القياسي، لا سيما بسبب ترتيب الأحرف الكبيرة قبل جميع الأحرف الصغيرة (وربما طريقة التعامل مع المسافات والرموز الأخرى غير الأحرف). ولذلك، يُطبق غالبًا مع بعض التعديلات، وأبرزها تحويل حالة الأحرف (غالبًا إلى أحرف كبيرة، لأسباب تاريخية [ ملاحظة 1 ] ) قبل مقارنة قيم ASCII.

في العديد من خوارزميات الترتيب، لا تعتمد المقارنة على الرموز العددية للأحرف، بل على تسلسل الترتيب - وهو تسلسل يُفترض أن الأحرف تتبعه لغرض الترتيب - بالإضافة إلى قواعد ترتيب أخرى مناسبة للتطبيق المحدد. وهذا يُسهم في تطبيق الاصطلاحات الصحيحة المستخدمة في الترتيب الأبجدي في اللغة المعنية، مع مراعاة التعامل السليم مع الأحرف ذات الأحرف الكبيرة والصغيرة، والأحرف المعدلة ، والثنائيات ، والاختصارات الخاصة، وما إلى ذلك، كما ذُكر أعلاه في قسم الترتيب الأبجدي ، وبمزيد من التفصيل في مقالة الترتيب الأبجدي . قد تكون هذه الخوارزميات معقدة للغاية، وربما تتطلب عدة مراجعات للنص. [ 3 ]

ومع ذلك، لا تزال المشاكل شائعة عندما يتعين على الخوارزمية أن تشمل أكثر من لغة. على سبيل المثال، في القواميس الألمانية ، تأتي كلمة ökonomisch بين كلمتي offenbar و olfaktorisch ، بينما تعامل القواميس التركية الحرفين o و ö كحرفين مختلفين، فتضع oyun قبل öbür .

تُعدّ خوارزمية ترتيب يونيكود خوارزمية قياسية لترتيب أي مجموعة من السلاسل النصية المؤلفة من أي رموز يونيكود قياسية . ويمكن تكييف هذه الخوارزمية لاستخدام تسلسل الترتيب المناسب للغة معينة عن طريق تعديل جدول الترتيب الافتراضي الخاص بها. وتُجمع العديد من هذه التعديلات في مستودع بيانات اللغات المشتركة .

فرز المفاتيح

في بعض التطبيقات، قد تختلف السلاسل النصية التي تُرتّب بها العناصر عن المعرّفات المعروضة. على سبيل المثال، قد يُرتّب فيلم "The Shining" على النحو التالي: Shining, The (انظر الترتيب الأبجدي أعلاه)، ولكن قد يُراد عرضه على النحو التالي: The Shining . في هذه الحالة، يمكن تخزين مجموعتين من السلاسل النصية، إحداهما لأغراض العرض، والأخرى لأغراض الترتيب. تُسمى السلاسل النصية المستخدمة للترتيب بهذه الطريقة بمفاتيح الترتيب .

مشاكل في الأرقام

أحيانًا، يُفضّل ترتيب النصوص التي تحتوي على أرقام باستخدام الترتيب العددي الصحيح. على سبيل المثال، يظهر "الشكل 7ب" قبل "الشكل 11أ"، مع أن الرقم 7 يأتي بعد الرقم 1 في نظام يونيكود . ويمكن تطبيق هذا على الأرقام الرومانية . ليس من الصعب تحقيق هذا السلوك طالما أن المطلوب فرز الأعداد الصحيحة فقط، مع أنه قد يُبطئ عملية الفرز بشكل ملحوظ. على سبيل المثال، يقوم نظام مايكروسوفت ويندوز بذلك عند فرز أسماء الملفات . يُسمى ترتيب الفرز الأساسي بالترتيب الطبيعي .

يُعدّ فرز الأرقام العشرية بشكل صحيح أكثر صعوبةً بعض الشيء، لأنّ اللغات المختلفة تستخدم رموزًا مختلفة للفاصلة العشرية ، وأحيانًا يُستخدم الحرف نفسه كفاصل ، كما في المثال "القسم 3.2.5". لا توجد إجابة واحدة موحدة لكيفية فرز هذه السلاسل النصية؛ فالقواعد تعتمد على التطبيق.

وضع ملصقات على الأصناف المطلوبة

في بعض السياقات، لا تُستخدم الأرقام والحروف كأساس لتحديد الترتيب، بل كوسيلة لترقيم العناصر المرتبة أصلاً. على سبيل المثال، تُرقّم الصفحات والأقسام والفصول وما شابهها، بالإضافة إلى عناصر القوائم، بهذه الطريقة. تشمل سلاسل الترقيم المستخدمة الأرقام العربية (1، 2، 3، ...)، والأرقام الرومانية (I، II، III، ... أو i، ii، iii، ...)، أو الحروف (A، B، C، ... أو a، b، c، ...). (ثمة طريقة بديلة للإشارة إلى عناصر القوائم، دون ترقيمها، وهي استخدام قائمة نقطية ).

عند استخدام حروف الأبجدية لغرض التعداد ، توجد اصطلاحات لغوية محددة بشأن الحروف المستخدمة. على سبيل المثال، تُحذف الحروف الروسية Ъ و Ь (التي تُستخدم في الكتابة فقط لتعديل الحرف الساكن السابق لها )، وعادةً ما تُحذف أيضًا الحروف Ы و Й و Ё. كذلك، في العديد من اللغات التي تستخدم الأبجدية اللاتينية الموسعة ، لا تُستخدم الحروف المعدلة غالبًا في التعداد.

انظر أيضاً

ملحوظات

  1. تاريخياً، كانت أجهزة الكمبيوتر تتعامل فقط مع النصوص المكتوبة بأحرف كبيرة (يعود هذا إلى اتفاقيات التلغراف ).

مراجع

  1. أبو حيدر، ج. أ. (1983). "مراجعة قاموس اللغة العربية الحديثة المكتوبة (عربي-إنجليزي)". نشرة كلية الدراسات الشرقية والأفريقية، جامعة لندن . 46 (2): 351-353 . doi : 10.1017/S0041977X00079040 . ISSN 0041-977X . JSTOR 615409 .  
  2. "قاموس هانز وير العربي-الإنجليزي" . ejtaal.net . تم الاطلاع عليه بتاريخ 2023-06-04 .
  3. برمجة 1 2 M: دليل شامل ، ريتشارد ف. والترز، دار النشر الرقمية، 1997