توربو كوانت
TurboQuant هي خوارزمية تكميم متجهي فورية لضغط المتجهات الإقليدية عالية الأبعاد مع الحفاظ على بنيتها الهندسية. طُرحت هذه الخوارزمية عام 2025 من قِبل أمير زانديه، وماجد دليري، وماجد هاديان، ووهاب ميروكني في ورقة بحثية بعنوان TurboQuant: تكميم متجهي فوري بمعدل تشويه شبه مثالي . [ 1 ] تشير الورقة البحثية إلى أن زانديه وميروكني ينتميان إلى قسم أبحاث جوجل ، ودليري إلى جامعة نيويورك ، وهاديان إلى جوجل ديب مايند . طُوّرت هذه الطريقة لتطبيقات تشمل استنتاج نماذج اللغة الكبيرة (LLM) ، وضغط ذاكرة التخزين المؤقت للقيم الرئيسية (KV) ، وقواعد بيانات المتجهات ، والبحث عن أقرب جار . [ 2 ]
يتألف برنامج TurboQuant من خوارزميتين مترابطتين: TurboQuant mse ، المُحسَّنة لحساب متوسط مربع الخطأ (MSE)، و TurboQuant prod ، المُحسَّنة لتقدير حاصل الضرب الداخلي غير المتحيز . تستخدم الخوارزمية تدويرًا عشوائيًا لمتجهات الإدخال، وتُطبِّق مُكمِّمات قياسية على الإحداثيات المُدوَّرة، ولتقدير حاصل الضرب الداخلي، تُطبِّق تحويل جونسون-ليندنستراوس الكمي أحادي البت (QJL) على الخطأ المتبقي. [ 1 ]
خلفية
التكميم المتجهي هو أسلوب ضغط يحوّل المتجهات عالية الأبعاد إلى مجموعة محدودة من الكلمات المشفرة. وتعود جذور هذه المشكلة إلى نظرية ترميز المصدر لشانون ونظرية معدل التشوه . [ 1 ] في مجال التعلم الآلي واسترجاع المعلومات ، يُستخدم التكميم المتجهي لتقليل الذاكرة المطلوبة لتخزين التضمينات ومتجهات التنشيط وغيرها من التمثيلات العددية.
في نماذج اللغة الكبيرة القائمة على Transformer ، تخزن ذاكرة التخزين المؤقت KV متجهات المفاتيح والقيم من الرموز السابقة أثناء فك التشفير التلقائي . يزداد حجم هذه الذاكرة مع طول السياق ، وعدد رؤوس الانتباه ، وعدد الطلبات المتزامنة، مما يجعلها عنق زجاجة رئيسيًا للذاكرة في خدمة نماذج اللغة الكبيرة. [ 1 ] تظهر مشاكل ضغط مماثلة في البحث المتجهي ، حيث يجب تخزين مجموعات كبيرة من متجهات التضمين والبحث فيها بكفاءة.
تشمل الأساليب السابقة لتكميم المتجهات تكميم الضرب، والتكميم القياسي ، وبناء دفتر رموز k-means المعتمد على البيانات . وتجادل ورقة TurboQuant بأن العديد من الطرق الحالية إما تتطلب معالجة مسبقة ومعايرة غير متصلة بالإنترنت أو تعاني من ضمانات تشويه دون المستوى الأمثل في البيئات المتصلة بالإنترنت. [ 1 ]
الخوارزمية
TurboQuant mse
TurboQuant mse هو إصدار من الخوارزمية مُحسَّن لحساب متوسط مربع الخطأ. بالنسبة لمتجه الوحدةتقوم الخوارزمية أولاً بتطبيق مصفوفة دوران عشوائيةوالمجموعات تتبع كل إحداثية من إحداثيات المتجه المُدار توزيع بيتا مُزاح ومُقاس ، والذي يتقارب إلى التوزيع الطبيعي في الأبعاد العالية. في الأبعاد العالية، تصبح الإحداثيات المختلفة مستقلة تقريبًا، مما يسمح للخوارزمية بتطبيق مُكمِّمات قياسية بشكل مستقل على كل إحداثية. [ 1 ]
يتم بناء المُكمِّم القياسي عن طريق حل مسألة تكميم أحادية البعد مستمرة باستخدام خوارزمية k-means أو خوارزمية Lloyd-Max . إذا كانت مراكز الثقل ، تخزن خطوة التكميم، لكل إحداثية،
أثناء عملية إزالة التكميم، يتم استبدال الفهرس المخزن لكل إحداثية بالمركز المقابل، مما يعطي متجهًا مُعاد بناؤه بعد تدويره.ثم تقوم الخوارزمية بالعودة إلى الوضع السابق: [ 1 ]
تُقدّم الورقة البحثية الحدّ التالي لمتوسط مربعات الخطأ في برنامج TurboQuant : كما يُشير التقرير إلى قيم MSE أكثر دقة تبلغ حوالي 0.36 و0.117 و0.03 و0.009 لعرض البتاتعلى التوالي. [ 1 ]
منتج TurboQuant
تم تحسين TurboQuant prod لتقدير الضرب الداخلي غير المتحيز. ويشير المؤلفون إلى أن المُكمِّم المُحسَّن باستخدام MSE قد يُدخل تحيزًا عند استخدامه لتقدير الضرب الداخلي. ولمعالجة ذلك، يطبق TurboQuant prod أولًا TurboQuant mse مع عرض البتثم يطبق تحويل جونسون-ليندنستراوس الكمي أحادي البت على متجه الباقي المتبقي. [ 1 ]
يترك ليكن الباقي بعد التكميم باستخدام متوسط مربع الخطأ، وليكن تخزن خطوة QJL متجه إشارة للباقي.ويمكن كتابة ذلك باستخدام الباقي المعياري : أينهي مصفوفة إسقاط عشوائية. وبما أن دالة الإشارة ثابتة تحت إعادة التحجيم الموجب، فإن هذا يكافئ ما يلي: متى. لو، التصحيح المتبقي يساوي صفرًا.
يخزن برنامج TurboQuant prod عملية التكميم MSE، ومتجه إشارة QJL، والمعيار المتبقي:
يُعاد بناء المتجه غير المُكمّم على النحو التالي:
تثبت الورقة البحثية أن برنامج TurboQuant prod غير متحيز لتقدير المنتج الداخلي: كما أنه يحدد حد التشوه
الأداء والتطبيقات
تشير ورقة بحثية حول TurboQuant إلى أن الخوارزمية تحقق معدلات تشويه شبه مثالية ضمن عامل ثابت صغير للحدود الدنيا لنظرية المعلومات. ويذكر الباحثون أنه بالنسبة لتكميم ذاكرة التخزين المؤقت KV ، حققت TurboQuant حيادية الجودة عند 3.5 بت لكل قناة وتدهورًا طفيفًا عند 2.5 بت لكل قناة. [ 1 ]
في تجارب تحليل اللغة الطبيعية طويلة السياق باستخدام برنامج Llama 3.1 8B Instruct، قيّمت الورقة البحثية الطريقة على مهمة استرجاع "الإبرة في كومة قش" بأطوال مستندات تتراوح من 4000 إلى 104000 رمز. وأفادت بأن TurboQuant حقق أداءً مطابقًا للخط الأساسي غير المضغوط ذي الدقة الكاملة مع استخدام ضغط يزيد عن 4 أضعاف، وقارنت الطريقة مع PolarQuant وSnapKV وPyramidKV وKIVI. [ 1 ]
ذكرت أبحاث جوجل أن TurboQuant خضع للتقييم على معايير قياس الأداء طويلة المدى، بما في ذلك LongBench وNeedle in a Haystack وZeroSCROLLS وRULER وL-Eval، باستخدام نماذج مفتوحة المصدر مثل Gemma و Mistral . [ 2 ] ووفقًا لتقرير نُشر في موقع Tom's Hardware ، وصفت جوجل هذه الطريقة بأنها تُقلل حجم ذاكرة التخزين المؤقت للقيم والمفاتيح بمقدار ستة أضعاف على الأقل، وتحقق تحسنًا يصل إلى ثمانية أضعاف في حساب دالة لوجيت الانتباه على وحدات معالجة الرسومات Nvidia H100 مقارنةً بالمفاتيح غير المُكمّمة ذات 32 بت. [ 3 ]
تم تطبيق TurboQuant أيضًا على البحث عن المتجهات الأقرب جارًا. وتتناول الورقة البحثية الأصلية تجارب على تضمينات كيانات DBpedia وتضمينات GloVe ، وتقارن TurboQuant مع تكميم المنتج وأساسيات تكميم البحث عن المتجهات الأخرى. [ 1 ]
العلاقة بالأساليب الأخرى
يرتبط برنامج TurboQuant بالعديد من الطرق لاستنتاج نماذج اللغة الكبيرة بكفاءة والبحث عالي الأبعاد:
- تكميم المنتج – تقنية تكميم متجهية تُستخدم على نطاق واسع للبحث التقريبي عن أقرب جار
- التكميم (التعلم الآلي) - تقليل الدقة العددية للأوزان أو التنشيطات أو الموترات المخزنة مؤقتًا في نماذج التعلم الآلي
- PagedAttention – خوارزمية لإدارة الذاكرة لخدمة LLM تقلل من التجزئة في ذاكرة التخزين المؤقت KV
- معضلة جونسون-ليندنستراوس – نتيجة في الهندسة عالية الأبعاد تُستخدم في طرق الإسقاط العشوائي
- خوارزمية لويد – خوارزمية للتكميم القياسي والمتجهي، بما في ذلك بناء دفتر رموز على غرار خوارزمية k-means
على عكس PagedAttention ، الذي يركز على تخصيص الذاكرة وتخطيط ذاكرة التخزين المؤقت، يقلل TurboQuant من تكلفة التخزين العددي للمتجهات نفسها. وعلى عكس العديد من طرق التكميم بالضرب، صُمم TurboQuant ليكون غير معتمد على البيانات ويعمل عبر الإنترنت، متجنبًا تدريب دفتر الترميز الخاص بمجموعة البيانات. [ 1 ]
القيود
تستند أقوى الادعاءات المتعلقة بأداء TurboQuant إلى الورقة البحثية الأصلية ومنشورات جوجل للأبحاث. وقد أشارت التغطية الإعلامية التقنية إلى أن التأثير الأوسع لهذه الطريقة سيعتمد على تفاصيل التنفيذ في الواقع العملي، وأحمال العمل، وبنى الأجهزة. [ 4 ]
انظر أيضاً
- البحث عن أقرب جار تقريبًا
- آليات الانتباه
- ذاكرة ذات نطاق ترددي عالٍ
- قائمة خوارزميات الذكاء الاصطناعي
- قائمة خوارزميات ضغط البيانات
- مخطط الخوارزميات
- vLLM – محرك استدلال LLM مفتوح المصدر يستخدم خوارزمية PagedAttention لتحسين كفاءة ذاكرة التخزين المؤقت للقيم الرئيسية
- نقص عالمي في إمدادات الذاكرة من عام 2024 وحتى الآن
- AlphaDev و AlphaEvolve و AlphaTensor — أنظمة ذكاء اصطناعي من تطوير Google DeepMind لاكتشاف الخوارزميات وتحسينها
مراجع
- 1 2 3 4 5 6 7 8 9 10 11 12 13 زانديه، أمير؛ دليري، ماجد؛ هاديان، ماجد؛ ميروكني، وهاب (28 أبريل 2025). "TurboQuant: التكميم المتجهي عبر الإنترنت بمعدل تشويه شبه مثالي". arXiv : 2504.19874 [ cs.LG ].
- 1 2 زانديه، أمير؛ ميروكني، وهاب (24 مارس 2026). "TurboQuant: إعادة تعريف كفاءة الذكاء الاصطناعي من خلال الضغط الفائق" . مدونة أبحاث جوجل . تم الاطلاع عليه في 23 أبريل 2026 .
- ↑ جيمس، لوك (25 مارس 2026). "تقنية TurboQuant من جوجل تُقلل متطلبات سعة ذاكرة التخزين المؤقت لنموذج التعلم العميق للذكاء الاصطناعي بمقدار ستة أضعاف على الأقل - ما يُحسّن الأداء حتى ثمانية أضعاف على وحدات معالجة الرسومات Nvidia H100، ويضغط ذاكرة التخزين المؤقت للقيم إلى 3 بتات دون أي فقدان في الدقة" . موقع Tom's Hardware . تاريخ الاسترجاع: 23 أبريل 2026 .
- ↑ أودينموين، إيفوسا (29 مارس 2026). ""ورقة غش رقمية فائقة السرعة": جوجل تكشف النقاب عن خوارزمية ضغط الذكاء الاصطناعي TurboQuant، التي تدّعي أنها قادرة على تقليل استخدام ذاكرة LLM بشكل كبير . TechRadar . تم الاطلاع عليه بتاريخ 23 أبريل 2026 .
- الخوارزميات
- ضغط البيانات
- استخراج البيانات
- استرجاع المعلومات
- خوارزميات الضغط مع فقدان البيانات
