تقدم كبير في الذكاء الاصطناعي طويل السياق
قدمت Google Research ورقتين بحثيتين جديدتين، Titans وMIRAS، تهدفان إلى معالجة القيود المتزايدة في أنظمة الذكاء الاصطناعي الحديثة: التعامل مع فترات طويلة جدًا من المعلومات دون إبطاء أو فقدان السياق المهم. يركز كل من Titans وMIRAS معًا على منح النماذج طريقة منظمة للاحتفاظ بما يهم مع مرور الوقت، مما يسمح لهم بمتابعة المستندات أو المحادثات أو تدفقات البيانات الممتدة بمزيد من الاستمرارية.
العمارة جبابرة
Titans هي عائلة نموذجية تستخدم وحدة ذاكرة طويلة الأمد تتعلم بشكل فعال أثناء معالجة البيانات باستخدام “متري مفاجئ“.
المقياس المفاجئ عبارة عن إشارة خطأ داخلية، وهي طريقة رياضية للإشارة إلى أن “هذا غير متوقع!” تقيس هذه الإشارة الفرق بين ما يتذكره النموذج حاليًا وما تخبره به البيانات الجديدة الواردة. فهو يشير إلى أن المعلومات غير متوقعة أو مهمة بدرجة كافية لترتيبها حسب الأولوية للتخزين طويل المدى.
ولجعل ذلك فعالاً، تستخدم البنية ما يُعرف بالزخم، وهو تركيز مستمر، لتحديد مقدار تسلسلات البيانات الطويلة المحيطة التي تسجلها بالفعل. ويضمن ذلك استمرار النموذج في تحديد أولويات التفاصيل ذات الصلة التي تتبع تلك العلامة الأولية حتى لو لم تكن تلك التفاصيل اللاحقة مفاجئة بشكل فردي.
وأخيرًا، تستخدم بنية Titans آلية نسيان قابلة للتكيف، وهي طريقة رياضية لإزالة المعلومات القديمة أو الأقل فائدة تدريجيًا. ويضمن ذلك أنه أثناء معالجة النموذج لتسلسلات طويلة من البيانات، يمكنه التخلص من التفاصيل القديمة لإفساح المجال لمعلومات جديدة أكثر صلة.
من خلال الجمع بين هذه العناصر الثلاثة، مقياس المفاجأة (ما يجب ملاحظته)، والزخم (كمية التسجيل)، واضمحلال الوزن (ما يجب نسيانه)، تخلق بنية Titans نظام ذاكرة يظل حادًا وذو صلة بغض النظر عن كمية البيانات التي يعالجها.
إطار عمل MIRAS
في حين أن Titans عبارة عن عائلة نموذجية محددة، فإن MIRAS عبارة عن إطار عمل لتصميم نماذج التسلسل. إنه يعيد تصور هذه البنى باعتبارها ذاكرة ترابطية، وهي وحدات تتعلم كيفية ربط نقاط بيانات محددة مع بعضها البعض باستخدام هدف داخلي يخبر وحدة الذاكرة “كيفية” تعلم العلاقة بين أجزاء مختلفة من البيانات.
لبناء نموذج ضمن هذا الإطار، يتخذ المصممون أربعة خيارات أساسية:
- بنية الذاكرة: البنية المادية للذاكرة نفسها، والتي يمكن أن تتراوح من ناقلات بسيطة إلى طبقات MLP العميقة المستخدمة في Titans.
- الانحياز المقصود: الهدف الداخلي المحدد الذي يحدد كيفية قيام الذاكرة بتحديد أولويات المعلومات الواردة وربطها.
- استقرار الذاكرة والاحتفاظ بها: الآلية التي توازن بين تعلم معلومات جديدة والاحتفاظ بالحالة السابقة.
- خوارزمية الذاكرة: طريقة التعلم المستخدمة لتحديث الذاكرة، مثل طرق النسب المتدرج التي تسمح للنموذج بالتعلم في وقت الاختبار.
المشكلة: الذكاء الاصطناعي يمكنه المعالجة، لكنه يجد صعوبة في التذكر
تعتبر نماذج الذكاء الاصطناعي الحديثة فعالة في تحليل المعلومات الموجودة أمامها مباشرة. يبدأ التحدي مع نمو السياق بشكل كبير جدًا. مع امتداد المستندات أو مجموعات البيانات أو المحادثات لفترة أطول، تواجه النماذج مقايضة بين الحفاظ على التفاصيل وإبقاء التكلفة الحسابية تحت السيطرة.
تتعامل نماذج اللغة الحديثة عادةً مع السياق الطويل بإحدى طريقتين:
- نافذة الانتباه
ويقومون بإعادة النظر في النص السابق مباشرةً عند الحاجة، وينظرون بشكل متكرر إلى الرموز المميزة السابقة لتحديد ما يهم بالنسبة للخطوة الحالية. - ضغط الدولة
إنهم يضغطون ما جاء من قبل في ملخص داخلي أصغر حتى يتمكنوا من الاستمرار في المضي قدمًا، وتداول التفاصيل من أجل الكفاءة.
كلا النهجين ناجحان، لكن كل منهما يبدأ في الانهيار مع نمو المدخلات لفترة أطول. مع نافذة الانتباه، تصبح إعادة النظر بشكل متكرر في المواد السابقة متطلبة بشكل متزايد في الموارد الحسابية، بينما مع ضغط الحالة، فإن ضغط ما جاء قبل المخاطرة بفقدان التفاصيل التي يتبين فيما بعد أنها ذات أهمية.
القيد ليس الحجم أو السرعة، بل الذاكرة. لا تتعامل الأنظمة الحالية مع الذاكرة كشيء يمكن إدارته بشكل متعمد أثناء الاستخدام. وبدلاً من ذلك، يعتمدون على أنماط معمارية ثابتة، إما المسح للخلف أو الضغط للأمام، دون طريقة منظمة لتحديد ما يجب الاحتفاظ به على مدى فترات طويلة.
يتعامل Titans وMIRAS مع هذه المشكلة من خلال التعامل مع الذاكرة كشيء يمكن للنماذج إدارته بشكل فعال بدلاً من وراثته بشكل سلبي من بنيتهم.
لماذا تم تقديم البحث في جزأين
تتطلب معالجة هذا القيد أكثر من تغيير تقني واحد. تتمثل إحدى الخطوات في إظهار أن النماذج يمكنها بالفعل إدارة الذاكرة بشكل مختلف في الممارسة العملية. والحل الآخر هو تطوير طريقة لتصميم مثل هذه الأنظمة بشكل متعمد بدلاً من التعامل مع كل بنية جديدة كحل لمرة واحدة.
وتعكس الورقتان تلك الاحتياجات:
- يقدم أحدهما طريقة ملموسة لإعطاء النماذج شكلاً من أشكال الذاكرة طويلة المدى.
- والآخر يوفر إطارًا لفهم وبناء النماذج حول تلك الفكرة.
جبابرة: إضافة شكل من أشكال الذاكرة طويلة المدى
يركز Titans على الجانب العملي للمشكلة. فهو يقدم بنية تمكن النموذج من تجميع المعلومات أثناء عمله. بدلاً من إعادة معالجة المدخلات السابقة بشكل متكرر أو ضغط كل شيء في تمثيل صغير، يمكن للنموذج نقل المعلومات المحددة بمرور الوقت.
على عكس الأنظمة التقليدية التي تستخدم ملخصًا بسيطًا وثابت الحجم، فإن هذه الوحدة عبارة عن شبكة عصبية عميقة يمكنها التقاط معلومات أكثر تعقيدًا وتفصيلاً.
الهدف هو تمكين العمل بمدخلات طويلة جدًا دون مسح الماضي بشكل متكرر أو فقدان التفاصيل الأساسية. لم يتم تقديم Titans كبديل لتصميمات النماذج الحالية. إنها طبقة إضافية يمكن دمجها معهم، لتوسيع كيفية تعاملهم مع السياق بدلاً من التخلص مما يعمل بالفعل.
MIRAS: إطار عمل لتصميم النماذج المعتمدة على الذاكرة
عندما يقدم Titans آلية محددة، تتراجع MIRAS وتنظر إلى مسألة التصميم الأوسع. فهو يتعامل مع نماذج التسلسل كأنظمة تقوم بتخزين الارتباطات وتحديثها بمرور الوقت، وتقترح طريقة منظمة للتفكير في كيفية عمل تلك الذاكرة.
بدلاً من عرض البنيات كفئات مختلفة بشكل أساسي، تنظمها MIRAS حول مجموعة صغيرة من خيارات التصميم المتعلقة بكيفية تخزين المعلومات ومطابقتها وتحديثها والاحتفاظ بها.
يوفر MIRAS طريقة لتفسير أنظمة مثل Titans وتطوير أنظمة جديدة دون البدء من الصفر.
اختبار ما إذا كان هذا النهج يعمل على تحسين التعامل مع السياق الطويل
لتحديد ما إذا كان هذا النهج القائم على الذاكرة يُترجم إلى ميزة عملية، قام الباحثون بتقييمه مقابل التصميمات الحالية للمهام التي يكون نطاق السياق فيها طويلًا للغاية.
في التقييمات طويلة السياق، تجاوزت Titans 2 مليون رمز مميز مع الحفاظ على دقة استرجاع أعلى من النماذج الأساسية التي تم اختبارها. في معيار BABILong، الذي يتطلب التفكير في الحقائق المدفونة في وثائق ضخمة، تفوقت Titans في الأداء على النماذج الأكبر حجمًا، بما في ذلك GPT-4، على الرغم من وجود معلمات أقل بكثير.
وتوضح ورقة MIRAS كذلك أن هذا النجاح لا يقتصر على نموذج واحد. ومن خلال اختبار العديد من الأنظمة المختلفة التي تم إنشاؤها باستخدام إطارها، أظهر الباحثون أن مبادئ التصميم هذه تنتج باستمرار نتائج عالية الأداء عبر مهام مختلفة.
تُظهر هذه التقييمات معًا أن الذاكرة المنظمة النشطة تمكن النماذج من الحفاظ على دقة عالية عبر مجموعات البيانات الضخمة دون المقايضة المعتادة في التكلفة الحسابية.
وأوضح الباحثون في Titans نتائجهم:
“يثبت تقييمنا التجريبي للمهام المتنوعة أن العمالقة أكثر فعالية من المحولات والنماذج الخطية المتكررة الحديثة، خصيصًا لـ
سياق طويل. وهذا يعني أن العمالقة يمكنهم التوسع إلى حجم نافذة سياق أكبر من 2 مليون بدقة أفضل من الخطوط الأساسية.
يشرح باحثو MIRAS لماذا يمثل MIRAS تقدمًا:
“في هذه الورقة، نقدم Miras، وهو إطار عام يشرح العلاقة بين التحسين عبر الإنترنت وحفظ وقت الاختبار. يمكن لإطار Miras أن يشرح دور العديد من الخيارات المعمارية القياسية في الأدب (على سبيل المثال، بوابة النسيان) ويساعد في تصميم الجيل التالي من البنى القادرة على إدارة الذاكرة بشكل أفضل.
بناءً على إطار عملنا، نقدم ثلاثة نماذج تسلسلية جديدة، لكل منها مزاياه (عيوبه). تُظهر تقييماتنا التجريبية أن كل هذه المتغيرات أقوى من المحولات وشبكات RNN الخطية، في مختلف المهام النهائية. في هذا العمل، نقدم مجموعة متنوعة من المتغيرات باستخدام Miras.
وفي المستقبل، يعد استكشاف هذه البنى البديلة لمختلف المهام النهائية اتجاهًا مستقبليًا مثيرًا للاهتمام.
استنتاجات الباحثين
خلصت ورقة Titans (PDF) إلى أن الجمع بين المعالجة قصيرة المدى والذاكرة المخصصة طويلة المدى يمكن أن يحسن كيفية تعامل النماذج مع المدخلات الموسعة دون الاعتماد فقط على نوافذ انتباه أكبر أو ضغط أكثر قوة. ويقدم هذا كقدرة إضافية يمكن دمجها مع البنى الحالية بدلاً من استبدالها.
تصف ورقة MIRAS نماذج التسلسل بأنها أنظمة تعتمد على الذاكرة ويمكن تصميمها ومقارنتها بشكل أكثر منهجية. يهدف إطار العمل الخاص بها إلى توجيه كيفية إنشاء هذه النماذج من خلال جعل سلوك الذاكرة بُعدًا تصميميًا واضحًا.
تتعامل كلتا الورقتين مع الذاكرة كشيء يمكن للنماذج إدارته بشكل متعمد: العمالقة من خلال إضافة آلية يمكنها تخزين المعلومات أثناء الاستخدام، وMIRAS من خلال وضع إطار عمل لتصميم ومقارنة النماذج التي تعتمد على الذاكرة.
يوضح منشور مدونة Google ما الذي يجعل Titans وMIRAS مهمًا:
“إن تقديم Titans وإطار MIRAS يمثل تقدمًا كبيرًا في نمذجة التسلسل. من خلال استخدام الشبكات العصبية العميقة كوحدات ذاكرة تتعلم الحفظ مع وصول البيانات، تتغلب هذه الأساليب على قيود الحالات المتكررة ذات الحجم الثابت.
علاوة على ذلك، يوفر MIRAS توحيدًا نظريًا قويًا، ويكشف عن العلاقة بين التحسين عبر الإنترنت والذاكرة الترابطية والتصميم المعماري. ومن خلال تجاوز النموذج الإقليدي القياسي، يفتح هذا البحث الباب أمام جيل جديد من نماذج التسلسل التي تجمع بين كفاءة شبكات RNN والقوة التعبيرية اللازمة لعصر الذكاء الاصطناعي طويل السياق.
لقد أثبتوا معًا أن الطريق إلى أداء أفضل في السياق الطويل لا يقتصر فقط على النوافذ الأكبر حجمًا أو النماذج الأكبر حجمًا، بل أيضًا على منح الذكاء الاصطناعي طريقة منظمة لإدارة ما يتذكره.
صورة مميزة بواسطة Shutterstock / AntonKhrupinArt
