تقدم كبير في الذكاء الاصطناعي طويل السياق

تقدم كبير في الذكاء الاصطناعي طويل السياق


قدمت Google Research ورقتين بحثيتين جديدتين، Titans وMIRAS، تهدفان إلى معالجة القيود المتزايدة في أنظمة الذكاء الاصطناعي الحديثة: التعامل مع فترات طويلة جدًا من المعلومات دون إبطاء أو فقدان السياق المهم. يركز كل من Titans وMIRAS معًا على منح النماذج طريقة منظمة للاحتفاظ بما يهم مع مرور الوقت، مما يسمح لهم بمتابعة المستندات أو المحادثات أو تدفقات البيانات الممتدة بمزيد من الاستمرارية.

العمارة جبابرة

Titans هي عائلة نموذجية تستخدم وحدة ذاكرة طويلة الأمد تتعلم بشكل فعال أثناء معالجة البيانات باستخدام “متري مفاجئ“.

المقياس المفاجئ عبارة عن إشارة خطأ داخلية، وهي طريقة رياضية للإشارة إلى أن “هذا غير متوقع!” تقيس هذه الإشارة الفرق بين ما يتذكره النموذج حاليًا وما تخبره به البيانات الجديدة الواردة. فهو يشير إلى أن المعلومات غير متوقعة أو مهمة بدرجة كافية لترتيبها حسب الأولوية للتخزين طويل المدى.

ولجعل ذلك فعالاً، تستخدم البنية ما يُعرف بالزخم، وهو تركيز مستمر، لتحديد مقدار تسلسلات البيانات الطويلة المحيطة التي تسجلها بالفعل. ويضمن ذلك استمرار النموذج في تحديد أولويات التفاصيل ذات الصلة التي تتبع تلك العلامة الأولية حتى لو لم تكن تلك التفاصيل اللاحقة مفاجئة بشكل فردي.

وأخيرًا، تستخدم بنية Titans آلية نسيان قابلة للتكيف، وهي طريقة رياضية لإزالة المعلومات القديمة أو الأقل فائدة تدريجيًا. ويضمن ذلك أنه أثناء معالجة النموذج لتسلسلات طويلة من البيانات، يمكنه التخلص من التفاصيل القديمة لإفساح المجال لمعلومات جديدة أكثر صلة.

من خلال الجمع بين هذه العناصر الثلاثة، مقياس المفاجأة (ما يجب ملاحظته)، والزخم (كمية التسجيل)، واضمحلال الوزن (ما يجب نسيانه)، تخلق بنية Titans نظام ذاكرة يظل حادًا وذو صلة بغض النظر عن كمية البيانات التي يعالجها.

إطار عمل MIRAS

في حين أن Titans عبارة عن عائلة نموذجية محددة، فإن MIRAS عبارة عن إطار عمل لتصميم نماذج التسلسل. إنه يعيد تصور هذه البنى باعتبارها ذاكرة ترابطية، وهي وحدات تتعلم كيفية ربط نقاط بيانات محددة مع بعضها البعض باستخدام هدف داخلي يخبر وحدة الذاكرة “كيفية” تعلم العلاقة بين أجزاء مختلفة من البيانات.

لبناء نموذج ضمن هذا الإطار، يتخذ المصممون أربعة خيارات أساسية:

  1. بنية الذاكرة: البنية المادية للذاكرة نفسها، والتي يمكن أن تتراوح من ناقلات بسيطة إلى طبقات MLP العميقة المستخدمة في Titans.
  2. الانحياز المقصود: الهدف الداخلي المحدد الذي يحدد كيفية قيام الذاكرة بتحديد أولويات المعلومات الواردة وربطها.
  3. استقرار الذاكرة والاحتفاظ بها: الآلية التي توازن بين تعلم معلومات جديدة والاحتفاظ بالحالة السابقة.
  4. خوارزمية الذاكرة: طريقة التعلم المستخدمة لتحديث الذاكرة، مثل طرق النسب المتدرج التي تسمح للنموذج بالتعلم في وقت الاختبار.

المشكلة: الذكاء الاصطناعي يمكنه المعالجة، لكنه يجد صعوبة في التذكر

تعتبر نماذج الذكاء الاصطناعي الحديثة فعالة في تحليل المعلومات الموجودة أمامها مباشرة. يبدأ التحدي مع نمو السياق بشكل كبير جدًا. مع امتداد المستندات أو مجموعات البيانات أو المحادثات لفترة أطول، تواجه النماذج مقايضة بين الحفاظ على التفاصيل وإبقاء التكلفة الحسابية تحت السيطرة.

تتعامل نماذج اللغة الحديثة عادةً مع السياق الطويل بإحدى طريقتين:

  1. نافذة الانتباه
    ويقومون بإعادة النظر في النص السابق مباشرةً عند الحاجة، وينظرون بشكل متكرر إلى الرموز المميزة السابقة لتحديد ما يهم بالنسبة للخطوة الحالية.
  2. ضغط الدولة
    إنهم يضغطون ما جاء من قبل في ملخص داخلي أصغر حتى يتمكنوا من الاستمرار في المضي قدمًا، وتداول التفاصيل من أجل الكفاءة.

كلا النهجين ناجحان، لكن كل منهما يبدأ في الانهيار مع نمو المدخلات لفترة أطول. مع نافذة الانتباه، تصبح إعادة النظر بشكل متكرر في المواد السابقة متطلبة بشكل متزايد في الموارد الحسابية، بينما مع ضغط الحالة، فإن ضغط ما جاء قبل المخاطرة بفقدان التفاصيل التي يتبين فيما بعد أنها ذات أهمية.

القيد ليس الحجم أو السرعة، بل الذاكرة. لا تتعامل الأنظمة الحالية مع الذاكرة كشيء يمكن إدارته بشكل متعمد أثناء الاستخدام. وبدلاً من ذلك، يعتمدون على أنماط معمارية ثابتة، إما المسح للخلف أو الضغط للأمام، دون طريقة منظمة لتحديد ما يجب الاحتفاظ به على مدى فترات طويلة.

يتعامل Titans وMIRAS مع هذه المشكلة من خلال التعامل مع الذاكرة كشيء يمكن للنماذج إدارته بشكل فعال بدلاً من وراثته بشكل سلبي من بنيتهم.

لماذا تم تقديم البحث في جزأين

تتطلب معالجة هذا القيد أكثر من تغيير تقني واحد. تتمثل إحدى الخطوات في إظهار أن النماذج يمكنها بالفعل إدارة الذاكرة بشكل مختلف في الممارسة العملية. والحل الآخر هو تطوير طريقة لتصميم مثل هذه الأنظمة بشكل متعمد بدلاً من التعامل مع كل بنية جديدة كحل لمرة واحدة.

وتعكس الورقتان تلك الاحتياجات:

  • يقدم أحدهما طريقة ملموسة لإعطاء النماذج شكلاً من أشكال الذاكرة طويلة المدى.
  • والآخر يوفر إطارًا لفهم وبناء النماذج حول تلك الفكرة.

جبابرة: إضافة شكل من أشكال الذاكرة طويلة المدى

يركز Titans على الجانب العملي للمشكلة. فهو يقدم بنية تمكن النموذج من تجميع المعلومات أثناء عمله. بدلاً من إعادة معالجة المدخلات السابقة بشكل متكرر أو ضغط كل شيء في تمثيل صغير، يمكن للنموذج نقل المعلومات المحددة بمرور الوقت.

على عكس الأنظمة التقليدية التي تستخدم ملخصًا بسيطًا وثابت الحجم، فإن هذه الوحدة عبارة عن شبكة عصبية عميقة يمكنها التقاط معلومات أكثر تعقيدًا وتفصيلاً.

الهدف هو تمكين العمل بمدخلات طويلة جدًا دون مسح الماضي بشكل متكرر أو فقدان التفاصيل الأساسية. لم يتم تقديم Titans كبديل لتصميمات النماذج الحالية. إنها طبقة إضافية يمكن دمجها معهم، لتوسيع كيفية تعاملهم مع السياق بدلاً من التخلص مما يعمل بالفعل.

MIRAS: إطار عمل لتصميم النماذج المعتمدة على الذاكرة

عندما يقدم Titans آلية محددة، تتراجع MIRAS وتنظر إلى مسألة التصميم الأوسع. فهو يتعامل مع نماذج التسلسل كأنظمة تقوم بتخزين الارتباطات وتحديثها بمرور الوقت، وتقترح طريقة منظمة للتفكير في كيفية عمل تلك الذاكرة.

بدلاً من عرض البنيات كفئات مختلفة بشكل أساسي، تنظمها MIRAS حول مجموعة صغيرة من خيارات التصميم المتعلقة بكيفية تخزين المعلومات ومطابقتها وتحديثها والاحتفاظ بها.

يوفر MIRAS طريقة لتفسير أنظمة مثل Titans وتطوير أنظمة جديدة دون البدء من الصفر.

اختبار ما إذا كان هذا النهج يعمل على تحسين التعامل مع السياق الطويل

لتحديد ما إذا كان هذا النهج القائم على الذاكرة يُترجم إلى ميزة عملية، قام الباحثون بتقييمه مقابل التصميمات الحالية للمهام التي يكون نطاق السياق فيها طويلًا للغاية.

في التقييمات طويلة السياق، تجاوزت Titans 2 مليون رمز مميز مع الحفاظ على دقة استرجاع أعلى من النماذج الأساسية التي تم اختبارها. في معيار BABILong، الذي يتطلب التفكير في الحقائق المدفونة في وثائق ضخمة، تفوقت Titans في الأداء على النماذج الأكبر حجمًا، بما في ذلك GPT-4، على الرغم من وجود معلمات أقل بكثير.

وتوضح ورقة MIRAS كذلك أن هذا النجاح لا يقتصر على نموذج واحد. ومن خلال اختبار العديد من الأنظمة المختلفة التي تم إنشاؤها باستخدام إطارها، أظهر الباحثون أن مبادئ التصميم هذه تنتج باستمرار نتائج عالية الأداء عبر مهام مختلفة.

تُظهر هذه التقييمات معًا أن الذاكرة المنظمة النشطة تمكن النماذج من الحفاظ على دقة عالية عبر مجموعات البيانات الضخمة دون المقايضة المعتادة في التكلفة الحسابية.

وأوضح الباحثون في Titans نتائجهم:

“يثبت تقييمنا التجريبي للمهام المتنوعة أن العمالقة أكثر فعالية من المحولات والنماذج الخطية المتكررة الحديثة، خصيصًا لـ
سياق طويل. وهذا يعني أن العمالقة يمكنهم التوسع إلى حجم نافذة سياق أكبر من 2 مليون بدقة أفضل من الخطوط الأساسية.

يشرح باحثو MIRAS لماذا يمثل MIRAS تقدمًا:

“في هذه الورقة، نقدم Miras، وهو إطار عام يشرح العلاقة بين التحسين عبر الإنترنت وحفظ وقت الاختبار. يمكن لإطار Miras أن يشرح دور العديد من الخيارات المعمارية القياسية في الأدب (على سبيل المثال، بوابة النسيان) ويساعد في تصميم الجيل التالي من البنى القادرة على إدارة الذاكرة بشكل أفضل.

بناءً على إطار عملنا، نقدم ثلاثة نماذج تسلسلية جديدة، لكل منها مزاياه (عيوبه). تُظهر تقييماتنا التجريبية أن كل هذه المتغيرات أقوى من المحولات وشبكات RNN الخطية، في مختلف المهام النهائية. في هذا العمل، نقدم مجموعة متنوعة من المتغيرات باستخدام Miras.

وفي المستقبل، يعد استكشاف هذه البنى البديلة لمختلف المهام النهائية اتجاهًا مستقبليًا مثيرًا للاهتمام.

استنتاجات الباحثين

خلصت ورقة Titans (PDF) إلى أن الجمع بين المعالجة قصيرة المدى والذاكرة المخصصة طويلة المدى يمكن أن يحسن كيفية تعامل النماذج مع المدخلات الموسعة دون الاعتماد فقط على نوافذ انتباه أكبر أو ضغط أكثر قوة. ويقدم هذا كقدرة إضافية يمكن دمجها مع البنى الحالية بدلاً من استبدالها.

تصف ورقة MIRAS نماذج التسلسل بأنها أنظمة تعتمد على الذاكرة ويمكن تصميمها ومقارنتها بشكل أكثر منهجية. يهدف إطار العمل الخاص بها إلى توجيه كيفية إنشاء هذه النماذج من خلال جعل سلوك الذاكرة بُعدًا تصميميًا واضحًا.

تتعامل كلتا الورقتين مع الذاكرة كشيء يمكن للنماذج إدارته بشكل متعمد: العمالقة من خلال إضافة آلية يمكنها تخزين المعلومات أثناء الاستخدام، وMIRAS من خلال وضع إطار عمل لتصميم ومقارنة النماذج التي تعتمد على الذاكرة.

يوضح منشور مدونة Google ما الذي يجعل Titans وMIRAS مهمًا:

“إن تقديم Titans وإطار MIRAS يمثل تقدمًا كبيرًا في نمذجة التسلسل. من خلال استخدام الشبكات العصبية العميقة كوحدات ذاكرة تتعلم الحفظ مع وصول البيانات، تتغلب هذه الأساليب على قيود الحالات المتكررة ذات الحجم الثابت.

علاوة على ذلك، يوفر MIRAS توحيدًا نظريًا قويًا، ويكشف عن العلاقة بين التحسين عبر الإنترنت والذاكرة الترابطية والتصميم المعماري. ومن خلال تجاوز النموذج الإقليدي القياسي، يفتح هذا البحث الباب أمام جيل جديد من نماذج التسلسل التي تجمع بين كفاءة شبكات RNN والقوة التعبيرية اللازمة لعصر الذكاء الاصطناعي طويل السياق.

لقد أثبتوا معًا أن الطريق إلى أداء أفضل في السياق الطويل لا يقتصر فقط على النوافذ الأكبر حجمًا أو النماذج الأكبر حجمًا، بل أيضًا على منح الذكاء الاصطناعي طريقة منظمة لإدارة ما يتذكره.

صورة مميزة بواسطة Shutterstock / AntonKhrupinArt



Source link

Postagens Similares

  • मे कोर अपडेटनंतर रेडडिटने प्रत्येक कोनाड्यात शीर्ष स्थान मिळवले

    100,000 कीवर्ड्सच्या SE रँकिंग विश्लेषणामध्ये असे आढळून आले की Reddit ने मे कोर अपडेटनंतर ट्रॅक केलेल्या सर्व 20 कोनाड्यांमध्ये त्याची शीर्ष 3 उपस्थिती वाढली आहे. पारदर्शकतेसाठी, SE रँकिंग रँक-ट्रॅकिंग आणि AI दृश्यमानता साधने विकते आणि डेटा त्याच्या स्वतःच्या कीवर्ड-निरीक्षण प्लॅटफॉर्मवरून येतो. डेटा सूचित करतो की Reddit सर्वात जास्त कोनाडामध्ये वाढला आहे जेथे लोक वैयक्तिक अनुभव…

  • ది క్యాండీ బిజినెస్ సైడ్ హస్టిల్: 12 ఉత్పత్తులు విక్రయించబడతాయి

    మీరు మీ కుటుంబం మునిగిపోతున్న నిధులకు నిధులు సమకూర్చడానికి, రాబోయే సెలవు ఖర్చులను కవర్ చేయడానికి లేదా రుణ చెల్లింపు ప్రణాళికలో అదనపు నగదును విసరడానికి వాస్తవిక మార్గం కోసం చూస్తున్నట్లయితే, వాస్తవానికి మీ జీవితానికి సరిపోయే సైడ్ హస్టిల్ మీకు అవసరం. మీరు ఇప్పటికే ఇంటి దినచర్యలు మరియు సాధారణ జీతంతో గారడీ చేస్తున్నప్పుడు, దుకాణం ముందరిని తెరవడానికి మీకు సమయం లేదా మూలధనం ఉండదు. ఇక్కడే మిఠాయి వ్యాపారం వైపు హస్టిల్ వస్తుంది. మిఠాయిని…

  • “Perché c’è una telecamera in diretta che guarda i bambini?” Fox 9 Stream of Splash Pad Kids suscita indignazione

    Fox 9, Minneapolis-St. Paul, aveva trasmesso uno streaming live 24 ore su 24 di bambini che giocavano in uno splash pad pubblico a Maple Grove, Minnesota, senza alcun preavviso visibile alle famiglie del parco. Un TikToker, la cui identità non è stata confermata nel post, ha scoperto lo streaming mentre controllava gli orari di apertura…

  • Dawn 洗碗皂和除草醋:最佳 DIY 除草剂

    如果杂草占据了您的车道裂缝、庭院边缘、碎石路、栅栏线或花园边界,您可能已经看到过流行的 DIY 食谱,使用 黎明洗洁精和醋除草。 这是听起来太简单的家庭疗法之一:拿醋,添加洗洁精,喷洒杂草,然后看着它们变干。 老实说,它是可行的——但有一些重要的限制。 醋会损坏杂草的叶部并使其变干,尤其是一年生幼草。洗碗皂可以帮助醋粘在叶子上,而不是立即滚落。但这种混合物并不神奇,通常也是如此 不是 杀死成熟杂草或坚韧多年生植物的深根。有些杂草可能在顶部看起来已经死了,然后从根部重新长出来。 而且,这种喷雾是非选择性的。这意味着它会损坏草、花、蔬菜、药草、灌木以及它接触到的任何植物。因此,它最适合人行道、砾石、摊铺机裂缝、车道接缝以及您不希望任何东西生长的地方。 关联公司披露: 这篇文章包含附属链接。如果您通过此页面上的链接购买,StylePersuit 可能会赚取少量佣金,而无需您支付额外费用。 黎明洗洁精和醋能杀死杂草吗? 是的,黎明洗洁精和醋可以杀死或烧掉许多小杂草,尤其是在温暖、阳光明媚、干燥的日子直接喷洒在叶子上时。 醋之所以起作用是因为醋酸。它从植物组织中吸收水分并导致叶子干燥。洗洁精充当表面活性剂,帮助醋扩散并粘附在蜡质叶子表面。 这款 DIY 除草剂最适合: 年轻的杂草 一年生小杂草 车道裂缝中杂草丛生 摊铺机之间的杂草 碎石路上的杂草 围墙边杂草丛生 人行道裂缝中杂草丛生 露台边缘周围有小杂草 它在以下方面效果较差: 主根深的蒲公英 旋花 百慕大草 马唐草丛 蓟 成熟的杂草 已扎根的杂草 从地下重新生长的多年生杂草 基于醋的除草剂通常对可见的顶部生长的损害比对根部的损害更大,因此较大或多年生杂草可能需要重复施用或物理清除。园艺界人士普遍指出,醋对幼小的杂草效果最好,但只能暂时烧掉成熟的杂草。 DIY黎明和醋除草剂配方 这是大多数人用于处理露台、摊铺机、砾石和车道裂缝的简单版本。 你需要: 1 加仑白醋,5% 酸度 1 汤匙 Dawn 洗洁精 花园喷雾器或喷雾瓶 漏斗 手套 可选:量匙 如何制作: 将醋倒入干净的花园喷雾器中。添加 1 汤匙…

  • ਆਪਣੀ ਸਮੱਗਰੀ ਦੀ ਯੋਜਨਾ ਕਿਵੇਂ ਬਣਾਈ ਜਾਵੇ (ਟੈਂਪਲੇਟ ਦੇ ਨਾਲ)

    ਮਾਰਕਿਟਰ ਅਤੇ ਕਾਰੋਬਾਰੀ ਮਾਲਕ ਵਿਕਲਪ ਦੇ ਲਈ ਵਿਖਾਈ ਗਏ ਹਨ ਜਦੋਂ ਬਹੁਤ ਸਾਰੇ ਸੋਸ਼ਲ ਮੀਡੀਆ ਪਲੇਟਫਾਰਮਾਂ ਦੀ ਗੱਲ ਆਉਂਦੀ ਹੈ ਤਾਂ Online ਨਲਾਈਨ ਹਾਜ਼ਰੀਨ ਦੇ ਉਤਪਾਦਨ ਲਈ ਉਪਲਬਧ ਹੁੰਦੇ ਹਨ. ਟਿੱਕਟੋਕ ਤੋਂ ਟਿੱਕਰੋਕ, ਲਿੰਕਡਇਨ ਤੋਂ ਪੈਟਰੇਨ ਤੱਕ, ਸੋਸ਼ਲ ਮੀਡੀਆ ਮਾਰਕੀਟਿੰਗ ਕਦੇ ਵਧੇਰੇ ਮਜਬੂਤ ਨਹੀਂ ਰਹੀ, ਜਾਂ, ਦਲੀਲਾਂ ਨਾਲ, ਸਮੇਂ-ਵਿਚਾਰ ਕਰਨ ਵਾਲੀ. ਪਰ ਇਹ ਹੋਣਾ ਨਹੀਂ…

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *