تقدم كبير في الذكاء الاصطناعي طويل السياق

تقدم كبير في الذكاء الاصطناعي طويل السياق


قدمت Google Research ورقتين بحثيتين جديدتين، Titans وMIRAS، تهدفان إلى معالجة القيود المتزايدة في أنظمة الذكاء الاصطناعي الحديثة: التعامل مع فترات طويلة جدًا من المعلومات دون إبطاء أو فقدان السياق المهم. يركز كل من Titans وMIRAS معًا على منح النماذج طريقة منظمة للاحتفاظ بما يهم مع مرور الوقت، مما يسمح لهم بمتابعة المستندات أو المحادثات أو تدفقات البيانات الممتدة بمزيد من الاستمرارية.

العمارة جبابرة

Titans هي عائلة نموذجية تستخدم وحدة ذاكرة طويلة الأمد تتعلم بشكل فعال أثناء معالجة البيانات باستخدام “متري مفاجئ“.

المقياس المفاجئ عبارة عن إشارة خطأ داخلية، وهي طريقة رياضية للإشارة إلى أن “هذا غير متوقع!” تقيس هذه الإشارة الفرق بين ما يتذكره النموذج حاليًا وما تخبره به البيانات الجديدة الواردة. فهو يشير إلى أن المعلومات غير متوقعة أو مهمة بدرجة كافية لترتيبها حسب الأولوية للتخزين طويل المدى.

ولجعل ذلك فعالاً، تستخدم البنية ما يُعرف بالزخم، وهو تركيز مستمر، لتحديد مقدار تسلسلات البيانات الطويلة المحيطة التي تسجلها بالفعل. ويضمن ذلك استمرار النموذج في تحديد أولويات التفاصيل ذات الصلة التي تتبع تلك العلامة الأولية حتى لو لم تكن تلك التفاصيل اللاحقة مفاجئة بشكل فردي.

وأخيرًا، تستخدم بنية Titans آلية نسيان قابلة للتكيف، وهي طريقة رياضية لإزالة المعلومات القديمة أو الأقل فائدة تدريجيًا. ويضمن ذلك أنه أثناء معالجة النموذج لتسلسلات طويلة من البيانات، يمكنه التخلص من التفاصيل القديمة لإفساح المجال لمعلومات جديدة أكثر صلة.

من خلال الجمع بين هذه العناصر الثلاثة، مقياس المفاجأة (ما يجب ملاحظته)، والزخم (كمية التسجيل)، واضمحلال الوزن (ما يجب نسيانه)، تخلق بنية Titans نظام ذاكرة يظل حادًا وذو صلة بغض النظر عن كمية البيانات التي يعالجها.

إطار عمل MIRAS

في حين أن Titans عبارة عن عائلة نموذجية محددة، فإن MIRAS عبارة عن إطار عمل لتصميم نماذج التسلسل. إنه يعيد تصور هذه البنى باعتبارها ذاكرة ترابطية، وهي وحدات تتعلم كيفية ربط نقاط بيانات محددة مع بعضها البعض باستخدام هدف داخلي يخبر وحدة الذاكرة “كيفية” تعلم العلاقة بين أجزاء مختلفة من البيانات.

لبناء نموذج ضمن هذا الإطار، يتخذ المصممون أربعة خيارات أساسية:

  1. بنية الذاكرة: البنية المادية للذاكرة نفسها، والتي يمكن أن تتراوح من ناقلات بسيطة إلى طبقات MLP العميقة المستخدمة في Titans.
  2. الانحياز المقصود: الهدف الداخلي المحدد الذي يحدد كيفية قيام الذاكرة بتحديد أولويات المعلومات الواردة وربطها.
  3. استقرار الذاكرة والاحتفاظ بها: الآلية التي توازن بين تعلم معلومات جديدة والاحتفاظ بالحالة السابقة.
  4. خوارزمية الذاكرة: طريقة التعلم المستخدمة لتحديث الذاكرة، مثل طرق النسب المتدرج التي تسمح للنموذج بالتعلم في وقت الاختبار.

المشكلة: الذكاء الاصطناعي يمكنه المعالجة، لكنه يجد صعوبة في التذكر

تعتبر نماذج الذكاء الاصطناعي الحديثة فعالة في تحليل المعلومات الموجودة أمامها مباشرة. يبدأ التحدي مع نمو السياق بشكل كبير جدًا. مع امتداد المستندات أو مجموعات البيانات أو المحادثات لفترة أطول، تواجه النماذج مقايضة بين الحفاظ على التفاصيل وإبقاء التكلفة الحسابية تحت السيطرة.

تتعامل نماذج اللغة الحديثة عادةً مع السياق الطويل بإحدى طريقتين:

  1. نافذة الانتباه
    ويقومون بإعادة النظر في النص السابق مباشرةً عند الحاجة، وينظرون بشكل متكرر إلى الرموز المميزة السابقة لتحديد ما يهم بالنسبة للخطوة الحالية.
  2. ضغط الدولة
    إنهم يضغطون ما جاء من قبل في ملخص داخلي أصغر حتى يتمكنوا من الاستمرار في المضي قدمًا، وتداول التفاصيل من أجل الكفاءة.

كلا النهجين ناجحان، لكن كل منهما يبدأ في الانهيار مع نمو المدخلات لفترة أطول. مع نافذة الانتباه، تصبح إعادة النظر بشكل متكرر في المواد السابقة متطلبة بشكل متزايد في الموارد الحسابية، بينما مع ضغط الحالة، فإن ضغط ما جاء قبل المخاطرة بفقدان التفاصيل التي يتبين فيما بعد أنها ذات أهمية.

القيد ليس الحجم أو السرعة، بل الذاكرة. لا تتعامل الأنظمة الحالية مع الذاكرة كشيء يمكن إدارته بشكل متعمد أثناء الاستخدام. وبدلاً من ذلك، يعتمدون على أنماط معمارية ثابتة، إما المسح للخلف أو الضغط للأمام، دون طريقة منظمة لتحديد ما يجب الاحتفاظ به على مدى فترات طويلة.

يتعامل Titans وMIRAS مع هذه المشكلة من خلال التعامل مع الذاكرة كشيء يمكن للنماذج إدارته بشكل فعال بدلاً من وراثته بشكل سلبي من بنيتهم.

لماذا تم تقديم البحث في جزأين

تتطلب معالجة هذا القيد أكثر من تغيير تقني واحد. تتمثل إحدى الخطوات في إظهار أن النماذج يمكنها بالفعل إدارة الذاكرة بشكل مختلف في الممارسة العملية. والحل الآخر هو تطوير طريقة لتصميم مثل هذه الأنظمة بشكل متعمد بدلاً من التعامل مع كل بنية جديدة كحل لمرة واحدة.

وتعكس الورقتان تلك الاحتياجات:

  • يقدم أحدهما طريقة ملموسة لإعطاء النماذج شكلاً من أشكال الذاكرة طويلة المدى.
  • والآخر يوفر إطارًا لفهم وبناء النماذج حول تلك الفكرة.

جبابرة: إضافة شكل من أشكال الذاكرة طويلة المدى

يركز Titans على الجانب العملي للمشكلة. فهو يقدم بنية تمكن النموذج من تجميع المعلومات أثناء عمله. بدلاً من إعادة معالجة المدخلات السابقة بشكل متكرر أو ضغط كل شيء في تمثيل صغير، يمكن للنموذج نقل المعلومات المحددة بمرور الوقت.

على عكس الأنظمة التقليدية التي تستخدم ملخصًا بسيطًا وثابت الحجم، فإن هذه الوحدة عبارة عن شبكة عصبية عميقة يمكنها التقاط معلومات أكثر تعقيدًا وتفصيلاً.

الهدف هو تمكين العمل بمدخلات طويلة جدًا دون مسح الماضي بشكل متكرر أو فقدان التفاصيل الأساسية. لم يتم تقديم Titans كبديل لتصميمات النماذج الحالية. إنها طبقة إضافية يمكن دمجها معهم، لتوسيع كيفية تعاملهم مع السياق بدلاً من التخلص مما يعمل بالفعل.

MIRAS: إطار عمل لتصميم النماذج المعتمدة على الذاكرة

عندما يقدم Titans آلية محددة، تتراجع MIRAS وتنظر إلى مسألة التصميم الأوسع. فهو يتعامل مع نماذج التسلسل كأنظمة تقوم بتخزين الارتباطات وتحديثها بمرور الوقت، وتقترح طريقة منظمة للتفكير في كيفية عمل تلك الذاكرة.

بدلاً من عرض البنيات كفئات مختلفة بشكل أساسي، تنظمها MIRAS حول مجموعة صغيرة من خيارات التصميم المتعلقة بكيفية تخزين المعلومات ومطابقتها وتحديثها والاحتفاظ بها.

يوفر MIRAS طريقة لتفسير أنظمة مثل Titans وتطوير أنظمة جديدة دون البدء من الصفر.

اختبار ما إذا كان هذا النهج يعمل على تحسين التعامل مع السياق الطويل

لتحديد ما إذا كان هذا النهج القائم على الذاكرة يُترجم إلى ميزة عملية، قام الباحثون بتقييمه مقابل التصميمات الحالية للمهام التي يكون نطاق السياق فيها طويلًا للغاية.

في التقييمات طويلة السياق، تجاوزت Titans 2 مليون رمز مميز مع الحفاظ على دقة استرجاع أعلى من النماذج الأساسية التي تم اختبارها. في معيار BABILong، الذي يتطلب التفكير في الحقائق المدفونة في وثائق ضخمة، تفوقت Titans في الأداء على النماذج الأكبر حجمًا، بما في ذلك GPT-4، على الرغم من وجود معلمات أقل بكثير.

وتوضح ورقة MIRAS كذلك أن هذا النجاح لا يقتصر على نموذج واحد. ومن خلال اختبار العديد من الأنظمة المختلفة التي تم إنشاؤها باستخدام إطارها، أظهر الباحثون أن مبادئ التصميم هذه تنتج باستمرار نتائج عالية الأداء عبر مهام مختلفة.

تُظهر هذه التقييمات معًا أن الذاكرة المنظمة النشطة تمكن النماذج من الحفاظ على دقة عالية عبر مجموعات البيانات الضخمة دون المقايضة المعتادة في التكلفة الحسابية.

وأوضح الباحثون في Titans نتائجهم:

“يثبت تقييمنا التجريبي للمهام المتنوعة أن العمالقة أكثر فعالية من المحولات والنماذج الخطية المتكررة الحديثة، خصيصًا لـ
سياق طويل. وهذا يعني أن العمالقة يمكنهم التوسع إلى حجم نافذة سياق أكبر من 2 مليون بدقة أفضل من الخطوط الأساسية.

يشرح باحثو MIRAS لماذا يمثل MIRAS تقدمًا:

“في هذه الورقة، نقدم Miras، وهو إطار عام يشرح العلاقة بين التحسين عبر الإنترنت وحفظ وقت الاختبار. يمكن لإطار Miras أن يشرح دور العديد من الخيارات المعمارية القياسية في الأدب (على سبيل المثال، بوابة النسيان) ويساعد في تصميم الجيل التالي من البنى القادرة على إدارة الذاكرة بشكل أفضل.

بناءً على إطار عملنا، نقدم ثلاثة نماذج تسلسلية جديدة، لكل منها مزاياه (عيوبه). تُظهر تقييماتنا التجريبية أن كل هذه المتغيرات أقوى من المحولات وشبكات RNN الخطية، في مختلف المهام النهائية. في هذا العمل، نقدم مجموعة متنوعة من المتغيرات باستخدام Miras.

وفي المستقبل، يعد استكشاف هذه البنى البديلة لمختلف المهام النهائية اتجاهًا مستقبليًا مثيرًا للاهتمام.

استنتاجات الباحثين

خلصت ورقة Titans (PDF) إلى أن الجمع بين المعالجة قصيرة المدى والذاكرة المخصصة طويلة المدى يمكن أن يحسن كيفية تعامل النماذج مع المدخلات الموسعة دون الاعتماد فقط على نوافذ انتباه أكبر أو ضغط أكثر قوة. ويقدم هذا كقدرة إضافية يمكن دمجها مع البنى الحالية بدلاً من استبدالها.

تصف ورقة MIRAS نماذج التسلسل بأنها أنظمة تعتمد على الذاكرة ويمكن تصميمها ومقارنتها بشكل أكثر منهجية. يهدف إطار العمل الخاص بها إلى توجيه كيفية إنشاء هذه النماذج من خلال جعل سلوك الذاكرة بُعدًا تصميميًا واضحًا.

تتعامل كلتا الورقتين مع الذاكرة كشيء يمكن للنماذج إدارته بشكل متعمد: العمالقة من خلال إضافة آلية يمكنها تخزين المعلومات أثناء الاستخدام، وMIRAS من خلال وضع إطار عمل لتصميم ومقارنة النماذج التي تعتمد على الذاكرة.

يوضح منشور مدونة Google ما الذي يجعل Titans وMIRAS مهمًا:

“إن تقديم Titans وإطار MIRAS يمثل تقدمًا كبيرًا في نمذجة التسلسل. من خلال استخدام الشبكات العصبية العميقة كوحدات ذاكرة تتعلم الحفظ مع وصول البيانات، تتغلب هذه الأساليب على قيود الحالات المتكررة ذات الحجم الثابت.

علاوة على ذلك، يوفر MIRAS توحيدًا نظريًا قويًا، ويكشف عن العلاقة بين التحسين عبر الإنترنت والذاكرة الترابطية والتصميم المعماري. ومن خلال تجاوز النموذج الإقليدي القياسي، يفتح هذا البحث الباب أمام جيل جديد من نماذج التسلسل التي تجمع بين كفاءة شبكات RNN والقوة التعبيرية اللازمة لعصر الذكاء الاصطناعي طويل السياق.

لقد أثبتوا معًا أن الطريق إلى أداء أفضل في السياق الطويل لا يقتصر فقط على النوافذ الأكبر حجمًا أو النماذج الأكبر حجمًا، بل أيضًا على منح الذكاء الاصطناعي طريقة منظمة لإدارة ما يتذكره.

صورة مميزة بواسطة Shutterstock / AntonKhrupinArt



Source link

Postagens Similares

  • Yahoo Mail は 1 TB の無料ストレージを提供するが、Gmail の上限は 15 GB — しかし Reddit が落とし穴を発見、これは大きな問題だ

    ファイナンシャル プランナーの Jeff Rose 氏の投稿は、Yahoo Mail とそれが一見無料で提供する容量についての懐かしい話題を呼び起こしました。数人の Reddit ユーザーが彼の投稿に反応し、Yahoo アカウントを何十年も持っていると述べた。 投稿の中でローズさんは、15歳の頃から個人アカウントを持っていると述べ、何十年も使い続け、現在48歳になっているにも関わらず、Yahooがストレージの追加料金の支払いを彼に求めたことは一度もなかったと述べた。そして、彼がYahooにどれほど満足しているかについて語ったとき、数人のRedditorは他のサービスでストレージの問題に苦労しており、アカウントが削除されるかもしれないという警告を日常的に受けていたと語った。 さらに、もちろん、多くの人が自分自身と Yahoo Mail との長年にわたる関係について共有しました。 公開時点で、Yahoo は個人アカウントに 1 TB の無料ストレージを提供していますが、Google はユーザーが Gmail、Google ドライブ、Google フォトで共有できるストレージを 15 GB に制限しています。 15 GB の上限を超えるユーザーは、Google One を通じて月額 1.99 ドルを支払って 100 GB の追加ストレージを利用できます。価格は国によって異なります。 ただし、多くの Yahoo Mail ユーザーが気づいていない落とし穴があるようです。 Reddit ユーザーは、Yahoo が最近ストレージ ポリシーを更新し、競合他社と同様に 15 GB のストレージのみを提供する予定であるため、Google と同等に近づいていると述べました。そして、アカウント削除というさらに大きな問題があります。 スレッドのコメント投稿者によると、Yahoo は長期間休眠状態になったアカウントを非アクティブ化します。この期間が経過すると、Yahoo はアカウント所有者に通知することなくアカウントを削除します。あるユーザーは、父親のアカウントがこのように削除されたと語った。別のコメントでは、彼らのアカウントも同じ運命をたどったと書かれていました。 複数のコメント投稿者は、長年使用されている Yahoo アカウントが政府機関や公式記録にリンクされることが多く、突然無効化されると警告なしに重要な通信が遮断される可能性があると指摘しました。…

  • Extérieur – ‘… De quoi ?’ | Son obscur

    …De quoi ? marque le premier album complet de Extérieurune collaboration entre Azalias et Freidrich$. Né d’une seule démo, le disque a évolué vers une déclaration audacieuse de R&B décalé et ardent et de danse-pop à la fois sombre et colorée. Freidrich$ fournit un cadre structurel que le talent artistique d’Azalias déconstruit fréquemment, aboutissant à…

  • ਰੋਲਿੰਗ ਵੇਵਜ਼ ਪੋਡਕਾਸਟ – ਤੰਦਰੁਸਤੀ ਅਤੇ ਤੰਦਰੁਸਤੀ ਨੂੰ ਪ੍ਰੇਰਿਤ ਕਰਨ ਲਈ ਇਮਾਨਦਾਰ ਗੱਲਬਾਤ

    ਇੱਕ ਸ਼ਾਂਤ, ਚਿੰਤਨਸ਼ੀਲ ਵਿਵਹਾਰ ਦੀ ਇਮਾਨਦਾਰ ਅਤੇ ਨਿਰਵਿਘਨ ਗੱਲਬਾਤ – ਰੋਲਿੰਗ ਵੇਵਜ਼ ਪੋਡਕਾਸਟ ਇੰਟਰਵਿਊਆਂ ਅਤੇ ਕੁਦਰਤੀ ਸੰਸਾਰ ਕਨੈਕਸ਼ਨਾਂ, ਸਵੈ-ਇਲਾਜ, ਸਪਸ਼ਟਤਾ, ਪ੍ਰੇਰਨਾ, ਅਤੇ ਤੰਦਰੁਸਤੀ ਬਾਰੇ ਚਰਚਾਵਾਂ ਲਈ ਸਮਰਪਿਤ ਹੈ। ਨਤਾਲੀਆ ਪੇਟੁਖੋਵਾ ਅਤੇ ਕੈਲੀ ਸਲੇਰ ਦੁਆਰਾ ਮੇਜ਼ਬਾਨੀ ਕੀਤੀ ਗਈ, ਰੋਲਿੰਗ ਵੇਵਜ਼ ਪੋਡਕਾਸਟ ਇਸਦੇ ਆਪਣੇ ਸਿਰਲੇਖ ਅਤੇ ਇਰਾਦਿਆਂ ਦੇ ਨਾਲ ਪੂਰੀ ਤਰ੍ਹਾਂ ਮੇਲ ਖਾਂਦਾ ਹੈ, ਇਹਨਾਂ ਨਜ਼ਦੀਕੀ ਗੱਲਬਾਤਾਂ…

  • 「我不回家」 « 流浪的蘇格蘭人

    “我不回家” 稱之為輕鬆高興……或只是假裝看到我工作一周而「老闆」留在家裡……但是看到這個無麩質漢堡(我確信它不僅僅是這個特殊的漢堡,而是一般的無麩質漢堡)……但第一口我聽到的只是「我不能回家」。我和席亞拉今晚在酒吧與工作人群一起完成了她的作品首秀。期待2天的完全自由活動。 此條目發佈於 2011 年 5 月 13 日星期五上午 11:38,並在新西蘭備案。您可以透過 RSS 2.0 來源關注對此條目的任何回應。您可以在您自己的網站上留下回應或引用引用。 Source link

  • 20個時尚的外觀希望在2025年提升圓面髮型

    選擇合適的髮型可以創造奇蹟,以增強您的面部特徵,尤其是如果您的面部圓臉。在2025年,流行的髮型趨勢傾向於自然而然地伸長,定義和輪廓面部形狀的切割。從通風層到大膽的劉海,正確的外觀可以立即纖細,並增強您的信心。無論您是去參加聚會,休閒的一天還是辦公室,這些時尚的髮型都是為適合各種心情和髮質質地而定制的。該指南具有20種圓面臉型的苗條髮型,這些髮型不僅是風味的,而且還具有多功能且易於維護。潛水並找到您的完美匹配! 20個令人驚嘆的圓形髮型 如果您想苗條並定義圓面,那麼2025年的20種時尚髮型提供了完美的轉換! 1。側面捲曲鮑勃 圖像:shutterstock 這款具有深側部分的捲發鮑勃(Bob)增加了高度和角度的圓形臉。它非常適合聚會或約會之夜,它為彈跳和質地帶來了細發或中發。側面部分產生了一條不對稱的線,毫不費力地纖細。這種髮型是圓形和心形面孔的最佳選擇之一。 樣式提示: 使用捲曲定義的慕斯增加體積並保持。 2。金發海灘 圖像:shutterstock 海灘波浪提供了輕鬆而討人喜歡的外觀,為圓面增添了長度。這種風格是休閒早午餐或假期的理想選擇,非常適合那些中等至厚頭髮的人。紋理的質地給人一種細膩的幻想,尤其是當與微妙的亮點配對時。它最適合圓形和橢圓形的面部形狀。此外,您還可以從上方嘗試趨勢的金髮色調,並立即使您的親人陷入困境! 樣式提示: 使用海鹽噴霧器進行天然,吹吹拂的飾面。 3。不對稱的葉 圖像:shutterstock 不對稱的LOB的前部和較短的後部自然會輪廓臉部。適用於辦公室磨損或正式活動,它直接適合波浪形紋理。這是一個時尚,現代的切割,可以圓形和方形的面孔。 樣式提示: 扁鐵將末端固定,使外觀清晰,拋光。 4。側掃劉海和中長層 圖像:shutterstock 此切割具有帶有分層頭髮的柔軟側劉海,非常適合日常穿著。側掃劉海在視覺上打破了臉部的寬度。非常適合厚或略帶波浪的頭髮,非常適合圓形或胖乎乎的臉頰。 樣式提示: 用圓形刷子吹乾劉海,以使體積平滑。 5。圓滑的長鮑勃與中心部分 圖像:shutterstock 一個由中心的Lob提供對稱性,可以垂直拉長臉部。最適合正式或專業設置,它直接適合略帶波浪的頭髮。這是圓形和心形的面孔的首選。 樣式提示: 將一側塞在耳朵後面以增強面部角度。 6。捲曲長層帶面部框架的亮點 圖像:shutterstock 這種外觀具有定義的捲發和光突出顯示,完美地創造了深度,並吸引了注意力。這種髮型適合特殊場合或夜間出現,可補充捲髮和毛髮的頭髮類型。它完美地炫耀了一張圓形的臉,同時突出了所有正確的面部特徵! 樣式提示: 使用擴散器乾燥捲髮以增加彈跳。 7。分層且通風 圖像:shutterstock 羽毛葉為臉部增加了柔軟度和長度。非常適合日常穿著或休閒會議,此切割適合中等質地。它毫不費力地產生了撫摸臉頰的抬起,框架的效果。 樣式提示: 使用質地噴霧以進行光音量。 8。波浪形的側面小精靈切割 圖像:shutterstock 這款帶有波浪的大膽小精靈為皇冠增添了高度和運動。最適合時尚活動或夜間活動的理想選擇,最適合精美的頭髮和大膽的個性。這樣的小精靈切割最適合圓形和橢圓形臉。 樣式提示: 使用輕巧的潤髮油來塑造波浪。 9.稀疏的劉海有中長層 圖像:shutterstock 淡淡的劉海會產生柔軟度,而中長則延長。髮型非常適合您本週末計劃的每一個創意活動,甚至是右紅色連衣裙的浪漫晚餐。 樣式提示: 修剪劉海經常保持羽毛外觀。 10。臉部框架長層與深色根部 圖像:shutterstock 長層使臉頰變軟,而深色根部增加了深度和對比度。這種外觀非常適合晚上,音樂會和適合濃密的波浪狀頭髮。該髮型非常適合那些臉頰寬闊和圓面的人,表現出纖細的外觀。 樣式提示: 使根部更暗以產生自然輪廓效果。 11。波浪狀的高馬尾辮 圖像:shutterstock…

  • Ein verstecktes Jazz-Juwel, das Sie hören müssen

    Musikrezension: „ALL4U kanalisiert atmosphärischen Pop durch einen Filter euphorischen Eskapismus. Die Melodie breitet sich wie warmes Neonlicht über einer Nachtlandschaft aus, während der entspannte Beat wie ein Puls wirkt, der nicht drängt – sondern Sie einlädt. Ruzandras Gesang, ätherisch und dennoch voller innerer Spannung, bewegt sich zwischen Verletzlichkeit und Selbstvertrauen und baut eine Hookline auf,…

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *