Olmo 3 هو برنامج LLM مفتوح بالكامل
Olmo 3 هو برنامج LLM مفتوح بالكامل
22 نوفمبر 2025
Olmo هي سلسلة LLM من Ai2 — معهد Allen للذكاء الاصطناعي. على عكس معظم نماذج الوزن المفتوح، تتميز هذه النماذج بتضمين بيانات التدريب الكاملة وعملية التدريب ونقاط التفتيش جنبًا إلى جنب مع تلك الإصدارات.
يدعي Olmo 3 الجديد أنه “أفضل نموذج تفكير مفتوح بالكامل بمقياس 32B” ويركز بشدة على قابلية التفسير:
في مركزها هو أولمو 3-فكر (32ب)، أفضل نموذج تفكير مفتوح بالكامل بمقياس 32B والذي يتيح لك لأول مرة فحص آثار الاستدلال الوسيط وتتبع تلك السلوكيات مرة أخرى إلى البيانات وقرارات التدريب التي أنتجتها.
لقد أصدروا أربعة نماذج 7B —Olmo 3-Base، وOlmo 3-Instruct، وOlmo 3-Think، وOlmo 3-RL Zero، بالإضافة إلى 32B متغيرات من طرازات 3-Think و3-Base.
يعد الوصول الكامل إلى بيانات التدريب مفيدًا حقًا. وإليك كيف يصفون ذلك:
تم تدريب Olmo 3 مسبقًا محشوة 3، مجموعة جديدة تبلغ قيمتها حوالي 9.3 تريليون رمز مميز مستمدة من صفحات الويب، وملفات PDF العلمية التي تمت معالجتها باستخدام olmOCR، وقواعد التعليمات البرمجية، ومشكلات الرياضيات وحلولها، والنص الموسوعي. من هذا المجمع نبني دولما 3 مكس، مزيج تدريب مسبق يبلغ 5.9 تريليون رمز (~6T) مع نسبة أعلى من الترميز والبيانات الرياضية مقارنة بإصدارات Dolma السابقة، بالإضافة إلى إزالة التلوث بشكل أقوى بكثير من خلال إلغاء البيانات المكررة على نطاق واسع، وتصفية الجودة، والتحكم الدقيق في خلط البيانات. نحن نتبع معايير الويب المعمول بها في جمع بيانات التدريب ولا نجمعها من المواقع التي تمنعها صراحةً، بما في ذلك المحتوى المحمي بنظام حظر الاشتراك غير المدفوع.
كما يسلطون الضوء أيضًا على أنهم يتدربون على عدد أقل من الرموز المميزة مقارنة بمنافسيهم:
(…) إنه أقوى نموذج تفكير منفتح تمامًا نعرفه، حيث يعمل على تضييق الفجوة إلى أفضل نماذج الوزن المفتوح ذات الحجم المماثل – مثل Qwen 3 32B – أثناء التدريب على عدد أقل من الرموز بمقدار 6x تقريبًا.
إذا كنت لا تزال تتمسك بالأمل في نموذج تم تدريبه بالكامل على البيانات المرخصة، فهذا النموذج للأسف لن يناسب الفاتورة — فلا يزال الكثير من هذه البيانات يأتي من الزحف إلى الويب.
لقد قمت بتجربة نموذج 32B Think ونموذج 7B Instruct باستخدام LM Studio. الطراز 7B بسعة تنزيل 4.16 جيجابايت، والطراز 32B بسعة 18.14 جيجابايت.
نموذج 32B هو بالتأكيد أكثر من اللازم! لقد طلبت منه “إنشاء صورة SVG لبجع يركب دراجة” وفكر في ذلك 14 دقيقة و 43 ثانية، حيث تم إنتاج 8,437 رمزًا، معظمها كان أثر التفكير الملحمي هذا.
لا أقتبس عادة ملف SVG الكامل في هذه المقالات، ولكن في هذه الحالة فهو قصير بدرجة كافية بحيث أعتقد أنه يستحق المشاركة. تعطي تعليقات SVG انطباعًا رائعًا عما كانت تحاول القيام به – فهي تحتوي على دراجة، وإطار دراجة، وبجع، وأجنحة يسارية ويمينية، وحتى “أقدام على الدواسات”.
<svg width="200" height="200" viewBox="0 0 100 100">
<circle cx="30" cy="60" r="15" stroke="black" fill="none"/>
<circle cx="70" cy="60" r="15" stroke="black" fill="none"/>
<rect x="35" y="25" width="30" height="10" fill="saddlebrown"/>
<line x1="35" y1="40" x2="30" y2="60" stroke="black" stroke-width="3"/>
<line x1="65" y1="40" x2="70" y2="60" stroke="black" stroke-width="3"/>
<ellipse cx="55" cy="65" rx="20" ry="15" fill="white"/>
<polygon points="52 50,57 35,62 50" fill="black"/>
<circle cx="55" cy="45" r="2" fill="white"/>
<circle cx="60" cy="45" r="2" fill="white"/>
<polygon points="45 60,50 70,55 60" fill="lightgrey"/>
<polygon points="65 60,70 70,55 60" fill="lightgrey"/>
<polygon points="25 75,30 85,35 75" fill="black"/>
<polygon points="75 75,70 85,65 75" fill="black"/>
svg>
تم تقديمه على النحو التالي:

لقد اختبرت OLMo 2 32B 4bit مرة أخرى في شهر مارس وحصلت على شيء، على الرغم من كونه تجريديًا بشكل مبهج، إلا أنه لا يشبه البجع أو الدراجة:

لكي نكون منصفين، فإن موديلات 32B بشكل عام لا تعمل بشكل جيد مع هذا. إليك محاولة Qwen 3 32B (لقد قمت بتشغيلها الآن باستخدام OpenRouter):

OlmoTrace
لقد كنت حريصًا بشكل خاص على تجربة القدرة على “فحص آثار الاستدلال الوسيط”. إليك كيفية وصف ذلك لاحقًا في الإعلان:
الهدف الأساسي لـ Olmo 3 ليس فقط القيام بذلك يفتح تدفق النموذج، ولكن لجعله قابلة للتنفيذ للأشخاص الذين يرغبون في فهم وتحسين السلوك النموذجي. أولمو 3 يتكامل مع OlmoTrace، أداتنا لتتبع مخرجات النموذج إلى بيانات التدريب في الوقت الفعلي.
على سبيل المثال، في Ai2 Playground، يمكنك أن تطلب من Olmo 3-Think (32B) الإجابة على سؤال يتعلق بالمعرفة العامة، ثم استخدام OlmoTrace لفحص أين وكيف تعلم النموذج إنشاء أجزاء من استجابته. يؤدي هذا إلى سد الفجوة بين بيانات التدريب وسلوك النموذج: لا يمكنك رؤية ما يفعله النموذج فحسب، بل يمكنك أيضًا معرفة السبب — وضبط البيانات أو قرارات التدريب وفقًا لذلك.
يمكنك الوصول إلى OlmoTrace عبر الملعب.allenai.org، عن طريق تشغيل المطالبة أولاً ثم النقر فوق الزر “إظهار OlmoTrace” الموجود أسفل الإخراج.
لقد حاولت ذلك في “إنشاء سيرة ذاتية لمؤتمر لـ Simon Willison” (محفز للأنا أستخدمه لمعرفة مقدار ما التقطته النماذج عني من بيانات التدريب الخاصة بهم) وحصلت على نتيجة تبدو كما يلي:

يعتقد أنني شاركت في تأسيس co:here وأعمل في Anthropic، وكلاهما غير صحيح – ولكن هذا ليس أمرًا غير شائع مع LLMs، كثيرًا ما أراهم يقترحون أنني مدير التكنولوجيا في GitHub وغير ذلك من الأخطاء المشابهة.
لقد وجدت لوحة OlmoTrace على اليمين مخيبة للآمال. لم تكن أي من وثائق التدريب التي أبرزتها تبدو ذات صلة – يبدو أنها تبحث عن تطابقات العبارة (المدعومة من infini-gram الخاص بـ Ai2) ولكن المستندات التي عثرت عليها لا علاقة لها بي على الإطلاق.
هل يمكن لبيانات التدريب المفتوحة معالجة المخاوف المتعلقة بالأبواب الخلفية؟
تدعي Ai2 أن Olmo 3 هو “أفضل نموذج تفكير مفتوح بالكامل بمقياس 32B”، والذي أعتقد أنه يصمد بشرط تعريف “مفتوح بالكامل” على أنه يتضمن بيانات تدريب مفتوحة. ومع ذلك، ليس هناك قدر كبير من المنافسة في هذا المجال، حيث تقارن Ai2 نفسها بشركة Marin من جامعة ستانفورد وشركة Apertus من شركة AI السويسرية، ولم أسمع عن أي منهما من قبل.
العيب الكبير في نماذج الوزن المفتوح الأخرى هو أنه من المستحيل مراجعة بيانات التدريب الخاصة بها. نشرت أنثروبيك بحثًا الشهر الماضي يوضح أن عددًا صغيرًا من العينات يمكن أن يسمم حاملي شهادة الماجستير في القانون من أي حجم، وقد يستغرق الأمر “250 مستندًا مسمومًا” فقط لإضافة باب خلفي إلى نموذج كبير يؤدي إلى سلوك غير مرغوب فيه بناءً على رسالة قصيرة مصممة بعناية.
وهذا يجعل بيانات التدريب المفتوحة بالكامل صفقة أكبر.
قام ناثان لامبرت، الباحث في Ai2، بتضمين هذه الملاحظة حول أهمية بيانات التدريب الشفافة في منشوره التفصيلي حول الإصدار:
على وجه الخصوص، نحن متحمسون بشأن مستقبل أبحاث RL Zero حول Olmo 3 على وجه التحديد لأن كل شيء مفتوح. يمكن للباحثين دراسة التفاعل بين آثار الاستدلال التي ندرجها في منتصف التدريب وسلوك النموذج النهائي (النوعي والكمي).
يساعد هذا في الإجابة على الأسئلة التي ابتليت بها نتائج RLVR في نماذج Qwen، مما يشير إلى أشكال تلوث البيانات خاصة في معايير الرياضيات والاستدلال (انظر Shao وRulin وآخرون. “المكافآت الزائفة: إعادة التفكير في إشارات التدريب في rlvr.” arXiv preprint arXiv:2506.10947 (2025). أو Wu، Mingqi، وآخرون. “الاستدلال أو الحفظ؟ نتائج غير موثوقة للتعلم المعزز بسبب لتلوث البيانات.”
آمل أن نرى المزيد من المنافسة في هذا المجال، بما في ذلك المزيد من النماذج في سلسلة أولمو. كانت التحسينات من Olmo 1 (في فبراير 2024) وOlmo 2 (في مارس 2025) كبيرة. وآمل أن يستمر هذا الاتجاه!
