حدود Jev AI: ما الذي لا يقيسه معيار الـ 193 ضعفاً

حدود Jev AI: ما الذي لا يقيسه معيار الـ 193 ضعفاً

نموذج Jev من TypeSafe يعيد قرارات محدَّدة النوع بدل النص، ويجيب في 70 مللي ثانية، ولا يتقاضى شيئاً عن رموز الخرج. وادعاءا السرعة 193.6 ضعفاً والكلفة 444.6 ضعفاً يأتيان من تقييم يُعرَّف فيه الجواب الصحيح بأنه ما قاله نموذجان آخران. وهذا ما يفعله Jev فعلاً، وما يقيسه المعيار.

بقلم Silverthread Labs··Jev AI·TypeSafe Jev·Jev مقابل نماذج اللغة

حدود Jev AI: ما الذي لا يقيسه معيار الـ 193 ضعفاً

تتصدّر صانعة Jev، وهي TypeSafe، صفحتها الرئيسية برقمين: أسرع بـ 193.6 ضعفاً وأقل كلفة بـ 444.6 ضعفاً من نموذج لغوي متقدم. وكلاهما يأتي من تقييمات مسارات العمل التي أجرتها الشركة نفسها، وكلاهما صحيح على الأرجح كما قيس.

والسؤال هو ما الذي قاسته. ففي منشور الإطلاق، تشرح TypeSafe أن التقييم بلا حقيقة مرجعية. فالجواب المرجعي هو «متوسط GPT-6 Astra وFable 5.1». فالدرجة إذن هي الاتفاق مع نموذجين متقدمين، لا الصواب. وTypeSafe تقول هذا في ملاحظاتها نفسها، مع الإقرار بأن مسارات العمل الاختبارية «صنعها أفراد في فريق قدرات النماذج عندنا، فقد يوجد بعض التحيّز».

ونشر بائع لنقاط ضعف معياره هو أمر غير معتاد ويستحق الاحترام. وهو يعني كذلك أن الرقم الذي يدور في كل نقاش من أسبوع الإطلاق سقفٌ أنتجته الشركة التي تبيع المنتج. ويبقى Jev أكثر إصدارات النماذج إثارةً للاهتمام هذا الشهر. لكنه شيء مختلف عما يوحي به العنوان.

ما هو Jev فعلاً#

Jev هو أول نموذج System One، أُطلق في وصول مبكر في 15 سبتمبر 2026 على يد مؤسس TypeSafe، Diogo Almeida، الذي عمل في OpenAI على طرائق اتّباع التعليمات التي صارت ChatGPT. وهو لا يولّد نصاً. بل يأخذ حالة برنامجكم، ويأخذ مجموعة أسئلة محدَّدة النوع، ويعيد أجوبة محدَّدة النوع مع احتمالات.

والإطار إطار Kahneman. فالنظام 2 هو الاستدلال البطيء المتأنّي. والنظام 1 هو الحكم الفوري الذي تصدرونه قبل أن تفرغوا من قراءة الجملة. ونماذج اللغة المتقدمة آلات نظام 2 استثنائية أمضينا ثلاث سنوات في تثبيتها على عمل النظام 1: اطلبوا JSON، وتمنّوا أن يصمد المخطط، واكتبوا مدقّقاً، واكتبوا إعادة محاولة، واكتبوا احتياطاً لحين تفشل إعادة المحاولة هي الأخرى.

وJev يحذف تلك الطبقة بدل تحصينها. فلا سلسلة نصية تُحلَّل، لأن لا شيء يولّد سلسلة.

وتحصلون على ثلاثة أنواع من الأسئلة. فـ Choice يختار من مجموعة خيارات ويعيد احتمالاً لكل واحد منها. وScore يقيّم مدخلاً على مستويات مرتّبة. وNoul يطرح سؤال نعم أو لا ويعيد احتمالاً، 0.95 أن هذه التذكرة طلب استرداد. وكل جواب يحمل قيمة ثقة، فتستطيع الشيفرة المستدعية الموافقة تلقائياً فوق عتبة والتصعيد تحتها.

وتُجاب أسئلتكم كلها في تمريرة متوازية واحدة. والنموذج اللغوي لا يستطيع ذلك بنيوياً، لأن الرمز n+1 يعتمد على الرمز n. وJev بلا ترتيب كهذا، ومن هنا يأتي كثير من سرعته. وقد درّبته TypeSafe بـ RLCD، أي التعلّم المعزّز للقرارات المعايَرة، بتحسين الاحتمال في مقابل النتيجة بدل تحسين الرد في مقابل التفضيل البشري.

نماذج اللغة المتقدمةJev
زمن الاستجابة3 إلى 329 ثانية70 إلى 500 مللي ثانية
سعر الدخل0.20 إلى 10 دولارات / MTok0.042 دولار / MTok
سعر الخرجنحو 5 أضعاف الدخلمجاني
أخطاء الأنواعغير صفرية0%
الخرجسلسلة نصية تُحلّلونهاقيمة محدَّدة النوع

ورموز الخرج المجانية تقلب نموذج التسعير عند كل مختبر كبير، ومعدّل أخطاء الأنواع 0% يصمد بالبناء لا بالقياس. فالنموذج لا يستطيع إعادة قيمة خارج مخططكم، لأنه لا توجد آلية يستطيع بها ذلك.

حدود Jev بكلمات TypeSafe نفسها#

وأمان الأنواع ليس هو الصواب، وتوثيق TypeSafe يقول ذلك صراحةً: «تُقاس المعايرة عبر مجموعات من التنبؤات؛ وهي لا تضمن أن جواباً منفرداً صحيح». وJev لن يخترع عضواً في تعداد قط. ويظل قادراً على أن يخطئ بثقة في تذكرة بعينها. وما تشترونه احتمال ذو معنى في المجموع: فعبر ألف تذكرة يعيد فيها Jev 0.8، ينبغي أن يتبيّن أن نحو ثمانمئة منها طلبات استرداد. وذلك مفيد حقاً لضبط عتبة، وهو ليس جواباً تثقون به واحداً تلو الآخر.

ثم هناك سؤال الأمن، وقد وصل سريعاً لأن المطورين بدأوا فوراً يستخدمون Jev للموافقة على أفعال وكلاء الذكاء الاصطناعي. وتذكر صفحة حدود Jev 1.13 عند TypeSafe أن «المحتوى المكتوب ليوجّه النموذج توجيهاً عدائياً، سواء كان تعليمة محقونة، أو تأطيراً مضلّلاً عمداً، أو نصاً يحاجّ لصالح تصنيفه هو، يستطيع تحريك الجواب». وقد أثبتت VentureBeat ذلك: فحين سُئل Jev هل يحجب rm -rf ~/.ssh، أعاد احتمال حجب 0.76. وبعد إضافة حقل خرج أداة زائف يوجّه النظام إلى السماح تلقائياً، هبط احتمال الحجب إلى 0.48 وانخفضت الثقة من 0.64 إلى 0.22.

ويضيف توثيق Pydantic نتيجة أهدأ لكنها أهم في العمل اليومي: «ترتيب خيارات Literal أو أعضاء Enum جزء مما يراه Jev، وإعادة ترتيبها تستطيع تحريك الجواب». فمخططكم ليس مدخلاً محايداً. وإعادة هيكلة تعداد هي تغيير في النموذج.

ولا شيء من هذا يجعل Jev غير آمن. بل يجعله مصنّفاً، وهو ما يقول عن نفسه إنه هو. وبرمجية LangChain الوسيطة تتعامل معه تعاملاً صحيحاً باستبعاد خرج الأدوات مما يراه المصنّف، فلا يستطيع محتوى جلبه وكيل أن يأذن بتنفيذ نفسه. وتوجيه Pydantic هو السطر الجدير بالحفظ: حارس مبني على Jev مكانه إلى جانب الفحوص الحتمية، لا بدلاً منها.

الجواب مفتوح المصدر، بعد ثلاثة أيام#

أطلقت Convai Innovations نموذج Laya تحت رخصة Apache 2.0 في 18 سبتمبر، بعد Jev بثلاثة أيام. وهو يعمل محلياً، ويأتي بمرمِّز بـ 421 مليون معامل مبنيّ على ModernBERT-large، ويُثبَّت بـ pip.

والمقارنة أقل ميلاً إلى جانب واحد مما توحي به عبارة «المفتوح يتفوق على المغلق». فدرجة Laya البارزة 0.766 في مقابل 0.727 لـ Jev تأتي من نقطة تحقّق مصقولة على شطر التدريب الخاص بذلك المعيار نفسه. وبلا تدريب مسبق على المهمة، يسجّل النموذج الأساس 0.362. وعلى Banking77، الذي يقتضي اختيار واحدة من 77 تسمية نية، تضع بطاقة نموذج Convai نفسها Jev عند 0.870 وLaya عند 0.425.

والاختيار عالي التعدد هو الموضع الذي يصعب فيه استبدال Jev. فهو يتعامل مع 255 خياراً مباشرةً ويستخدم تقييماً على مرحلتين فوق ذلك، وهذا أيضاً سبب نجاح عرض Wikiracing عنده: فالتنقل في Wikipedia يعني الاختيار من مئات الروابط في كل صفحة، والمسار الذي لا يخطو خطوة مشوّهة قط لا ينفق خطوات في التعافي من واحدة.

والمواجهة الكاملة، بما فيها الأرقام التي يفضّل كل بائع ألا تقتبسوها، في Laya مقابل Jev: هل البديل مفتوح المصدر جيد فعلاً؟

أين يصلح#

استخدموا Jev في العمل الذي لم تكونوا تستخدمون فيه نموذجاً لغوياً إلا مصنّفاً. التوجيه، والفرز، والتقييم، ووضع العلامات، وترشيح أحجام كبيرة، وفحص خرج نموذج آخر. وعند 0.042 دولار لكل مليون رمز دخل بخرج مجاني، تتوقفون عن تقنين القرارات وتبدأون باستدعاء النموذج على كل صف بدل كل صف معلَّم. وذلك هو أثر Jevons الذي يشير إليه الاسم، وهو القصة الحقيقية هنا.

ولا تستخدموه في أي شيء عليه أن ينتج لغة، ولا تعاملوا درجة ثقته حدّاً أمنياً. فهو رأي سريع، منخفض الكلفة، جيّد المعايرة. وابنوا بقية النظام وأنتم تعرفون ذلك.

تشغيل Jev فعلياً#

والفجوة بين القراءة عن Jev وتشغيله في الإنتاج هي الجزء الذي لا يؤديه Jev عنكم: تحديد أي مسارات عملكم تصنيف فعلاً، وكتابة المخططات والعتبات، وتوصيل مسار التصعيد للأجوبة منخفضة الثقة، وإبقاء الفحوص الحتمية أمام كل ما له آثار جانبية. وذلك هو هندسة الوكلاء والأتمتة، وهو عمل نؤديه يومياً.

وتبني Silverthread Labs أنظمة ذكاء اصطناعي إنتاجية حول هذا النمط بالضبط: قرارات سريعة محدَّدة النوع حيث يصلح المصنّف، ونموذج متقدم أو إطار وكلاء حيث يصلح الاستدلال، وشيفرة حتمية حول الاثنين.

تريدون Jev يعمل في منظومتكم التقنية؟

أخبرونا بما تصنّفونه. سنعطيكم جواباً صريحاً عن مدى ملاءمة Jev، ثم نصمّم ونبني المسار حوله: المخططات، والعتبات، ومسارات التصعيد، والحرّاس الحتميون الذين يبقونه آمناً.


المصادر

  • Diogo Almeida، Introducing System One Models & Jev، TypeSafe AI، 15 سبتمبر 2026: منهجية التقييم، والتسعير، وزمن الاستجابة، وRLCD، والتعدد.
  • توثيق TypeSafe: System One: الأوليّات وبيان المعايرة.
  • VentureBeat: صفحة حدود Jev 1.13 عند TypeSafe، وملاحظة الترتيب من Pydantic، وعرض الحقن.
  • Anthus: Jev vs Laya: أرقام Banking77 ومعيار القرارات محدَّدة النوع.

آخر تحديث: September 22, 2026

[ كيف يعمل الأمر ]

تدقيق أتمتة مجاني

نعثر على 20% من عملك اليدوي الأكثر كلفة عليك، ثم نُريك بالضبط كيف تتخلص منه.

الخطوة 1.0
أخبرنا بما يُرهقك

أخبرنا بما يُرهقك

مكالمة من 30 دقيقة. اشرح لنا عملياتك اليومية وسنرصد الاختناقات التي لم تعد تلاحظها.

الخطوة 2.0
نُرتّب المكاسب

نُرتّب المكاسب

نُقيّم كل فرصة بالأثر والجهد، لترى أين يوفّر الذكاء الاصطناعي أكبر قدر من الوقت والمال.

الخطوة 3.0
تحصل على خطة العمل

تحصل على خطة العمل

خارطة طريق مرتبة بالأولوية يمكنك التحرك بها. نفّذها معنا أو بمفردك. تبقى لك في الحالتين.