ai-powered-markdown-translatorمقال مترجم من الفرنسية إلى العربية باستخدام gpt-6.1-sol.
تتيح Mistral نسخة معاينة من Mistral Large 4، وهو نموذج متعدد الوسائط يضم 1 000 مليار معلمة، وتتوفر واجهة API الخاصة به للجميع بدءًا من اليوم، مع وعد بنشر أوزانه في نهاية أكتوبر. وتُدخل Anthropic نموذج Claude إلى Google Docs وSheets وSlides، وتعيد تنظيم برنامجها للتحقق في الأمن السيبراني ضمن ثلاثة مستويات وصول، فيما تنشر Google DeepMind نموذج EmbeddingGemma 2، وهو نموذج تضمينات مفتوح ومتعدد الوسائط يمكن تشغيله على هاتف. ولنماذج اتخاذ القرار نصيب أيضًا من أخبار اليوم: تتيح OpenAI واجهة API المسماة Decisions في نسخة تجريبية عامة، وتخفض Perplexity سعرها إلى النصف، ويفاضل بينها تصنيف مجتمعي.
Mistral Large 4 : 1 000 مليار معلمة في مرحلة المعاينة، مع وعد بنشر الأوزان في نهاية أكتوبر
6 أكتوبر — تطلق Mistral AI نسخة معاينة عامة من Mistral Large 4، المعروف اختصارًا باسم ML4، وباسم Chonk «رسميًا جدًا». وهو أكبر نموذج لدى الشركة حتى الآن: نموذج بمزيج من الخبراء (Mixture-of-Experts) ومتعدد الوسائط بطبيعته، يضم 1 000 مليار معلمة (1T)، منها 49 مليار معلمة نشطة وفقًا لتدوينة الإعلان، ويجمع اتباع التعليمات والاستدلال وقدرات العمل بالوكلاء ضمن نافذة سياق تبلغ مليون tokens. وتورد بطاقة النموذج في الوثائق أرقامًا أخرى دون تفسير الفارق: 1 050 مليار معلمة، منها 52 مليار معلمة نشطة، إضافة إلى مُرمِّز للرؤية يضم 1,6 مليار معلمة.
واجهة API متاحة للجميع بدءًا من اليوم على Mistral Studio، لكن الأوزان لم تُنشر بعد: تعد Mistral بإتاحتها بحلول نهاية أكتوبر، مع تفاصيل عن البنية والتدريب اللاحق. وفي انتظار ذلك، يختبر النموذج في ظروف واقعية مسؤولون عن الأمن السيبراني وشركاء جرى التحقق منهم وجهات حكومية، مع وصول يخضع لقيود أقل على المحتوى. دُرّب ML4 من الصفر على 3 800 وحدة GPU من NVIDIA Grace Blackwell في مراكز بيانات Mistral الأوروبية، التي تستضيف أيضًا نسخة المعاينة. وتخطط الشركة لنشر أوروبي تتولى تشغيله من البداية إلى النهاية، وفق القانون الأوروبي، وتقدّم النموذج بوصفه أول محطة في خريطة الطريق المموّلة بجولة تمويلها من الفئة D بقيمة 3 مليارات يورو.
الأمن السيبراني هو الحجة الرئيسية. وفقًا لـMistral، يقع ML4 ضمن النماذج الخمسة الأولى في Artificial Analysis Cyber Index، ويحقق 82 % في أحد اختباراته، الذي يتطلب إعادة إنتاج ثغرة حقيقية في برنامج مفتوح المصدر ثم إصلاحها، وهي أعلى نتيجة بين جميع النماذج. وتؤكد الشركة أن Claude Opus 5.5 وGPT-6 Astra يحققان نتيجة قريبة من الصفر في الاختبار نفسه، لأنهما يرفضان تنفيذ المهمة.
| الاختبار المرجعي المُقيَّم | النتيجة المعلنة من Mistral | المقارنة التي أوردتها Mistral |
|---|---|---|
| DeepSWE v1.1 | 61,7 % | — |
| Coding Agent Index (المجمّع) | 49,8 % | متقدمًا على DeepSeek V4 Pro 0813 وQwen3.8 Max |
| تقييم بشري أعمى من Surge AI (البرمجة، من 5) | 3,74، في المرتبة 2 من 5 | خلف Claude Opus 5 (4,22) |
| Cybench (40 تحديًا) | 93 % | — |
| AA Cyber Index، إعادة إنتاج ثغرة ثم إصلاحها | 82 % | أعلى نتيجة بين جميع النماذج |
| AutomationBench (657 عملية أعمال) | 59,9 % | متقدمًا على Kimi K3 وMiMo-V2.6-Pro وDeepSeek V4 Pro |
تختلف التدوينة وبطاقة النموذج أيضًا بشأن السعر: تعرض البطاقة في التدوينة 1,36 دولار لكل مليون tokens للإدخال و4,18 دولارات للإخراج، بينما تشطب بطاقة النموذج في الوثائق هذين السعرين وتعرض بجوارهما سعرًا مخفضًا إلى النصف، دون تحديد مدة أو تقديم تفسير.
| خاصية ML4 | وفقًا لتدوينة الإعلان | وفقًا لبطاقة النموذج في الوثائق |
|---|---|---|
| إجمالي المعلمات | 1 000 مليار | 1 050 مليار |
| المعلمات النشطة | 49 مليار | 52 مليار |
| الإدخال، لكل مليون tokens | 1,36 دولار | 0,68 دولار (1,36 مشطوب) |
| الإخراج، لكل مليون tokens | 4,18 دولارات | 2,09 دولار (4,18 مشطوب) |
جميع هذه النتائج صادرة عن Mistral، التي توضح أن التعلم المعزز لنسخة المعاينة مستمر دون علامات على بلوغ حد التشبع، وتتوقع تقدمًا سريعًا خلال الأسابيع المقبلة.
🔗 تدوينة Mistral عن Mistral Large 4 🔗 بطاقة Mistral Large 4 في الوثائق
Claude for Google Workspace : Claude يستقر في Docs وSheets وSlides
6 أكتوبر — تطلق Anthropic إضافة Claude for Google Workspace، وهي وحدة إضافية (add-on) تفتح Claude في لوحة جانبية داخل Google Docs وSheets وSlides، في نسخة تجريبية عامة على جميع الخطط المدفوعة. يقرأ Claude الملف المفتوح، ويرى التحديد الحالي، سواء كان نصًا أو خلايا أو شرائح، ويعدّل الملف مباشرة في مكانه.
| تطبيق Google | ما يفعله Claude فيه |
|---|---|
| Docs | تصحيحات وتغييرات في الأسلوب مباشرة في الملف، وبطاقات اقتراح يمكن تطبيقها أو تجاهلها لعمليات إعادة الصياغة الأوسع |
| Sheets | صيغ وجداول محورية ورسوم بيانية أصلية وعلامات تبويب جديدة، ومعالجة نطاق من الخلايا عبر Python لإجراء عملية ربط أو تنظيف |
| Slides | شرائح تستند إلى تخطيطات العرض التقديمي ونسقه، وفحص العناصر التي تتداخل أو تتجاوز الحدود |
يختار المستخدم درجة الاستقلالية: في وضع «طلب الموافقة قبل التعديل» (Ask before edits)، المفعّل افتراضيًا، يمر كل تعديل عبر بطاقة موافقة؛ وفي وضع «قبول جميع التعديلات» (Accept all edits)، يتابع Claude تنفيذ التعديلات دون توقف. وعند ربط اللوحة بحساب Claude، تستخدم النماذج والموصلات والمهارات (skills) نفسها. وفي خطط Enterprise، تنطبق أيضًا على الإضافة واجهة Compliance API، ومفاتيح التشفير التي يديرها العميل (CMEK)، وتصدير سجلات التدقيق عبر OpenTelemetry.
Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.
🇸🇦 يعمل Claude الآن في Google Docs وSheets وSlides، وتُفتح هذه الملفات أيضًا داخل Claude. في Google Workspace، يظهر Claude في لوحة جانبية بجوار ملفك، ويقرأ ما فتحته ويعدّله مباشرة في مكانه. يمكنك الموافقة على كل تعديل قبل تطبيقه. — @claudeai على X
تتوفر الإمكانية العكسية في الوقت نفسه: تتيح موصلات جديدة لـGoogle Docs وSheets وSlides، وهي أيضًا في مرحلة تجريبية، إنشاء ملفات Google وتعديلها من داخل Claude، عبر لصق رابط أو طلب مستند جديد. وفي الإعدادات المدعومة، يُفتح الملف في لوحة بجوار المحادثة، ويتبع وصول Claude صلاحيات المشاركة في Google. تُثبّت الإضافة من Google Workspace Marketplace (الإضافات > Claude > فتح Claude)، ويمكن للمشرفين نشرها من وحدة تحكم Google Admin؛ وفي خطط Team وEnterprise، يجب أن يفعّل أحد المالكين الموصلات أولًا. وبذلك ينضم Google Workspace إلى Microsoft 365، حيث أصبح Claude لـExcel وPowerPoint وWord متاحًا بشكل عام منذ 7 مايو.
🔗 تدوينة Anthropic عن Claude for Google Workspace
Cyber Verification Program : Anthropic تتيح Opus 5.5 وSonnet 5.5 وMythos 5.1 عبر ثلاثة مستويات وصول
6 أكتوبر — تعيد Anthropic تنظيم برنامجها للتحقق في الأمن السيبراني (Cyber Verification Program، CVP)، الذي يتيح لمحترفي الأمن الذين جرى التحقق منهم قدرات تحظرها نماذجها الموجّهة إلى الجمهور العام. كان هناك مساران يعملان بالتوازي منذ ستة أشهر: Project Glasswing، الذي أتاح الوصول إلى Claude Mythos للمؤسسات المسؤولة عن البرمجيات الأشد أهمية، وبرنامج CVP بمستوى واحد يخفف ضوابط الحماية في نماذج Opus وSonnet. يندمجان الآن في ثلاثة مستويات، تتيح جميعها الوصول إلى Claude Opus 5.5 وClaude Sonnet 5.5 وClaude Mythos 5.1 والنماذج المقبلة. أما النماذج المتاحة بشكل عام، وهي Opus 5.5 وFable 5.1 وSonnet 5.5، فتحتفظ بضوابط حماية حذرة تحظر معظم مهام الأمن السيبراني.
| مستوى الوصول | الاستخدامات المشمولة | الجمهور المستهدف والمدة |
|---|---|---|
| Defense Access | مركز عمليات الأمن، والاستجابة للحوادث، والهندسة العكسية للبرمجيات الخبيثة، وتحليل الثغرات | فرق الأمن، والبنى التحتية الحيوية مهما كان حجمها، والقائمون على صيانة البرمجيات المفتوحة المصدر، والباحثون؛ بضعة أيام |
| Red Team Access | استخدامات دفاعية، إضافة إلى اختبارات الاختراق وتمارين الهجوم المحاكى (red teaming) المصرّح بها | المؤسسات فقط، وعلى الأنظمة التي يُصرّح لها باختبارها؛ بضعة أسابيع |
| Specialized Access | اختبارات أنظمة السلامة: الطيران، وشبكات الكهرباء، والاتصالات، والتحويلات بين المصارف، وشبكات الإدارات | عدد قليل من المؤسسات تُقيّم كل منها على حدة بالتعاون مع الحكومة الأمريكية؛ مع نقل أعضاء Glasswing |
في مستوى Red Team Access، تظل الإجراءات التي قد تسبب أضرارًا مادية أو اضطرابًا واسع النطاق، مثل نشر برمجية فدية، محظورة في الوقت الفعلي. وللتحقق من إعداداتها، أخضعت Anthropic نموذج Opus 5.5 لاختبار CyScenarioBench، وهو تقييم لعمليات الأمن السيبراني متعددة المراحل، باستخدام ضوابط الحماية الخاصة بكل مستوى (10 تحديات، و5 محاولات لكل منها).
| الإعداد الذي اختبرته Anthropic (Opus 5.5) | النتيجة على CyScenarioBench (50 محاولة) |
|---|---|
| دون CVP | حُظرت جميع المهام منذ الطلب الأول |
| Defense Access | حُظرت 46 محاولة في مرحلة ما، ونجحت 4 |
| Red Team Access | دون أي حظر، مع نجاح 34 مهمة، بما يعادل نسبة 67,6 % للنموذج دون ضوابط حماية |
تقدّم التدوينة أيضًا حصيلة أولية لـGlasswing، بأرقام جزئية وفقًا لـAnthropic: اكتشف الشركاء ما لا يقل عن 129 000 ثغرة جرى التحقق منها بين أبريل ويوليو، إضافة إلى 5 500 ثغرة اكتشفتها فحوص Anthropic للبرمجيات المفتوحة المصدر، وصُنّف أكثر من 33 000 منها بدرجة خطورة حرجة أو عالية. تستند هذه الأرقام إلى 33 تقريرًا من الشركاء، وتقدّر Anthropic أن الأثر الفعلي «أعلى بخمس مرات على الأقل». وفي شهادة نُشرت في اليوم نفسه، تقول Comcast إنها اكتشفت باستخدام Claude Mythos Preview ثغرة مصادقة حرجة أثناء تقييم 258 نظامًا ونحو 170 مليون سطر من الشيفرة، كما راجع محلل في Booz Allen عددًا قدره 138 مستودعًا خلال اثني عشر يومًا.
من الناحية العملية، يشترط البرنامج الاحتفاظ بالبيانات لمراقبة إساءة الاستخدام، في انتظار Enterprise Frontier Safeguards (EFS)، الذي سيتيح في وقت لاحق هذا الخريف إبقاء هذه البيانات في سحابة يتحكم فيها العميل؛ ويمكن للمؤسسات التي تستخدم بالفعل Fable 5.1 أوMythos 5.1 دون الاحتفاظ بالبيانات أن تفعل الشيء نفسه مع CVP. البرنامج متاح عبر Claude Platform وVertex AI وMicrosoft Foundry، وعبر Amazon Bedrock للعملاء المؤهلين لاستخدام EFS فقط. ولا يمكن تقديم طلب فردي إلا لمستوى Defense Access، ضمن خطة مدفوعة، وسيتعين على هذا المستوى اعتماد مصادقة متعددة العوامل مقاومة للتصيد الاحتيالي بحلول 15 ديسمبر، والتوقف عن استخدام مفاتيح API. ومن المقرر عقد ندوة عبر الإنترنت في 14 أكتوبر، الساعة 9 بتوقيت PT.
🔗 تدوينة Anthropic عن Cyber Verification Program 🔗 صفحة المساعدة الخاصة بـCyber Verification Program 🔗 Comcast وBooz Allen مع Claude Mythos
EmbeddingGemma 2 : نموذج التضمينات المفتوح من Google يصبح متعدد الوسائط
6 أكتوبر — تنشر Google DeepMind نموذج EmbeddingGemma 2، الجيل الثاني من نموذج التضمينات المفتوح المصمّم للعمل على الجهاز. كان EmbeddingGemma الأول، الذي تجاوز عدد تنزيلاته 20 مليونًا بحسب Google، يعالج النص فقط؛ أما النموذج الجديد فيمثّل النصوص (بما فيها الشيفرة) والصور والفيديو والصوت، منفردة أو مجتمعة، في فضاء واحد ذي 768 بُعدًا. وهو مبني على معمارية Gemma 4، ويصدر بموجب ترخيص Apache 2.0.
Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.
🇸🇦 إليكم EmbeddingGemma 2، أول نموذج مفتوح لدينا متعدد الوسائط بطبيعته لتوليد التضمينات على الجهاز. يتجاوز النص ليوحّد الشيفرة والصور والصوت والفيديو في فضاء مشترك. — @GoogleDeepMind على X
يضمّ النموذج 740 مليون مَعلمة، لكنه يتكوّن من وحدات: نواة نصية بحجم 270M، يُضاف إليها عند الطلب مُرمِّز للرؤية (170M) ومُرمِّز للصوت (300M). لذلك لا يحمّل التطبيق المخصّص للنص وحده سوى 270M مَعلمة. ومع التكميم، تقيس Google على Pixel 11 Pro نحو 191 ميغابايت من RAM النشطة لأوزان النص، و567 ميغابايت للنموذج الكامل متعدد الوسائط.
| خاصية EmbeddingGemma 2 | القيمة التي تعلنها Google |
|---|---|
| إجمالي المَعلمات | 740M (النص 270M، الرؤية 170M، الصوت 300M) |
| أبعاد المتجهات | 768، قابلة للاختصار إلى 512 أو 256 أو 128 |
| نافذة السياق | 8K tokens، أربعة أضعاف نافذة الإصدار الأول |
| RAM النشطة على Pixel 11 Pro (مع التكميم) | نحو 191 Mo للنص وحده، و567 Mo للوسائط المتعددة |
| MTEB Code | 78,68، مقابل 68,76 للإصدار الأول |
| MTEB متعدد اللغات v2 | 61,36، مقابل 61,15 للإصدار الأول |
يتيح تعلّم التمثيلات «المتداخلة كالدمى الروسية» (Matryoshka Representation Learning) تقصير المتجهات، لتقليل حجم التخزين بما يصل إلى ستة أضعاف؛ وبحسب بطاقة النموذج، لا تتأثر الجودة كثيرًا عند تقليصها إلى 256 بُعدًا، بينما تناسب 128 بُعدًا أساسًا استخدامات النص وحده. ويتعلّق التحسّن الأوضح بالشيفرة، مع زيادة تقارب عشر نقاط على MTEB Code بحسب Google، بينما يظلّ النص متعدد اللغات عند مستواه السابق.
تتمثّل الاستخدامات المستهدفة في البحث والتوليد المعزّز بالاسترجاع (RAG) محليًا بالكامل، مثل العثور على مقطع من فيديو انطلاقًا من مذكرة صوتية. وبما أن النموذج يشترك مع Gemma 4 في مُجزِّئ النص (tokenizer) ومُرمِّز الصوت، فيمكن تشغيل النموذجين معًا باستهلاك أقل للذاكرة. الأوزان متاحة على Hugging Face وKaggle؛ وأُعلن عن وصول النموذج إلى Model Garden في Gemini Enterprise Agent Platform «قريبًا»، من دون تحديد موعد. ويحظى النموذج منذ إطلاقه بدعم Transformers (الإصدار 5.19.0)، وsentence-transformers، وMLX، وvLLM، وllama.cpp، وOllama، وLM Studio، وكذلك داخل المتصفح باستخدام transformers.js.
🔗 الإعلان على مدونة Google 🔗 بطاقة نموذج EmbeddingGemma 2 🔗 الأوزان على Hugging Face
نماذج القرار : OpenAI تفتح واجهة API Decisions، وPerplexity تنشر Decider v1.1 وتخفض سعره إلى النصف، وDecision Index 0.3 يصنّفها
شهدت نماذج القرار، التي تختار خيارًا أو تقيّم مدخلًا بدلًا من صياغة إجابة حرة، يومًا حافلًا: شركتان تعدّلان عروضهما وأسعارهما، ويتغيّر منهج التصنيف المجتمعي لهذه الفئة.
واجهة API Decisions من OpenAI في نسخة تجريبية عامة
6 أكتوبر — بعد أسبوع من إتاحتها بوصول محدود في DevDay، تنتقل واجهة API Decisions من OpenAI إلى نسخة تجريبية عامة، مع توقّع إتاحتها للجميع «خلال الأسابيع المقبلة». وتجيب عن أسئلة مغلقة حول نص أو صورة أو كليهما، باستخدام GPT-6 Luna، النموذج الوحيد المتاح، عبر نقطة وصول مخصّصة (POST /v1/decisions)؛ وبحسب OpenAI، تصل استجاباتها ذات الأنواع المحدّدة بسرعة أكبر بنحو 10 أضعاف مقارنةً بـ Responses API. والجديد اليوم هو السعر: 0,10 دولار لكل مليون رمز إدخال، من دون رسوم على المخرجات أو التخزين المؤقت، مع إضافة رسوم المعالجة الإقليمية والسياق الطويل.
| نوع السؤال | الاستخدام المستهدف | النتيجة المُعادة |
|---|---|---|
شرط منطقي (predicate) | التحقّق من شرط، مثل وجود منتج تالف في صورة | احتمال من 0 إلى 1 بأن يكون الشرط صحيحًا |
اختيار (choice) | اختيار أحد الخيارات من قائمة مقدّمة | الخيار، واحتمال كل خيار، ومؤشر للثقة |
تقييم (score) | التقييم وفق مستويات مرتّبة، مثل خطورة حادث | متوسط المستويات المرجّح بالاحتمالات |
يمكن طرح عدة أسئلة حول المدخل نفسه في طلب واحد، ويجب إرسال الصور بصيغة base64، من دون رابط مستضاف أو معرّف ملف. وتدعم الواجهة عدم الاحتفاظ بالبيانات (Zero Data Retention) والاستخدامات الخاضعة لـ HIPAA للعملاء المؤهّلين، مع إقامة البيانات في الولايات المتحدة وأوروبا.
🔗 دليل واجهة API Decisions 🔗 سجل تغييرات واجهة API من OpenAI
pplx-decider-v1.1-27b من Perplexity وخفض السعر إلى النصف
6 أكتوبر — بعد خمسة أيام من إطلاق واجهة Decisions API الخاصة بها، تحدّث Perplexity النموذج الذي يشغّلها، في سلسلة منشورات على حسابها للمطوّرين، @perplexitydevs. يحتفظ pplx-decider-v1.1-27b، المنشور بأوزان مفتوحة بموجب ترخيص Apache 2.0 على Hugging Face، بقاعدة Qwen3.8-27B المستخدمة في v1، ويقرأ النصوص والصور ضمن سياق يسع 250k رمز، ويزيل القناع السببي (causal mask) من طبقاته ذات الانتباه الكامل. وتبلغ تكلفة واجهة Decisions API، التي تقدّم الآن هذا النموذج، 0,02 دولار لكل مليون رمز إدخال، أي نصف سعر v1 البالغ 0,04 دولار، بينما تظلّ المخرجات مجانية.
| فئة Decision Index (بطاقة Hugging Face) | نتيجة Jev | نتيجة v1 | نتيجة v1.1 |
|---|---|---|---|
| المعارف (المعرفة) | 51,4 | 40,9 | 48,18 |
| اللغة (اللغة) | 62,0 | 63,5 | 69,45 |
| استرجاع المعلومات (الاسترجاع) | 55,4 | 54,9 | 61,26 |
| الأدوات (الأدوات) | 75,1 | 79,3 | 78,88 |
| الفنون (الفنون) | 37,7 | 39,4 | 44,66 |
| النتيجة الإجمالية المرجّحة | 57,9 | 56,4 | 61,56 |
بحسب بطاقة النموذج، ترتفع النتيجة الإجمالية من 56,4 إلى 61,56، متجاوزةً نتيجة Jev البالغة 57,9، وهو نموذج القرار من TypeSafe AI، الذي يظلّ متقدّمًا في المعارف. وتؤكّد Perplexity أيضًا أنها تحقّق أفضل نتيجة في Decision Index 0.3 الجديد. ولاستضافته ذاتيًا، يلزم معالج GPU قادر على استيعاب أوزان بحجم نحو 49 Gio، إلى جانب التنفيذ البرمجي المقدّم، لأن الاستدلال السببي القياسي لا يعيد إنتاج السلوك الذي جرى قياسه.
🔗 سلسلة منشورات @perplexitydevs على X 🔗 pplx-decider-v1.1-27b على Hugging Face
Decision Index 0.3
6 أكتوبر — ينشر apolinario، المهندس في Hugging Face، الإصدار 0.3 من Decision Index، وهو التصنيف المجتمعي لنماذج القرار المفتوحة التي تعيد إنتاج Decision Model من Jev. ويضمّ الآن 112 نموذجًا، منها 111 نسخة مفتوحة تعيد إنتاجه، وتعمل على NVIDIA RTX PRO 6000. ويتغيّر المنهج: تجمع النتيجة الكاملة (النتيجة الكاملة) بين 37 مجموعة اختبارات عامة، واختبارات خاصة تقيس المهارات نفسها، ومهام خاصة من مجالات جديدة، لكي يعكس الترتيب المهارات، ولا يقتصر على النجاح في اختبارات معروفة. ويظهر أيضًا تبويب للرؤية.
| الترتيب المعروض | النموذج المصنّف | النتيجة الكاملة |
|---|---|---|
| 1 | Perplexity Decider v1.1 (27B) | 62,8 |
| 2 | Fastino GLiDE دون تفكير (28B) | 60,2 |
| المرجع | Jev | 60,1 |
| 3 | Torchcast Decision 27B | 59,9 |
| 4 | deck31b (Gemma 4 31B) | 59,0 |
نتيجتا Decider v1.1 مختلفتان: 61,56 هي النتيجة المنشورة في بطاقة Perplexity، و62,8 هي التي يحسبها هذا التصنيف بمنهجه الجديد. والاختبارات الخاصة، بطبيعتها، لا تُنشر.
🔗 إعلان apolinario على X 🔗 Decision Index 0.3
التحكّم في الحاسوب : OpenAI تدرّب GPT-6 Astra على عقود Ironclad
6 أكتوبر — تطلق OpenAI تعاونات بحثية مع شركات برمجيات لزيادة فعالية وكلائها داخل برمجيات الأعمال، في إطار العمل على التحكّم في الحاسوب (computer use)، وتبدأ مع Ironclad، المتخصّصة في العقود بمساعدة الذكاء الاصطناعي. وقد حدّدت الفرق 11 مهمة في الشؤون القانونية والمبيعات والمشتريات، تستغرق كل منها من 30 إلى 40 دقيقة لمستخدم متمرّس بحسب OpenAI، وتُقيَّم وفق 8 إلى 50 معيارًا. وقدّمت Ironclad بيئات مستضافة لبرمجياتها، تدرّبت فيها النماذج بالتعلّم المعزّز على مهام اصطناعية مستمدّة من عقود عامة في قاعدة EDGAR التابعة لـ SEC.
| قياس OpenAI على المهام الـ 11 | GPT-5.6 Sol (استدلال High) | GPT-6 Astra (استدلال Max) |
|---|---|---|
| متوسط النتيجة | 41,6 % | 55,0 % (+32 %) |
| متوسط الوقت المقدّر لكل محاولة (بالمحاكاة) | 37,0 دقيقة | 19,2 دقيقة (-48 %) |
GPT-6 Astra هو أول نموذج من فئة النماذج الأكثر تقدّمًا لدى OpenAI يُدرَّب على هذه المهام، ويصل نموذج داخلي استُخدم أثناء تطويره إلى 63,7 %. هذه الأرقام صادرة عن OpenAI، والأوقات محسوبة بالمحاكاة بناءً على سرعات معالجة مفترضة، ولم تُقَس لدى العملاء. وتدعو OpenAI شركات برمجيات أخرى إلى اقتراح مهام لا ينجح الوكلاء الحاليون بعد في إنجازها بموثوقية.
🔗 تدوينة OpenAI عن تعاونها مع Ironclad
واجهات API والمنصات : مستويات الاستخدام وBAA لواجهة API من OpenAI، والمستندات والصور في Agent API من Perplexity، وGLM-5.3 على Bedrock
تخصّ أربعة تغييرات المطوّرين الذين يشترون خدمات الاستدلال: شروط الوصول إلى واجهة API من OpenAI، وأدوات Agent API من Perplexity، ونموذجًا مفتوحًا جديدًا في كتالوج AWS.
مستويات استخدام واجهة API من OpenAI تنخفض من خمسة إلى ثلاثة
6 أكتوبر — تبسّط OpenAI الوصول إلى أعلى حدود معدّل الطلبات (rate limits) في واجهتها البرمجية: تتحوّل مستويات الاستخدام المدفوعة الخمسة إلى ثلاثة، هي Build وLaunch وGrow. ويمكن الوصول إلى أعلى مستوى، Grow، بمدفوعات تراكمية للواجهة تبلغ 500 دولار، مقابل 1 000 دولار لأعلى مستوى سابق. وتنتقل المؤسسات الموجودة أصلًا على مستوى مدفوع تلقائيًا، من دون أي إجراء من جانبها، ثم ترتقي إلى مستوى أعلى عندما تبلغ مشترياتها التراكمية من الرصيد الحدود المطلوبة؛ ويظلّ المستوى المجاني محدودًا بـ 100 دولار شهريًا.
| مستوى الاستخدام | حدّ المشتريات التراكمية | سقف الاستخدام الشهري | Astra وSol وTerra (الطلبات والرموز في الدقيقة) | Luna (الطلبات والرموز في الدقيقة) |
|---|---|---|---|---|
| Build | 5 دولارات | 500 دولار | 5 000 و1 000 000 | 5 000 و2 000 000 |
| Launch | 100 دولار | 5 000 دولار | 10 000 و4 000 000 | 10 000 و10 000 000 |
| Grow | 500 دولار | 200 000 دولار | 15 000 و40 000 000 | 30 000 و180 000 000 |
🔗 سلسلة منشورات @OpenAIDevs على X 🔗 توثيق حدود معدّل الطلبات
توقيع BAA وتفعيل الامتثال لـ HIPAA ذاتيًا على واجهة API من OpenAI
5 أكتوبر — يمكن الآن للمؤسسات التي تعالج بيانات صحية محمية باستخدام واجهة API من OpenAI أن توقّع بنفسها اتفاقية الشريك التجاري (Business Associate Agreement، BAA) التي يفرضها القانون الأمريكي HIPAA. ضمن الإعدادات > المؤسسة > عام، يقبل أحد المسؤولين اتفاقية BAA القياسية ويفعّل دعم الامتثال لـ HIPAA، من دون عقد للمؤسسات. وتقتصر هذه الخدمة الذاتية على المؤسسات المؤهّلة ذات السجل الراسخ في استخدام الواجهة، ولا يمكن إلغاء التفعيل من هذه الإعدادات. أما البنود المخصّصة فلا تزال تتطلّب طلبًا عبر البريد الإلكتروني، مع ردّ خلال يوم إلى يومَي عمل. وتذكّر OpenAI بأن توقيع BAA وحده لا يجعل التطبيق ممتثلًا، وأنه لا تُقدَّم أي اتفاقية BAA لـ ChatGPT Business.
🔗 مقالة مساعدة OpenAI عن BAA للواجهة البرمجية
Agent API من Perplexity تقرأ المستندات وتبحث عن الصور
5 أكتوبر — يتلقّى سجل تغييرات واجهة API من Perplexity ثلاثة بنود في وقت متأخّر من المساء. وتقبل Agent API الآن مستندات PDF وDOC وDOCX وTXT وRTF كمدخلات، سواء أُدرجت داخل الطلب أو حُدّدت برابط HTTPS عام، مع اعتماد الدعم على النموذج والمزوّد المختارين. وتبحث أداة جديدة، image_search، عن الصور على الويب وتعيد نتائج منظّمة تتضمّن عنوان الصورة وعنوان صفحتها الأصلية: من 1 إلى 30 صورة لكل استدعاء، و5 افتراضيًا، مع مرشّحات للنطاقات والصيغ، وبحث آمن مفعّل افتراضيًا. وتبلغ تكلفتها 2,50 دولار لكل 1 000 استدعاء ناجح، ولا تُحتسب رسوم على الاستدعاءات الفاشلة. ويصحّح البند الثالث حساب التكاليف: تفصّل الاستجابات الآن تكلفة عمليات الاستخراج المنفّذة في البيئة المعزولة، وفق تعرفة GPT-6 Luna التي لم تتغيّر.
🔗 سجل تغييرات واجهة API من Perplexity 🔗 توثيق أداة image_search
GLM-5.3 من Z.ai على Amazon Bedrock
6 أكتوبر — تعلن Z.ai وصول GLM-5.3، نموذجها الرائد ذو الأوزان المفتوحة، إلى Amazon Bedrock؛ وتحدّد بطاقة AWS تاريخ الإطلاق في 5 أكتوبر. وهو نموذج بمزيج من الخبراء يضمّ 744 مليار مَعلمة، منها نحو 40 مليارًا نشطة لكل رمز، مع سياق يسع مليون رمز، وما يصل إلى 128 000 رمز في المخرجات. ويقتصر الوصول على العملاء المؤهّلين، الذين يتواصلون مع فريق إدارة حسابهم لدى AWS، ولا يُقدَّم النموذج إلا عبر الاستدلال بين المناطق (ملف US أو ملف عالمي)، مع تخزين مؤقت للموجّهات بدءًا من 1 024 رمزًا، ومستويات الخدمة Standard وPriority وFlex وReserved. ولا تذكر البطاقة سعرًا، بل تحيل إلى صفحة تسعير Bedrock. ويأتي GLM-5.3 بعد Kimi K3 (22 سبتمبر) وGrok 4.7 (28 سبتمبر)، اللذين وصلا إلى Bedrock خلال الأسبوعين الماضيين.
🔗 بطاقة GLM 5.3 على Amazon Bedrock 🔗 إعلان Z.ai على X
وكلاء البرمجة : Claude Code من 2.1.290 إلى 2.1.292، جلسات سحابية، Vibe CLI 2.26.0، وAntigravity وReplit
يتلقّى وكلاء البرمجة خمسة تحديثات، من الطرفية إلى المحرّر: ثلاثة إصدارات من Claude Code في أقل من عشرين ساعة، ودليل للجلسات السحابية، وVibe CLI التي تتوسّع واجهتها الجديدة المكتوبة بـ Rust، وامتداد Antigravity لـ VS Code، وReplit الذي بات يطّلع على جميع مشاريع المستخدم.
Claude Code من 2.1.290 إلى 2.1.292
5 و6 أكتوبر — صدر Claude Code 2.1.290 في 5 أكتوبر الساعة 23:33 بتوقيت UTC، وهو إصدار كبير يضم 190 بندًا، منها 131 إصلاحًا. يقبل claude attach وclaude logs جزءًا من اسم الجلسة بدلًا من معرّفها، ويحوّل /claude-api managed-agents-onboard نموذج Managed Agents الذي تصفه صفحة ويب إلى ملفات ant apply. لم تعد ميزانية البحث على الويب في الجلسة التفاعلية تتوقف بعد 200 استدعاء، بل تتجدد بمعدل 100 استدعاء في الساعة. وعند مستوى الجهد المتوسط (medium)، يشير /code-review أيضًا إلى مخالفة قواعد CLAUDE.md على Opus 5.5 وSonnet 5.5. وفي Slack، يحصل Claude Tag على وضع سريع (!fast)، ويُتاح لاستدعاء browser_batch في Claude in Chrome وقت قدره 90 ثانية بدلًا من 60، ولم يعد WebFetch يقتطع النص بصمت بعد 100 000 حرف. ويتطلب pyright والمزيد من صيغ ps إذنًا، مع إصلاح عدة ثغرات في الأذونات: أحرف البدل في rg وgit grep التي يوسّعها مفسّر الأوامر، وملفات CLAUDE.md المرتبطة بمواقع خارج مجلدات العمل، وتجاوز وحدة mod الخاصة بالمؤسسة بواسطة وحدة mod للمستخدم. وبعد أربع ساعات، أصلح الإصدار 2.1.291 تراجعين، ظهر أحدهما مع 2.1.290 (فقدان الردود على طلبات الإذن في الجلسات السحابية)، والآخر مع 2.1.288 (فقدان آخر رسائل الجلسة عند الخروج).
وفي 6 أكتوبر الساعة 18:59 بتوقيت UTC، أضاف الإصدار 2.1.292 (92 بندًا، منها 64 إصلاحًا) المعلمة effort إلى أداة Agent لتشغيل وكيل فرعي بمستوى الجهد المطلوب، وأضاف claude plugin install --marketplace، الذي يضيف سوق الإضافات (marketplace) عند الحاجة ثم يثبّت الإضافة. وتتفاوض خوادم MCP المحلية (stdio) الآن افتراضيًا على البروتوكول 2026-07-28 (مع MCP_PROTOCOL_NEGOTIATION=legacy للعودة)، ويطيل CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS محاولات إعادة التشغيل عند أخطاء 529، وتحصل وحدات mod على حدث للإكمال التلقائي للموجّه وعلى التخزين المؤقت للموجّه. وعلى صعيد الأمان، لم تعد الموافقات الصادرة عن خطاف PreToolUse والوضع التلقائي تتجاوز طلب الإذن لقراءة مسارات الشبكة (UNC)، وتُضاف محارف الإفلات إلى الوسوم <system-reminder> التي يكتبها خطاف قبل وصولها إلى Claude. وأصبحت أداة Artifact تسرد أخيرًا 200 عنصر بدلًا من 50، ويفصّل Code Review إحصاءاته حسب المستودع. ولم يُعلَن عن 2.1.290 أو 2.1.292 على X.
| إصدار Claude Code | تاريخ الإصدار (UTC) | عدد البنود | أبرز إضافة |
|---|---|---|---|
| 2.1.290 | 5 أكتوبر، 23 h 33 | 190، منها 131 إصلاحًا | تحديد الجلسات بأسمائها، managed-agents-onboard، تجديد ميزانية WebSearch |
| 2.1.291 | 6 أكتوبر، 3 h 55 | 2 إصلاحات | إصلاح تراجعين |
| 2.1.292 | 6 أكتوبر، 18 h 59 | 92، منها 64 إصلاحًا | جهد الوكلاء الفرعيين، الإضافة وسوق الإضافات بأمر واحد، MCP 2026-07-28 |
🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292
دليل الجلسات السحابية في Claude Code
6 أكتوبر — بعد أسبوعين من إطلاق النسخة التمهيدية للجلسات السحابية في Claude Code، تنشر Anthropic على claude.dev دليلًا عمليًا بقلم أدي عثماني. تعمل كل مهمة على آلة افتراضية جديدة بنحو 4 vCPU و16 غيغابايت من RAM و30 غيغابايت من مساحة القرص، مع استنساخ المستودع على فرع جديد، دون تكلفة حوسبة إضافية على خطط Pro وMax وTeam وEnterprise. ويصف الدليل سبعة استخدامات: إنجاز قائمة المهام المتراكمة (backlog) بالتوازي، وإثبات صحة إصلاح عبر عمليات تشغيل متكررة، والتخطيط محليًا ثم استئناف الجلسة باستخدام claude --teleport، والمتابعة من الهاتف، وإسناد إخفاقات CI وتعليقات المراجعة إلى Auto-fix، وتشغيل إجراءات دورية، وتنفيذ شيفرة غير آمنة في آلة افتراضية يمكن التخلص منها. وفي عرضه التوضيحي، انتهت الجلسات الثلاث جميعها بعد 87 ثانية من بدء الجلسة الأولى، ويمكن للمشروع إطلاق ما يصل إلى 200 سلسلة محادثات جديدة (threads) يوميًا. ويفصّل الدليل أيضًا الاتصال بـGitHub: تسجيل الدخول باستخدام GitHub وتثبيت تطبيق Claude GitHub إذنان منفصلان، والثاني وحده يتيح الوصول إلى المستودعات الخاصة. ويجب المطالبة بالرصيد الإضافي البالغ 100 دولار (Pro) أو 250 دولارًا (Max) قبل 7 أكتوبر الساعة 23:59 بتوقيت PT، وتنتهي صلاحيته في 4 نوفمبر.
🔗 الدليل العملي للجلسات السحابية على claude.dev 🔗 تذكير @ClaudeDevs بالرصيد الإضافي
Vibe CLI 2.26.0
6 أكتوبر — تصدر Mistral الإصدار Vibe CLI 2.26.0 من وكيلها البرمجي الذي يعمل عبر سطر الأوامر، بعد ثلاثة عشر يومًا من 2.25.8 ودون إعلان على X. ويُعد التحديث كبيرًا، مع 33 إضافة و23 تغييرًا و91 إصلاحًا: يتعلق 72 من بنوده الـ147 بالواجهة الجديدة المكتوبة بلغة Rust: معالج التشغيل الأول، والوضع الصوتي (/voice)، وموجّهات متكررة موصوفة بلغة طبيعية باستخدام /loop، وإرسال الجلسة إلى Vibe Code Web باستخدام /teleport، والأمر vibe update. ويعمل Vibe الآن دائمًا على Unified Harness، محرك التنفيذ الجديد، ويتوقف برسالة خطأ صريحة عند غيابه بدلًا من العودة بصمت إلى المحرك القديم. ويمكن للإضافات تضمين خادم MCP خاص بها، ولم يعد مفتاح API الاحتياطي المخزّن في ~/.vibe/.env قابلًا للقراءة إلا من مالكه، وأصبحت Rust CLI ترسل بيانات قياس الاستخدام (وقت بدء التشغيل، والأوامر المستخدمة، والطرفية المكتشفة) إلى Mistral.
🔗 ملاحظات إصدار Mistral Vibe v2.26.0
إضافة Antigravity لـVS Code 1.7.0
5 أكتوبر — تصدر Google النسخة 1.7.0 من إضافة Antigravity لـVisual Studio Code، التي تُدخل وكلاء Google Antigravity إلى محرر Microsoft (محادثة في لوحة جانبية، ومراجعة الفروق ضمن المحرر، وخطط تفاعلية)، بدءًا من VS Code 1.90. وتُحدَّث الإضافة نحو مرة كل أسبوع منذ بداية سبتمبر وفقًا لسجل تغييراتها، ولم يسبق تناولها هنا. وتركز هذه النسخة 1.7.0 (6 تحسينات و9 إصلاحات) على مراجعة الشيفرة: يمكن التراجع عن قرارات Accept وReject وإعادتها باستخدام لوحة المفاتيح، ويضيف محرر الفروق جنبًا إلى جنب زري Accept All وReject All، ولم يعد الحفظ التلقائي (Auto Save) في VS Code قادرًا على الكتابة فوق مراجعة جارية أو إغلاقها. وفي Windows، تشير إشعارات النظام إلى انتهاء المهمة عندما لا تكون النافذة في المقدمة، ويحصل كل من Google Cloud Workstations وCloud Shell على مصادقة تفاعلية. وفي اليوم نفسه، تنتقل إضافة Visual Studio إلى الإصدار 1.0.261005.0 وتُرفق سجلات التشخيص بالملاحظات المُرسلة.
🔗 سجل تغييرات Google Antigravity
Replit وسياق جميع المشاريع
6 أكتوبر — تعلن Replit أنها أصبحت تمتلك سياق جميع مشاريع المستخدم. ومن محادثة جديدة، يمكن طلب العثور على مشروع موجود، أو إضافة ميزة إليه، أو الاستناد إلى مشروع بوصفه مرجعًا لمشروع آخر؛ فتقرأ Replit الملفات المعنية وتبدأ التعديلات في مهام تعمل في الخلفية (background tasks)، مع روابط لمراجعة التغييرات. ويتجاوز المثال المختار البرمجة وحدها: تطبيق لوحة ألوان « Partner Marketing Hub » على مشروعين آخرين لعلامة تجارية للقهوة. ويقتصر الإعلان على تغريدة مصحوبة بفيديو، دون منشور مدونة أو وثائق أو تسعير.
طلبات السحب المكدَّسة في GitHub تصل إلى الإتاحة العامة
6 أكتوبر — تتيح GitHub لجميع خطط github.com طلبات السحب المكدَّسة (stacked pull requests)، التي كانت في معاينة عامة منذ 30 يوليو: يُقسَّم تغيير كبير إلى طلبات سحب أصغر، تُراجَع كل منها على حدة ثم تُدمَج معًا. وستحصل عليها GitHub Enterprise Server في إصدار قادم. ووفقًا لـGitHub، تدمج المستودعات التي تستخدم المكدَّسات شيفرة أكثر بنسبة 9 % من مستودعات مماثلة، ويستخدمها أكثر من ثلثي المستودعات الواقعة ضمن أعلى 1 %، مع تحسن الوقت اللازم للوصول إلى الدمج بنسبة 5 %.
تقلل النسخة النهائية العقبات التي تواجه الدمج. فعندما يتقدم الفرع الرئيسي، يحافظ « Rebase stack » على الموافقات على الشيفرة التي لم تتغير ويُنشئ إيداعات بديلة موقَّعة؛ وتمر المكدَّسة عبر طابور الدمج (merge queue) بوصفها مجموعة واحدة، ويُغيَّر الفرع المستهدف لمكدَّسة حُذف فرعها الأساسي بدلًا من إغلاقها. وسيصل الدمج التلقائي لمكدَّسة كاملة « خلال الأسابيع المقبلة ». وللاستخدام عبر سطر الأوامر وللوكلاء، تدعم إضافة gh stack في GitHub CLI أشجار العمل في Git.
🔗 سجل تغييرات GitHub بشأن طلبات السحب المكدَّسة
نماذج متعددة اللغات: Tiny Aya L2-Thinker من Cohere وFalcon-OCR-Arabic من TII
يستهدف نموذجان صغيران لغاتٍ لا تخدمها النماذج الكبيرة بالكفاءة نفسها: أحدهما يستدل بلغة المستخدم، والآخر يقرأ الوثائق بالعربية.
Tiny Aya L2-Thinker من Cohere
6 أكتوبر — تتناول Cohere اللغة التي تستدل بها النماذج: فعندما تُسأل بالإسبانية أو العربية أو السواحيلية، يفكر معظمها بالإنجليزية قبل الإجابة. ويستدل نموذجها البحثي Tiny Aya L2-Thinker (3,35 مليار معامل) بلغة الموجّه في أكثر من 93 % من الحالات، عبر 60 لغة. وتكمن الوصفة في مزيج البيانات: نحو 1,7 مليون مثال استدلال بالإنجليزية، مولَّدة بواسطة gpt-oss-120b، تجعله يستدل بلغة المستخدم في 12,8 % من الحالات فقط؛ ويرفع نحو 5 000 مثال مترجم لكل لغة، عبر 44 لغة، هذه النسبة إلى 86,1 %، وتوسّع بيانات متعددة اللغات دون استدلال هذا السلوك ليشمل لغات أخرى. وبالمقارنة مع نسخته التوأم التي تستدل بالإنجليزية، تتراجع الدقة بنقطتين إلى ثلاث نقاط على الأكثر في خمسة من الاختبارات المعيارية الستة؛ وحده PolyMath، الذي يختبر رياضيات المسابقات، يسجل تراجعًا أوضح، لغياب مرحلة التعلم بالتعزيز. ويستهلك النموذج أقل من 5 000 رمز للتفكير في المتوسط. وتُنشر النماذج والبيانات على Hugging Face بموجب الترخيص غير التجاري CC-BY-NC 4.0؛ ويعرض المنشور ورقة arXiv بتاريخ 9 سبتمبر.
🔗 منشور Cohere البحثي عن Tiny Aya L2-Thinker
Falcon-OCR-Arabic من TII
6 أكتوبر — يقدم TII، المعهد الإماراتي الذي يطور نماذج Falcon، على مدونة Hugging Face نموذج Falcon-OCR-Arabic، وهو نسخة عربية من نموذجه للتعرف على النصوص Falcon OCR. ويحتفظ بمعاملاته البالغ عددها 270 مليونًا وبمعماريته القائمة على الدمج المبكر، وقد كُيِّف بضبط دقيق خاضع للإشراف على وثائق عربية حقيقية واصطناعية، ثم بالتعلم بالتعزيز. وعلى اختبار معياري أعده TII بنفسه (11 974 وثيقة حقيقية، و15 فئة)، يحتل المرتبة الثانية بين النماذج الـ17 التي جرت مقارنتها، والمرتبة الأولى في الوثائق الرسمية والنماذج الإدارية والإيصالات والفواتير.
| النموذج الذي قيَّمه TII | دقة النص | درجة Table TEDS |
|---|---|---|
| Gemini 3.5 Flash | 84,34 % | 51,30 % |
| Falcon-OCR-Arabic (270M) | 81,87 % | 59,95 % |
| Claude Opus 5.5 | 79,22 % | 43,98 % |
| GPT Astra | 75,02 % | 51,23 % |
| Chandra OCR 2 (أفضل OCR متخصِّص) | 61,67 % | 32,63 % |
لا يوفر المنشور سوى مساحة للتجربة (playground): لم تكن أي أوزان لـFalcon-OCR-Arabic ظاهرة على Hub وقت رصدنا، ولا يُذكر أي ترخيص.
🔗 منشور TII عن Falcon-OCR-Arabic
مكتبات Hugging Face: تدمج Diffusers 0.41.0 نموذج Qwen-Image 2.1، وتضيف Transformers v5.19.0 دعم EmbeddingGemma 2
تصدر المكتبتان الرئيسيتان لنماذج Hugging Face إصدارًا جديدًا في اليوم نفسه.
Diffusers 0.41.0 وQwen-Image 2.1
6 أكتوبر — تدمج Diffusers 0.41.0، مكتبة Hugging Face لنماذج الانتشار، نموذج Qwen-Image 2.1 من Alibaba، الذي يجمع بين توليد الصور وتحريرها: أصبح بالإمكان استخدامه مباشرة للتوليد والتحرير وإنتاج صور بخلفية شفافة (مخرجات RGBA أصلية) وتدريب LoRA، مع مكوّن للتوليد البصري يضم 7 مليارات معامل. ويغيّر الفريق أيضًا وتيرة الإصدارات: فعلى غرار Transformers، ستضبط Diffusers إصداراتها الفرعية وفق وصول نماذج جديدة، مع إبقاء الإصدارات التصحيحية مخصصة للإصلاحات. ويتيح التحميل باستخدام التوازي الموترّي لكل GPU قراءة حصته وحدها من الأوزان، ويضيف الإصدار مسارات المعالجة LTX-2.5 DFR وتحسينات لـCosmos 3. وفي المقابل، أصبح دعم ONNX متقادمًا لصالح Optimum.
🔗 ملاحظات إصدار Diffusers 0.41.0
Transformers v5.19.0
6 أكتوبر — بعد ستة أيام من v5.18.0، تضيف Transformers v5.19.0 دعم EmbeddingGemma 2، الذي عُرض أعلاه، مع متجهاته القابلة للتقصير ومشفّرات الرؤية والصوت التي يمكن تعطيلها عند التحميل. وعلى صعيد التدريب الموزع، يحصل التوازي بين الخبراء على توزيع للرموز (token dispatch)، مفعَّل افتراضيًا لـQwen3 MoE وMellum: لم يعد حجمه ملزمًا بمساواة حجم التوازي الموترّي، ويعمل Trainer مع هذا الوضع. وأصبح إعداد الذاكرة المؤقتة ممكنًا لكل طبقة على حدة، ما يفيد النماذج غير المتجانسة، وتدعم المعالجة المستمرة على دفعات (continuous batching) أجهزة XPU. ويضم الإصدار ستة تغييرات غير متوافقة مع الإصدارات السابقة، منها إرجاع قيم logits للموجّه في جميع نماذج MoE والتخلي التدريجي عن البادئة paged|.
🔗 ملاحظات إصدار Transformers v5.19.0
الوكلاء الصوتيون: تطلق ElevenLabs أداة ElevenAgents Architect في مرحلة Alpha
6 أكتوبر — تدمج ElevenLabs في ElevenAgents، منصتها للوكلاء الحواريين، خبيرًا يُدعى Architect، يساعد الفرق على بناء وكلائها الصوتيين أو النصيين وتحسينها عبر التحدث إليه أو الكتابة له. ويعرف جميع إعدادات ElevenAgents (قاعدة المعرفة، والموجّهات، وتسلسل الخطوات، والأصوات، وضوابط الحماية، والأدوات، والمحاكاة) وكيفية تفاعلها. ويمكن عرض سؤال عليه، أو اختبار فاشل، أو ارتفاع في التحويلات إلى موظف بشري، أو ملاحظة رصدتها ElevenAgents Spotlight: فيحلل نصوص المحادثات، ويحدد السبب، ويقترح تعديلًا، ويكتب عمليات المحاكاة التي تتحقق من صحته. كما يبني وكيلًا انطلاقًا من وصف بسيط. ويصل كل تغيير في مسودة لها إصدار محدد ويمكن التراجع عنها، ولا يُنقل أي شيء إلى بيئة الإنتاج دون موافقة. ويمكن الوصول إلى Architect من داخل المنتج، وكذلك من Claude وClaude Code وChatGPT وCursor وGrok Bot. وهو متاح الآن في مرحلة Alpha، دون تسعير أو أرقام للنتائج.
🔗 منشور ElevenLabs عن ElevenAgents Architect
توليد الفيديو: FLUX 3 يتصدر Physics-IQ Verified بحسب Black Forest Labs
6 أكتوبر — تعلن Black Forest Labs تصدّر Physics-IQ، وهو معيار الاختبار من Google DeepMind الذي يقيس فهم نماذج الفيديو للعالم المادي: يُعرض على النموذج بداية تجربة حقيقية مصوّرة، وعليه أن يتنبأ بما سيحدث بعدها، في مجالات الموائع والبصريات وميكانيكا الأجسام الصلبة. وتتولى Anates Labs إدارة التصنيف المرجعي، Physics-IQ Verified. وفي مسار تحويل الفيديو إلى فيديو، يتقدم FLUX 3 [large] بفارق واضح على Cosmos3 من NVIDIA، بتكلفة أعلى لكل فيديو.
| النموذج والطريقة (تحويل الفيديو إلى فيديو) | نتيجة Physics-IQ Verified | التكلفة المعيارية لكل فيديو |
|---|---|---|
| FLUX 3 [large]، أفضل نتيجة من 8 عمليات توليد | 64,35 % | 16,43 دولارًا |
| FLUX 3 [large] | 61,11 % | 2,08 دولار |
| Cosmos3 Super (NVIDIA) | 50,80 % | 0,82 دولار |
| Cosmos3 Nano (NVIDIA) | 43,00 % | 0,82 دولار |
وفي مسار تحويل الصور إلى فيديو، يتقدم FLUX 3 [large] أيضًا على Physis-Lang، وهي الطريقة التي وضعتها NVIDIA في الصدارة يوم 29 سبتمبر. ويُعدّ FLUX 3 [large] نموذجًا مملوكًا، ولا تتضمن سلسلة المنشورات موعدًا لإتاحة هذه النسخة أو سعرًا لها.
🔗 سلسلة منشورات @bfl_ai على X 🔗 تصنيف Physics-IQ Verified
تقييمات عامة: GeoGuess Bench وRSI Arena
يخرج تقييمان متاحان للجمهور عن معايير الاختبار المعتادة: يجعل أحدهما النماذج تلعب GeoGuessr، بينما يتيح الآخر للجمهور التصويت على نماذج درّبها وكلاء.
GeoGuess Bench
6 أكتوبر — ينشر حسن، مسؤول تجربة المطورين في Together AI، مشروع GeoGuess Bench، وهو منصة اختبار شخصية تجعل النماذج تلعب GeoGuessr: يرى كل نموذج صور الشوارع الـ210 نفسها ويضع دبوسًا على الخريطة تُحتسب نقاطه وفق صيغة اللعبة، وصولًا إلى 25 000 نقطة في مباراة من خمس جولات. ويتصدر Claude Opus 5.5، بفارق بسيط عن Claude Fable 5.1؛ أما المفاجأة فهي Muse Glimmer 30B، نموذج Meta مفتوح الأوزان، الذي يحتل المركز الثالث ويتقدم على GPT-6 Astra بتكلفة أقل بنحو 45 مرة لكل مباراة.
| الترتيب في GeoGuess Bench | النموذج المُقيَّم | النتيجة من 25 000 | التكلفة لكل مباراة |
|---|---|---|---|
| 1 | Claude Opus 5.5 | 23 412 | 0,064 دولار |
| 2 | Claude Fable 5.1 | 23 307 | 0,115 دولار |
| 3 | Muse Glimmer 30B (مفتوح) | 22 407 | 0,0049 دولار |
| 4 | GPT-6 Astra | 21 562 | 0,223 دولار |
| 5 | GPT-6.1 Sol | 21 194 | 0,042 دولار |
| 6 | GLM-5.3 Flash (مفتوح) | 21 183 | 0,0087 دولار |
وبذلك يحقق GLM-5.3 Flash أداءً مماثلًا لـGPT-6.1 Sol بتكلفة أقل بنحو خمس مرات. وهذا مشروع شخصي لموظف في Together AI، مزوّد خدمات الاستدلال للنماذج المفتوحة، وليس تقييمًا تجريه الشركة؛ ولا يتضمن أي نموذج Gemini، وقد نُشرت الشيفرة على GitHub.
🔗 إعلان حسن على X 🔗 GeoGuess Bench
RSI Arena
6 أكتوبر — يعلن زيتشن تشن جولة جديدة من RSI Arena، وهو اختصار للتحسين الذاتي التكراري، التحسين الذاتي التكراري، وهذه المرة بالتعاون مع Hugging Face. حصل وكلاء ذكاء اصطناعي على وحدات GPU ومهمة واحدة: تدريب نماذج أفضل؛ فاختاروا البيانات بأنفسهم، وكتبوا الشيفرة وأجروا التجارب. وبعد انتهاء جولة التدريب الأولى، يدخل الجمهور في الحلقة: تتواجه النماذج في مواجهات ثنائية، ويصوّت المشاركون، ثم يستخدم الوكلاء هذه الملاحظات لإجراء تجارب جديدة. وتقدّم Inference Endpoints من Hugging Face كل نموذج مباشرة، ويسرد الموقع عشرة وكلاء، منهم GPT-6 Astra وGrok 4.7 وDeepSeek V4.1 Flash وGLM-5.3 وMuse Spark 1.3؛ وكانت لوحة المتابعة تعرض نفقات API بقيمة 286,60 دولارًا من أصل 300، واستهلاكًا قدره 755,17 ساعة GPU من أصل 1 000. ويعد الفريق بنشر كل نموذج درّبه الوكلاء على Hub، ونشر جميع المخرجات عند انتهاء التجربة: البيانات والشيفرة ومسار البحث الكامل لكل وكيل.
🔗 إعلان زيتشن تشن على X 🔗 RSI Arena
البنية التحتية لوحدات GPU: NVIDIA تنشر AICR v1.0
6 أكتوبر — تنشر NVIDIA الإصدار 1.0 من AI Cluster Runtime (AICR)، وهو مشروع مفتوح يهدف إلى إنهاء إعداد عناقيد Kubernetes المزودة بوحدات GPU بطريقة التجربة والخطأ. يعتمد العنقود المسرَّع على عشرات المكوّنات ذات الإصدارات المستقلة، مثل النواة وبرامج التشغيل وبيئات الحاويات والشبكات والتخزين والمشغّلات والمكتبات، وقد تفشل توليفة تعمل في بيئة ما بصمت في بيئة أخرى. ويعالج AICR ذلك بوصفات مثبتة الإصدارات ومُتحقَّق منها، تُحوَّل إلى صيغ مناسبة لـHelm أو Argo CD أو Flux أو Helmfile، وتُرفق بأدلة تحقق موقّعة على العتاد الذي خضع للاختبار. ويضع الإصدار v1.0 عقدًا للتوافق: تصبح CLI وAPI REST وSDK Go وبنية حزم النشر ومخططات المخرجات واجهات مستقرة، وسيستلزم أي تغيير يكسر التوافق إصدارًا رئيسيًا جديدًا. وتعلن NVIDIA مشاركة أكثر من 100 مساهم، نحو نصفهم من خارج الشركة، وتذكر عمليات تكامل لدى Pulumi Labs وفي مدير العناقيد المتعددة k0rdent من Mirantis.
🔗 تدوينة على مدونة NVIDIA التقنية
Claude Startups: منتجات وأرصدة تصل قيمتها إلى 7 000 دولار، وStartup Stack بقيمة 45 000 دولار
6 أكتوبر — توسّع Anthropic إتاحة Claude Startups، برنامجها للمؤسسين الذين يبنون باستخدام Claude، ليشمل الشركات الناشئة التي تأسست منذ أقل من خمس سنوات أو حصلت على تمويل خلال العامين الماضيين.
| مزايا البرنامج | القيمة المعلنة من Anthropic |
|---|---|
| عام من Claude Team، لما يصل إلى خمسة مقاعد Premium | 6 000 دولار (خمسة مقاعد بسعر 100 دولار شهريًا) |
| رصيد API لمرة واحدة، متاح فور الموافقة | 1 000 دولار |
| إجمالي منتجات Claude وأرصدته | حتى 7 000 دولار |
| Claude Startup Stack (عروض الشركاء) | حتى 45 000 دولار |
يسري عام Claude Team على الشركات التي تبدأ استخدام Team، وتعتمد قيمته الفعلية على عدد المقاعد ونوعها. وتجمع Claude Startup Stack، الجديدة اليوم، خصومات وأرصدة من شركات تبني باستخدام Claude، منها Linear وLovable وElevenLabs وGranola وHex؛ ويعادل سقفها القيمة الإجمالية لجميع العروض وفق الأسعار المعلنة في سبتمبر 2026، ولا يمكن الجمع بين جميع هذه العروض. ويضيف البرنامج مواعيد للتواصل مع فريق الذكاء الاصطناعي التطبيقي في Anthropic، ومساعدة لنشر صفحة تعريفية على Claude Marketplace، وإمكانية حضور فعاليات.
🔗 تدوينة Anthropic عن Claude Startups 🔗 سلسلة منشورات @claudeai عن Claude Startup Stack
أخبار موجزة
- Claude Projects والمجلد المحلي — يعلن دان فاين، من Anthropic، أن جلسات Claude Projects السحابية تستطيع الاتصال بمجلد معتمد على الحاسوب، ولا تصل إليه إلا عندما تحتاج إليه مهمة؛ ويجري طرح الميزة تدريجيًا منذ 5 أكتوبر، وقد أوشك الفريق على إتمامه (أوشكنا على الوصول)، بحسب بوريس تشيرني. 🔗 المصدر · 🔗 بوريس تشيرني
- Claude في رسائل Slack الجماعية — يمكن الآن إضافة Claude إلى الرسائل الجماعية (الرسائل المباشرة الجماعية) في Slack مثل أي مشارك؛ ويرد ضمن سلسلة محادثة يواصل متابعتها، ويستطيع استخدام الموصلات الشخصية للشخص الذي يستدعيه، دون تفاصيل عن الخطط أو الجدول الزمني. 🔗 المصدر
- بوريس تشيرني وطريقته في كتابة التوجيهات — يجعل بوريس تشيرني Opus 5.5 يبني موقعًا مرافقًا تفاعليًا لحلقة من بودكاست Acquired عن Home Depot، بما في ذلك الرسوم بالألوان المائية؛ وبحسبه، لا سرّ لكتابة التوجيهات: أخبر النموذج بما تريده، ومقدار الجهد الذي ينبغي أن يبذله، وكيف يتحقق من النتيجة. 🔗 الموقع المرافق · 🔗 طريقته في كتابة التوجيهات
- Atlassian وOpenAI — بموجب اتفاق جديد، ستشغّل النماذج الرائدة من عائلة GPT-6، ومنها GPT-6 Astra، وكلاء منصة Atlassian وRovo؛ ويستخدم أكثر من 3 000 مطور في Atlassian بالفعل Codex، وتُدرس عمليات تكامل أعمق مع Jira، دون إعلان قيمة الاتفاق. 🔗 المصدر
- أدوات Codex المصغرة في ChatGPT على iOS — يضيف الإصدار 1.2026.267 من ChatGPT على iOS، الصادر في 2 أكتوبر، أدوات مصغرة على الشاشة الرئيسية لمهام Codex الأخيرة على الحواسيب المحددة، وأخرى لحصة الاستخدام المتبقية وموعد تجددها، متاحة أيضًا على شاشة القفل، وإعدادًا يُبقي لوحة المفاتيح مفتوحة. 🔗 المصدر
- Gemini CLI v0.63.0 وv0.64.0-preview.0 — يعيد الإصدار المستقر v0.63.0 إدراج البنود الـ15 نفسها من النسخة التجريبية الصادرة في 29 سبتمبر، وتجمع النسخة التجريبية v0.64.0-preview.0 البنود الـ16 من الإصدارات الليلية بين 30 سبتمبر و3 أكتوبر: لا محتوى جديدًا، والإصدار الليلي ليوم 6 أكتوبر فارغ. 🔗 المصدر
- SDK Python من Mistral 3.1.0 — يُولَّد هذا الإصدار تلقائيًا انطلاقًا من API، ويضيف في المرحلة التجريبية أربع عشرة عملية تقييم ضمن وحدة الرصد؛ وتنتقل أساليب
RunsإلىWorkflows.runs، ما قد يعطّل الشيفرة الحالية رغم أنه مجرد تحديث للإصدار الفرعي. 🔗 المصدر - Qwen Code v0.25.1-preview.0 — بعد يوم من v0.25.0، تقدم هذه النسخة التجريبية 13 ميزة و27 إصلاحًا، منها بيئة تشغيل Kubernetes تجريبية، وأوامر Shell ومراقبة في الخلفية لـManaged Agent، وقواعد MCP لم تعد تسمح لخادم يحمل الاسم نفسه. 🔗 المصدر
- SDK TypeScript من SpaceXAI 0.2.2 — نُشر هذا الإصدار في 5 أكتوبر دون إعلان، ولا يتضمن سوى تغيير واحد: ينطبق الخيار
retryBeforeOutputأيضًا على استدعاءcreate()غير متدفق (بث متواصل) يتوقع JSON. 🔗 المصدر - Falcon-Emirati-7B، اللهجة الإماراتية — تخصّص TII نموذج Falcon-H1-Arabic 7B للعربية الإماراتية: 84,83 % على Alyah، وهو معيار اختبار من 1 173 سؤالًا، والتزام باللهجة يبلغ 0,52 مقابل 0,05 في أفضل الحالات لدى ALLaM وGemma 3 27B وJais-2 وFanar-2، بحسب نموذج التحكيم Gemini 3.7 Flash؛ ولا يُتاح النموذج إلا على منصة المحادثة التابعة لـTII. 🔗 المصدر
- Datasets 5.1.0 — يتيح إصدار مكتبة مجموعات البيانات المنشور في 5 أكتوبر قراءة بيئات التعلم المعزز Harbor، والتنسيق العمودي Vortex، وخمسة تنسيقات للبيانات البيولوجية (FASTA وFASTQ وGenBank وPDB وmmCIF)، ويصلح ثغرة كانت تسمح لأرشيف بالكتابة في مجلد مجاور. 🔗 المصدر
- TRL v1.14.2 — يصلح هذا التحديث خللًا كان يفسد التدريب بصمت: فمن دون vLLM، لم تكن GRPO وRLOO وDistillation تتوقف عند نهاية الدور في نماذج مثل Gemma أو Phi-3.5، وكانت تتعلم من كل النص اللاحق حتى بلوغ الطول الأقصى؛ كما أُصلحت ثلاثة أعطال. 🔗 المصدر
- Jev في مواجهة رسائل الحملات الانتخابية — في تدوينة مجتمعية، يفرز ستيفن سولكا رسائله السياسية باستخدام Jev، الذي حقق 99 نتيجة صحيحة من 100 رسالة فعلية، مع نتيجة إيجابية كاذبة واحدة، ثم باستخدام مصنِّف SetFit ذي 22,6 مليون معلمة يعمل على المعالج: 98 % في التقييم الأولي، لكن 18 من 23 في الحالات الصعبة. 🔗 المصدر
- Open Together في 16 أكتوبر — ينظم vLLM وHugging Face فعالية Open Together، وهي تجمع لمطوري البرمجيات مفتوحة المصدر يفتتح Open Source AI Week يوم الجمعة 16 أكتوبر في سان فرانسيسكو؛ وبحسب جيف بودييه، تضم قائمة الانتظار 150 شخصًا، وقد ضُوعفت السعة. 🔗 المصدر · 🔗 جيف بودييه
- Copilot CLI 1.0.93-2 — تضيف هذه النسخة التجريبية إعدادًا للمؤسسات،
permissions.limitTo، يحصر طلبات الشبكة في نطاقات خاضعة للإدارة، ويبرز GPT-6.1 Sol وGPT-6 Astra وLuna ونماذج Claude 5.5 في قائمة الاختيار، ولم يعد يقرأ إعدادات المستخدم إلا من~/.copilot/settings.json. 🔗 المصدر - AI Scan في نظرة عامة على الأمان — يستطيع مسؤولو المؤسسات والشركات الآن أن يروا، في نظرة عامة على الأمان (نظرة عامة على الأمان) في GitHub، المستودعات التي فعّلت تحليل طلبات السحب بالذكاء الاصطناعي (AI Scan لطلبات السحب)، مع مرشحين وعمود في تصدير CSV. 🔗 المصدر
- اكتشاف الأسرار: Lovable وPydantic وSupabase — يتعرف اكتشاف الأسرار (فحص الأسرار) في GitHub على خمسة أنواع جديدة من الأسرار، منها مفتاح API الخاص بـLovable، ورمز Logfire ومفتاح Pydantic AI Gateway، إضافة إلى رمزين من Supabase؛ وتنضم Lovable Labs أيضًا إلى برنامج الشراكة. 🔗 المصدر
- ملاحظات إصدار Devin ليوم 5 أكتوبر — معظمها تحسينات نهائية: تبويب Terminal في مساحة عمل الجلسة، حيث ينشّط فتح Files أو Terminal برنامج Devin، ومستويات جهد لـDevin Review يمكن ضبطها عبر إجراءات التفعيل، وتحليلات للشيفرة (عمليات فحص الشيفرة) يمكن استرجاعها بالمعرّف عبر API v3 أو MCP الخاص بـDevin. 🔗 المصدر
- Delta وأشجار العمل الخاصة به — يشرح كونراد إروين على مدونة Delta سبب استبدال الأداة لأشجار العمل في Git: لكل سلسلة محادثة شجرة عمل مسجلة في DeltaDB ومكررة بين الأشخاص والوكلاء والأجهزة، ويعمل عدة وكلاء على الفرع نفسه، ويجهّز برنامج نصي
.agents/prepareخاضع لإدارة الإصدارات كل نسخة عمل مستخرجة؛ ولا ترافق التدوينة نسخة جديدة. 🔗 المصدر - v0: الحسابات الشخصية تتحول إلى مساحات للفرق — تتحول حسابات v0 الشخصية إلى مساحات عمل للفرق، مع نقل المحادثات والمشاريع والإعدادات تلقائيًا؛ لكن الوثائق تقصر بعض الوظائف، مثل قوالب الفرق، على خطط Plus وBusiness وEnterprise. 🔗 المصدر
- v0 واشتراك ChatGPT على iOS — أصبح اشتراك ChatGPT، الذي يقبله v0 منذ 29 سبتمبر، قابلًا للاستخدام في تطبيقه على iOS، دون سعر أو تفاصيل إضافية. 🔗 المصدر
- Eleven v4 وEleven v4 Turbo في الصدارة — تعلن ElevenLabs أن نموذجيها لتوليد الكلام، اللذين أُطلقا في 28 سبتمبر، يحتلان المركزين الأول والثاني في تصنيف توليد الكلام (تحويل النص إلى كلام) لدى Artificial Analysis؛ وكان v4 في المركز الأول بالفعل عند إطلاقه. 🔗 المصدر
- HeyGen Video بدقة 2K — بعد أسبوع من إطلاقه، ينتقل HeyGen Video إلى دقة 2K؛ وتقول HeyGen إنه الأول في تصنيف الفيديو على OpenRouter من حيث الاستخدام، دون سعر خاص بدقة 2K، بينما لا تزال صفحة الكتالوج تعرض سعر 0,01 دولار للثانية حتى نهاية أكتوبر. 🔗 المصدر
- Nano Banana 2.1 على Pika — تضيف Pika إلى منصتها وإلى Pika API Club نموذج Nano Banana 2.1، الإصدار الجديد من نموذج Nano Banana من Google، بجودة بصرية أفضل وسرعة أعلى بحسب Pika؛ ولا يُذكر أي سعر أو تكلفة بالأرصدة. 🔗 المصدر
- DOCA GPUNetIO — تجعل NVIDIA من DOCA GPUNetIO التنفيذ المشترك للشبكات التي تقودها وحدات GPU (GDA-KI) لكل من NCCL وNVSHMEM وNIXL/UCX، بإصدار كامل ضمن SDK DOCA، ومشروع مفتوح المصدر أخف يركز على RDMA Verbs. 🔗 المصدر
- السياقات الخضراء في CUDA — توضح تدوينة تقنية من NVIDIA كيفية تخصيص وحدات SM لمهمة حرجة: على وحدة GPU من فئة Blackwell تضم 148 SM، تستجيب نواة خُصصت لها 8 SM في 0,007 ms، مقابل 0,140 ms عند استخدام مسار (تدفق تنفيذ) ذي أولوية، و3,727 ms دون أولوية. 🔗 المصدر
- النماذج المفتوحة لدى مشغّلي الاتصالات — في تدوينة تعرض موقفها، تستشهد NVIDIA باستطلاعها لقطاع الاتصالات لعام 2026، الذي يرى فيه 89 % من المشاركين أن البرمجيات مفتوحة المصدر مهمة، وبشهادات من SoftBank وAT&T وIndosat؛ لا يوجد أي منتج جديد. 🔗 المصدر
- دليل Perplexity لأدوات التعاون — تقارن Perplexity عشر أدوات تعاون مزودة بالذكاء الاصطناعي (Slack وLoom وConfluence وAirtable وNotion وClickUp وAsana وMonday.com وTrello وMiro)، ووظائف الذكاء الاصطناعي فيها، وباقات الاشتراك التي تشملها؛ لا توجد أي مستجدات في المنتجات. 🔗 المصدر
ما الذي يعنيه ذلك
أصبحت نماذج اتخاذ القرار فئة قائمة بذاتها، لها حرب أسعارها وتصنيفها. في اليوم نفسه، تحدد OpenAI سعر API Decisions عند 0,10 دولار لكل مليون رمز إدخال، وتخفض Perplexity سعرها إلى 0,02 دولار، أي نصف ما كان عليه قبل خمسة أيام؛ ولا تفرض أي منهما رسومًا على الإخراج. هذه النماذج لا تصوغ النصوص، بل تختار أو تمنح درجات: يُدفع لها مقابل ما تقرؤه، ويُراد منها أن تكون سريعة، إذ تعد OpenAI باستجابات أسرع بنحو عشر مرات من Responses API لديها. يؤدي Decision Index 0.3 دور الحكم المجتمعي، ويهدف نصفه الخاص الجديد إلى قياس المهارات بدلًا من النجاح في اختبارات معيارية معروفة. وتؤثر نتائجه بالفعل في خطاب الشركات المطورة: تستند إليه Perplexity في إعلانها، رغم أن بطاقة نموذجها تعرض درجة مختلفة عن تلك الواردة في التصنيف.
يندمج الذكاء الاصطناعي في الأدوات المكتبية بدلًا من أن يحدث العكس. يدخل Claude إلى Google Docs وSheets وSlides بعد Excel وPowerPoint وWord، وينضم إلى الرسائل الجماعية في Slack، وستشغّل نماذج GPT-6 وكلاء Rovo لدى Atlassian. في هذه التكاملات، لم تعد المسألة تقتصر على جودة النموذج، بل تشمل التحكم أيضًا: وضع يطلب الموافقة على كل تعديل، وموصلات تلتزم بأذونات المشاركة في Google، وضوابط Enterprise تُطبَّق على الإضافة. ويسري المنطق نفسه على أدوات الوكلاء المطروحة اليوم، من قرارات المراجعة القابلة للتراجع في Antigravity إلى المسودات ذات الإصدارات في ElevenAgents Architect.
في مجال الأمن السيبراني، تتدرج صلاحيات الوصول بحسب التحقق. لا يغير CVP لدى Anthropic النموذج، بل ضوابطه الوقائية: ففي CyScenarioBench، ينتقل Opus 5.5 نفسه من مهام تُحظر منذ أول توجيه عند غياب التحقق إلى إنجاز 34 مهمة من أصل 50 في Red Team Access. وتطرح Mistral حجة أخرى، هي نموذج لا يرفض: إذ تعلن تحقيق 82 % في اختبار سيبراني تقول إن Claude Opus 5.5 وGPT-6 Astra يرفضان خوضه. ويلتقي النهجان في نقطة واحدة: الوصول الأوسع إلى القدرات السيبرانية يمر أولًا عبر متخصصين جرى التحقق منهم، سواء كانوا شركاء Mistral قبل نشر الأوزان أو أعضاء في برنامج Anthropic.
تتوسع النماذج أيضًا عند طرفَي نطاق الحجم. في الطرف الكبير، نجد Mistral Large 4 بمعلماته البالغ عددها 1 000 مليار، مع وعد بإتاحة أوزانه في نهاية أكتوبر؛ وفي الطرف الصغير، نجد EmbeddingGemma 2، الذي يكتفي بنحو 567 ميغابايت من RAM على هاتف، وTiny Aya L2-Thinker بمعلماته البالغ عددها 3,35 مليار، أو Falcon-OCR-Arabic بمعلماته البالغ عددها 270 مليونًا، والمتاح حاليًا في عرض توضيحي فقط. غير أن كثيرًا من أرقام اليوم تقيسها الشركة المطورة نفسها: درجات Mistral، والمركز الأول الذي تعلن Black Forest Labs تحقيقه، والاختبار الداخلي لدى TII، وبطاقة Perplexity، ومهام Ironclad التي قيّمتها OpenAI، أو تحسينات الدمج التي أعلنتها GitHub. وغالبًا ما تكون هذه هي القياسات الوحيدة المتاحة يوم الإعلان؛ وسيكون من المفيد مقارنتها بتقييمات مستقلة، وهو ما ستتيحه أوزان Mistral Large 4 بعد نشرها.
المصادر
- تدوينة Mistral عن Mistral Large 4
- بطاقة Mistral Large 4 في الوثائق
- تدوينة Anthropic عن Claude for Google Workspace
- @claudeai على X، Claude for Google Workspace
- تدوينة Anthropic عن Cyber Verification Program
- صفحة المساعدة الخاصة بـCyber Verification Program
- Comcast وBooz Allen مع Claude Mythos
- EmbeddingGemma 2 على مدونة Google
- بطاقة نموذج EmbeddingGemma 2
- @GoogleDeepMind على X، EmbeddingGemma 2
- EmbeddingGemma 2 على Hugging Face
- دليل API Decisions من OpenAI
- سجل تغييرات API من OpenAI
- @perplexitydevs على X، pplx-decider-v1.1-27b
- pplx-decider-v1.1-27b على Hugging Face
- @multimodalart على X، Decision Index 0.3
- Decision Index 0.3
- تدوينة OpenAI عن تعاونها مع Ironclad
- @OpenAIDevs على X، مستويات الاستخدام
- وثائق حدود معدل الطلبات في API من OpenAI
- مقالة مساعدة من OpenAI عن BAA الخاص بـAPI
- سجل تغييرات API من Perplexity
- وثائق أداة image_search من Perplexity
- بطاقة GLM 5.3 على Amazon Bedrock
- @Zai_org على X، GLM-5.3 على Bedrock
- Claude Code 2.1.290
- Claude Code 2.1.291
- Claude Code 2.1.292
- الدليل الميداني للجلسات السحابية على claude.dev
- @ClaudeDevs على X، رصيد إضافي للجلسات السحابية
- ملاحظات إصدار Mistral Vibe v2.26.0
- سجل تغييرات Google Antigravity
- @Replit على X، سياق جميع المشاريع
- سجل تغييرات GitHub بشأن طلبات السحب المتراكبة
- تدوينة بحثية من Cohere عن Tiny Aya L2-Thinker
- تدوينة TII عن Falcon-OCR-Arabic
- ملاحظات إصدار Diffusers 0.41.0
- ملاحظات إصدار Transformers v5.19.0
- تدوينة ElevenLabs عن ElevenAgents Architect
- @bfl_ai على X، FLUX 3 وPhysics-IQ
- تصنيف Physics-IQ Verified
- @nutlope على X، GeoGuess Bench
- GeoGuess Bench
- @my_cat_can_code على X، RSI Arena
- RSI Arena
- AICR v1.0 على مدونة NVIDIA التقنية
- تدوينة Anthropic عن Claude Startups
- @claudeai على X، Claude Startup Stack
- دان فاين على X، Claude Projects ومجلد محلي
- بوريس تشيرني على X، الإتاحة التدريجية لـClaude Projects
- دان فاين على X، Claude في الرسائل الجماعية على Slack
- بوريس تشيرني على X، الموقع المصاحب لـAcquired
- بوريس تشيرني على X، طريقته في صياغة التوجيهات لـClaude
- Atlassian وOpenAI توسعان شراكتهما
- سجل تغييرات ChatGPT وCodex، ChatGPT لنظام iOS 1.2026.267
- Gemini CLI v0.63.0
- SDK بلغة Python من Mistral v3.1.0
- Qwen Code v0.25.1-preview.0
- SDK بلغة TypeScript من SpaceXAI v0.2.2
- تدوينة TII عن Falcon-Emirati
- Datasets 5.1.0
- TRL v1.14.2
- تدوينة ستيفن سولكا
- @vllm_project على X، Open Together
- جيف بودييه على X، قائمة انتظار Open Together
- Copilot CLI 1.0.93-2
- سجل تغييرات GitHub بشأن حالة تفعيل AI Scan
- سجل تغييرات GitHub بشأن أدوات الكشف الجديدة عن الأسرار
- ملاحظات إصدار Devin بتاريخ 5 أكتوبر
- تدوينة كونراد إروين على مدونة Delta
- سجل تغييرات v0، تحويل الحسابات الشخصية إلى مساحات عمل للفرق
- @v0 على X، اشتراك ChatGPT على iOS
- @ElevenLabs على X، Eleven v4 في الصدارة
- @HeyGenDev على X، HeyGen Video بدقة 2K
- @pika_labs على X، Nano Banana 2.1 على Pika
- DOCA GPUNetIO على مدونة NVIDIA التقنية
- Green contexts على مدونة NVIDIA التقنية
- النماذج المفتوحة ومشغّلو الاتصالات، مدونة NVIDIA
- دليل Perplexity لأدوات التعاون