الأحدث الأكثر رواجاً استكشف الخطوط الزمنية التصنيفات
شبكة من صور متنوعة أنشأها دال-إي انطلاقًا من أوصاف نصية.
خط زمني تقني 2014–حتى الآن مستمر

من الشبكات التوليدية إلى وكلاء الذكاء الاصطناعي: كيف تطور الذكاء الاصطناعي التوليدي

خط زمني متجدد لأهم الأبحاث والمنتجات التي نقلت الذكاء الاصطناعي التوليدي من تجارب إنشاء الصور إلى أنظمة تكتب وتستدل وترى وتسمع وتنتج الفيديو وتنفذ المهام عبر الأدوات البرمجية.

14 محطة موثقة
لم يبدأ الذكاء الاصطناعي التوليدي (Generative AI) مع ChatGPT. فقد تشكلت قدراته الحالية من مسارات بحثية متعددة، منها التدريب التنافسي، والنماذج اللغوية واسعة النطاق، ونماذج الانتشار، وبنية المحولات (Transformer). ينتقي هذا الخط الزمني المحطات التي غيّرت الاتجاه التقني للمجال أو وسعت الوصول إليه أو بدلت طريقة تفاعل البشر مع الآلات. وتظهر المنتجات عندما أحدث إطلاقها تحولاً في الاستخدام، مع التعامل بحذر مع نتائج الاختبارات لأن طرق التقييم وشروط الوصول وقدرات النماذج تتغير بسرعة.
كل المحطات
  1. Research

    الشبكات التوليدية التنافسية تحول الإنشاء إلى منافسة

    قدم إيان جودفيلو وزملاؤه الشبكات التوليدية التنافسية (GANs)، حيث يتدرب نموذج مولّد في مواجهة نموذج مميّز.

    تعلم النموذج المولّد إنشاء عينات تستطيع خداع النموذج المميّز، بينما تعلم المميّز اكتشاف الناتج الاصطناعي. وأصبحت GANs مؤثرة في إنشاء الصور الواقعية، رغم استمرار مشكلات عدم استقرار التدريب ومحدودية تنوع النتائج.
    المصادر والمراجع 1 مصدر
  2. Research

    بنية المحولات تعيد تشكيل الذكاء الاصطناعي اللغوي

    قدمت ورقة “الانتباه هو كل ما تحتاج إليه” بنية تعتمد على آلية الانتباه بدلاً من المعالجة التكرارية.

    تعالج المحولات العلاقات بين الوحدات النصية بالتوازي، ما سهّل توسيع التدريب مقارنة بالأساليب التكرارية السابقة. ركزت الورقة الأصلية على الترجمة، لكن البنية أصبحت أساس معظم النماذج اللغوية الكبيرة وكثير من الأنظمة متعددة الوسائط.
    المصادر والمراجع 1 مصدر
  3. Research

    GPT يكشف قوة التدريب المسبق التوليدي

    أظهرت OpenAI أن محولاً مدرباً على نطاق واسع من النصوص غير المصنفة يمكن تكييفه مع مهام لغوية متعددة.

    كان المحول التوليدي المدرب مسبقاً (GPT) الأول صغيراً مقارنة بما تبعه، لكن وصفته ذات المرحلتين أصبحت شديدة التأثير: تعلم الأنماط اللغوية العامة عبر التنبؤ، ثم الضبط الدقيق لمهام محددة. وساعد ذلك على انتقال المجال نحو النماذج الأساسية القابلة لإعادة الاستخدام.
  4. Research

    GPT-3 يبرهن على التعلم من الأوامر عند التوسع

    نفّذ نموذج لغوي يضم 175 مليار معلمة مهام متعددة انطلاقاً من التعليمات والأمثلة، من دون ضبط دقيق تقليدي لكل مهمة.

    جعل GPT-3 التوجيه بأمثلة قليلة أو من دون أمثلة واجهة أساسية للنماذج اللغوية الكبيرة. جذبت طلاقته اهتماماً واسعاً، لكن البحث وثق أيضاً الإجابات غير الموثوقة والتحيز والحاجة إلى موارد حاسوبية ضخمة. حسّن التوسع القدرات، لكنه لم يحل مشكلة الدقة الواقعية.
    المصادر والمراجع 1 مصدر
  5. Research

    DALL-E يربط الأوامر اللغوية بإنشاء الصور

    عرضت OpenAI نموذجاً ينشئ الصور ويعدلها انطلاقاً من أوصاف نصية تشمل مفاهيم متنوعة.

    شبكة من صور متنوعة أنشأها دال-إي انطلاقًا من أوصاف نصية.
    Illustration: Justin Jay Wang / OpenAI
    أظهر DALL-E أن النمذجة التوليدية واسعة النطاق تستطيع الربط بين اللغة والرؤية. كانت النتائج المبكرة محدودة ومنتقاة، لكنها مهدت للانتشار السريع لأنظمة تحويل النص إلى صورة.
    المصادر والمراجع 1 مصدر
  6. Open Release

    Stable Diffusion ينقل إنشاء الصور إلى الأجهزة المحلية

    وسع الإطلاق العام لـ Stable Diffusion الوصول إلى تحويل النص إلى صورة، وأتاح منظومة كبيرة من التعديلات والأدوات.

    على خلاف مولدات الصور المحصورة في خدمات مستضافة، أتاحت الأوزان المنشورة لـ Stable Diffusion للمطورين وكثير من المستخدمين تشغيل النموذج وتعديله. سرّع ذلك التجارب، لكنه صعّد النقاش حول بيانات التدريب والموافقة وحقوق النشر وإساءة الاستخدام.
  7. Product Launch

    ChatGPT يحول النموذج اللغوي إلى محادثة جماهيرية

    أطلقت OpenAI نسخة بحثية للمحادثة مدربة على اتباع التعليمات والاستجابة عبر الحوار.

    لم يخترع ChatGPT بنية المحولات أو النماذج اللغوية الكبيرة، لكن واجهته السهلة غيّرت نطاق الاستخدام. أصبح بوسع الملايين طرح الأسئلة وتصحيح الطلبات وتحسينها عبر الحوار. كما جعل الإطلاق الهلوسة وتأثير الذكاء الاصطناعي في التعليم والعمل والحوكمة قضايا عامة لا نقاشات متخصصة فقط.
    المصادر والمراجع 1 مصدر
  8. Model Release

    LLaMA يسرّع منظومة النماذج المفتوحة

    قدمت Meta عائلة من النماذج اللغوية الأساسية الأصغر حجماً بهدف توسيع الوصول إلى أبحاث النماذج عالية الأداء.

    أسهم LLaMA وما تبعه في بناء منظومة من النماذج المضبوطة والقابلة للتشغيل محلياً. وظل وصف “مفتوح” موضع جدل لأن التراخيص وبيانات التدريب وشروط النشر تختلف عن البرمجيات مفتوحة المصدر تقليدياً، لكن التحول قلل الاعتماد على الأنظمة التجارية المستضافة.
  9. Model Launch

    GPT-4 يضيف فهم الصور إلى نموذج لغوي رائد

    استقبل GPT-4 مدخلات نصية وصورية وأنتج نصوصاً، في خطوة مهمة نحو الذكاء الاصطناعي متعدد الوسائط واسع الاستخدام.

    استطاع النموذج تحليل المستندات والصور والمخططات ولقطات الشاشة إلى جانب النص. لكن OpenAI نشرت تفاصيل تقنية محدودة عن حجمه وبيانات تدريبه، ما عكس تراجعاً أوسع في الشفافية مع ارتفاع القيمة التجارية للأنظمة المتقدمة.
  10. Model Launch

    Gemini يُصمم نموذجاً متعدد الوسائط من الأساس

    قدمت Google عائلة Gemini المصممة للتعامل مع النصوص والصور والصوت والفيديو ضمن نموذج متعدد الوسائط من الأساس.

    بدلاً من إضافة مكونات منفصلة للإدراك بعد تدريب اللغة فقط، قدمت Google نموذج Gemini بوصفه متعدد الوسائط منذ البداية. وصعّد الإطلاق المنافسة حول النماذج التي تفهم أشكالاً متعددة من المعلومات وتنتج عبرها، مع اختلاف القدرات وشروط الوصول بين الإصدارات.
  11. Research Preview

    Sora يستعرض إنشاء فيديو أطول وأكثر ترابطاً من النص

    استعرضت OpenAI نموذج فيديو ينشئ مشاهد معقدة ويمد المقاطع الموجودة انطلاقاً من أوامر نصية.

    أبرز Sora التقدم السريع في الفيديو التوليدي واستخدام محولات الانتشار. كانت العروض المبكرة منتقاة من المطور، وظل النموذج يواجه صعوبة في الاتساق الفيزيائي والسبب والنتيجة. وتكمن أهميته في اتجاه القدرات، لا في إثبات محاكاة موثوقة للعالم.
  12. Model Launch

    GPT-4o يوحد التفاعل الفوري بالنص والرؤية والصوت

    عالج GPT-4o مزيجاً من النص والصوت والصور وأنتجه بزمن استجابة أقل من الأنظمة السابقة المركبة من نماذج منفصلة.

    صورة أنشأها جي بي تي-4o تُظهر روبوتًا يكتب على آلة كاتبة من منظور الشخص الأول.
    OpenAI
    يشير الحرف “o” إلى “omni” أو الشمول، في انتقال من المحادثة النصية إلى تفاعل متعدد الوسائط أكثر طبيعية. جعل الصوت والرؤية المساعدات الذكية أكثر فورية، وأثارا في الوقت نفسه أسئلة أكبر حول الانتحال والخصوصية والاعتماد العاطفي وضوابط إنشاء الوسائط المباشرة.
    المصادر والمراجع 1 مصدر
  13. Research

    نماذج الاستدلال تخصص حوسبة أكبر قبل الإجابة

    قدمت OpenAI نموذج o1-preview الذي يستخدم حوسبة إضافية أثناء الاستدلال لتحسين أداء المسائل متعددة الخطوات.

    نقل الإطلاق جزءاً من سباق التوسع من زيادة التدريب المسبق إلى “الحوسبة وقت الاختبار”، حيث يجري النموذج معالجة داخلية أطول قبل الرد. لم يضمن تحسن الاختبارات صحة الإجابات ولم يلغ الحاجة إلى التحقق، لكنه أثر في الجيل التالي من النماذج المتقدمة.
  14. Model Launch

    GPT-5 يدمج الاستدلال التلقائي في التجربة الافتراضية

    جعلت OpenAI نموذج GPT-5 النظام الافتراضي في ChatGPT، مع الانتقال بين الإجابة المباشرة والاستدلال الأعمق وفق طبيعة المهمة.

    عكس الإطلاق تحولاً في المنتجات بعيداً عن مطالبة المستخدم بفهم قائمة متزايدة من النماذج، إذ أصبح النظام الموحد يقرر متى يحتاج إلى استدلال إضافي. كما أظهر انتقال منتجات الذكاء الاصطناعي التوليدي من نموذج منفرد إلى منظومات تجمع التوجيه والأدوات وطبقات الأمان وأنماطاً متعددة من الحوسبة.
    المصادر والمراجع 1 مصدر

ماذا بعد؟

انتقل الذكاء الاصطناعي التوليدي من إنتاج عينات مقنعة إلى المشاركة في سير عمل معقد يشمل النصوص والصور والصوت والفيديو والبرمجيات. لكن الطلاقة لا تعني امتلاك معرفة موثوقة أو حكماً مستقلاً. فما تزال الهلوسة والتحيز ونزاعات حقوق النشر والمخاطر الأمنية واستهلاك الطاقة وتركز القدرة الحاسوبية قيوداً أساسية. وستتحدد المرحلة المقبلة بدرجة أقل بقدرة النموذج على إنشاء المحتوى، وبدرجة أكبر بقدرته على الاستدلال واستخدام الأدوات وحفظ السياق والعمل بصورة موثوقة تحت إشراف البشر.

يتوفر إصدار جديد من نيو تقنية.