الذكاء الاصطناعي متعدّد الوسائط: نص، صورة، صوت وفيديو
افهم كيف يمكن لذكاء اصطناعي أن يجمع عدّة أشكال من المحتوى ليُحلّل موقفاً، ويُجيب، ويُنتج.
وماذا لو استطاع ذكاءٌ اصطناعي أن يرى الموقف نفسه الذي تراه؟
تخيّل آلةً معطّلة. تلتقط صورةً للجهاز، وتشرح المشكلة بصوتك، وتُرسل دليله التقني. عندئذٍ يستطيع ذكاءٌ اصطناعي أن يفحص الصورة، ويستمع إلى وصفك، ويقرأ الوثيقة، ويربط بين هذه المعلومات ليقترح أوّل خطوات التحقّق.
وكان هذا يستلزم قبلاً عدّة برامج منفصلة: واحدٌ للتعرّف على الصورة، وآخر لتحويل الصوت إلى نصّ، وثالثٌ لقراءة الوثيقة، ثمّ جمع النتائج يدوياً. أمّا اليوم فبعض الأنظمة تعالج عدّة صيغ معاً — وهذا هو الذكاء الاصطناعي متعدّد الوسائط.
ما هي الوسيطة؟
الوسيطة طريقةٌ لنقل معلومة أو تمثيلها. ونحن في حياتنا اليومية نستعمل وسائط عدّة بلا انقطاع: نصّاً، وصورةً، وصوتاً، ورسماً بيانياً، وإشارةً، وفيديو.
- النصّ يشرح فكرةً أو يقدّم تعليماً.
- الصورة تُظهر مشهداً أو شيئاً أو علاقةً بصرية.
- الصوت يضيف النبرة والإيقاع وبعض عناصر السياق.
- الفيديو يُظهر تطوّراً عبر الزمن.
- الوثيقة تُنظّم معلومات أطول أو أدقّ.
وسيطة واحدة
جملة «يبدو العميل راضياً» تُعطي إشارةً، لكنها لا تُظهر تعبير الوجه، ولا النبرة، ولا السياق كاملاً.وسائط متعدّدة
قد تُضيف صورةٌ وتسجيلٌ وفيديو سياقاً أوفر، دون أن تضمن مع ذلك تفسيراً صحيحاً تماماً.ما هو الذكاء الاصطناعي متعدّد الوسائط؟
يُقال عن ذكاء اصطناعي إنه متعدّد الوسائط حين يستطيع معالجة أنواع متعدّدة من المحتوى أو إنتاجها. فيمكنه أن يتلقّى سؤالاً مكتوباً، ويفحص صورة، ويستمع إلى طلب شفهي، ويُحلّل وثيقة، ويتتبّع بعض عناصر فيديو.
ولا يلزمه إنتاج كل هذه الصيغ ليكون متعدّد الوسائط. فقد يتلقّى صورةً وسؤالاً شفهياً، ثمّ يُجيب كتابةً فقط. ويبقى متعدّد الوسائط لأنه يجمع بين عدّة صيغ من المُدخَلات.
كيف يجمع الذكاء الاصطناعي هذه المعلومات؟
تحويل كل محتوى
يُحوّل النظام الصورة أو الجملة أو الصوت أو الفيديو إلى تمثيلات رقمية يستطيع تحليلها.البحث عن العلاقات
يحاول ربط النصّ بالعناصر الظاهرة، أو جملةٍ باللحظة الصحيحة في فيديو، أو وثيقةٍ بالرسم البياني المقابل لها.إنتاج الإجابة
يمكنه بعدها أن يصف، أو يقارن، أو يُلخّص، أو يشرح، أو يُنتج محتوى جديداً بحسب المعلومات المتاحة.أين يُستخدَم الذكاء الاصطناعي متعدّد الوسائط؟
المساعدة وخدمة العملاء
قد تساعد صورةٌ أو فاتورة أو وصفٌ شفهي أو فيديو على تصنيف طلب وتجهيز إجابة أولى.التدريب والتعلّم
يستطيع النظام وصف مخطّط، أو شرح رسم بياني، أو تحليل إجابة مكتوبة بخطّ اليد، أو تلخيص وثيقة.التجارة والإدارة
يمكن للشركة تحليل صور منتجات، أو استخراج بيانات من فواتير، أو مقارنة المخزون بالطلبات.إتاحة الوصول
يستطيع وصف صورة، أو تحويل الكلام إلى نصّ، أو قراءة وثيقة بصوت مسموع، أو ترجمة محادثة.التفاعل الآني
بعض الأنظمة تستطيع العمل بالصوت أو الصور أو الكاميرا أثناء المحادثة نفسها.إنتاج المحتوى
قد تُحلّل الأداةُ الواحدة وثيقةً، وتقترح نصّاً، وتُنتج صوتاً، وتولّد صورةً مناسبة.
الرؤية ليست فهماً كما يفهم الإنسان
حين يصف ذكاءٌ اصطناعي صورةً وصفاً صحيحاً، قد يُوحي بأنه يفهم المشهد فهماً كاملاً. غير أنه قد يتعرّف على الأشياء دون أن يعرف النوايا، ولا الأحداث السابقة، ولا العلاقات الإنسانية، ولا المشاعر الحقيقية.
فالشخص الذي يبتسم في اجتماع قد يكون سعيداً، أو مجاملاً، أو متوتّراً، أو مُكرَهاً. فالملاحظة الصحيحة لا تؤدّي دائماً إلى تفسير صحيح.
ما الأخطاء التي قد يرتكبها ذكاءٌ اصطناعي متعدّد الوسائط؟
اختلاق تفصيل
قد يصف النظام شيئاً غير موجود في الصورة، أو يضيف معلومة لم تُقدَّم إليه.سوء قراءة معطى
قد يُساء تفسير رقم أو تاريخ أو وحدة قياس أو كتابة صغيرة.إغفال عنصر
قد لا تُرصَد معلومة بالغة الصغر، أو محجوبة، أو واقعة في الخلفية.سوء الربط بين الصيغ
قد تُربَط جملةٌ بالصورة الخطأ، أو باللحظة الخطأ من فيديو.الإجابة بثقة
قد تحمل إجابةٌ واضحة ومُقنِعة خطأً جسيماً رغم ذلك.تفويت السياق
لا يعرف النظام بالضرورة القصّة كاملة، ولا العواقب الواقعية.حماية البيانات قبل أي إرسال
قد تكشف صورةٌ أو صوتٌ أو فيديو معلوماتٍ أكثر بكثير ممّا يكشفه نصٌّ بسيط: وجهاً، أو عنواناً، أو لوحة سيارة، أو وثيقةً سرّية، أو داخل منزل، أو محادثةً في الخلفية.
- التحقّق ممّا إذا كان المحتوى يتضمّن بيانات شخصية.
- إخفاء المعلومات غير الضرورية قبل الإرسال.
- التأكّد من حقّك في إرسال محتوى يخصّ شخصاً آخر.
- تجنّب إرسال الوثائق السرّية.
- حصر الملفّات في المعلومات اللازمة فعلاً.
- مراجعة الاستنتاجات قبل أي استخدام مهمّ.
ابنِ طلباً متعدّد الوسائط
اختر موقفاً بسيطاً: ترتيب مساحة عمل، أو فهم جهاز، أو تحليل منتج، أو شرح رسم بياني، أو تحسين وثيقة.
النصّ
ما السؤال المحدَّد الذي ستكتبه للذكاء الاصطناعي؟الصورة
أيّ صورة أو مخطّط يساعد على فهم المشكلة؟الصوت
أيّ معلومة يسهل شرحها شفهياً أكثر؟الوثيقة أو الفيديو
أيّ محتوى إضافي يتيح تفسير الموقف تفسيراً أفضل؟وأنهِ التمرين بتحديد الجزء من الإجابة الذي يجب إلزاماً أن يراجعه إنسان.
سياقٌ أوفر لا يعني فهماً كاملاً
- الوسيطة شكلٌ من أشكال المعلومة: نصّ، أو صورة، أو صوت، أو فيديو، أو وثيقة.
- الذكاء الاصطناعي متعدّد الوسائط يستطيع معالجة صيغ عدّة وإقامة علاقات بينها.
- يستطيع إنتاج إجابة أنسب بفضل سياق أغنى.
- لا يُدرك العالم كما يُدركه الإنسان، وقد يُسيء تفسير مشهد.
- يجب حماية البيانات الشخصية والتحقّق من الاستنتاجات.
هل تريد التعمّق أكثر؟
احصل مجاناً على دوسيه PDF أكثر تفصيلاً وأحدث حول هذا الموضوع. اترك بريدك الإلكتروني أدناه، ونرسله إليك شخصياً.
امتحان الدرس
الذكاء الاصطناعي متعدّد الوسائط: نص، صورة، صوت وفيديو
10 أسئلة · 3 خيارات · 70% للنجاح · محاولات غير محدودة