شرح تقني
كيف يجمع الذكاء الاصطناعي الكلمات والصوت وإشارات الوجه لتصنيف الضغط؟
تحول النماذج متعددة الوسائط النص والصوت والفيديو إلى تمثيلات رقمية، ثم تحاذيها وتتعلم درجة مشتركة. ناتجها تصنيف إحصائي، لا قراءة مباشرة للمشاعر ولا تشخيص سريري.
يبدأ مصنف الضغط متعدد الوسائط بفصل التسجيل إلى مسارات معلومات متعددة. يمكن للتعرف على الكلام إنتاج نص، ويستطيع تحليل الصوت قياس أنماط مثل التوقيت وطبقة الصوت، بينما يحول تحليل الفيديو حركات الوجه عبر اللقطات إلى بيانات قابلة للمعالجة. ويتحول كل مسار إلى تضمين، أي قائمة أرقام تحتفظ بالأنماط المفيدة للنموذج.
بعد ذلك يحتاج النموذج إلى محاذاة معلومات تتحرك بسرعات مختلفة. تصل الكلمات في صورة وحدات نصية، ويتغير الصوت مرات كثيرة في الثانية، ويتكون الفيديو من سلسلة لقطات. يستطيع المحول متعدد الوسائط تعلم العلاقات داخل كل مسار وبين المسارات، مثل تزامن وقفة صوتية مع عبارة وحركة في الوجه.
يتطلب التدريب أمثلة تحمل تسميات. وقد تأتي تسميات الضغط من استبيانات أو تقييمات سريرية أو أنماط تكتشفها خوارزمية تجمع قياسات متكررة. ويهم مصدر التسمية لأن النموذج يتعلم إعادة إنتاجها. فإذا كانت التسمية نمطا مشتقا من استبيان، فلا يتحول النموذج تلقائيا إلى اختبار تشخيصي.
تُقاس القدرة عادة بالمساحة تحت منحنى ROC والحساسية والنوعية على بيانات لم تدخل التدريب. ويتطلب الاستخدام الموثوق اختبارات إضافية في مستشفيات ومهن ولغات وأجهزة وفئات سكانية مختلفة. كما تحتاج المعايرة والخصوصية والموافقة الواعية وحدود الاستخدام في مكان العمل إلى قواعد واضحة، لأن تسجيلات الصوت والوجه قد تحمل معلومات حساسة تتجاوز إشارة الضغط المقصودة.
ظهر أول مرة في
الوجه والصوت والكلمات ترسم خريطتين لضغط العاملين الصحيين