في عالم تتسارع فيه وتيرة التطور التكنولوجي، باتت الحدود بين الواقع والعالم الرقمي تتلاشى تدريجياً. ومن أبرز مظاهر هذا التطور هو ظهور "التوائم الرقمية"، تلك النسخ الافتراضية التي تحاكي وجودنا بشكل مذهل. هذا ما اختبرته شخصياً عندما أُتيحت لي فرصة إنشاء صورة رمزية رقمية تفاعلية خاصة بي، مدعومة بالذكاء الاصطناعي.
بدأت القصة عندما تلقيت رابطاً من "ألكسندرو فويكا"، رئيس الشؤون المؤسسية في شركة "Synthesia" الناشئة المتخصصة في توليد الفيديوهات. تفاجأت بوجود صورة رمزية افتراضية تفاعلية له، مُدرّبة خصيصاً للإجابة عن الأسئلة الشائعة حول الشركة. بدا الأمر وكأنه "الزعيم النهائي" لاستخدام الذكاء الاصطناعي في مجال العلاقات العامة.
Synthesia: صعود نجم الشركات الناشئة الافتراضية
تُعد "Synthesia"، التي تأسست في المملكة المتحدة وتوسعت لتفتح مقراً جديداً في نيويورك، من الشركات الرائدة في مجال الصور الرمزية الرقمية، جنباً إلى جنب مع شركات أخرى مثل D-ID و HeyGen و Colossyan. لقد حققت الشركة تقييماً بلغ 4 مليارات دولار هذا العام، وتجاوزت إيراداتها السنوية المتكررة 100 مليون دولار.
تتيح "Synthesia" للمؤسسات بناء مقاطع فيديو تدريبية تفاعلية باستخدام صور رمزية مدعومة بالذكاء الاصطناعي. كما أطلقت مؤخراً منتج "Roleplay Sessions" الذي يمكّن الموظفين من ممارسة مهاراتهم، مثل تقديم عروض المبيعات، مع صورة رمزية تفاعلية تستجيب وتقيّم أدائهم.
تجربة إنشاء "التوأم الرقمي"
عندما عُرض عليّ إنشاء صورة رمزية خاصة بي في مقر "Synthesia" الجديد، لم أتردد لحظة. بالطبع، أرغب في الحصول على نسختي الرقمية! كان مظهري في ذلك اليوم أنيقاً وتسريحتي مثالية، وشعرت أن هذه فرصة فريدة.
قبل هذه التجربة، كنتُ على الحياد تجاه الصور الرمزية، لكنني كنتُ أدرك أنها ستصبح جزءاً لا مفر منه من حياتنا الرقمية. سمعتُ عن أشخاص يستخدمونها على إنستغرام لإنشاء محتوى اجتماعي. هذا الاهتمام المتزايد دفعني للمشاركة، وتقديم نسختي الرقمية لكم.
لإنشاء هذه النسخة، قضيتُ وقتاً في استوديو مصغر داخل مكتب "Synthesia"، حيث التُقطت لي صور متعددة وسُجل صوتي لمدة دقيقتين. وافقتُ على استخدام هذه البيانات، وهكذا وُلد "دوم" الرقمي.
كيف تعمل هذه التكنولوجيا؟
تم بناء صورتي الرمزية التفاعلية باستخدام مزيج من تقنيات تحويل الصوت إلى نص، ومعالجة الفيديو، والنماذج اللغوية، وتحويل النص إلى صوت. تعتمد هذه التقنية على نماذج "Synthesia" الخاصة للفيديو والصوت، ولكن الشركة تسمح أيضاً للعملاء باختيار بدائل من مختبرات أخرى مثل Cartesia و ElevenLabs و Google أو OpenAI. يمكن للمؤسسات استضافة صورها الرمزية على السحابة التي تفضلها أو الاستعانة بخدمات استضافة "Synthesia".
تتضمن العملية:
- تحويل الصوت إلى نص: يحوّل ما يقوله المستخدم إلى نص.
- النموذج اللغوي الوكيل: يفسر النص ويتخذ إجراءات بناءً عليه.
- تحويل النص إلى صوت: يحوّل الاستجابة إلى ملف صوتي.
- نموذج الفيديو: يحرك الصورة الرمزية ويجعلها تتحدث.
تقدم "Synthesia" ثلاثة أنواع رئيسية من المنتجات: منصة لإنشاء وتوزيع الفيديوهات بالصور الرمزية التقليدية، ومنصة تفاعلية تسمى "Sessions" للمشاركة في استبيانات أو لعب الأدوار، ومنصة API تسمح للمطورين بدمج نماذج "Synthesia" مع خدمات أخرى لبناء صور رمزية تفاعلية أو منتجات مختلفة.
الانطباعات والتساؤلات المستقبلية
استغرق فريق "Synthesia" بضعة أيام لإنشاء صوري الرمزية. كانت النتيجة الأولية مذهلة، فالصوت كان دقيقاً إلى حد كبير. عندما عرضتها على أصدقاء غير متخصصين في التكنولوجيا، وجدوا الأمر مثيراً للاهتمام ومخيفاً في الوقت ذاته.
صورتي الرمزية التفاعلية، والتي تم تدريبها على قصة كتبتها حول الاحتيال في الشركات الناشئة المدعومة برأس المال الاستثماري، كانت تستجيب فقط للأسئلة المتعلقة بتلك القصة. حاول البعض طرح أسئلة شخصية، لكنها كانت تعيد توجيههم دائماً إلى موضوع القصة.
جعلتني هذه التجربة أفكر في مستقبل الصحافة. هل سيتقبل الناس أخباراً تقدمها صور رمزية؟ يرى البعض أن الثقة، وهي حجر الزاوية في الصحافة، لا يمكن تفويضها للذكاء الاصطناعي. لكن آخرين يرون أن هذه التقنيات يمكن أن تعزز دور الصحفيين.
أرى أن فكرة "استنساخ" النفس قد تكون جذابة للكثيرين خارج نطاق الصحافة، لتجنب تراكم العمل أثناء الإجازات. ومع ذلك، فإن مشاعر مختلطة تنتابني حيال هذه التقنية. بعد تجاوز حداثة الأمر، بدأت أتأمل نسختي الرقمية، منتظراً منها أن ترمش، أو تبتسم، أو تعبر عن وعي. لكنها، كنسخة حتمية، لن تفعل ذلك.
في الختام، يبدو أن التوائم الرقمية، سواء كانت حتمية أو غير حتمية، تحمل في طياتها إمكانيات هائلة وتساؤلات عميقة حول علاقتنا بالمستقبل الرقمي.