تواصل جوجل تسريع خطواتها في سباق الذكاء الاصطناعي، وهذه المرة مع Gemini 3.8 Live، الذي يركز على جعل التفاعل مع الذكاء الاصطناعي أكثر طبيعية وسرعة، مع قدرات أفضل على فهم الصوت والصورة وما يظهر أمام المستخدم على الشاشة.
الميزة الأهم هنا ليست مجرد إجراء محادثة صوتية مع Gemini، بل محاولة الانتقال إلى تجربة أقرب إلى الوكيل الذكي Voice Agent الذي يستطيع الاستماع، وفهم السياق، ومتابعة ما يحدث أمامه، ثم الاستجابة بناءً على ذلك.
ما الجديد في Gemini 3.8 Live؟
يعتمد Gemini Live على فكرة التفاعل المباشر مع المستخدم بدلًا من كتابة Prompt وانتظار الرد بالطريقة التقليدية. تستطيع التحدث مع النموذج بصورة مستمرة، بينما يحاول الاحتفاظ بسياق المحادثة وفهم ما تقصده أثناء الحوار.
ومع Gemini 3.8 Live يظهر اهتمام أكبر بتحسين سرعة التفاعل ودقة الفهم، خصوصًا عند التعامل مع أكثر من نوع من المعلومات في الوقت نفسه، مثل الصوت والصورة ومحتوى الشاشة.
وهذا مهم جدًا للتطبيقات التي تحتاج إلى ذكاء اصطناعي قادر على العمل مع المستخدم بشكل لحظي، مثل المساعدين الشخصيين، وخدمات العملاء، والتعليم التفاعلي، والوكلاء الصوتيين.
ما هي Live Extended Thinking؟
من أبرز الإضافات أيضًا Live Extended Thinking، وهي قدرة تسمح للنموذج باستخدام قدر أكبر من التفكير في المهام التي تحتاج إلى تحليل أعمق بدلًا من إعطاء إجابة سريعة فقط.
الفكرة هنا أن بعض الأسئلة لا تحتاج سرعة بقدر ما تحتاج إلى فهم العلاقات بين المعلومات الموجودة أمام النموذج، وتحليل المشكلة قبل الرد.
وهذا يجعل Gemini Live أكثر ملاءمة للمهام المركبة التي قد تجمع بين المحادثة والصورة والمعلومات الموجودة على الشاشة.
التجربة العملية داخل Google AI Studio
الجزء الأكثر أهمية هو الاختبار الفعلي داخل Google AI Studio.
خلال التجربة، تم اختبار قدرة Gemini Live على متابعة المحتوى الظاهر على الشاشة وفهم ما يحدث أثناء التفاعل. ومن الاختبارات تجربة صفحة ويب تحتوي على معلومات ومسألة تحتاج إلى قراءة وتحليل، ثم الانتقال إلى اختبار يعتمد بصورة أكبر على الرؤية.
وتم كذلك استخدام لوحة شطرنج لمعرفة ما إذا كان Gemini يستطيع فهم الوضع الموجود أمامه وتحليل العناصر المرئية بدلًا من الاعتماد فقط على النص المكتوب.
مثل هذه الاختبارات تعطينا تصورًا أفضل عن الاتجاه الذي تسير إليه جوجل: الذكاء الاصطناعي لا يكتفي بأن تسأله سؤالًا، بل يصبح قادرًا تدريجيًا على رؤية ما تراه والتفاعل مع ما تفعله.
خطوة مهمة نحو الوكلاء الذكيين
ربما تكون النقطة الأكبر في Gemini 3.8 Live هي ما يمكن أن يبنى فوق هذه التقنية مستقبلًا.
عندما يستطيع النموذج الاستماع للمستخدم، ورؤية الشاشة، وفهم محتواها، والتفكير في المهمة أثناء المحادثة، فنحن نقترب أكثر من مفهوم AI Agents القادرين على مساعدة المستخدم أثناء تنفيذ المهام نفسها، وليس فقط تقديم تعليمات حول كيفية تنفيذها.
الخلاصة
Gemini 3.8 Live يوضح أن جوجل تعمل على نقل Gemini من مجرد مساعد للدردشة إلى نظام تفاعلي متعدد الوسائط يفهم الصوت والصورة ومحتوى الشاشة بصورة أكثر تكاملًا.
التقنية ما زالت بحاجة إلى التجربة العملية في سيناريوهات مختلفة لمعرفة حدودها الحقيقية، لكن الاتجاه واضح: التفاعل مع الذكاء الاصطناعي أصبح أقرب إلى محادثة مستمرة مع مساعد يرى ويفهم ما يحدث أمامك.
شاهد الفيديو للتجربة العملية الكاملة لـ Gemini 3.8 Live وLive Extended Thinking، واختبار قدرته على فهم الشاشة والتعامل مع المحتوى في الوقت الفعلي.
