نحن نبني مجموعة بيانات متطورة لتقييم وكلاء البرمجة بالذكاء الاصطناعي، بهدف قياس قدرة النماذج على التعامل مع مهام المطورين الواقعية. بصفتك مهندس تقييم مستقل، ستكون مسؤولاً عن تصميم وإنشاء مهام تقييم صعبة ومعايير دقيقة ضمن بيئات محاكاة واقعية. تتضمن المهمة بناء بيئات مطور شاملة (شركة افتراضية مع قاعدة كود، بنية تحتية، وسياق تطوير كامل)، وصياغة المهام التي تختبر حدود أفضل نماذج الذكاء الاصطناعي، وكتابة اختبارات تحقق من صحة حلول الوكيل بدقة.
توفر هذه المهمة تحدياً تقنياً عالياً ومباشراً مع أحدث تقنيات الذكاء الاصطناعي. ستعمل بشكل مستقل، وتحدد جدولك الزمني، وتساهم في تحسين نماذج AI الرائدة. التعويض يصل إلى 50 دولاراً/ساعة مقابل إكمال مهام تقدر بحوالي 20 ساعة لكل منها. البيئة محفزة وتتطلب تفكيراً نقدياً عميقاً في تقييم وكلاء البرمجة.
تُعلن Mindrift عن وظيفة مهندس تقييم وكلاء ذكاء اصطناعي - مستقل (عن بعد) للعمل في برمجة وكمبيوتر وشبكات الرياض في الرياض، السعودية — تخصص برمجة وكمبيوتر وشبكات · اخرى . آخر موعد للتقديم 2026-08-08.
يمكنك التقديم بحسابك على وظف دوت كوم. أو التقديم بدون تسجيل.
وظف دوت كوم منصة إعلانات وظيفية مستقلة وليست شركة توظيف. نعرض يومياً آلاف الوظائف الشاغرة من كبرى الشركات في الشرق الأوسط. إذا طُلب منك دفع أي مبالغ مالية من أي جهة معلنة، تجنب التعامل معها فوراً وأبلغنا على الفور.
صحيفة وظائف
احصل على نصائح مهنية مخصصة وتقييم للسيرة الذاتية من خبراء التوظيف