International Science and Technology Journal

Home < Articles < Article Details

Beyond FPS: A Critical Review of Temporal Evidence for Real-Time Object Detection in Video Surveillance

الملخص
يُعد وصف أنظمة كشف الأجسام في المراقبة بالفيديو بأنها تعمل «في الزمن الحقيقي» من أكثر ادعاءات الأداء شيوعاً، إلا أن هذا الوصف يُدعَم في كثير من الدراسات بمقاييس غير متجانسة، مثل معدل الإطارات في الثانية، أو زمن الاستدلال المنفصل، أو إنتاجية أجهزة الحافة، أو توقيت جزئي لمسار النظام. تقدم هذه الدراسة مراجعة نقدية موجهة لعشر دراسات تجريبية في كشف الأجسام نُشرت بين عامي 2021 و2026، واختيرت بصورة قصدية لتحقيق تنوع في بنية الكاشف، ومنصة الحوسبة، وبيئة التشغيل، وحدود القياس الزمني. استُخدم Google Scholar كمصدر اكتشاف رئيسي مع التحقق من صفحات الناشرين وتتبع الاستشهادات بصورة موجهة. وطُبّق تصنيف وصفي رباعي المستويات للأدلة الزمنية: L0 للادعاء دون قياس زمني، وL1 لتوقيت النموذج، وL2 للإنتاجية التشغيلية أو التوقيت الجزئي لمسار المعالجة، وL3 للتوقيت الكلي للنظام أو من البداية إلى النهاية. كما أُجري تقييم وصفي منظم لموثوقية الإبلاغ عبر خمسة أبعاد: وجود مقياس زمني صريح، وتحديد العتاد والسياق، ووضوح حدود القياس الزمني، وقابلية إعادة إنتاج بروتوكول التوقيت، ووجود تقييم تشغيلي أو بث حي. ضمن هذه العينة القصدية، أبلغت سبع دراسات من أصل عشر (70.0%) عن معدل الإطارات، وأبلغت خمس (50.0%) عن قيمة صريحة للكمون، بينما قدمت ثلاث دراسات (30.0%) حدوداً زمنية واضحة للنظام ككل أو من البداية إلى النهاية. وتُعد هذه النسب وصفية للعينة المختارة وليست تقديرات لانتشار الممارسات في المجال. تراوح الأداء المبلغ عنه من 1.96 إطار/ثانية على Raspberry Pi 3B إلى 143.7 إطار/ثانية على RTX 3060 Laptop GPU، أي بفارق يتجاوز 73 ضعفاً عبر عتاد وأعباء عمل غير متجانسة. كما تُظهر دراسات المستوى L3 الحديثة أن فك الفيديو، والمعالجة المسبقة واللاحقة، والتخزين المؤقت، والشبكات، والعرض قد تهيمن على زمن الاستجابة الكلي حتى عندما يكون استدلال الكاشف سريعاً. استخدمت الدراسة النطاق العام لمعيار IEC 62676-6:2026 كعدسة تفسيرية مستنيرة بالمعايير دون ادعاء تقييم المطابقة. وتدعم النتائج خلاصة مركزية مفادها أن الأداء في الزمن الحقيقي ليس خاصية كامنة في كاشف الأجسام، بل خاصية لتركيبة الكاشف والعتاد وعبء العمل والتطبيق وحدود القياس الزمني. وتقترح الدراسة مجموعة دنيا من عناصر الإبلاغ، مع امتداد مستقبلي يربط الأدلة الزمنية باستهلاك الطاقة لتحسين القابلية للتكرار وملاءمة النشر التشغيلي................. الكلمات المفتاحية:........... يُعد وصف أنظمة كشف الأجسام في المراقبة بالفيديو بأنها تعمل «في الزمن الحقيقي» من أكثر ادعاءات الأداء شيوعاً، إلا أن هذا الوصف يُدعَم في كثير من الدراسات بمقاييس غير متجانسة، مثل معدل الإطارات في الثانية، أو زمن الاستدلال المنفصل، أو إنتاجية أجهزة الحافة، أو توقيت جزئي لمسار النظام. تقدم هذه الدراسة مراجعة نقدية موجهة لعشر دراسات تجريبية في كشف الأجسام نُشرت بين عامي 2021 و2026، واختيرت بصورة قصدية لتحقيق تنوع في بنية الكاشف، ومنصة الحوسبة، وبيئة التشغيل، وحدود القياس الزمني. استُخدم Google Scholar كمصدر اكتشاف رئيسي مع التحقق من صفحات الناشرين وتتبع الاستشهادات بصورة موجهة. وطُبّق تصنيف وصفي رباعي المستويات للأدلة الزمنية: L0 للادعاء دون قياس زمني، وL1 لتوقيت النموذج، وL2 للإنتاجية التشغيلية أو التوقيت الجزئي لمسار المعالجة، وL3 للتوقيت الكلي للنظام أو من البداية إلى النهاية. كما أُجري تقييم وصفي منظم لموثوقية الإبلاغ عبر خمسة أبعاد: وجود مقياس زمني صريح، وتحديد العتاد والسياق، ووضوح حدود القياس الزمني، وقابلية إعادة إنتاج بروتوكول التوقيت، ووجود تقييم تشغيلي أو بث حي. ضمن هذه العينة القصدية، أبلغت سبع دراسات من أصل عشر (70.0%) عن معدل الإطارات، وأبلغت خمس (50.0%) عن قيمة صريحة للكمون، بينما قدمت ثلاث دراسات (30.0%) حدوداً زمنية واضحة للنظام ككل أو من البداية إلى النهاية. وتُعد هذه النسب وصفية للعينة المختارة وليست تقديرات لانتشار الممارسات في المجال. تراوح الأداء المبلغ عنه من 1.96 إطار/ثانية على Raspberry Pi 3B إلى 143.7 إطار/ثانية على RTX 3060 Laptop GPU، أي بفارق يتجاوز 73 ضعفاً عبر عتاد وأعباء عمل غير متجانسة. كما تُظهر دراسات المستوى L3 الحديثة أن فك الفيديو، والمعالجة المسبقة واللاحقة، والتخزين المؤقت، والشبكات، والعرض قد تهيمن على زمن الاستجابة الكلي حتى عندما يكون استدلال الكاشف سريعاً. استخدمت الدراسة النطاق العام لمعيار IEC 62676-6:2026 كعدسة تفسيرية مستنيرة بالمعايير دون ادعاء تقييم المطابقة. وتدعم النتائج خلاصة مركزية مفادها أن الأداء في الزمن الحقيقي ليس خاصية كامنة في كاشف الأجسام، بل خاصية لتركيبة الكاشف والعتاد وعبء العمل والتطبيق وحدود القياس الزمني. وتقترح الدراسة مجموعة دنيا من عناصر الإبلاغ، مع امتداد مستقبلي يربط الأدلة الزمنية باستهلاك الطاقة لتحسين القابلية للتكرار وملاءمة النشر التشغيلي.................. الكلمات المفتاحية:................. كشف الأجسام في الزمن الحقيقي؛ المراقبة بالفيديو؛ YOLO؛ الكمون؛ معدل الإطارات؛ الحوسبة الطرفية؛ النشر التشغيلي؛ قابلية التكرار.
Abstract
“Real-time” is one of the most frequently used performance claims in deep-learning video surveillance, yet the term is often supported by incompatible measures such as detector frames per second (FPS), isolated inference latency, edge-device throughput, or partially defined system timing. This targeted critical review examines how real-time performance is evidenced in ten empirical object-detection studies published between 2021 and 2026, selected purposively to maximize variation in detector architecture, computing platform, deployment setting, and temporal boundary. Google Scholar was used as the primary discovery source, supplemented by publisher verification and targeted citation chasing. A descriptive four-level temporal-evidence typology was applied: L0 (claim only), L1 (model-level timing), L2 (operational throughput or partial-pipeline timing), and L3 (explicit system-total or end-to-end timing). A separate structured reporting-reliability appraisal examined five dimensions: presence of an explicit temporal metric, hardware/context specification, timing-boundary clarity, timing-protocol reproducibility, and operational/live evaluation. Within this purposive sample, seven of ten studies (70.0%) reported FPS, five (50.0%) reported an explicit latency value, and three (30.0%) provided a clearly defined system-total or end-to-end temporal boundary. These proportions are descriptive of the selected sample and are not prevalence estimates for the field. Reported FPS ranged from 1.96 FPS on a Raspberry Pi 3B to 143.7 FPS on an RTX 3060 Laptop GPU, a greater than 73-fold span across heterogeneous hardware and workloads. Recent L3 studies further show that preprocessing, post-processing, decoding, buffering, networking, and rendering can dominate total response time even when detector inference is fast. The review uses the public scope of IEC 62676-6:2026 as a standards-informed lens for operational context, without claiming compliance assessment. The findings support a central conclusion: real-time performance is not an intrinsic property of an object detector; it is a property of the detector–hardware–workload–application configuration and of the temporal boundary being measured. A minimum reporting set and a future temporal–energy reporting extension are proposed to improve reproducibility and deployment relevance........................ Keywords:................ real-time object detection; video surveillance; YOLO; latency; FPS; edge computing; deployment; reproducibility