قراءة مقاييس التقييم قراءة صحيحة

ما الذي يخبرك به فعلًا Word-F1 وخطوط الأساس وتقدير التصحيح وعلامات المقاطع غير الصالحة للتجميع وعلامة التراجع.

القسم: التقييم والتخصيص 7 دقيقة قراءة جرى التحقق من المحتوى مقابل تطبيق RoughCut الحالي بتاريخ 28 أغسطس 2026 English

Word-F1 هو المقياس الأساسي: قياس لمدى التوافق على الكلمات التي يجري استبعادها، مرجّح بمدة كل كلمة، وكلما ارتفع كان أفضل. ويقيس Interval F1 التوافق نفسه بالزمن بدل الكلمات. ولا تقرأ أيًا منهما بمعزل عن غيره: قارنه بخطوط الأساس remove_all وkeep_all وsilence_only، وبتشغيل سابق من النوع نفسه. ويوضح الفارق عن remove_all ما إذا كان النموذج يتفوق على مجرد قص المقطع بأكمله. ويقدّر Fixup لكل 30 دقيقة حجم عمل التصحيح المتبقي الناتج عن عمليات قص زائدة وعمليات قص فائتة وإزاحات في الحدود. وتُوضع علامة على المقاطع غير الصالحة للتجميع وتُستبعد من النتائج المجمّعة. وانخفاض متوسط Word-F1 بأكثر من 3 نقاط عن التشغيل المماثل السابق يرفع علامة تراجع تنبّه ولا تمنع. وتشغيلات التفريغ السحابي لا تقارَن إلا بتشغيلات سحابية أخرى.

في هذه الصفحة
محتوى متقدم. هذه الأرقام أداة لمقارنة RoughCut بنفسه في ظل تغييرات محكومة. وهي ليست تقييمًا لجودة المنتج، والدرجة الناتجة عن مجموعتك المرجعية لا تنتقل إلى لقطات شخص آخر. اقرأ الصفحة كاملة قبل أن تستخلص نتيجة من رقم واحد؛ وأسرع طريق للعودة إلى أرض صلبة واحد دائمًا: أعد قراءة خطوط الأساس بجوار الدرجة.

أين تظهر الأرقام

بعد كل تشغيل، تعرض اللوحة بطاقة Results تحمل إحصاءات مجمّعة، يليها جدول لكل مقطع.

العنصرما هو
Word-F1 mean / Word-F1 medianالمقياس الأساسي، بمتوسط محسوب على المقاطع الصالحة للتجميع
Interval meanالنسخة الزمنية من قياس التوافق نفسه
Fixup meanدقائق التصحيح المقدّرة لكل 30 دقيقة من المادة المصدر
Remove-all baseمتوسط درجة خط الأساس البدائي «اقصص كل شيء»، للمقارنة
Gold fingerprintبصمة قصيرة تحدد المجموعة المرجعية التي قيس عليها هذا التشغيل بالضبط
Transcriptionيظهر في التشغيلات السحابية، ومعه تذكير بأن المقارنة تكون مع تشغيلات سحابية أخرى فقط
أعمدة كل مقطع: Clip وWord-F1 وΔ remove-all وFixup/30m وFlagsصف واحد لكل مقطع حصل على درجة
العلامتان degenerate وcachedسبب إخراج المقطع من النتائج المجمّعة، وما إذا كان قد أُعيد تشغيله من الذاكرة المؤقتة

أما المقاطع المتجاوَزة وحالات الفشل الفردية فتُعرض على حدة، ومع كل واحدة سببها.

Word-F1، المقياس الأساسي

يقيس Word-F1 مدى التوافق حول الكلمات التي يجري استبعادها، مرجّحًا بمدة كل كلمة، ويُعرض كنسبة مئوية، وكلما ارتفع كان أفضل.

وهناك تفصيلان مهمان لتفسيره:

  • إنه مرجّح بالمدة، فالاختلاف حول كلمة طويلة يكلّف أكثر من الاختلاف حول كلمة قصيرة. وهذا مقصود: ما يلاحظه المشاهد ثوانٍ لا رموز نصية.
  • تُعدّ الكلمة مستبعدة حين يقل تداخل مدتها مع المديات المُبقاة عن 50%. فالحدود التي تقع في فترة التوقف الصحيحة تقريبًا تتوافق، والحدود الواقعة في فترة توقف خاطئة لا تتوافق.

Word-F1 درجة توافق مع مونتاجك المرجعي، لا أكثر. وهو ليس قياسًا لما إذا كان القص الناتج جيدًا.

Interval F1، السؤال نفسه لكن بالزمن

يقارن Interval F1 المديات الزمنية المستبعدة بدل الكلمات: الدقة والاستدعاء وقيمة F1 في فضاء الاستبعاد، إضافة إلى قياس تداخل من جهة الإبقاء.

وهو يجيب عن سؤال مختلف قليلًا — هل استبعدنا الأجزاء نفسها من الخط الزمني — وهو المقياس الذي يحمل التشغيل حين تكون تسميات الكلمات غير قابلة للاستخدام. وحين يختلف المقياسان اختلافًا حادًا، يكون السبب المعتاد وجود اختلافات قصيرة كثيرة متجمّعة في مواضع قليلة.

اقرأ دائمًا خط أساس بجوار الدرجة

الدرجة بلا خط أساس ليست نتيجة. وكل تشغيل يحسب ثلاثة خطوط أساس:

خط الأساسما يفعلهما يخبرك به
remove_allلا يُبقي على شيءالدرجة التي يحصل عليها نظام يقص المقطع بأكمله. وإذا كان ملفك المرجعي يستبعد معظم المقطع، فسيكون خط الأساس هذا مرتفعًا
keep_allلا يستبعد شيئًادرجة عدم فعل أي شيء إطلاقًا
silence_onlyيستبعد فترات الصمت المكتشفة فقطالدرجة من دون أي مرحلة مونتاج بالذكاء الاصطناعي

الفارق عن remove-all هو عمود Δ remove-all لكل مقطع: قيمة Word-F1 للتشغيل ناقص قيمة F1 لخط الأساس remove-all. والنموذج الذي لا يستطيع التفوق على «اقصص كل شيء» ليس يحرر، بل يحذف. وهذا الفارق، لا الدرجة الخام، هو العنوان النزيه لمقطع واحد.

وخط الأساس silence_only هو ما ينبغي مراقبته حين تقيس ما إذا كانت مرحلة المونتاج بالذكاء الاصطناعي تستحق كلفتها على موادك. فإذا كان تشغيل خط المعالجة الكامل بالكاد يتفوق على silence_only في مقاطعك، فإن استبعاد المحاولات غير الموفقة لا يقدّم كثيرًا مع هذا النوع من اللقطات.

تقدير التصحيح لكل 30 دقيقة

يقدّر Fixup/30m حجم عمل التصحيح الذي يخلّفه التشغيل، بالدقائق لكل 30 دقيقة من المادة المصدر. وهو مبني على ثلاثة أنواع من الخطأ، لكل منها كلفة مختلفة:

الخطأما هوالكلفة النسبية
قص زائدقص لا يقابله شيء في مونتاجك المرجعيمتوسطة — تلاحظه فتعيده
قص فائتشيء استبعده مونتاجك المرجعي لكنه بقيالأعلى — عليك أن تعثر عليه بنفسك
إزاحة حدقص متطابق لكن بدايته أو نهايته منزاحة بأكثر من نحو عُشر ثانيةالأدنى — سحبة على الخط الزمني

تُرجَّح عمليات القص الفائتة بأكبر وزن لأن العثور على مشكلة أغلى من إصلاح مشكلة تراها أمامك. وكلما انخفض الرقم كان أفضل، وهو تقدير للجهد لا قياس له.

المقاطع غير الصالحة للتجميع

بعض المقاطع تنتج درجة صحيحة حسابيًا لكنها بلا معنى تحريري. وتوضع على هذه المقاطع علامة degenerate وتُستبعد من النتائج المجمّعة، مع بقائها مقيّمة بالكامل ومعروضة في الجدول.

ويُعدّ المقطع غير صالح للتجميع عند تحقق أي مما يلي، بهذا الترتيب:

  1. المونتاج المتوقَّع لم يُبقِ على شيء — استُبعد كل شيء.
  2. المونتاج المتوقَّع لم يستبعد شيئًا.
  3. ملفك المرجعي لم يستبعد شيئًا، فلا توجد نسبة استبعاد يمكن القياس عليها.
  4. نسبة الزمن المستبعد، في المتوقَّع مقابل المرجعي، تقع خارج المدى 0.5 إلى 2.0 — أي أن أحد الطرفين استبعد أقل من نصف ما استبعده الآخر أو أكثر من ضعفه.

وتجمّع علامات degenerate يشير في الغالب الأعم إلى مشكلة في المجموعة المرجعية لا إلى مشكلة في النموذج. فالحالتان 2 و3 تعنيان عادة مونتاجًا مرجعيًا يُبقي على المقطع كله، والحالة 4 تعني عادة خطأ في المرجع الزمني. راجع إنشاء ملفات gold_v2.json المرجعية أولًا.

علامة التراجع

حين ينخفض متوسط Word-F1 لتشغيل ما بأكثر من 3 نقاط دون التشغيل السابق من النوع نفسه، توضع على التشغيل علامة:

تم رصد تراجع: انخفض متوسط word-F1 بأكثر من 3 نقاط مقارنة بالتشغيل السابق.

وهناك أمران ينبغي فهمهما عنها:

  • إنها تنبّه ولا تمنع. يُكتب الملخص في الحالتين، ولا يُهمل شيء ولا يُمنع شيء.
  • إنها تقارن المتماثل بالمتماثل فقط. لا تُقارَن التشغيلات ذات الأوضاع المختلفة ببعضها أبدًا، لأن مجموعات المقاطع تختلف فيكون الفارق كذبًا.

تعامل مع العلامة بوصفها دعوة للتحقيق — ما الذي تغيّر بين التشغيلين، وهل كان ذلك هو الإعداد الذي قصدت تغييره — لا بوصفها حكمًا.

تشغيلات السحابة عالم منفصل

إذا شغّلت مع تفعيل خيار Pro المسمى Cloud transcription (whisper-1):

  • جاء النص المفرّغ من نموذج مختلف يقسّم الكلمات بطريقة مختلفة، ولذلك تُسقَط تسميات الكلمات من الفترات الزمنية بدل مطابقتها كلمة بكلمة.
  • تُكتب النتائج في ملفات ملخص منفصلة بلاحقة تدل على السحابة، وتستخدم ذاكرة مؤقتة منفصلة للنص المفرّغ، فيبقى سجلك للتشغيلات على الجهاز سليمًا.
  • تطبع اللوحة Transcription: <source> — compare only against other cloud runs.

قارن السحابي بالسحابي، وما يجري على الجهاز بما يجري على الجهاز. فالفارق في Word-F1 بين السحابي وما يجري على الجهاز يهيمن عليه إسقاط التسميات، لا جودة التفريغ النصي. راجع خيارات التفريغ النصي.

العربية والكتابات الأخرى

المطابقة المطلقة للكلمات تُقرأ بتشاؤم على المواد العربية. فالكلام باللهجة حين يُفرَّغ نحو رسم العربية الفصحى ينتج صيغًا لا تتطابق رمزًا برمز حتى حين يكون القرار التحريري متطابقًا — كما أن المونتاجات المرجعية لهذه المجموعات تميل بحكم بنائها إلى الإبقاء على أقل مما ينبغي.

والاستجابة الصحيحة ليست عدم الثقة بالنظام، بل تغيير ما تقرأه: ثق بالفوارق المحكومة وبخطوط الأساس، لا بالرقم المطلق. قارن تشغيلًا عربيًا بالتشغيل العربي السابق مع تغيير إعداد واحد، وانظر إلى Δ remove-all. راجع التبديل بين الإنجليزية والعربية.

بصمة الملف المرجعي

يسجّل كل ملخص بصمة قصيرة محسوبة على الملفات المرجعية لكل مقطع حصل على درجة فعلًا، بترتيب البيان. وهي تحدد المجموعة المرجعية التي قيس عليها التشغيل بالضبط.

والغرض منها منع المقارنات غير النزيهة. فإذا عدّلت ملف gold_v2.json بين تشغيلين، تتغير البصمة، ويصبح التشغيلان لا يقيسان الشيء نفسه — وقد يكون الفارق بينهما ناتجًا عن تحرك ملفك المرجعي لا عن سلوك التطبيق. والمقارنات ترفض الوثوق بالفوارق عبر ملفات مرجعية مختلفة، وتحذّر بوضوح حين يخلو أحد الطرفين من بصمة أصلًا.

قبل أن تقارن تشغيلين، تحقق من تطابق البصمتين. وإن لم تتطابقا، فالجواب النزيه أنك لا تملك مقارنة، بل قياسين منفصلين.

ما لا يصح استنتاجه

  • لا تقرأ المتوسط بوصفه تقديرًا. مجموعتان مرجعيتان بناهما محرران مختلفان ستنتجان أرقامًا مختلفة لسلوك متطابق من التطبيق، لأن المونتاجات المرجعية مختلفة.
  • لا تقارن أرقامك بالأرقام المطبوعة في ترويسة اللوحة. فتلك المراجع قيست على مجموعة مرجعية أخرى بمقاطع مختلفة ومونتاجات مرجعية مختلفة؛ والمرجع الوحيد الذي يعني لك شيئًا هو تشغيلك السابق أنت.
  • لا تستشهد بدرجة بوصفها ادعاءً عن المنتج. فهي توافق مع أسلوب مونتاج شخص واحد على مجموعة واحدة من المقاطع.
  • لا تلاحق عُشر نقطة. نطاق «بلا تغيير» في المقارنة بين تشغيل وآخر موجود لأن الفروق الصغيرة ضوضاء.

أخطاء شائعة

  • قراءة النتيجة المجمّعة من دون جدول المقاطع. مقطع واحد كارثي قادر على زحزحة متوسط محسوب على 15 مقطعًا.
  • تجاهل عدد المقاطع غير الصالحة للتجميع. إذا استُبعد نصف المجموعة، فالمتوسط يصف النصف الآخر.
  • المقارنة عبر أوضاع مختلفة. وضع smoke ووضع full يحتويان مقاطع مختلفة.
  • تغيير شيئين في وقت واحد. متغير واحد لكل تشغيل، وإلا فالفارق لا يخبرك بشيء.
  • مقارنة تشغيلين ببصمتَي ملف مرجعي مختلفتين. هذه ليست مقارنة A/B.

الخطوات التالية

ما زالت المشكلة قائمة؟

تواصل مع الدعم

هل كانت هذه الصفحة مفيدة؟