# قراءة مقاييس التقييم قراءة صحيحة

> ما الذي يخبرك به فعلًا Word-F1 وخطوط الأساس وتقدير التصحيح وعلامات المقاطع غير الصالحة للتجميع وعلامة التراجع.
>
> جرى التحقق من المحتوى مقابل تطبيق RoughCut الحالي بتاريخ 28 أغسطس 2026
> https://www.roughcuteditor.com/ar/docs/evaluation-metrics

Word-F1 هو المقياس الأساسي: قياس لمدى التوافق على الكلمات التي يجري استبعادها، مرجّح بمدة كل كلمة، وكلما ارتفع كان أفضل. ويقيس Interval F1 التوافق نفسه بالزمن بدل الكلمات. ولا تقرأ أيًا منهما بمعزل عن غيره: قارنه بخطوط الأساس remove_all وkeep_all وsilence_only، وبتشغيل سابق من النوع نفسه. ويوضح الفارق عن remove_all ما إذا كان النموذج يتفوق على مجرد قص المقطع بأكمله. ويقدّر Fixup لكل 30 دقيقة حجم عمل التصحيح المتبقي الناتج عن عمليات قص زائدة وعمليات قص فائتة وإزاحات في الحدود. وتُوضع علامة على المقاطع غير الصالحة للتجميع وتُستبعد من النتائج المجمّعة. وانخفاض متوسط Word-F1 بأكثر من 3 نقاط عن التشغيل المماثل السابق يرفع علامة تراجع تنبّه ولا تمنع. وتشغيلات التفريغ السحابي لا تقارَن إلا بتشغيلات سحابية أخرى.

> ! **محتوى متقدم.** هذه الأرقام أداة لمقارنة RoughCut بنفسه في ظل تغييرات محكومة. وهي ليست تقييمًا لجودة المنتج، والدرجة الناتجة عن مجموعتك المرجعية لا تنتقل إلى لقطات شخص آخر. اقرأ الصفحة كاملة قبل أن تستخلص نتيجة من رقم واحد؛ وأسرع طريق للعودة إلى أرض صلبة واحد دائمًا: أعد قراءة خطوط الأساس بجوار الدرجة.

## أين تظهر الأرقام

بعد كل تشغيل، تعرض اللوحة بطاقة `Results` تحمل إحصاءات مجمّعة، يليها جدول لكل مقطع.

| العنصر | ما هو |
|---|---|
| `Word-F1 mean` / `Word-F1 median` | المقياس الأساسي، بمتوسط محسوب على المقاطع الصالحة للتجميع |
| `Interval mean` | النسخة الزمنية من قياس التوافق نفسه |
| `Fixup mean` | دقائق التصحيح المقدّرة لكل 30 دقيقة من المادة المصدر |
| `Remove-all base` | متوسط درجة خط الأساس البدائي «اقصص كل شيء»، للمقارنة |
| `Gold fingerprint` | بصمة قصيرة تحدد المجموعة المرجعية التي قيس عليها هذا التشغيل بالضبط |
| `Transcription` | يظهر في التشغيلات السحابية، ومعه تذكير بأن المقارنة تكون مع تشغيلات سحابية أخرى فقط |
| أعمدة كل مقطع: `Clip` و`Word-F1` و`Δ remove-all` و`Fixup/30m` و`Flags` | صف واحد لكل مقطع حصل على درجة |
| العلامتان `degenerate` و`cached` | سبب إخراج المقطع من النتائج المجمّعة، وما إذا كان قد أُعيد تشغيله من الذاكرة المؤقتة |

أما المقاطع المتجاوَزة وحالات الفشل الفردية فتُعرض على حدة، ومع كل واحدة سببها.

## Word-F1، المقياس الأساسي

يقيس Word-F1 مدى التوافق حول **الكلمات التي يجري استبعادها**، مرجّحًا بمدة كل كلمة، ويُعرض كنسبة مئوية، وكلما ارتفع كان أفضل.

وهناك تفصيلان مهمان لتفسيره:

- إنه **مرجّح بالمدة**، فالاختلاف حول كلمة طويلة يكلّف أكثر من الاختلاف حول كلمة قصيرة. وهذا مقصود: ما يلاحظه المشاهد ثوانٍ لا رموز نصية.
- تُعدّ الكلمة مستبعدة حين يقل تداخل مدتها مع المديات المُبقاة عن **50%**. فالحدود التي تقع في فترة التوقف الصحيحة تقريبًا تتوافق، والحدود الواقعة في فترة توقف خاطئة لا تتوافق.

Word-F1 درجة توافق مع مونتاجك المرجعي، لا أكثر. وهو ليس قياسًا لما إذا كان القص الناتج جيدًا.

## Interval F1، السؤال نفسه لكن بالزمن

يقارن Interval F1 **المديات الزمنية المستبعدة** بدل الكلمات: الدقة والاستدعاء وقيمة F1 في فضاء الاستبعاد، إضافة إلى قياس تداخل من جهة الإبقاء.

وهو يجيب عن سؤال مختلف قليلًا — هل استبعدنا الأجزاء نفسها من الخط الزمني — وهو المقياس الذي يحمل التشغيل حين تكون تسميات الكلمات غير قابلة للاستخدام. وحين يختلف المقياسان اختلافًا حادًا، يكون السبب المعتاد وجود اختلافات قصيرة كثيرة متجمّعة في مواضع قليلة.

## اقرأ دائمًا خط أساس بجوار الدرجة

الدرجة بلا خط أساس ليست نتيجة. وكل تشغيل يحسب ثلاثة خطوط أساس:

| خط الأساس | ما يفعله | ما يخبرك به |
|---|---|---|
| `remove_all` | لا يُبقي على شيء | الدرجة التي يحصل عليها نظام يقص المقطع بأكمله. وإذا كان ملفك المرجعي يستبعد معظم المقطع، فسيكون خط الأساس هذا مرتفعًا |
| `keep_all` | لا يستبعد شيئًا | درجة عدم فعل أي شيء إطلاقًا |
| `silence_only` | يستبعد فترات الصمت المكتشفة فقط | الدرجة من دون أي مرحلة مونتاج بالذكاء الاصطناعي |

**الفارق عن remove-all** هو عمود `Δ remove-all` لكل مقطع: قيمة Word-F1 للتشغيل ناقص قيمة F1 لخط الأساس remove-all. والنموذج الذي لا يستطيع التفوق على «اقصص كل شيء» ليس يحرر، بل يحذف. وهذا الفارق، لا الدرجة الخام، هو العنوان النزيه لمقطع واحد.

وخط الأساس `silence_only` هو ما ينبغي مراقبته حين تقيس ما إذا كانت مرحلة المونتاج بالذكاء الاصطناعي تستحق كلفتها على موادك. فإذا كان تشغيل خط المعالجة الكامل بالكاد يتفوق على `silence_only` في مقاطعك، فإن [استبعاد المحاولات غير الموفقة](/ar/docs/bad-take-removal) لا يقدّم كثيرًا مع هذا النوع من اللقطات.

## تقدير التصحيح لكل 30 دقيقة

يقدّر `Fixup/30m` حجم عمل التصحيح الذي يخلّفه التشغيل، بالدقائق لكل 30 دقيقة من المادة المصدر. وهو مبني على ثلاثة أنواع من الخطأ، لكل منها كلفة مختلفة:

| الخطأ | ما هو | الكلفة النسبية |
|---|---|---|
| قص زائد | قص لا يقابله شيء في مونتاجك المرجعي | متوسطة — تلاحظه فتعيده |
| قص فائت | شيء استبعده مونتاجك المرجعي لكنه بقي | الأعلى — عليك أن تعثر عليه بنفسك |
| إزاحة حد | قص متطابق لكن بدايته أو نهايته منزاحة بأكثر من نحو عُشر ثانية | الأدنى — سحبة على الخط الزمني |

تُرجَّح عمليات القص الفائتة بأكبر وزن لأن العثور على مشكلة أغلى من إصلاح مشكلة تراها أمامك. وكلما انخفض الرقم كان أفضل، وهو تقدير للجهد لا قياس له.

## المقاطع غير الصالحة للتجميع

بعض المقاطع تنتج درجة صحيحة حسابيًا لكنها بلا معنى تحريري. وتوضع على هذه المقاطع علامة `degenerate` وتُستبعد **من النتائج المجمّعة**، مع بقائها مقيّمة بالكامل ومعروضة في الجدول.

ويُعدّ المقطع غير صالح للتجميع عند تحقق أي مما يلي، بهذا الترتيب:

1. المونتاج المتوقَّع **لم يُبقِ على شيء** — استُبعد كل شيء.
2. المونتاج المتوقَّع **لم يستبعد شيئًا**.
3. **ملفك المرجعي لم يستبعد شيئًا**، فلا توجد نسبة استبعاد يمكن القياس عليها.
4. نسبة الزمن المستبعد، في المتوقَّع مقابل المرجعي، تقع خارج المدى **0.5 إلى 2.0** — أي أن أحد الطرفين استبعد أقل من نصف ما استبعده الآخر أو أكثر من ضعفه.

وتجمّع علامات `degenerate` يشير في الغالب الأعم إلى مشكلة في المجموعة المرجعية لا إلى مشكلة في النموذج. فالحالتان 2 و3 تعنيان عادة مونتاجًا مرجعيًا يُبقي على المقطع كله، والحالة 4 تعني عادة خطأ في المرجع الزمني. راجع [إنشاء ملفات gold_v2.json المرجعية](/ar/docs/gold-reference-edit) أولًا.

## علامة التراجع

حين ينخفض متوسط Word-F1 لتشغيل ما **بأكثر من 3 نقاط** دون التشغيل السابق من النوع نفسه، توضع على التشغيل علامة:

`تم رصد تراجع: انخفض متوسط word-F1 بأكثر من 3 نقاط مقارنة بالتشغيل السابق.`

وهناك أمران ينبغي فهمهما عنها:

- **إنها تنبّه ولا تمنع.** يُكتب الملخص في الحالتين، ولا يُهمل شيء ولا يُمنع شيء.
- **إنها تقارن المتماثل بالمتماثل فقط.** لا تُقارَن التشغيلات ذات الأوضاع المختلفة ببعضها أبدًا، لأن مجموعات المقاطع تختلف فيكون الفارق كذبًا.

تعامل مع العلامة بوصفها دعوة للتحقيق — ما الذي تغيّر بين التشغيلين، وهل كان ذلك هو الإعداد الذي قصدت تغييره — لا بوصفها حكمًا.

## تشغيلات السحابة عالم منفصل

إذا شغّلت مع تفعيل خيار Pro المسمى `Cloud transcription (whisper-1)`:

- جاء النص المفرّغ من نموذج مختلف يقسّم الكلمات بطريقة مختلفة، ولذلك تُسقَط تسميات الكلمات من الفترات الزمنية بدل مطابقتها كلمة بكلمة.
- تُكتب النتائج في **ملفات ملخص منفصلة** بلاحقة تدل على السحابة، وتستخدم ذاكرة مؤقتة منفصلة للنص المفرّغ، فيبقى سجلك للتشغيلات على الجهاز سليمًا.
- تطبع اللوحة `Transcription: <source> — compare only against other cloud runs`.

**قارن السحابي بالسحابي، وما يجري على الجهاز بما يجري على الجهاز.** فالفارق في Word-F1 بين السحابي وما يجري على الجهاز يهيمن عليه إسقاط التسميات، لا جودة التفريغ النصي. راجع [خيارات التفريغ النصي](/ar/docs/transcription-options).

## العربية والكتابات الأخرى

المطابقة المطلقة للكلمات تُقرأ بتشاؤم على المواد العربية. فالكلام باللهجة حين يُفرَّغ نحو رسم العربية الفصحى ينتج صيغًا لا تتطابق رمزًا برمز حتى حين يكون القرار التحريري متطابقًا — كما أن المونتاجات المرجعية لهذه المجموعات تميل بحكم بنائها إلى الإبقاء على أقل مما ينبغي.

والاستجابة الصحيحة ليست عدم الثقة بالنظام، بل تغيير ما تقرأه: **ثق بالفوارق المحكومة وبخطوط الأساس**، لا بالرقم المطلق. قارن تشغيلًا عربيًا بالتشغيل العربي السابق مع تغيير إعداد واحد، وانظر إلى `Δ remove-all`. راجع [التبديل بين الإنجليزية والعربية](/ar/docs/language).

## بصمة الملف المرجعي

يسجّل كل ملخص بصمة قصيرة محسوبة على الملفات المرجعية لكل مقطع حصل على درجة فعلًا، بترتيب البيان. وهي تحدد المجموعة المرجعية التي قيس عليها التشغيل بالضبط.

والغرض منها منع المقارنات غير النزيهة. فإذا عدّلت ملف `gold_v2.json` بين تشغيلين، تتغير البصمة، ويصبح التشغيلان لا يقيسان الشيء نفسه — وقد يكون الفارق بينهما ناتجًا عن تحرك ملفك المرجعي لا عن سلوك التطبيق. والمقارنات ترفض الوثوق بالفوارق عبر ملفات مرجعية مختلفة، وتحذّر بوضوح حين يخلو أحد الطرفين من بصمة أصلًا.

قبل أن تقارن تشغيلين، تحقق من تطابق البصمتين. وإن لم تتطابقا، فالجواب النزيه أنك لا تملك مقارنة، بل قياسين منفصلين.

## ما لا يصح استنتاجه

- **لا تقرأ المتوسط بوصفه تقديرًا.** مجموعتان مرجعيتان بناهما محرران مختلفان ستنتجان أرقامًا مختلفة لسلوك متطابق من التطبيق، لأن المونتاجات المرجعية مختلفة.
- **لا تقارن أرقامك بالأرقام المطبوعة في ترويسة اللوحة.** فتلك المراجع قيست على مجموعة مرجعية أخرى بمقاطع مختلفة ومونتاجات مرجعية مختلفة؛ والمرجع الوحيد الذي يعني لك شيئًا هو تشغيلك السابق أنت.
- **لا تستشهد بدرجة بوصفها ادعاءً عن المنتج.** فهي توافق مع أسلوب مونتاج شخص واحد على مجموعة واحدة من المقاطع.
- **لا تلاحق عُشر نقطة.** نطاق «بلا تغيير» في المقارنة بين تشغيل وآخر موجود لأن الفروق الصغيرة ضوضاء.

## أخطاء شائعة

- **قراءة النتيجة المجمّعة من دون جدول المقاطع.** مقطع واحد كارثي قادر على زحزحة متوسط محسوب على 15 مقطعًا.
- **تجاهل عدد المقاطع غير الصالحة للتجميع.** إذا استُبعد نصف المجموعة، فالمتوسط يصف النصف الآخر.
- **المقارنة عبر أوضاع مختلفة.** وضع `smoke` ووضع `full` يحتويان مقاطع مختلفة.
- **تغيير شيئين في وقت واحد.** متغير واحد لكل تشغيل، وإلا فالفارق لا يخبرك بشيء.
- **مقارنة تشغيلين ببصمتَي ملف مرجعي مختلفتين.** هذه ليست مقارنة A/B.

## الخطوات التالية

- [ربط تتبّع Langfuse](/ar/docs/langfuse) للاحتفاظ بسجل التشغيلات ودرجاتها في لوحة تتابعها مع الوقت.
- [تخصيص المونتاج عبر بنك الأمثلة](/ar/docs/exemplars) — أحد التغييرات القليلة القادرة على تحريك هذه الأرقام.
- [بناء مجموعة مرجعية](/ar/docs/golden-set) إذا كانت الأرقام تشير إلى بياناتك المرجعية لا إلى التطبيق.
