Вихідна ситуація: є 6 записаних скрінкастів (всього ~90 хвилин) із внутрішнього навчання з реагування на інциденти та розслідування логів (SIEM) для команди SOC. Відео англійською, багато термінів та абревіатур, спікер з акцентом, зустрічаються назви полів подій, команди та фрагменти конфігів. Матеріали потрібно випустити російською для російськомовних аналітиків, зберігши точність формулювань і прив'язку до таймкодів. Технічне середовище та предметна область: кібербезпека - SOC, SIEM, кореляційні правила, аналіз Windows Event Logs, Sysmon, MITRE ATT&CK, базові команди PowerShell, розбір мережевих індикаторів. У відео присутні екранні фрагменти з консоллю, Kibana/Elastic, Splunk-подібний інтерфейс, таблиці, JSON-поля, регулярні вирази. Що потрібно зробити – кілька етапів:
1) Витягти мову та підготувати точну транскрипцію EN з таймкодами та позначками незрозумілих місць – допускається використання ASR, але фінальна правка вручну обов'язкова, особливо для термінів, чисел, імен технік та команд.
2) Зробити переклад EN->RU з урахуванням доменної термінології. Переклад має бути не дослівним, а навчально-практичним – без втрати змісту, але з акуратною локалізацією термінів, де це доречно. Команди, імена полів, значення, CVE, техніки MITRE, індикатори, шляхи та ключі реєстру не перекладати, а зберігати як у оригіналі.
3) Сформувати глосарій (EN-термін – затверджений RU-варіант – примітка) мінімум на 60 одиниць, щоб подальші ролики можна було перекладати однаково.
4) Підготувати субтитри у форматі SRT для кожного ролика - з коректною сегментацією, читання та синхронізацією. Обмеження за субтитрами: 1-2 рядки, до 42 символів у рядку, швидкість читання не вище 17 cps, на екрані не менше 1.0 сек і не більше 6.0 сек без перекриття таймкодів.
5) Провести контроль якості - виловити невідповідності термінів, розсинхрон, помилки у числах, командах та іменах полів, та видати короткий звіт про спірні місця з пропозиціями. Конкретний результат: папка з 6 файлами .srt (RU) та 6 файлами .txt або .docx з фінальною EN-транскрипцією та RU-перекладом за абзацами, єдиний глосарій .xlsx, і QC-звіт .txt з переліком проблемних фрагментів за таймкодами. Обмеження: вихідні відео та можливі внутрішні назви не публікувати та не використовувати для навчання моделей. Не змінювати сенс інструкцій щодо реагування на інциденти. Будь-які сумнівні місця наголошувати, а не додумувати. Важливо не ламати технічні артефакти – команди, запити, шляхи, імена полів, хеші та ІР повинні збігатися з оригіналом. Вимірні критерії приймання:
- 100% покриття по таймкодах - все сказане має відображення в субтитрах, без перепусток довше 2 секунд, крім пауз.
- Розбіжність тривалості реплік у SRT з аудіо не більше 200 мс на ключових місцях (команди, показники, висновки) та не більше 400 мс у середньому.
- Помилок у числах, CVE, шляхах, командах та іменах полів – 0 за підсумками вибіркової перевірки 30 випадкових фрагментів.
- Одноманітність термінів: не менше 95% збігів з глосарієм щодо перевірки входжень (на спірні терміни допускаються позначки у QC-звіті).
- Відповідність обмеженням за довжиною рядків і cps - не менше 95% рядків, випадки, що залишилися, обґрунтовані (наприклад, довга команда) і зазначені. Професійні інструменти: зручніше працювати в Subtitle Edit/Aegisub, для транскрипції допускаються Whisper-подібні рішення, але фінальна синхронізація та вичитка вручну обов'язкові.