Сервіс транскрибування Vertex
Огляд кейсу
Платформа обробки медіа на базі ШІ, розроблена для роботи з мільйонами хвилин аудіо- та відеоконтенту. Вона приймає записи освітніх лекцій — арамейською та англійською — і перетворює їх у чистий, відформатований текст з правильним сценарієм, діакритиками, перевіреними посиланнями та синхронізованими субтитрами. Коли надходить відеофайл, система автоматично його виявляє, витягує аудіодоріжку і пропускає через одну й ту ж транскрипційну лінію.
Мета: Створити медіалінію, здатну обробляти мільйони хвилин контенту та доставляти текст, субтитри та HLS-потоки, готові для публікації — з мінімальною участю вручну. Обробляти одночасно звук і відео в одній лінії, транскрибувати багатомовний контент з високою точністю та динамічно масштабуватися на Kubernetes для роботи з пакетами з понад 300 одночасних записів.
Ключова інформація про проєкт
Галузі
Платформи освітнього контенту, релігійні установи, медіавидавництво, компанії електронного навчання, архіви лекцій, бібліотеки академічного контенту.
Послуги
Транскрипція на базі ШІ, обробка відео, витяг аудіо, багатобітрейтове кодування HLS, генерація субтитрів, пакетна оркестрація, перевірка джерел посилань, доставка в хмарне сховище, створення ескізів і прев’ю.
Рішення
Уніфікована аудіо/відео лінія, автоматичне виявлення формату, багатомовна транскрипція, конвертація сценарію з діакритиками, розбиття за паузами, збирання часових позначок, перевірка релігійних посилань, динамічний вибір моделей ШІ.
Технології
Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM-інстанси, HLS (m3u8), асинхронний Python, пул підключень, CI/CD пайплайн.
Виклики
Процес
Кожен файл — чи то сирий аудіозапис лекції, чи повний відеозапис — проходить через одну автоматизовану лінію. Вісім послідовних етапів переводять його від необробленого вхідного сигналу до готового для публікації результату, при цьому обробка відео працює паралельно, тож нічого не затримується.
Виявлення медіа і підготовка
FFprobe визначає, чи є файл аудіо або відео. Для відео автоматично витягується аудіодоріжка. Аналіз тривалості та формату потім визначає стратегію обробки.
Розбиття аудіо за тишею
Файли довші за 20 хвилин розбиваються на шматки в природних точках тиші, щоб жодна фраза не обривалась посеред речення, дозволяючи одночасно транскрибувати всі частини паралельно.
Транскрипція ШІ
Кожен шматок надсилається до Gemini Pro або Flash — вибираються залежно від довжини контенту — зі структурованою схемою, що змушує модель повертати текст із часовими позначками та позначками спікерів.
Об’єднання часової лінії
Всі транскрибовані частини зшиваються назад з правильними часовими зсувами в один безшовний документ із 99% точною синхронізацією часових позначок по всьому запису.
Постобробка тексту
Сирий транскрипт проходить конвертацію сценарію, нанесення діакритиків, очищення форматування та перевірку посилань на релігійні джерела за зовнішньою базою даних.
Обробка відео (паралельно)
Поки триває транскрипція, відеомодуль займається багатобітрейтовим кодуванням HLS, генерацією ескізів, створенням прев’ю кліпів та обробкою багатодоріжкового аудіо через FFmpeg.
Генерація субтитрів та резюме
Із фінального перевіреного тексту генеруються файли субтитрів з часовими позначками (.vtt / .srt) разом з автоматичним метаданим резюме для бібліотеки контенту.
Доставка в хмару
Все — транскрипти, субтитри, резюме, HLS-потоки — завантажується в AWS S3 з доставкою посилань команді контенту. 100% збереження даних навіть при розривах з’єднання.
Рішення
Ключові особливості рішення
Уніфікований аудіо- та відеопотік — FFprobe автоматично визначає формати. Один вхідний пункт обробляє MP4, MKV, WebM, MOV і аудіо без ручного конвертування.
Багатомовна AI-транскрипція — Обробляє записи англійською, арамейською та змішаними мовами з підказками, які зберігають мовні межі та застосовують правильні скриптові конвенції.
Динамічний вибір AI-моделі — Рівні Pro, Flash і Flash-Lite вибираються автоматично залежно від тривалості файлу та типу контенту — максимізуючи точність і мінімізуючи витрати API.
HLS потокове мовлення з мульти-бітрейтом — Паралельна обробка відео створює адаптивні потоки бітрейту, мініатюри та прев’ю-кліпи, готові для будь-якого сучасного відеопрогравача.
300+ одночасних пакетних завдань — Асиметрична архітектура Kubernetes натурально обробляє великі пакети без блокувань. Helm-чарти керують розгортанням та масштабуванням на ARM-інстансах.
Результати в цифрах
99%
Точність для англійського та арамейського аудіоконтенту з автоматичним застосуванням правильної писемності та діакритик.
300+
Транскрипційні завдання обробляються одночасно зі смарт-менеджментом черги і адаптивним відступом.
60%
Заощадження завдяки динамічному вибору моделей — легші моделі автоматично обробляють коротший контент.
100%
Відсутність втрат даних навіть під час обривів підключення з автоматичною синхронізацією при відновленні з'єднання.