Сервіс транскрибування Vertex

Огляд кейсу

Платформа обробки медіа на базі ШІ, розроблена для роботи з мільйонами хвилин аудіо- та відеоконтенту. Вона приймає записи освітніх лекцій — арамейською та англійською — і перетворює їх у чистий, відформатований текст з правильним сценарієм, діакритиками, перевіреними посиланнями та синхронізованими субтитрами. Коли надходить відеофайл, система автоматично його виявляє, витягує аудіодоріжку і пропускає через одну й ту ж транскрипційну лінію.

Мета: Створити медіалінію, здатну обробляти мільйони хвилин контенту та доставляти текст, субтитри та HLS-потоки, готові для публікації — з мінімальною участю вручну. Обробляти одночасно звук і відео в одній лінії, транскрибувати багатомовний контент з високою точністю та динамічно масштабуватися на Kubernetes для роботи з пакетами з понад 300 одночасних записів.

Image

Ключова інформація про проєкт

Галузі

Галузі

Платформи освітнього контенту, релігійні установи, медіавидавництво, компанії електронного навчання, архіви лекцій, бібліотеки академічного контенту.

Послуги

Послуги

Транскрипція на базі ШІ, обробка відео, витяг аудіо, багатобітрейтове кодування HLS, генерація субтитрів, пакетна оркестрація, перевірка джерел посилань, доставка в хмарне сховище, створення ескізів і прев’ю.

Рішення

Рішення

Уніфікована аудіо/відео лінія, автоматичне виявлення формату, багатомовна транскрипція, конвертація сценарію з діакритиками, розбиття за паузами, збирання часових позначок, перевірка релігійних посилань, динамічний вибір моделей ШІ.

Технології

Технології

Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM-інстанси, HLS (m3u8), асинхронний Python, пул підключень, CI/CD пайплайн.

Виклики

Складність змішаних мов

Складність змішаних мов

Аудіо перемикається між арамейською, англійською та іншими мовами під час запису. Потрібні були особливі AI-підказки та багатокрокова обробка тексту для правильного застосування діакритиків і форматування.

Відео й аудіо в одній лінії

Відео й аудіо в одній лінії

Система повинна була обробляти і чисте аудіо, і відеоконтейнери. Автовиявлення на основі FFprobe витягує аудіопотік з будь-якого відеоформату перед обробкою — без втручання користувача.

Масштабування на мільйони хвилин

Масштабування на мільйони хвилин

Спроєктовано з нуля для великих обсягів: повністю асинхронний, паралелізований та нативний для Kubernetes з правильним управлінням ресурсами для поглинання стрибків навантаження.

Розумне розбиття для довгого аудіо лекцій

Розумне розбиття для довгого аудіо лекцій

Лекції часто тривають більше години. Розбиття на фрагменти за виявленням тиші відбувається природно, тоді як збирання часових позначок реконструює безперервну послідовну хронологію без пропусків чи накладень.

Розумна система повторних спроб для навантажень ШІ

Розумна система повторних спроб для навантажень ШІ

Сотні одночасних AI-завдань сильно навантажують провайдера. Розумна логіка повторних спроб, адаптивне експоненційне збільшення таймаутів та управління чергою підтримують лінію в русі без втрати завдань.

Вибір моделі ШІ для ефективності витрат

Вибір моделі ШІ для ефективності витрат

Три рівні моделей ШІ — потужна, швидка та легка — вибираються динамічно залежно від довжини та складності контенту, що дозволяє знизити витрати на API до 60% на короткому контенті.

Процес

Кожен файл — чи то сирий аудіозапис лекції, чи повний відеозапис — проходить через одну автоматизовану лінію. Вісім послідовних етапів переводять його від необробленого вхідного сигналу до готового для публікації результату, при цьому обробка відео працює паралельно, тож нічого не затримується.

Виявлення медіа і підготовка

Виявлення медіа і підготовка

FFprobe визначає, чи є файл аудіо або відео. Для відео автоматично витягується аудіодоріжка. Аналіз тривалості та формату потім визначає стратегію обробки.

Розбиття аудіо за тишею

Розбиття аудіо за тишею

Файли довші за 20 хвилин розбиваються на шматки в природних точках тиші, щоб жодна фраза не обривалась посеред речення, дозволяючи одночасно транскрибувати всі частини паралельно.

Транскрипція ШІ

Транскрипція ШІ

Кожен шматок надсилається до Gemini Pro або Flash — вибираються залежно від довжини контенту — зі структурованою схемою, що змушує модель повертати текст із часовими позначками та позначками спікерів.

Об’єднання часової лінії

Об’єднання часової лінії

Всі транскрибовані частини зшиваються назад з правильними часовими зсувами в один безшовний документ із 99% точною синхронізацією часових позначок по всьому запису.

Постобробка тексту

Постобробка тексту

Сирий транскрипт проходить конвертацію сценарію, нанесення діакритиків, очищення форматування та перевірку посилань на релігійні джерела за зовнішньою базою даних.

Обробка відео (паралельно)

Обробка відео (паралельно)

Поки триває транскрипція, відеомодуль займається багатобітрейтовим кодуванням HLS, генерацією ескізів, створенням прев’ю кліпів та обробкою багатодоріжкового аудіо через FFmpeg.

Генерація субтитрів та резюме

Генерація субтитрів та резюме

Із фінального перевіреного тексту генеруються файли субтитрів з часовими позначками (.vtt / .srt) разом з автоматичним метаданим резюме для бібліотеки контенту.

Доставка в хмару

Доставка в хмару

Все — транскрипти, субтитри, резюме, HLS-потоки — завантажується в AWS S3 з доставкою посилань команді контенту. 100% збереження даних навіть при розривах з’єднання.

Рішення

Ключові особливості рішення

  • Уніфікований аудіо- та відеопотік FFprobe автоматично визначає формати. Один вхідний пункт обробляє MP4, MKV, WebM, MOV і аудіо без ручного конвертування.

  • Багатомовна AI-транскрипція — Обробляє записи англійською, арамейською та змішаними мовами з підказками, які зберігають мовні межі та застосовують правильні скриптові конвенції.

  • Динамічний вибір AI-моделі — Рівні Pro, Flash і Flash-Lite вибираються автоматично залежно від тривалості файлу та типу контенту — максимізуючи точність і мінімізуючи витрати API.

  • HLS потокове мовлення з мульти-бітрейтом — Паралельна обробка відео створює адаптивні потоки бітрейту, мініатюри та прев’ю-кліпи, готові для будь-якого сучасного відеопрогравача.

  • 300+ одночасних пакетних завдань — Асиметрична архітектура Kubernetes натурально обробляє великі пакети без блокувань. Helm-чарти керують розгортанням та масштабуванням на ARM-інстансах.

Image

Результати в цифрах

Точність транскрипції

99%

Точність для англійського та арамейського аудіоконтенту з автоматичним застосуванням правильної писемності та діакритик.

Одночасні завдання

300+

Транскрипційні завдання обробляються одночасно зі смарт-менеджментом черги і адаптивним відступом.

Нижчі витрати на API

60%

Заощадження завдяки динамічному вибору моделей — легші моделі автоматично обробляють коротший контент.

Збереження даних

100%

Відсутність втрат даних навіть під час обривів підключення з автоматичною синхронізацією при відновленні з'єднання.

Маєте мільйони хвилин для обробки? Давайте створимо конвеєр!

Розкажіть нам про ваше завдання з контентом або запишіться на безкоштовну консультацію — ми розробимо рішення, адаптоване до вашого масштабу, мов і вимог доставки.

Message not sent.
Message not sent.
×
Не знаєте, з чого почати? Ми допоможемо вам окреслити наступні кроки!
Згода на обробку персональних даних
×
Є виклик? Наша команда перетворить його на рішення.
Згода на обробку персональних даних