Vertex transkribeerimisteenus
Juhtumi ülevaade
Tehisintellektil põhinev meedia töötlemise platvorm, mis on loodud töötlema miljoneid minuteid heli- ja videomaterjali. See võtab aramea ja inglise keeles õpetusloengute salvestusi ning teisendab need puhastatud, vormindatud tekstiks koos korrektsete skriptide, diakriitiliste märkide, kinnitatud viidetega ja ajatatud subtiitritega. Kui video fail saabub, tuvastab süsteem selle automaatselt, eraldab heliraja ja juhib selle samasse transkribeerimisvoogu.
Eesmärk: Luua meediavoog, mis suudab töödelda miljoneid minuteid materjali ja pakkuda avaldamiseks valmis teksti, subtiitreid ja HLS-vooge - võimalikult vähe käsitööga. Töötleda nii heli kui videot ühest voost, transkribeerida mitmekeelset sisu suure täpsusega ning skaleerida dünaamiliselt Kubernetesil, et mahutada üle 300 samaaegse salvestuse.
Projekti põhiteave
Tööstusharud
Haridusplatvormid, usulised institutsioonid, meediaväljaanded, e-õppe ettevõtted, loengute arhiivid, akadeemilised sisukogud.
Teenused
Tehisintellekti transkriptsioon, videote töötlemine, heli eraldamine, HLS mitme bitikiiruse kodeerimine, subtiitrite genereerimine, partiide haldamine, allikaviidete kontroll, pilvesalvestuse tarnimine, pisipiltide ja eelvaadete loomine.
Lahendused
Ühtne heli- ja videotöötluse voog, automaatne formaadi tuvastus, mitmekeelne transkriptsioon, skripti teisendus koos diakriitikutega, vaikusepõhine failide jaotus, ajatemplite ühendamine, usuliste viidete kinnitamine, dünaamiline tehisintellekti mudelite valik.
Tehnoloogiad
Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM instantsid, HLS (m3u8), asünkroonne Python, ühenduste haldus, CI/CD vooautomaatika.
Väljakutsed
Protsess
Iga fail – olgu see toores heliloeng või terve videosalvestis – liigub läbi ühe automatiseeritud torujuhtme. Kaheksa järjestikust etappi viivad selle toormaterjalist avaldamiseks valmis väljundini, videote töötlemine toimub paralleelselt, nii et miski ei oota midagi.
Meedia tuvastamine ja ettevalmistus
FFprobe tuvastab, kas fail on heli- või videofail. Video puhul eraldatakse helirada automaatselt. Kestuse ja formaadi analüüs määrab töötlemise strateegia.
Vaikusepõhine helifailide jagamine
Üle 20 minuti kestvad failid jagatakse loomulikul vaikusehetkel osadeks, et ükski fraas ei katkeks poole lause peal, võimaldades kõikide osade paralleelset transkribeerimist.
Tehisintellekti transkriptsioon
Iga osa saadetakse Gemini Pro või Flash mudelile – valik sõltub sisu pikkusest – struktureeritud skeemiga, mis nõuab mudelilt ajatempliga teksti esitamist koos kõneleja siltidega.
Ajatelgede ühendamine
Kõik transkribeeritud osad liidetakse korrektselt ajatemplitelt kalibreerituna ühte sujuvasse dokumendisse, saavutades 99% täpsuse kogu salvestuse vältel.
Teksti järelkäsitlus
Tooresskriptsioon läbib skripti teisenduse, diakriitilise märgistuse lisamise, vorminduse korrastamise ja usuliste viidete kontrolli välishõivangu andmebaasist.
Videote töötlemine (paralleelselt)
Transkriptsiooni ajal tegeleb videomoodul HLS mitme bitikiiruse kodeerimise, pisipiltide loomise, eelvaateklippide genereerimise ja FFmpeg'i abil mitme helivoo töötlemisega.
Subtiitrid ja kokkuvõtte genereerimine
Lõplikust kinnitatud tekstist luuakse ajatatud subtiitrite failid (.vtt / .srt) koos automaatse meataandmete kokkuvõttega sisukogule.
Pilve kaudu tarnimine
Kõik – transkriptsioon, subtiitrid, kokkuvõte, HLS vood – laaditakse üles AWS S3-sse ja lingid edastatakse sisutiimile. Andmete säilimine 100%, ka ühenduse katkemise korral.
Lahendused
Lahenduse põhifunktsioonid
Ühtne heli- ja videovoo — FFprobe tuvastab automaatselt vormingud. Üks sisendpunkt töötleb MP4, MKV, WebM, MOV ja heli ilma käsitsi teisendamiseta.
Mitmekeelne tehisintellekti transkriptsioon — Töötleb inglise, aramea ja segakeelseid salvestisi, säilitades keelipiirid ja rakendades õigeid kirjakonventsioone.
Dünaamiline tehisintellekti mudeli valik — Pro, Flash ja Flash-Lite tasemed valitakse automaatselt faili pikkuse ja sisu tüübi järgi — maksimeerides täpsust ja minimeerides API kulutusi.
HLS mitme bitikiiruse voogesitus — Paralleelne videotöötlus genereerib adaptiivseid bitikiiruse vooge, pisipilte ja eelvaateklippe, mis sobivad igale kaasaegsele videopleierile.
300+ samaaegset partiitööd — Kubernetesi-põhine asünkroonne arhitektuur haldab suuri partiisid ilma blokeerimiseta. Helm-kleebised haldavad juurutamist ja skaleerimist ARM-i instantsidel.
Tulemused numbrites
99%
Täpsus inglise ja aramea keele helisisu jaoks, kus rakendatakse automaatselt õiget kirjakujundust ja diakriitikuid.
300+
Transkriptsioonitööd töödeldakse samaaegselt nutika järjekorrapõhise halduse ja adaptiivse tagasivõtuga.
60%
Säästud tänu dünaamilisele mudelivalikule — kergemad mudelid töötlevad automaatselt lühemaid sisu.
100%
Andmekadu puudub isegi ühenduse katkemise korral, automaatse sünkroonimisega ühenduse taastamisel.