Бизнесте маңызды ақпараттың үлкен бөлігі ауызша беріледі. Стратегиялық талқылаулар қоңыраулар барысында өтеді, шешімдер кездесу бөлмелерінде қабылданады, ал сарапшылардың білімі конференциялар мен вебинарларда дауыстап айтылады. Ал егер ақпарат мәтінге түсірілмесе, оның едәуір бөлігі уақыт өте жоғалады немесе бұрмаланады. Біреу планшетке дұрыс жазба жасамай, оның нені білдіретінін ұмытып қалады, біреу маңызды деректері бар блокнотын жоғалтады.
Осылайша, аудио немесе видеоны қолмен транскрибациялау қажеттілігі туындайды. Бірақ бұл процесс сағаттарға созылуы мүмкін. Ал кездесулерді жүйелі түрде өткізетін компаниялар үшін мұндай қажеттілік тез арада тұрақты жүктемеге айналады.
Аудионы мәтінге транскрибациялайтын ЖИ бұл мәселені технологиялық тұрғыдан шешеді. GPTunneL-де қолжетімді Whisper модельдері аудио немесе видеоны бірнеше минут ішінде мәтінге түрлендіреді. Қызмет күрделі баптаусыз немесе арнайы интеграцияларсыз қолжетімді.
Whisper дегеніміз не және аудионы мәтінге таситын нейрожелі қалай жұмыс істейді
Whisper – сөйлеуді автоматты тану (Automatic Speech Recognition, ASR) саласына маманданған модельдер класы. Бұл нейрожелілер желісін OpenAI компаниясы 2022 жылы әзірлеп, жариялады.
Модель ашық бастапқы кодпен ұсынылады, сол себепті Whisper ең кең таралған open-source транскрибация технологияларының біріне айналды.
Аудионы мәтінге таситын бұл нейрожелі жазба сапасы, акценттер мен фондық шуы әртүрлі шамамен 680 000 сағат көптілді аудиода оқытылды. Мұндай кешенді оқыту тек «таза» студиялық жазбаларды ғана емес, сонымен қатар:
- бизнес-қоңырауларды;
- конференцияларды;
- вебинарларды;
- сұхбаттарды;
- жиналыстарды
да транскрибациялауға мүмкіндік береді.
Нейрожелі аудионы мәтінге қалай аударады
Whisper Transformer encoder–decoder архитектурасына негізделген.
Процесс мынадай:
- Аудио 30 секундтық фрагменттерге бөлінеді.
- Сигнал спектрограммаға түрленеді.
- Аудионы мәтінге транскрибациялайтын қызмет спектрограмманы талдап, мәтінді кезең-кезеңімен генерациялайды.
Егер ЖИ видеомен жұмыс істесе, ол автоматты түрде аудио жолағын бөліп алып, оны сипатталған алгоритм арқылы өткізеді.
Қолдау көрсетілетін форматтар
Whisper көптеген кең таралған аудио және видео форматтарды қолдайды. GPTunneL-де транскрибация әдетте корпоративтік ортада жиі қолданылатын файлдармен жұмыс істейді.
Аудио:
- WAV;
- MP3;
- OGG / OGA;
- FLAC;
- M4A.
Видео:
- MP4;
- WEBM;
- OGV;
- MOV (аудио жолағы болса).
Форматтардың сан алуандығы мыналарды жүктеуге мүмкіндік береді:
- Zoom және Google Meet жазбаларын;
- вебинарларды;
- сұхбаттарды;
- оқыту видеоларын;
- дауыстық хабарламаларды;
- мұрағат жазбаларын.
Whisper не істейді және не істемейді
Whisper-дің міндеті – аудионы мәтінге транскрибациялау. Дегенмен ол:
- мазмұнды қысқартпайды;
- мағынасын талдамайды;
- стилін өңдемейді;
- материалды құрылымдамайды.
ЖИ арқылы аудионы мәтінге транскрибациялау – бұл ауызша берілген ақпаратты тек негізгі деңгейде тіркеу ғана. Негізгі мәтінді алғаннан кейін компаниялар деректерді талдау, хаттама дайындау немесе қоңырау не конференция мазмұнын жариялау үшін басқа құралдарды пайдалана алады.
GPTunneL-де бұл технология әртүрлі дәлдік деңгейіндегі Whisper модельдерін таңдау арқылы қолжетімді. Таңдау транскрибацияны нақты бизнес-сценарийлерге бейімдеуге мүмкіндік береді – жедел жоба нұсқаларынан бастап келіссөздерді дәл тіркеуге дейін.
GPTunneL-дегі Whisper модельдерінің айырмашылығы: Tiny, Medium және Large
GPTunneL-де Whisper-дің үш нұсқасы – Tiny, Medium және Large – қолжетімді. Әрқайсысы аудионы мәтінге транскрибациялау мүмкіндігін ұсынады. Нұсқалар арасындағы айырмашылық модельдің көлемінде, есептеу талаптарында және тану дәлдігінің әдеттегі деңгейінде.
Модельдер желісі туралы ресми мәліметтерді OpenAI Whisper техникалық есебінде және жобаның ашық репозиторийінде жариялады.
- Whisper Technical Report (OpenAI): https://cdn.openai.com/papers/whisper.pdf
- openai/whisper ресми репозиторийі: https://github.com/openai/whisper
Жарияланған салыстырмалы кестелермен расталған негізгі принцип: модель неғұрлым үлкен болса, соғұрлым қателер көрсеткіші (WER) төмен, ал есептеу жүктемесі жоғары болады.
WER дегеніміз не және ол неге маңызды
Сөйлеуді тану жүйелерінің сапасы WER (Word Error Rate) метрикасы арқылы бағаланады. WER алынған мәтіннің эталондық адами транскрипциядан қаншалықты ерекшеленетінін көрсетеді. Метрика 3 түрлі қатені ескереді:
- сөздердің ауыстырылуы (Substitutions);
- сөздердің түсіп қалуы (Deletions);
- артық қосымшалар (Insertions).
Есептеу формуласы:
WER = (S + D + I) / N,
мұндағы N – эталондық мәтіндегі сөздер саны.
WER неғұрлым төмен болса, транскрипция бастапқы файлдағы сөйлеуге соғұрлым жақын болады.
Бұл өлшемнен бизнес үшін қарапайым логика туындайды: модель таңдағанда қандай бұрмалану тәуекеліне дайын екеніңізді ескеру керек.
Whisper Tiny
- Шамамен көлемі: ~39 млн параметр.
- Ең аз есептеу жүктемесі.
- Ең жоғары өңдеу жылдамдығы.
Tiny – модельдің ең жеңіл нұсқасы. Ресми салыстырмалы кестелерде ол басқа модельдермен салыстырғанда жоғарырақ WER көрсетеді.
Жылдамдық маңызды болса, ресурстар шектеулі болса, ал дәлдік шешуші емес болса, аудио мен видеоны мәтінге транскрибациялау үшін дәл осы модель оңтайлы.
Whisper Medium
- Шамамен көлемі: ~769 млн параметр.
- Tiny-мен салыстырғанда WER айтарлықтай төмен.
- Орташа есептеу жүктемесі.
Medium аралық позицияда тұрады және сөйлеуді мәтінге әлдеқайда тұрақты түрлендіруді ұсынады. Ресми бенчмарктерде Tiny-мен салыстырғанда WER-нің төмендеуі жүйелі және қайталанатын сипатта.
Көптеген корпоративтік сценарийлер үшін Medium жылдамдық пен дәлдіктің алтын ортасы болып табылады.
Whisper Large
- Шамамен көлемі: ~1,55 млрд параметр.
- Стандартты нұсқалар арасында ең төмен WER.
- Ең жоғары есептеу жүктемесі.
Large – желідегі ең үлкен өнім. OpenAI жариялаған нәтижелерге сәйкес, дәл осы модель көптілді деректер мен күрделі аудио жазбаларда ең жақсы дәлдік көрсеткіштерін көрсетеді.
GPTunneL-де Large нұсқасы қосымша тілді қолмен таңдауға мүмкіндік береді, бұл шетел тілінде сөйлеумен жұмыс істегенде тануды тұрақтырақ ете алады.
Бизнес үшін тәжірибелік қорытынды
Үш модель де аудионы мәтінге онлайн транскрибациялауға жарамды. Айырмашылық тек әр модельдің қателерге қаншалықты төзімді екенінде және қандай жылдамдықпен жұмыс істейтінінде:
- Tiny – жылдамдыққа басымдық;
- Medium – сапа мен ресурс үнемдеудің жұмыс балансы;
- Large – қателерді барынша азайтуға басымдық (WER төмендеуі).
Нақты аудио- және видеофайлдарда транскрибацияны көрсету
Ескертпе: Құралдың жұмысын көрсету үшін еркін лицензиялар бойынша таратылатын Wikimedia Commons ашық мұрағатының файлдары пайдаланылды. Бұл авторлық құқықты, корпоративтік этиканы және коммерциялық материалдарда контентті пайдалану талаптарын бұзбай транскрибация принциптерін көрсетуге мүмкіндік береді.
1-кейс – Орыс поэзиясы (WAV)
Файл: «Я помню чудное мгновенье» Модель: Whisper-Medium
Транскрибацияны GPTunneL-де іске қосудан бұрын интерфейсте файлды өңдеу құны бірден көрсетіледі (жазба минутына есептеледі).

Бұл бизнес үшін маңызды деталь: кездесулерді немесе мұрағаттарды жаппай өңдеуге арналған бюджетті жасырын шығындарсыз және күтпеген есептен шығарусыз алдын ала бағалауға болады.
Не тестелді:
- әдеби лексика;
- интонациялық оқу;
- анық дикция.
Жазба сапасы жақсы болғанда Medium моделі тілді дұрыс анықтап, орысша транскрипция береді деп күттік. Бірақ тест басқаша өтті.
Не болды
Whisper-Medium жазба тілін қате анықтап, түпнұсқа файл орыс поэзиясы болса да, испан тілінде мәтін жасады.

Бұл маңызды тәжірибелік нәрсе: тілді автоматты анықтау анық дикция мен классикалық мәтінде де 100% дұрыстықты кепілдендірмейді.
Нәтижесінде біз сол файлда тестті қайталауды шештік, бірақ:
- басқа модельді пайдаланып;
- тілді қолмен таңдап.
Мұндай тәсіл автоматты анықтаумен байланысты қате тәуекелін азайтуға және Whisper-дің әртүрлі нұсқаларының жұмысын бірдей жағдайда дұрыс бағалауға мүмкіндік береді.
Сол файлда қайта тест – Whisper Tiny
Файл: «Я помню чудное мгновенье» Модель: Whisper-Tiny
Medium нұсқасы тілді қате анықтағаннан кейін, біз сол WAV-файлда транскрибацияны модельдің ең компакт нұсқасы – Whisper-Tiny арқылы қайталадық.
Бұл жолы тіл дұрыс анықталды: модель орысша транскрипция берді. Өңдеу 1 минут 27 секундқа созылды, бұл Tiny-дің басым артықшылығына – жылдамдыққа сәйкес келеді.
Дегенмен мәтінді талдағанда тану дәлдігі үлкенірек нұсқалардан төмен екені байқалды.
Транскрипциядағы нақты қателер:

Скриншотта бірнеше түрлі бұрмалану көрінеді.
Тұрақты тіркестердің бұрмалануы
Түпнұсқа жол:
- Я помню чудное мгновенье
Мәтінде:
- я помню чудное мгновение передо мной явилось
«Мгновенье» сөзі «мгновение» болып өзгертілген – бұл формальды түрде рұқсат етілген түр, бірақ бұл түпнұсқа мәтіннен ауытқу. Әдеби шығарма үшін бұл маңызды.
Семантикалық бұрмалану
Түпнұсқа:
- Как мимолётное виденье
Мәтінде:
- как мимолётное ведение
«Виденье» → «ведение» – бұл жай орфографиялық қате емес, мағынаның өзгеруі.
Түпнұсқа:
- Как гений чистой красоты
Мәтінде:
- как гений чистой красоты, в томлении груз тебя знойный
«В томлении грусти безнадежной» тіркесі былай танылған:
- в томлении груз тебя знойный
Мұнда бірнеше бұрмалану бар:
- «грусти» → «груз»;
- «безнадежной» → «тебя знойный».
Бұл ASR-дің үйінді қатесіне тән мысал: модель сөйлемді фонетикалық ұқсастыққа сүйеніп «толықтырады».
Бас әріптер мен тыныс белгілерінің жоғалуы
Есім:
- Александр Сергеевич Пушкин
Мәтінде:
- Александр Сергеевич Пушкин, я помню чудное мгновение
Бас әріптер жартылай сақталған, бірақ одан кейін тыныс белгілері ретсіз болып кетеді.
Негізгі сөздердің бұрмалануы
Түпнұсқа:
- Без божества, без вдохновенья, Без слёз, без жизни, без любви.
Мәтінде:
- без Божества, без дыхновения, без Слёз, без Жизни, без Любви
Қателер:
- «вдохновенья» → «дыхновения»;
- бас әріптерді ретсіз пайдалану;
- сөз түрлерінің өзгеруі.
Үзінді қосымшалар
Соңында мыналар қосылған:
ДИНАМИЧНАЯ МУЗЫКА
Бұл аудио оқиғасын дұрыс тіркеу, бірақ шығарма мәтінін қалпына келтіру мақсаты болса, әдеби транскрипция үшін артық элемент болуы мүмкін.
Tiny бойынша қорытынды
Whisper-Tiny:
- тілді дұрыс анықтады;
- файлды жылдам өңдеді;
- құрылымдалған мәтін ұсынды.
Дегенмен фонетикалық алмастырулар, семантика және сөз түрлерінің өзгеруі бойынша «күнә жасады».
Сөйлеудің жоба нұсқасын тіркеу үшін модель толықтай жарамды. Дәлдігі жоғарырақ міндеттермен үлкенірек аналог немесе адам-транскрибатор жақсырақ жұмыс істейді.
Сол файлда Whisper-Large тесті
Файл: «Я помню чудное мгновенье» Модель: Whisper-Large Тіл: қолмен таңдалды (орыс) Өңдеу уақыты: 31 секунд
Тілді қолмен таңдап қайта тестілеуден кейін Large моделі айтарлықтай тұрақты жұмыс істеді. Тіл дұрыс анықталды (қолмен орнатылғандықтан), ал соңғы транскрипция мағынасы бойынша түпнұсқа мәтінмен дерлік толық сәйкес келді.

Нейрожелі нені дұрыс таныды:
- Өлеңнің құрылымын: ЖИ жолдардың ретін және мәтіннің логикасын сақтады.
- Негізгі әдеби конструкцияларды: «Как мимолётное виденье», «Как гений чистой красоты», «В томлениях грусти безнадёжной», «В тревогах шумной суеты». Бұл тіркестердің барлығы мағыналық бұрмалаусыз берілді.
- Күрделі сөз түрлерін: «без божества», «без вдохновенья», «в упоенье». Фонетикалық алмастырулар кездескен Tiny-ден («дыхновения» орнына «вдохновенья») айырмашылығы, Large лексиканы дұрыс жеткізеді.
- Семантикалық тұтастықты: сөйлемдер тұтас көркем мәтін ретінде оқылады, мағына ешбір жерде «ауытқыған» жоқ.
Қай жерде дәлсіздіктер туындады
Дәлдіктің жоғары деңгейіне қарамастан, транскрипцияны толықтай мінсіз деп атауға болмайды.
Орфографиялық нюанс
Мәтінде мынау кездеседі:
«В томлениях грусти безнадёжной»
Өлеңнің классикалық редакциясында мына түр қолданылады:
«В томленьях грусти безнадежной»
Айырмашылық мағыналық емес, бірақ бұл әдеби канондық түрден ауытқу.
Тыныс белгілері
Модель мәтінді жолдар мен шумақтардың тыныс белгілерінсіз дерлік жеткізеді. Көркем шығармада бұл рәсімдеу дәлдігін төмендетеді, сол себепті мағына да зардап шегеді.
Соңындағы бөгде қосымша
Соңында мына жол пайда болады:
«С вами был Игорь Негода. Пока!»
Бұл Пушкиннің түпнұсқа мәтініне мүлдем қатысы жоқ және, ықтимал, аудиожазбада қосымша реплика ретінде бар. Модель айтылған мәтінді дұрыс таныды, бірақ әдеби транскрипция тұрғысынан бұл артық үзінді.
Whisper-Large бойынша қорытынды
- Тіл қолмен таңдалды, демек модель оны қате анықтау тәуекелі жойылды.
- Күрделі әдеби лексика дұрыс шешілді.
- Өңдеу уақыты – 31 с, бұл, кем дегенде осы тест үшін, Tiny-мен салыстырғанда жылдамырақ.
Мәтін сапасы тұрғысынан Large ең тұрақты нәтижені көрсетеді. Егер міндет – мағыналық бұрмалаусыз сөйлеуді дәл тіркеу болса, дәл осы модель нұсқасы ең болжамды болып табылады.
Видеоны транскрибациялау: бизнеске бұл не үшін керек
Видео – корпоративтік қарым-қатынастың ең заманауи және кең таралған форматы:
- вебинарлар;
- онлайн-конференциялар;
- оқыту курстары;
- кездесулердің жазбалары;
- инвесторларға арналған презентациялар.
Бірақ мәтіндік нұсқасы болмаса, видео «қараңғы мұрағат аты» болып қала береді, өйткені оны талдау, дәйексөз ретінде келтіру немесе басқа жерде қайта пайдалану қиын.
Транскрибация видеоны жұмыс құжатына айналдырады. Компания мынадай мәтін алады:
- жылдам қарап шығуға;
- негізгі сөздер бойынша ақпарат іздеуге;
- есептер мен хаттамаларды дайындауға пайдалануға;
- кейстерге, мақалалар мен жарияланымдарға айналдыруға;
- сайт үшін субтитрлер мен мәтіндік нұсқалар жасауға;
- келісімдермен байланысты дәлел базасы ретінде сақтауға болатын.
Осылайша, бизнес аз ақпарат жоғалтады, ал процестер анағұрлым мөлдір және бақыланатын болады.
2-кейс – Видеосұхбат (WEBM)
Файл: Depoimento de enfermeira (португал тілі) Модель: Whisper-Medium
Мүмкін фондық шуы бар нақты сұхбат форматындағы шетел тіліндегі сөйлеу тестелді.
Medium моделі тағы да тілді қате анықтады. Португалша транскрипция орнына жүйе орыс тілінде мәтін берді. Бұл ретте нәтиже машиналық қайта баяндау сияқты көрінді: сөйлем құрылымы бұзылған, мағына ішінара жоғалған, кейбір тұжырымдар түпнұсқа сөйлеуге сәйкес келмейді.
Мәні бойынша, оны оқып сұхбат мазмұны туралы тек болжам жасауға болатын мәтін шыққан.

Қорытынды: шетелдік видеомен жұмыс істегенде тек тілді автоматты анықтауға сену тәуекелді – әсіресе тұжырымдардың дәлдігі маңызды бизнес-контексте.
Whisper-Tiny-де қайта іске қосу
Файл: Depoimento de enfermeira (WEBM, португал тілі) Модель: Whisper-Tiny
Сол видеоны Tiny арқылы қайта өңдеу әрекеті нақты сәтсіздікпен аяқталды. Модель толыққанды транскрипция бермеді: нәтиже болмады.

Бұл шетелдік ауызекі сөйлеу және мүмкін фон бар видеофайл екенін ескерсек, бұл модельдің ең компакт нұсқасы үшін күтілетін жағдай. Tiny минималды есептеу ресурстарына бағдарланған және күрделі көптілді сценарийлерге арналмаған.
Тәжірибелік қорытынды: шетел тіліндегі видеосұхбат үшін Tiny сенімді нұсқа емес. Мұндай міндеттерде тұрақтырақ модель және тілді қолмен таңдау қажет.
Whisper-Large тесті (тілді автоматты анықтау)
Файл: Depoimento de enfermeira (WEBM, португал тілі) Модель: Whisper-Large Тіл: автоанықтау
Medium мен Tiny-ден айырмашылығы, Large нұсқасы тілді автоматты таңдағанда португал тіліндегі сөйлеуді дұрыс танып, транскрипцияны түпнұсқа тілде берді.

Не дұрыс танылды
- Сұхбаттың жалпы құрылымы сақталған.
- Лексика португал түпнұсқасына сәйкес келеді.
- Негізгі мағыналық элементтер барабар жеткізілген: дәрігерлердің ауысу мәселесі, локацияға қол жеткізудің қиындығы, инфрақұрылымның болмауы (мейрамханалар, тұрақтар), медперсонал бірлігіне түсетін жоғары жүктеме, шамамен 15 000 адам тұратын халық.
Мәтін логикалық түрде, басқа тілге көшпей және айқын «аудару» әрекетінсіз оқылады.
Анықталған дәлсіздіктер
Жалпы дұрыстығына қарамастан, ASR-тануға тән әдеттегі нюанстар кездеседі:
- Тыныс белгілері тұрақсыз: кей жерде сөйлемдер ауызша кідірістің логикасына қайшы келіп қосылып немесе бөлініп кетеді.
- Қайталаулар мен ауызекі оралымдар: os médicos, eles vinham сияқты тіркестер тірі ауызекі сөйлеуді бейнелейді – модель оларды стилистикалық түзетусіз, сөзбе-сөз жеткізеді.
- Сандық рәсімдеу: 15 1000 pessoas – сандық конструкцияны жеткізудегі ықтимал қате. Сірә, сөз 15 000 pessoas туралы болған. Сандар мен сандық тұжырымдар – ЖИ-транскрибация үшін тәуекел аймағы.
Тәжірибелік қорытынды
Whisper-Large:
- тілді автоматты түрде дұрыс таныды;
- сұхбаттың мағынасын сақтады;
- қателер – жүйелі емес, нүктелі: тыныс белгілері, сандар.
Шетел тіліндегі видеосұхбат үшін Large, әсіресе тілді автоматты анықтау қосылған кезде, Medium мен Tiny-мен салыстырғанда әлдеқайда болжамды нәтиже көрсетеді.
Маңызды шектеулер
Транскрибация дәлдігі тек модельге ғана емес, аудио немесе видео жазылған жағдайларға да байланысты.
Егер қатысушылар бір-бірінің сөзін бөлсе, бір мезгілде сөйлесе, тақырыптан тақырыпқа секірсе, қателер тәуекелі артады. Фондық шу, әлсіз микрофон және бұрмаланған байланыс та тану сапасына тікелей әсер етеді.
Whisper сөйлеуді сөзбе-сөз тіркейді. Ол стильді өңдемейді, қайталауларды жоймайды, синтаксисті теңестірмейді және мәтінді әдеби нормаға бейімдемейді. Кідірістері, ауызекі оралымдары мен аяқталмаған сөйлемдері бар ауызекі сөйлеу түпнұсқада қалай естілсе, солай беріледі.
Сондықтан транскрибациядан кейін мәтінге әдетте қосымша өңдеу қажет болады: стилистикалық түзету, құрылымдау, талдау.
Қорытынды
Whisper – аудионы қазақ, орыс және басқа тілдерде мәтінге транскрибациялауға арналған ыңғайлы құрал.
GPTunneL ортасында транскрибация жүйелі процестің бөлігіне айналады. Кездесу жазбасы талдауға, мұрағаттауға, есептер мен құжаттамада пайдалануға болатын мәтіндік активке айналады, оның ішінде суперқосымшада қолжетімді әртүрлі ЖИ-қызметтердің көмегімен де.
Файлды GPTunneL-ге жүктеп, Whisper моделін таңдаңыз және бірнеше минут ішінде мәтін алыңыз.
Демонстрацияға арналған материалдар
1. MaisMédicos - Depoimento de enfermeira sobre o Programa Mais Médicos.webm
Видео “#MaisMédicos | Depoimento de enfermeira sobre o Programa Mais Médicos”
Автор: Ministério da Saúde
Лицензия: Creative Commons Attribution 3.0 Unported (CC BY 3.0)
https://creativecommons.org/licenses/by/3.0/
Транскрипцияны редакция орындады. Түпнұсқа CC BY 3.0 лицензиясы бойынша қолжетімді.
2. «Я помню чудное мгновенье» (читает Eniisi Lisika).wav
Шығарма: «Я помню чудное мгновенье» (оқыған Eniisi Lisika)
Орындаушы: Eniisi Lisika
Лицензия: Creative Commons Attribution-ShareAlike 4.0 International (CC BY-SA 4.0)
https://creativecommons.org/licenses/by-sa/4.0/
Материал өзгертулермен пайдаланылды (транскрипция орындалды).
