Нейросеть на узбекском языке — это не один продукт, а три разные задачи: понять и написать текст, распознать голосовое и озвучить ответ. Готовность у них разная.
С текстом большие модели справляются: Google пишет, что все модели Gemini понимают узбекский и отвечают на нём. Про ChatGPT официальных цифр мы не нашли: в открытом многоязычном тесте OpenAI MMMLU 14 языков, и узбекского среди них нет. Узбекскую речь распознают несколько облачных сервисов, но открытые замеры качества есть не у всех. Озвучивают узбекский текст меньше сервисов, чем кажется: в списке голосов Google Cloud и в моделях синтеза ElevenLabs его нет.
Текст: две графики и смешанные фразы
Официальная графика узбекского — латиница. Закон «О введении узбекского алфавита, основанного на латинской графике» принят 2 сентября 1993 года. Нынешний вид алфавит получил в редакции закона от 6 мая 1995 года: 26 букв, три буквосочетания sh, ch, ng и апостроф (lex.uz). Статья 2 того же закона сохраняет условия для кириллицы и арабской графики. Полный переход на латиницу идёт поэтапно, в 2021 году для этого вышло постановление Кабмина № 61.
В переписке это выглядит так. Один клиент пишет «Narxi qancha?», другой — «Нархи қанча?», третий здоровается «Салом!» и дальше спрашивает по-русски. Для бота отсюда три требования.
- Узнавать язык не по алфавиту. Кириллица ещё не значит «русский», латиница — не значит «английский».
- Отвечать в той же графике. Клиент написал кириллицей, а ответ пришёл латиницей — для него это выглядит как ошибка.
- Не спотыкаться об апостроф. В буквах oʻ и gʻ его пишут кто как: знаком ʻ, обычным апострофом, типографской кавычкой, обратной кавычкой — или пропускают совсем. Даже в тексте закона об алфавите на lex.uz стоит обратная кавычка, а в профессиональном переводе FLORES-200, о котором ниже, мы насчитали 2 358 обычных апострофов и всего 8 знаков ʻ.
Скоро вариантов станет больше. 10 сентября 2026 года Сенат одобрил изменения в закон об алфавите: в нём будет 28 букв и один апостроф вместо 26 букв и трёх буквосочетаний («Янги Ўзбекистон»). По данным Gazeta.uz, вместо Sh, Ch, Oʻ и Gʻ предлагаются Ş, Ç, Ö и Ğ. Докладчик, сенатор Одилжон Маматкаримов, объяснял реформу в том числе цифровой средой: по его словам, у Oʻ и Gʻ на практике больше десяти вариантов написания, и программы принимают одно и то же слово за разные.
Закон направлен президенту. На 28 сентября подписанного акта на lex.uz нет, там действует редакция 1995 года. Вывод для бота понятен уже сейчас: пока идёт переход, клиенты будут писать минимум тремя способами — кириллицей, нынешней латиницей и новой. Приводить их к одной внутренней форме лучше заранее, до поиска по каталогу и до определения языка.
Налог на язык: во что узбекский обходится в токенах
Модели читают текст не буквами, а токенами — кусками слов. За токены платят, токенами меряют окно контекста, и ответ модель выдаёт токен за токеном. Слова, которых токенизатор при обучении видел мало, он режет на куски мельче, и тот же смысл занимает больше токенов.
Мы посчитали это на открытом параллельном корпусе FLORES-200 от Meta. В нём одни и те же предложения из 842 веб-статей переведены на 200 языков. Мы взяли часть devtest — 1 012 предложений. Токенизатор — o200k_base: по таблице в библиотеке OpenAI tiktoken его используют GPT-4o, GPT-4.1 и GPT-5 (tiktoken). Какой токенизатор у GPT-6, в этой таблице на 28 сентября 2026 года не указано; если он другой, коэффициенты будут другими.
| Язык | Токенов на 1 012 предложений | К английскому | К русскому |
|---|---|---|---|
| Английский | 26 873 | ×1,00 | ×0,70 |
| Русский | 38 188 | ×1,42 | ×1,00 |
| Турецкий | 38 458 | ×1,43 | ×1,01 |
| Казахский | 42 609 | ×1,59 | ×1,12 |
| Узбекский, латиница | 47 712 | ×1,78 | ×1,25 |
| Таджикский | 50 861 | ×1,89 | ×1,33 |
| Узбекский, кириллица (оценка) | 52 884 | ×1,97 | ×1,38 |
Что из этого следует.
- Тот же текст по-узбекски дороже русского примерно на четверть, а кириллицей — почти на 40%. Цена токена от языка не зависит, поэтому разница в токенах переходит в счёт за модель напрямую. Длинная переписка по-узбекски раньше упирается в окно контекста, и ответ генерируется дольше.
- Новый токенизатор налог сильно снизил. На старом
cl100k_base, который использовали GPT-4 и GPT-3.5, тот же текст выходил дороже английского: русский в 2,46 раза, узбекская латиница в 2,17 раза, кириллица в 3,55 раза. - Похоже, дело не в грамматике. Турецкий — родственный тюркский язык, где слова тоже собираются из цепочки суффиксов, — стоит почти как русский. Вероятная причина разницы — сколько текстов на языке видел токенизатор.
- Вид апострофа почти ничего не меняет. Если заменить обычный апостроф в oʻ и gʻ на знак ʻ, токенов на
o200k_baseприбавляется меньше 0,1%.
На уровне слов разница видна сразу: «call» — 1 токен, «звонок» — 3, «qo’ng’iroq» и «қўнғироқ» — по 5.
Как повторить. Скачайте архив FLORES-200 и возьмите файлы devtest/eng_Latn, rus_Cyrl и uzn_Latn. Установите tiktoken, для каждой строки посчитайте len(enc.encode(line)) с enc = tiktoken.get_encoding("o200k_base") и сложите. На второй части корпуса, dev из 997 предложений, выходит то же самое: узбекская латиница ×1,77 к английскому, русский ×1,43. Узбекской кириллицы во FLORES нет, поэтому мы перевели uzn_Latn в кириллицу автоматически по таблице букв из закона (sh → ш, oʻ → ў, q → қ, h → ҳ и так далее). В живом кириллическом тексте русские заимствования пишутся иначе, так что строка про кириллицу — оценка.
Токенизаторы Gemini и Claude мы не мерили, коэффициенты у них могут быть другими.
Распознавание узбекской речи: кто и насколько хорошо
Часть клиентов не пишет, а наговаривает вопрос голосом. Бот без распознавания речи такие обращения теряет.
Самый известный бесплатный вариант — открытая модель Whisper от OpenAI. В статье её авторов видно, почему на узбекском она слаба. В обучающих данных на распознавание узбекской речи было 0,3 часа, русской — 9 761 час (приложение E, рисунок 11). На тестовом наборе FLEURS модель Whisper large-v2 ошибалась так (приложение D.2.4, таблица 13): узбекский — 90,2% ошибок в словах, таджикский — 85,8%, казахский — 37,7%, турецкий — 8,4%, русский — 5,6%. Метрика WER считает неверные, пропущенные и лишние слова на 100 слов эталонной расшифровки. Цифры относятся к версии large-v2 и одному набору данных. Более новых версий в статье нет, и переносить на них эти проценты нельзя. В своей документации OpenAI пишет коротко: Whisper поддерживает 98 языков, но точность от языка к языку разная.
Что заявляют остальные по официальным спискам языков на сентябрь 2026 года:
- Google Cloud Speech-to-Text. Узбекский (uz-UZ) есть только в моделях Chirp. Автоматическая пунктуация есть, разделения записи по говорящим для узбекского в таблице нет (список языков). Для записей звонков это важно.
- Gemini. Аудио подают модели напрямую, как и текст. По документации секунда звука — 32 токена, минута — 1 920. Голосовое в Telegram, по Bot API, — это OGG с кодеком Opus, MP3 или M4A, и все три формата Gemini принимает. Языки для аудио Google сводит к общему списку моделей Gemini, где узбекский есть. Налога на язык у звука нет: секунда узбекской речи стоит столько же, сколько секунда английской. Он появляется у текста расшифровки и ответа.
- Microsoft Azure. Узбекский в латинице, uz-UZ, есть в распознавании, включая быструю расшифровку файлов (список языков).
- Yandex SpeechKit. В списке — «uz-UZ, Узбекский (латиница)» (модели распознавания). Значит, расшифровку ждите латиницей, даже если клиент пишет кириллицей.
- ElevenLabs Scribe v2. Узбекский отнесён к группе с долей ошибок от 10 до 20% (документация). Это оценка самой компании, набор данных не назван.
- UzbekVoice. На uzbekvoice.ai заявлены распознавание и синтез через API и отдельная модель Enhanced Uzbek только для узбекского аудио. Для русской и смешанной речи сервис советует общую модель. Для бота, которому пишут на двух языках вперемешку, эта деталь важна.
Кроме Whisper, всё это заявления самих поставщиков. Независимого сравнения этих сервисов на одних и тех же узбекских записях за 2026 год мы не нашли.
Озвучка текста на узбекском: кто синтезирует голос
С синтезом выбор уже.
- Microsoft Azure — два голоса: женский Madina и мужской Sardor.
- Yandex SpeechKit — три женских голоса: nigora, zamira и yulduz. У zamira и yulduz есть манеры «нейтральная», «строгая» и «дружелюбная», у yulduz ещё и шёпот (список голосов). Мужского узбекского голоса в списке нет.
- Gemini API — в таблице языков моделей синтеза речи есть Northern Uzbek, язык модель определяет сама (документация). Northern Uzbek — название из стандарта ISO 639-3, код uzn; тем же кодом размечен узбекский во FLORES-200.
- Google Cloud Text-to-Speech — в списке голосов узбекских нет, хотя русские и турецкие есть.
- ElevenLabs — у модели Eleven v3 в списке больше 70 языков, среди них казахский и киргизский, а узбекского нет. Нет его и у других моделей синтеза на той же странице.
- UzbekVoice — синтез с выбором диктора и настроения голоса, по описанию на сайте.
Сводная таблица на сентябрь 2026 года:
| Сервис | Распознавание | Озвучка | На что смотреть |
|---|---|---|---|
| Google Cloud | да, модели Chirp | нет в списке голосов | по говорящим не делит |
| Gemini API | да, аудио на входе модели | да | 32 токена за секунду звука |
| Microsoft Azure | да, латиница | 2 голоса, женский и мужской | — |
| Yandex SpeechKit | да, вывод латиницей | 3 женских голоса | мужского голоса нет |
| ElevenLabs | да, Scribe v2 | нет в списках моделей | 10–20% ошибок по своей оценке |
| Whisper (OpenAI) | да, открытая модель | не входит | 90,2% ошибок у large-v2 на FLEURS |
| UzbekVoice | да, отдельная узбекская модель | да | смешанная речь — общей моделью |
Как проверить нейросеть на узбекском за 30 минут
Ни одна таблица не скажет, как сервис поймёт именно ваших клиентов. Проверка занимает полчаса, и её можно попросить у любого подрядчика до подписания договора.
- 20 настоящих сообщений из вашей переписки. Десять латиницей, десять кириллицей. Среди них — с обычным апострофом, с типографским и без апострофа, как «ozbek». Смотрите, на каком языке и в какой графике пришёл каждый ответ.
- 5 голосовых. Мужской голос, женский, запись с улицы или из машины, сообщение, где человек переходит с узбекского на русский, и одно длиннее минуты. Просите показать расшифровку, а не только ответ.
- Смешанная фраза. Например, «Салом! Сколько стоит доставка?». Заранее решите, на каком языке должен прийти ответ, и проверьте.
- Название вашей компании, товаров и цены в сумах. Бот должен писать их буква в букву, без «перевода» и округления.
- Голосовое без речи. Десять секунд уличного шума или музыки. Правильный ответ — «не разобрал», а не уверенная расшифровка. Так ловится модель, которая не слышит звук и сочиняет текст.
| Что проверяете | Признак провала |
|---|---|
| Графика ответа | клиент писал кириллицей, ответ пришёл латиницей |
| Смешанная фраза | бот ответил на языке приветствия, а не вопроса |
| Названия и цены | название «перевели», цену округлили |
| Голосовые | голосовое на узбекском, а ответ по-русски |
| Шум вместо речи | бот уверенно «расшифровал» то, чего не было |
Голосовое клиента — тоже персональные данные. Что можно отправлять внешней модели после изменений закона 27 марта 2026 года, мы разбирали в статье о переписке клиентов в ChatGPT и Claude.
Чего мы не знаем
Доли ошибок ElevenLabs и заявления остальных сервисов мы не проверяли на своих записях. Цифры Whisper относятся к версии large-v2 и набору FLEURS 2022 года. Строка про узбекскую кириллицу в таблице токенов — оценка по автоматической транслитерации. Подписанного закона о новом алфавите на 28 сентября на lex.uz нет, а буквы Ş, Ç, Ö и Ğ мы знаем из пересказа СМИ, а не из текста акта. Другие цифры об ИИ в Узбекистане с первоисточниками собраны в нашей справке.
Честно о том, где тут мы
Своих моделей распознавания и синтеза речи у нас нет. Мы собираем ботов из чужих моделей и проверяем их на сообщениях клиента. Главный наш опыт с узбекским — Valli, ИИ-автоответчик для Telegram Business. В сентябре 2026 года мы разбирали, почему он плохо справлялся с узбекским, и поменяли вот что.
Детектор языка теперь узнаёт узбекский в обеих графиках и латиницей без апострофов, а смешанную фразу вроде «Салом! Сколько стоит?» отличает по списку русских слов. Узбекские и таджикские сообщения больше не уходят в маленькую дешёвую модель: она перевирала названия компаний и путала языки. Маленькая модель отвечает только там, где язык уверенно русский или английский.
Голосовые сначала расшифровывает полновесная модель Gemini, Whisper в версии turbo остался резервом: на узбекской речи он выдавал нам текст, больше похожий на казахский. Облегчённая версия Gemini (flash-lite) в нашей связке звук не слышала и сочиняла правдоподобную расшифровку по подсказке из запроса. Отсюда пятый пункт теста выше. Язык ответа на голосовое мы берём из самой речи, а не из текста расшифровки.
Добиться ответа кириллицей одним промптом не вышло: модель всё равно тянулась к латинице. Помог код. Если клиент писал кириллицей, а ответ пришёл латиницей, отдельный шаг перекладывает его в кириллицу, а названия брендов оставляет латиницей.
Это наблюдения на наших диалогах, а не замер. Процентов у нас нет, поэтому в статье их нет.
Как мы собираем ИИ-агента, который отвечает по-русски и по-узбекски в обеих графиках, и проверяем его ответы на ваших реальных сообщениях до запуска, описано на странице «ИИ-агенты для бизнеса». Если нужен бот попроще — принимать заявки, отвечать на типовое и передавать нетиповое человеку, — смотрите чат-боты для бизнеса.
Если хотите прогнать своего бота или подрядчика по этому тесту, опишите задачу в анкете на главной или напишите в Telegram. Разбор одного процесса — за 48 часов, бесплатно.