Мухаммадсаид Мамасаидов родился в Ташкенте, вырос в семье айтишников и окончил филиал южнокорейского Университета Инха по направлению «Программная инженерия». На 2-м курсе парень заинтересовался обработкой естественного языка и создал сервис автокоррекции узбекского, который позже перерос в ИИ-переводчик тюркских языков Tilmoch.
Сейчас платформой ежемесячно пользуются 200 тысяч человек. За время работы стартап привлек свыше $300 тысяч грантовых и венчурных средств, а в 2025 году Tilmoch оценили в $1,5 млн.
Для совместного проекта Digital Business и Astana Hub «100 стартап-историй Центральной Евразии» Мухаммадсаид рассказал, почему универсальные LLM-боты плохо справляются с тюркскими языками, с какими барьерами столкнулся Tilmoch при выходе на рынок Казахстана и как сервис планирует вырасти в полноценный суперапп.
«Собрали корпус из 35 тысяч книг на узбекском языке»
— Мухаммадсаид, почему заинтересовались ИИ-переводом и обработкой естественного языка? С чего начался этот проект?
— На 2-м курсе университета был предмет «Структура данных и алгоритмы», и по нему нужно было сделать проект. Тогда меня волновало, что большинство операционных систем нативно не поддерживали коррекцию узбекского языка, поэтому решил создать сервис для автоисправления ошибок.
Узбекский — сложный язык: к корню приклеивается множество суффиксов и других аффиксов, которые меняют форму слова. К тому же у узбекского два алфавита — на латинице и кириллице, помимо этого люди говорят на русском и английском, а еще есть большое количество диалектов. Многие применяют нелитературные формы или ошибаются в заимствованных из арабского словах. Все это приводит к тому, что цифровизация языка страдает: сложно использовать его для поиска в интернете и развивать какие-то сервисы, потому что люди пишут одни и те же слова по-разному. Мне хотелось привести разные варианты написания к единому стандарту.
— Что представляла собой первая версия сервиса автокоррекции?
— Она была очень простой: программный код без какого-либо пользовательского интерфейса. Брали список слов на узбекском и список из 150-200 возможных окончаний и механически комбинировали их.
Полученные результаты сравнивали со словарем: если форма есть в словаре или в загруженном тексте — алгоритм считал его правильным, если нет — выдавал ошибку. Способ топорный и неполноценный. Пользователей раздражало, когда правильное слово помечалось ошибочным только потому, что конкретной формы не оказалось в базе. После окончания проекта захотел сделать полноценную систему, которая знала бы все правила узбекского языка и алгоритмически понимала структуру каждого слова.
— Как проект по автокоррекции узбекского языка вырос в полноценный стартап?
— В то время понимания, как делать стартапы, не было совсем. Сначала хотели запустить клон Grammarly для узбекского языка — веб-сайт, куда люди вставляют текст и проверяют ошибки. Сделал первую веб-версию, но ею никто не пользовался. Стало понятно, что нужно заниматься маркетингом и рекламой, а не только писать код.
Затем узнал про конкурс мобильных приложений mGovAward, организованный IT Park Uzbekistan совместно с Министерством цифровых технологий и Правительством ОАЭ. Для участия требовалась команда, поэтому привлек двух одногруппников — дизайнера и специалиста по данным. Весной 2022 года разработали мобильную клавиатуру для узбекского языка с предиктивным вводом и автоисправлением. Лингвиста в команде не было, поэтому пришлось самостоятельно изучать учебники по грамматике: разбираться, как работают 150-200 видов аффиксов и как они меняют корень слова. Использовали наработки ученых по турецкому и финскому языкам, консультировались со специалистами. На основе словарей, правил и анализа текстов новостей итеративно обучали модель. В итоге проект занял первое место и получил $50 тысяч.
— Что произошло с проектом после победы в конкурсе?
— Вскоре выяснилось, что мобильную клавиатуру крайне сложно монетизировать, и поэтому решили сделать продвинутый модуль проверки орфографии узбекского языка, который получил название Tahrirchi. Он должен был работать как плагин для Microsoft Word — в Узбекистане им пользуются почти во всех организациях, и людям удобнее проверять документы прямо в процессе работы.
Параллельно углубились в исправление сложных грамматических и стилистических ошибок, пунктуацию. Чтобы обучить модель, требовался масштабный цифровой корпус языка, а больших данных по узбекскому тогда не существовало. Собирать их только из новостных сайтов нельзя было — там слишком однообразный и скудный словарный запас. Стало понятно, что нужные нам данные находятся в бумажных книгах на узбекском языке.
Мы брали доступные электронные издания, а редкие книги разыскивали в магазинах, выкупали у букинистов и сканировали. В итоге нам удалось собрать около 35 тысяч оцифрованных текстов в единый языковой корпус. С этим продуктом пошли в государственный сектор, однако с госучреждениями работать оказалось тяжело, стали дальше искать свой product-market fit.
В конце 2023 года приняли участие в конкурсе President Tech Award. Проект победил в направлении «Искусственный интеллект» и получил $100 тысяч. Деньги позволили полностью переосмыслить продукт и найти нишу, за которую рынок действительно был готов платить. Рассматривали распознавание речи, голосовых ботов, решения по компьютерному зрению. Но когда проанализировали статистику поисковых запросов в Google, увидели, что есть колоссальная потребность в качественном переводе. ChatGPT и Claude тогда слабо знали узбекский, а Google Translate выдавал неестественный машинный текст. Весь 2024 год посвятили разработке специализированного переводчика, используя грантовые деньги на серверы, обучение моделей и маркетинг. В сентябре 2024 года платформа Tilmoch вышла в публичный релиз.
— Чем отличается перевод Tilmoch от универсальных моделей вроде ChatGPT или Claude?
— Все большие языковые модели фундаментально мыслят на английском языке. Тюркские языки — малоресурные, то есть оцифрованных материалов, на которых ИИ мог бы обучаться, очень мало. Из-за этого при генерации на узбекском или казахском тексты получаются неестественными: чувствуется машинный англоязычный синтаксис. К тому же универсальные чат-боты могут терять фрагменты текста при переводе длинных документов, искажать смысл или обрывать генерацию на полуслове.
Tilmoch предназначен только для перевода, поэтому он не теряет фрагменты и не искажает смысл. Мы регулярно проводим слепые тесты с профессиональными лингвистами, сопоставляя результаты нашей модели, Google Translate и LLM-ботов. В 80-90% случаев эксперты отдают предпочтение переводу Tilmoch благодаря естественности синонимов и точности формулировок.
Чтобы добиваться такого качества без гигантских бюджетов на серверы, сделали две модели: легкую быструю и тяжелую, но более глубокую. Базовая модель мгновенно переводит текст и закрывает повседневные задачи. Если пользователю нужно улучшить работу, в интерфейсе есть специальные инструменты. Кнопка «Отполировать» включает тяжелую нейросеть, которая оценивает контекст всего абзаца, сверяется с базой памяти переводов и находит наиболее живые конструкции. Если изначальный вариант был точным, алгоритм оставляет его без изменений, а если видит неестественный оборот, то перефразирует.
«После Сан-Франциско выросли амбиции и аппетиты команды»
— В сентябре 2025 года вы привлекли $150 тысяч от трех венчурных фондов. Как получилось найти инвестиции?
— После официального релиза Tilmoch начал последовательно захватывать разные сегменты аудитории: сервис стал популярен среди госслужащих, юристов, маркетологов, блогеров и SMM-специалистов. Выручка стабильно росла, и к моменту переговоров с фондами вышли на ежемесячный доход (MRR) в $8-9 тысяч.
Нас заметил Даврон Парманов, операционный партнер венчурного фонда Aloqa Ventures. Он вышел на связь и предложил поднять раунд инвестиций. Aloqa Ventures выступил лид-инвестором сделки и привлек к участию еще два локальных фонда — IT Park Ventures и Yoshlar Ventures. В итоге стартап получил рыночную оценку в $1,5 млн. Каждый из трех фондов вложил от $40 до $60 тысяч, суммарно закрыв раунд на $150 000.
— В 2025 году вы также участвовали в Silicon Valley Residency и акселераторе AlchemistX в США. Что дала вам эта поездка?
— Программа проходила при участии Astana Hub, IT Park Uzbekistan, Alchemist Accelerator и Silkroad Innovation Hub. Фонды Astana Hub Ventures и IT Park Ventures получили миноритарные доли в стартапе в обмен на доступ к программе, менторской поддержке и международным возможностям.
Три месяца в Сан-Франциско поменяли восприятие бизнеса. Обучение в акселераторе AlchemistX было посвящено в основном B2B-продажам: еженедельно опытные фаундеры проводили воркшопы, с нами работал персональный трекер от Alchemist, а завершилось все классическим Demo Day, где питчили проекты перед американскими инвесторами.
Главный инсайт, который привез из Долины, — понимание масштаба рынка и совершенно иной готовности к риску. В Центральной Азии миллион долларов выручки часто считают пределом мечтаний и конечной целью, а в США это лишь отправная точка. Там огромная концентрация талантов: на профильных площадках каждый вечер проходит с десяток встреч, где можно знакомиться и собирать проекты. Американские инвесторы готовы вкладывать деньги даже в сырые идеи, если фаундер уверен в себе и горит делом. После этой поездки выросли амбиции и аппетиты команды.
— Как построена монетизация? Какой доход приносит стартап и в каком сегменте выручка больше?
— Текущий MRR составляет $22-23 тысячи, есть цель до конца года дойти до $30 тысяч. Основную долю выручки генерирует B2C-сегмент.
Если говорить про монетизацию B2C, то в Узбекистане у нас более 200 тысяч активных пользователей в месяц и около 1,2 млн визитов. Примерно 98% аудитории пользуются платформой бесплатно с ограничением по объему символов — удерживаем этот трафик осознанно, так как он дает стабильный приток данных для дообучения моделей и расширения охвата. Постоянно оплачивают подписку 4 000-4 200 пользователей. Базовый тариф стоит $4 в месяц, а максимальный — $15.
В сегменте B2B сотрудничаем примерно со 150 компаниями из Узбекистана. Корпоративные заказчики покупают командные пакеты доступов по цене от $200 в год за рабочее место.
Среди наших B2B-клиентов, например, команда локализации сервиса Yandex Go, а также онлайн-кинотеатры Кинопоиск и iTV, которые используют продукт для перевода субтитров. Еще у нас есть технология ИИ-озвучки. Она пока не подходит для дубляжа художественных фильмов или сериалов, но уже успешно используется одним из наших клиентов для перевода обучающих курсов на узбекский.
Что касается более сложных интеграций, то подключение по API стоит $500-1000 в год — под каждый крупный бизнес разрабатываем индивидуальные шлюзы и кастомные решения. Также готовим размеченные дата-сеты для банков, которые тренируют собственные внутренние языковые модели на узбекском языке.
«В тюркских языках критически не хватает готовых корпусов текстов»
— Как проходило масштабирование на казахский и другие языки?
— Казалось, что отработана универсальная формула. Для каждого нового языка делали alignment — выравнивание параллельных текстов. То есть брали одну и ту же книгу на русском, английском и целевом языке и сопоставляли по предложению, чтобы модель видела, как одна и та же мысль формулируется на разных языках. В 2025 году так добавили казахский язык, используя около 4 000 книг и тексты из открытых источников, но качество перевода оказалось не очень хорошим.
Чтобы понять, в чем проблема, провели небольшой кастдев с профессиональными филологами, переводчиками и копирайтерами из Казахстана. Выяснилось, что огромная часть казахоязычного контента в интернете и в современных печатных книгах содержит большое количество машинного перевода и калькированные конструкции с русского языка. Модель обучалась на этих данных, поэтому наш перевод тоже был «ИИ-шным». Подобная проблема возникла и с другими тюркскими языками.
Масштабироваться в Казахстане оказалось сложно еще и потому, что физически не находимся в стране, – трудно улавливать отклик аудитории. Сейчас ошибки в модели исправили, перевод звучит более естественно, но заходить на казахский рынок думаем через смежные инструменты — словари или сервисы проверки копирайтинга. Пока что в Казахстане у нас около 20 тысяч пользователей ежемесячно, из них примерно 300 оплачивают подписку.
— На платформе Tilmoch доступны 16 языков, в том числе азербайджанский, грузинский и даже корейский. Планируете ли вы добавлять новые языки и какие цели ставите на ближайший год?
— Добавление и качественная настройка одного языка с нуля занимает 3-4 месяца. Пока решили остановиться и бросить все силы на повышение качества перевода у казахского, кыргызского, таджикского, каракалпакского и азербайджанского языков. Критически не хватает готовых корпусов текстов, поэтому сейчас применяем аугментацию данных: с помощью сторонних LLM генерируем необходимые синтаксические конструкции, проверяем их качество и дообучаем собственный алгоритм.
Глобально стремимся превратить сервис в языковой суперапп: уже добавили словесные головоломки, в которые ежедневно играют больше тысячи человек, и запустили транскрибацию звуковых файлов на узбекском и казахском языках: система обрабатывает 50-60 часов аудио в сутки. Развиваем портал с правилами правописания и генерацией типовых документов и договоров.
В планах на ближайший год выпустить мобильные клавиатуры для нового узбекского алфавита на основе латиницы, чтобы помочь людям быстрее к нему привыкнуть, полноценно оцифровать язык и сделать его удобным для пользователей.
Наша стратегическая цель — нарастить трафик с текущих 1,2 млн до 5 млн визитов в месяц. Собрав многомиллионную аудиторию с качественным трафиком, рассматриваем возможность выйти на сделку или интегрироваться с крупными цифровыми экосистемами в регионе.