18 программ для голосового ввода: от клавиатуры телефона до локальных моделей

Отпускаем пальцы на заслуженный отдых

18 программ для голосового ввода: от клавиатуры телефона до локальных моделей

Человек говорит со скоростью 150-180 слов в минуту, а печатает в среднем 52 слова. IT-специалисты, кстати, печатают бодрее, около 70 слов в минуту, но разрыв с голосом всё равно двух-трёхкратный. С голосовым вводом были проблемы: лет десять назад он работал с постоянными ошибками распознавания: движки Speech-to-text переводили звук в буквы и выдавали текст без пунктуации и логики. Сейчас сверх типичного распознавания добавили языковую модель, которая убрала мусор устной речи и превратила его в нормальный текст. Как раз это сделало диктовку популярной сегодня.

В подборке собрали инструменты от мобильных клавиатур и браузерных расширений до open-source-приложений с ускорением через видеокарту.

ВАМ ПРИШЛО ПРИГЛАШЕНИЕ 💌
Приходите к нам в соцсети поделиться своим мнением и почитать, что пишут другие. А ещё там выходит дополнительный контент, которого нет на сайте — шпаргалки, опросы и разная дурка. В общем, вот тележка, вот ВК — велком!

После диктовки текст всё равно нужно перечитывать, зато ставить задачи в трекере, писать письма, сохранять заметки в Obsidian или объяснять LLM контекст — теперь можно гораздо быстрее. 

Почему голосовой ввод починили только сейчас

Главная проблема в разнице между устной и письменной речью. Когда человек говорит, он повторяется, перескакивает между фразами, оставляет паузы и мысли не до конца оформленными — так люди думают вслух, и в этом нет ничего плохого. Письменный текст устроен по-другому: его специально составляют так, чтобы было удобно читать. 

Раньше распознавание речи просто конвертировало звук в буквы один в один, поэтому на выходе получалась каша, которую нужно было много редактировать или печатать заново. Решением стало не усовершенствование самого распознавания, а добавление слоя перевода на базе LLM. Модель забирает сырой транскрипт, убирает речевой мусор, расставляет знаки препинания и форматирует устную мысль в нормальный письменный язык.

Второй фактор — смена формата работы. Надиктовывать задачи в опенспейсе неудобно для окружающих, а на удалёнке разговор с компьютером стал уже рутиной. Для разработчиков это совпало с ростом голосового промптинга в LLM: набирая текст руками, вы, скорее всего, сократите контекст ради экономии времени, а голосом за то же время наговариваете кусок в несколько абзацев — с целями, ограничениями и примерами, без необходимости экономить на деталях.

Как включить голосовой ввод на компьютере и телефоне

Прежде чем ставить сторонние программы, попробуйте то, что уже встроено в систему. Диктовка есть во всех четырёх популярных ОС, она бесплатна и включается в пару шагов. Если её точности не хватит — переходите к следующим разделам.
Сначала короткая сводка, чтобы не листать:

СистемаКак запуститьРаботает офлайн
Windows 10 и 11Win + HНет, нужен интернет
macOSДвойное нажатие ControlДа, на Apple Silicon
AndroidЗначок микрофона на клавиатуреДа, после загрузки языкового пакета
iPhoneЗначок микрофона на клавиатуреДа, на новых моделях

Как включить голосовой ввод в Windows

Чтобы включить голосовой ввод в Windows, поставьте курсор в текстовое поле и нажмите Win + H. Сочетание работает в любом приложении — от блокнота до адресной строки браузера.

  1. Поставьте курсор туда, где нужен текст.
  2. Нажмите Win + H — появится панель голосового ввода.
  3. При первом запуске разрешите доступ к микрофону.
  4. Начните говорить. Чтобы система сама расставляла знаки препинания, нажмите шестерёнку на панели и включите автопунктуацию.

Язык распознавания подтягивается из раскладки клавиатуры: переключитесь на русскую — и диктовка будет на русском. В Windows 10 функция дополнительно требует включить распознавание речи в сети: «Параметры → Конфиденциальность → Голосовые функции».

Как включить диктовку на Mac

Диктовка на Mac отключена по умолчанию — её включают один раз в системных настройках, дальше она вызывается двойным нажатием Control.

  1. Откройте Системные настройки → Клавиатура → Диктовка и включите переключатель.
  2. Выберите язык и сочетание клавиш для запуска.
  3. Поставьте курсор в текстовое поле и нажмите выбранное сочетание.
  4. Диктуйте. Знаки препинания проговариваются словами: «запятая», «точка», «новая строка».

На компьютерах с чипами Apple Silicon распознавание для многих языков считается прямо на устройстве, без интернета. Это тот же принцип, что у локальных приложений из следующего раздела, только качество ниже.

Как включить голосовой ввод на Android

На Android голосовой ввод запускается значком микрофона на клавиатуре — на большинстве телефонов это Gboard от Google.

  1. Откройте любое поле ввода, чтобы появилась клавиатура.
  2. Нажмите значок микрофона в правом верхнем углу клавиатуры.
  3. Разрешите доступ к микрофону, если система спросит.
  4. Говорите — текст появляется в поле по мере распознавания.

Если значка нет, включите его в «Настройки → Система → Языки и ввод → Виртуальная клавиатура → Gboard → Голосовой ввод». Там же скачивается языковой пакет — с ним диктовка работает без интернета.

Как включить диктовку на iPhone

Диктовку на iPhone нужно один раз разрешить в настройках, после этого она доступна с любой клавиатуры.

  1. Откройте Настройки → Основные → Клавиатура и включите пункт «Диктовка».
  2. Вернитесь в любое приложение с текстовым полем и вызовите клавиатуру.
  3. Нажмите значок микрофона рядом с пробелом и начните говорить.
  4. При необходимости продолжайте печатать руками — на iPhone диктовка и клавиатура работают одновременно.

Начиная с iOS 16 знаки препинания расставляются автоматически, а на новых моделях распознавание считается на самом телефоне и не уходит на серверы Apple.

Что делать, если голосовой ввод не работает

Четыре причины покрывают почти все случаи.

Нет доступа к микрофону. Проверьте разрешения: в Windows это «Параметры → Конфиденциальность → Микрофон», на Mac — «Системные настройки → Конфиденциальность и безопасность → Микрофон», на телефонах — разрешения конкретного приложения.

Не тот язык раскладки. Windows и Android распознают речь на языке активной клавиатуры. Русская речь при английской раскладке превратится в бессмыслицу.

Не скачан языковой пакет. На Android офлайн-распознавание не работает, пока пакет не загружен вручную.

Не работает Win + H. Сочетание перехватывают некоторые программы — например, менеджеры буфера обмена и утилиты для скриншотов. Закройте их и попробуйте снова.

Большая скидка — 16% на все курсы Практикума

Если вы читаете эту статью, тогда вы точно разбираетесь в технологиях. Стать лучше и зарабатывать больше можно после курсов Практикума — по программированию, анализу данных и искусственному интеллекту.

До 17 сентября на все курсы действует скидка 16%, она применится автоматически при оплате. Потом цены станут выше, поэтому не откладывайте!

В Практикуме есть программы для начинающих и специалистов с опытом, которые хотят обновить знания или освоить новое направление.

Десктопные клиенты

Десктопный софт берёт звук с микрофона, обрабатывает его через локальную или облачную модель и вставляет готовый текст туда, где стоит курсор. Разница между программами в приватности данных, требовательности к железу и настройках.

SuperWhisper работает на Windows, macOS и iPhone, но версии не всегда стабильно работают: на десктопе всё нормально, а вот на iPhone у пользователей возникают проблемы со стабильностью фоновой записи. 

Бесплатно доступна модель Standard — по ощущениям пользователей она не сильно уступает топовой Ultra, которая открывается только на 15 минут в триале. Автоматически расставляет пунктуацию и предлагает готовые пресеты под разные форматы — сообщение, статья. Подписка Pro стоит $8,5 в месяц или $85 в год; в российском App Store она дороже в пересчёте на доллары — 799 ₽ и 7990 ₽ соответственно, то есть около $10 в месяц вместо $8,5. Известный баг: в терминале VS Code на Windows текст не вставляется напрямую, а падает в отдельное окошко и буфер обмена.

Handyopen source для Windows и macOS. Весь звук обрабатывается локально, ничего не уходит на серверы. Для чистого русского в приложение официально встроена модель GigaAM — компактная и быстрая. Для смешанной русско-английской речи по умолчанию доступны модели Whisper. Модель Breeze-ASR, которая по независимым тестам (23 модели, 100 000+ прогонов) обходит по качеству даже Whisper Large, в официальную сборку Handy пока не входит — её можно получить только через неофициальный форк проекта, собранный энтузиастами. Ускорение работает через Vulkan — универсальный стандарт, который тянет и NVIDIA, и AMD без специальных драйверов, и на новых видеокартах RTX 50-й серии он обгоняет классическую CUDA.

OpenWhispr — тоже open source, с 5600+ звёзд на GitHub и активной разработкой. Можно использовать бесплатно, если модели крутятся локально, или по подписке, если нужна облачная обработка; можно подключить свои API-ключи от LLM-провайдеров. Умеет ускоряться через NVIDIA CUDA — и разница ощутимая: без дискретной видеокарты Whisper Large обрабатывает звук, по замерам в 30-60 раз медленнее, чем на GPU. В последних версиях появился режим транскрибации встреч, который сам отслеживает начало звонка в Zoom и включает запись.

Wispr Flow — облачный сервис, вставляет обработанный текст в любые десктопные программы и устанавливается на iPhone как отдельная системная клавиатура. Главный минус — непредсказуемая пунктуация: качество разметки зависит от того, в какое приложение вы диктуете, и иногда текст приходит вообще без единого знака препинания. Бесплатный тариф ограничен 2000 словами в неделю. Подписка стоит $15 в месяц или $144 в год. Через российский App Store дешевле: 750 ₽ в месяц (≈ $9) вместо $15, и 7200 ₽ в год (≈ $87) вместо $144.

Кроме них на рынке есть российский аналог SpeakFlow — 690 ₽ в месяц за безлимит либо бесплатно с лимитом 30 минут в месяц; те же проблемы с пунктуацией и нагрузкой на систему, а также нишевые варианты вроде Aqua Voice — с собственной моделью, заточенной под dev-контекст, но пока слабо приспособленной под русский, и MacWhisper для тех, кто работает только на Mac.

Браузерные сервисы и расширенная транскрибация

Если устанавливать отдельный софт на рабочий компьютер не хочется или система ограничена правами администратора, задачу закрывают браузерные инструменты. Они работают прямо во вкладке и подходят для расшифровки длинных файлов или наговаривания заметок без установки клиентов.

SpeechPad доступен через браузер на Windows, Linux и macOS, а также есть версия для Android и iOS. Главная фича платформы — обработка голосовых команд для пунктуации: слова «точка» или «запятая» автоматически превращаются в нужные знаки прямо во время диктовки. Текст сохраняется в TXT, отдельно сервис умеет транскрибировать аудиодорожку из загруженного видео. Часть возможностей мобильного приложения закрыта платной подпиской.

Speechnotes существует в двух вариантах — как приложение для Windows и как отдельное Android-приложение, при этом есть и браузерная версия с чуть менее точным распознаванием, чем у мобильного приложения (которое, по отзывам, распознаёт почти все слова с первого раза). В веб- и десктоп-версии готовый текст можно скопировать, экспортировать в Word или TXT, отправить по почте или выгрузить на Google Диск; в мобильном приложении добавляются экспорт в PDF, сохранение на карту памяти и прямая отправка другим пользователям, а частые термины можно привязать к горячим клавишам.

Voice Notepad — минималистичный браузерный блокнот: даёте разрешение на микрофон, диктуете, редактируете выравнивание и абзацы, сохраняете или печатаете результат. Из ограничений — сервис плохо распознаёт тихую речь и знаки препинания, если говорить неразборчиво или негромко.

Voice Inрасширение для Chrome и Edge, которое добавляет кнопку микрофона в любое текстовое поле на любом сайте: закрепляете иконку на панели, даёте разрешение — и можно диктовать прямо в форму или диалоговое окно. Как и с Voice Notepad, для стабильного результата нужно говорить чётко и не слишком тихо.

Мобильный ввод и встроенные решения

Для ввода текста с телефона или быстрого наговаривания заметок удобно использовать мобильные клавиатуры и системные функции операционных систем. Они вызывают иконку микрофона в любом текстовом поле и не требуют переключения между окнами.

Яндекс Клавиатура для iOS и Android заточена под русскую речь; чтобы включить голосовой набор, приложение сначала нужно добавить в системных настройках как активную раскладку. По отзывам пользователей, она особенно хорошо справляется именно с русским языком — что логично для сервиса с этим фокусом, — и удобна для быстрых сообщений в мессенджерах и черновиков.

Gboard — бесплатная клавиатура Google для Android и iOS с кнопкой микрофона в любом приложении, где открывается клавиатура. Ничего не нужно донастраивать — это самый быстрый способ начать диктовать сразу после покупки телефона.

Клавиатура Samsung работает по умолчанию на устройствах Samsung, а язык и параметры голосового ввода настраиваются в системных настройках телефона.

Встроенная диктовка на iPhone и Mac доступна прямо из коробки и работает двумя разными способами, а не одновременно: можно нажать значок микрофона на клавиатуре и надиктовать текст прямо в поле — например, в приложении «Заметки», — а можно отдельно записать голосовую заметку через кнопку «Аудиозапись» во вложениях, и тогда в заметке сохранится сама аудиодорожка, а не расшифровка.

Android-приложение Написать голосом: Речь в текст позволяет настроить размер шрифта и оформление и предлагает выбор между стандартным режимом распознавания (текст появляется в отдельном окне для редактирования) и непрерывным (текст печатается синхронно с речью).

SoundType AI работает с гостевым аккаунтом или после регистрации, поддерживает как обычную диктовку, так и загрузку видео с преобразованием звуковой дорожки в текст; результат можно выгрузить в DOCX, TXT или PDF.

Яндекс Браузер даёт голосовой набор через значок микрофона (Алису) в поисковой строке на новой вкладке — нужно разрешить доступ к микрофону в настройках. Яндекс Заметки дублируют эту функцию отдельным приложением: на телефоне работают через Яндекс Браузер или Яндекс Диск, на компьютере требуют предварительной установки Яндекс Диска.

Практические сценарии для разработчика

Голосовой ввод меняет рутину, когда вы перестаёте использовать его как замену клавиатуре и начинаете применять для работы с большими объёмами текста.

Составление промптов для нейросетей. При ручном наборе разработчики экономят время и вырезают из запроса детали. Если запустить микрофон в ChatGPT или любом другом клиенте, за то же время, что ушло бы на пару скупых фраз с клавиатуры, получается наговорить подробный контекст — с целями задачи, ограничениями и примерами входных данных. Нейросеть точнее выдаёт результат, когда получает развернутое описание без сокращений.

Фиксация задач и итогов встреч. Прямо во время созвона или сразу после его завершения можно наговорить список договорённостей в базу знаний или рабочий мессенджер, а утилита превращает речь в отформатированный список. 

Ведение базы знаний в Obsidian. Обычное копирование чужих статей или примеров кода из браузера не помогает усвоить материал. Намного лучше прочитать технический разбор, закрыть страницу и надиктовать главные мысли своими словами в Obsidian.

Личный дневник и кастомный макропад. Вы просто проговариваете сделанные за день задачи. Для удобства некоторые подключают копеечную китайскую клавиатуру на шесть клавиш с регулятором громкости, программируя одну кнопку под режим Push-to-Talk, вторую на старт записи, а третью для смены языковой модели.

Что в итоге выбрать

Чтобы не собирать сложный стек с нуля, выбирайте инструмент под вашу операционную систему и пару дней тестируйте. Собрали всё в таблицу для понятного выбора. 

ИнструментПлатформаОбработкаЧто важно знать
SuperWhisperWindows, macOS, iOSЛокальноStandard бесплатно и почти не уступает Ultra; на iPhone работает нестабильно
HandyWindows, macOSЛокальноOpen source, бесплатно; GigaAM для русского встроен официально, Breeze-ASR — только через неофициальный форк
OpenWhisprWindows, macOS, LinuxЛокально / облакоБез GPU обработка в 30–60 раз медленнее; есть режим транскрибации созвонов
Wispr FlowКроссплатформенный, iPhoneОблакоПунктуация нестабильна и зависит от приложения; дешевле через российский App Store
SpeakFlowWindows, macOSОблакоРоссийский аналог Wispr Flow, те же проблемы с пунктуацией
SpeechPadБраузер, Android, iOSОблакоГолосовые команды для знаков препинания, транскрибация видео
SpeechnotesБраузер, Windows, AndroidОблакоМобильная версия точнее браузерной; экспорт различается по платформам
Voice NotepadБраузерОблакоМинимализм, слабо распознаёт тихую речь
Voice InРасширение Chrome/EdgeОблакоМикрофон в любом текстовом поле на любом сайте
Яндекс КлавиатураAndroid, iOSОблакоФокус на русскую речь, нужно включить как активную раскладку
GboardAndroid, iOSОблакоГотовый вариант без настройки
Клавиатура SamsungAndroid (Samsung)ОблакоРаботает по умолчанию на устройствах бренда
Диктовка AppleiOS, macOSЛокально / облакоТекст и аудиозапись — два разных режима, не одновременно
«Написать голосом»AndroidОблакоСтандартный и непрерывный режимы распознавания
SoundType AIБраузерОблакоДиктовка плюс перевод видео в текст, экспорт в DOCX/TXT/PDF
Яндекс Браузер / ЗаметкиДесктоп, Android, iOSОблакоГолосовой набор через Алису; для десктопа нужен Яндекс Диск

Если есть видеокарта NVIDIA на десктопе — берите OpenWhispr и включайте CUDA. Бесплатно, всё считается локально, качество не проседает даже на смеси русского с английским. На Mac с Apple Silicon (M4 Pro и мощнее) та же история с Handy или бесплатной моделью Standard в SuperWhisper — тоже без всякой подписки.

Видеокарты нет — не мучайте процессор тяжёлыми моделями, он справляется в 30-60 раз медленнее GPU. Тут проще взять облачный вариант с бесплатным лимитом: Standard в Super Whisper без ограничений вообще или Wispr Flow, пока хватает 2000 слов в неделю.

Диктуете только на русском, без английских терминов, а железо слабое — ставьте Handy с моделью GigaAM. Она в разы легче Whisper и спокойно тянет распознавание на CPU.

Важно, чтобы голос вообще не уходил на сервер — вариантов только два: Handy и OpenWhispr в локальном режиме. Больше никто из подборки не работает полностью офлайн.

Для диктовки с телефона доустанавливать ничего не нужно — хватает системной клавиатуры: Gboard, Яндекс Клавиатуры или Samsung Keyboard, в зависимости от устройства. А если нужно расшифровать уже готовый файл, а не надиктовать текст с нуля, — это отдельная задача, которую из инструментов в этой подборке закрывают SpeechPad и SoundType AI: оба умеют работать с загруженным аудио и видео, а не только с живой речью.

Советуем дополнительно почитать

Нейросети для озвучки текста: лучшие ИИ-сервисы 2026 года — обратная задача: как устроен синтез речи и какие сервисы подходят для озвучивания инструкций и курсов.

16 нейросетей для генерации видео, картинок и озвучки — сервисы для создания и обработки роликов, их разрешение, ограничения и подходящие сценарии.

Переводим аудио в текст — как собрать собственный расшифровщик на Python, если готовые сервисы не устраивают по приватности или цене.

Технодурка: голосовой помощник, который работает без интернета и API — сборка полностью автономного голосового ассистента: что для этого нужно и где начинаются ограничения.

3 российских таск-трекера для небольших команд — куда складывать задачи, которые вы теперь наговариваете голосом.

Бонус для читателей

Если вам интересно погрузиться в мир ИТ и при этом немного сэкономить, держите наш промокод на курсы Практикума. Он даст вам скидку при оплате, поможет с льготной ипотекой и даст безлимит на маркетплейсах. Ладно, окей, это просто скидка, без остального, но хорошая.

Вам может быть интересно
easy