#про_инструменты

Speech-to-text как новый интерфейс работы

Часто экспериментирую с разными инструментами: ставлю, даю себе время попользоваться. Если приживается — оставляю в системе, если нет — просто отбрасываю. Один из таких инструментов — speech-to-text.

На этой неделе решил попробовать после сообщения знакомого про Handy и его способ взаимодействия с компьютером через диктовку. Поставил, начал играться — и внезапно эксперимент перерос в изменение самого подхода: начал по-другому взаимодействовать с моделями и иначе смотреть на выполнение задач. Поймал себя на мысли: диктовка — это не просто способ “быстрее писать”. Это вообще другой формат мышления и взаимодействия с компьютером.

Плюсы: — скорость х10: надиктовал поток мыслей, без запятых и редактуры — меньше трения: не думаешь о формулировках, просто говоришь — связка с LLM: на выходе можно прогнать через Perplexity/ChatGPT и получить уже нормальный текст с которым работаешь дальше.

Минусы: — мысли “растекаются”: сложно держать структуру и фокус — плохо подходит для сложных текстов с цифрами и данными (аналитика, исследования, акционные документы) — редактировать большой надиктованный текст все еще неудобно

По факту это не замена письму, а отдельный инструмент для генерации идей и заметок: голос → черновик → модель → нормальный текст -> осмысленная обработка. Любопытно, что голосовые интерфейсы до сих пор мало кто реально освоил как основной способ работы, но дети их просто обожают и давно общаются с устройствами в основном голосом.

Кто активно пользуется speech-to-text — чем именно? Какие инструменты/связки зашли?