Коротко
Звук берётся с самого компьютера: то, что играет в наушниках, и то, что слышит микрофон. К звонку приложение не подключается, ссылку на встречу не спрашивает и в списке участников не появляется.
Клавиша записи по умолчанию — Cmd + Option + Z на macOS и Ctrl + Shift + A на Windows. После нажатия запись уходит на распознавание, а расшифровка попадает в поле ввода.
Откуда берётся звук
Источников два, и работают они независимо. Системный звук — это всё, что воспроизводит компьютер, то есть голос собеседника в видеозвонке. Микрофон — ваша собственная речь.
| Система | Системный звук | Микрофон |
|---|---|---|
| macOS | Системный перехват звукового потока. Работает без виртуальных звуковых устройств и без стороннего драйвера | Штатный аудиодвижок системы |
| Windows | Петлевой захват вывода: то же, что слышите вы | Штатный захват устройства ввода |
Оба потока смешиваются в одну дорожку. Поэтому в расшифровке одного фрагмента может оказаться и вопрос интервьюера, и ваш ответ.
Почему именно тридцать секунд
Запись идёт непрерывно в кольцевой буфер: новые данные вытесняют старые, и в памяти всегда лежат последние тридцать секунд. Нажатие клавиши копирует содержимое буфера и отправляет его на распознавание.
Тридцать секунд — это компромисс. Длиннее означает дороже и медленнее: распознавание тарифицируется по длине записи, а ждать ответа дольше на собеседовании невозможно. Короче означает риск не захватить вопрос целиком, потому что развёрнутые вопросы на секции по системному дизайну занимают двадцать секунд и больше.
Практическое следствие. Если вопрос оказался длиннее тридцати секунд, в буфер попадёт только его конец. В такой ситуации проще нажать клавишу дважды: один раз в середине вопроса, второй после его окончания.
Микрофон можно выключить
В настройках есть отдельный тумблер микрофона, по умолчанию включённый. Когда он выключен, системный звук продолжает писаться, а ваша речь в расшифровку не попадает.
Это удобнее, чем кажется. Расшифровка становится чище: в ней только вопрос собеседника, без ваших «ага» и раздумий вслух. Модель получает на вход вопрос, а не диалог, и отвечает точнее.
Отдельно от этого работает выключатель всего захвата сразу: Cmd + Option + R на macOS и Ctrl + Option + R на Windows. Он останавливает и микрофон, и системный звук, а индикатор записи в системе гаснет. Настройка переживает перезапуск приложения, поэтому если захват был выключен вчера, сегодня он останется выключенным.
Что происходит с записью дальше
Запись сжимается и уходит на сервер, где её расшифровывает модель распознавания речи. По умолчанию она настроена на русский язык. Расшифровка возвращается в поле ввода, откуда вы отправляете её модели вместе с остальным контекстом.
Распознавание тарифицируется как фиксированные тридцать секунд независимо от того, сколько в записи было речи. Поэтому нажимать клавишу на всякий случай, когда никто не говорит, невыгодно.
Перед отправкой приложение проверяет громкость и отсекает тишину локально. Это экономит и время, и кредиты: если в буфере ничего не было, запрос на сервер не уходит вовсе.
Как отсекаются выдуманные фразы
У всех моделей распознавания есть общая особенность: на тишине и шуме они склонны выдумывать текст. В расшифровке появляется фраза, которой никто не говорил, чаще всего из обучающих данных: титры, благодарности, обещания продолжения.
Мы отбрасываем такие куски по двум независимым признакам. Первый — зацикленность: если модель повторяет одно и то же, текст сжимается подозрительно хорошо, и это видно арифметически. Второй — сочетание низкой уверенности модели в собственном результате с высокой вероятностью того, что речи в этом фрагменте не было вовсе. Одного признака мало, поэтому второй срабатывает только вместе с первым.
Сверх этого работает список типовых выдумок: они повторяются от записи к записи и вычищаются по точному совпадению. Если после фильтра не осталось ничего, приходит пустой ответ. Это сделано намеренно: лучше показать, что расслышать не удалось, чем подсунуть модели фразу, которой не было.
Если ничего не расслышало
| Сообщение | Что проверить |
|---|---|
| Не услышали системный звук за последние тридцать секунд | Звук идёт в другое устройство вывода, или собеседник молчал. Проверьте, что слышите его сами |
| Слышно слишком тихо | Громкость входа микрофона в настройках системы. Частый случай — микрофон ноутбука при включённых наушниках |
| Не удалось получить звук с микрофона | Микрофон занят другим приложением. Захват перезапускается сам, достаточно повторить |
| Не удалось расслышать речь | В буфере была тишина либо всё содержимое отсеял фильтр выдуманных фраз |
| Недостаточно кредитов | Дневной лимит исчерпан. Сбрасывается раз в сутки, у платных планов есть месячный пул |
Отдельная частая причина на macOS — наушники, подключённые как гарнитура. В этом режиме система переключает звук на узкополосный профиль связи, качество падает, и распознавание ошибается чаще. Если микрофон наушников не нужен, выключите его в настройках приложения: система вернёт звуку полное качество.
Какие вопросы стоит ожидать на разных этапах и где подсказка помогает меньше всего, разобрано отдельно: скрининг, секция по языку, системный дизайн.
Частые вопросы
Приложение подключается к звонку как участник?
Нет. Оно берёт звук с вашего компьютера напрямую, как любая программа записи экрана. Ссылку на встречу вводить не нужно, и в списке участников приложение не появляется. Часть ИИ-ассистентов на рынке устроена иначе: они заходят в звонок отдельным ботом и видны всем.
Нужно ли нажимать запись до вопроса?
Нет, и это главное отличие от диктофона. Приложение всё время держит в памяти последние тридцать секунд звука. Нажатие забирает то, что уже прозвучало. Поэтому нажимать нужно после того, как интервьюер договорил, а не до.
Какая клавиша записывает звук?
На macOS это Cmd + Option + Z, на Windows — Ctrl + Shift + A. Комбинацию можно поменять в настройках горячих клавиш.
Слышно ли собеседника, если микрофон выключен?
Да. Микрофон и системный звук — два независимых источника. Собеседник приходит через системный звук, то есть через то, что играет в ваших наушниках или динамиках. Выключенный микрофон убирает из расшифровки только вашу собственную речь.
Видно ли собеседнику, что идёт запись?
Индикатор записи в строке меню macOS относится к вашей системе, и на демонстрации экрана он не появляется: окно приложения и системные индикаторы исключены из захвата. Но захват звука — это работа с микрофоном, и если вы демонстрируете весь экран на компьютере коллеги, индикатор в его системе, разумеется, не загорится.
Почему в расшифровке иногда появляется бессмыслица?
Так ведут себя все модели распознавания речи: на тишине или шуме они склонны выдумывать фразу. Мы отбрасываем такие куски по двум признакам — по зацикленности текста и по одновременно низкой уверенности и высокой вероятности тишины. Отдельный список отсекает типовые выдумки вроде «Продолжение следует». Если после фильтра не осталось ничего, приходит пустой ответ, а не выдуманная фраза.
