Как OfferHack слышит вопросы интервьюера

Последнее обновление: 11 сентября 2026 · Проверено: 11 сентября 2026

Приложение работает не как диктофон. Оно постоянно держит в памяти последние тридцать секунд звука, а нажатие клавиши забирает то, что уже прозвучало. Из этого следует главное правило: нажимать нужно после того, как интервьюер договорил, а не перед тем, как он начнёт.

Главное

  • Приложение не подключается к звонку. Оно слушает звук самого компьютера — то, что играет в динамиках, и то, что слышит микрофон.
  • Запись идёт в кольцевой буфер на тридцать секунд. По нажатию клавиши забираются последние тридцать секунд, а не начинается запись с этого момента.
  • Микрофон выключается отдельно от системного звука. Тогда в расшифровку попадёт только речь собеседника, без вашей.
  • Весь захват целиком снимается одной клавишей, и системный индикатор записи гаснет.

Коротко

Звук берётся с самого компьютера: то, что играет в наушниках, и то, что слышит микрофон. К звонку приложение не подключается, ссылку на встречу не спрашивает и в списке участников не появляется.

Клавиша записи по умолчанию — Cmd + Option + Z на macOS и Ctrl + Shift + A на Windows. После нажатия запись уходит на распознавание, а расшифровка попадает в поле ввода.

Откуда берётся звук

Источников два, и работают они независимо. Системный звук — это всё, что воспроизводит компьютер, то есть голос собеседника в видеозвонке. Микрофон — ваша собственная речь.

Как устроен захват на разных системах
СистемаСистемный звукМикрофон
macOSСистемный перехват звукового потока. Работает без виртуальных звуковых устройств и без стороннего драйвераШтатный аудиодвижок системы
WindowsПетлевой захват вывода: то же, что слышите выШтатный захват устройства ввода
Ни один из способов не требует прав в самом приложении для видеозвонков и не вмешивается в его работу. Для macOS нужны системные разрешения на запись экрана и микрофон, для Windows — на микрофон.

Оба потока смешиваются в одну дорожку. Поэтому в расшифровке одного фрагмента может оказаться и вопрос интервьюера, и ваш ответ.

Почему именно тридцать секунд

Запись идёт непрерывно в кольцевой буфер: новые данные вытесняют старые, и в памяти всегда лежат последние тридцать секунд. Нажатие клавиши копирует содержимое буфера и отправляет его на распознавание.

Тридцать секунд — это компромисс. Длиннее означает дороже и медленнее: распознавание тарифицируется по длине записи, а ждать ответа дольше на собеседовании невозможно. Короче означает риск не захватить вопрос целиком, потому что развёрнутые вопросы на секции по системному дизайну занимают двадцать секунд и больше.

Практическое следствие. Если вопрос оказался длиннее тридцати секунд, в буфер попадёт только его конец. В такой ситуации проще нажать клавишу дважды: один раз в середине вопроса, второй после его окончания.

Микрофон можно выключить

В настройках есть отдельный тумблер микрофона, по умолчанию включённый. Когда он выключен, системный звук продолжает писаться, а ваша речь в расшифровку не попадает.

Это удобнее, чем кажется. Расшифровка становится чище: в ней только вопрос собеседника, без ваших «ага» и раздумий вслух. Модель получает на вход вопрос, а не диалог, и отвечает точнее.

Отдельно от этого работает выключатель всего захвата сразу: Cmd + Option + R на macOS и Ctrl + Option + R на Windows. Он останавливает и микрофон, и системный звук, а индикатор записи в системе гаснет. Настройка переживает перезапуск приложения, поэтому если захват был выключен вчера, сегодня он останется выключенным.

Что происходит с записью дальше

Запись сжимается и уходит на сервер, где её расшифровывает модель распознавания речи. По умолчанию она настроена на русский язык. Расшифровка возвращается в поле ввода, откуда вы отправляете её модели вместе с остальным контекстом.

Распознавание тарифицируется как фиксированные тридцать секунд независимо от того, сколько в записи было речи. Поэтому нажимать клавишу на всякий случай, когда никто не говорит, невыгодно.

Перед отправкой приложение проверяет громкость и отсекает тишину локально. Это экономит и время, и кредиты: если в буфере ничего не было, запрос на сервер не уходит вовсе.

Как отсекаются выдуманные фразы

У всех моделей распознавания есть общая особенность: на тишине и шуме они склонны выдумывать текст. В расшифровке появляется фраза, которой никто не говорил, чаще всего из обучающих данных: титры, благодарности, обещания продолжения.

Мы отбрасываем такие куски по двум независимым признакам. Первый — зацикленность: если модель повторяет одно и то же, текст сжимается подозрительно хорошо, и это видно арифметически. Второй — сочетание низкой уверенности модели в собственном результате с высокой вероятностью того, что речи в этом фрагменте не было вовсе. Одного признака мало, поэтому второй срабатывает только вместе с первым.

Сверх этого работает список типовых выдумок: они повторяются от записи к записи и вычищаются по точному совпадению. Если после фильтра не осталось ничего, приходит пустой ответ. Это сделано намеренно: лучше показать, что расслышать не удалось, чем подсунуть модели фразу, которой не было.

Если ничего не расслышало

Что означают сообщения об ошибке
СообщениеЧто проверить
Не услышали системный звук за последние тридцать секундЗвук идёт в другое устройство вывода, или собеседник молчал. Проверьте, что слышите его сами
Слышно слишком тихоГромкость входа микрофона в настройках системы. Частый случай — микрофон ноутбука при включённых наушниках
Не удалось получить звук с микрофонаМикрофон занят другим приложением. Захват перезапускается сам, достаточно повторить
Не удалось расслышать речьВ буфере была тишина либо всё содержимое отсеял фильтр выдуманных фраз
Недостаточно кредитовДневной лимит исчерпан. Сбрасывается раз в сутки, у платных планов есть месячный пул

Отдельная частая причина на macOS — наушники, подключённые как гарнитура. В этом режиме система переключает звук на узкополосный профиль связи, качество падает, и распознавание ошибается чаще. Если микрофон наушников не нужен, выключите его в настройках приложения: система вернёт звуку полное качество.

Какие вопросы стоит ожидать на разных этапах и где подсказка помогает меньше всего, разобрано отдельно: скрининг, секция по языку, системный дизайн.

Частые вопросы

Приложение подключается к звонку как участник?

Нет. Оно берёт звук с вашего компьютера напрямую, как любая программа записи экрана. Ссылку на встречу вводить не нужно, и в списке участников приложение не появляется. Часть ИИ-ассистентов на рынке устроена иначе: они заходят в звонок отдельным ботом и видны всем.

Нужно ли нажимать запись до вопроса?

Нет, и это главное отличие от диктофона. Приложение всё время держит в памяти последние тридцать секунд звука. Нажатие забирает то, что уже прозвучало. Поэтому нажимать нужно после того, как интервьюер договорил, а не до.

Какая клавиша записывает звук?

На macOS это Cmd + Option + Z, на Windows — Ctrl + Shift + A. Комбинацию можно поменять в настройках горячих клавиш.

Слышно ли собеседника, если микрофон выключен?

Да. Микрофон и системный звук — два независимых источника. Собеседник приходит через системный звук, то есть через то, что играет в ваших наушниках или динамиках. Выключенный микрофон убирает из расшифровки только вашу собственную речь.

Видно ли собеседнику, что идёт запись?

Индикатор записи в строке меню macOS относится к вашей системе, и на демонстрации экрана он не появляется: окно приложения и системные индикаторы исключены из захвата. Но захват звука — это работа с микрофоном, и если вы демонстрируете весь экран на компьютере коллеги, индикатор в его системе, разумеется, не загорится.

Почему в расшифровке иногда появляется бессмыслица?

Так ведут себя все модели распознавания речи: на тишине или шуме они склонны выдумывать фразу. Мы отбрасываем такие куски по двум признакам — по зацикленности текста и по одновременно низкой уверенности и высокой вероятности тишины. Отдельный список отсекает типовые выдумки вроде «Продолжение следует». Если после фильтра не осталось ничего, приходит пустой ответ, а не выдуманная фраза.

Готовитесь к собеседованию?

OfferHack — ИИ-помощник на собеседовании: слышит вопрос интервьюера и за секунды подсказывает ответ прямо на экране. Не виден при демонстрации экрана.

Узнать про OfferHack

Остались вопросы?

Если у вас есть вопросы или замечания по этому документу, напишите нам: admin@offerhack.tech