Мошенники научились использовать искусственный интеллект для клонирования не просто голоса жертвы, а её локального акцента и диалекта — и это резко повышает эффективность обмана. Разбираем исследования психологов и маркетологов о том, почему знакомое звучание речи усыпляет бдительность, и объясняет, как защититься от нового поколения голосовых афер.
Механика обмана. Представьте: вам звонят якобы из банка. Звонящий говорит с тем же местным акцентом, что и вы сами — скажем, характерным «уперским» выговором жителей Верхнего полуострова Мичигана, — предупреждает, что кто-то пытается перевести крупную сумму с вашего счёта, а затем просит назвать ПИН-код, чтобы остановить операцию.
Необычная просьба, безусловно, — возможно, этого было бы достаточно, чтобы насторожиться. Но, скорее всего, бдительность притупляется именно из-за узнаваемого голоса: собеседник говорит точь-в-точь как вы сами. Именно на это и рассчитывает мошенник. Технологии ИИ, обученные на огромных массивах речи из соцсетей и других открытых источников, теперь способны крайне убедительно имитировать местные акценты.
«Это стало настолько хорошо получаться, — говорит доцент психологии университета Абертей в Данди (Шотландия) Нил Кирк, — что люди по умолчанию склонны считать, будто слышат живого человека».
Масштаб технологии. О размахе технологии клонирования голоса говорит такой факт: самая популярная платформа генерации голоса, ElevenLabs, заявляет на своём сайте о библиотеке из более чем 10 тыс. голосов и способности клонировать голос, доступный, скажем, на YouTube или в TikTok, используя всего лишь 10-секундный аудиофрагмент. Подобные платформы (ElevenLabs не ответила на запрос о комментарии) обслуживают множество легитимных сценариев использования клонированных голосов — от развлекательного контента до маркетинга.
Боты становятся «настоящими». Ключевая проблема для потребителей в том, что современные, более совершенные ИИ-голоса совершенно не похожи на безликие, «роботизированные» голоса, знакомые по звонкам в службы поддержки.
В недавнем исследовании Кирк проверял, смогут ли жители Шотландии отличить записанную человеческую речь от синтетической. В первом эксперименте 150 участников из Шотландии прослушивали образцы человеческой и ИИ-сгенерированной речи на стандартном шотландском английском, а также на дандонском диалекте (Dundonian Scots), на котором говорит около 30% жителей Данди — города с населением всего 150 тыс. человек.
Большинство слушателей приняли за человеческую речь как настоящие, так и синтетические голоса. По словам Кирка, участники попросту не ожидали, что машина может звучать «как они сами». Ещё чаще их обманывал ИИ, произносивший фразы именно на дандонском диалекте, — это говорит о том, что чем более специфичен акцент, тем выше вероятность, что человек примет его за настоящий.
Эффект знакомого голоса. Исследование Нам Гён (Кимберли) Хён, профессора маркетинга Университета Цинциннати, демонстрирует, насколько сильным может быть эффект знакомого звучания голоса. В своей недавней работе Хён проанализировала 14 сезонов телешоу «Акулы бизнеса» (Shark Tank), где предприниматели пытаются убедить потенциальных инвесторов вложиться в их проект. Она обнаружила: чем ближе тембр голоса предпринимателя к голосу одного из членов жюри, тем выше вероятность, что этот инвестор согласится на сделку. Хён изучала именно сходство тембра — общего качества звучания голоса.
Как защититься. Как же потребителям обезопасить себя от этого нового уровня обмана? Если знакомое звучание голоса больше не может служить доказательством подлинности собеседника, нужно возвращаться к критической оценке самой истории, которую нам рассказывают, — считает руководитель исследовательского отдела компании по кибербезопасности Edgescan Джеймс Маллен. По его словам, стоит спрашивать себя: имеет ли смысл то, что мне говорят? Соответствует ли это тому, что я уже знаю об этом человеке или ситуации? Кроме того, всегда можно связаться с человеком отдельно — по номеру или каналу связи, который уже проверен и вызывает доверие.
Если кто-то звонит, представляясь сотрудником банка, стоит повесить трубку и перезвонить в банк самостоятельно — по номеру с выписки или банковской карты. Ни в коем случае не следует сообщать пароли или другие конфиденциальные данные по незапрошенному звонку, каким бы достоверным ни казался голос собеседника.
Но всё начинается с осведомлённости: если человек вообще не видит опасности в ситуации, никакие навыки защиты ему не помогут. Кирк из университета Абертей отмечает, что людям нужно пересмотреть привычное убеждение, будто локальная речь — это то, что ИИ пока не умеет воспроизводить. В его исследовании, когда участникам заранее сообщали, что ИИ теперь способен достоверно воспроизводить шотландский акцент, их склонность принимать синтетические голоса за человеческие заметно снижалась.
По мере того как мошенники масштабируют эту схему, всем нам стоит быть внимательнее — независимо от того, как именно мы произносим те или иные слова на родном диалекте.







