Notebookcheck Logo

Клонированный голос по телефону: как его не распознать

Пожилая женщина с седыми волосами и в очках разговаривает по телефону в светлой гостиной, прижимая ладонь ко виску.
ⓘ Kaboompics.com / Pexels
Дождитесь, пока голос станет металлическим, и только после этого перечисляйте деньги.
Существует шесть признаков, по которым якобы можно распознать синтетический голос по телефону. Два из них не упоминаются ни в одном источнике, три — технически устарели, а тот, который по-прежнему действует, не имеет никакого отношения к звуку. Крупнейшее на сегодняшний день исследование, посвящённое прослушиванию, также показывает, что люди не становятся лучше в распознавании подделок. Они всё хуже верят настоящим голосам.

В пятницу днём в июле в доме 80-летней женщины в Кюлунгсборне на побережье Балтийского моря в Германии зазвонил телефон. Звонивший представился врачом: он сообщил, что её внучка стала виновницей серьёзного ДТП, в результате которого погиб человек, и что необходимо внести залог в размере 30 000 евро, иначе ей грозит тюремное заключение. Затем трубку взяла другая женщина, представившаяся дочерью жертвы. Полиция Ростока в своём заявлении от 27 июля, переведённом с немецкого, написала: «Её голос настолько сильно напоминал голос её настоящей дочери, что 80-летняя женщина сначала поверила этой истории». Пенсионерка отправилась за деньгами. По дороге в Росток она встретила своего настоящего внука, рассказала ему об этом, и он вызвал полицию. Дело так и осталось на стадии попытки.

Был ли задействован клонированный голос, никто не знает. Полиция об этом не сообщает, и никто это не проверял. Именно в этом и заключается проблема, о которой идёт речь в данной статье.

Ведь то, что все консультационные рубрики обещают на протяжении многих лет, — это ответ на вопрос «как она могла это узнать?». С этой целью распространяются шесть признаков. Они звучат правдоподобно, их можно встретить повсюду, и большинство из них уже не соответствуют действительности.

Шесть признаков, рассмотренных поочерёдно

Источником этого списка является страница о дипфейках, опубликованная BSI — Федеральным ведомством по информационной безопасности Германии. Именно этот текст с тех пор все копируют.

Эта страница сама по себе выдаёт свой возраст. В разделе, посвящённом мерам противодействия, в нём по-прежнему содержится ссылка на «проект регламента о системах искусственного интеллекта» Европейской комиссии, который предусматривал бы обязательную маркировку. Этот проект уже давно стал законом. Закон об искусственном интеллекте вступил в силу 1 августа 2024 года, а предусмотренные им обязательства по обеспечению прозрачности применяются с 2 августа 2026 года.

Обзор шести распространённых признаков, позволяющих распознать клонированные голоса, с указанием их статуса: четыре признака устарели или действительны лишь частично, два не имеют источника, один остаётся актуальным.
ⓘ Notebookcheck
Из шести признаков сохранился лишь один. И он не имеет никакого отношения к звучанию.

Здесь следует обратить внимание на два момента. Во-первых, два из наиболее часто упоминаемых признака вообще отсутствуют на странице BSI. Там нет ни «отсутствия фонового шума», ни «отсутствия звуков дыхания». Эти утверждения появились в результате повторения, при этом ни один авторитетный источник и ни одно исследование никогда их не проверяли.

Во-вторых, из оставшихся четырёх признаков металлический звук является самым известным и в то же время наименее убедительным.

Почему задержка исчезла

BSI указывает «заметную задержку» в качестве признака и даёт техническое объяснение: система должна принять часть контента, прежде чем сможет его преобразовать. Раньше это соответствовало действительности. Сейчас — уже нет.

Чтобы понять причину, необходимо разграничить две технологии, которые в повседневной речи обе называются «голос ИИ».

При преобразовании текста в речь (TTS) пользователь вводит текст, а система его озвучивает. При преобразовании голоса (VC) человек говорит, а система лишь меняет тембр. Интонация, эмоции, дыхание и способность отвечать на вопросы — всё это исходит от реального человека.

Для звонка, в ходе которого жертва задаёт вопросы и плачет, пригодна только вторая технология. Причём она работает в режиме реального времени. По результатам измерений, проведённых компанией Koe AI на обычном настольном процессоре без видеокарты, задержка метода LLVC составляет 19,7 миллисекунд, QuickVC — 97,6, а RVC — 189,8. Задержка при обычном мобильном соединении составляет от 100 до 200 миллисекунд. Преобразовательный слой длительностью 20 миллисекунд теряется в линии связи, прежде чем кто-либо успеет его услышать.

Остаётся вопрос об исходном материале. «Достаточно трёх секунд» — эта фраза повсеместно сопровождает данную тему. Она происходит из двух источников, которые часто путают. Серьёзным источником является VALL-E — система Microsoft Research, представленная в январе 2023 года, которая осуществляет синтез на основе трёхсекундного образца, хотя измерения проводились на чистых аудиокнигах и студийных записях. Более популярным источником является цифра из исследования, проведённого в мае 2023 года поставщиком программного обеспечения для безопасности McAfee, методология которого так и не была опубликована.

Результаты современных исследований, посвящённых спонтанной повседневной речи, выглядят более реалистично. Исследование Барселонского суперкомпьютерного центра 2026 года показывает, что при сокращении объёма исходного материала с 7,7 до 5,5 секунд сходство голоса с системой F5-TTS снижается примерно на 31 процент. При использовании StyleTTS2 выходной текст к тому же становится частично неразборчивым.

Таким образом, честное разграничение заключается в следующем. Нескольких секунд достаточно для «узнаваемого сходства». Для того чтобы «выдержать весь телефонный разговор», требуется больше — судя по имеющимся данным, примерно от десяти до шестидесяти секунд чистой непрерывной речи. В лондонском исследовании, в котором клоны действительно было невозможно отличить от реальных голосов, на каждый голос использовалось около четырёх минут исходного материала.

Кстати, BSI самостоятельно провело подобный эксперимент, и эта деталь более примечательна, чем любые цифры. Для демонстрационного видео агентство клонировало голос своего тогдашнего президента Арне Шёнбома. Для этого было использовано около десяти минут аудиозаписей, взятых из общедоступных видео, которые, по собственным словам агентства, были «лишь среднего качества». Фраза, произнесённая искусственным голосом, звучит так: «Я не настоящий, и пока что вы можете это распознать. Однако по мере совершенствования технологии вам будет очень, очень сложно это сделать». Вторая половина этой фразы и является темой остальной части данной статьи.

Дело обстоит иначе

В мае 2026 года Николас М. Мюллер и Вэй Хернг Чунг из Института прикладной и интегрированной безопасности имени Фраунгофера опубликовали крупнейшее на сегодняшний день исследование по данной теме, посвящённое анализу речи. 1 768 участников, 35 532 индивидуальных оценок, 138 систем синтеза речи — данные, непосредственно сопоставимые с базовым исследованием 2021 года.

Ожидалось, что люди стали хуже распознавать подделки. Однако результаты показали обратное.

Что касается подделок, точность практически не изменилась — 71,2 % против 72,9 %. Ухудшились показатели в отношении реальных записей: точность снизилась с 72,7 % до 64,1 %. Люди не стали хуже распознавать синтез. Они стали хуже доверять настоящим голосам. Авторы называют это «сдвигом скептицизма».

Для телефонного звонка в половине двенадцатого ночи это означает нечто неприятное. Любой, кто решает в следующий раз слушать более внимательно, в основном сдвигает порог, при котором начинает не доверять собственной дочери. Совет прислушиваться к звуку заметно ухудшает ситуацию, а не улучшает её.

Второй вывод из того же исследования завершает перечень. Наиболее трудно распознаваемыми оказались не экзотические исследовательские системы, а коммерческие сервисы и системы, основанные на языковых моделях, — от 61,3 до 65,9 процента. Наиболее легко распознавались старые, технически более простые методы — с показателями от 75,4 до 76,8 процента. То, что любой может заказать с помощью кредитной карты, звучит наиболее реалистично.

Статья Лондонского университета королевы Марии, опубликованная в журнале PLOS ONE в сентябре 2025 года, приходит к тем же выводам. В данном исследовании голосовые клоны были признаны человеческими в 58 % случаев, а настоящие голоса — в 62 % при тех же условиях. Исследователи прямо подчеркивают, что клоны не превосходят настоящие голоса. Их статья озаглавлена «Голосовые клоны звучат реалистично, но (пока) не гиперреалистично». Они не звучат более реально, чем настоящие голоса. Они звучат точно так же реально, и этого вполне достаточно.

Автоматический детектор, использованный в исследовании Fraunhofer, демонстрировал точность выше 94,5 процента при всех условиях. Машины по-прежнему слышат разницу. Люди — нет.

Гистограмма. Уровень выявления подделок в период с 2021 по 2026 год останется практически неизменным и составит около 72 процентов. Уровень выявления подлинных записей снизится с 72,7 до 64,1 процента.
ⓘ Notebookcheck
Люди по-прежнему распознают подделки. Они все реже верят настоящим голосам.

Что показывают немецкие данные, а что — нет

6 августа Федеральное управление уголовной полиции Германии по запросу информационного агентства dpa обнародовало данные из полицейской статистики преступности за 2025 год. Результаты свидетельствуют о двух тенденциях. Число случаев мошенничества с использованием «бабушкинского» и «шокового» сценариев сократилось с 6 658 до 4 798, однако сумма убытков при этом выросла. Что касается мошенников, выдающих себя за сотрудников полиции, оба показателя выросли, причем убытки увеличились на две трети. Это указывает на то, что количество преступлений сократилось, но они стали более целенаправленными, а суммы ущерба в каждом отдельном случае возросли.

Таблица из статистики преступлений, составленной немецкой полицией за 2025 год. Мошенничество с участием «бабушек и дедушек» и «шоковые звонки»: 4 798 случаев и ущерб в размере 49,0 млн евро. Мошенничество с участием лиц, выдающих себя за сотрудников полиции: 4 646 случаев и ущерб в размере 49,5 млн евро.
ⓘ Notebookcheck
Число случаев мошенничества с участием пожилых людей сократилось, однако суммы убытков при этом остаются такими же значительными.

А теперь самое важное предложение: в статистике преступлений не фиксируется, был ли задействован искусственный интеллект. По Германии нет ни одной достоверной цифры о том, сколько «шоковых звонков» было совершено с использованием клонированного голоса. Любой, кто приводит такие данные, не проводил соответствующих измерений.

Однако это не мешает распространению подобных цифр. Наиболее часто цитируемая цифра — общий ущерб в размере 10,6 миллиарда евро — взята из опроса 2 000 потребителей, проведённого Глобальным альянсом по борьбе с мошенничеством в июне 2025 года, и охватывает все формы мошенничества, а не только мошенничество с использованием ИИ. Со временем эта цифра превратилась в оценку Федерального управления уголовной полиции и Европола, которую ни одно из этих ведомств никогда не давало. Аналогичная ситуация наблюдается с предполагаемым полумиллионом мошеннических звонков, которые, как утверждается, Федеральное сетевое агентство зарегистрировало в январе 2026 года. Эта цифра получена из приложения для определения номера звонящего и учитывает сообщения от его собственной базы пользователей.

Заявления властей на самом деле носят более осторожный характер. Федеральное управление уголовной полиции сообщило агентству dpa, что имитация убедительного голоса внука, если переводить с немецкого, «возможна даже без глубоких технических знаний с использованием общедоступных систем искусственного интеллекта». Это заявление касается возможности, а не конкретного случая. На странице немецкой полиции, посвящённой профилактике преступлений, связанных с «шоковыми звонками», искусственный интеллект и клонирование голоса до сих пор вообще не упоминаются.

Один из недавних случаев показывает, почему осторожность оправдана. 29 апреля 2026 года полиция Верхнего Пфальца сообщила о трёх завершённых мошенничествах с использованием «шоковых звонков», произошедших за один день в Регенсбурге и Амберге. Все три разговора велись на русском языке и были целенаправленно направлены на русскоязычных пенсионеров. Человек, который свободно общается на русском языке и гибко реагирует на вопросы 89-летнего пенсионера, — это, безусловно, живой человек на другом конце провода.

Что действительно помогает

Если выслушивание не помогает, остаётся единственный вариант — сменить канал общения. Все эффективные меры вытекают из этой единственной идеи.

Повесьте трубку и перезвоните сами. Немецкая полиция формулирует это на своём сайте по профилактике мошенничества следующим образом (перевод с немецкого): «Немедленно положите трубку. Это не является невежливостью, это даёт вам возможность перевести дух и собраться с мыслями». А также: «Свяжитесь с звонящим или с кем-то, кому вы доверяете, по номеру, который вам уже известен». Именно последняя часть имеет решающее значение. Не кнопка повторного набора, а номер из вашей собственной адресной книги, поскольку отображаемые номера могут быть подделаны.

Кодовое слово или вопрос, на который может ответить только настоящий человек. Полиция рекомендует договориться о «кодовом слове для идентификации по телефону», а полиция Верхнего Пфальца добавляет, что оно должно быть лёгким для запоминания и сложным для угадывания. На своей странице, посвящённой мошенничеству с участием пожилых людей, тот же орган рекомендует более надёжный вариант: «Спросите звонящего о вещах, которые может знать только настоящий родственник или знакомый». Кодовое слово можно забыть в состоянии шока. А прозвище семейной собаки с 1998 года — нет, и никакая языковая модель не сможет его угадать, поскольку этой информации нигде не существует.

Здесь следует сделать одно важное замечание. Звонящие реагируют на вопросы плачем, давлением времени и передачей трубки якобы адвокату. Одного лишь вопроса недостаточно. Необходимо сначала повесить трубку, а затем перезвонить.

Измените свою запись в телефонном справочнике. Это самый эффективный и наименее известный совет. На своей странице, посвящённой мошенничеству с участием бабушек и дедушек, немецкая полиция выражается необычно прямо (перевод с немецкого): «Мошенники используют записи в телефонных справочниках для выбора жертв телефонного мошенничества. Старомодные имена или короткие телефонные номера подсказывают им, что за этой записью стоит пожилой человек». Тем, кто желает остаться в списке, следует сократить своё имя. На той же странице размещена готовая форма для оператора связи. Для жертв телефонного мошенничества смена номера, как правило, осуществляется бесплатно.

Ничего не передавайте и в случае сомнений звоните по номеру 110. Предупреждение полиции кратче любого объяснения: «Никогда не передавайте деньги или ценности, такие как драгоценности, незнакомцам, даже полиции». Сообщайте об этом, даже если дело осталось на стадии попытки. Только так можно выявить закономерности.

Новая обязанность по маркировке здесь не помогает

Обязательства по обеспечению прозрачности, предусмотренные Законом об искусственном интеллекте, вступили в силу 2 августа 2026 года. 5 августа Баварский центр защиты прав потребителей кратко изложил, что это означает, и привёл именно этот случай (перевод с немецкого): «Это прямо включает синтетические голоса. Любой, кто получает звонок или голосовое сообщение, созданное с использованием клонированного голоса, должен быть об этом проинформирован».

Формально эта обязанность возлагается на звонящего, а исключение для чисто частного, непрофессионального использования не распространяется на преступную группировку, действующую на коммерческой основе. На практике для жертвы это ничего не меняет. Никто не соблюдает обязанность раскрытия информации, которая лишила бы преступление его смысла. Обеспечение соблюдения осуществляется в административном порядке с наложением штрафов в размере до 15 миллионов евро на компании, имеющие юридический адрес и оборот, а не на анонимных звонящих из-за рубежа. С точки зрения уголовного права это по-прежнему квалифицируется как мошенничество в соответствии со статьёй 263 Уголовного кодекса Германии, точно так же, как и раньше.

Татьяна Хальм, руководитель отдела по правовым и цифровым вопросам Баварского центра консультирования потребителей, сама говорит об этом (перевод с немецкого): «Новые правила обеспечивают большую прозрачность. Однако мошенники не соблюдают правила, поэтому отсутствие метки не является гарантией безопасности».

Именно эта фраза заменяет весь перечень контрольных вопросов. Не нужно ждать появления какой-либо метки и прислушиваться к какому-либо звуку. Есть только второй канал.

Google LogoAdd as a preferred source on Google
Mail Logo
Steffen Zahn, 2026-08-17 (Update: 2026-08-17)