DEV Community

Cover image for AI voice changer у мошенников: как в 2026 клонируют голос родственника за 3 секунды аудио
Promptra Team for Promptra

Posted on

AI voice changer у мошенников: как в 2026 клонируют голос родственника за 3 секунды аудио

Трубка плачет голосом твоей дочери. Она попала в аварию, нужны деньги, прямо сейчас, и не вздумай перезванивать - «телефон заберут». Через четыре минуты выясняется: дочь цела и вообще на горнолыжке. Это не мысленный эксперимент: 20 января 2023 года такой звонок получила Дженнифер ДеСтефано в Аризоне, и голос в трубке был синтезированным.

Технология, которая это делает, в быту называется AI voice changer. Чтобы собрать клон чужого голоса с совпадением около 85%, модели хватало трёх секунд чистой записи - такой замер приводила McAfee в отчёте «Beware the Artificial Imposter» ещё в 2023 году, а с большим массивом записей совпадение поднималось до 95%. Замеру три года, и порог с тех пор только снижался: первичных данных, что в 2026-м нужно больше материала, нет.

Дальше - без инструкций для мошенников. Только оборона: сколько уже украдено, почему подделку не слышит никто (есть цифры) и какой семейный протокол срабатывает, даже если клон идеален.

Как из трёх секунд чужой записи получается «ваш ребёнок»

Коротко: модель снимает с записи спектрограмму - своеобразный отпечаток тембра - и доучивает на ней генератор. Для убедительного клона хватает нескольких секунд, а для подмены голоса в реальном времени вообще есть бесплатные программы.

McAfee Labs нашла в открытом доступе больше десятка бесплатных инструментов клонирования, а часть сервисов стоит от $15 в месяц (тот же отчёт, опрос 7 054 взрослых в семи странах, апрель 2023). Бытовой AI voice changer реального времени - это, к примеру, открытый клиент w-okada: меняет голос на лету на моделях RVC, стыкуется с Discord, Zoom и OBS, задержка на видеокарте - меньше 100 миллисекунд. Программа бесплатна. Гайды в духе «как сделать голос няшки в дискорде» - самый безобидный её сценарий. Она же - технологическая база телефонного скама: остаётся подставить чужой тембр и набрать номер.

Отдельная индустрия - очеловечивание синтеза: в клон добавляют паузы, фоновый шум, всхлипы и сбивки, чтобы мозг слушателя сам дорисовал живого человека.

Исходный голос берут из сторис, голосовых сообщений и интервью: по опросу McAfee, 53% взрослых публикуют свой голос онлайн минимум раз в неделю. В России добавились две схемы добычи: «фейковый соцопрос» с длинными вопросами, чтобы записать речь (такую описывают в VisionLabs), и «фейковая вакансия актёра озвучки» - по данным Angara Security, число таких объявлений выросло с 1,2 тыс. в 2021 году до 7 тыс. в 2023-м. Президент Ассоциации банков России Анатолий Козлачков рассказывал, что его синтезированным голосом «пугали один очень солидный банк».

Модели, на которых это собирается, лежат в открытом доступе - и те же классы моделей (синтез речи, распознавание, текстовые LLM) легально доступны тебе самому. В provod.ai (российский OpenRouter) они собраны в одном чате и на одном API, оплата в рублях по ценам официальных провайдеров: можно заранее послушать, как звучит синтез, и натаскать семью на проверку.

Сколько уже украдено - и почему звонков меньше, а денег больше

Коротко: за 2025 год у россиян похитили 29,3 млрд рублей, вернуть удалось 5,9%. В первом квартале 2026-го мошеннических звонков стало на 45% меньше - но доля клонированных голосов в оставшемся трафике уже заметна.

Цифры Банка России из «Обзора операций, совершённых без добровольного согласия клиентов» (озвучены на ПМЭФ-2026): 29,3 млрд ₽ потерь за 2025 год, это +6,4% к 27,5 млрд ₽ в 2024-м, а число мошеннических операций выросло на 31,2%. Банки вернули пострадавшим 1,7 млрд ₽ - 5,9% от украденного.

Звонков при этом стало меньше: в первом квартале 2026-го их число упало на 45% год к году, доля среди входящих - менее 1%, в сети МТС мошеннические и спам-звонки - минус 74%. Но качество трафика изменилось: по данным vc.ru со ссылкой на «МегаФон», звонки с синтезированным или клонированным голосом - уже около 10% мошеннического трафика в сети (апрель 2026), а за 2025 год оператор заблокировал больше 865 млн таких вызовов. Там же, со ссылкой на МВД, - примерно 4 000 пострадавших от дипфейк-аватаров с начала года; источник - авторская колонка, а не официальная сводка, поэтому держим оговорку.

Мировой фон: ФБР IC3 насчитало около $893 млн заявленных потерь от мошенничеств с ИИ за 2025 год, из них $352 млн - у пострадавших старше 60 лет. CrowdStrike фиксирует рост вишинга на 442% за вторую половину 2024-го и всплеск deepfake-вишинга на 1 633% в первом квартале 2025-го. Deloitte прогнозирует потери от GenAI-фрода в США на уровне $40 млрд к 2027 году. Все цифры этого раздела - по состоянию на июль 2026.

Схема Как звучит Подтверждённый масштаб Что спасает
Экстренный звонок «от родного» Плач, «я попал в аварию», «меня задержали» Типичное требование $2 500-15 000 (ФБР) Кодовое слово и перезвон
«Виртуальное похищение» Крик родного, потом «похититель» диктует условия Кейс ДеСтефано: $1 млн, потом $50 000 Дозвон до «жертвы» по своему номеру
Дипфейк-совещание Видеозвонок с «руководством» компании Arup: ~$25,6 млн пятнадцатью транзакциями Перепроверка через головной офис
Сбор голоса «Соцопрос», «вакансия озвучки» Вакансии-пустышки: с 1,2 тыс. до 7 тыс. за два года (Angara) Не разговаривать долго с незнакомых номеров

Четыре хода одного звонка

Коротко: схема почти всегда одна - голос родного, захват разговора «авторитетом», запрет положить трубку, безвозвратный платёж. Узнаёшь конструкцию - и у тебя есть секунды на разрыв.

Ход первый - голос: три секунды знакомого тембра выключают критическое мышление быстрее любых слов.

Ход второй - авторитет. Трубку берёт «доктор», «полицейский» или «юрист»: роль, которой ты привык подчиняться. Ход третий - изоляция: «не клади трубку», «никому не звони», «это конфиденциально». Ход четвёртый - деньги: перевод на «безопасный счёт», курьер, код из SMS.

«Похититель» ДеСтефано требовал $1 млн, потом снизил до $50 000; афера развалилась за четыре минуты дозвоном до дочери, а 13 июня 2023 года ДеСтефано давала показания в подкомитете Сената США.

Корпоративная версия схемы дороже. В феврале 2024 года сотрудник инжиниринговой компании Arup в Гонконге перевёл мошенникам HK$200 млн - около $25,6 млн - пятнадцатью транзакциями на пять счетов. Он не ленился: он созвал видеосовещание, на котором все участники, включая «финансового директора», были дипфейками. Вскрылось всё при перепроверке через головной офис.

Можно ли услышать подделку?

Коротко: нет. В контролируемых тестах люди распознают дипфейки на уровне подброшенной монеты, а уверенность в собственном ухе с результатом не коррелирует.

В тесте iProov (2 000 потребителей из Великобритании и США, февраль 2025) только 0,1% участников верно определили все дипфейки и реальные образцы - хотя их заранее предупредили. При этом около 60% были уверены в своих силах, а 30% людей 55-64 лет и 39% старше 65 вообще не слышали о дипфейках. Оговорка обязательна: исследование заказное, iProov продаёт детекторы.

Незаказные данные невеселее. Метаанализ 56 исследований и 86 155 участников (Diel и соавторы, Computers in Human Behavior Reports, 2024) даёт среднюю точность распознавания 55,54%: по аудио - 62,08%, по видео - 57,31%. В эксперименте UCL (PLOS ONE, 529 участников) люди узнали синтезированную речь в 73% случаев - но первый автор Kimberly Mai отмечает, что тестовые образцы были «старыми» по меркам текущих моделей. То есть тембр человечным кажется даже там, где модель устарела.

Точность распознавания дипфейков человеком: метаанализ 55,54%, аудио 62,08%, видео 57,31%, UCL 73%, iProov 0,1%

Ориентиры-«швы» существуют: слишком ровный темп, уход от конкретных вопросов, категоричный запрет перезвонить. Но это ориентиры, а не защита. Оригинальность голоса на слух не проверяется, а уникальность тембра как «биометрического отпечатка» скомпрометирована самим фактом любой записи. Меня здесь напрягает вот что: совет «просто слушайте внимательнее» до сих пор раздают люди, которые сами не прошли бы тест iProov.

Что делать в первую минуту звонка

Коротко: не проверяй голос - проверяй процедуру. Пауза, закрытый вопрос, перезвон по своему номеру. Правило одной строкой: срочность плюс секретность равно скам.

  1. Пауза. Любое «срочно» - красный флаг. У настоящей беды есть пять минут на проверку, у мошенника - нет: его модель живёт, пока ты в разговоре.
  2. Закрытый вопрос, ответ на который знаете только вы двое. Не «как зовут кота» (это в соцсетях), а «что мы дарили бабушке на юбилей».
  3. Кодовое слово семьи. Договорись с близкими заранее, меняй раз в год, не храни в переписке.
  4. Положи трубку и перезвони по номеру, который записан у тебя. Схема ДеСтефано умерла именно на этом шаге - за четыре минуты.
  5. Никаких платежей «сейчас»: ни переводов, ни курьеров, ни «безопасных счетов».

Банк России предупреждал о схеме «голос родных» ещё в январе 2024-го. Аналитик Эльдар Муртазин рассказывал, что мошенники звонили ему с синтезом голоса его ребёнка - «совпадение полное». Защита, на которой сходятся эксперты, - то самое кодовое слово.

Вторая линия - проверка текста звонка. Перескажи содержание разговора в claud (Claude) или другую крупную модель и спроси прямо: похоже ли это на скам-сценарий, какие фразы - маркеры давления. LLM не детектор голоса, но скрипт мошенника текстуально однообразен, и модели его знают. Такой чек заводится из России сменой двух строк: ключ и base_url на единый API provod.ai - он совместим и с OpenAI-SDK, и с Anthropic, так что твой «Вася», ИИ-помощник на все случаи жизни, собирается в том же кабинете без переписывания кода.

Что этот протокол не решает

Коротко: протокол защищает от одного звонка, но мир безопаснее не делает. Не спасают ни приложения-детекторы, ни «просто не выкладывать голос», ни вера в собственное ухо.

Детекторы. Бенчмарк DeepFake-Eval-2024 на реальном контенте из соцсетей показал около 78% точности у коммерческих детекторов «в полях», а по оценке ВЭФ эффективность детектирующего ИИ падает на 45-50% вне лаборатории. Ставить семейную безопасность на такую монетку я бы не стал.

«Не выкладывать голос» - совет из параллельной вселенной: 53% взрослых и так публикуют его минимум раз в неделю. Синонимайзер и детекторы «ИИ-текста» здесь бесполезны вдвойне: они работают со словами, а не с тембром. И наконец, ИИ-грамотность: курсы вроде skillbox учат базе, но семейный протокол из пяти пунктов выше проще, дешевле и начинает работать сегодня вечером.

Что уже запрещено законом

Коротко: в США робозвонок с клонированным голосом без согласия абонента незаконен с февраля 2024 года, в России законопроект об охране голоса гражданина внесён в Госдуму, но ещё не принят.

FCC Declaratory Ruling 24-17 (8 февраля 2024, принято единогласно) признало ИИ-сгенерированные голоса «artificial voice» по закону TCPA: робозвонок с клоном без согласия - штраф от $500 до $1 500 за каждый звонок. С 1 апреля 2024-го действует правило FTC 16 CFR 461 против имперсонации, включая ИИ-контент, а первое предупреждение о «семейных» схемах с ИИ-голосом FTC выпустила ещё 20 марта 2023-го.

Кейс-индикатор скорости правосудия: «робозвонок Байдена» перед праймериз в Нью-Гэмпшире (январь 2024) был собран примерно за 20 минут и около $1. Организатору Стиву Крамеру FCC выписала штраф $6 млн в сентябре 2024-го - а в июне 2025 года суд оправдал его по уголовным обвинениям. Штраф есть, тюрьмы нет.

В России, по данным СенатИнформ, за первую половину 2025-го дипфейк-мошенничество выросло в 2,3 раза год к году, в открытом доступе - больше 50 тыс. ресурсов для создания дипфейков (оценка банкиров), а МВД насчитало 765,4 тыс. ИТ-преступлений за 2024 год. Внесённый в Госдуму законопроект предлагает запретить использование голоса гражданина, включая синтезированную запись, без согласия - с ответственностью вплоть до возмещения убытков.

Где граница между скамом и легальным синтезом голоса

Коротко: технология одна, разница - в согласии человека и цели. Кавер на «Офицеры» голосом Канье Уэста - шумная игрушка, звонок «мама, это я» - уголовная статья. Между ними - маркировка и честный контекст.

Первая волна дипфейков была звёздной: голоса знаменитостей - актрисы из интервью, музыканты, Жан-Клод Ван Дамм - идеальное сырьё, записей много и они в хорошем качестве. Но и у обычного человека сырья хватает: сторис и войсы. Мозг прощает подделку знакомому тембру - ИИ-песни «под Высоцкого» звучат «почти как настоящие», потому что память достраивает недостающее. Тот же трюк «оживляет» и стих Блока «Ночь, улица, фонарь, аптека» в прочтении нейросети: великого чтеца слушатель достраивает сам. Бытовая ветка технологии криминала не несёт: текст озвучивают голосом Мелстроя, ищут голос Сони Сафаровой, собирают ИИ-каверы «под Юру Шатунова», песни на стихи Ларисы Рубальской и каверы на «Грустную девчонку». В телефонной трубке работает тот же трюк.

Словарик запросов кластера - что ещё люди ищут рядом с этой темой и что это значит. Сгруппировал от близкого к далёкому:

Музыка и каверы - самая густая ветка рядом с темой:

  • «песенки чужими голосами» - ИИ-каверы; законность упирается в права на голос и композицию.
  • «рок баллады голосом кумира» и «промты для фонка» - музыкальная ветка тех же моделей, к скаму отношения не имеет.
  • «соната от нейросети», «создать гимн нейросетью» - генерация музыки, а не клонирование голоса.
  • «богиня моря», «матушка земля» - народные промты для ИИ-песен, безобидный хвост выдачи.
  • «минусовки Глента» - каверы блогеров, молодёжная линия запросов.
  • «аленький» - «аленький цветочек»: сказку-мюзикл и песню просят у нейросети целиком.
  • «гудвино» - именная ветка ИИ-песен из Suno; к телефонному скаму отношения не имеет.
  • «родина» - патриотические ИИ-песни и каверы.
  • «фара» - «Фара, ночь»: слушатели гадают, нейросеть ли это поёт, достоверного ответа у выдачи нет.
  • «шоколад» - ИИ-версии песни «Шоколад» («прости-прощай») и сказки про шоколад для Алисы.
  • «трактор» - «синий трактор» и «прокати меня на тракторе»: детские песни, минусовки, переделки.
  • «шапка» - «красная шапка» в Suno и шапка для ютуб-канала: два разных интента слиплись в одном слове.
  • «красавицы» - «русская красавица»: песни через Алису и картинки в Шедевруме.
  • «игорь» - ИИ-каверы под Игоря Корнелюка; рядом аудиокниги - это совпадение имени.
  • «эмодзи» - «создай песню по эмодзи» и посты с эмодзи: декоративная ветка генераторов.
  • «придумывания» - нейросеть для придумывания стихов и текстов песен: самый честный сценарий ветки.
  • «церковь» - люди спрашивают, одобряет ли церковь духовные песни, написанные ИИ.

Сервисы и сайты - их ищут с фонетическими опечатками:

  • «кондинский» - Kandinsky от Сбера: опечатка стабильная, но находит.
  • «гвен» - китайская модель Qwen в народной записи «гвено»; скачивают на смартфон.
  • «дельфин» - так в запросах зовут DeepSeek: «чат с дельфином» - это про него.
  • «манус» - ИИ-агент Manus: вход, русский язык, официальный сайт.
  • «марсик» - нейросеть-помощник для студентов; люди ищут отзывы.
  • «дипинс» - чаты с ИИ-персонажами и озвучка их реплик.
  • «астра» - голосовой ИИ-помощник «Астра» для ПК.
  • «гигачек» - «проверка на ИИ гигачек»: ищут детектор ИИ-текста, а не сам чат.
  • «рамблер» - почта с ИИ-помощником; половина запросов - как его, наоборот, отключить.

Курсы, книги и рабочие задачи:

  • «скиллбокс» - курсы по нейросетям; ищут отзывы перед покупкой.
  • «баранова» - Ксения Баранова и её школа SMM с нейросетями: та же ветка отзывов.
  • «халилов» - Дамир Халилов, «ChatGPT на каждый день»: книгу ищут бесплатно.
  • «зубарев» - стример; зрители выясняют, каким чатом он пользуется на стриме.
  • «кирилл» - Калужский, Пшинник, Вервольф: авторов курсов по нейросетям проверяют по имени.
  • «руслан» - Гамзат и Хасаншина: та же проверка авторов по имени.
  • «самоучитель» - книги-самоучители по ИИ и GPT с нуля.
  • «преподавателя» - нейросети в помощь преподавателю: справочники и бесплатные курсы.
  • «тетради» - «переписать текст как в тетради»: конспекты и имитация рукописного.
  • «искового» - нейросеть для составления искового заявления: структуру соберёт, проверять доводы - юристу.
  • «рецензию» - написать рецензию на статью с помощью ИИ: частый учебный запрос.
  • «трейдинга» - «какой ИИ хорош для трейдинга»: с нашей темой пересекается разве что словом «модель».
  • «компас» - чертежи в КОМПАС-3D: ищут нейросеть, которая сделает чертёж за студента.

Игры - вторая по густоте ветка:

  • «варфейс» - нейронки и «читы» для Warface; античит находит их быстро.
  • «дота» - ИИ-помощники для Dota 2 и старые карты с ботами.
  • «бедрок» - моды на ИИ-компаньона для мобильной версии майнкрафта.
  • «мобов» - моды на чат с мобами: та же игровая ветка.
  • «компота» - «коричневый компот»: майнкрафт-мультики, которые дети просят у Алисы.
  • «жителя» - голос жителя из майнкрафта для озвучки мемов: бытовое клонирование без жертв.
  • «дельтарун» - чаты с Крисом и другими персонажами Deltarune, нейроперевод пятой главы.
  • «форсакен» - чаты и озвучка персонажей Forsaken, аудио-фишки отдельным запросом.
  • «ведьмак» - чат с ИИ-персонажем и аудиокниги по вселенной.

Имена, персонажи и детские запросы к Алисе:

  • «малфой» - Драко Малфой: чаты с персонажем без регистрации.
  • «джек» - капитан Джек Воробей и Эпплджек: чаты с персонажами и озвучка.
  • «патруль» - сказочный и щенячий: мультики по запросу к Алисе и чат с Варей.
  • «царевна» - царевна-лягушка и мёртвая царевна: сказки читать и рисовать.
  • «мишки» - ми-ми-мишки: мультики и странный хвост «нейросеть 1 серия».
  • «теремок» - сказка и песня про теремок от нейросети.
  • «рыбку» - песню про золотую рыбку просят и у Алисы, и у нейросети.
  • «дабл» - «дабла бабла» и «пиковая дама»: детские мультики через Алису, опечатки никто не чинит.
  • «лакорн» - тайский сериал «ИИ-девушка»: ищут серии с русской озвучкой.
  • «бастард» - «Бастард с нейросетью» Виктора Корда: книгу ищут почитать, все три части.
  • «сад» - сценарии про детский сад и картинки для воспитателей: рабочая ветка Шедеврума.
  • «мужик» - от «алиса, найди мужика» до откровенного: вторая половина интентов режется фильтром площадок.

Перевод и языки - ветка голосовых помощников:

  • «немецкого» - перевод с немецкого на русский голосом и транскрибация.
  • «французская» - Mistral компания французская, а ищут в основном перевод с французского.
  • «украинские» - перевод с украинского и украинские песни в ИИ-обработке.
  • «индийский» - перевод с индийского и просьбы включить индийский фильм.

Быт, города и эзотерика:

  • «новосибирск» - погода и время для Алисы, офлайн-курсы по нейросетям для взрослых.
  • «ИИ-таролог», он же в запросах «таролог», «сонник», «астролог» и «астрология» - эзотерические чат-боты; к безопасности звонков не относятся.
  • «набить грамоту с нейросетью», «какой у тебя типаж» - развлекательные текстовые генераторы и тесты.

Спам-интенты и мусорный хвост:

  • «блондинка» - генерация портретов в Шедевруме; откровенная часть запросов режется фильтром.
  • «бдсм» - NSFW-чаты и картинки: площадки такое режут фильтром, к теме статьи отношения нет.
  • Почему в выдаче столько сео мусора по этой теме - потому что запросы смешивают музыку, игры и безопасность. Этот материал написан не ради сео, а ради протокола из раздела выше.

Когда provod.ai не подходит

Коротко: provod.ai закрывает доступ к моделям и оплату в рублях - дисциплину семьи он не установит.

Зона ответственности делится просто: проверить текст звонка, собрать семейного помощника, отрепетировать с семьёй распознавание скам-скриптов - это агрегатор умеет. Кодовое слово, перезвон и отказ платить «сейчас» - ваши договорённости, а не подписка. Если компании нужен антифрод на потоке звонков колл-центра с верификацией голоса - это другой класс решений, не чат с LLM. А если ты ищешь программу, которая сама отличит клон за тебя, - её не существует даже у вендоров детекторов: 78% «в полях» - их собственный измеренный результат.

Голос перестал быть доказательством личности - доказательством стала процедура. Хорошая новость в том, что процедура дешёвая: один семейный разговор и пять пунктов. Плохая - в том, что мошеннику хватит одного родственника, который этот разговор отложил.

Проверка подозрительного звонка в едином кабинете provod.ai: расшифровка и LLM-чек-лист

Собери семейный протокол за один вечер: договоритесь о кодовом слове, а потом прогони через модель пару выдуманных «звонков» - пусть она сыграет мошенника, а родители потренируются ломать сценарий. Все модели для такой тренировки собраны на provod.ai в одном чате и через единый API, оплата в рублях с карты РФ, для юрлиц - договор и закрывающие. Без VPN и без наценки: платишь официальный тариф, только в рублях.


provod.ai — понятный расчётный контур для юридических лиц

Переведите AI из личных оплат в нормальную закупку: компания получает рублёвые расчёты, договор, счёт и закрывающие документы, а техническая команда — единый API.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Документальный контур не маскирует дополнительную маржу: модели оплачиваются по официальным ценам 1:1, без наценки provod.ai.

Оформите AI для бизнеса: форма регистрации · цены на модели · защита данных по 152-ФЗ · реквизиты для договора

FAQ

Сколько секунд аудио нужно, чтобы склонировать голос?
По замеру McAfee 2023 года - три секунды чистой записи для совпадения около 85%, больший массив поднимает сходство до 95%. Первичных замеров 2026 года нет, но порог с тех пор только снижался.

Можно ли на слух отличить клонированный голос?
Практически нет: в тесте iProov всё верно определили 0,1% предупреждённых заранее участников, метаанализ даёт среднюю точность 55,54%.

Что сказать, если «родственник» звонит и просит денег?
«Я сейчас перезвоню тебе сам» - и положить трубку. Потом звонок по записанному номеру и кодовое слово. Если на том конце сопротивляются перезвону - это и есть ответ.

Работают ли приложения-детекторы дипфейков?
В лаборатории - неплохо, «в полях» - около 78% точности, вне лаборатории эффективность падает ещё на 45-50% (оценка ВЭФ). Как дополнение - можно, как основную линию защиты - нет.

Источники

Top comments (0)