Митап meet-up
Voice AI Dev Meetup #1: голосовые технологии в продакшене
10 авг
Пн
Бесплатно
Россия, Москва
Никитский бульвар, 7Б, «Светлый лофт»
10 августа 2026 года Bitmanager.ai проводит в Москве открытый Voice AI Dev Meetup – встречу для разработчиков, которые работают с речевыми технологиями и голосовыми интерфейсами. Поговорим о распознавании и синтезе речи, перебиваниях и создании голосовых агентов, ведущих естественный диалог с пользователем.
Ждём опытных и начинающих разработчиков, ML- и Voice-инженеров, исследователей речевых технологий, создателей голосовых агентов и разговорных интерфейсов, продакт-менеджеров и всех интересующихся.
Спикеры
Евгения Заворина
Voice Engineering Lead @ Bitmanager.ai
Перебей меня, если сможешь: подводные камни перебиваний в голосовом агенте
Как голосовой агент понимает, что его перебили и нужно ли на это реагировать? Детекции голосовой активности для этого недостаточно: агенту приходится различать типы речевых сигналов, учитывать контекст и выбирать между скоростью реакции и точностью классификации. Не менее остро стоит вопрос с потерей контекста, который агент не успел произнести. На реальных сценариях разберём, как это влияет на естественность диалога и где заканчивается ML и начинается продуктовая логика.
Кирилл Бородин
Voice Engineer @ Bitmanager.ai (Interspeech’26 Author)
Твой ход: как мы учили модель понимать смену хода в диалоге
Как построить точную и быструю модель определения конца реплики в живом диалоге? Разберём BitTurn – наше решение на базе GigaAM-CTC. Оптимизация инференса с помощью int8 QAT и прунинга позволила ускорить модель почти без потери точности. Отдельно остановимся на решениях, которые дали наибольший прирост качества, поговорим про неоднозначные backchannel-сигналы и подготовку данных из реальных разговоров.
Максим Маслов
Senior Voice Engineer @ VK R&D (Senior Research Scientist @ lab260)
Как мы построили крупнейшую в России открытую полноцикловую экосистему речевого антиспуфинга
Можно ли построить универсальный детектор голосовых дипфейков, который работает на разных языках, датасетах и типах атак? Представим крупнейшую в России открытую полноцикловую экосистему речевого антиспуфинга: архитектуры AASIST3, Res2TCNGuard и семейство Spectra, русскоязычный бенчмарк RuASD, мультиязычный набор LRLspoof, бенчмарк синтетической дизартрической речи и открытую Speech Anti-Spoofing Arena. На результатах масштабного тестирования покажем, почему существующие решения обобщаются хуже, чем принято считать, и как системная работа с моделями, данными и протоколами оценки приближает к действительно универсальному детектору.
Денис Петров
Voice ML Research Engineer @ MWS AI
ESpeech: открытый русский TTS на трёх 4090, от датасета до синтеза с клонированием голоса
Открытых русских TTS стало много, но почти все они не заточены в первую очередь под русский: язык там идёт довеском к английскому или китайскому. Расскажем, как делаем ESpeech, где русский стоит на первом месте. Пройдём по стеку: пайплайн обработки данных и его масштабирование от первых 50 000 часов сырого аудио до гораздо больших объёмов, наш аудиокодек ECodec, обучение моделей. Всё на трёх 4090. Расскажем про наши эксперименты, в том числе те, что не сработали, и почему. Заодно представим RUAccent-bench, бенчмарк качества ударений в TTS-системах, и обсудим болячки современных TTS-архитектур.
Ждём опытных и начинающих разработчиков, ML- и Voice-инженеров, исследователей речевых технологий, создателей голосовых агентов и разговорных интерфейсов, продакт-менеджеров и всех интересующихся.
Спикеры
Евгения Заворина
Voice Engineering Lead @ Bitmanager.ai
Перебей меня, если сможешь: подводные камни перебиваний в голосовом агенте
Как голосовой агент понимает, что его перебили и нужно ли на это реагировать? Детекции голосовой активности для этого недостаточно: агенту приходится различать типы речевых сигналов, учитывать контекст и выбирать между скоростью реакции и точностью классификации. Не менее остро стоит вопрос с потерей контекста, который агент не успел произнести. На реальных сценариях разберём, как это влияет на естественность диалога и где заканчивается ML и начинается продуктовая логика.
Кирилл Бородин
Voice Engineer @ Bitmanager.ai (Interspeech’26 Author)
Твой ход: как мы учили модель понимать смену хода в диалоге
Как построить точную и быструю модель определения конца реплики в живом диалоге? Разберём BitTurn – наше решение на базе GigaAM-CTC. Оптимизация инференса с помощью int8 QAT и прунинга позволила ускорить модель почти без потери точности. Отдельно остановимся на решениях, которые дали наибольший прирост качества, поговорим про неоднозначные backchannel-сигналы и подготовку данных из реальных разговоров.
Максим Маслов
Senior Voice Engineer @ VK R&D (Senior Research Scientist @ lab260)
Как мы построили крупнейшую в России открытую полноцикловую экосистему речевого антиспуфинга
Можно ли построить универсальный детектор голосовых дипфейков, который работает на разных языках, датасетах и типах атак? Представим крупнейшую в России открытую полноцикловую экосистему речевого антиспуфинга: архитектуры AASIST3, Res2TCNGuard и семейство Spectra, русскоязычный бенчмарк RuASD, мультиязычный набор LRLspoof, бенчмарк синтетической дизартрической речи и открытую Speech Anti-Spoofing Arena. На результатах масштабного тестирования покажем, почему существующие решения обобщаются хуже, чем принято считать, и как системная работа с моделями, данными и протоколами оценки приближает к действительно универсальному детектору.
Денис Петров
Voice ML Research Engineer @ MWS AI
ESpeech: открытый русский TTS на трёх 4090, от датасета до синтеза с клонированием голоса
Открытых русских TTS стало много, но почти все они не заточены в первую очередь под русский: язык там идёт довеском к английскому или китайскому. Расскажем, как делаем ESpeech, где русский стоит на первом месте. Пройдём по стеку: пайплайн обработки данных и его масштабирование от первых 50 000 часов сырого аудио до гораздо больших объёмов, наш аудиокодек ECodec, обучение моделей. Всё на трёх 4090. Расскажем про наши эксперименты, в том числе те, что не сработали, и почему. Заодно представим RUAccent-bench, бенчмарк качества ударений в TTS-системах, и обсудим болячки современных TTS-архитектур.
Подписаться на похожие мероприятия
Хотите получать информацию о мероприятиях по нужной вам тематике?
Выбирайте тематику и подписывайтесь! Раз в неделю получайте подборку актуальных бизнес-событий для вас!
Похожие мероприятия
Рекомендуем
Реклама
Бизнес-завтрак
Искусственный интеллект: актуальное регулирование и практическое применение
24 сен
Чт
Бизнес-завтрак
Реклама
Семинар
Изменения налогового законодательства. новое в бухгалтерском учете и отчетности за 9 месяцев
25 сен
Пт
Семинар
Реклама
Конференция
ИИ в HR | Конференция по искусственному интеллекту и нейросетям для HR
30 сен
Ср
Конференция
Реклама
Форум
RUSSIAN FOOD-MARKETING FORUM 2026 | Форум производителей продуктов питания
01 - 02 окт
Чт-Пт
Форум
Реклама
Конференция
«Пром Закупки 2026. Осень» | 3-я всероссийская конференция о закупках в промышленности
08 - 09 окт
Чт-Пт
Конференция
Реклама
Конференция
IV HR-конференция Quorum «HR TECH + ИИ ТРАНСФОРМАЦИЯ 2026»
08 - 09 окт
Чт-Пт
Конференция
Реклама
Вебинар
Электронный документооборот для грузоперевозок: обзор практики и актуальных изменений
14 окт
Ср
Онлайн-трансляция
Реклама
Конференция
XXVI HR Конференция Quorum «COMPENSATION & BENEFITS FORUM RUSSIA 2026»
15 - 16 окт
Чт-Пт
Конференция
