tgindex
VF | Science

Генерацией музыки и всем, что связано с аудио ML я занимаюсь, а всем остальным ML интересуюсь) Делюсь знаниями, мыслями, событиями по своей карье, делаю анонсы своих онлайн/офлайн мероприятий. Автор: @varfolomeefff

Последний пост
2 авг.
Последнее чтение
12:45
Постов за неделю
0
Всего постов
47
Тип
открытый
Язык
русский
Категория
Музыка
В каталоге с
12 авг.
Подписчики
1 132
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
1 601
40 постов
Вовлечённость
141,4%
к подписчикам
Постов в день
0,0
всего 47
Упоминаний
4
каналов
Охват размещения
оценка
1/24сутки в ленте
471
1/48двое суток
539
1/72трое суток
582

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 2 авг.5501311

    Позволю себе поделиться историей… Я уже 4 месяца без работы живу жизнь Тяжелеющая история случилась в то время. Начал искать работку месяца 2 назад. Подался в Bland AI, Inworld, еще много куда. Самое интересное было с Bland AI, прошел 5 собесов и тестовое…

  • 2 авг.5932725

    Позволю себе поделиться историей… Я уже 4 месяца без работы живу жизнь Тяжелеющая история случилась в то время. Начал искать работку месяца 2 назад. Подался в Bland AI, Inworld, еще много куда. Самое интересное было с Bland AI, прошел 5 собесов и тестовое, на Английском. У меня разговорный Английский не очень. Я вообще не ожидал, что я умею говорить на нем для собесов. Сам удивился, когда смог. Намеренно я его не учил, лишь последние годы очень много читал, смотрел видео. Могу понимать все, а сам говорить это другое. Ну и вот… После защиты тестового на 5 этапе - мне написали такое (см. скрин) Я почти устроился на 280к баксов в год, с перспективой визы в США

  • видео или голосовое, без подписи

  • 2 авг.513101

    Гуляю такой возле дома на Ходынке… Думал отдохнуть от работы

  • 17 июл.680155из voicestuff

    🎉 Подготовили статью "Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants", с Ильёй Латышевым, которую приняли на Interspeech 2026 Слова Ильи: Это был мой первый подобный опыт, и теперь я могу с уверенностью сказать: если кажется, что всё, что может пойти не по плану, обязательно пойдёт не по плану — скорее всего, так и будет 😄 Переносы записей, сорванные дедлайны, организационные сложности, постоянные мелкие проблемы, которые по отдельности кажутся незначительными, но вместе сильно тормозят работу. В какой-то момент начинает казаться, что проект уже никогда не закончится. Но в итоге всё получилось, и я очень рад, что мы довели его до конца. За время работы я понял, насколько много мелочей влияют на качество речевого корпуса. Например: • желательно использовать одинаковые микрофоны и одинаковую аудиоцепочку для всех дикторов; • одинаковое расстояние до микрофонов; • необходимо контролировать уровень фонового шума и акустику помещения; • важно не менять настройки записи между сессиями; • стоит заранее продумать организацию записи, потому что именно она часто становится источником самых неожиданных проблем. Одной из особенностей нашего корпуса стали условия записи диалогов. Два актёра театра сидели напротив друг друга и читали реплики, видя мимику, жесты и эмоциональную реакцию собеседника. Несмотря на то что текст был заранее подготовлен, такое взаимодействие делало реплики значительно более естественными и выразительными. Это заметно отличается от записи, когда каждый диктор работает в одиночку и произносит свои реплики изолированно. В результате получился открытый студийный корпус выразительной русской разговорной речи: • 20 часов записей; • 3 профессиональных диктора — актёра театра; • широкий набор эмоций и разговорных стилей; • открытая лицензия для исследований. Корпус в первую очередь предназначен для файнтюна моделей синтеза речи. В статье мы также показываем результаты обучения моделей и субъективную оценку качества (MOS) для различных разговорных стилей. 📄 Статья на arxiv: https://arxiv.org/abs/2607.14310 📄Статья на hf: https://huggingface.co/papers/2607.14310 🤗 Датасет: https://huggingface.co/datasets/langswap/dialogs-ru-emotional-conversations 🎤 Демо: https://huggingface.co/spaces/frappuccino/dialogs-ru-tts Спасибо Илье за работу над этим проектом - это было очень непросто и ресурсозатратно и я очень хочу чтобы результаты нашей работы приносили пользу таким же исследователям речевых технологий как мы. Подписывайтесь на канал Ильи, он делает крутые обзоры там! @decent_researcher И на этот канал, @voicestuff

  • 5 июл.1 504111

    афтепати на ACL... фу а можно мне тоже?

  • 20 мая3 0772629

    Накручиваем просмотры 😇 https://youtu.be/NOdTBdAXdIM

  • 19 мая1 852125

    ❤️ Секция про ML в музыке на DataFest 2025! Посмотреть запись секции: https://vkvideo.ru/video-164555658_456241380?t=5h35m33s Отдельно доклады будут выложены на ютубе позже. Впервые за время существования датафеста (10 лет!) мною была собрана секция про…

  • 19 мая1 848611

    6. Дальше RL. В речи RL зашёл быстро, потому что есть объективные метрики. TTS-1 берёт α·R_WER + β·R_SIM + γ·R_DNSMOS, считает всё через Whisper/WavLM/DNSMOS и катит GRPO. Без разметчиков. Плюс хитрость - conditional activation: reward на эмоции активен только на сэмплах с тегом эмоции, иначе он бессмысленно штрафует базовые сэмплы. Qwen3-TTS делает DPO, потом GSPO для стабильности на разных задачах. В музыке всё сложнее, потому что объективных метрик там нет. Musicality, harmony, запоминаемость - субъективщина. Два разных подхода. LeVo делает multi-preference DPO: три оси (lyric alignment через PER, соответствие промпту через MuQ-MuLan, musicality через human seed -> reward model -> 60К пар), под каждую обучают отдельный DPO, потом линейно интерполируют веса трёх моделей. Если оптимизировать одну ось - другие проседают. Интерполяция обходит этот конфликт. ACE-Step v1.5 пошёл дальше всех. Они отказались от внешних reward моделей вообще и придумали intrinsic rewards - модель сама себе judge через свои внутренние свойства. Attention Alignment Score считается прямо из кросс-атенншн карт диффузии: насколько внимание покрывает все lyric-токены, насколько оно монотонно движется по времени, насколько уверенно сидит в осмысленных регионах. Через DTW аггрегируется в один скаляр, корреляция с человеческой оценкой выше 95%. Далее Pointwise Mutual Information: одна и та же LM играет роль Composer (текст -> audio codes) и Listener (audio codes -> текст). Reward - это насколько Listener восстанавливает исходный промпт. Если модель сгенерила что-то общее, Listener даст generic caption, PMI будет около нуля. Если сгенерила что-то конкретное и попадающее в промпт - PMI большое. Никаких внешних judge'ов, никакого bias, никакого дрифта на странных генерациях. И ещё ACE-Step применяет RL не только к генератору. У них GRPO ещё и на captioner'е в пайплайне разметки. Улучшается captioner - улучшается весь корпус - улучшается финальная модель. #audio #perfomances

  • 19 мая2 4551344

    👀 Audio Generation 2024-2026 Недавно собрался силами провести семинар в МИСиС от AIKC. Рассказал как сейчас делают генерацию музыки и речи. От подготовки данных из большых сырых корпусов, до применения RL. Поделился своими инсайдами и направлениями ресерча. Презу приложил к посту. Запись выложат на Stepic. Тут поделюсь сухой выжимкой без моих размышлений и комментариев) Структура семинара поделилась на общие паттерны для речи и музыки, и специфичные для речи и музыки. Некоторые идеи отлично ложатся с одного домена на другой, но еще не были применены для речи/музыки. 1. Говоря о данных, а у нас корпуса могут доходить до 5М часов как в Qwen3-TTS, или 1М часов как в Inworld TTS-1, или 27М семпов музыки как в ACE-Step-1,5... Хочется уметь автоматически и качественно отбирать данные для претрейна/CPT/SFT. В речи есть объективные метрики типа WER/PER, SIM, всякие MOS'ы. Это более приятный сценарий, в отличие от музыки, где нет объективных метрик. Поэтому сейчас хороший сценарий для музыки - использовать frontier LLM модели типа Gemini 2.5 Pro. Авторы ACE-Step предложили занятный self-evolving pipeline. 2. Говоря о репрезентациях аудио, сейчас идет смещение к аудио кодекам. В речи главный приоритет - стриминг. Низкий битрейт 12-25Hz, casual-only decoder для реалтайма, а попытки сжать битрейт еще ниже до 5Hz обычно неудачны, НО недавно вышел SiTok. В музыке стриминг не нужен, нам скорее хочется сделать кодек работающий с 48kHz аудио и длинным контекстом. Длина последовательности при 25Hz ~= 7500*количество кодбуков, бюджет растет до десятков тысяч токенов. Плюс хочется учитывать когерентность между треками: вокал и разные инструменты аккомпанемента. Авторы LeVo придумали классный кодек для этого. А для работы с длинным контекстом хорошее решение предложили авторы Qwen3-TTS, сделали curriculum по контексту с 8 до 32к токенов. Конечно сейчас также мейнстрим разными способами добавлять семантику в кодеки, стандарт - стиль Mimi Codec. 3. Собрав данные и определив репрезентации, подумаем о архитектуре. Тут мне нравится схема от BLIP3o-Next, хоть тут и про картинки. Их AR+Diffusion пайплайн. Накидывают RL на AR для хорошего понимания сцены, позиционирования объектов, прочей семантики. Потом через кросс-атеншн в DiT блоки добавляют инфу из AR блока. Почитайте работу) В речи подобный паттерн нарастает. Впрочем, говоря про pure AR: готовый стек LLM, in-context learning — voice cloning «из коробки», законы масштабирования, но бывает exposure bias, hallucinations, repetitions и качество ограничено codec bottleneck. Иначе гововря про Non-AR: параллельная генерация — нет последовательной задержки, continuous latents — нет codec bottleneck, нет exposure bias, но alignment text-audio — центральная сложность, long-form coherence хуже, чем у AR, тяжелее применять RL 4. Переходя к обучению, конечно увидим пайплайн PT->CPT->SFT->RL, а говоря про инференс и стримнг обратите внимание на техрепорт Iworld TTS-1. В музыке говоря про long-context снова обратите внимание на curriculum по длине от Qwen3-TTS, про структурное сегментирование у YuE/ACE-Step, dual-treck+mixed tokens generation от LeVo. 5. Для управляемости генерацией мейнстрим - LM как планировщик. Вместо промпт -> output делают промпт -> LM blueprint -> output. В речи это thinking pattern из Qwen3-TTS, активируется для сложных voice description промптов, как ризонинг в LLM. Плюс emotion/non-verbal tags ([whispering], [breathe]), которые в Inworld TTS-1 учат через LoRA на парных (neutral, stylized) данных - полный FT теряет базовую cloning capability. В музыке размах больше: ACE-Step делает Composer Agent, который раскладывает «sad jazz ballad» в YAML с BPM, key, structure, instruments, mood - DiT-рендерер занимается только акустикой. YuE добавляет structural progressive conditioning - генерация по сегментам [verse][chorus][bridge] с передачей контекста, авторы явно называют это CoT для музыки. #audio #perfomances

  • 12 мая1 0962211из aiknowledgeclub

    📊 Лекция 11: Advanced DL от AI Knowledge Club ⭐ Тема: Audio Generation ⭐ Лектор: Варфоломеев Захар Разберем современные пайплайны для генерации речи и музыки. Обсудим как делают данные из больших сырых корпусов, архитектуры моделей, обучение, влияние семантики и RL. Выделю практические инсайды, поделюсь своими идеями для последующих модификаций Ссылка на степик ▫ 14 мая (этот четверг) в 18:15 ▫ Онлайн (ссылку на трансляцию пришлём в чат)

  • 26 мар.1 50764из speechtech

    Interesting community on Reddit https://www.reddit.com/r/VoiceAutomationAI/ will host AMA session with Tony Robinson, one of the most knowledgeable person I know Upcoming AMA with Dr Tony Robinson (Founder Speechmatics) Excited to announce that Dr Tony Robinson will be joining Unio - The Voice AI Community powered by SLNG for a live AMA with builders & founders. If you’re building voice AI, you already know this: it works in demos… and breaks in production. Dr Tony has spent 36+ years in Voice AI, starting in 1989 at Cambridge where he built one of the earliest neural network based speech recognition systems, long before deep learning became mainstream. Today, Speechmatics powers voice AI across 50+ languages, with customers seeing 9x growth in voice agent adoption in 2025. 📅 Date: 27 March ⏰ Time: 10:30 AM PST / 11:00 PM IST 📍 Location: Reddit (r/VoiceAutomationAI) For the next 24 hours, he’ll be answering questions about: • What actually breaks in production voice AI (and how to fix it) • Accents, noise, latency & real-world edge cases • Designing reliable STT-LLM-TTS pipelines • Lessons from 35+ years building speech systems • Where voice AI is really heading (beyond the hype) • What he’d do differently if starting today If you're building in Voice AI, AI agents, or conversational automation, this is a rare opportunity to learn from someone who has been solving these problems for decades. Join the reddit community to drop questions👇 Link in the first comment.

  • 30 дек.2 312241

    А писать посты с разборами статей как то приелось, также есть нейронки, да и хочется делиться тем, что я знаю на практике длиною в год и более. Я в этом году много говорил про кодеки и авторегрссию в домене аудио (музыка, речь). Дальше будет порционно что-то иное, в течение года. Я просто выложу список самых интересных и ценных работ. По вопросам моей деятельности/таким-то инсайдам всегда можете обращаться в коменты/лс. С наступающим, всех благ!)

  • 30 дек.2 0195

    Продолжайте следить за каналом, потому что цели на 2025: ✔️ Понять какие цели и пути мне реально важны)) *️⃣Научиться грамотно распределять время и свои ресурсы *️⃣Расширять свои знания и навыки за пределы аудио ML *️⃣Сделать 100+ классных постов и стримов…

  • 30 дек.1 938142

    Продолжайте следить за каналом, потому что цели на 2025: ✔️ Понять какие цели и пути мне реально важны)) *️⃣Научиться грамотно распределять время и свои ресурсы *️⃣Расширять свои знания и навыки за пределы аудио ML *️⃣Сделать 100+ классных постов и стримов…

  • 18 дек.1 97034

    Audio2MIDI вошёл в ТОП-100 рейтинга Платформы университетского технологического предпринимательства В 2025 году на отбор подали заявки более 2300 команд со всей России, и наш проект сразу оказался в первой сотне 💯 Мы продолжаем развитие сервиса и уже внедряем…

  • 18 дек.1 938374из Audio2MIDI

    Audio2MIDI вошёл в ТОП-100 рейтинга Платформы университетского технологического предпринимательства В 2025 году на отбор подали заявки более 2300 команд со всей России, и наш проект сразу оказался в первой сотне 💯 Мы продолжаем развитие сервиса и уже внедряем улучшения, чтобы вывести конвертацию аудио в MIDI на новый уровень. Спасибо за ваше доверие❤️ —————— Audio2MIDI has entered the TOP 100 of the University Technological Entrepreneurship Platform ranking. In 2025, over 2,300 teams from across Russia applied for the selection, and our project immediately made it into the top hundred 💯 We continue to develop the service and are already implementing improvements to take audio-to-MIDI conversion to the next level. Thank you for your trust ❤️

  • 3 дек.1 810114

    В команду успешной музыкальной платформы с 15-летней историей ищем талантливого ML-разработчика, для качественного усиления, в связи с ростом. Плеер гитарных табов (https://www.songsterr.com/) — наш основной продукт, которым ежемесячно пользуются миллионы.…

  • 3 дек.2 1201942

    В команду успешной музыкальной платформы с 15-летней историей ищем талантливого ML-разработчика, для качественного усиления, в связи с ростом. Плеер гитарных табов (https://www.songsterr.com/) — наш основной продукт, которым ежемесячно пользуются миллионы. Мы работаем над сложными задачами в ML, включая разработку моделей для автоматической транскрипции музыки. Наши модели уже успешно создают табулатуры из аудио — вот пример результата (https://www.youtube.com/watch?v=rM4nAZOJoTQ). Это лишь часть наших проектов в области AI и музыки. Требуемые навыки: • Разработка и оптимизация DL-моделей, внедрение в прод • Глубокое знание современных DL-архитектур • Опыт тренировки на multi-GPU, оптимизация гиперпараметров • Работа с грязными user-generated датасетами: фильтрация, очистка • Желательно: аудиообработка и music information retrieval Стек: • Python + PyTorch • Accelerate/DeepSpeed/W&B Проекты завязаны на музыке и обучении — интерес к темам плюс. Главное — умение выдавать результат. Условия: • Полностью удалёнка, ставка от $9900/mo gross. • Оформление на контракт, можно из РФ/РБ. • Предпочитаем фулл-тайм, но график гибкий, сами выбираете когда работать. Хотите больше — допчасы с пропорциональной оплатой. В годовой уже ставке учтены месяц отпуска, 7 дней больничных, 14 праздников и компенсация техники, потому отдельно не оплачиваются. Процесс отбора: • Код-тест • Фидбек по тесту от нас • Если все ок — оплачиваемое тестовое (испытательный срок парт-тайм): реальная задача, график свободный, можно совмещать с текущей работой — никаких рисков Связь: @rammusin

  • 13 нояб.1 735295из sinecor

    Доклад вчера, кстати, безусловно удался. Большое спасибо Захару, он отлично подготовился, и этот семинар уже точно будет частью курса DL в этом году.) Спасибо всем, кто пришёл, ну а дальше будет опять something completely different...

VF | Science — tgindex