Voice stuff
СтатистикаКанал про голосовые технологии. Чат группы @voice_stuff_chat Здесь говорят про свежие подходы и решения в областях распознавания и синтеза речи, голосовой биометрии и про машинное обучение в целом. Контакт: @frappuccino_o
- Последний пост
- 12:13
- Последнее чтение
- 10:54
- Постов за неделю
- 11
- Всего постов
- 30
- Тип
- открытый
- Язык
- русский
- Категория
- Образование
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 524
- 1/48двое суток
- 600
- 1/72трое суток
- 647
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Красивым людям проще найти работу? Британские учёные, подвиньтесь — свежий лонгрид The Guardian подтверждает неудобную правду: привлекательность влияет на карьеру куда сильнее, чем принято считать, а «премия за красоту» добралась до обычных офисов. Если раньше мы говорили про природный «эротический капитал» и харизму, сегодня правила изменились. Препараты для похудения, филлеры и пластика сделали апгрейд внешности настолько доступным, что для многих это стало базовым минимумом. Ради карьеры 15% людей старше 45 уже допускают пластическую хирургию, а каждый пятый — ботокс. На словах рекрутеры ставят опыт и хард-скиллы выше внешности. Но 15-летнее исследование выпускников MBA показывает, что красивые кандидаты чаще забирают лучшие офферы, а разрыв в доходах достигает $2500 в месяц. Когда работодателю прилетают сотни одинаково сгенерированных резюме, ухоженный вид работает как финальный фильтр. И это касается уже не только тех, кто напрямую работает с клиентами. Компании активно ведут соцсети и отправляют сотрудников на индустриальные тусовки. Лицо рядового сотрудника становится лицом бренда работодателя. И здесь возникает неприятная гипотеза. Когда одинаково вылизанные резюме, письма и презентации всё чаще производятся одними и теми же ИИ-инструментами, внешность может превратиться в один из последних сигналов, по которым кандидатов пытаются различать. Что делать и куда бежать? Никуда. Просто признать, что внешний вид стал частью профессиональной самопрезентации — наравне с резюме, речью и умением держаться. Ухоженность может помочь пройти первый фильтр. Но карьеру по-прежнему строят качества, которые нельзя взять в рассрочку в клинике эстетической медицины: харизма, суждение и навык читать людей. В общем, если вас вдруг не взяли на работу — не расстраивайтесь. Для мамы вы всё равно симпатяга. Просто приоритеты теперь выглядят так: 2025: нанимаем карьерного коуча. 2026: нанимаем стилиста.
Поставил на роутере OpenWRT Плюсы: • можно всё настраивать через claude через SSH минусы: • ssh не работает • wifi не работает • Роутер даже по проводу без своего IP адреса • Подключение к интернету не работает • Клод, соответственно, тоже не работает
ML System design Я тут готовлюсь к ML System Design собесу и там всё мастерство в том чтобы сделать большой reality check вообще системы которую мы строим, понять какие реально требования были чтобы порой вообще избежать дорогостоящего рисёрча. Это забавно ведь я хожу по работодателям и часто именно этим и занимаюсь - спрашиваю: “А вам вообще нужно тратить деньги на команду, видюхи или можно API-провайдером можно обойтись?” - и я хорошо знаю сценарии когда нужен отдел МЛ-щиков и когда нет. Короче, поразился тому что всё, за что я так активно обычно топлю, за то что меня часто уважают называлось простым ML System Design.
DeepSeek Harness (🔥 Score: 156+ in 1 hour) Link: https://readhacker.news/s/72DXE Comments: https://readhacker.news/c/72DXE
Stanford University выложил на YouTube полный курс по Agentic AI уровня graduate school — бесплатно. Курс называется CS329A: Self-Improving AI Agents. Всего 9 лекций от исследователей, которые работают над agentic LLM и системами, способными к самообучению. Что внутри: • агенты, которые сами генерируют данные для обучения; • агенты, которые проверяют собственные рассуждения; • агенты, которые сами придумывают задачи и пытаются их решить; • и главное — как создавать системы, которые могут самостоятельно становиться лучше. Начинается всё с фундаментальных вопросов — почему более крупные AI-модели обычно становятся умнее — и постепенно переходит к продвинутым архитектурам self-improving agents. Думаю много тут будет полезно. https://www.youtube.com/playlist?list=PLangBM27OtEA
Комьюнити развивает Balalaika На Hugging Face появился датасет paralingua_ru, построенный на базе Балалайки: Что в нём есть: 1) разметка спикеров по паралингвистическим характеристикам: пол, возраст, высота голоса, тембр и голосовые особенности вроде «звонкий», «бархатный» и т.д. 2) TTS-промпты для аудио: 223 тыс. уникальных промптов на 355 тыс. аудиозаписей 3) промпты сгенерированы не просто шаблонами, а с учётом POS-теггинга, dependency parsing, лексического анализа и особенностей текста: прямой речи, пола персонажа, модификаторов речи и других деталей Почему это важно? Такой датасет может помочь TTS-моделям лучше понимать инструкции про голос, стиль и персонажа - особенно на русском языке. Ближайший план автора - дообучить инструктивный ТТС на части датасета и показать. что подход действительно работает. Balalaika продолжает жить и развиваться силами комьюнити. Очень круто видеть, как открытые датасеты становятся основой для новых экспериментов. Ссылка на датасет: 🤗 https://huggingface.co/datasets/turnipseason/paralingua_ru
ребят, тыкайте, https://huggingface.co/spaces/TeraTTS/TTS, будет что то не так пишите в коменты - подправим
Постепенное улучшение В Японии есть такая традиция, которая стала знаменита благодаря успеху toyota - kaizen. Идея в том что маленькие, но постоянные шаги дают очень сильные результаты, даже порой лучше, чем скачки. Сами изменения могут быть атомарны - улучшение всего на 1%, но каждый день. И тут важна регулярность. Практически это означает что мы уходим от "за этот месяц мне нужно стать лучшим в LLM" к - почитаю 5 страниц книги - решу одну задачку - воспроизведу одну статью в неделю Ни один из этих шагов по отдельности ничего не меняет, но эффект от продолжительных усилий складывается. Конечно, тут есть ограничения как и в sgd: иногда нужны именно скачки. Но это просто приём, который можно использовать.
Code switching ASR Competition 😻 Mozilla запустила сореву по переводу. ЗПка слабенькая, но зато по нашей теме. Если кто-то хочет участвовать и собрать команду - отзовитесь! Меня заинтриговал indonesian-Javanese - там кстати все на бахасе довольно уверенно говорят, но вот на том же Бали говорят на Балийском. Не то чтобы знаю язык. Знаю наверно как привет и спасибо 😅 https://competitions.mozilladatacollective.com/competitions/1/lost-in-transcription/
Мы только что выпустили крупнейший открытый TTS-корпус для казахского языка: 600 часов, 11 839 дикторов. YO-CPT-kk — второй датасет в нашей серии YO-CPT после 6 000 часов русского корпуса, который мы открыли ранее. Это 157 тысяч одноголосных TTS-качества записей, автоматически извлечённых из 47 тысяч часов казахского YouTube. Казахский — язык с ограниченными ресурсами. До сегодняшнего дня крупнейший открытый TTS-корпус содержал 270 часов данных и всего 5 дикторов. В нашем датасете: 2 947 личностей объединены между разными видео; ещё 4 258 подтверждены с помощью анализа лиц; для каждого доступно текстовое описание персоны. В основе — тот же пайплайн, который мы использовали для русского языка, но с одним важным отличием. Существующие open-source ASR-модели для казахского оказались недостаточно качественными для ансамблевого распознавания, поэтому мы обучили три собственные модели: Whisper-large-v3-turbo, wav2vec2-BERT CTC, двуязычный ru-kk FastConformer. Их результаты объединяются пословно с помощью ROVER. Остальная часть пайплайна: каждый сегмент проходит VAD, проверку на одного говорящего и MOS-фильтр с порогом 3.0; аудио очищается от шума, нормализуется по громкости и выравнивается по словам с сохранением таймингов пауз; тексты содержат ударения, пунктуацию, а также нормализованную и исходную формы записи. Лицензия: CC BY 4.0 на аннотации и компиляцию датасета. Корпус предназначен прежде всего для continual pre-training TTS-моделей, но также подходит для ASR, speaker verification и turn detection. Ссылка: https://huggingface.co/datasets/NCSpeech/YO-CPT-kk И ещё один момент. Этот релиз — лишь небольшая часть всего казахского корпуса, который мы обработали. Мы открываем ту часть данных, которая принесёт пользу сообществу, а остальное сохраняем для коммерческих проектов. Идея серии YO-CPT проста: наш пайплайн не зависит от языка. Если для какого-то языка нет подходящих моделей, мы обучаем их сами. Уже есть русский и казахский, дальше — языки, которые нужны нашим клиентам. Если вашей команде нужны речевые данные для языка, который ещё никто не покрыл, — пишите. #TTS #SpeechData #OpenSource —— слова не мои - перевёл анонс из linkedin. канал @voicestuff
Каждое эссе Дарио Амодея вот так выглядит
Скажите кодовое слово “блять” AI агенту техподдержки чтобы переключиться на реального человека.
Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос. tldr: Мы делаем маленькие модели, чтобы агенты могли управлять GUI как люди. Наша модель встраивается во фронтир агента как рука-манипулятор. Клод думает, а мы смотрим на экран как на видео, берем на себя клики и прочие действия. https://x.com/SteelmanLabs/status/2082789336995528727?s=20 Большая просьба помочь хайпом в твиттере и лайком на HN (пост "You can't solve computer use by ignoring the interface") https://news.ycombinator.com/news
Парсер адресов У меня на github с 2017 года лежит проект по нормализации адресов. Он был очень увесистый - после регулярок и правил он искал в базе данных всех адресов и этот индекс занимал около 100гб. Так себе вариант, но это то, что работало в банке и то, что мне позволило очень быстро завести геоаналитику в Озоне в 2018 году. Прошло много лет и у этого проекта 41 лайк на гитхабе, что говорит о том что люди им заинтересованы и спрос есть, при том что у проекта миллион низковисящих фруктов. И вот, спустя 8 лет, я натравил codex на то чтобы его обновить. Теперь он нормально парсит адреса без базы. Там всё те же регулярки, но поверх них есть модель, которая пытается угадать город или улица и дом или квартира или строение. https://github.com/shigabeev/address-normalizer Устанавливается просто: pip install address-normalizer потом from address_normalizer import parse parse("г. Москва, ул. Тверская, д. 4, кв. 12") print(result.city.value) # Москва print(result.street.value) # Тверская print(result.house_num.value) # 4 print(result.apartment.value) # 12 print(result.normalized) # Москва, ул Тверская, д 4, кв 12 Лайк, шер, алишер 🤗
видео или голосовое, без подписи
Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling Up Real-world Acoustic Simulation Разбираем статью со скромным названием Mega-ASR. Основной вклад работы — улучшение распознавания сложных аудио. Также авторы собрали и выложили свой датасет — VOICES-IN-THE-WILD-2M. В реальных условиях, где есть разные шумы, ASR работает хуже. Так происходит, потому что шумов нет в данных. Кто-то пробует добавлять в данные отдельные шумы, но в обычно возникает не одна помеха, а целый комплекс. Авторы ставят перед собой цель получить SotA-модель на данных с разными типами шумов, и при этом не просесть на чистых данных. Выложенный датасет большой — на 11 тысяч часов. Состоит из синтетики с добавлением разных типов помех. Всего выделено семь «атомарных акустических эффектов»: 🔴Noise — аддитивный шум; 🔴Far-field — источник звука далеко; 🔴Obstructed — на пути звука есть препятствие; 🔴Echo & reverb — эхо и повторения звука; 🔴Recording Coloration — артефакты при записи или проигрывании; 🔴Electronic distortion — электронные искажения сигнала; 🔴Transmission dropout — пропадания при передаче. При генерации датасета пытались имитировать реальные ситуации (скажем, эхо в церкви), чего нет в датасетах, на которых учатся SotA ASR. Для каждого эффекта есть гиперпараметры, которые настраивают, чтобы комбинировать шумы. Так пытаются избежать ситуации, когда один эффект гасит другой. Всего есть 54 комбинации шумов. Авторы не делали для Mega-ASR свой претрейн, а использовали Qwen3-ASR c немного изменёнными SFT и RL, и обучали для него LoRA-адаптеры. SFT интересна тем, что проходила в три этапа: 1) Acoustic warm-up. Учат только акустическую часть — энкодер и алайнер (адаптер, который переводит hidden encoder в hidden LLM). Данные подают не все сразу, а увеличивают их сложность в несколько этапов. Сложность определяют по WER распознавания Qwen. На первом этапе подают записи с WER < 30, далее расширяют до WER < 50 и в конце — WER < 70. Записи с WER > 70 выкидывают с целью сохранить стабильность тренировок. 2) Semantic adaptation. Энкодер и алайнер замораживают, учат только LLM, уже на всех данных. 3) Joint training. Учат всё сразу — и LLM, и энкодер, и адаптер. RL хорошо работает там, где WER маленький. Тогда ошибки — это в основном word-level confusion, которые можно исправлять. Если WER большой, происходит развал, и обычный objective не помогает. Поэтому делают reward из двух частей: Статический rule-based reward — по сути MWER со штрафом за повторения. Динамический reward, состоящий из token-level refinement reward и sentence-level reconstruction reward. Token-level refinement reward рассчитывается как WER с небольшим изменением: для ошибок substitution добавляется разделение на hard и soft errors — в зависимости от того, насколько сильно предсказанное слово отличается от оригинального. Soft errors в реворде идут с меньшим весом, который регулируется гиперпараметром. Sentence-level reconstruction reward состоит из двух частей. Первая считается на базе LCS и оценивает, насколько хорошо восстанавливается структура предложения. Вторая часть штрафует за разницу в длине между гипотезой и таргетом. Веса между пословной и семантической частями реворда зависят от WER. Если он маленький, больше вклад пословной части, если большой — то семантики. Итоговый лосс складывается из базового и динамического с подобранными коэффициентами. Сравниваются с большим количеством моделей. На более зашумлённых датасетах (CHiME-4, VOiCES, NOIZEUS) модель прилично побеждает. На более чистых (LibriSpeech, Fleurs) — проигрывает, но цифры приемлемые. На собственном бенче также уверенно побеждают. С адаптивным роутингом, который позволяет использовать базовую тушку на чистых аудио, получили метрики, сравнимые с обычным Qwen, сохранив выигрыш на шумных примерах. Кроме экспериментов с подбором гиперпараметров, авторы сделали аблейшн для своего динамического реворда и сравнили его с использованием Gemini в качестве LLM-judge на RL-стадии. Получили сравнимое качество, выиграв по скорости обучения в три раза. Артур Яковлев ❣ Специально для Speech Info