От обезьяны к LLM💡
СтатистикаЕсли вы пошли налево и вам сделали больно, то это не значит, что справа было бы лучше💡
- Последний пост
- 8 авг.
- Последнее чтение
- 10:54
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 129
- 1/48двое суток
- 147
- 1/72трое суток
- 159
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Посмотрел доклад с датафеста: Всеволод Викулин | Реальная автоматизация: в каких процессах AI-агенты приносят пользу. Вообще задумался об использовании агентов. Получается агенты хорошо умеют в Intelligence, а за Judgement должны пока отвечать люди. Но как люди научаться Judgement, если они не будут делать Intelligence ? Или я что-то не понимаю ? Т.е. получается, что теперь работать нужно в 100 раз больше, чтобы приобрести этот самый Judgement и успеть за быстро бегущей жизнью ?
Мне недавно показали скилл grill-me и это, один из самых полезных скилов. Смысл простой: агент не бросается сразу что-то делать, а сначала закидывает вопросами: уточняет цель, ограничения, спорные места, риски, критерии успеха. Потом сводит всё в понятный план, согласовывает его с тобой. И только после этого начинает выполнять задачу.
без подписи
без подписи
без подписи
без подписи
#БылоБольно #НоПонравилось Два года закрыты. Прошёл выпускной самое время поделиться впечатлениями. Если честно — ШАД я прошёл, но выжал из него далеко не всё. Послевкусие: 1. Вести заметки по мере прохождения материала. Обязательно. Это единственный совет, который я готов давать без оговорок, потому что проверил его с обеих сторон. 2. Курсы и оценки — не самое важное. Мне показалось, что важнее то, как именно ты ШАДом пользуешься. Можно просто закрывать домашки и получать за них оценки. А можно написать статью на топовую конференцию и слетать на неё с командой Яндекса. Разброс между этими двумя вариантами гораздо больше, чем разброс между хорошей и отличной оценкой за курс. Отдельно про курсы написал здесь и здесь. 3. Люди. Самое классное, чего на заочке мало, — это общение с другими ребятами и новые знакомства. Помимо, конечно, тех знаний, которые там приобретаются. Около-шадовские активности — статьи, летние школы, обеды с экспертами — стоят внимания как минимум не меньше самих курсов. 4. ШАД лучше заходит, когда за плечами уже есть опыт. Тогда он подсвечивает пробелы и углубляет то, что уже есть. Парадокс в том, что когда у тебя уже есть опыт и работа — уже как будто и не до ШАДа)) Тут вспоминается цитата из «Пигмалиона», про деньги, которые отец просил за свою дочь: "я их пропью, но зато как" Так же и здесь. Проучиться в ШАДе можно очень по-разному, и результат в конце будет совершенно разный. #НаверноеВсё #ТолькоНачинается
без подписи
без подписи
#БылоБольно #НоПонравилось ШАД. Курсы 2-го года. Третий семестр. Осенние даются проще: больше концентрации. Считаю его самым продуктивным за все два года — все курсы попали в меня. А в конце получилось съездить на Новый год в ШАД, что тоже было очень круто. Natural Language Processing Наверное, самый полезный курс в контексте текущего развития машинного обучения. Спасибо Ежу за классные лекции и семинары — его очень интересно слушать, и он хорошо умеет рассказывать сложные вещи простым языком. Внутри курса было соревнование на Kaggle с RAG — там пришлось плотно повозиться с генерацией и LoRA. Минус ровно один: у старых домашек были сломаны зависимости, из-за этого пришлось немного пострадать :( Генеративные модели Сложный курс, некоторые вещи я так и не осознал до конца. Курс сложный и требует большой самоотдачи. Смотрит на генеративки через призму работы с изображениями: основной вес — на диффузионных моделях, а авторегрессионные, VAE, GAN и NF даны довольно обзорно. Глубинное зрение и графика Хорошо проработанный курс, классные домашки. Именно на нём мне продали идею про методы предобучения при работе с картинками — и я ей, наверное, уже задолбал всех своих коллег)) Четвёртый семестр. Был самым тяжёлым, так как подъехали приятные жизненные хлопоты которые начали отнимать достаточно много времени, и из-за нехватки времени перестал вести заметки по пройденному материалу, да и домашки сдавал либо за день перед дедлайном либо после (до этого 3 семестра старался себе такого не позволять). Self-Driving Cars Если у вас нет опыта работы с облаками точек и с ros2 — лучше где-то его заиметь до курса. У меня не было, и всё, что было связано с облаками точек, давалось очень тяжело. А чтобы сделать домашку по ros2, пришлось сначала пройти курс на Stepik. Но за то прикольно понимать как работает автопилот на машинах. Обучение с подкреплением Теоретически нагруженный курс: семинаров практически нет, большую часть времени занимают лекции. Домашки классные и сложные, но чтобы реально глубоко погрузиться, нужно много времени. У меня его не было в этом семестре, поэтому я достаточно порехностно прошёл( Вычисления на графических процессорах при помощи C++/CUDA Курс не попал в меня. Познакомился с базовыми концепциями программирования на CUDA, но глубоко не изучил. При этом сами параллельные вычисления заставляют смотреть на одни и те же вещи по-другому, и это достаточно круто. #НаверноеВсё #ТолькоНачинается
без подписи
без подписи
#БылоБольно #НоПонравилось ШАД. Курсы 1-го года. Первый семестр. Всё было в новинку: не было понимания, как выстраивать планирование времени, что нужно делать, что не нужно, когда и на что обращать внимание. В конце семестра на пробных собеседованиях обнаружил, что курс вроде бы закрыт, а в голове осталось мало, знания разрозненные и не структурированные. Собственно, после этого и решил начать куда-то писать и структурировать информацию — так появился этот канал. Про Obsidian я тогда ещё не знал) Алгоритмы и структуры данных Не знаю на кого расчитан данный курс. Есть пару вопросов, даже не к сложности, а к устройству: после прочитанной лекции сразу дают задачи, которые как-то хитро используют материал, и нет промежуточной ступени, а хотелось бы конечно) Из хорошего в курсе классные ревью. Реально хорошо помогают понять, как нужно структурировать и декомпозировать программу. Машинное обучение В целом хороший курс, про классичиское машинное обучение и базу базовую в deep learning, но курс пробежал мимо меня, т.к. в этом же семестре были алгосы и C++, которые требовали гораздо больше внимания, и машинному обучению доставалось гораздо меньше времени. В итоге как раз на пробных собеседованиях я понял, что курс частично был прослушан зря:( Теория игр Взял просто для себя, в универе, где я учился, теории игр не было, а хотелось удовлетворить своё любопытство иузнать основные концепции и прикольные вещи, которые можно применять на практике. Курс полностью оправдал ожидания — несложный и интересный) Вот, например, оттуда игра на доверие: https://ncase.me/trust/ Обучение языку C++, ч. 1 После алгоритмов — второй по сложности курс семестра. Много маленьких задач на реализацию разных структур данных и на использование различных концепций: move-семантика, RAII, обёртки над старым C-кодом и так далее. Запомнились две большие БДЗ: raytracer и интерпретатор функционального языка Второй семестр. Весенние семестры всегда идут тяжело: гормоны, хочется погулять и какого-то движа, птички поют, а не вот это всё. Но, чтобы не получилось как в первом семестре начал вести заметки по курсам, которые проходил. Часть тех заметок до сих пор лежит в самом верху канала, и именно они потом очень помогали мне при подготовке к собеседованиям. Алгоритмы и структуры данных, ч. 2 Выбирал между С++ ч.2 и алгосами, и сейчас скажу с уверенностью, что выбрал неправильно. Проходить не понравилось, и только сильнее убедился в тех выводах, которые сделал после первой части. (Остался немой вопрос, если мне в первом семестре не понравились алгосы, то почему я их выбрал во втором? - Ответ: люблю боль страдания и унижения, но нет, ревью в первом семестре мне понравились, да и целом подумал, что потом будет проще готовится к алго собесам) Машинное обучение, ч. 2 Во втором семестре отдал приоритет этому курсу и речевым технологиям. Курс достаточно общий по deep learning и является фундаментом, на который потом ложатся NLP, CV, Speech и всё остальное — ровно то, что от него и требуется. Внутри курса ещё было AIDAO с задачами на fMRI. Часть моих заметок по этому курсу лежит в самом верху канала. Речевые технологии У меня уже был опыт работы с речью (TTS, ASR), и курс помог расширить, углубить и систематизировать эти знания. Отдельно хочется сказать спасибо Роме Кайлу — за хорошо проработанный курс и классные лекции) Именно на нём я впервые поймал мысль, ШАД сильно по-разному заходит в зависимости от того, с каким опытом ты в него приходишь. Рекомендательные системы Курс классный и достаточно сложный, но по ходу многое встало по полочкам. Ещё во время курса было организовано соревнование на Kaggle — ранжирование товаров в выдаче Яндекс Лавки. До этого я практически не участвовал в соревнованиях подобного рода, и мне очень понравилось) #НаверноеВсё #ТолькоНачинается
🎉 Подготовили с Ильёй Шигабеевым статью "Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants", которую приняли на Interspeech 2026. Это был мой первый подобный опыт, и теперь я могу с уверенностью сказать: если кажется, что всё, что может пойти не по плану, обязательно пойдёт не по плану — скорее всего, так и будет 😄 Переносы записей, сорванные дедлайны, организационные сложности, постоянные мелкие проблемы, которые по отдельности кажутся незначительными, но вместе сильно тормозят работу. В какой-то момент начинает казаться, что проект уже никогда не закончится. Но в итоге всё получилось, и я очень рад, что мы довели его до конца. За время работы я понял, насколько много мелочей влияют на качество речевого корпуса. Например: • желательно использовать одинаковые микрофоны и одинаковую аудиоцепочку для всех дикторов; • одинаковое расстояние до микрофонов; • необходимо контролировать уровень фонового шума и акустику помещения; • важно не менять настройки записи между сессиями; • стоит заранее продумать организацию записи, потому что именно она часто становится источником самых неожиданных проблем. Одной из особенностей нашего корпуса стали условия записи диалогов. Два актёра театра сидели напротив друг друга и читали реплики, видя мимику, жесты и эмоциональную реакцию собеседника. Несмотря на то что текст был заранее подготовлен, такое взаимодействие делало реплики значительно более естественными и выразительными. Это заметно отличается от записи, когда каждый диктор работает в одиночку и произносит свои реплики изолированно. В результате получился открытый студийный корпус выразительной русской разговорной речи: • 20 часов записей; • 3 профессиональных диктора — актёра театра; • широкий набор эмоций и разговорных стилей; • открытая лицензия для исследований. Корпус в первую очередь предназначен для файнтюна моделей синтеза речи. В статье мы также показываем результаты обучения моделей и субъективную оценку качества (MOS) для различных разговорных стилей. 📄 Статья на arxiv: https://arxiv.org/abs/2607.14310 📄Статья на hf: https://huggingface.co/papers/2607.14310 🤗 Датасет: https://huggingface.co/datasets/langswap/dialogs-ru-emotional-conversations 🎤 Демо: https://huggingface.co/spaces/frappuccino/dialogs-ru-tts Отдельное спасибо моему соавтору за огромную работу над проектом. Если вам интересны речевые технологии, синтез, ASR и голосовой ИИ, очень рекомендую его Telegram-канал Voice stuff: @voicestuff. Там регулярно появляются разборы свежих статей, моделей и новостей из мира Speech AI.
🎙 audiogear обновился Обкатал инструмент на 27 датасетах и собрал все грабли в новую версию. 🛡 Один битый файл больше не роняет прогон. Реальная история: один кривой mp3 убивал набор на 549k клипов, а клип длиной 2 мс валил миллионный golos. Теперь любой сбой на клипе (не только OOM) на любом пути исполнения — серийном, CPU-параллельном, батчевом, prefetch — превращается в sentinel-значение (NaN/−1), и прогон едет дальше. А чтобы не получить «тихий мусор», серия сбоев подряд честно останавливает шард: это уже не битые данные, а сломанная модель/конфиг. 💾 Resume внутри шарда. Раньше kill/OOM хоста на 90% большого шарда = пересчёт с нуля (часы GPU). Теперь каждая метрика ведёт чекпоинт по клипам — перезапуск той же команды доделывает только остаток. Включено по умолчанию. 🎧 QA-отчёт с прослушкой у порогов*(`examples/qa_report.py`). Один self-contained HTML на датасет: гистограммы всех метрик с линиями порогов фильтра и — главное — встроенные плееры с клипами вплотную к порогу с обеих сторон. Отсеянные звучат нормально → порог завышен; прошедшие звучат плохо → занижен. Калибровка порогов на слух за 10 минут вместо «на глаз». 🗣 GigaAM-v3 как метрика: батчевый e2e-транскрипт с пунктуацией и регистром, выведенными прямо из акустики, плюс CER к референсу — сразу и «пунктуация по аудио» для наборов без неё, и agreement-фильтр для ASR-размеченных. 🤖 SKILL.md — готовый Agent Skill для Claude Code: кладёте файл во внешний проект, и агент сам знает, как поставить audiogear, написать конфиг, запустить, домержить шарды и собрать QA-отчёт — включая все подводные камни. Из мелкого, но выстраданного: дедуп id при слиянии шардов, схема CSV больше не теряет колонки, fallback на soundfile там, где ffmpeg давится валидными mp3, батч-фонемизация для темпа речи. Всё покрыто тестами (68, CPU-only). 🔗 https://github.com/lIkesimba9/audiogear
Claude сбросили лимиты, продолжаем работать.
🎙 audiogear — как разметить миллионы аудиозаписей для TTS Выложил инструмент, которым готовлю датасеты под синтез речи. Указываешь папку с аудио → получаешь таблицу, где у каждой записи дописаны фичи: MOS, SQUIM (STOI/PESQ/SI-SDR), SNR, pitch, темп речи, выразительность, bandwidth, WER/CER, пол, эмоция. Плюс две вещи, на которых обычно спотыкаются: 🔹 Консенсус-ASR для аудио без текста — гоняет несколько русских моделей (GigaAM + Whisper + T-one) и берёт медоид по CER. Галлюцинация одной модели просто отбрасывается, в довесок — оценка уверенности. 🔹 Спикер-лейблинг с порогом — присваивает id только когда это безопасно, иначе оставляет unknown. Не сольёт двух дикторов в один голос. И любую модель с HuggingFace (классификация или регрессия) подключаешь строкой в ямле — без кода. ⚡️ Про эффективность — это главное: • батч с бакетами по длине под VRAM-бюджет → GPU на 70–90%, а не на 20%; • длинная запись не роняет прогон — лестница OOM (батч пополам → окна → CPU → NaN); • параллельные дорожки CPU∥GPU — DSP-метрики считаются под инференсом, бесплатно; • модели грузятся один раз на воркер, а не на каждый шард; • масштаб от одной GPU до SLURM-кластера, прогоны resumable. 📝 Подробный разбор «что умеет / за счёт чего быстро / как гонять»: habr , medium 🔗 Код: https://github.com/lIkesimba9/audiogear
Как то я уже делал агента для игры в blackjack. Решил провалидировать мои результаты с помощью Claude Code. В прошлой версии у меня вышло: Q-learning + подсчёт карт + сплит давали плюс. С помощью Claude Code перепроверил код — и плюс исчез. «Выигрыш» держался на двух тихих багах: — бутстрап в терминальных состояниях (агент тянул «будущую награду» из уже закончившихся раздач); — сломанный график epsilon (исследование не затухало, а росло). После фикса казино честно выигрывало во всех вариантах. Хуже того — подсчёт и сплит делали только хуже: раздували Q-таблицу до сотен тысяч состояний, которые нечем заполнить. 🛠 Что пришлось изменить, чтобы выйти в плюс по-настоящему: ① убрать счёт из состояния игры — играем простую базовую стратегию (~280 состояний); ② вернуть счёт в размер ставки (bet spread по true count); ③ углубить пенетрацию колоды. 📈 Результат. Матожидание в плюсе по-честному — не только «на раунд», но и на единицу денег (+0.4…0.7%). Ссылка на английскую версию статьи на medium. Ссылка на репозиторий (в репозитории лежит обновленная версия статьи и на русском языке).
Посмотрел доклад Ежа про LLMы ≠ Мы. Нечеловеческие приёмы в рассуждениях языковых моделей с attention. Если коротко, то пока что не понятно как думают LLM и думают ли они вообще. Но несколько основных мыслей из доклада напишу ниже: Часть LLM, которая позволяет LLM-мам думать это Attention. Attention — это не просто «механизм внимания», а способ несколько раз переосмыслить вход (подсветить важные токены для ответа), прежде чем прийти к ответу. Именно поэтому модели могут собирать смысл из разных частей контекста. Но attention сам по себе не учитывать позиции входных токенов, для этого нужно использовать RoPE. RoPE (Rotary Position Embedding) кодирует позицию токена через поворот вектора. Вектор признаков разбивается на пары координат, и каждая пара поворачивается со своей частотой. Так модель получает информацию о порядке токенов не через явные позиционные признаки, а через геометрию пространства. Отсюда же вылезает интересный эффект: если ключи и запросы уже посчитаны, они как будто «живут» вместе с памятью контекста. Это удобно, особенно с KV cache, но у такого подхода есть и ограничение — модели не умеют по-настоящему забывать и переосмыслять прошлое, как это делает человек. YARN — еще один способ расширять работу с длинным контекстом: старые токены как бы «доворачиваются» на нужный угол, чтобы модель лучше удерживала дальние зависимости. Благодаря YARN и RoPE токены можно «шарить» (доворачивая их на нужный угол) между несколькими LLM, и это может улучшать решение задач. Если перед задачей загрузить в контекст мусор, модель начинает работать хуже и генерирует меньше токенов <think>. Похоже, качество рассуждения сильно зависит не только от самой задачи, но и от того, как устроен контекст вокруг нее. Значит, контекст — это не просто память, а рабочее пространство, где очень многое определяется способом представления информации.
29 мая выступал на конференции «Иванниковские чтения» с докладом «Обучение доменно-инвариантных представлений для дерматоскопических изображений». В работе исследовал переносимость моделей между различными доменами. Под доменом в данном случае подразумеваются разные дерматоскопы, условия съёмки и популяции пациентов. Для решения задач доменной адаптации и выравнивания распределений использовал BYOL в сочетании с triplet loss, что позволило сформировать более устойчивые признаковые представления. В результате удалось получить прирост порядка 5% на кросс-доменных данных.