RnD ML Team
СтатистикаRnD ML @ Sber-AI Admin: @hukenovs Repos: https://github.com/ai-forever/
- Последний пост
- 14 авг.
- Последнее чтение
- 14:47
- Постов за неделю
- 6
- Всего постов
- 52
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии (по похожим)
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 948
- 1/48двое суток
- 1 086
- 1/72трое суток
- 1 171
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
🧩 STARM: Открытый фреймворк для рекурсивных reasoning-моделей от AI Forever Наша команда R&D NLP представила STARM — open-source фреймворк для обучения рекурсивных reasoning-моделей. 📌 TLDR STARM — фреймворк для рекурсивных моделей, способных к многошаговым рассуждениям. Мы нашли оптимальную архитектуру, стабилизировали обучение и получили SOTA на алгоритмических бенчмарках. На выходе единая модель для всех задач + поддержка test-time scaling. 🧠 Зачем? Рекурсивные модели, когда один блок применяется многократно, теоретически эффективнее трансформеров для алгоритмических задач, но на практике страдали от нестабильности и плохой воспроизводимости. STARM пытается решить эти проблемы. ⚙️ Что внутри — Системный поиск лучшей конфигурации рекурсивного блока (нормализация, residual, gating) — Стабилизация обучения: gradient clipping, adaptive LR, curriculum по глубине — Единая архитектура для сортировки, графов, арифметики и символических задач — Test-time scaling: можно увеличить число шагов рекурсии при инференсе без дообучения 📊 Результаты — 94.2% accuracy на алгоритмических задачах — новый SOTA — Спец. трансформеры: 89.1%, open-source LLM: 76.3% — При увеличении шагов рекурсии 4 → 32 точность растёт на +7.4% — Сходимость в 2 раза быстрее, дисперсия результатов ↓40% 🖥 GitHub 📄 Хабр 💚Авторы работы Инесса Фёдорова @notn3ss Юлиана Шахвалиева @YulianaShakhvalievaa Будем признательны за лайки на Хабре! 🙏 #reasoning #opensource
🇪🇺Доступность цифровых сервисов в ЕС Немного в тему предыдущего поста. С 28 июня 2025 года в Евросоюзе ввели обязательные правила для исполнения частным и государственным бизнесом на рынке ЕС. Европейский акт доступности (European Accessibility Act, EAA) — это директива Евросоюза, которая обязывает делать цифровые продукты и повседневные услуги удобными для людей с ограниченными возможностями, людей с инвалидностью и пожилых граждан. 🌍 На что распространяется Закон затрагивает широкий спектр цифровых и электронных товаров, а также сферу услуг: — Интернет-магазины, сайты и мобильные приложения — Электронные книги и софт для их чтения — Банковские и финансовые онлайн-услуги — Терминалы самообслуживания, банкоматы и билетные кассы — Смартфоны, компьютеры, планшеты и операционные системы — Сервисы транспорта и аудиовизуальных медиа — Главные требования закона 📌Главные требования закона 1) Стандарты доступности: Цифровой контент должен отвечать международным критериям (например, WCAG), включая корректную работу с программами чтения с экрана, контрастность и управление с клавиатуры. 2) Проектирование: Доступность должна закладываться на этапе создания продукта, а не добавляться в последний момент. 3) Ответственность: Правила распространяются на всех производителей, импортеров и продавцов, работающих на территории ЕС, независимо от того, где зарегистрирована компания. ❗️Закон обязывает бизнес предоставить как минимум один альтернативный способ использования продукта или услуги, если у пользователя полностью или частично отсутствуют зрение или слух. По сути это переработка правил от 2020 года (см. приложение). Главный принцип — информация не должна подаваться только визуально или только голосом. Продукт обязан иметь визуальную, звуковую или тактильную альтернативу. То есть наличие субтиров, текстовое дублирование звука, поддержка дисплеев Брайля, alt text (для скринридеров), а также поддержка жестового языка и многие другие правила. #accessibility #news
🤟 DeepMind SL2T: мультиязычная модель перевода жестового языка в текст 📌 TL;DR DeepMind представила SL2T — модель перевода жестового языка в текст, которая работает на потребительских устройствах (Pixel 11, Gboard, Live Transcribe). Ключевые особенности: приватность через pose-ландмарки (не сырое видео), обучение на 100K+ часов данных по 50+ жестовым языкам, и прямой перевод landmarks → text без промежуточных глоссов. На бенчмарке FLEURS-ASL модель достигает 70 BLEURT (zero-shot), значительно обгоняя предыдущие SOTA (около 50). 🧠 Зачем? Большинство систем распознавания жестового языка до сих пор в стадии RnD-исследований: либо они требуют разметку глоссов (искусственных текстовых представлений жестов), либо работали только с одним языком и обрабатывали сырое видео, что по мнению авторов создает риск безопасности (спорный поинт). Можно ли создать единую модель, которая (1) масштабируется на десятки жестовых языков, (2) работает в реальном времени на устройстве, (3) защищает приватность пользователей и (4) не требует промежуточных аннотаций? Ответ — да. 🗂️ Как устроена SL2T Пайплайн обработки: [Камера] → MediaPipe Holistic (on-device) → Pose landmarks (x, y coords) → [Server] → SL2T Model → Text Ключевые выводы: 1) Мультиязычность улучшает качество на 50+ языках, помогает модели выявлять общие структуры, что улучшает метрики даже на редких языках; 2) Отказ от глоссов: прямой перевод позволяет модели учиться на нелинейных аспектах жестового языка (мимика, пространственные отношения), которые глоссы не передают; 3) Качество растёт с объёмом данных — нет искусственного потолка из-за ограниченного словаря глоссов. 🧪 Ограничения и открытые вопросы — Покрытие языков: пока только американский ЖЯ в продуктах; остальные 50+ языков — в исследовательской фазе — Бенчмарки обычно собраны на чистых данных; реальная вариативность (освещение, ракурсы, скорость жестов) могут сильно влиять на качество — Не-мануальные компоненты: хотя модель теоретически способна их учитывать, но тема не изучена достаточно хорошо — Культурная адаптация: жестовые языки тесно связаны с культурным контекстом. А как модель адаптируется к региональным вариациям внутри одного языка? Проблема диалектов остается открытой. 🔗Ссылка: Google DeepMind Blog, 2026 #signlanguage
⚡️ Диффузионные языковые модели: что в них работает, а что вызывает вопросы Выложили большой разбор dLLM — результат совместной работы нескольких команд: «Интерпретируемый ИИ» лаборатории FusionBrain, «Основы генеративного ИИ» Института AIRI (@Ivan_Oseledets) и «Генеративная поэзия» Сергея Маркова (@oulenspiegel_channel) SberAI. tldr: год возились с диффузионными языковыми моделями — воспроизводили чужие методы, обучали свои, ускоряли инференс. Разобрали за вас целое поле и рассказываем, что уже стоит брать, а куда пока лучше не вкладывать время. Для тех, кто не в теме: dLLM генерируют текст не по одному токену слева направо, а параллельно, раскрывая замаскированные позиции по всей последовательности. Отсюда обещание кратного ускорения — но на практике всё упирается в KV-кэш, который в классической диффузии нормально не работает. Мы разобрали три подхода — и вот что у нас получилось: Адаптация — переучить готовую LLM в диффузионную за небольшую долю стоимости исходного претрейна. Сегодня это основной путь к большим dLLM — так получают модели вплоть до сотен миллиардов параметров. У нас DiffuGPT/DiffuLLaMA не воспроизвёлся: нашли и исправили кучу проблем в коде, прогнали на GPT-2, Qwen и GigaChat — но генерация всё равно осталась плохой. Зато ReFusion + GigaChat 3B завёлся: 2,7× ускорение по wall-clock и более чем 2× рост на GSM8K. Обучение с нуля — дорого и почти всегда не нужно в прикладном сценарии, но без него сложно проверять методические гипотезы. Разбираем MDLM как полигон для экспериментов и Eso-LM, где ради работающего KV-кэша пожертвовали двунаправленным вниманием. Дистилляция — ускорить уже обученную модель, сократив число шагов расшумления. Рассказываем про свой метод IDLM (ICML 2026): для MDLM число шагов сокращается с 1024 до 16. В конце — таблица с рекомендациями: какой подход выбирать под конкретную задачу и ограничения. 👉 Хабр
🚀 AI R&D DAY — 17 сентября, Москва 3️⃣ Мы собираемся третий год подряд! Ждём не только исследователей и инженеров, но и тех, кто переводит смелые идеи в реальные продукты: R&D-специалистов, AI-архитекторов, продактов и техлидов, отвечающих за внедрение технологий следующего поколения. Наша R&D-команда поделится результатами флагманского проекта NextGenAI и расскажет о продуктах и технологических треках, над которыми мы работаем для развития ИИ следующего поколения. Также на конференции будут доклады, постеры и демо-стенды от наших коллег из Kandisnky, Physical AI, AIRI, Giga и других. 🔬 О чём: — альтернативные архитектуры — процессы обучения, инструменты и агенты — омнимодальная долгосрочная память и ризонинг — модальности и коммуникации — бенчмаркинг, стандарты качества и производительности AI 🎯 Что вас ждёт: — 22 доклада на двух сценах от ведущих специалистов — живое общение с коллегами и экспертами — интерактивные зоны, которые сделают день по-настоящему запоминающимся Это шанс из первых уст узнать, над какими технологиями работают исследовательские команды Сбера сегодня, обсудить идеи и даже стать частью нашей команды! 💚 📍 Где: Москва (очно или онлайн) ⏰ Когда: 17 сентября 🎁 Цена: Участие бесплатное Количество мест ограничено! 😉 Регистрация: https://airndday.ontico.ru/ #rndml #conference @rndml_team
В одном из последних интервью Первый Зампред Правления Сбера, А.А. Ведяхин, рассказал о том, как Сбер создает инклюзивные сервисы. Сбер привлек более тысячи людей к созданию инклюзивных сервисов на базе ИИ. Среди них — переводчик с русского жестового языка (РЖЯ) в текст и инструменты, которые помогают голосовым помощникам лучше понимать людей с нарушениями речи. Это про нас. 🤗 Одна из наших исследовательских команд занимается сбором и обработкой данных и обучением моделей с целью создания доступных сервисов, в том числе реалтайм РЖЯ-переводчика. ✌️ А если вы являетесь носителем РЖЯ или у вас есть знакомые, которые владеют жестовым языком, то можно присоединиться к проекту и поучаствовать в записи и разметке датасета на удобной площадке TagMe. Записи оплачиваются! 💸 #ржя
А ещё мы сняли ролик для популяризации CADENA
🚀 Реверс-инжиниринг CAD выходит на новый уровень: встречайте CADENA! Команда Антона Конушина и лаборатория Fusion Brain совместно с нашей командой Игоря Пасечника в управлении @oulenspiegel_channel выкатили мощное обновление линейки моделей для CAD реверс-инжиниринга: CADENA (Stepwise CAD Reverse Engineering). В чем суть задачи (mesh2code)? Берем 3D-скан реальной физической детали (mesh) и восстанавливаем ее CAD-модель. Но не просто как "мертвую" геометрию, а как дерево построений — последовательность CAD-операций, сгенерированную Python-кодом. Инженер может легко править этот код, и по нему деталь можно отправлять в производство. Прошлые модели генерировали всю последовательность операций разом (one-shot). Из-за этого они сильно переобучались на статистику трейна: если в обучающей выборке операция B всегда шла между A и C, модель лепила её туда же и на инференсе. На сложных и редких геометриях пайплайн рассыпался. В CADENA мы перешли на пошаговое (stepwise) предсказание: модель исполняет то, что уже написала, смотрит на разницу с целью и решает, что делать дальше. HuggingFace создали нам демо на ZeroGPU. Можно протестировать модель. 🔥 🔗 Все материалы в открытом доступе: 📄 Paper: arXiv | HuggingFace(🔥 Заходите поставить апвоут!) 💻 GitHub: zhemdi/cadena 🤗 Model: kulibinai/cadena 🗄 Dataset: kulibinai/cadena-bench #release #cad
🌿 Адаптация мема на нашу индустрию. После физики видим небольшой провал, а потом в вашу жизнь врывается этот эйай. Но график уже не остановить...
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
🛣 Нерешенные задачи для LLM Или вечерний ресерч и как LLM не справились с несложной задачей составления маршрута. 💡 Идея Захотелось как-то проехать по маршруту МКАД → ТТК → Садовое, то есть сделать три полных кольца. Зачем? Красивый GPS-трек в активностях часов. На картах тыкать 30-50+ точек было лень (если меньше, то навигатор предлагает маршрут "оптимальнее", но режет круги). Поэтому было решено отдать задачу этим вашим нейросетям. 🗯 Подробное условие Сделай закольцованный маршрут МКАД → ТТК → Садовое. То есть нужно сделать полный круг по МКАД, потом сделать сделать съезд на ТТК и полный круг по ТТК, затем полный круг по Садовому. Точку старта возьми в любом удобном месте на МКАД (например: на Можайском шоссе). Финиш в любом месте после полного последнего круга садового кольца. Поставь столько точек, сколько нужно, чтобы маршрут закольцевался, а не искал оптимальный или короткий путь. Маршрут сделай ссылкой на Яндекс Картах. Что получилось? — Deepseek плохо: думал-думал, ссылку так нормально и не хотел выдавать. Пришлось мучать дольше всех. Итого прислал ссылку на 30+ рандомных точек, большая часть которых вообще не на дороге. — Qwen плохо: пришлось постоянно доуточнять условия, но что-то прислал (вообще и близко не похожее, но хотя бы в Москве). — ChatGPT получше: отказался делать ссылку в Я.Картах и требовал GPX-трек, ну ОК. Результат очень грубый, хоть и видно три кольца. — Gemini ужасно: решил, что 10 точек достаточно, в итоге получились полукруги на всех кольцах. ИМХО, хуже всех справился, да еще и за деньги. — Claude на версии Fable, конечно, не удалось на этой задаче потестить, но Opus был ближе всех. Хоть и неправильно местами, но он хотя бы предложил разбить на три колечка и сразу сказал, что у Яндекса могут быть проблемы с отображением в вебе >10 точек. А ещё он предложил сделать ссылки на 2ГИС и Гуглмапы. 2ГИС получилась битая, а гуглмапа относительно похожа на правду. Российские аналоги протестируйте сами 😮💨 Бенчмарк? Можно ли из этого сделать бенчмарк планирования сложных маршрутов? Однозначно — да. Что-то похожее есть, но прямо на создание многосоставных сложных маршрутов сходу не нашлось. Ниже список актуальных бенчей на эту тему беглым поиском: MobilityBench (2026) — масштабируемый бенчмарк для оценки LLM-агентов в реальных задачах планирования маршрутов CityBench (2024) — первый комплексный бенчмарк для оценки способности LLM выступать в роли городской модели мира TransitLM (2026) — масштабный датасет и бенчмарк для обучения моделей генерации маршрутов общественного транспорта без использования карт GridRoute (2025) — бенчмарк для оценки LLM в задачах поиска пути на дискретной сетке карты #карты #деньги #трикольца
🏠 ЖКХ вы че творите?? Админ устал собирать квитанции и передавать показания. Каждый месяц одно и то же: открой ЛК, дождись пока проснётся SPA, ткни в нужную вкладку, закрой баннеры, скачай PDF, повтори по числу объектов и ресурсных организаций. На круг — час кликанья по одинаковым формам. Спасибо Claude Code — за вечер мы выкатили zhkh. Это парсер, который сам обходит разные ЛК и складывает квитанции в receipts/<месяц>/<сайт>/. Что под капотом — Python + Playwright (Chromium headless) — Креды надежно лежат в `~/.zhkh.keys` — CLI и tg-bot для удобства — VLM для извлечения нужных полей квитанций: можно подключить любую модель через openrouter — На каждой стадии делается скриншот + HTML-дамп в debug/, чтобы при поломке вёрстки сразу видеть, что отвалилось — В конце прогона табличка с разбивкой по сайтам/объектам/периодам/суммам и общий итог в рублях Поддерживаемые сайты — МОЭК — Мосводоканал — Мосэнергосбыт — Эталон Установка и запуск в один клик uv run run.py # все сайты uv run run.py --site moek --headed --debug Подробнее в ридми, тг-бот запускается также просто. Как улучшить и что дальше? — Подключение других организаций (МГТС, Интернет, Капремонт). — Передача показаний счётчиков прямо из бота / CLI — Оплата квитанций (???) — Встраивайте в эти ваши уроборосы как скилл 😉 🔗Ссылка: https://github.com/hukenovs/zhkh/ #жкх
видео или голосовое, без подписи
видео или голосовое, без подписи
🇨🇳 Xiaomi vs Claude Code Китайская компания показала новый инструмент для работы с кодом — MiMo Code. По заявлению разработчиков, MiMo Code способен конкурировать с решениями от Anthropic. Как заявляют авторы, стандартные агенты "плывут" на длинных задачах: ошибки накапливаются, контекст переполняется, опыт не сохраняется, код получается хуже. MiMo решает это системно, не просто "больше токенов", а сложная архитектура под длительные сессии. Из жирных плюсов: Бесплатно под MIT + замеры на бенчах прилагаются (сравнивали с Sonnet 4.6). Мы уже немного потестили, из забавного — сносно отвечает на разных языках(см. скриншот), изначально вообще начала говорить на беларусском. 🇧🇾 🔗 Блогпост 🔗 Попробовать 🔗 Гитхаб #xiaomi #claude #code #news
видео или голосовое, без подписи
видео или голосовое, без подписи