tgindex
iMak AI Lab
@imak_aiрусский

Место где занимаются всем в ИИ https://iMak.ai

Последний пост
14 авг.
Последнее чтение
15 авг.
Постов за неделю
1
Всего постов
23
Тип
открытый
Язык
русский
В каталоге с
14 авг.
Подписчики
546
−3 за 2 дн.
Сутки
−1
−0,18%
Неделя
 
Месяц
 
Просмотров на пост
622
23 постов
Вовлечённость
113,9%
к подписчикам
Постов в день
0,1
всего 23
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
165
1/48двое суток
189
1/72трое суток
203

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 🔬👕👗 QuantFit-VTON: диффузионная модель, которая действительно умеет виртуально примерять одежду «по размеру» Современные диффузионные модели виртуальной примерки выдают фотореалистичные картинки, но реально не контролируют посадку: подол новой вещи чаще всего просто повторяет длину исходной одежды на фото, независимо от заявленного размера. Авторы предложили QuantFit-VTON - модель на базе SDXL с отдельным энкодером измерений, который получает явные числовые параметры человека и одежды (рост, длина, ширина) и встраивает их прямо в генерацию через cross-attention. Дополнительно добавлены геометрические лоссы, контролирующие длину подола и силуэт. 📊 Как результат, модель достигает фотореализма на уровне лучших аналогов и при этом является лучшей по геометрической точности среди всех сравненных методов. 📄 Эта работа - часть диссертационного исследования одного из выпускников нашей лаборатории, опубликована в IEEE Access. Ознакомиться с успехами в разработке новой виртуальной примерочной можно по ссылке. 🔬 iMak AI Lab 😌 iMak AI Lab

  • 5 авг.326151

    🔬 IHIE: физика встречается с deep learning в мониторинге промышленного оборудования Как понять, что турбина, станок или двигатель скоро выйдут из строя еще до того, как это произойдет? Существующие DL-модели для мониторинга износа оборудования обычно оценивают лишь одну характеристику деградации, игнорируя физические принципы, которые описывают, как реально «стареет» техника. Наши исследователи представили новый подход и модель IHIE (Industrial Health Index Extraction) для мониторинга состояния промышленного оборудования, объединяющую данные с сенсоров и физические уравнения деградации. Обычно нейросети «загоняют» скрытое представление устройства под одну конкретную характеристику, например, только под остаточный срок службы. Мы решили иначе: пусть система одновременно учится предсказывать сразу несколько показателей состояния устройства и сверяет их друг с другом. Это работает как перекрестная проверка, в результате которой модель меньше галлюционирует насчет нереалистичных сценариев износа и ее решения становится проще объяснить. 📊 Модель протестирована на двух эталонных промышленных датасетах NASA: ✔️NASA C-MAPSS (предсказание оставшегося срока службы турбовентиляторных двигателей): IHIE превзошла все современные аналоги (GNMR, RVE, DSFormer, MSTCN и др.) по RMSE на всех 4 подвыборках датасета; ✔️ NASA Milling (предсказание износа резцов): RMSE = 0.0056 — заметно лучше конкурентов (LSTM-based: 0.0148, TAKELM: 0.0134); ✔️ Модель содержит всего 5.1 млн параметров и работает со скоростью ~14 мс на инференсе на видеокарте V100; 🔧Систему можно внедрить для решения задачи мониторинга авиационных двигателей, станочного оборудования, любых промышленных систем с сенсорами: от предиктивного обслуживания до раннего обнаружения аномалий. Для тех, кто работает с промышленным ИИ или анализом временных рядов, мы как всегда открыты к сотрудничеству 🔬 Наш сайт 😌 Наш ТГ

  • 🔬🥲 CAFAS: как научить ИИ слышать эмоции в голосе и делать это легковесно Голос выдаёт эмоции даже без слов: тон, темп, дрожь - всё это сигналы, которые слышит человек интуитивно. Наша задача - научить этому же нейросеть, причём так, чтобы для запуска модели не нужно было тратить кучу денег на аренду серверного GPU, а развернуть ее на обычном устройстве. Наша команда представила новую архитектуру для распознавания эмоций в речи. Современные SER-модели показывают хорошую точность, но платят за это огромным количеством параметров, становясь тяжёлыми и медленными. При этом большинство моделей опираются либо на акустические признаки (тон, частота), либо на семантические эмбеддинги из self-supervised моделей, но редко объединяют оба типа сигналов эффективно. Наша архитектура CAFAS объединяет два потока информации через механизм cross-attention: 🎵 Акустическая ветка — MFCC-признаки проходят через специальный энкодер (LSTM + трансформер), который учит их «общаться» друг с другом; 🗣 Семантическая ветка — Wav2vec2.0 извлекает контекстуальные представления речи 🔀 Cross-Attention Fusion — запросы берутся из акустических признаков, а ключи и значения — из семантических, что позволяет модели выборочно подсвечивать релевантные детали Дополнительно добавлен вспомогательный классификатор для более стабильного обучения. 📊 Немного сухих но показательных цифр На датасете IEMOCAP (12 часов диалогов с аннотированными эмоциями) модель достигла: ✔️74.6% Weighted Accuracy, что делает модель конкурентной с современными аналогами; ✔️ Среди всех сравниваемых моделей CAFAS показал лучший показатель Unweighted Accuracy; ✔️ Всего 112 млн параметров, что почти в 3 раза меньше некоторых альтернатив (сравнимая модель с 317М параметров показывает похожую точность) ✔️ Латентность 24 мс на GPU, что для реальных приложений является практически мгновенным откликом Модель показывает 91.87% точности лучшего бейзлайна, используя лишь 49.1% его параметров. Отдельно интересно: анализ attention-карт показал, что модель действительно «замечает» ключевые эмоционально нагруженные слова и игнорирует паузы, что делает её решения интерпретируемыми. Применений этой модели может быть великое множество: от голосовых ассистентов до мониторинга психического здоровья - иными словами, везде, где нужно понимать не только «что» сказал человек, но и «как». Если вы занимаетесь речевыми технологиями, обработкой аудио или HCI, мы открыты к коллаборации 🤝 🔬 Наш сайт 😌 Наш ТГ

  • 🔬 Сегодня мы расскажем об одном из наших проектов, который достаточно громко «выстрелил» в прошлом году Представьте: вы наводите камеру телефона на стелу в музее, и мгновенно видите перевод надписи, которой больше трех тысяч лет. Звучит как научная фантастика?…

  • 19 июл.6877517

    Летел на конфу в LA, на пересадке высадили, долго куда-то везли на допрос, спросили Испания или Аргентина, дали кепку и посадили на 2 часа 😅😂⚽️🇦🇷

  • 🙂🙁 Может ли ИИ понять по едва заметным жестовым маркерам без единого слова распознать эмоции человека? У нас есть ответ. В рамках международного соревнования MiGA 2025 на базе IJCAI мы разработали две системы, которые анализируют видео и распознают: ✔️Микрожесты - мельчайшие движения рук и пальцев (всего 32 класса жестов); ✔️Эмоции по поведению - позитивное или негативное состояние, определенное исходя из движений тела и мимики. В чём сложность? Обычные модели видят либо картинку, либо скелет человека, и работают с чем-то одним. Мы научили нашу систему объединять оба потока информации: видеоряд и трехмерные координаты суставов. Для этого был разработан специальный модуль слияния, который находит связи между визуальными признаками и позой тела в каждый момент времени. Дополнительно модель накапливает «память» о типичных представителях каждого класса жестов и уточняет свои предсказания, сравнивая новые примеры с уже изученными. Для распознавания эмоций система одновременно анализирует общий контекст видео и детали лица через отдельные потоки, которые постепенно обмениваются информацией друг с другом, так же, как разные отделы нашего мозга работают совместно при считывании чужих чувств. 🥈В треке по распознаванию эмоций мы заняли 2-е место среди всех участников соревнования. Такие технологии открывают путь к системам, которые могут понимать эмоциональное состояние человека в самых разных реальных сценариях: от клинической диагностики до адаптивных интерфейсов и систем обратной связи. 🔬 Наш сайт 😌 Наш ТГ

  • 🔬🛣 Каждый год в регионах проводится перекраска дорожной разметки, но проводится она не по мере износа, а по расписанию. Вот только есть нюанс: разметка стирается не по расписанию. Как итог - одни участки красят раньше времени, когда обновление разметки еще не требуется, а другие - когда зебры или стоп-линии становятся едва заметными. Мы сделали шаг к тому, чтобы это изменить. Наша команда создала LCRM - датасет дорожной разметки, с которым можно обучить модель не просто находить разметку на снимке, но и понимать, в каком она состоянии: всё хорошо, пора наблюдать или срочно перекрашивать. 🚙Такую систему можно установить на специализированные машины дорожных служб или городские автомобили. Они едут по своим маршрутам, и параллельно автоматически оценивают состояние каждой разметки на пути. Никаких ручных обходов, никаких сюрпризов: город получает актуальную карту износа и может планировать ремонт заранее. 📹 Мы использовали линейную камеру, которая снимает дорогу равномерно, без перспективных искажений, которые мешают обычным видеорегистраторам четко видеть тонкие полосы разметки. Съемка проходила в Москве, Петербурге и Подмосковье, в разное время суток. Итог: более 20 000 изображений с 12 типами разметки и тремя уровнями износа. Лучшая из протестированных моделей распознает разметку с точностью IoU 91.5%: это уже близко к уровню, пригодному для реального применения. Датасет открытый, и его может использовать любая команда, которая работает над безопасностью дорог или автономным вождением. 🔬 Наш сайт 😌 Наш ТГ

  • 5 июн.674153

    🔬 🚗Наши исследователи научили машины «общаться» интеллектуальнее Представьте: каждый автомобиль постоянно генерирует гигабайты телеметрии: обороты двигателя, давление тормозов, температура охлаждающей жидкости и десятки других параметров. Передавать все это по беспроводной сети в системах V2X «Vehicle-to-Everything» (буквально, «автомобиль ↔ всё») - это огромная нагрузка на канал связи. Как ее снизить на порядки, не теряя смысл данных? ✅ Именно эту задачу решает Car2Vec - наш новый фреймворк на основе контрастивного самообучения. Как это работает? Вместо того чтобы передавать поток сырых данных, бортовое устройство прямо на автомобиле «сжимает» всю телеметрию в компактный вектор из 40 чисел — семантическое описание состояния машины. Именно этот вектор и отправляется дальше: другим автомобилям, светофорам, серверам. Что показали эксперименты? ✔️ Модель на основе GNN научилась без какой-либо разметки разделять поездки на кластеры в скрытом пространстве ✔️ Дополнительно выявились кластеры по марке топлива и вязкости моторного масла, хотя модель этому явно не обучалась ✔️ Задержка вывода на мобильном процессоре с NPU менее 1 мс, что делает систему пригодной для работы в реальном времени Подход снижает беспроводную нагрузку на порядки величин по сравнению с передачей сырой телеметрии. В дальнейшем мы планируем провести тестирование на парке из 100+ автомобилей, а также провести интеграцию с задачами совместного вождения. ⭐️⭐️ Статья представлена на ACM MOBICOM '25 в Гонконге 🔬 Наш сайт 😌 Наш ТГ

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • 3 июн.603268

    🔬🎓Исследователи iMak AI Lab с командой из ИТМО приняли участие в открытии совместной лаборатории с институтом ИИ AIRI Вчера состоялось официальное открытие новой лаборатории «Мультиагентный интеллект и адаптивные системы» совместно с Университетом ИТМО. Здесь мы с нашими коллегами будем разрабатывать ИИ-системы нового поколения: те, что самостоятельно ищут информацию, принимают согласованные решения, адаптируются к изменяющимся условиям и работают как единая исследовательская команда. Применений новым открытиям может быть масса: от автоматизации бизнес-процессов до генерации и рецензирования научных статей (этому направлению, кстати, будет уделено особое внимание). «Команда iMak AI Lab уже давно и продуктивно взаимодействует с коллегами из ИТМО в рамках совместных исследований в области мультиагентных систем. Новая лаборатория станет настоящей точкой притяжения для талантливых студентов и молодых учёных, которые смогут включиться в работу над нашими фреймворками эволюционных мультиагентных систем и приблизить их практическое применение в реальных задачах». 📩Лаборатория открыта для студентов, магистрантов и аспирантов, владеющих навыками ML и программирования. Хочешь присоединиться? Отправь резюме на smuravyov@itmo.ru и пройди собеседование. 🔬 Наш сайт 😌 Наш ТГ

  • 29 мая6761614

    ✏️На «Иванниковских чтениях»представили систему, способную автоматизировать полный цикл исследования до написания научной статьи О разработке рассказал Илья Макаров (AIRI, ИСП РАН, Университет Иннополис) в рамках секции «Управление данными и искусственный…

  • видео или голосовое, без подписи

  • 29 мая6172110из ispras

    ✏️На «Иванниковских чтениях»представили систему, способную автоматизировать полный цикл исследования до написания научной статьи О разработке рассказал Илья Макаров (AIRI, ИСП РАН, Университет Иннополис) в рамках секции «Управление данными и искусственный интеллект». Сегодня система также обсуждалась на конференции в рамках пленарной дискуссии и проектной сессии «Доменные ИИ-пилоты для развития научных исследований». Разработка уже продемонстрировала практический результат: с её помощью были подготовлены две научные статьи, опубликованные на ведущих международных конференциях уровня A*. Создание данной системы демонстрирует фундаментальный сдвиг в исследовательской деятельности под влиянием ИИ: приоритет смещается с формального выполнения публикационных требований на достижение измеримой практической пользы. Роль исследователя трансформируется в определение социально и технологически значимых задач, тогда как инструментальная часть научного цикла будет автоматизирована современными ИИ-решениями, — отметил Илья Макаров. 💬ИСП РАН в Telegram 💬ИСП РАН в МАКС

  • 19 мая711192

    ⌨️ На конференции Data Fusion мы приняли участие в дискуссии о том, как ИИ меняет профессию ученого, а также о кризисе публикаций, закрытии технологий и новой логике карьеры в науке Участники сессии зафиксировали шесть сдвигов, уже меняющих правила игры: ✔️ Поток статей стал настолько огромным, что следить за ним физически невозможно. Знаком качества теперь служит имя лаборатории, а не журнал или конференция; ✔️ Фронтирные компании (OpenAI, Anthropic, DeepMind) публикуют результаты, но не раскрывают архитектуру и методы. Даже исследователи больше не знают, за счёт чего модели становятся лучше; ✔️ Математика остаётся исключением - это одна из немногих областей, где учёный может работать ради самого знания, без прикладного заказа; ✔️ Бизнес встраивается в исследования на ранних этапах, а не ждёт готового результата; ✔️ Новая стратегия выживания — искать области на стыке дисциплин, куда LLM ещё не добрались. Как отметил Илья Макаров, синергия специалиста по ИИ с экспертом из другой области даёт куда больший импакт, чем «прожимание метрик в конкретной маленькой модели»; ✔️ Сам исследователь становится активом для прямых инвестиций — академический путь перестаёт быть единственным. «Если ты что-то делаешь полезное, то это должно быть не про понимание, а про то, что когда-то, через год, три, десять оно должно сконвертиться в ощутимый результат». Полный разбор сессии → https://kod.ru/kak-ai-menyaet-nauku-uchenyh-i-biznes 🔬 Наш сайт 😌 Наш ТГ

  • 6 мая804214

    Артём Липиньски из нашей совместной лаборатории с СПбГУ в пятницу представит промежуточные результаты работы над арабской языковой моделью. О том, как мы собираем данные, строим пайплайн обучения и адаптируем LLM к низкоресурсным языкам расскажет на трансляции в эту пятницу👆

  • 6 мая692134из sinecor

    Следующий анонс — на семинаре лаборатории Маркова мы теперь внезапно займёмся арабским языком: Создание арабской языковой модели методом непрерывного дообучения (continuous pretraining) Ссылка на трансляцию (пятница 8 мая, 14:00) Артём Липиньски (Санкт-Петербургский государственный университет) Арабский язык — один из крупнейших в мире по числу носителей, однако современные языковые модели работают с ним заметно хуже, чем с английским или китайским. Причина проста: качественных арабских данных в открытом доступе катастрофически мало, а существующие модели обучались преимущественно на англоязычных текстах. В докладе будет представлена работа по созданию арабской языковой модели, которая способна осмысленно понимать и генерировать текст на арабском, при этом оставаясь достаточно компактной для практического применения. Будет рассмотрено: — как собрать и подготовить большой качественный корпус текста с нуля; — почему смешение языков в обучающих данных помогает, а не мешает; — полный pipeline адаптации LLM к новому языку, от сбора данных до SFT (с разбором того, как эффективно пройти каждый этап и каких ошибок избежать). Результаты работы актуальны для всех, кто занимается адаптацией LLM к низкоресурсным языкам: подходы применимы далеко за пределами арабского. #markovlab #seminar #spsu

  • 30 апр.7472310

    🔬👨‍💻 Наша команда предложила решение проблемы распределения задач в команде разработчиков при помощи ИИ Представьте: в крупной IT-компании тысячи задач и сотни разработчиков. Как автоматически назначить нужного человека на нужную задачу, учитывая не только прошлый опыт, но и контекст — описание задачи, коммиты, роль и профиль разработчика? Именно эту проблему решает SODAOpt — наш трансформерный фреймворк для умного распределения задач в разработке ПО. В чём проблема существующих подходов? Большинство систем опираются на статические идентификаторы (ID разработчика) и историческую статистику — и полностью игнорируют семантику задач и социально-демографический профиль специалиста. Как работает SODAOpt? ✔️ Текстовый энкодер на базе E5-large извлекает смысл из описаний задач и коммитов; ✔️ Адаптивные слои объединяют текстовые признаки с профилем разработчика; ✔️ Составная функция потерь сочетает контрастивное обучение с оптимизацией назначений; ✔️Поиск оптимального матча выполняется через FAISS-индекс. Иными словами, модель «читает» описание задачи и одновременно изучает профиль разработчика: его опыт, роль и отдел. Затем она совмещает эти два потока информации и находит наилучшее соответствие: кому из команды эта задача подойдёт больше всего. Чем больше контекста — тем точнее назначение. Модель в разы превосходит конкурентов как в ID-only, так и в text-only подходах. 📄 Статья опубликована на ACM FSE Companion '25 (Тронхейм, Норвегия) 💻 Код: https://github.com/SODAForge/SODAOpt 🔬 Наш сайт 😌 Наш ТГ

  • видео или голосовое, без подписи

iMak AI Lab — tgindex