tgindex
Открытый код ФКН ВШЭ

Открытый код ФКН ВШЭ

Статистика

Показываем новости по открытому коду ФКН ВШЭ. Контакты: Михаил Гущин @mhushchyn

Последний пост
14 авг.
Последнее чтение
14:56
Постов за неделю
3
Всего постов
24
Тип
открытый
Язык
русский
Категория
Новости и СМИ
В каталоге с
12 авг.
Подписчики
812
−2 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
423
23 постов
Вовлечённость
52,1%
к подписчикам
Постов в день
0,4
всего 24
Упоминаний
5
каналов
Охват размещения
оценка
1/24сутки в ленте
181
1/48двое суток
207
1/72трое суток
223

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • GSOFT В репозитории опубликован код GSOFT — метода экономного файнтюнинга нейросетей через структурированные ортогональные матрицы. Авторы работают с ограничением существующих подходов вроде OFT и BOFT. Ортогональные преобразования помогают аккуратно адаптировать веса предобученной модели, но простая блочно-диагональная структура OFT слишком ограничивает взаимодействие признаков, а butterfly-параметризация BOFT требует произведения нескольких матриц и даёт лишние вычислительные накладные расходы. GSOFT строится на новом классе Group-and-Shuffle матриц. Такая матрица сначала применяет независимые линейные преобразования внутри небольших групп, затем перемешивает признаки между группами и снова применяет групповые преобразования. За счёт этого можно получать плотные ортогональные матрицы с меньшим числом множителей и обучаемых параметров. На GLUE с RoBERTa-base GSOFT превосходит OFT и BOFT и немного обходит LoRA по среднему результату при сопоставимом числе параметров. Работа будет полезна исследователям parameter-efficient fine-tuning, генеративных моделей, ортогональных параметризаций и архитектур, где важно уменьшать число обучаемых параметров без заметной потери выразительности. статья | код

  • manga-colorization В репозитории опубликован код manga-colorization — метода для полуавтоматической раскраски манги с помощью условных состязательных сетей. Система получает чёрно-белую страницу манги и редкие цветовые подсказки от пользователя, после чего строит цветную версию изображения. Подсказки позволяют отдельно править раскраску каждой панели, поэтому метод остаётся не просто автоматическим фильтром, а инструментом для управляемой работы с изображением. Для обучения авторы собирают набор вручную раскрашенных и чёрно-белых изображений манги. В работе также показано, что результат можно улучшить дообучением на небольшом числе чёрно-белых страниц нового стиля. Код будет полезен исследователям компьютерного зрения, генеративных моделей и интерактивной обработки изображений. статья | код

  • Горячий анонс "для своих" 🚀 15–16 августа в пространстве Сбер.Среда в баре "Оригинал" пройдут выходные, которые зарядят энергией надолго — Сбер.Среда Weekend: IT фестиваль для российского технологического комьюнити. ⚡️ Выступят спикеры из Сбера, Т-Банка, ВШЭ и др. В программе будет представлен доклад «Что корпоративному open source стоит знать о научном коде?» от Михаила Гущина, ведущего научного сотрудника НИУ ВШЭ А вообще вас ждут три уникальные зоны: 🔥 human.env — честные, смешные и местами беспощадные стендапы и рассказы про работу. 🔥 growth.env — воркшопы и дискуссии от IT‑сообществ Сбера. С тебя — вопрос, с команды — ответ. 🔥 party.env — DIY, танцы и большая финальная вечеринка. За музыку отвечают хедлайнеры фестиваля: ЛАУД, тима ищет свет и DJ SALAMÉ — артисты, которые задают звучание современной электронной сцены и превратят вечер в настоящий open air. 💻 Регистрация по этой ссылке Обращаем внимание – количество очных мест ограничено, поэтому торопитесь зарегистрироваться.

  • c-pic В репозитории опубликован код C-PIC — метода для обучения низкоранговых представлений визуальных данных с помощью дифференцируемых кросс-аппроксимаций. Авторы рассматривают задачу работы с очень большими многомерными тензорами, где обычные CNN быстро упираются в память, особенно на 3D-данных вроде томографии, MRI и других объёмных сканов. Ключевая идея работы состоит в том, чтобы не обрабатывать весь входной тензор целиком, а смотреть только на небольшую часть его значений и при этом всё равно строить полезное компактное представление для последующего предсказания В экспериментах на двух задачах медицинского анализа C-PIC показывает качество на уровне SoTA методов, а при этом способен работать на существенно более высоком разрешении. Авторы отдельно отмечают, что с теми же гиперпараметрами их подход справляется с удвоенным разрешением, где другие сильные методы уже не проходят из-за ограничений по памяти. Работа будет полезна исследователям компьютерного зрения и медицинских изображений. статья | код

  • cosmos В репозитории опубликован код COSMOS — метод диффузионной генерации текста в сжатом и гладком латентном пространстве, представленный на конференции NeurIPS в 2025 году. Авторы переносят идею latent diffusion из генерации изображений в текст, где прямое моделирование токенов остаётся дорогим из-за высокой размерности и длины последовательностей. COSMOS сначала кодирует текст замороженным BERT, затем сжимает полученные представления через лёгкий compressor и обучает diffusion model уже в этом компактном пространстве. Важная часть работы не только в самом сжатии, а в том, как это пространство делается пригодным для диффузии. Автоэнкодер обучается одновременно на восстановление токенов, приближение к исходным BERT-представлениям, устойчивость к шуму, маскированию активаций и частичному занулению признаков внутри latent vectors. Такая схема делает пространство более гладким и уменьшает разрыв между тем, какие представления модель видит при обучении, и тем, какие появляются во время генерации. В экспериментах авторы показывают, что текст можно сжимать до 8 раз без заметной потери качества относительно token-level diffusion, а при умеренном сжатии COSMOS превосходит ряд diffusion-based и autoregressive baselines. Метод проверяется на ROCStories, XSum, ParaDetox и SQuAD2.0, а также на OpenWebText для более длинной генерации. На ROCStories версия COSMOS с большим числом latent vectors достигает MAUVE 0.940 при 0.953 у исходных текстов и заметно обходит GPT-2 по этой метрике. Для длинных последовательностей подход даёт особенно сильный выигрыш по скорости, так как диффузия работает с фиксированным числом шагов и не генерирует текст строго токен за токеном. Работа будет полезна исследователям генерации текста, text diffusion, latent diffusion и всем, кто изучает альтернативы авторегрессионным языковым моделям для быстрой и управляемой генерации. статья | код

  • smoothie В репозитории опубликован код Smoothie — метода диффузионной генерации текста, который учитывает и дискретную природу языка, и смысловую близость между токенами. Авторы работают с одной из главных проблем текстовых диффузионных моделей, где обычная гауссовская диффузия в пространстве представлений хорошо сохраняет семантическую геометрию, но потом требует отдельного перехода обратно к токенам, а методы в пространстве словарного симплекса проще декодируются, но почти не используют сходство между словами. Smoothie предлагает промежуточную постановку. Каждый токен описывается не самим embedding, а вектором расстояний от него до всех токенов словаря. В экспериментах Smoothie проверяется на безусловной генерации на ROCStories и на четырёх задачах преобразования текста: QQP, Quasar-T, XSum и ParaDetox. Модель сравнивается с DiffuSeq, SeqDiffuSeq, SSD-LM, TESS, TEncDM, MDLM и авторегрессионными базовыми моделями. Smoothie показывает лучшие результаты среди диффузионных методов на нескольких задачах, включая MAUVE на ROCStories, BLEU на Quasar-T и J-Score на ParaDetox. Отдельно авторы показывают, что предложенное пространство расстояний работает лучше, чем стандартное embedding space и simplex space при одинаковой архитектуре и схожей процедуре обучения. Работа будет полезна исследователям генерации текста, диффузионных языковых моделей и дискретных данных, где между категориями есть содержательная близость, например в графах или белковых последовательностях. статья | код

  • 📢 Напоминаем: прием заявок на конкурс open source-проектов ФКН НИУ ВШЭ продолжается до 31 июля! Если вы уже готовите репозиторий к подаче (или только собираетесь его опубликовать), рекомендуем обратить внимание на OSA (Open-Source Advisor) — инструмент, который поможет быстро привести проект в порядок. С помощью OSA можно: ➕ подготовить или улучшить README; ➕ проверить качество кода и документации; ➕ добавить docstring'и; ➕ настроить CI/CD и GitHub Actions; ➕ автоматизировать другие рутинные задачи по сопровождению open source-проекта. Хорошо оформленный репозиторий — это не только плюс для конкурса, но и возможность сделать ваш проект понятным и полезным для других разработчиков. На конкурс принимаются: ✅ Результаты курсовых работ (КР). ✅ Выпускные квалификационные работы (ВКР). ✅ Любые другие инициативные разработки. 📆 Прием заявок до 31 июля 2026 ⭐️ Награждение победителей пройдет 01 октября 2026 Желаем удачи всем участникам и ждем ваши проекты! 🚀 Подписывайтесь на канал: @hse_cs_opensource

  • LAMBO В репозитории опубликован код LAMBO — метода аугментации разметки для задач с ключевыми точками и контурами объектов. Авторы работают с ситуацией, где изображений много, а точной разметки мало или она не сопоставлена с изображениями напрямую. Такая постановка часто встречается в медицине, биометрии и других областях, где аннотация требует экспертизы. Вместо обычных геометрических преобразований LAMBO генерирует новые разметки через барицентры Вассерштайна между близкими примерами на многообразии исходных аннотаций. Для этого строится граф ближайших соседей по расстоянию Вассерштайна, в нём находятся локальные клики, а новые точки получаются как случайные барицентры внутри этих локальных областей. Такой подход сохраняет естественную геометрию данных и не уводит разметку далеко от исходного распределения. В работе метод применён к обнаружению ключевых точек лица на 300-W, поз человека на Human3.6M и сегментационным контурам на Cardio MRI. Сгенерированные разметки используются при обучении Cyclic GAN, который сопоставляет изображения и ключевые точки в unpaired и semi-supervised сценариях. В экспериментах LAMBO снижает переобучение и превосходит обычные геометрические преобразования, GMM, GAN, VAE и Нормализующие потоки. Особенно заметный выигрыш появляется при малом числе аннотаций, например на подвыборках из 100, 300 и 600 размеченных изображений. Работа будет полезна исследователям компьютерного зрения, медицинской сегментации и задач с дорогостоящей разметкой, где нужно расширять набор аннотаций без ручного контроля каждой новой формы. статья | код

  • MaterialFusion В репозитории опубликован код MaterialFusion — метода для переноса материала на объект в изображении без построения 3D-модели. Авторы решают задачу, где нужно взять материал с изображения-примера, например металл, дерево, стекло или ткань, и реалистично применить его к выбранному объекту, сохранив форму, детали поверхности и фон исходной сцены. Такой инструмент полезен для виртуального прототипирования, визуализации товаров, дополненной реальности и создания цифрового контента. MaterialFusion объединяет возможности IP-Adapter и Guide-and-Rescale внутри диффузионной модели. IP-Adapter извлекает признаки материала из изображения-примера, а Guide-and-Rescale помогает сохранить геометрию и исходные особенности объекта. Для оценки метода авторы собрали собственный набор реальных изображений: 25 фотографий объектов и 15 изображений материалов. MaterialFusion сравнивается с ZeST, Guide-and-Rescale и IP-Adapter с маской. В количественных метриках, визуальных сравнениях и пользовательском исследовании метод показывает более реалистичное встраивание материала, лучше сохраняет структуру объекта и аккуратнее работает с фоном и границами. Работа будет полезна исследователям генеративных моделей и редактирования изображений, а также разработчикам инструментов для дизайна, AR/VR, e-commerce и визуализации продуктов. статья | код

  • 24 июн.36862из hub_sk

    Митап Open Source: «День открытого кода» 30 июня Открытый код стал частью технологического фундамента современной разработки: 89% российских компаний использует его в своей ИТ-инфраструктуре.  Вместе с ростом популярности пришли и вызовы: как управлять открытым кодом в корпоративной среде и строить устойчивый бизнес?  На платформе Мос.Хаб уже размещено больше 32 тысяч проектов с открытым кодом. Город последовательно развивает экосистему, где разработчики могут пользоваться готовыми решениями, а также влиять на их прогресс.  В МосХаб.Сколково соберутся разработчики, продуктовые и ИТ-команды, стартапы и профильные медиа, чтобы обсудить последние тренды отрасли в России, завести полезные знакомства и наметить совместные проекты.  На митапе участники узнают, как столица видит развитие опенсорс, какие результаты уже есть и почему открытый код стал важной частью городской цифровой стратегии. В программе — пленарная сессия с лидерами рынка, живое обсуждение, вопросы из зала и свободное время для нетворкинга. Посетителей ждёт интерактив: при регистрации каждый участник получит карточку с кодом, в котором спрятана ошибка. Если сможете найти и исправить ошибку, то получите брендированный стикерпак. Регистрация и подробности — по ссылке. Количество мест ограничено! Подписывайтесь: Telegram | МАКС | ВКонтакте

  • Открытый код ФКН ВШЭ pinned a photo

  • Does-It-Look-Sequential В репозитории опубликован код Does-It-Look-Sequential — исследования о том, насколько популярные наборы данных действительно подходят для оценки последовательных рекомендаций. Авторы разбирают частую проблему в этой области, где модели вроде SASRec и GRU4Rec предполагают, что порядок действий пользователя несет полезный сигнал, но сами наборы данных не всегда содержат сильные последовательные зависимости. Для проверки авторы используют простую идею со случайным перемешиванием пользовательских историй. Если после перемешивания качество модели почти не меняется, значит модель в основном опиралась не на порядок действий, а на другие свойства данных. В работе предложены три способа такой проверки. Первый считает короткие последовательные правила до и после перемешивания. Два других смотрят на падение HitRate@10 и NDCG@10, а также на изменение списка рекомендаций через Jaccard@10. Эксперименты проведены на 19 наборах данных, включая Beauty, Diginetica, RetailRocket, Yoochoose, Steam, ML-20m, 30Music, Yambda-50M, Gowalla, Yelp и другие часто используемые бенчмарки. Авторы показывают, что Diginetica, Foursquare, Gowalla, RetailRocket, Steam и Yelp имеют сравнительно слабую последовательную структуру. Отдельно анализируется влияние предобработки, фильтрации редких пользователей и объектов, удаления уже просмотренных объектов из рекомендаций и выбора гиперпараметров. Оказывается, такие технические детали могут заметно менять выводы о том, есть ли в данных полезный порядок. В конце авторы разделяют наборы данных по типам зависимостей: где история работает почти как набор объектов без порядка, где важны только недавние действия, где достаточно одного-двух последних объектов, и где есть более сложная структура порядка. Работа будет полезна исследователям рекомендательных систем и ML-инженерам. статья | код

  • 18 июн.1 510716

    Продолжаем прием заявок на второй конкурс проектов с открытым кодом для студентов ФКН НИУ ВШЭ 2026! 🎉 Заполните заявку на сайте конкурса и прикрепите ссылку на репозиторий вашего проекта (GitHub/GitLab/GitVerse) до 31 июля. Прокачивайте навыки разработки, публикуйте свои проекты с открытым кодом и получайте призы. Кто может участвовать: ⚪️ Все аспиранты и студенты ФКН. ⚪️ Индивидуальные авторы и команды. Принимаются проекты любых форматов: ✅ Результаты курсовых работ (КР). ✅ Выпускные квалификационные работы (ВКР). ✅ Любые другие инициативные разработки. Что получают участники: ➕ Опыт работы над open-source проектами. ➕ Интеграцию в мировое сообщество разработчиков. ➕ Призы и награды для победителей. ❓ Вопросы по конкурсу можно писать нам в чат. 📆 Прием заявок до 31 июля 2026 ⭐️ Награждение победителей пройдет 01 октября 2026 Подписывайтесь на канал: @hse_cs_opensource

  • 16 июн.35674из basealtspo

    Приглашаем принять участие в конкурсе для разработчиков «Код логики» Стартовал первый этап конкурса Open-Source-проектов для разработчиков свободного ПО «Код логики». Конкурс проводится при финансовой поддержке «Базальт СПО» и частных лиц. Организатор конкурса — АНО «Институт логики, когнитологии и развития личности». На протяжении 35 лет институт поддерживает разработчиков свободного ПО и образовательные технологии. Миссия АНО «Институт логики» — помогать исследователям, специалистам и учебным учреждениям реализовывать проекты, влияющие на развитие технологий. Кто может участвовать? Физические лица — разработчики свободного ПО, обладающие гражданской дееспособностью лица старше 18 лет, налоговые резиденты. Что нужно сделать? Представить значимый вклад в существующий Open-Source-проект, опубликованный в публичном репозитории под свободной лицензией. Вклад может быть сделан в свой или сторонний проект. Призовой фонд Денежные премии. Всего 3 призовых места, максимальное количество победителей — до 6 человек. Победитель получит 1 000 000 рублей. Заявки принимаются до 15 августа 2026 года (включительно) на сайте института. Награждение победителей состоится 2–4 октября на XXII ежегодной конференции разработчиков свободных программ. Подробности об условиях конкурса можно посмотреть на сайте: logic.ru. «Базальт СПО» в МАХ | ВКонтакте

  • Folding-In-MRGSRec В репозитории опубликован код Folding-In-MRGSRec — метода для быстрого обновления графовых рекомендательных моделей после появления новых взаимодействий. Авторы работают с практической проблемой таких рекомендательных систем, где новые действия пользователей обычно требуют полного переобучения модели. В реальных задачах это быстро становится дорогим и неудобным, особенно если рекомендации должны меняться почти сразу после новых кликов, покупок или просмотров. Вместо обновления всех весов Folding-In меняет только небольшую часть пользовательских представлений, связанных с пользователями, у которых появились новые взаимодействия. Метод встроен в MRGSRec, модели с множественными представлениями, объединяющую графовую часть на LightGCN и последовательную часть на SASRec. Графовая компонента отвечает за глобальные связи между пользователями и объектами, а sequential-компонента лучше ловит локальную историю конкретного пользователя. Эксперименты проведены на MovieLens-1M и трёх датасетах Amazon. Folding-In-MRGSRec показывает лучшее качество среди рассмотренных графовых, последовательных и бейзлайнов с множественными представлениями. Работа будет полезна исследователям рекомендательных систем и ML специалистам в области рекоменлдаций. статья | код

  • solar-magnetic-tornado В репозитории опубликован код solar-magnetic-tornado — пайплайна для автоматического поиска солнечных магнитных торнадо на изображениях SDO/AIA 171 Å. Авторы рассматривают темные спиралевидные структуры у лимба Солнца, которые раньше в основном находили вручную по отдельным наблюдениям. Такой подход плохо подходит для статистики по солнечному циклу, поэтому в работе собраны обучающие данные по известным и дополнительно размеченным торнадо и предложены два нейросетевых метода детекции. Первый метод использует MobileNetV3 как feature extractor и recurrent-блок GRU или LSTM для классификации последовательностей из 20 кадров. Он учитывает временную динамику и видимое вращение структуры. Второй метод основан на YOLO 11 и работает с отдельными кадрами, зато сразу возвращает bounding boxes, координаты и оценку размера объекта. Лучшей моделью в первом подходе стала связка MobileNetV3 + GRU с AUC-ROC 0.945, recall 0.968 и precision 0.836 при пороге 0.5. YOLO хуже учитывает динамику, но удобен для массового поиска и пространственного анализа. На основе моделей авторы нашли 1 476 885 новых объектов и построили базу событий, пригодную для дальнейшей проверки и статистики. Работа будет полезна исследователям физики солнц, специалистам по автоматическому анализу астрономических изображений и командам, которые строят большие базы событий из потоковых наблюдений, где ручная разметка уже не масштабируется. статья | код

  • 30 мая44961из scientific_opensource

    Наша сегодняшняя онлайн-секция Open Source начинается меньше чем через пол-часа! Ровно в 12-00 стартуем. Будут доклады от представителей Yandex Cloud, ФКН ВШЭ и Иннотеха. Ссылка на трансляцию - https://dion.vc/event/datafest-kb (нужно нажимать "Войти как гость") Задавать вопросы докладчикам можно в чате трансляция или здесь в комментариях. Подробности по программе - тут.

  • 29 мая419101из scientific_opensource

    Публикуем расписание нашей секции Open Source на DataFest 2026 - https://ods.ai/events/datafest2026: Онлайн (30.05, 12:00): 1) Марина Кошелева, руководитель проектов, Центр технологий для общества Yandex Cloud: Как мы делали библиотеку-опенсорс курсов от преподавателей вузов 2) Михаил Гущин, ведущий научный сотрудник, зам. зав. лаб, руководитель проекта по открытому коду Факультета компьютерных наук ФКН НИУ ВШЭ: Научные открытые проекты 3) Юрий Барамыков, старший руководитель проекта, Иннотех: ggmlR:Vulkan GPU-бэкенд для R Белград, 31.05 - https://ods.ai/events/fest2026-fon-belgrade 4) Алексей Васильев, исполнительный директор по исследованию данных, Sber AI Lab: SplitLight: RecSys Evaluation Toolkit 5) Илья Шагабеев, ML Researcher, Acclaim ai TTS in 2026: Open Source vs Big Tech Ссылки на трансляцию онлайна скинем позже.

  • DPNVerifier В репозитории опубликован код DPN Verifier — инструментария для проверки и исправления бездефектности моделей процессов с данными. Работа рассматривает Data Petri Nets, расширение сетей Петри, где переходы зависят не только от разметки, но и от значений переменных. Такая постановка нужна для процессов, в которых данные напрямую меняют поток управления, а ошибки могут проявляться как deadlock, livelock, неограниченный рост ресурсов или действия, которые никогда не выполняются. Авторы предлагают более быстрый метод проверки DPN, который требует не больше двух построений пространства состояний. Существующие подходы часто опираются на многократное построение графов, из-за чего методы плохо масштабировались и оставались ближе к исследовательским прототипам. DPN Verifier реализует новую роцедуру, добавление tau-переходов и анализ абстрактных пространств состояний, включая ARG, ACG и ACT. Сам DPN Verifier поставляется как desktop-приложение, консольная утилита и библиотека классов, поэтому его можно использовать вручную, подключать к пайплайнам моделирования или брать как основу для экспериментов с DPN. Работа будет полезна исследователям process mining, разработчикам инструментов формальной верификации и командам, которые работают с процессными моделями, где поведение зависит от данных, а проверка корректности должна быть не демонстрацией на малом примере, а частью нормального инженерного пайплайна. статья | код

  • SimChrom В репозитории опубликован код SimChrom — интерактивного ресурса и набора данных для анализа человеческого хроматома. Авторы собирают разрозненную информацию о хроматин-ассоциированных белках из функциональных баз, данных о субклеточной локализации и исследований спектрометрии, а затем приводят её к единой системе. Работа обращает внимание на то, что само множество белков хроматина до сих пор плохо согласовано между источниками, и разные протеомные исследования дают сильно отличающиеся списки, локализационные базы имеют неполное покрытие, а Gene Ontology слишком подробна и неудобна для прямого анализа хроматома. На этой основе авторы строят SimChrom классификацию, набор примерно из 3000 хроматиновых белков и более простую версию разметки, где каждый белок получает одну основную категорию. Отдельно авторы показывают, что в хроматиновых белках остаётся заметная тёмная часть структурного пространства. С помощью AlphaFold и TED они находят 241 структурный домен без известных экспериментальных структур или близких структурных суперсемейств, а часть из них также не имеет Pfam-аннотаций. Работа будет полезна исследователям хроматина, системной биологии, структурной биоинформатики и командам, которые строят модели регуляции генома на уровне белков, доменов и взаимодействий. статья | код

Открытый код ФКН ВШЭ — tgindex