Научный опенсорс
описание
Канал сообщества ITMO OpenSource, посвященного созданию и использованию наукоёмких open-source проектов, в том числе в области AI/ML. Чат: https://t.me/itmo_opensource По всем вопросам - @nicl_nno
953
подписчиков
Охват к подписчикам
78,7%
ERR
Реакции к просмотрам
0,71%
246 на 29 постов
Пересылки к просмотрам
1,51%
520
Постов в день
0,1
всего 29
Где отзываются чаще
доля реакций к просмотрам- 31 янв. 2025 г.🔸 Open Talks Special: Лидеры русскоязычного open source LLM в одном эфире. 5 февраля в 19:00 собираем ключевых независимых разработчиков опенсорсных русскоязычных LLM и говорим о том, что волнует AI-сообщество прямо сейчас: ➡️ Как создаются русскоязычные LLM и с какими вызовами сталкиваются их разработчики? ➡️Что ждет опенсорсные AI-решения в будущем? ➡️ Как DeepSeek меняет правила игры? Спикеры: 🎤 Михаил Тихомиров – научный сотрудник НИВЦ МГУ, занимается адаптацией мультиязычных LLM, создатель Ruadapt➡️Топовая модель показывает 92 балла на балла на Ru Arena General 🎤 Илья Гусев – автор Сайги ➡️одной из самых скачиваемых русскоязычных моделей на HF, а также role-play бенчмарка PingPong 🎤 Александр Николич – один из авторов Rudalle и Kandinsky, создатель Vikhr models ➡️ одни из лучших моделей на русском языке до 20B параметров, один из самых популярных бенчмарков 🔸 Проведет эфир Павел Подкорытов, сооснователь AI Talent Hub и CEO Napoleon IT. 🤔 Не увидел важного вопроса в анонсе? ➡️ Регистрируйся и задай свой вопрос экспертам! Приходи! Без тебя – не то 💘 #OpenTalks #AITalentHub #ITMO #NapoleonIT3,98%
- 12:39Попался интересный лонгрид про конкурентоспособность людей и ИИ-агентов: https://t.me/vgcourse/560 Разбираются различные модели продуктивности, методики её оценки, статьи по теме и т.п. Цитируя основные выводы автора: - Большинство студентов не понимает, почему они могут быть конкурентоспособны в век агентов и как двигаться к этой конкурентоспособности. - В свежем исследовании METR рассматривается Expenditure Horizon — момент, начиная с которого агент становится менее эффективен, чем квалифицированный человек, что будет использоваться как для измерения эффективности агентов, так и для повышения эффективности использования агентов человеком. - Наиболее перспективны в век ИИ AI-Amplifier задачи, когда использование ИИ существенно повышает производительность наиболее квалифицированных людей, увеличивая их отрыв от менее опытных. Доля таких задач будет с ближайшие годы расти просто потому, что в AI-Equalizer задачах ИИ будет все сильнее вытеснять людей, а их работа будет использоваться в первую очередь как разметка для ИИ. - В ваших руках увеличение доли AI-Amplifier задач в вашей работе/учебе. Если она мала — дружеский совет — меняйте работу/учебу.3,07%
- 5 авг.Коллеги из Sber AI Lab опубликовали новый открытый репозиторий https://github.com/sb-ai-lab/SIRIN (Semantic Inconsistency Recognition and Inspection Nexus) - инструмент для поиска смысловых ошибок в ответах языковых моделей. Что умеет SIRIN: - Проверяет соответствие ответа исходному контексту на уровне токенов, последовательностей и отдельных утверждений. - Поддерживает детекцию галлюцинаций и оценку answerability - достаточности данных для ответа. - Объединяет несколько классов детекторов: llm-as-a-judge, uncertainty, probing с использованием метамоделей. - Позволяет сравнивать и комбинировать разные методы детекции - работает как инструмент для исследований и разработки. Ссылки: 🔗GitHub 🔗GitVerse 🔗Демо на Hugging Face 🔗Статья на arxiv Поддержать традационно можно звездочками.2,24%
- 3 авг.Тематически близкая конференция про качество кода продлила дедлайн до 17 августа: https://www.iccq.ru/2026.html Публикации в IEEE Xplore/Scopus, локация - уютный декабрьский Новосибирск.1,70%
- 8 июн.В GitVerse сообщают, что развернули актуальное зеркало PyPI: https://t.me/gitversenews/912 Всячески надеюсь, что с доступом к оригинальному PyPI из наших сетей никогда не будет никаких проблем, но недавно были случаи перебоев - так что для внутренних серверов может и пригодится. Также представлены зеркала Docker Hub, Maven Central и NPM. P.S. Ещё есть аналогичное зеркало от Яндекса.1,55%
- 25 мар.#зоопарк_одобряет RusWeather-GF: "дневник российской погоды" за 44 года с привязкой к местности Ученые из Почвенного института им. Докучаева (Москва) проделали колоссальную работу: собрали ежедневные данные по температуре и осадкам для 593 метеостанций России за 44 года (1980–2023), закрыв все пробелы и привязав станции к высокоточным топографическим моделям. Получился первый в своём роде открытый набор данных, готовый для любых климатических расчётов. Кто-то скажет "такое уже было". Не совсем: в исходных архивах Росгидромета не хватало примерно 1.6% записей по температуре и 1.8% по осадкам. На первый взгляд, немного, но беда в том, что пробелы были распределены очень неравномерно. Восстановление данных делалось разными методами (несколько физических моделей + ИИ, подробнее в статье) - и получилось отлично, корреляция очень высокая. Впервые к каждой станции привязали цифровую модель рельефа FABDEM v1.2 — высоту над уровнем моря, крутизну склона и шероховатость поверхности. Это критически важно для горных районов, где климат меняется на десятках метров. Данные выложены на Zenodo, ну, а статья по мотивам проделанной работы вышла в Atmospheric Research (IF = 4.4). На картинке - распределение метеостанций в России1,51%
- 3 июл.И снова рубрика "рассказываем о научно-опенсорсных успехах коллективов ИТМО". Сегодня - про AI4Physics. Андрей Богданов из Нового физтеха ИТМО совместно с Харбинским инженерными университетом: (1) разработали ИИ-модель MetaDiT для автоматического проектирования сверхтонкой оптики. (2) опубликовали статью "MetaDiT: Enabling Fine-grained Constraints in High-degree-of Freedom Metasurface Design" на А*-конференции AAAI 2026. (3) выложили открытый код; (4) на днях выпустили пресс релиз. Правда, для полноценной открытости кода в репозитории не хватает лицензии) Попробуем его обработать Осой, чтобы исправить это и поискать что ещё можно улучшить. Статья: https://ojs.aaai.org/index.php/AAAI/article/view/37025 Код: https://github.com/JessePrince/metadit СМИ: https://tass.ru/nauka/278724351,34%
- 29 июл.🤖 Интересная дискуссия развернулась по поводу open-weights моделей – после того, как стало известно об инициативах в правительстве США по запрету использования китайских моделей в американских компаниях. Дженсен Хуанг (CEO NVIDIA) – с еще семью десятками ИТ- и ИИ-лидерами – написал открытое письмо, в котором заявил, что open source – это, вообще-то, замечательно, да и open-weight тоже, так что не надо, пожалуйста, ничего и нигде запрещать. 🔹В этой связи хорошо вспомнить, что open source – это практически никогда не про благотворительность. Все самые большие проекты – они про деньги, просто не деньги за сам код. — Большая часть контрибьюторов в ядро Linux и спонсоров Linux Foundation – это компании и их сотрудники. Intel вкладывается в Linux, потому что это помогает продавать больше серверов. — Facebook (организация ужасная и запрещенная, потому что ужасная) вложился в PyTorch, чтобы Google со своим TensorFlow не монополизировал нейронки и все не сидели на их облаках. — На карточках NVIDIA, конечно же, гоняется огромное количество open-weights ИИ-моделей – тут коммерческий ущерб от их запрета пошел бы на миллиарды. Да, на тех же карточках можно гонять и американские модели, но перестройка существующих бизнес-процессов была бы катастрофической. — Perplexity и другие подписавшиеся тоже хотят использовать в своих продуктах open-weights: не все хотят переплачивать за дорогой ChatGPT, так как в этом случае конкурентоспособность сервисов радикально снизится. 🔹Почему же Anthropic отказалась подписывать это все? Скорее всего, у них самый независимый стек технологий, где open-weights используется немного, и проблемы зажравшейся NVIDIA и компаний, которые делают более дешевые, но не такие хорошие продукты, им на руку. Ну а про кибербез и репрессии китайского народа в их заявлении – для того, чтобы эгоизм не выглядывал. 🔹Есть и более позитивная сторона open source: иногда ребята открывают проекты, потому что хотят, чтобы технологии развивались в целом, и чтобы кадры росли, и чтобы экономика двигалась вперед. А где деньги заработать – это уже потом придумаем. Или не придумаем, но карму точно заработаем🌟 Так, Т-шники на TurboML выкатили пару очень прикольных релизов – T-Search и Perseus. T-Search – агентный фреймворк для многошагового поиска на английском и русском языках. Многошаговый поиск нужен, чтобы агент сначала понял контекст из всего поверхностно найденного, а потом постепенно улучшал запросы. Получилось очень круто с точки зрения сотношения полноты найденного и потраченных ресурсов. Допиленный Qwen работает на одной карточке. Всем страдающим от невозможности закупить мощностей, но страждущим сделать агентный поиск – крайне рекомендую. А штука с романтичным названием Perseus – это фреймворк для построения рекомендательной системы на потоке данных о человеке без каких-либо специальных обработок этих самых данных. То есть если у вас есть поток данных, вы хотите что-то рекомендовать человеку, и вам при этом не хочется учиться на кафедре РЭСИК два года, можно просто поставить Персея – он сам разберется и все порекомендует.1,27%
- 27 июн.Сегодня - рубрика "рассказываем о научно-опенсорсных успехах коллективов ИТМО": У коллег из Industrial AI Research Lab Института ИИ ИТМО вышла новая статья на демо-треке A*-конференции ACL 2026: SlideGuard: AI-Driven Evaluation of Graduate Student Presentation Materials SlideGuard - это агентная система, анализирующая презентации на основе множества критериев с поддержкой фильтрации и категоризации по типам слайдов. Её уже внедрили на ФТИИ ИТМО (наравне с нашим инструментом OSA - про его применение для ВКР cм. тут) Код SlideGuard - полностью открыт: https://github.com/Industrial-AI-Research-Lab/SlideGuard1,25%
- 3 июн.Коллеги из AIRI выложили в открытый доступ модель OCC-RAG. Описание дают такое: Она обучена отвечать на вопросы по внешним источникам, связывать факты из нескольких независимых частей текста, опираться только на предоставленный контекст и отказываться предоставлять ответ, если данных в источнике не хватает. Благодаря компактному размеру модель обрабатывает запросы в 1,5–2 раза быстрее решений на базе больших языковых моделей, тратя при этом на генерацию ответа в среднем в 1,5 раза меньше токенов. Ссылки: Технический репорт | GitHub | GitVerse | HuggingFace | Forbes Подробности реализации от Ивана Оселедца закинул в наш чат. Кстати, на HF статью можно поддержать апвоутом - сейчас она уже в Paper of the Day.1,25%
- 20 июл.RAGU - на HuggingFace! Сегодня мы выложили на HuggingFace препринт про открытый GraphRAG-фреймворк RAGU. RAGU - это модульный GraphRAG-движок, который превращает сырой текст в граф знаний: извлекает сущности и связи, строит и чистит граф, а затем ищет ответы через локальные, глобальные или гибридные стратегии. Этот проект сейчас разрабатывается совместно Лабораторией прикладных цифровых технологий НГУ (Иван Бондаренко) и Лабораторией автоматизированного мульти-агентного ИИ ИТМО (Николай Никитин). В разработке активно участвуют студенты обоих университетов. В комплект фреймворка входит также новая компактная модель Meno-Lite-0.1 на 7B параметров (первое место на SemEval-2026 Task 8 MTRAG). В препринте, (сейчас он на рецензии на одной из A*-конференций), мы показали, что для построения качественного графа знаний не обязательно задействовать большие модели: наш 7B-экстрактор показывает результат лучше, чем Qwen2.5-32B на построении графов. Также, фреймворк недавно ставил одним из победителей конкурса Yandex Open Source. Если говорить о конкретных цифрах: RAGU достает до 84% релевантного контекста в медицинских бенчмарках (у конкурентов ≤76%). Мы обходим HippoRAG 2 на креативных задачах (59.0 против 56.9). При этом стоимость обработки — $0.001 за документ в сравнии с $0.10 у API-решений. Как пользоваться RAGU: Ставится одной командой pip install graph_ragu, работает на обычной потребительской видеокарте. Код открыт (MIT), веса — Apache 2.0. Как поддержать: Если разработка заинтересовала, то ее можно поддержать в Daily Papers на Huggingface, поставив upvote тут: https://huggingface.co/papers/2607.11683 Также, будет рады звездочкам на репозиторий: https://github.com/RaguTeam/RAGU Если есть вопросы - пишите в комментариях или в Issues на GitHub. P.S. Если хотите посмотреть, как всё работает: - 2 минуты: базовая настройка и первый запуск - 11 минут: глубокое погружение в конфигурации пайплайна1,15%
- 4 авг.#зоопарк_одобряет #конференции Вернее, не конференция, а интересный (и бесплатный) вебинар от girafe.ai "Рабочее окружение ML-инженера: делегируем рутину ИИ-агентам" Почему интересно: хотя бы по той причине, что у girafe.ai есть совместная онлайн-мага с МФТИ, что, на наш взгляд, уже знак качества (Физтех очень разборчив в выборе таких партнеров) Темы: • организация удобного рабочего окружения ML-инженера с нуля • настройка безопасного состояния удалённого сервера для любых нужд • автоматизация всех рутинных процессов агентами • формирование скиллов агентов для однокнопочного воспроизводства операций • кастомизация под свои вкусы и нужды Когда: 5 августа (среда), в 19:00 (МСК) Спикер: Владислав Гончаренко - основатель girafe.ai и автор курса MLOps онлайн-магистратуры MSAI (girafe.ai × МФТИ) Язык русский, участие, повторяем, бесплатное, но нужна предварительная регистрация - вот тут1,10%