tgindex
Neurohive

Новости нейросетей. Open source модели и методы, AI-агенты, deep learning, big data, machine learning, NLP, computer vision. По вопросам сотрудничества: @kekspeksoh

Последний пост
11 авг.
Последнее чтение
12:09
Постов за неделю
1
Всего постов
32
Тип
открытый
Язык
русский
Категория
Технологии
В каталоге с
13 авг.
Подписчики
4 966
−3 за 3 дн.
Сутки
−2
−0,04%
Неделя
 
Месяц
 
Просмотров на пост
2 735
32 постов
Вовлечённость
55,1%
к подписчикам
Постов в день
0,1
всего 32
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
680
1/48двое суток
779
1/72трое суток
840

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 11 авг.7671324

    JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одной B200 Команда Joy Future Academy представила JoyAI-Video-Edit — открытую авторегрессионную диффузионную модель на 16B параметров для редактирования видео в реальном времени. Модель обрабатывает кадры по текстовому промпту по мере их поступления, без доступа к будущим кадрам и не зная длину ролика. Полный сквозной пайплайн выдаёт 30.19 FPS в разрешении 720×1280 на одной Nvidia B200. JoyAI-Video-Edit умеет менять фон, стиль (акварель, масло, мультфильм), добавлять, удалять и заменять объекты и людей в кадре, менять одежду и внешность, изменять движения персонажей и объектов. Отдельно поддерживается редактирование по референсной картинке, когда одежда или предмет с фотографии переносится на человека в видео. Всё это работает поверх исходного ролика, оставляя без изменений движения, композицию и те области видеопотока, которые менять не просили. Архитектура модели состоит из энкодера условий на базе MLLM, каузального видео-VAE и мультимодального диффузионного трансформера. Итеративный денойзинг сжат до двух шагов методом Source-Anchored DMD, который привязывает учителя к синхронному фрагменту исходного видео и не даёт картинке отходить от оригинала на длинных потоках. Результаты: на бенчмарке OpenVE-Bench модель набирает 3.60 балла против 2.62 у SANA-Streaming и 1.87 у XMax-X2.0, что сопоставимо по качеству с офлайн-редакторами Kling-3.0 Omni (3.64) и Bernini-R (3.72). На минутных видео из LongV2VBench — 3.30 против 1.71 у ближайшего конкурента. В попарной человеческой оценке JoyAI-Video-Edit выигрывает у потоковых редакторов в 81–90% случаев. Код инференса выложен на GitHub, веса - на Hugging Face под лицензией Apache 2.0. #Stateoftheart

  • 3 авг.1 8071136

    TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря замене LLM на BERT Исследователи из Хуачжунского университета науки и технологий и Huawei опубликовали TurboVLA - компактную vision-language-action модель, которая выдаёт действия для робота за 31.2 мс на RTX 4090 и набирает 97.7% на бенчмарке для роботов LIBERO. Главное отличие от других VLA в том, что внутри нет LLM. Вместо неё лёгкий текстовый энкодер BERT, а картинка и инструкция обмениваются информацией напрямую через модуль кросс-внимания. Отсюда 0.2B параметров вместо миллиардов и меньше 1 ГБ видеопамяти на инференсе. Обычно VLA-модели устроены так: робот получает картинку с камеры и текстовую инструкцию по типу «сложи три миски друг на друга». Визуальные признаки сначала проецируются в пространство токенов языковой модели, склеиваются с токенами инструкции, прогоняются через модель, и уже из её скрытых состояний декодируются действия. Этот путь обозначается как V → L → A: сначала зрение, затем язык, потом действие. Ключевое наблюдение исследователей простое: если в инструкции уже написано, что делать, то от текста нужно только подсказать, на какие визуальные детали смотреть. Вместо V → L → A авторы предлагают прямое отображение V + L → A. Картинки и инструкция кодируются независимо, потом обмениваются информацией напрямую, минуя большую языковую модель. За один прямой проход модель выдаёт сразу чанк из 12 шагов управления. Результаты на бенчмарке для роботов LIBERO: TurboVLA набирает 97.7% в среднем при 0.2B параметров, 0.9 ГБ видеопамяти и 31.2 мс задержки. Для сравнения, модель π0.5 выдаёт 96.9% при 3.4B параметров, 12.8 ГБ и 93.6 мс. VLA-JEPA набирает 97.2% при 2.8B и 108.7 мс, CogVLA 97.4% при 8.3B и 115.5 мс. Среди лёгких моделей Evo-1 даёт 94.8% при 0.8B, VLA-Adapter 97.3% при 1.5B. На реальном роботе AgileX Piper модель проверили на четырёх задачах (взять валик, отодвинуть карту, нажать степлер, сложить три миски) и получила от 80% до 92.5% success rate, в каждой из них обойдя π0.5. Симуляционную часть можно воспроизвести целиком: обучение и тесты шли на открытых датасетах LIBERO и RoboTwin 2.0 (для версии под RoboTwin брали визуальный энкодер побольше, там 0.4B параметров). Собственные данные использовали только для дообучения под реального робота. TurboVLA рассчитана на конкретные инструкции. Если попросить робота «приготовить завтрак», разбивать это на шаги будет нечем. Код модели доступен на GitHub под лицензией Apache-2.0, веса выложены на Hugging Face. #Stateoftheart

  • 22 июл.2 9632033

    🗜Bonsai: 1-bit версия Qwen 27B работает на iPhone c сохранением 90% качества ответов Стартап PrismML выпустил Bonsai 27B — бинарную и тернарную версии Qwen3.6-27B, которые сохраняют 90–95% качества исходной модели при сжатии весов в 9.4–14.2 раза. Тернарная версия занимает 5.9 ГБ и работает на ноутбуке (M5 Pro) со скоростью около 26 токенов в секунду, а 1-битная умещается в 3.9 ГБ и генерирует около 11 токенов в секунду на iPhone 17 Pro Max, или около 30 слов в секунду. Это первый случай, когда модель такого класса запускается на телефоне. Обычное квантование ниже 4–5 бит ломает модели резко, а не постепенно. Текст остаётся гладким и уверенным, но рассуждения начинают противоречить сами себе, вызовы инструментов перестают парситься. До сих пор это обходили только обучением с нуля сразу в низкобитном виде (подход BitNet от Microsoft), но такие модели упёрлись в ~2B параметров. Bonsai конвертирует уже готовую предобученную модель, и главный результат именно в этом: считалось, что при сжатии ниже 4 бит модели ломаются сами по себе, но выяснилось, что дело в методах квантования. Тернарный значит «троичный». Это способ хранения весов, при котором каждый вес принимает только одно из трёх значений: −1, 0 или +1. В обычной модели каждый вес — это число с плавающей точкой (FP16), например 0.0374, и на него уходит 16 бит. В бинарной модели вес может быть только −1 или +1, то есть хранится один бит, по сути только знак. Ноль здесь важен, потому что даёт модели возможность «выключить» связь между нейронами, то есть сказать «этот вход вообще не влияет на выход». Тернарная версия точнее, а бинарная компактнее. Усредненные показатели по 15 бенчмаркам от математики и кода до вызова инструментов и работы с изображениями показывают, что деградация ответов по сравнению с исходной Qwen3.6-27B составляет 5.4% у Ternary Bonsai - 80,49 пртив 85.07 и 11.5% у 1-bit Bonsai, которая показала средний бал 76.11. Сравнение проводилось по единой методике на базе EvalScope с vLLM на NVIDIA H100 в режиме рассуждений, где деградация ниже 4 бит проявляется сильнее всего. Тернарная и бинарная версии теряют заметные баллы на агентных задачах и зрении относительно FP16. Веса обеих версий выложены на Hugging Face, код на GitHub под лицензией Apache 2.0, а попробовать модель можно в браузере. #Stateoftheart

  • 8 июл.5 3391452

    🎮 MIRA: нейросеть полностью симулирует Rocket League для четырёх игроков в 20 FPS, не требуя установки игры General Intuition, Kyutai и Epic Games представили MIRA — мировую модель, которая полностью симулирует игровую среду Rocket League сразу для четырёх игроков и рисует каждому свою картинку в реальном времени. Движка игры внутри нет вообще. Ни физического движка, который считает столкновения мяча и машин, ни рендерера, который рисует арену. Всё это заменяет одна нейросеть, которая по нажатиям кнопок сама дорисовывает следующий кадр. Игра целиком «живёт» внутри весов модели, поэтому запустить её можно локально, без установки оригинальной Rocket League. Под капотом диффузионный трансформер на 5B параметров. Он предсказывает не пиксели напрямую, а сжатое скрытое представление кадра поверх замороженного экстрактора признаков DINOv3-L: кадры сначала сжимает видео-кодек, модель предсказывает следующий скрытый кадр, а декодер разворачивает его обратно в картинку. Работает в реальном времени: 20 FPS на одной Nvidia B200. Обучена на 10 000 часов матчей 2 на 2, полностью сыгранных ботами. Четыре картинки согласованы благодаря тому, что ракурсы игроков складывают в одну сетку и предсказывают вместе. Пространственное внимание охватывает четыре представления, и модель рисует общий мир, мяч и чужие машины одинаково со всех четырёх ракурсов за один проход. Физическое состояние игры (позиции, скорости, ориентации мяча и машин) логируется отдельно на 120 Гц. Мировая модель его не видит и учится только на пикселях и действиях. Это состояние нужно как эталонная разметка для проверки: по нему авторы смотрят, кодирует ли модель в своих признаках физически осмысленные величины. Видео-кодек MIRA даёт заметный рост качества по сравнению с предсказанием прямо в пикселях. Метрики gFID и gFVD измеряют, насколько сгенерированное видео похоже на настоящее (чем меньше, тем лучше): с кодеком 10.7 и 163.1 против 104.9 и 1456.3 без него. Метрика ARR показывает, насколько точно модель отрисовывает нажатые кнопки (1.0 = идеал): с кодеком 0.91 против 0.61. На практике без кодека картинка сваливается в искажённую текстуру уже через секунду. Авторы опубликовали код обучения и инференса на Github, а также датасет на Hugging Face. Поиграть самостоятельно можно в демо-режиме на сайте проекта. #Stateoftheart

  • 2 июл.4 15718

    ⚡Выбирать железо для обучения и инференса моделей больше не нужно Qwen, Whisper, Deepseek и другие нейросети уже готовы к работе на приватной инфраструктуре. Просто выбираете нужную модель и получаете готовый инференс-сервис в пару кликов в Selectel. Каталог ИИ-моделей Selectel — удобный инструмент для работы с нейросетями, когда нужны безопасность и производительность. Что вы получаете в пару кликов: ⚡Большой выбор моделей для ваших задач: для генерации текстов и кода, распознавания речи, создания контента и других. ⚡Производительность и гибкое масштабирование. Инференс-сервис развернут на современном железе с актуальными видеокартами и автоматически адаптируется при росте или снижении нагрузки. ⚡Прогнозируемая стоимость: платите за фактическое время потребления вычислительных ресурсов. Начните работать с ИИ-моделями на выделенной инфраструктуре: https://slc.tl/ibq7g Реклама, АО «Селектел», erid: 2VtzqwFqJdw

  • 1 июл.3 41755

    Claude Sonnet 5: сильный агентный апгрейд, но не очевидная замена Opus Anthropic представила Claude Sonnet 5 — новую модель из линейки Claude, доступную в том числе пользователям бесплатного тарифа. Она ориентирована на агентные задачи, программирование, работу с инструментами и корпоративную автоматизацию. По данным Artificial Analysis, Sonnet 5 набрала 53 балла в Intelligence Index и стала моделью №5 в рейтинге по общему интеллекту модели. Она отстает от GPT-5.5 и Claude Opus 4.8 всего на 2–3 балла, от Fable — на 7 баллов, а по сравнению с Sonnet 4.6 прибавила 6 баллов на максимальном уровне рассуждений. В кодинге прирост тоже заметен. Cursor сообщил, что на CursorBench — тесте реальных многофайловых задач из Cursor — Sonnet 5 набрала 57% против 49% у Sonnet 4.6. Но главный нюанс — стоимость. В тестах Artificial Analysis одна задача на Sonnet 5 при стандартной цене API стоила примерно в 2 раза дороже Sonnet 4.6 и на 15% дороже Opus 4.8. Причина — повышенный расход: Sonnet 5 генерировала на 40% больше выходных токенов и делала примерно в 3 раза больше агентных шагов на выполнение рабочих задач: поиск информации, анализ документов и подготовку решений. На стоимость влияет и новый токенизатор. Simon Willison проверил одни и те же тексты и получил рост числа токенов на входе: английский текст стал тратить примерно в 1.4 раза больше токенов, испанский — в 1.33 раза, Python-код — в 1.28 раза. Для упрощенного китайского текста разницы почти не было. CodeRabbit тоже дает смешанную оценку. Для ревью кода Sonnet 5 стала точнее: precision вырос с 29% у Sonnet 4.6 до 38–40%. Но по нахождению багов результат хуже: Sonnet 5 нашла около 51% багов, а Sonnet 4.6 — около 63%. Усиление глубины рассуждений почти не улучшало результат, а стоимость при этом почти удвоилась. Вывод: Claude Sonnet 5 стала сильнее Sonnet 4.6 в кодинге и агентных задачах, но это не делает ее новой флагманской моделью Anthropic. Opus 4.8 по-прежнему сильнее в сложных задачах на глубокие рассуждения, а Sonnet 5 обходит его только в двух бенчмарках из десятков. Зато Sonnet 5 доступна пользователям бесплатного тарифа Claude. #AInews

  • 30 июн.2 5901341

    LFM2.5-230M: ультракомпактная модель работает на Raspberry Pi и почти любом современном телефоне Команда Liquid AI выпустила LFM2.5-230M — одну из самых маленьких языковых моделей на сегодня, всего на 230 миллионов параметров. Модели хватает 293 МБ памяти на Raspberry Pi 5 и 375 МБ на смартфоне. На Raspberry Pi 5 модель выдаёт 42 токена в секунду при декодировании, а на флагмане Galaxy S25 Ultra разгоняется до 213 т/с. Человек читает текст со скоростью примерно 5–7 т/с. На бенчмарках модель конкурирует с моделями вдвое больше и часто их обходит. Модель поставили на человекоподобного робота Unitree G1, и она работала на встроенном чипе NVIDIA Jetson Orin. Модель выступила в качестве слоя выбора навыков: берёт одну команду на обычном языке вроде «постой 2 секунды, потом иди вперёд со скоростью 1 м/с на 3 метра» и раскладывает её на последовательность вызовов готовых низкоуровневых навыков. Получается, что модель на 230 миллионов параметров может служить языковым интерфейсом управления для робота. Главное ограничение модели простое: ей нужно около 350MB RAM и более-менее современный процессор. Прямыми тестами авторов подтверждены запуск на одноплатнике Raspberry Pi 5. Заявлена поддержка чипов Apple, AMD, Qualcomm и Nvidia, ее потянет почти любой современный телефон или планшет, а на ноутбуках ресурсов с запасом. Часы тоже теоретически потянут, но на практике мешают нагрев и неемкая батарейка. Микроконтроллеры и простая бытовая электроника (чайники, лампочки, фитнес-браслеты, наушники) точно не потянут: там памяти килобайты, а не сотни мегабайт. Несмотря на размер, на бенчмарках модель обходит соперников вдвое крупнее. На тесте следования инструкциям IFEval она набрала 71.71 против 63.49 у Gemma 3 1B и 59.94 у Qwen3.5-0.8B. Сильнее всего она в вызове инструментов и извлечении данных, а вот для математики, кода и сложных рассуждений авторы её брать не советуют — она заточена под другое. Модель и веса можно скачать на Hugging Face, исходники и SDK лежат на Github. #Stateoftheart

  • 29 июн.1 9502

    Выбираем железо для обучения и инференса моделей 🔝 Простая формула: чем больше у модели параметров, тем более мощное железо нужно для ее инференса. Найти решение для нейросетей разного масштаба можно в Selectel. Более 15 моделей видеокарт — от RTX 4090 до B300 — доступны к аренде в облаке и на выделенных серверах. Облачные серверы подойдут для тех, кому нужна гибкость и быстрая масштабируемость, а выделенные — когда необходима физическая изоляция инфраструктуры, а нагрузки стабильные. Видеокарты в облаке можно арендовать даже на час, цена стартует от 5 рублей. Выбирайте оптимальный сервер с видеокартой и арендуйте его от 5 рублей в час: https://slc.tl/rqf62 Реклама, АО «Селектел», erid: 2Vtzqwcao6q

  • 19 июн.2 7541027

    DreamX-World-5B: открытая модель генерации мира с контролем камеры, текстовым управлением и запоминанием локаций Команда AMAP-ML опубликовала DreamX-World 1.0 — интерактивную генеративную модель мира, которая превращает текст или изображение в управляемое видео с точным контролем камеры, памятью о ранее посещённых сценах и поддержкой добавления событий по текстовым промптам. Модель работает в фотореалистичных, игровых и стилизованных визуальных доменах. Исследователи дообучили базовую модель Wan2.2-TI2V поэтапно: сначала для управления камерой, затем для долгосрочной памяти о сцене, событийного управления и авторегрессивной генерации длинных видео. На восьми GPU RTX 5090 модель работает в реальном времени со скоростью до 16 FPS. DreamX-World 1.0 — единственная публично доступная модель, поддерживающая все пять уровней управления действиями: реакцию на текстовые промпты, события на уровне отдельных объектов, привязку событий к области кадра, комбинирование нескольких сущностей в одной инструкции и взаимодействие между объектами. Конкуренты частично покрывают первые два-три уровня, но не дают полноценного управления несколькими взаимодействующими объектами одновременно. DreamX-World с 5B параметров обгоняет модели большего размера по ключевым метрикам и при этом работает в реальном времени. В слепом исследовании предпочтений людей DreamX-World выигрывает у конкурентов: HY-WorldPlay (8B) в 57.5% случаев и у LingBot-World (14B) в 61.9% по общему впечатлению. Моделирование мира — это комплексная задача: подготовка данных, поэтапное обучение, оценка и оптимизация инференса должны проектироваться вместе, а не отдельно друг от друга. Если решить только архитектурную часть и оставить медленный инференс, модель останется лабораторным прототипом, не пригодным для интерактивного использования. Если сосредоточиться только на скорости и забыть про память сцены, пользователь будет видеть, как окружение меняется при каждом повторном проходе, и ощущение «настоящего мира» пропадёт. Веса модели доступны на Hugging Face, код на GitHub. #Stateoftheart

  • 16 июн.2 6971865

    🤔 VibeThinker: 3B-модель рассуждает и кодит на уровне DeepSeek V3.2, GLM-5 и Gemini 3 Pro Команда Sina Weibo AI опубликовала VibeThinker-3B — компактную языковую модель, которая на задачах математики и программирования показывает результаты уровня флагманских моделей DeepSeek V3.2, GLM-5 и Gemini 3 Pro, при этом уступая им в размере в 200+ раз. Код и веса модели опубликованы на Github и HuggingFace. Авторы сформулировали гипотезу о параметрическом сжатии: одни способности моделей сжимаемы, другие нет. Верифицируемые рассуждения относятся к первым — алгоритм решения универсален и повторяем, его можно плотно уложить в небольшое число параметров. Энциклопедические знания относятся ко вторым: каждый факт, понятие и редкий сценарий требует отдельного места, поэтому здесь масштаб по-прежнему важен. Оказалось, что 3B параметров достаточно, чтобы войти в топ на специализированных задачах рассуждения. VibeThinker-3B обучена поверх Qwen2.5-Coder-3B в четыре этапа. SFT в две ступени: сначала широкое покрытие доменов, затем фокус на длинных и сложных примерах. Многодоменный RL последовательно по математике, коду и STEM. Офлайн self-distillation лучших траекторий обратно в модель и финальный Instruct RL для следования инструкциям. На этапе RL используется MGPO — модификация GRPO, которая назначает высокие веса запросам, где модель отвечает правильно примерно в 50% случаев. Такие запросы находятся на текущей границе возможностей модели и дают наиболее полезный градиентный сигнал. Результаты на бенчмарках с рассуждениями впечатляют. На AIME 2026 модель набирает 94.3 — столько же, сколько DeepSeek V3.2 (671B) и Kimi K2.5 (1T), с CLR (техникой проверки ключевых утверждений на этапе инференса) результат растёт до 97.1. На LiveCodeBench v6 — 80.2 Pass@1, на LeetCode соревнованиях апреля-мая 2026 решает 96.1% задач с первой попытки, выше GPT-5.2 (95.3%) и всей линейки Claude 4.6. На IFBench 74.5 — выше Claude Opus 4.5 (58.0) и Gemini 3 Pro (70.4). На вопросно-ответном GPQA-Diamond заметно отставание: 70.2 против 90+ у крупных моделей, что авторы считают подтверждением гипотезы. #Stateoftheart

  • 4 июн.2 6832230

    ESM Cambrian: модель для предсказания и дизайна белков превзошла AlphaFold3 от Google и построила крупнейший атлас белкового мира Команда исследователей из Biohub представила ESM Cambrian (ESMC) — открытую языковую модель для предсказания и дизайна белков, которая обошла AlphaFold3 от Google по точности предсказания структур белка. Модель построила атлас из 6,8 миллиарда белковых последовательностей — готовую базу для поиска новых лекарств, ферментов и материалов без дорогостоящих лабораторных экспериментов. ESMC спроектировала молекулы с аффинностью до 0,068 нМ к мишеням CTLA-4 и EGFR — это уровень лучших клинически одобренных антител для лечения рака. Классический лабораторный цикл для получения молекулы такого качества занимает месяцы. Авторы показали, что вычислительный скрининг через ESMC даёт сопоставимый результат за дни. ESMC обучена по принципу предсказания замаскированных токенов: часть аминокислот в последовательности скрывается, и модель учится их восстанавливать. Тот же подход используется в языковых моделях для текстов: модели вроде BERT научились понимать значение слов и их связи, просто восстанавливая пропуски - без словарей, учебников или разметки. Авторы показали через разреженные автоэнкодеры (SAE), что ESMC действительно выучила иерархию биологических концепций: от отдельных аминокислот до эволюционных тем, общих для бактерий, архей и эукариот. Это чистый пример эмерджентности: паттерн возник сам по себе в процессе обучения без разметки. На бенчмарке FoldBench модель достигла DockQ pass rate 50% на задаче предсказания комплекса антитело-антиген из одной последовательности, превзойдя AlphaFold3 с показателем 47%, при том что AlphaFold3 для этого использует MSA (multiple sequence alignment) - выравнивание сотен эволюционно родственных последовательностей, которое требует дорогостоящего поиска по миллиардам записей. Веса и код доступны на GitHub и HuggingFace, интерактивная среда запущена на biohub.ai. #Stateoftheart

  • 28 мая3 7551073

    LLaVA-OneVision-2-8B: мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео. Вместо того чтобы нарезать видео на равномерные кадры, модель анализирует сжатый видеопоток через кодек. Большинство моделей просто нарезают видео на 8–32 равномерных кадра и выбрасывают остальное. Если что-то важное происходит между двумя отобранными кадрами, модель это просто пропустит. Видеокодеки вроде H.264 уже содержат информацию о том, где в видео происходят изменения, LLaVA-OV-2 использует именно её. Модель отбирает фрагменты с высоким битрейтом, где происходит движение или смена сцены. В итоге токены концентрируются там, где в видео действительно что-то происходит, а не размазываются равномерно по всему клипу Авторы создали бенчмарк JumpScore, в нем модели нужно найти конкретный момент среди множества визуально почти одинаковых циклов. В нём 189 видео с прыжками на скакалке, задача - указать время начала каждого прыжка с точностью до 0,1–0,3 секунды. LLaVA-OV-2-8B сравнивали с четырьмя моделями того же класса: Qwen3-VL-8B, Keye-VL-1.5-8B, InternVL-3.5-8B и LLaVA-OV-1.5-8B. Наибольший отрыв — на JumpScore (+44,8 пункта над Qwen3-VL) и на задачах локализации событий во времени и пространственного рассуждения. На большинстве остальных бенчмарков модель лидирует или держится в топ-2. Код доступен на GitHub, датасеты - на Hugging Face, где также доступны веса модели. #Stateoftheart #Benchmark

  • 21 мая2 735916

    LongLive-2.0 — 5B-модель генерирует минутное видео в 720p в реальном времени Исследователи из NVIDIA опубликовали LongLive-2.0 — инфраструктуру для обучения и запуска моделей генерации длинных видео с использованием 4-битного квантования NVFP4. NVFP4 — собственный формат NVIDIA, нативно поддерживаемый на GPU архитектуры Blackwell (GB200), так что полное ускорение доступно только на этом железе. В исследовании сравнивается квантование BF16 и NVFP4. BF16 хранит каждое число в 16 битах, NVFP4 сжимает их до 4 бит, поэтому модель занимает меньше памяти и быстрее считает. Теоретически это должно снижать качество генерации, но авторы показывают, что на практике результаты почти не отличаются от BF16: 85.06 против 84.51 балла на VBench. Wan2.2-TI2V-5B, дообученная с помощью LongLive-2.0, генерирует 720p-видео со скоростью 45.7 FPS. Предыдущие методы выдавали 20-25 FPS при разрешении 480p. Обучение ускорилось в 2.15 раза, инференс — в 1.84 раза, потребление видеопамяти упало с 35.4 до 19.4 ГБ по сравнению с BF16-версией. На бенчмарке VBench-Long модель заняла первое место по согласованности персонажей и фона на 60-секундных видео. Три ключевых компонента делают это возможным. Balanced SP — каждый GPU обрабатывает свой временной фрагмент видео, балансируя нагрузку и убирая дублирование VAE-энкодинга. Это позволяет обучать модель на 64-секундных видео без выхода за пределы памяти. KV-кэш квантуется в NVFP4 прямо во время генерации, сжимаясь в 3.6 раза. Асинхронное декодирование запускает VAE на отдельном GPU параллельно с основной моделью, так что декодирование не замедляет общую генерацию. Код, веса и датасеты доступны на GitHub и Hugging Face. #Stateoftheart

  • 14 мая3 19722

    видео или голосовое, без подписи

  • 14 мая2 69722

    видео или голосовое, без подписи

  • 14 мая2 00422

    видео или голосовое, без подписи

  • 14 мая1 6351323

    SenseNova-U1: новая мультимодальная архитектура NEO-unify работает напрямую с пикселями без VAE Команда SenseNova представила мультимодальную архитектуру SenseNova-U1, которая объединяет понимание изображений, генерацию и редактирование внутри единого трансформера без VAE или визуального энкодера. Архитектура NEO-unify не только упрощает модель, но и делает мультимодальное обучение заметно эффективнее: 8B-модель превосходит OmniGen и FLUX.1-Kontext на задачах генерации изображений, инфографики и сложных макетов. Модель умеет генерировать и редактировать изображения, распознавать текст и разбирать документы, работать в мультимодальном чате, выполнять смешанную генерацию текста и изображений, решать задачи визуального рассуждения и создавать инфографику со сложными макетами. SenseNova-U1 изначально обучается как единая мультимодальная фундаментальная модель, а не как набор соединённых компонентов. Авторы отдельно подчёркивают, что модель работает напрямую с пикселями и текстом без отдельного латентного пространства. Вместо визуального энкодера используется лёгкое разбиение изображения на патчи. Изображение делится на блоки размером 32×32 пикселя, после чего они напрямую отправляются в трансформер. Для этого используются всего два сверточных слоя с функцией активации GELU. Компактная 8B версия показывает результаты выше BAGEL, FLUX.1-Kontext и OmniGen на задачах редактирования изображений, а 30B MoE-модель показывает уровень Qwen2.5-VL и InternVL на бенчмарках для мультимодального понимания, OCR и визуального рассуждения. Код, веса моделей, пайплайн инференса и демо доступны на Hugging Face и на Github под лицензией Apache 2.0. #StateOfTheArt

  • 7 мая2 5671265

    OpenSeeker-v2: лучший в своем классе Deep Research агент, созданный академической командой всего на 10600 примерах Исследователи из Шанхайского университета Цзяо Тун представили OpenSeeker-v2 — агента, который самостоятельно исследует интернет в ответ на сложный вопрос: формулирует цепочку поисковых запросов, читает страницы, сопоставляет источники и выдаёт развёрнутый ответ. Для обучения использовалось всего 10600 правильно подобранных примеров, сгенерированных полностью автоматически без участия людей-разметчиков. Модель обучили за один этап, без предобучения и без обучения с подкреплением. OpenSeeker-v2 побила Tongyi DeepResearch от Alibaba на четырёх бенчмарках: 46.0% против 43.4% на BrowseComp, 58.1% против 46.7% на BrowseComp-ZH, 34.6% против 32.9% на Humanity's Last Exam, 78.0% против 75.0% на xbench. OpenSeeker-v2 построен на базе Qwen3-30B-A3B-Thinking-2507 — 30B MoE модели, у которой при генерации ответа активируется только 11% параметров, что заметно снижает вычислительные затраты. Контекстное окно составляет 256k токенов, а на одну задачу агент может совершить до 200 вызовов инструментов. Процесс генерации данных для обучения выглядит так: берётся граф знаний, вокруг случайного узла строится подграф, на его основе генерируется вопрос, затем агент ищет ответ в интернете. Последовательность шагов записывается как обучающий пример. Это одна из причин, почему подход доступен университетским командам: не нужен бюджет на разметку данных. При этом чем больше граф, тем сложнее задача — модель вынуждена искать ответ не в одном документе, а выстраивать цепочку переходов между несколькими источниками (multi-hop reasoning). Проект полностью открытый: веса модели доступны на Hugging Face, а код обучения и код генерации обучающих данных — на GitHub. #Stateoftheart

  • 28 апр.2 4641238

    🎮 OpenGame: агент генерирует полноценные браузерные игры по текстовому описанию Исследователи из CUHK MMLab представили OpenGame — открытый агентный фреймворк для создания 2D-игр. Пользователь пишет идею, агент самостоятельно генерирует код, графику и музыку. На выходе получается работающая браузерная игра. Фреймворк состоит из трёх компонентов: 1. Модель GameCoder-27B, обученная на базе Qwen3.5-27B на репозиториях Phaser/JavaScript в три этапа: дообучение на корпусе без разметки, обучение с учителем, обучение с подкреплением. 2. Агентный пайплайн из 6 фаз: классификация типа игры, построение каркаса проекта (scaffolding), генерация геймдизайн-документа, создание мультимодальных ассетов (изображения, музыка), написание кода, верификация с самоисправлением через запуск билда в браузере. 3. Механизм итеративного улучшения GameSkill. Агент учится на своих ошибках. Механизм Debug Skill ведёт «живой» протокол отладки: каждый раз, когда что-то ломается, агент записывает сигнатуру ошибки, причину и проверенное исправление. По мере решения задач фреймворк выделяет переиспользуемые фрагменты и добавляет их в библиотеку. В результате возникли пять классов: платформер с гравитацией, top-down с непрерывным движением, grid-механика, tower defense с волнами врагов и UI-ориентированные игры. На бенчмарке OpenGame-Bench из 150 игр конфигурация OpenGame с Claude Sonnet 4.6 в качестве движка рассуждений показывает SOTA результат: корректность сборки 72.4, визуальная читаемость 67.2, соответствие замыслу 65.1 — на 5–6 пунктов выше Cursor с тем же бэкендом. GameCoder-27B превосходит все открытые модели при значительно меньшем размере. Код, веса GameCoder-27B и датасеты доступны на GitHub. #Stateoftheart

  • 21 апр.2 5211237

    📺 ClawGUI: фреймворк полного цикла для GUI-агентов от обучения до запуска на девайсе Исследователи из Чжэцзянского университета представили фреймворк для разработки GUI-агентов ClawGUI. ИИ-агент управляет телефоном или компьютером как человек: нажимает, скроллит, вводит текст без доступа к API. Фреймворк состоит из трёх модулей: ClawGUI-RL для обучения с подкреплением на параллельных эмуляторах и реальных устройствах, ClawGUI-Eval для стандартизированной оценки на 6 бенчмарках, ClawGUI-Agent для деплоя на Android, HarmonyOS и iOS через 12 мессенджеров. Модель ClawGUI-2B была обучена на базе MAI-UI-2B c использованием 64 параллельных Android-эмуляторов на 8 GPU A6000. На бенчмарке MobileWorld GUI-Only она набирает 17.1% — лучше исходной MAI-UI-2B (11.1%) того же размера, и выше Qwen3-VL-32B (11.9%) и UI-Venus-72B (16.4%). Примечательно, что обучение 2B-модели на этом фреймворке могло обойтись авторам относительно недорого. Аренда одной A6000 в облаке стоит от $0.27/час на Thunder Compute до $0.91/час на Lambda — при 8 GPU в сумме от $2.16 до $7.28 в час. Для прохождения коротких специализированных сценариев, таких как тестирование приложения после релиза или заполнение форм, точность после дообучения будет заметно выше, чем на универсальном бенчмарке. Код, веса модели и датасеты доступны на GitHub и HuggingFace под лицензией Apache 2.0. #Frameworks #Stateoftheart

Neurohive — tgindex