Complete AI
описание
Меня зовут Андрей Кузнецов Руковожу управлением в Sber AI, построил успешную лабораторию FusionBrain в AIRI, один из основателей Kandinsky, к.т.н., 15+ лет опыта в Computer Vision, выступаю с лекциями и пишу о событиях в AI и ML
7 829
подписчиков
Охват к подписчикам
32,0%
ERR
Реакции к просмотрам
1,09%
663 на 23 постов
Пересылки к просмотрам
1,47%
890
Постов в день
0,3
всего 24
Где отзываются чаще
доля реакций к просмотрам- 12 авг.🐍 Сегодня мы выпустили ГигаАгента Расскажу, что мы построили и почему это важно. ГигаАгент — это автономный универсальный ИИ-агент на базе Ouroboros, который переписывает свой собственный код через reviewed self-evolution. Буквально: редактирует рантайм, коммитит через multi-model review gate, рестартится на новой версии. Если сломался — откатывается. Если совсем плохо — /panic. Это результат синергии, которая редко случается в индустрии: исследовательская команда лаборатории FusionBrain AIRI отвечала за архитектуру агента и самоэволюцию, фреймворк и научный фундамент, а инженерная команда в Сбере — за продуктовую обвязку, инфраструктуру и адаптацию под бизнес-сценарии и enterprise-ограничения. Когда исследователи и инженеры работают как одна команда, получается отличная синергия: 🏆 SOTA на трёх бенчмарках разом: — Terminal-Bench 2.1: 86.97% (предыдущий лучший — 83.8%) — OSWorld-Verified: 90.69% — работа мышкой/клавиатурой в реальном десктопе — CL-Bench: 0.2301 normalized reward — накопление знаний между задачами На SWE-bench Pro и GAIA — паритет с Claude Code и Codex. 🧬 Ключевая фишка — саморазвитие Агент может менять свои навыки, промпты, контекст и даже логику ревью. Но каждое изменение проходит через иммунную систему: несколько LLM от разных вендоров независимо ревьюят дифф, голосуют кворумом, плюс отдельная модель с большим контекстом проверяет, не ломает ли правка проект целиком. Fail-closed — при сомнении изменение не проходит. Пользователю доступны разные режимы глубины эволюции: от ядровых компонент до навыков. Он также умеет — Создавать рой субагентов для сложных задач — Проектировать навыки по запросу пользователя — Решать задачи по расписанию (cron) — Подключать уже созданные ранее навыки в других агентах, интегрирован магазин ClawHub, есть MCP и A2A протоколы для взаимодействия — Анализировать и создавать презентации, дэшборды, документы, таблицы, PDF Как продукт — Работает в фоне, не нужно контролировать каждый шаг — Хранит память между сессиями — Сам создаёт и подключает навыки по необходимости — Учится на ошибках — Доступен через Agents Space от Cloud.ru, 4000 бонусов на старте 📄 Техрепорт на arXiv: arxiv.org/abs/2608.08311 📰 Хабр: https://habr.com/ru/companies/airi/articles/1065428/ 🔗 Попробовать: https://cloud.ru/agents-space2,46%
- 31 июл.Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes. Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса. Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ. Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋 P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!) GitHub, Хабр, установочники2,42%
- 6 авг.Курс по Visual GenAI от Yandex Research и ШАД Авторы CV Time не только пишут обзоры статей о компьютерном зрении, но и создают обучающие курсы. Сегодня делимся курсом ШАДа «Генеративные модели в компьютерном зрении», который ведёт Дмитрий Баранчук, руководитель группы GenAI в Yandex Research, вместе с праймовой командой исследователей в этой области. Будет полезно тем, у кого есть базовые знания по генеративкам и желание разобраться глубже: • в теории диффузионных моделей, эффективных методах их обучения и семплирования; • в новых гибридных моделях на основе диффузии для генерации изображений, видео и 3D. У курса есть открытый GitHub-репозиторий, где можно найти слайды, записи лекций и семинаров, а также домашние задания. CV Time1,99%
- 17 июл.Вчера вечером был на ивенте ML&DS Offstage от Ozon Tech, участвовал в круглом столе «Агенты: от исследований к бизнес-внедрениям», где модератором был мой хороший друг Алексей Обровец. Очень интересные спикеры! Вроде бы стандартные и наболевшие вопросы, но так много разных содержательных мнений. Конечно, больше всего волнуются за молодое поколение, подходы к образованию в эпоху агентной экономики — всё это очень важно и нужно постоянно анализировать и развивать. А главное, «не бояться», потому что любые технологические изменения направлены на то, чтобы сделать жизнь лучше. Проблемы галлюцинаций, предсказуемости и объяснимости подведения моделей и агентов ещё находятся в глубокой фазе исследований, но как и любым инструментом агентами надо учиться пользоваться себе во благо, и мы явно идём правильным путём. Ну и фотоотчёт😎1,87%
- 19 июл.Интересная неделя намечается😉1,85%
- 7 авг.Alibaba, что ты делаешь? Прекрати! 12.08 нас ждёт большой залив весов в опенсурсе. Приятно, что для простых смертных дают дистиллированную версию на 27B параметров💪1,85%
- 4 авг.⚡️CADENA: Stepwise CAD Reverse Engineering Новое решение от Лаборатории FusionBrain, группы Пространственного интеллекта Института AIRI и команды Sber AI 🚀 Релиз в нашей линейке моделей для реверс-инжиниринга деталей! tldr: Перешли на пошаговое предсказание — модель стала гибче, качество выросло, и чем сложнее датасет, тем больше отрыв. Плюс собрали CADENA-Bench: 3396 реальных механических деталей, разбитых по категориям ЕСКД, чтобы можно было оценивать готовность к практике для отдельных типов деталей. Постановка задачи для тех, кто пока про нее не слышал: по скану физической детали восстановить её CAD-модель — дерево построений, которое инженер может править и по которому деталь можно произвести. Последовательность CAD-операций пишется питоновским кодом, так что фактически это mesh2code. Наши прошлые модели предсказывали всю последовательность разом и потому наследовали статистику трейна: если операция B в обучении всегда стоит между A и C, на инференсе она встанет туда же. На сложных и редких деталях это ломалось. В CADENA мы предсказываем по одной операции за раз — модель исполняет то, что уже написала, смотрит на разницу с целью и решает, что делать дальше. Плюс новый генератор, дающий длинные последовательности операций. Результат: заметный отрыв на всех датасетах, где мы замеряемся. На CADENA-Bench мы лучше в 5 категориях из 6 и в среднем. На BenchCAD, где свои модели меряет в том числе Claude, восстановление объёма 91% против 71% у фронтирных моделей и 75% у специализированных. На гифке — как модель собирает деталь по операциям. 🤗 Будем очень благодарны за апвоуты на HF и звёздочки на GitHub: 👉 Paper тут и тут 👉 GitHub 👉 Dataset 👉 Model 👉 Заапвоутить1,82%
- 27 июл.Kimi как обещали зарелизили в опенсурс веса своей самой крупной модели K3 - 2.8T параметров🔥 Осталось домашний комп чуть обновить и можно тестировать https://huggingface.co/moonshotai/Kimi-K31,62%
- 14 авг.🔥 GLM-5.3 от Z.ai — главное за 30 секунд: Чистый post-training. Та же базовая модель —GLM-5.2 — все улучшения получены только масштабированием RL на длинных агентных задачах (фреймворк slime + SAO) Сильнейшая open-weight модель для кода. +50% на внутреннем Z.ai Code Bench; Terminal Bench 3.0: 28.3 (было 4.6); DeepSWE v1.1: 66.9 (было 46.2). На TB 2.1 (88.2) вплотную к Fable 5 и GPT-5.6 Sol. Эмерджентные способности в кибербезопасности — главный сюрприз. Модель сама начала выстраивать полные цепочки эксплуатации уязвимостей. CyberGym 84.5% — #1 среди всех моделей; ExploitBench удвоился (24→54). В реальных проектах нашла 2 436 уязвимостей в 269 OSS-проектах, включая баги возрастом до 40 лет. Веса будут открыты через 2 недели после завершения safety-аудита и hardening Честное позиционирование на бенчмарках. Z.ai прямо показывают, где отстают от closed frontier (Fable 5, GPT-5.6 Sol) — ExploitBench 54 vs 78, Terminal Bench 3.0 28 vs 35 Все детали по ссылке1,30%
- 3 авг.Ну вот и Qwen 3.8 пожаловал💪 — Автономный кодинг: более 10 дней саморазвивающейся разработки - от пустой папки до готового к эксплуатации продукта без вмешательства человека; полная история проекта доступна на GitHub: https://github.com/qwen-code-dev-bot/oh-my-cli — Работает в пром задачах: готовые решения production уровня для сотен задач — Высокий уровень долгосрочного планирования: автономное планирование на системном уровне с адаптивным обучением по принципу замкнутого цикла, обеспечивающее выполнение 500+ итераций оптимизации дизайна чипов и разработку стратегии на год в e-com — Нативная мультимодальность: vision как непрерывный контур обратной связи для планирования, выполнения задач и самокоррекции1,15%
- 20 июл.⚡️Новости опенсорса 👉GLM-5.2 ✅ Almost Opus-level 👉Kimi-K3 ✅ Almost Fable-level 👉Qwen-3.8 🔜 2.4T, Expected to beat Opus 👉Deepseek V4 GA 🔜 $0.0028/M Expected to beat Opus 👉Minimax-M3-Pro 🔜 3T, Expected to be Fable-level 👉GLM-5.5 🔜 Expected to beat Opus1,15%
- 28 июл.🤖 Ищем менеджера проектов в ИИ-стройку Мы — SberAI, команда, которая строит будущее строительства с помощью искусственного интеллекта. Совмещаем исследования и реальное применение: автоматизируем анализ и составление строительной документации, извлекаем данные из BIM-моделей, создаём генеративные решения для архитектуры и дизайна. Ищем человека, который сведёт воедино науку, продукт и стройку. Чем предстоит заниматься → Управлять проектами от идеи до внедрения: планировать сроки, ресурсы, риски и зависимости → Синхронизировать усилия исследователей (DS, ML-инженеров) и продуктовой команды — переводить научные разработки в рабочие решения → Работать с заказчиками из строительной отрасли: понимать их процессы, формализовывать требования, контролировать качество поставки → Вести проектную документацию и обеспечивать прозрачность для всех стейкхолдеров → Анализировать рынок строительных ИИ-решений: конкуренты, тренды, регуляторика, потребности заказчиков → Формулировать бизнес-требования на основе анализа рынка и обратной связи — переводить инсайты в задачи для команды → Определять ключевые метрики: технические (точность, скорость инференса), продуктовые (вовлечённость, retention) и бизнесовые (экономия времени, снижение ошибок) → Готовить аналитику для руководства: эффективность внедрённых решений, прогнозы, сравнение с рынком Что важно для нас ✅ Опыт управления проектами в технических командах 3+ лет — желательно в продуктах с ИИ-компонентом или сложной доменной логикой ✅ Понимание жизненного цикла ML-проектов: от сбора данных до production-инференса ✅ Знакомство со строительной отраслью или готовность быстро погружаться: BIM, проектная документация, СП, стадии строительного цикла ✅ Гибкость: умение работать и в условиях исследовательской неопределённости, и в режиме продуктовой поставки ✅ Коммуникация: умение объяснять сложные технические вещи нетехническим стейкхолдерам и наоборот Откликнуться — пишите в личку Евгении Газарян @jjg261,05%