Krist/Blog
СтатистикаВеду свой уютный канал про старые и новые железки и не железки, нейросети и не нейросети и вообще всё, что мне интересно. Вступайте в чатик @kristchat Писать сюда - @kristaller
- Последний пост
- 14 авг.
- Последнее чтение
- 13:58
- Постов за неделю
- 2
- Всего постов
- 23
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 222
- 1/48двое суток
- 254
- 1/72трое суток
- 274
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Deepseek-V4-Pro-0813 вышел Релиз так себе в целом, не смотря на более высокие скоры на бенчмарках, Pro не сильно превосходит Flash в реальных задачах, а кое где даже умудряется проигрывать. Цена на API как и обещали, подняли, реально очень сильно. В "пиковые часы" цена на V4 Pro выше, чем на gemini 3.7 flash, которая, вероятно, будет поинтереснее в плане производительности. Веса доступны на HF под лицензией MIT.
Qwen3.8-2.4T-A95B (Qwen3.8-Max) вышел Следующая опенсорсная модель в размере 2T+. Короткий обзор: - Хорошее качество в агентских задачах, коде, ризонинге. - Отличное (вероятно, лучшее среди всех моделей вообще) качество vision/agentic-vision задач. - Умеет в reasoning effort. - По бенчмаркам на уровне Opus/Fable. - Собственная лицензия, которая ограничивает инференс провайдеров и продукты для кодинга и "офисной продуктивности". Веса, блогпост
Muse Glimmer 30B Meta возвращается в опенсорс и выпускают свою новую модель спустя почти полтора года после Llama 4. Короткий обзор: - 30B dense. - 130 тысяч базового контекста. - Многоязычная, 100 языков. - Заточена под агентские сценарии, ризонинг, мультимодальность. - Умеет в reasoning effort. - Лицензия Apache 2.0. - По бенчмаркам лучшая в классе (вероятно, до выхода Qwen3.8-27B). Ещё обещают опенсорснуть Muse Spark 1.2, но сроков нет. Веса
Deepseek-V4-Flash-0731 - Старый претрен, новый посттрен. - По бенчмаркам сильно лучше старой V4 Pro. - Новый V4 Pro уже в августе. - Лицензия MIT. Веса
Thinking Machines Labs выпустили младшую версию Inkling. 276B-A12B. https://thinkingmachines.ai/news/inkling-small/
без подписи
без подписи
Kimi K3 Самая большая и мощная open source модель на данный момент - 2.8T параметров MoE (~50B активных параметров), первая модель такого размера в опенсорсе. - Заскейлить модель до такого размера им помогли Kimi Delta Attention и Attention Residuals. - По бенчмаркам (и похоже в реальности тоже) модель превосходит Opus 4.8, всего немного не догоняя 5.6 Sol и Fable 5. - На отдельных задачах Kimi K3 даже превосходит SOTA закрытые модели. - Модель особенно хороша в визуальных задачах и в ML ресёрче. - Веса выложат скоро. Блогпост
Inkling - первая языковая модель от Thinking Machines Lab Неожиданный релиз. Основные моменты: - MoE, 1T A41B. - Полная мультимодальность: текст, картинки, аудио и видео. - По бенчмаркам модель не догоняет текущий SOTA open source, зато реально сильна в мультимодальности. - Лицензия apache 2.0. Thinking Machines известны своими подробными блогпостами, так что не буду отбирать их хлеб - очень рекомендую прочитать полностью. Блогпост, веса
GigaChat 3.5 Ultra 432B Выпустили в опенсорс новое поколение нашей модели. Уникального в этом релизе — своя собственная архитектура (MLA + GatedDeltaNet + Gated Normalization — GN это наша придумка), новый претрейн на другом миксе данных, фулл fp8 обучение, не только дпо степ, наконец-то завезли онлайн рл и сильно улучшили арены. Модель похудела на 40% (теперь влезает в одну ноду без tp16) и сильно ускорилась из-за MTP2 и гибридной архитектуры — мы смогли выбить 260 тпс на 8xH100. В этот раз мы решили не ограничиваться только финальным чекпом, выложив еще и кучу служебных — четыре чекпа с разных степов претрейна, два с мидтрейна, один с расширения контекста, один после дпо и два финальных, после онлайн рл — в fp8 и bf16. Теперь вы можете взять нашу модель и доучить её самостоятельно — передаём эстафету коллегам из Яндекса, ждём новую Алису на зелёной базе :) По метрикам — претрейн идёт ноздря в ноздрю с DeepSeek V4 Flash Base, а финальный наш чекп сравним с DeepSeek V3.2. По сравнению с гигой 3.1 у нас сильно улучшились арены, код, агентность, тулколлинг и математика — в общем, меньше, быстрее, сильнее. Из смешных историй, связанных с разработкой, не вошедших в хабр — в какой-то момент на онлайн рл этапе модель смекнула, что можно хакнуть судью, если писать более эротичные ответы. Слава богу отучили, а то получилось бы неловко. В этом релизе я ушёл из SFT команды гигачата, став главой команды метрик. На мне были задачи по выстраиванию нашей инфраструктуры замеров и придумыванию новых бенчмарков — так что если вам не нравится выбор бенчей, который мы замерили, как обычно, приходите к нам его чинить :) HF: https://huggingface.co/collections/ai-sage/gigachat-35 Habr: https://habr.com/ru/companies/sberbank/articles/1055826/
Tencent HY3 Вышла релизная версия открытой модели от Tencent. По бенчмаркам модель вполне неплоха для своего размера, хотя в целом конечно звезд с неба не хватает. Из хорошего - сменили ограничительную лицензию на apache 2.0 Веса
LongCat-2.0 Новая модель от Meituan. Не SOTA, но есть кое-что интересное: - Собственный эффективный атеншен LongCat Sparse Attention (LSA), основанный на DSA. - Обучали на китайских AI чипах. - Динамические эксперты, как и в прошлой модели LongCat. - 1M контекст, 1.6T параметров, 35T токенов претрен. - Лицензия MIT, но веса еще не залили. - По бенчмаркам +- Gemini 3.1 Pro. Блогпост, веса (скоро)
GLM-5.2 Спустя несколько дней после релиза в подписке, z.ai выпускают свою новую модель в опенсорс: - Контекст теперь миллион токенов. - Ещё лучше в коде. - Лучше в долгосрочных задачах. - Дешёвый контекст благодаря IndexShare. - Лицензия MIT. Блогпост, веса
Пу пу пу. Веса в репозитории оказались мерджем из Nex-N2-Pro (тюн Qwen) и Qwen3.5-397B. Авторы извинились, написали что это ошибка и они перезальют нормальные веса. Правда есть сомнения, что это ошибка и они что-то зальют в ближайшем будущем
Rio 3.5 Open 397B Правительство Рио-де-Жанейро (да) выпустило свой тюн Qwen, который на первый взгляд выходит очень неплохо. Основное: - Модель находится на уровне deepseek v4, Qwen 3.7 Max и Kimi K2.6 (по бенчмаркам конечно). - SwiReasoning: модель умеет переключаться между явным ризонингом (если она не уверена в ответе) и ризонингом внутри латентного пространства (если уверена). Сам метод правда даёт не очень сильный прирост (+2-3%), но даёт. - Лицензия MIT. Веса
Kimi K2.7-Code Обновление модели от китайского стартапа Moonshot AI. Лучше в кодинге, лучше token efficiency, собственная лицензия modified mit. Веса
Gemma-4-12B - мультимодельная модель без энкодера для изображений и аудио. - Новая модель в серии Gemma-4 - Поддерживает текст, изображения, видео (до 30 секунд) и аудио (до 60 секунд). - Качество на уровне Gemma-4-26B. - Модель с ризонингом. - MTP из коробки. - Лицензия Apache 2.0. Блог, веса
Хорошо, не самые неожиданные
Mistral 3.5 - 128B dense модель. - 256K контекст. - По бенчмаркам на уровне sonnet 4.6. - Лицензия llama-like, запрещает коммерческое использование если ты или твой работодатель зарабатывает 20M$/мес. Блогпост, модель
без подписи