Цифранутый AI 🇰🇿
СтатистикаНовости AI & Digital. В Казахстане и во всем мире. Подписывайтесь => @tsifranuty_me Автор: Геннадий Захаров (@globa_me) Соцсети и сайт с портфолио моих проектов: https://tsifranuty.taplink.ws/
- Последний пост
- 09:44
- Последнее чтение
- 17:03
- Постов за неделю
- 8
- Всего постов
- 32
- Тип
- открытый
- Язык
- русский
- Категория
- Новости и СМИ
- В каталоге с
- 14 авг.
- 1/24сутки в ленте
- 210
- 1/48двое суток
- 240
- 1/72трое суток
- 259
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Крипто карты от Nvidia начали использовать для инференса Ещё в 2021 году Nvidia наклепала для майнинга гору очень сильно урезанных карт CMP HX170, на основе чипа от А100. Номинально у них было по 8 или по 10 гигабайт и урезанные в 32 раза вычислительные мощности, но при этом полная пропускная способность памяти, которая и нужна для майнинга. После того как Ethereum перешёл на proof of stake алгоритм, все они превратились тыкву. Так бы они и оставились тыквами, но в конце июня появился пейпер, в котором описывалось снятие части ограничений через уязвимость в новых драйверах Nvidia. Кода авторы не опубликовали, но через несколько недель уязвимость удалось независимо реплицировать, так появился cmpunlocker. Карты на 10 гигабайт стали картами на 40(или даже 80) гигов, а карты на 8 гигов — картами на 64 гига. Дело в том, что убрать HBM чипы без урезания пропускной способности было нельзя, так что Nvidia просто заблокировали 80% памяти через софт. Хакерам удалось ещё и убрать ограничение на вычисления. Главная оставшаяся проблема — PCIe ограничен версией 2.0 и физически только x4, но ребята с паяльниками уже пытаются это починить. В итоге, счастливчики, которые смогли купить карту до роста цен, за 100-200 долларов, получили уже чуть менее урезанную А100 за очень дёшево, особенно с учётом текущего кризиса. А сейчас цена выросла и за цену в 5-10 раз выше брать их уже вряд-ли стоит. А есть ли владельцы таких карт среди подписчиков канала? Как впечатления? cmpunlocker @ai_newz
Кого и что я читаю, изучаю и анализирую по теме AI: Hacker News — техно-новости и дискуссии (https://news.ycombinator.com/) Y Combinator — стартапы и разборы исследований всяких (https://www.youtube.com/@ycombinator) Fireship — ржачные IT-новости (https://www.youtube.com/@Fireship) Matthew Berman — обзоры AI-моделей и всего вокруг (https://www.youtube.com/@matthew_berman) Two Minute Papers — научпоп про исследования (https://www.youtube.com/@TwoMinutePapers) Matt Pocock — AI для разработчиков (https://www.youtube.com/@mattpocockuk) Matt Pocock Skills — готовые Agent Skills (https://github.com/mattpocock/skills) Zvi Mowshowitz — глубокая AI-аналитика (https://thezvi.substack.com/) ServerFlow AI Lab — тесты локальных моделей (https://www.youtube.com/@serverflowailab) AI Newz — новости и аналитика (https://t.me/ai_newz) Artificial Analysis — бенчмарки AI-моделей (https://artificialanalysis.ai/) Simon Willison — технический блог про LLM (https://simonwillison.net/) Epoch AI — исследования развития AI (https://epoch.ai/) METR — измерение возможностей агентов (https://metr.org/time-horizons/) Interconnects — модели и post-training (https://www.interconnects.ai/) Stanford AI Index — ежегодный отчет об AI (https://hai.stanford.edu/ai-index)
Нейродайджест за неделю (#127) LLM - Qwen 3.8 27B — Alibaba прокачали 27B модельку, она теперь самая сильная в своём классе с заметным отрывом. - Muse Glimmer — Meta вновь начала выпускать открытые модели, начали с 30B модели для локального запуска, но пообещали выпустить веса Muse Spark 1.2. - Grok 4.6 — SpaceXAI выкатили апдейт на базе 1.5T претрейна с улучшенным посттрейном. Удвоили лимиты в Grok Build и Cursor на эту модель на неделю. - Веса Qwen 3.8 Max — Alibaba выложила в открытый доступ модель на 2.4T параметров (95B активных), полная версия модели прекрасно показывает себя на VLM задачах, но как раз эту часть из открытого релиза вырезали. - DeepSeek Harness и V4 Pro — Вышел крайне модульный харнес и MIT-веса V4 Pro из превью, кроме этого повысили цены. - Gemini 3.7 Flash — Flash прыгнули выше Sonnet 5 по бенчмаркам. - GLM 5.3 — Прокачали масштабированием RL на реальных задачах, что дало больший чем ожидалось буст в кибербезопасности. Веса пообещали через две недели после релиза. Корпоративные новости - Поглощение Cursor — SpaceX завершили сделку по покупке за $60 млрд своими акциями. > Читать дайджест #126 #дайджест @ai_newz
➡️Manus бесплатно до 25 августа. Налетай, торопись. Забирай живопИсь Я, честно, не фанат этого агента, но многие даже не имели возможности его попользовать, т.к. он жрал деньги, как не в себя. Он многое умеет и по своему хорош. Но лично у меня не прижился. Кто не тестил по разным причинам — сейчас самое время. По идее, по этой ссылке вы должны получить +500 кредитов (которые потом, после атракциона щедрости, можно будет тоже потратить) p.s. внимательно прочитайте про удаление данных в 20х числах августа.
без подписи
DeepSeek выпустили собственный харнес и V4 Pro из превью Основная фишка DeepSeek Harness — экстремальная модульность. Практически всё является модулем с возможностью хот релоада, динамически можно поменять и коннекторы моделей и сам агентный луп. О том как это работает выпустили детальнейший пейпер. Вместе с этим выпустили V4 Pro из превью, традиционно выпустив веса под лицензией MIT. Ну и ещё компания, как и обещала, поднимает цены с 16 августа. Инпут токены будут теперь дороже в 1.5x, аутпут более чем в 2x. Кроме этого в пиковые часы цена будет ещё удваиваться. Веса V4 Pro 0813 DeepSeek Harness @ai_newz
Веса Qwen 3.8 Max вышли в открытый доступ Это модель на 2.4 триллиона параметров, с 95B активных. Официальные веса распространяются в bf16 и весят 5 терабайт, но уже есть нормальные NVFP4 и MXFP4 версии. Для запуска нужна одна нода с B300/MI355x или несколько нод с картами попроще. На визуальных VLM задачах по личному опыту, она тащит вроде бы даже лучше чем закрытые фронтир модели. Китайцы - вперед! SGLang Cookbook vLLM recipe Веса @ai_newz
Интересное про ChatGPT как продукт. Если кто не знал, вся AI индустрия держится на двух китах - OpenAI и Anthropic, на которые по разным оценкам (Wells Fargo, Barclays и др.) приходится 85-90% всего мирового спроса на AI компьют! И 70%+ AI выручки гиперскейлеров - тоже от них. А не от собственных AI продуктов, у которых есть фантастические возможности дистрибьюции (как у Майкрософта например). ChatGPT - главный consumer продукт всей индустрии, поэтому по его трендам можно делать какие-то выводы обо всем мировом genAI. 1️⃣ Многие заметили, что с недавних пор Револют на своих тарифах бесплатно предлагает подписку ChatGPT Go вместо Perplexity. Нередко компании делают так, чтобы в отчетности увеличить число юзеров платных тарифов. Например Perplexity их считал как платных, но на бумаге была строка Discounts and Refunds с большим убытком, почти в половину выручки! (в этом посте есть картинка с примером отчетности). 2️⃣ Но самое интересное, что в начале года OpenAI планировало падение числа $20/m подписчиков Plus с 44 млн до 9 млн! (the information) При этом число более дешевого тарифа Go должно было вырасти с 3 млн до 112 млн. И это должен быть самый быстрый в истории рост базы платных подписчиков. Сначала OpenAI стал раздавать Go бесплатно в Индии, потом были еще акции (Shopee и др.), а сейчас дело дошло до 75 млн клиентов Революта - теперь каждый из них может по сути бесплатно пользоваться Go. 3️⃣ Аналитики пишут, что такие сложности, да и сам новый тариф Go потребовались, потому что ретеншн на Plus за $20/мес уж очень плох, и даже общее число стало падать. Поэтому придумали такой витиеватый план показать бурный рост юзеров платных тарифов. Кстати по майским инсайдам The Information конверсия из бесплатного в платный, когда были только Plus/Pro - 2,58%, а с появлением Go уже почти 6% - я об этом писал, что у революционного технологического продукта не может быть конверсия в платного на уровне плохих бенчмарков b2c. А саму конверсию я посчитал точно - 2-3%, почти полтора года назад. 4️⃣ OpenAI не смог достичь собственных прогнозов на 2025 год в 1 млрд WAU у ChatGPT, даже к лету 2026 число пользователей растет крайне медленно. Я тоже писал, что ChatGPT больше некуда расти - просто нет столько людей в мире. А значит и сложно впечатлять инвесторов ростом выручки. 5️⃣ Есть прикольное жопокрутство от OpenAI: про b2b юзеров компания пишет paying business users, а про b2c - просто consumer subscribers. То есть там очевидно есть те, кто пользуется Go или другими тарифами, но не платит. При этом техкранчи, рейтерсы и другие сми пишут сразу про всех paid users. Ну да, это же мелочи (нет). 6️⃣ Короче говоря, самый популярный из AI продуктов и единственный AI продукт среди популярных, ChatGPT - сталкивается со своими сложностями. Считаю, что все, кто как-то планирует бенефициировать на AI, должны следить за динамикой ChatGPT и его метриками. Потому что у остальных горизонтальных AI продуктов они почти всегда хуже 🥲 @kyrillic
Как запустить Colibri на Windows (или MacOS) Если хочется попробовать GLM 5.2 на 744 млрд параметров, самый простой вариант — использовать готовую сборку Colibri. Компилировать код, ставить CUDA или разбираться с WSL не нужно. Сразу о требованиях: Windows 10/11, минимум около 16 ГБ RAM, лучше 24 ГБ+, и примерно 380 ГБ свободного места. Желательно на быстром NVMe SSD — скорость диска сильно влияет на скорость генерации. Видеокарта не обязательна: Colibri умеет работать только на CPU. 1. Устанавливаем Python Скачайте и установите обычный Python 3. Он нужен для командного интерфейса coli. При установке лучше сразу отметить пункт добавления Python в PATH. 2. Скачиваем Colibri Открываем страницу Releases официального репозитория Colibri и скачиваем архив вида: colibri-...-windows-x86_64.zip Распаковываем его в любую удобную папку. Внутри уже будет colibri.exe — ничего собирать или переименовывать не надо. 3. Скачиваем саму GLM 5.2 Это самая тяжёлая часть. Нужна готовая версия: GLM-5.2-colibri-int4-g64-with-int8-mtp Она лежит на Hugging Face и занимает около 372 ГБ. Л учше положить её на быстрый внутренний NVMe, например: D:\glm52_i4 Важно брать именно актуальную gs64 + int8 MTP версию: авторы Colibri не рекомендуют старые per-row INT4-сборки из-за заметной потери качества. 4. Запускаем Открываем папку с Colibri, нажимаем на адресную строку Проводника, вводим powershell и нажимаем Enter. Затем запускаем: python coli chat --model D:\glm52_i4 Если модель лежит в другом месте — просто меняем путь. После загрузки появится обычный текстовый чат. Можно писать запросы прямо туда. Что важно понимать Первый запуск может быть долгим: Colibri должен загрузить примерно 10 ГБ постоянно используемых весов. А дальше скорость очень зависит от SSD и количества RAM. На слабом или внешнем накопителе вполне можно увидеть скорость меньше одного токена в секунду — это нормально. 744B-модель действительно запускается дома Главная фишка Colibri именно в том, что теперь такую модель в принципе можно локально запустить, даже если целиком в оперативную память она не помещается.
Meta выпустила Muse Glimmer и пообещала открыть веса Muse Spark 1.2 Muse Glimmer это 30B мультимодальная модель, которая обходит по бенчам и Qwen 3.6 27B и Gemma 4 31B. Это первый заметный открытый LLM релиз от Meta с апреля 2025 года, ну а в такой весовой категории, модели компании не выпускались аж с Code Llama 34B в августе 2023. Архитектурно это dense модель с относительно большим perception encoder. Главный очевидный минус — длина контекста всего 131к, что меньше чем у конкурентов. Вместе с моделью выпустили официальные квантизации, так что модель влезает в 24 гигабайта VRAM. Вышла и официальная драфт модель, благодаря этому Muse Glimmer запускается на одной 5090 на скорости в 230 токенов в секунду. Веса модели Официальные квантизации @ai_newz
Как запустить Gemma 4 26B на Mac примерно с 2 ГБ RAM TurboFieldfare позволяет запустить локально Gemma 4 26B-A4B, не загружая все ~14,3 ГБ весов модели в оперативную память. Поддерживаются даже Mac с 8 ГБ RAM. Репозиторий проекта: TurboFieldfare на GitHub Сначала установите Xcode из App Store, если его еще нет. Затем откройте Terminal, перейдите в любую удобную папку — например: cd ~/Documents После этого вставьте команды по очереди: git clone https://github.com/drumih/turbo-fieldfare.git cd turbo-fieldfare swift build -c release .build/release/TurboFieldfareMac После последней команды откроется TurboFieldfare. Дальше уже в самом приложении скачиваете Gemma 4 26B, загружаете модель и начинаете пользоваться. Чтобы каждый раз не запускать ее через Terminal, после запуска нажмите правой кнопкой на иконку TurboFieldfare в Dock → «Параметры» → «Оставить в Dock». Репозиторий проекта: https://github.com/drumih/turbo-fieldfare На моем Mac с M3 Pro и 18 ГБ RAM модель разгоняется примерно до 20 токенов/с — вполне комфортная скорость для локального чата.
Открыт прием заявок на Female Founders Pitch Competition! 🚀 BE WOMAN совместно с @silkroad_innovation_hub и @womenintech.kz объявляет о старте приема заявок на Female Founders Pitch Competition. 📅 Прием заявок: до 11 августа 2026 года. Это возможность для женщин-основательниц представить свой стартап на международной площадке, получить экспертную обратную связь, найти новых партнеров и открыть для своего проекта новые возможности роста. 📍 Финал конкурса состоится 15 октября 2026 года на международном форуме BE WOMAN 2026 в Алматы. Финалистки представят свои проекты реальным инвесторам, международным экспертам и лидерам технологической экосистемы. Если вы основательница стартапа и готовы вывести свой проект на новый уровень — подавайте заявку. 🔗 Подать заявку: https://bewoman.asia/femalefounders Возможно, следующая большая история успеха начнется именно с вашей заявки.
Meta выпустила собственного агента — Muse Code Вместе с этим релизнулась Muse Spark 1.2. Заявляют что новая модель с официальным харнесом лучше Grok 4.5, но не дотягивает до Opus 5. Самое интересное тут — новая ценовая политика. Теперь, если вы позволите Meta тренировать модели на ваших данных, то модель отдают совсем за бесценок — $0,1/$0,2 за миллион токенов, против обычной цены в $1,25/$4,25. Это делает её дешевле DeepSeek V4 Flash, у которой в официальном API и так схожие условия, даже до уже анонсированного повышения цен. Но лучше не ведитесь на такую халяву, если вы разрабатываете что-то стоящее, и особенно если строите стартап. Для пет-проектов и опен-сорса ок, но не более. @ai_newz
Lift4D — 4D-реконструкция динамических объектов по одному видео Фреймворк восстанавливает полную 360° геометрию, текстуры и нежёсткие деформации движущихся объектов по обычному видео с камеры, достраивая даже невидимые ракурсы. Зачем лично мне такая турбофича пока непонятно, но выглядит очень интересно, на Project Page можно самому покрутить руками. Project Page arXiv Код @ai_newz
OpenAI представила две специализированные модели для транскрибации — gpt-transcribe и gpt-live-transcribe. Соответственно, одна переводит аудио в текст ПОСЛЕ записи, а другая (которая Live) способна показывать живую транскрипцию прям во время разговора. И я просто обожаю вот такие видео, которые прям наглядно показывают технологию. Особенно где он на укулеле начал играть, прелесть! Очень жду, когда обновят открытый Whisper, там кажется с 2024 года крупных апдейтов не было. Почитать подробней можно тут.
OpenAI сбросили цены на GPT 5.6 Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат. @ai_newz
Мини-новость. Kimi 3 оказалась невероятно мощной и хорошей штукуёвиной Интерес и волна ажиотажа добралась так сильно, что разработчики написали в твиттере Kimi K3 получил гораздо больше любви, чем мы ожидали, и наши графические процессоры это чувствуют. За последние 48 часов спрос приблизился к пределам нашей текущей мощности. Чтобы защитить опыт существующих подписчиков, мы временно приостанавливаем новые подписки и приоритизируем вычисления для текущих участников. Существующие подписанные пользователи не затронуты
Anthropic оставляют Fable 5 в подписке С 20 июля модель будет включена в планах Max ($100/$200) и Team Premium ($125), на них Fable по прежнему можно будет использовать до половины лимитов. Планам Pro и Team разово выдадут по $100 кредитов. @ai_newz
Конкуренция, ты прекрасна
➡️🇨🇳Самая большая опенсоурс модель. Kimi 3 Быстрее, выше, сильнее и бла бла бла. В общем — идём играться сюда👇 ссылка цены на API: $3/$15 (не прям халява, но дешевле чем fable, а судя по слухам близко к ней и 5.6 sol. если не лучше даже) p.s. в Kimi Code CLI тоже добавили. вот тут кое-какие сравнения