KorolevLAbs | ИИ-лаборатория
СтатистикаДекодируем тренды. Проводим лабы. Запускаем проекты. Посты тут https://t.me/korolevlabs Общение https://t.me/korolevlabschat
- Последний пост
- 12:04
- Последнее чтение
- 13:35
- Постов за неделю
- 5
- Всего постов
- 24
- Тип
- открытый
- Язык
- русский
- Категория
- Криптовалюты (по похожим)
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 60
- 1/48двое суток
- 68
- 1/72трое суток
- 74
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Qwen 3.8 MAX + GLM 5.2 + DeekSeek 4 Flash в облаке по подписке! Итак я попробовал подписку от Alibaba ...снова. Когда они только запустили сервис несколько месяцев назад, я был в бетатестерах. Условия были шикарные - 90 000 _ЗАПРОСОВ_ в месяц. 49$ в месяц. Скорость - на высоте! Около 80tk/s на GLM 5 в то время. Как сейчас? Тех подписок уже нет в наличии. Появились новые. Скорость ниже, кредитов меньше, стоимость выше. 20$ - 40 000 кредитов (и это не запросы, это какая то внутренняя валюта как у всех теперь). Но в сравнении с тем что дают конкуренты - это все ещё можно сказать что оно "в рынке", но не так здорово, когда все мы радовались что НАКОНЕЦ-ТО КИТАЙ СОСТАВИТ РЫНОЧНУЮ КОНКУРЕНЦИЮ США в нейронках! И фонда валилась к чертям только на новостях о ИИ из Китая. Эпоха, похоже, завершается? Давайте считать! DeekSeek 4 кстати 16 Августа поднимает цены в 12X . Дада, в 12 блин раз. Тенденция. Они купили себе клиентов, сформировали юзербейс, и теперь оказываются вполне себе неплохой нейронкой. Все еще ниже рынка. Но в 12 раз выше чем было, Карл ! Итак обратно к Алибаба провайдеру. На картинке вы видите как я сожрал недельный лимит всего за 2 дня: Cache Hit Rate 96% Cache/Total Input Tokens: 52.23M / 54.66M Катастрофа? Давайте считать. За 10 000 кредитов с 96% кэшем получилось 52 мульта TOTAL. Теперь убирает cache: 1 миллион/2.4 миллиона output/input чистыми. Сравним с API других провайдеров (правильнее было бы подписки, но как есть), сравним именно чистые, зная примерно кэширование других провайдеров под 90%: 📊 Реальная стоимость вашей сессии с активным Prompt Caching (База: 48.6M Cached In + 1.0M Uncached In + 2.4M Out) 1️⃣ Тарифы с учетом кэша (за 1 млн) • Qwen 3.8 Max / DeepSeek V4 Pro: Cached In: $0.05 | New In: $0.435 | Out: $0.87 • DeepSeek V4 Flash: Cached In: $0.015 | New In: $0.14 | Out: $0.28 • GPT-5.6 Sol: Cached In: $1.25 (-75%) | New In: $5.00 | Out: $30.00 • Claude Fable 5: Cached In: $1.00 (-90%) | New In: $10.00 | Out: $50.00 2️⃣ Фактическая стоимость сессии (52 млн токенов суммарно) • Ваша подписка Alibaba: $20.00 (закрыла недельный лимит за 2 дня) • Qwen / DeepSeek Pro API: $4.95 ↳ [Кэш: $2.43 + Ввод: $0.44 + Вывод: $2.09] • DeepSeek Flash API: $1.54 ↳ [Кэш: $0.73 + Ввод: $0.14 + Вывод: $0.67] • GPT-5.6 Sol API: $137.75 ↳ [Кэш: $60.75 + Ввод: $5.00 + Вывод: $72.00] • Claude Fable 5 API: $178.60 ↳ [Кэш: $48.60 + Ввод: $10.00 + Вывод: $120.00] Итог: В API с кэшированием вы потратили бы всего ~$5 на стеке Qwen/DeepSeek без каких-либо лимитов и блокировок на неделю. В западных флагманах даже со скидкой кэша чек составил бы $138–$179 за 2 дня. ❗️Делаем вывод - подписка у китайского провайдера приближается к стоимости API. Но все еще значительно дешевле чем у провайдеров США.
Qwen 3.8 - у себя дома на локалке! Ну вот и дожили. Нейронка уровня Claude Opus 4.6 (судя по тестам) у тебя дома на локалке. Да еще и со всеми плюшками от Unsloth, чтобы запустить на видеокартах 5000 серии nVidia с ускорениями. Сразу скачал, попатчил все конфиги своего харнеса Гермесом - работает. Переехал я с Qwen 3.6 27B локальной модели, говорить пока ничего не могу. По бенмаркам это BIG STEP UP. По факту - наблюдаю. Работает. На RTX 5090 скорость около 100tk/s Качать тут https://unsloth.ai/docs/models/qwen3.8
GLM-5.3: кибербезопасность, но не для Пентагона! Сегодня Z.ai выпустили GLM-5.3 — новую версию своей флагманской open-weight модели, заточенную под кодинг, агентов и теперь уже довольно серьёзно под cybersecurity. Это тот же base model, что и у GLM-5.2. Никакой новой огромной тренировки с нуля. Все улучшения 5.3 получили на этапе post-training. Можно сказать дотюнили просто? И результат у них получился довольно показательный. +50% к GLM-5.2 на внутреннем Z.ai Code Bench. Open-weight SOTA на Terminal Bench 3.0 и Agents' Last Exam. GLM-5.2 и без того была очень сильной: миллион токенов контекста, 81.0 на Terminal-Bench 2.1 и уже тогда почти вплотную подбиралась к закрытым frontier-моделям в длинных coding-задачах. Но в 5.3 Z.ai сделали ставку на качество поведения модели внутри длинной агентной работы: сложный код, многошаговые задачи, самостоятельное выполнение. Агенты, агенты и еще раз агенты, тобишь = прочитал → решил → вызвал tool → получил результат → продолжил. Сильно вырос cyber. Z.ai пишет, что при масштабировании post-training cybersecurity capability начала расти быстрее, чем они ожидали. GLM-5.3 стала SOTA (State Of the Art, "топчик" говоря на жаргоне) на CyberGym для поиска уязвимостей, а на задачах, расположенных дальше по цепочке эксплуатации, результат более чем вдвое выше GLM-5.2. Сами веса Z.ai обещают выложить через две недели - после дополнительных safety evaluation и hardening. Сейчас GLM-5.3 уже появляется в GLM Coding Plan/ZCode и у первых партнёров. GLM-5.2 прожила флагманом меньше двух месяцев, а её уже заметно перепрошили одним post-training. Похоже, следующий большой прирост coding-моделей всё чаще находится не внутри ещё более дорогого base model претрена, а файнтюна после под конкретные задачи. Дальше, уверен, будет разделение по доменам - для медицины, для юристов, для военные (конечно нам не покажут, но по миру уже все в новостях видят). С каждой новой моделью проценты вверх даются с большими и большими усилиями. Поэтому постепенно файнтюн станет еще одной областью, где можно будет делать громкие заявления. Перед покупкой больших тарифом, попробуйте малые - у Zhipu хорошие модели. Но небольшие мощности датацентров 25-35tk/s реальные сейчас скорость на стороне пользователя уже.
Агент: батарейки в комплект не входят Недавно я наконец понял, откуда у людей вечное «Claude всё сожрал», «Codex закончился», «я вроде только начал работать». Мой коллега первый раз сел за нативный Codex плагин в VSCode. Работал сознательно: смотрел изменения, подтверждал действия, реально правил код. Никакого ночного YOLO. Примерно 3-4 часа в день правка кода с вопросами + выполнение тестов. За 6 дней месячный лимит улетел к чертям. Я изрядно прифигел. Может вы помните, сам я исторически пошёл по open-source маршруту. OpenCode, разные провайдеры, разные модели под разные задачи. Поиск, чтение файлов и простые tool calls можно отдавать дешёвым или локальным моделям. Дорогую модель оставлять там, где реально нужна тяжёлая работа головой. То есть у меня сразу было несколько разных профилей агентов, я быстро скопировал этот принцип у openSource ребят. Поэтому context window, caching, compaction, routing моделей и стоимость каждого шага для меня всегда были частью системы. Куда улетает лимит? У coding agent есть несколько скучных деталей, которые решают финальную стоимость: что попадает в context, сколько раз перечитывается repo, как работает caching, когда запускается compaction, как агент ищет и редактирует код, сколько делает model calls и какую модель вызывает на каждом шаге. Толстый контекст, повторное чтение файлов и дорогая модель на рутинных операциях очень быстро превращаются в расход токенов. Жрёт как не в себя. Я же человек простой и ленивый. Хочу сформулировать intent внутри контекста, и получить качественный, безопасный, масштабируемый код. Как можно дешевле. Всего то навсего, иначе нафиг мне этот ИИ. ☕️ Я сейчас пользуюсь OpenCode и конкретно его сборку с батарейками Oh My OpenAgent поверх. Под «батарейками» я понимаю routing, subagents, LSP/AST tooling, fallback между провайдерами, готовые workflows и нормальное управление контекстом. Но у OMO стал жирнеть payload, и он становится по чуть чуть похож на прожорливый комбайнер. Да, он делает работу. Но издержки на оформление этого всего очень высокие. На этом фоне мне стал интересен Dirac. У него конкретная ставка на экономику harness: точнее работать с edits и контекстом, реже таскать лишние данные через модель и сокращать количество дорогих round-trips. Но она мало известен и мало популярен, пока я не вижу к нему батареек. Свои писать мне лень, после множества экспериментов с OSbees, которые я пока остановил. Я выгорел тупо. На картинке к посту их собственный benchmark: Dirac проходит 8/8 задач со средней стоимостью $0.18. OpenCode тоже 8/8, но $0.44. Benchmark собственный, поэтому цифры воспринимаю соответственно. Но сам вопрос правильный: сколько полезной работы агент делает на потраченный токен? Зачем тогда ещё один coding agent? Вот это я пока для себя до конца не закрыл. Сам agent loop давно понятен. Интерес появляется, когда у нового агента есть конкретная инженерная гипотеза: другая экономика контекста, лучший edit loop, model routing, permissions, local-first, orchestration или новая механика работы с repo. Для себя я сейчас раскладываю так: • Dirac: эффективность edits и контекста. • OpenCode: открытая provider-agnostic база. • Oh My OpenAgent: orchestration и батарейки поверх. • Claude Code / Codex: готовый вертикальный опыт, но уже не понятно зачем мне туда. Метрика, которую я теперь хочу видеть: полезная работа на 1 млн токенов и на $1. Но простая арифметика тут не работает имхо. Агент может и бюрократии развести без проблем, и будет считать что это очень полезный код. Вот эту степень полезности, может ли кто-то кроме человека ее определять? А что оказалось решающим в выборе для вас: простота установки, UX, качество кода, стоимость?
Claude забанил мне аккаунт. Письмо счастья общего содержания. Сохранить ресерчи и войти в аккаунт не дает. Причин не называют. Claim заполнил, ответа нет. Не забывайте делать бэкапы. Я не сделал. Потеря нескольких месяцев работы это больно. 🤕 Хотя бы код…
🎉 oh-my-openagent / LazyCodex v4.19.4 — OSS должен победить: Kimi K3 забирает корону Kimi K3 теперь полноценный first-class citizen — Sisyphus, Sisyphus-Junior и Atlas получили отдельные варианты промптов для Kimi K3, откалиброванные под стиль рассуждений K3. В model-core также добавлены определение семейства модели и встроенная маршрутизация на запасные варианты. Фронтирная open-weight модель Moonshot с 2,8 трлн параметров только что обошла Claude Fable 5 в рейтинге Frontend Code на Arena.ai, и OMO теперь нативно использует это преимущество. Goals заменяют Ralph Loop — старая связка ralph_loop полностью удалена. Её заменяет новая чистая система Goal: состояние, персистентность, парсер, миграция конфигурации и команда /goal. Существующие конфиги мигрируются автоматически. Усиление движка Senpi — claims на residency теперь освобождаются при потере задач, очистка по TTL запускается при старте сессии, хранилище записей кеширует дескрипторы, а lead poller выполняет инкрементальное сканирование. Долгоживущие мультиагентные процессы стали заметно стабильнее. Также добавлены: нативный skill hyperplan для adversarial planning, сессионная платформа Boulder senpi, codegraph MCP для senpi, сохранение лимитов потоков Codex V2, более строгий парсинг ulw-plan, пользовательские аргументы для Playwright MCP и более безопасные git-маркеры codegraph. Личная заметка от мейнтейнера: сегодня я ни разу не использовал Claude Opus 4.8. Весь день вытянули модели с открытыми весами. Так же это последний релиз, до того как мой любимый harness - OMO отделиться от opencode и уйдет в Native CLI. Посмотрим, что у них из этого получится. Я надеюсь на большую управляемость и меньший payload. А то OMO разжирнел по контекстному окну 🍿 📦 Установка / обновление: bun i -g oh-my-opencode@4.19.4 (or npm) 📝 Full release notes: https://github.com/code-yeongyu/oh-my-openagent/releases/tag/v4.19.4
Qwen 3.8-Max - никого не удивил. Счет параметров пошел на триллионы. А результат по бенчмаркам не то чтобы...зато дешевле по API чем K3 Kimi. Обещают выпустить Qwen 3.8 27B в OpenSource, вот это ждем, надеемся и верим. Хочется свежую. хорошую модель, чтобы умещалась в домашние PC без 1500Gb VRAM. 😊
🐈 В «Стартап-Котиках» проводим Круглый стол: AI-First: что теперь может построить один человек Ещё недавно для запуска сложного цифрового продукта требовалась целая команда. Сегодня один человек, вооружённый AI-инструментами и правильно выстроенной системой, способен пройти путь от идеи до работающего продукта. Поговорим о том: — что на практике означает AI-first;— какие задачи уже можно передать AI-агентам;— как организовать разработку силами одного человека;— где заканчивается магия и начинается инженерная дисциплина;— как изменятся команды, управление и запуск стартапов. Гость Круглого стола — Павел Валентов (@PavelValentov) Основатель лаборатории Arcanada AI и аналитической платформы финансовых рынков Angry Robot Deals. Создатель AI-workflow-фреймворка разработки проектов Datarim. Паша программирует с 1993 года, работает в коммерческом IT с 1997-го, проектирует архитектуру систем и организует полный цикл разработки. Работал с нейросетями ещё до появления LLM и сегодня последовательно внедряет AI-first-подход в разработку и управление компаниями. Ведущий — Ден (@Gendolf77) Будет не лекция, а живой разговор: с конкретными примерами, неудобными вопросами и обсуждением того, что один человек действительно может построить уже сейчас. 📅 30 июля, четверг, 17-00 по Лондону 👉 Zoom: https://us06web.zoom.us/j/86805785672?pwd=No7kTbKKeNIwvfr5uG4jVwhSQV7n2f.1 Приходите — будем разбираться, стала ли команда из одного человека новой нормой.
Привет коллеги лаборанты! https://t.me/korolevlabs/325 Сегодня Павел будет рассказывать какую эко-систему он наваял за несколько месяцев! Пойдём слушать всей лабой, что там в соседней исследовательской solo лабе делается. Павел, удачи! Обсуждаем тут в чатике - https://t.me/korolevlabschat Мои рекомендасьйон ! 😎
Kimi 3 появилась в Perplexity! Perplexity это поиск + обработка данных с помощью ИИ модели на выбор. Мало ли кто еще не имеет этот инструмент у себя в арсенале? Обязательно попробуйте! Это в десятки тысяч раз лучше чем встроенный Gemini "ИИ поиск" от Google. Раз K3 появился в Perplexity, это значит - выход передовой модели "Kimi К3" в open source и это очень хорошая новость! Kimi K3 это 2.8 трлн параметров - на данный момент это самая мощная модель в открытом доступе! А значит она появится у множества провайдеров, и можно выбирать поставщика услуг. Китайцы снова жмут США, ведь и электричества у них больше чем у США и Европы вместе взятых в 2.5 раза, как утверждает Илон Маск в интервью The Economist. - это шортс на английском из этого интервью, кстати там упоминается К3 не зря. Эта модель обходит Claude Fable и Opus 5.0 по некоторым тестам. Я давно перестал пользоваться поиском, только, и то по старой привычке, когда ответ подразумевает одно предложение или даже слово. Во всех остальных случаях perplexity + Kimi 2.7 было моим фаворитом. Иногда включал Claude Sonnet 5.0 для обработки найденного. Теперь буду тестировать K3. Нужна подписка perplexity дешевая или у всех уже есть? Наберем лайков 20, напишу где купить, если еще нет.
ДЕНЬГИ Будущего будут измеряться Ваттами (Вт)! Я обещал вам Девятый пункт лаборанты, и вот каков он - Илон Маск недавно сформулировал одну мысль, которую я не могу выкинуть из головы: «Валюта будущего по существу будет измеряться ваттами». Илон Маск Крипта? Токены Tesla? Не фига, речь о более фундаментальной штуке: сколько энергии цивилизация умеет превращать в полезную работу. Бабки приравнять к физике ! В интеллект / в вычисления / в производство / в роботов / в преобразование материи. Ватт, строго говоря, измеряет мощность, то есть скорость такого преобразования. И в этом тезисе преобразование понятия "НОВЫЕ ДЕНЬГИ". Мы привыкли что слово "НОВОЕ" это старое, просто в немного другой упаковке. Мир маркетинга нас так научил воспринимать новое. Нам все время продают старое или чуть измененное в другой упаковке и говорят: вот, покупай, это новое! В действительности, это забытое старое. А старое нынче это то, что выпущено было вчера. Память ю у поколения Тик-Ток стала еще короче. Бумажные леньги могут печататься бесконечно, они сейчас по факту уже ни к чему не привязаны. Акции могут расти от ожиданий. Крипто токены могут создаваться тысячами по кнопке. Но физическую работу всё равно делает энергия, машины, люди и всё больше ИИ. Мы в периоде перехода. И он будет длиться лет 10. ИИ сегодня упирается именно в физику. К примеру неоткуда взять больше электроэнергии - говорит Маск. Неоткуда прямо сейчас откуда то взять больше чипов памяти - говорит Маск. И так по многим вопросам. Вы знали что сейчас огромный недостаток энергии для датацентров ИИ ? Можно купить GPU. Можно собрать дата-центр. Можно заказать стойки, сеть, охлаждение. Но в какой-то момент ты упираешься в подстанции, трансформаторы, генерацию, сроки подключения и доступную мощность. Маск смотрит на этот мир одновременно как визионер и как бизнесмен и как ученый, у него интересный синтез параметров в голове. Важно что они не абстрактные, он в каждой из этих способов мышления представлен физически и на себе ощущает эти ограничения. Можете посмотреть его интервью на эти темы - GOLD ! Tesla строит батареи, солнечную генерацию и энергетику в космосе! Запуск в 2027! xAI - ИИ-шке Маске нужен гигантский compute power! Сам SpaceX потенциально удешевляет доставку инфраструктуры в космос. Факты, будут видны на дальнюю. В его модели космические солнечные дата-центры когда-нибудь смогут производить ИИ-токены почти как завод производит товар: солнечный поток превращается в вычисления, вычисления превращаются в интеллект, интеллект и роботы делают работу. Энергия → Compute → AI-токены → Полезное действие → Экономическая ценность. Борьба за AI в ближайшие годы будет одновременно борьбой за чипы, электростанции, сети, охлаждение, трансформаторы, батареи и доступ к энергии. Кто контролирует дешёвые ватты, тот получает возможность производить больше интеллекта на квадратный метр и на доллар капитала. Именно там, возможно, находится настоящая валюта будущего по мнению Маска. Как вам такой взгляд, похоже на "Новые Деньги" или это опять нефте-доллар в новой упаковке?
Пекин закручивает гайки Reuters пишет, что китайские власти обсуждают ограничение зарубежного доступа к своим топовым ИИ-моделям, включая ещё не выпущенные. Первая попытка Китая вслед за США поставить frontier AI в режим стратегического актива. РФ это не грозит, к сожалению, у нас такого актива нет. На всю страну где то 10 000 штук H100 ускорителей nVidia, в США исчисления идут на миллионы для бизнеса и правительства. И есть свои фронтир модели. В РФ фронтира пока нет. Все же, вероятнее всего будем покупать у Китая за нефть, лес и газ. Что именно обсуждают За последний месяц Минкоммерции Китая встречалось с Alibaba, ByteDance и Z ai. Параллельно поднимался вопрос о том, чтобы утечку или кражу проприетарных ИИ-технологий можно было трактовать как преступление по линии нацбезопасности. Как это может выглядеть На столе многоуровневая схема: open source инструменты через уведомление, более чувствительные технологии через проверку, самые мощные модели - без публичного релиза или только для внутреннего использования. Точных сроков и финального механизма пока нет, и Reuters отдельно пишет, что новые правила могут затронуть только будущие модели. К сожалению, Qwen 3.7 в OpenSource так и не поступил, заметьте. Это будет ооочень грустно, если Qwen 3.6 и GLM-5.2 это последнее что мы видим в open source. Почему это важно Это часть более широкой картины: Китай уже ограничивает выезд топовых ИИ-специалистов из частных компаний, а Anthropic закрывает обходные пути доступа к Claude для китайских фирм. Доступ к моделям, людям и инфраструктуре всё плотнее уходит в зону контроля. Для лаборантов KorolevLAbs Главный вывод простой: в ИИ-истории ценность сидит не только в модели, но и в доступах, среде запуска и правилах использования. Кто держит дверь, тот и управляет системой. Настоящий же фронтир модели уже не уходят от условного "Пентагона" или другого органа нац безопасности. Ведь вышедший снова в народ Fable-5 от Claude на поверку оказался совсем не тот "Fable-5" которым дали попользоваться недельку до запрета Пентагоном. Делайте выводы, коллеги.
ЮморИИло: Все возвращается. Движение вперед, через возврат к прошлому.
5. Агенты у каждого человека, кто хоть как-то в теме ИИ, резко умножают социальную эффективность. Кратно. Это настоящие экзоскелеты для мозга и социальных компетенций. Они помогают писать, искать, проверять, договариваться, помнить, собирать аргументы, вести проекты, разбирать документы, держать контекст, делать черновики, вытаскивать смысл из хаоса. Их нужно учиться создавать, брать готовые, примерять под себя и юзать. Нужно учиться общаться с машинами. Это становится проще, но ранний вход всё ещё даёт преимущество. Кто залетает сейчас, может занять очень вкусные места. 6. Идёт борьба за стартовый интерфейс пользователя. За первое окно. То, что человек видит, когда включает девайс. Все эти сотни тысяч “очень удобных” интерфейсов уже всем набили оскомину. Дальше движение может пойти роторным способом: через упрощение, через возврат к одному главному входу. Хватит множить сущности. Кто займёт это место, тот будет господствовать следующие 12-15 лет. День пользователя будет начинаться с прикосновения к этому первому окну девайса. “Здравствуй, Алиса” - “Hello, Google” это было только первая попытка? Теперь это выход на агентов, которые за тебя делают все, ты только оркестрируешь. Но ты не можешь оркестрировать грамотно то , в чем не разбираешься совсем. Ты не сможешь отличить то, что ты так долго собирал от плохо сделанного или повтора существующего. Проблема постоянного изобретения колеса в ИИ-билдинге сейчас остра как никогда. Тезис "КОД ЭТО КОММОДИТИ" актуален как никогда. Оператор может делать только средний уровень, потому что представь что могут делать те кто собрал экзо скелет со своими профессиональными навыками, используя свой опыт десятилетий работы. Визуал пока побеждает. Это самый быстрый интерфейс для понимания. Сам ввод и вывод можно делать голосом, но первое представление всё равно должно быть видно глазами. 7. Context is the king. Ваш контекст. Ваша работа с ним. Ваше владение им. Вот что становится реальной ценностью. ИИ жрёт всё, что ему дают. И я уверен, всё сохраняет, потому что датасеты это ценный корм. Пользователи с большим удовольствием сливают свой контекст облачным ИИ за сущие копейки. Каждый думает: ну что там мой кусок в общем объёме инфы? А потом из этих кусков собираются модели, профили, поведенческие паттерны, рабочие привычки, коммерческие сигналы, документы, связки, решения и ошибки. Вывод простой: локальные модели будут становиться всё ценнее. Чем лучше люди понимают цену приватной информации, тем сильнее будет спрос на local-first контуры, приватную память, свои пайплайны и контролируемый compute. 8. Акции Биотехов вверх. Кто помнит, я выкладывал отчёты Jordi Visser по макроэкономике. Там были очень сильные прогнозы. Многие отработали. Особенно история вокруг Micron, SK Hynix, Oracle и всего, что связано с AI-инфраструктурой. Сейчас Jordi говорит, что следующий сильный участок может быть в биотехах. И логика понятная: модели стали лучше, compute всё ещё относительно дешёвый для тех задач, где раньше требовались годы мокрой лаборатории, а фарма начинает тащить AI глубже в drug discovery. Посмотрите на Pfizer и их движение в сторону AI-платформ для разработки лекарств. Там уже не разговоры про “когда-нибудь”. Там proprietary data, модели, партнёрства и попытка ускорить реальные R&D-процессы. Биотех долго был адом неопределённости. Но когда модели начинают лучше работать с молекулами, белками, антителами, клиническими данными и гипотезами, экономика сектора может сильно поменяться. Будет ещё 9-й пункт. Но он настолько важный, что только в следующем выпуске.
Краткие экономические мысли из KorolevLAbs. Привет, коллеги лаборанты, а также ИИ-гангстеры! 1. Неделю назад у меня наконец нормально открылся доступ к Alibaba без VPN. Мой тезис последних лет про Китай-РФ был такой: в какой-то момент Китай начнёт продавать в РФ весь технологический стек, который становится труднее доставать из западных источников. Железо, сервисы, подписки, модели, API, developer tools. Сейчас Китай закрывает дыры по продуктам, которые РФ сама не производит. Теперь постепенно начинается похожая история с технологиями. В подписках Alibaba уже лежит пачка моделей из китайского контура: Qwen, GLM, Kimi, MiniMax и другие. Для российского пользователя это может стать очень практичным окном, особенно на фоне санкций, самоцензуры западных техногигантов и постоянной угрозы отключений и перехода в суверенный интернет. 2. Мне кажется, в течение ближайших шести месяцев рубль начнёт терять позиции к мировым валютам. Пока этот пост отлеживался неделю, это уже начало происходить. Сейчас там огромный дисбаланс. Он не может висеть в воздухе бесконечно. Его чем-то оплачивают, из каких-то резервов, через какие-то механизмы удержания. Но любой такой механизм имеет ресурс. Сейчас начнется ускорение. Это не финсовет. Это моя текущая гипотеза. 3. Только с приходом агентской экономики становится понятно, зачем миру столько блокчейнов, скоростей, сетей и всей этой инфраструктуры расчётов. Кто будет забивать эти сети? Агенты. Агентские системы начнут считать, покупать, платить, резервировать, проверять, страховать, подписывать, обмениваться доступами и микроплатежами. Человек руками туда не полезет в таком объёме. Машины полезут. И вот тогда вся эта скорость, пропускная способность, settlement, public ledger и дешёвые транзакции вдруг становятся очень понятными. 4. API-бизнесы становятся новыми золотыми рудниками. Занимайте места. (подслушано и переварено после подкаста Dario Amodei, CEO Anthropic). Герман Греф, видимо, тоже слушал. Туда будут стучать агенты. Автоматом. Без эмоций. Без переговоров. Без “давайте созвонимся”. Просто запрос, ответ, копейка упала. OpenAI и Anthropic уже плотно заняли верхние полки. У Google и Microsoft тоже кое-что есть. )) Но рынок будет гораздо шире. Нужны будут API (и MCP) для всего: данных, документов, платежей, проверки фактов, гео, юридических действий, закупок, медицины, логистики, бухгалтерии, кибербеза, доступа к локальным системам. Если агенту нужен внешний навык, он постучит в API (читай MCP).
Мой пост на reddit набрал 157 upvote, почему? Я в нем просто спросил, смогут ли ребята из Unsloth ужать GLM-5.2 , ведь модель действительно удачная. Представители студии ответили что уже занимаются этим. И действительно - Уже сегодня представили свою сжатую модель GLM-5.2 Проблема вот в чем: Удивительно, но 2-битная модель сохранила точность около 82% после уменьшения её размера с 1,51 ТБ до 238 ГБ (-84% от размера). 4-битная модель сохранила около 98%. Скриншот игры Flappy Bird, который вы видите, был создан на основе самой маленькой 1-битной версии модели. Игра получилась практически идеальной! 🪨 Запустите 2-битную модель на Mac с 256 ГБ оперативной/видеопамяти. ➡️ У вас есть 256gb Mac памяти или VRAM, лаборанты? 😏 В прошлый раз в чатике мы насчитали что новый M5 Studio ULTRA 512gb будет стоить 6-8 млн руб в РФ. 256 конечно чуть дешевле, он опять же дефициты разгонят эту цену. Настала пора купить немного деньги, коллеги! Или сделать 3D принтер, чтобы напечатать себе достаточно VRAM. Ведь в каком то смысле, память действительно печатается ☕️
GLM-5.2 релиз, акции китайцев летят 🚀 Модель вышла на HuggingFace ✅ На фоне ввода KYC у антропиков и других вероятных предстоящих запретах от США, акции Zhipu, разрабов GLM модели, летят вверх. На локалке такое не запустить, нужно 1500gb vram. Жду появления у своего провайдера в списке. Так как в дискорде самого zhipu мне никто не ответил заапгрейдили ли они свои датацентры. Они выдавали 35tks топ в нагруженные часы, это мало. 😭 А теоретически, ребята из Unsloth смогут её капитально ужать как Qwen?
SpaceX покупает Cursor за $60 ярдов. Сначала Илон напечатал триллион на IPO, и вот уже совсем быстро начались затраты. Покупает не терминальную приблуду, заметьте. А именно приложение. Что подтверждает мой тезис о том что все CLI штуки это ненадолго. Интерфейсы все таки куда удобнее чем искать какой хоткей надо нажать в каждом отдельно взятом TAU . Хотя я так же свято верю что скоро мы уйдет полностью на voice управление. Именно AI позволяет этому случится, раньше этому прижиться почти не было возможности. Этой покупкой Илон так же будет пушить AI-coding. Собирает себе ИИ империю понемногу в общем... 😏 https://www.reuters.com/legal/transactional/spacex-buy-anysphere-60-billion-2026-06-16/
Gemma 4 MTP: быстрый локальный слой от Google и Unsloth Сегодня решил продолжить разговор про локальные модели. У Unsloth вышла поддержка Google Gemma 4 MTP в GGUF. MTP, Multi-Token Prediction, это ускорение генерации. Он заранее предлагает несколько следующих токенов, основная модель проверяет прогноз, inference идёт быстрее. (но требует +2Gb VRAM) По цифрам Unsloth, Gemma 4 MTP даёт примерно 1.4-2.2× ускорения. В их примере Gemma 4 12B с MTP доходит до 162 t/s против 52 t/s в обычном режиме. Для 31B заявлено 101 t/s. Речь про целую линейку Gemma 4: E2B и E4B для лёгких локальных сценариев, ноутбуков, edge и мобильных устройств. 12B как средний вариант для повседневных задач и мультимодальности. 26B A4B как MoE-вариант. 31B как более тяжёлый dense-вариант для рабочих станций и мощных локальных сетапов. Я бы разнёс Gemma 4 MTP и Qwen3.6 MTP по разным рабочим ролям. Qwen3.6 MTP сейчас выглядит более естественным выбором для инженерного агента: кодинг, repo-level reasoning, работа с терминалом, контекст проекта, Hermes, OpenCode, OmO, последовательные действия в кодовой базе. Там сильная сторона именно в agentic coding. Модель должна держать ход работы, понимать структуру проекта, читать файлы, править код, проверять результат, возвращаться к ошибкам. Gemma 4 MTP закрывает другой пласт. Это быстрый локальный помощник ближе к пользователю: текст, изображения, короткое аудио, суммаризация, классификация, офисные задачи, лёгкие мультимодальные сценарии, edge-inference, домашний сервер, ноутбук, локальная лаборатория. Для меня Gemma 4 MTP интересна как экономичный слой рядом с человеком. Не главный кодовый агент, который живёт в репозитории и таскает сложные инженерные задачи. Скорее быстрый локальный контур для повседневной обработки информации: прочитать, сжать, разобрать, классифицировать, посмотреть на картинку, помочь с документом, быстро ответить без похода в облако. Qwen3.6 MTP я бы оставлял в роли рабочей лошади для инженерных агентов. Gemma 4 MTP смотрится как хороший кандидат для локального AI-слоя вокруг пользователя и его среды. Для домашних лабораторий, локальных AI-агентов и self-owned compute это интересная моделька. Буду тестировать. Надо какие то уже свои локальные тесты изобретать... - "Эй, агент, начинай создавать локальные тесты под наши задачи!" - вот такая нынче деятельность. ☕️ Вы уже её юзали? https://unsloth.ai/docs/models/mtp#gemma-4-mtp Поделитесь с чем сравнивали в комментах!
GLM-5.2: китайцы подбираются к американскому фронтиру Привет, коллеги-лаборанты! GLM-5.1 для меня уже была одной из самых интересных моделей последнего времени наравне с Qwen3.6 Она хорошо ощущалась в рабочих задачах: код, длинный контекст, agentic workflows, адекватная цена входа, нормальная скорость на сложных прогонах. Китайские лаборатории всё плотнее догоняют американцев в моделях: coding, reasoning, long context, open weights, интеграция в реальные инструменты разработчика. GLM-5.2 уже доступна в GLM Coding Plan. API, чатбот и открытые веса под MIT обещаны следом. Бенчмарков на релизе пока нет, поэтому это ещё не победный круг, а повод внимательно тестировать руками. Жаль на своей 5090 запустить я ее не смогу. 5 моментов, за которыми я бы следил: 1. Контекст до 1M токенов Большой репозиторий, история задачи, архитектурные заметки, логи, тесты, прошлые решения, текущие ошибки. Всё это можно держать в одной рабочей сессии. Главная проверка: насколько модель реально понимает длинный проект на таком окне. Цифра 1M сама по себе ничего не гарантирует. 2. Long-horizon coding Вот это для меня главный пункт. Сильная coding-модель видна на длинной задаче: поняла проект, внесла изменения, прошла по ошибкам, поправила тесты, сохранила цель, довела работу до результата. Если GLM-5.2 прибавит именно здесь, она станет очень интересной для агентных harness-систем. 3. High и Max effort У GLM-5.2 есть режимы reasoning effort: High и Max. Это практичная логика. Рутину можно гонять быстрее. Архитектуру, миграции, баги и multi-file refactor лучше отдавать в глубокий режим. 4. Открытые веса под MIT Сильная открытая coding-модель даёт маленьким командам и локальным лабораториям больше свободы: self-hosting, контроль над кодом, свои агентные контуры, меньше зависимости от закрытых API. Да, обслуживать большую модель всё равно дорого. Но сама альтернатива давит на рынок. Некоторые провайдеры предлагают GLM 5.1 именно благодаря открытости. 5. Быстрое попадание в рабочие инструменты GLM-5.2 приходит сразу в coding workflow. Claude Code, Cline, OpenCode, Roo Code и другие агенты уже фигурируют в контексте поддержки. Это важно. Модель можно быстро воткнуть в реальный рабочий контур: репозиторий, задачи, логи, тесты, ревью, правки. GLM-5.2 нужно гонять руками: на реальных репозиториях, длинных задачах, грязных логах и агентных сценариях. Если GLM-5.2 подтвердит ожидания , у нас появится ещё один серьёзный игрок для локальных лабораторий, coding agents и self-hosted AI-инфраструктуры. Кто научил своих агентов быстро тестировать, сравнивать и встраивать такие модели в свой harness, тот получает преимущество раньше рынка. Пробовать в облаке - у самих разрабов модели (там обычно не топовая скорость датацентра, но зато хорошие широкие лимиты больше рыночных). Доступно на всех тарифах, даже самых дешевых. https://z.ai