Поляков считает: AI, код и кейсы
СтатистикаПишу про AI, вайбкодинг и кейсы применения. Связаться: @polyakovbest
- Последний пост
- 18:15
- Последнее чтение
- 09:03
- Постов за неделю
- 13
- Всего постов
- 28
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 723
- 1/48двое суток
- 1 974
- 1/72трое суток
- 2 129
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать. 🏆 Агентный бенчмарк: вровень с фронтиром Прогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме reasoning xhigh выдал 90,7%. Ровно столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%). И это всего лишь 27 миллиардов параметров. Локально. Без интернета. 🐌 А теперь цена Sonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с. Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина: 📐 макс. ток/с = пропускная способность памяти / размер активных весов Каждый токен требует вычитать все активные веса из памяти. Заново. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Делим — потолок ~10 ток/сек. Ровно то, что я и видел до спекулятивки. Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с. Модель больше, но это MoE — активны 3B из 35B, читается два гигабайта вместо двадцати шести. 👁 Видео: описывает отлично, понимает плохо Второй тест — скормил 28-секундную запись экрана. Сценарий: скроллю до расширения Контур, включаю его, двигаю анимированного персонажа, выключаю обратно. 🔸 Без ризонинга (ответ за 28 с) — подробнейшее описание интерфейса: Chrome, страница расширений, список плагинов, мультяшный персонаж, текст тултипа. Действий модель не разобрала вообще. Как будто ей дали скриншот, а не видео. 🔸 С ризонингом (94 с, втрое дольше) — появился пошаговый разбор с выводами о намерениях пользователя. Выглядит убедительно. И неверно. 🤔 Переключение Контура засекла только модель с ризонингом — интересно, почему? Но каждый раз путалась в показаниях: то описывала включение, то отключение. Как будто дробление на кадры происходит случайным образом. Видимо, тумблер размером 40 пикселей — это шум для EVS при нарезке кадров на токены. Кстати, стоит помнить, что Qwen3-VL сэмплит видео на 2 fps, то есть если будем пытаться делать скиллы по скринкасту, плотность действий на экране должна быть низкой, а темп медленным. 🗺️ Копии интерфейсов по скриншоту — прекрасно Третий тест — сгенерировал в ChatGPT картинку «хиро-блок сайта» и попросил Qwen сверстать её в HTML. Получилось очень близко к оригиналу. В одном из прогонов референс был с картинками. Модель сама сообразила, откуда их взять, и подставила сервис моковых изображений. Похоже, интерфейсы уже сейчас можно генерировать огромными партиями на небольших локальных моделях. 🧾 Что в итоге, где затестить и сколько стоит Если говорить о запуске на локальном мини-ПК вроде DGX Spark, Qwen3.8-27B — отличная модель, но очень медленная. Для задач, где важен результат, а не время отклика — ночные прогоны, батчи, автономные агенты — это лучшее, что сегодня можно поставить локально. Для интерактива терпения не хватит. Поэтому тут выручают провайдеры: • У нас в РФ эту модель уже поднял Валера — ребята затащили скорость 67 ток/сек • На OpenRouter — 3 доллара за миллион выходных токенов, но Throughput 16 ток/сек настораживает • Вот бы дождаться раздачи на cloud.cerebras.ai — там это будет выглядеть сверхбыстрой магией по 500 ток/с. Интересно, когда мы сможем тянуть такие модели прям на локальном железе? Кто что думает? ---- Поляков считает — AI, код и кейсы
видео или голосовое, без подписи
видео или голосовое, без подписи
Сюрприз от Manus: аккаунты удаляют, но обещают все вернуть Сегодня получил рефунд подписки на Манус и уведомление о том, что надо сделать бекап. Оказывается, что для соответствия законодательству компания вынуждена удалить данные. Но при этом они позволяют все данные скачать в виде бекапа, чтобы потом восстановить. 🔗 Вот ссылка: https://manus.im/backup 🤦🏻♂️ Всему виной сделка с Мета (террористом и экстремистом) Data generated by some users on/after Meta's acquisition of Manus needs to be deleted to comply with regulatory requirements in specific jurisdictions. В своем блоге Манус объясняет ситуацию, что некоторые юрисдикции обязывают их удалить данные накопленные в период владения вышеназванной корпорацией. 💳 Дарят скромный извинительный бонус Всем кто вернется после 23 августа дадут скидку 90% на первый месяц подписки. Возвращаться или нет, пока не решил. Возможности сервиса, это только виртуальная машина + агент в почтовом ящике. Что думаете? Нужен Манус современному айтишнику? Какие фичи в нем ценные? UPD: Анонсированы вообще свободные лимиты. ---- Поляков считает — AI, код и кейсы
инсайт который пришёл мне этой ночью, пока я жёг токены вы сталкивались когда-нибудь с такой проблемой: прорабатываешь с codex scope задачи или архитектурное решение и порой бывает, что это занимает довольно много контекста и может выполниться парочку compaction. да, у codex действительно лучший compaction на рынке и у нас есть почти бесконечное контекстное окно, но всё же важные детали после compaction в любом случае теряются. особенно, если эти детали не были зафиксированы где-нибудь в файлах, которые можно почитать после compaction. что делать? попросите codex использовать tool read_thread. если вы раннее видели как codex читает чужие треды, то вы наверняка знаете, что это за tool – он позволяет кодексу читать соседние треды. но вчера до меня дошло, что его можно просить читать и свой тред тоже. таким образом, можно прочитать детали, которые он писал в треде, до наступления compaction и восстановить их, чтобы потом сохранить в вашем плане. прочти весь наш тред через read_thread и убедись что ты собрал все детали которые мы с тобой обсуждали и на которых остановились вы уже знали про такой лайфхак? Лайк, репост, ✔️ Тимур Хахалев про AI Coding, подписывайтесь!
видео или голосовое, без подписи
видео или голосовое, без подписи
Разбираем ошибки Сбербанк Онлайна и обсуждаем ИИ для управления интерфейсами На самом деле пост про Bb харнес, но хочется обсудить с позиции продуктов, поэтому начнём со Сбербанка. Около 240 часов коллективного времени в сутки — столько, по моей прикидке, съедает ИИ-поиск в «СберБанк Онлайн». Сбер встроил ИИ в строку поиска. Раньше я находил нужный пункт меню мгновенно, теперь жду генерацию 2-3 секунды, чтобы быстро перейти к разделу со штрафами. 🗺️ Считаем на салфетке. В приложении, по данным самого Сбера, больше 85 миллионов активных пользователей. Если хотя бы 1% раз в сутки лезет в поиск и теряет на ожидании секунду — это 850 000 секунд, или 236 часов. Оценка нарочно скромная. Плюс электричество и токены за то, что и так работало быстро. А на прошлой неделе я увидел, как ИИ в интерфейсе делают по уму. 🧩 bb: агент дописывает интерфейс на ходу Рефат разобрал bb — открытую обвязку для кодинг-агентов — https://getbb.app. Я бы назвал это харнес для харнесов. Внутри Claude Code, Codex, Cursor, Pi, OpenCode, Grok и Hermes, что угодно с поддержкой ACP. Мне в Bb зашла идея с плагинами: агент прямо в треде пишет плагин под твою задачу, собирает и подгружает его сам. Плагин умеет добавить панель в сайдбар, свою команду, инструменты и навыки для агентов, фоновые задания, собственную базу SQLite. Многое в самом bb так и сделано: автоматизации, сайд-чат, память, задачи, интеграция с GitHub. 🤔 Я искал у Bb связь с Россией, так как Bb — это слово ИИ набранное в английской раскладке. Но не нашел. 🧪 Что попробовал я Селектор скиллов. Один раз указываешь директорию с навыком, дальше bb сам прокидывает симлинки и добавляет избирательную подгрузку. Вышло криво, но за пару минут и без единой строчки кода руками. Можно настроить отображение остатков лимитов подписки, и у меня наконец-то отображается остаток лимитов из Cursor. ⚡ ИИ в интерфейсе может быть полезен тем, что может собрать экран под конкретного пользователя. 🎯 Кому стоит украсть идею - Сбер: чтобы пользователь мог вынести штрафы в меню, если ему они интереснее чем кредиты. - Битрикс24: дашборды, которые пользователь собирает себе сам по своим задачам. - Яндекс Директ: быстрый доступ к настройкам, до которых сейчас четыре клика. Список можно продолжать, в него вписывается почти любой SaaS с ценностью на уровне приложения и интерфейса. 🧯 Что стоит знать до установки Проекту пара месяцев. До версии 0.36.0 от 8 августа сервер bb слушал все сетевые интерфейсы и отдавал неаутентифицированный API любому, кто дотянется до машины. Починили, теперь только 127.0.0.1. Десктоп только под macOS на Apple Silicon, остальным npx bb-app@latest, Windows через WSL2. Сам я не перееду: слишком привык к нативным Claude Code и Codex. Но как демо для тех, кто делает интерфейсы, это самое интересное, что я видел за последнее время. Думали уже о том, что ИИ — это скорее не болталка, а способ нового взаимодействия на уровне интерфейса? Какому из продуктов советовали бы добавить агентов, как средство изменения интерфейса? ---- Поляков считает — AI, код и кейсы
Cursor - это выпрямитель рук По ощущениям это словно дарк соулс от мира кодовых агентов. Ошибок не прощает. Надо очень внимательно следить и за тем, что ты попросил агента сделать, и за тем, как он это в итоге сделал. Один раз пролистал диф по диагонали, и в репозитории уже живёт что-то, что вроде работает, но совсем не так, как ты задумывал. Зато дисциплина от этого подтягивается (хотя многих это и отпугивает). Начинаешь формулировать задачу точнее и читать сгенерированный код внимательнее, апрувить не сразу пачкой, как в Codex и Claude Code, мол я сделял, а небольшими кусочками, с учётом контекста. Поэтому выскажу мнение основанное на личном опыте: Если научиться работать с Cursor, то и с любым другим агентом дальше пойдёт легче и проще. Как раз про это я собрал бесплатный курс про Cursor AI на Stepik, там всё по шагам, от первой настройки до работы с большими проектами. PS. Кому удобнее читать офлайн, весь курс собрал в PDF-книгу
Ваш покорный слуга тоже приобрёл у Паши книгу по Cursor и всем советует. Для меня Cursor — это такая замена Warp. Сказал перекопировать бота из сервера А на сервер Б, потому что нет соединения с сервисом — он за 2 минуты сделал. Купил ещё осенью, когда вышел Composer, так до сих пор и гоняю на примитивные задачи.
Кейс: Рабочий пайплайн для редизайна сайтов На прошлой неделе я написал, как удобно создавать редизайн старых сайтов с помощью ИИ. На этой неделе, я решил натянуть собранный тогда дизайн на админку. Имейте в виду, что я не разработчик, я скорее менеджер…
Туту проводит хакатон: хороший способ познакомиться с командой Помните я рассказывал, что запустили MCP для сервиса путешествий Туту. Самый популярный запрос в личку по итогам анонса был про то, как я нашел проект и договорился с командой. Ответ простой, команду я уже знал, прототип приготовил за вечер. Сделал демо, оно зашло. Вчера Туту анонсировали хакатон с призами: https://hackathon2026.tutu.ru Призы символические — деньги на покупку внутри сервиса. Но принципиально это предложение почелленджить интересные идеи для тревел-сервиса на живом API компании. 🙋🏻♂️ Сижу в жюри, буду оценивать решения Ваш покорный слуга приглашён в качестве судьи. На прошлой неделе проходило аналогичное мероприятие со студентами центрального университета. Лично мне зашло два решения. Одни ребята сделали ассистента, который управлял фильтрами на сайте (как Elevenlabs у себя), другие сделали Тиндер предлоджений. 🚀 Если бы я участвовал в таком челлендже, я бы наверное сделал тиндер-механику в целом для тревела. Типа поле ввода: путешествие на двоих с семьёй и варианты, которые обучаются в зависимости от сделанных человеком лайков. Тут отлично вписываются и агенты и рексис и спецпроекты для маркетинга. 🤔 Кому бы я советовал принять участие Если интересуетесь карьерой в тревелтехе, ИИ-агентами, в т.ч. как владелец продукта — хакатон однозначно для вас. Кроме призов организаторы совершенно точно заинтересованы в формировании кадрового резерва + с удовольствием реализуют вместе интересные проекты. Если собираетесь участвовать — напишите в комментариях, в какую сторону копаете: подбор поездки, интерфейсное решение или свой агент поверх MCP. ---- Поляков считает — AI, код и кейсы
#полезное Постоянный канал с вакансиями для AI-инженеров https://t.me/ai_engineer_jobs. Туда автоматически летят вакансии для AI Engineer, LLM Engineer, Agent Engineer, AI Product Engineer, vibe coder и других около-AI ролей. Сейчас подключено 22 источника -> чуть позже будет 400+ Поддерживает Telegram, RSS, API, карьерные сайты и вообще любые источники, которые удастся обнаружить и распарсить. Также содержит продвинутый набор инструментов обходов блокировок и защит от парсинга (исключая LinkedIn, там особый случай) За всем этим стоит написанный мной монстр job_ftch -> ETL-пайплайн с автодискавери источников, парсингом, дедупликацией и ML+LLM фильтрацией В общем, кому нужны нормальные вакансии в AI без тонны мусора -> подписывайтесь. Также вы можете сделать свой сервис/MCP/телеграм бот из этого проекта, так как он универсальный
Интересный случай продажи кота в мешке под соусом новой нац.модели. Открываем неделю с поста рубрики #ИИзнанка 😜 Да, да, знаю, что вышел Kimi3, читаю техрепорт, обзор будет позже. 📦 Вышла итоговая правка закона о развитии и поддержке суверенного ИИ. Максимально похудевший, где возможно, от фрейминга закон, дал почву бодрым кобанчикам для спекуляции в открытом поле. Теперь все пытаются залезть в нишу моделей среднего размера и назваться гордым именем "национальной" всея 🎉. При этом цимис понятен, b2g рынок (и бюджеты) - это золотая жила, прикоснуться хотят многие, однако можно случайно пойти по пути автоваза. Расскажу замечательную свежую историю о том, как не попасться на пустые инвестиции бодрым кабанчикам и что проверять, если вам предлагают "аналоговнет" за ХХмлн енотов. Кейс. Приходят к вам ребята с просьбой посмотреть на интересный проект и оценить потенциал инвестиций. Вы открываете презентацию и КП. А там: предлагаются новые модели, заявляется отличие от всех типовых transformers архитектур на рынке (llama, Qwen, Saiga, Vikhr и тп). При этом, заявляются размеры 9b, 35b, 122b; размер контекста более К млн токенов 🚬 Модели первой волны уже прошли К этапа обучения из М, но уже сопоставим результаты с Claude, но требуют дополнительных ХХ млн руб. (не млрд) инвестиций, чтобы показать всем кузькину мать и таки выйти на М этапов 💪. История собирательный образ, несёт образовательный смысл и все совпадения случайны. Итак, что вы должны сделать, чтобы провести фаст аудит: 1. Проверить размеры открытых популярных моделей на обнимашках. Тут мы видим, подозрительные совпадения с семейством Qwen 😐. А нам заявляют, что аналогов нет. Задумались. Ладно может совпадение и перед вами генИИ отрасли. Тогда идём к П2. 2. Просим тех.документы/добавить в репо/ссылку на патент или статью, или иную доказательную базу, естественно, под расписку, а лучше под NDA договор. Также важно запросить состав команды и их mindset, будет странно, если ребята делали раньше условный рексис, а сегодня они сами уже запилили грамотно К этапов обучения LLM, да так успешно, что аж на уровне Claude моделей. Не дают? Очень странное, ну может решают перестраховаться и мы идём к П3. 3. Допустим, вы понимаете, что модели аналоги Qwen, тогда в соответствии с scaling laws вы должны понимать сколько нужно пролить токенов данных, а значит шагов моделей на GPU, чтобы получить оптимальную сходимость для 9b,35b,122b. Те ваша модель на выходе будет адекватно работать. Отсюда же, вы можете посчитать сколько надо 💸 - это самое важное. Тут и спросите за бюджет, сколько gpu нужно, чтобы модель прошла все оставшиеся фазы и была prod ready, ну хотя бы MVP/PoC. Сколько токенов, gpu часов и тп. И увы если ХХХ млн не вписываются в создание заявленного числа параметров модели, gpu и gpu часов, то... В общем, получив такой чеклист, далее решать вам. 👍 Уже не говорю о том, что если внезапно это Qwen или аналоги, зачастую в открытом доступе уже лежат full обученные модели, прошедшие все этапы обучения, и сделать ещё сверху серьезный posttrain, расширить словарь и ничего при этом не сломать, требует компетенций и ресурсов. 😐 Удачи и stay tuned. 🦾 #ЖизаДня, #ИИнфоцыганство, #ДоверяйНоПроверяй А какие вы кейсы видели на своём опыте? Пишите в комментариях. 👇👇👇
видео или голосовое, без подписи