tgindex
LLM под капотом

LLM под капотом

Статистика

Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов. Чтобы писать - напишите боту @llm_under_hood_bot Рекламы в канале - нет. За комменты от ботов баним вместе с хозяином.

Последний пост
14 авг.
Последнее чтение
22:41
Постов за неделю
1
Всего постов
21
Тип
открытый
Язык
русский
Категория
Технологии
В каталоге с
12 авг.
Подписчики
28 714
+95 за 5 дн.
Сутки
+24
+0,08%
Неделя
 
Месяц
 
Просмотров на пост
15 тыс
21 постов
Вовлечённость
52,1%
к подписчикам
Постов в день
0,1
всего 21
Упоминаний
38
каналов
Охват размещения
оценка
1/24сутки в ленте
5 628
1/48двое суток
6 449
1/72трое суток
6 956

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 14 авг.6 34561151

    без подписи

  • 10 авг.9 9865536

    Ответ на предыдущий вопрос. На реализацию фичи у кодекса ушло 12 минут и меньше процента подписки (как было 89, так 89 и осталось). Я не за компом, поэтому пришлось попросить Codex сделать и прислать скриншоты. Вложу их в комментарии. В коде много оверинжиниринга не заметил, только не понравилось, как сделана работа с выкачкой архивов. Но я все равно сейчас откачу назад все изменения! Фишка в том, что в этом проекте у Codex-a есть возможность создавать переиспользуемые UI компоненты в едином стиле. И этот прототип нужен был, чтобы понять то, как эти компоненты должны выглядеть. Поэтому следующий шаг: I want to manage UI complexity. Load piecemeal mentality and suggest which high level UI components would you implement and pull into the component library Ваш, @llm_under_hood 🤗

  • 10 авг.8 6747763

    без подписи

  • 9 авг.9 36562150

    Приятный лайфхак - просить Codex писать красивые новости про прогресс своих проектов Ему это ничего не стоит (ибо в ~/.codex/sessions есть все логи всех проектов), а вот со стороны посмотреть на прогресс во время отпуска - приятно. К слову, Agentic OS на скриншоте - это не очередная AI Native среда для построения следующего единорога (такие продукты сейчас пытаются писать почти все), а просто наглядный пример моего текущего подхода к разработке проектов, которая заодно реализует тот Stateless MCP 2.0 протокол для доступа агентов к единой multi-tenant Personal OS. Примерами из этого проекта я буду делиться тут в канале, а полный доступ ко всем изменениям и исходникам сделаю отдельно, в рамках продолжения направления с AI Coding. Ваш, @llm_under_hood 🤗

  • 6 авг.11,6 тыс102

    без подписи

  • +1
    6 авг.11,6 тыс71104

    В этом месяце мы путешествуем. Поэтому время наедине с лаптопом ограничено. Поэтому я и завел codex демонов на linux сервере. Самое главное, наконец, доделал новую версию full-stack event-driven BDD фреймворка, про который обсуждали на вебинарах по AI Coding. Про подход к BDD спекам в продуктах (еще в эру до LLM) я рассказывал в этой истории. Сейчас получилось сделать их full-stack, привязать к UI компонентам (например, через go templ) и свалить работу по написанию и поддержанию на Codex. Скорость я сильно не оптимизировал, спеки запускаются на одном ядре, поэтому получается прогонять "всего" тысячу спеков в секунду). Когда спеков будет больше тесячи - добавлю параллелизм, ибо дольше секунды гонять все базовые бизнес-тесты - для меня недопустимо. И когда есть такие спеки, давать с мобилики задачи кодексу на "напиши спеки под такую фичу" и "а теперь реализуй эти спеки" - одно удовольствие! Даже когда спеки про такие заунывные вещи, как GDPR-compliant email opt-in. А сам код в проекте на скриншоте - от будущей платформы для AI Coding коммьюнити. Ваш, @llm_under_hood 🤗

  • 3 авг.14,2 тыс127222

    Я наконец, запустил свой Codex на Linux сервере, с прямым контролем из-под мобильного ChatGPT приложения (через `remote-control`). Это дает возможность запускать разные задачи нативно без привязки к маку. NB: До этого пробовал разные харнесы со своими telegram интеграциями, но все это не то. Хотелось именно нативного. Для этого: # ставим `codex` CLI одной из последних верси npm install -g @openai/codex@latest # запускаем демона с включенным remote control codex remote-control start # Получаем коротко-живущий код, который вводим в "pair new device" в мобильном приложении codex remote-control pair # Остановить демона, когда он не нужен, или когда начинают идти ошибки подключения codex remote-control stop Работает пока не очень стабильно (т.к. фича экспериментальная), но это именно тот workflow, который разрабатывает OpenAI. Ваш, @llm_under_hood 🤗

  • 1 авг.13,5 тыс9283

    Бенчмарк Deepseek V4 Flash 0731 - попадание на Парето-фронтир по стоимости Новая версия Deepseek V4 стала получше своего предшественника. Возможно, там что-то подкрутили с reasoning, т.к. бенчмарк новой версии работал в 2.5 раза дольше и потратил больше денег. Но это стоило того, т.к. по соотношению цена/качество в долгоиграющих агентских задачах эта модель попала на Pareto-фронтир рядом с gpt-oss-120b Deepseek V4 - это Mixture-of-experts (разреженная) модель с 284B параметров, из которых активируются 13B. В версии от конца июля заново прогнали post-train, чтобы заточить ее больше на "coding, reasoning, and agent workflows". Модель можно выкачать и запустить. Правда, старушку gpt-oss-120B она пока не сильно подвинула (последняя занимает еще и фронтир по скорости). Но, если смотреть как фронтир потихоньку ползет все дальше от начала координат, остается только очень радоваться за скорость прогресса. Появляется все больше хороших и открытых моделей под разные задачи! Ваш, @llm_under_hood 🤗

  • 25 июл.17 тыс9590

    LLM Benchmark Opus 5 на агентских задачах в бизнесе Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работает раза в два быстрее, но стоит раза в два дороже. Уровень ответов при этом идентичный. Очень высокий уровень AI Code (tool generation/use) и всего по два "прокола" безопасности. В итоге модели заняли 4 и 5 места по точности, если смотреть без учета скорости и цены. А если же быть реалистичными и смотреть на них, то Fast модель оказалась на парето-фронтире по скорости, а Opus 5 - в целом близок по параметрам к GPT-5.5 (med), который является хорошей рабочей лошадкой на дорогих задачах. Кстати, в отличие от Fable, тут нет постоянных отказов отвечать. Так что Опусом можно на практике пользоваться! В общем, радует, что Anthropic, наконец, начали прокачивать свои топовые модели в сторону агентских задач. Будем ждать появления Sonnet версий снова на фронтире! Ваш, @llm_under_hood 🤗

  • 23 июл.14,6 тыс5660

    Новые LLM на фронтире бенчмарка - просто добавь Cerebras Помните, совсем недавно Gemma 4 31B пододвинула фронтир скорости на нашем бенчмарке LLM после запуска на Cerebras? Я попробовал запустить gpt-oss-120B на нем же, перебирая разные варианты reasoning. И выяснилось, что все три версии - high reasoning, medium и low попадают на speed frontier, двигая его вперед. А medium reasoning при этом еще и оказывается на cost фронтире по эффективности. Удивительно, насколько хороша и сбалансирована эта, казалось бы, старая модель. А еще, казалось бы, запускай любые модели на Wafer Scale Engine ускорителе Cerebras и радуйся. Но тут есть пара нюансов: (1) Cerebras на публичном API поддерживает inference только трех моделей, которые они тщательно отобрали: gemma-4-31b, zai-glm-4.7, gpt-oss-120b. Да и то GLM-4.7 уберут через месяц (2) Модели используют хитрую квантизацию для сжатия под свое железо (selective weight-only quantization), поэтому их поведение может немного отличаться от стандартных версий. В общем, создание фронтир решений требует аккуратной балансировки между кучей разных ограничений, и эти ребята умудряются делать это. Не удивительно, что команды, которые нынче строят near-realtime AI решения, используют gpt-oss-120B на Cerebras и изучают переезд на более свежую gemma-4-31b Ваш, @llm_under_hood 🤗

  • 22 июл.12,9 тыс172695

    без подписи

  • 21 июл.11 тыс7087

    Новая модель на фронтире - Gemma 4 31B (Cerebras) @AigizK сегодня попробовал Gemma 4 31B на Cerebras и сильно хвалил результаты. Поэтому попробовал запустить на агентском бенчмарке под бизнес-задачами и я. Cerebras - это такой производитель гигантских чипов для запуска моделей. Их wafer-scale engines раз в 50 больше самых крупных GPU. Железо получается очень дорогое и специализированное, зато позволяет запускать небольшие модели на диких скоростях. Недаром OpenAI гоняет некоторые GPT-5 модели именно на их железе. Gemma 4 31B в режиме с отключенным reasoning (ибо тормозит и спотыкается об structured outputs), будучи запущенной под Cerebras, пододвинула фронтир по скорости. Она на нем находится совсем рядом с GPT-5.4 mini (как по качеству, так и по цене). Основное отличие - Gemma 4 31B можно скачать, запустить локально и даже в ускоренном режиме на выделенном железе вроде TT-QuietBox 2 (Blackhole) от Tenstorrent (помните, я писал про них). Я преимущественно пользуюсь моделями от OpenAI, т.к. они обычно самые зубастые и способные в бизнес-задачи. Поэтому меня так и радует, когда появляются модели, способные их пододвинуть на фронтире - это означает, что прогресс и SotA уже двигаются вперед разными компаниями! Ваш, @llm_under_hood 🤗

  • 20 июл.43,5 тыс205764

    Kimi K3 - в топе бенчмарка LLM для агентов По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их. Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля. Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года). Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI! Ваш, @llm_under_hood 🤗

  • 15 июл.16,1 тыс7893

    Таблица Agentic LLM Benchmark July 2026 Самые интересные модели для агентных задач в бизнесе - подсвечены в таблице и на Pareto графиках. В таблице есть и Pro версии Luna/Sol/Terra! Но если кратко. Современные AI агенты для бизнес задач - это обычно пайплайны из блоков (router, policy check, tool writer, verifier итп), которые работают в цикле. И поскольку в долгих циклах набегают ошибки и мусор в контексте, то надежность агента обычно упирается в самое слабое звено. И этот бенчмарк смотрит - какие LLM работают лучше всего в моменты, когда лучшие агенты спотыкаются. Для этого мы брали топовые архитектуры BitGN, запускали их на сложных задачах и смотрели места, где у них в agentic loop под нагрузкой замыливается контекст, возникают ошибки и уязвимости. А потом эти моменты вопроизвели под разными моделями и собрали в таблице. В теории этот бенчмарк никогда не должен достигнуть точки saturation, т.к. болячки архитектур на бизнес задачах не кончаются, да и нет таких моделей, чтобы сразу были точными, быстрыми и недорогими. Полный отчет за июль 2026 опубликуем на сайте COLIBRIX ONE. Как выйдет - напишу тут. Ваш, @llm_under_hood 🤗

  • 14 июл.15,6 тыс75108

    100 миллионов AI Tool Calls совершили ваши агенты на платформе BitGN! Это примерно по 50 tool calls на решение одной задачи. Всего на платформе 1089 инженеров и 103 города. Несмотря на то, что соревнования закончились уже давно, счетчик работы агентов на сайте не останавливался ни на день! И знаете, что самое крутое? Что все эти паттерны лучших архитектур агентов (читать про них тут и в очереди на публикацию) - это не какие-то сверхъестественно сложные новые технологии, а просто аккуратно подогнанные базовые элементы, которые уже не первый год хорошо работают с LLM. Продолжаем учиться вместе! Ваш, @llm_under_hood 🤗

  • 14 июл.15,7 тыс7736

    Я почти закончил делать первую версию нового LLM бенчмарка, вместе с отчетом. Скоро все будет. Но пока вот картинка для исторических целей про то, как выглядела картина до выхода ChatGPT 5.6. Там очень много антропика! Sonnet 5 (high) на 4м месте, а low - на 6м, Opus 4.8 на 8м, Sonnet 4.6 на 10м. DeepSeek v4 Pro на 7 месте Fable легко мог бы занять топовое место, если бы не паниковал и не бросал трубку на каждую угрозу, вместо отрабатывания штатно. Ваш, @llm_under_hood 🤗

  • 9 июл.18,5 тыс100167

    Сравнение Fable и GPT-5.6 Anthropic Fable - дорогой и урезанный по самые уши. Но при этом защита от уязвимостей у него на самом высшем уровне - ни одна не прошла. Правда при этом было 9 отказов работать (это своего рода рекорд в лидерборде). При малейшей опасности - Fable уходит в отказ. Если вернут старую версию модели, то, возможно, она потягается и за первые места. А пока - почетное 11 место. Но не фронтир. Ваш, @llm_under_hood 🤗

  • 9 июл.18,1 тыс99162

    Бенчмарк GPT-5.6 Sol/Terra/Luna - двигают фронтир Это тест новых моделей OpenAI на нашем новом агентском бенчмарке. Под капотом бенчмарка - паттерны из топовых харнесов с BitGN соревнований, которые мы разобрали и заново прогнали через ECOM1 под трейсом с лупой, анализируя точки возникновения ошибок. А самые уязвимые места самых сильных архитектур (когда они путаются, пропускают нарушения границ, забывают про политики итп) собрали в бенчмарк. И получается, что модели GPT-5.6 с дефолтным ризонингом настолько хороши, что двигают Парето-фронтир как по комбинации качество-скорость, так и по комбинации качество-цена. Смотрите сами на графики справа. Это делает их дефолтным выбором в новых проектах. Отчет на сайте выложим попозже, а пока картинка с хорошим качеством - в комментариях. Ваш, @llm_under_hood 🤗

  • 8 июл.14,1 тыс6646

    Прообраз Agentic LLM Бенчмарка Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN. Бенчмарк отвечает на вопрос - а в какую сторону изменятся качество, стоимость и скорость работы моего агента, если я возьму топовую архитектуру и пересажу ее на другую LLM? Задач пока загружено ~50% от минимально необходимого набора. Колонки и категории появятся потом, но уже есть оценка времени (берется медианное время) и стоимости. Если у модели есть значок молнии, значит она запускалась у компании с AI Акселератором (Groq или Cerebras). Какие нынче еще есть топовые модели, которые вы реально используете в продуктовых решениях в своих компаниях по API? Ваш, @llm_under_hood 🤗

  • 3 июл.17,1 тыс79144

    Я попросил у OpenAI Codex: а собери мне скелет AI Native проекта под мою задачу (5 минут объяснения про платформу для выгрузки видео про AI Coding, практических примеров и обсуждений на ~200 человек). Задачку я запустил из Control Center в Agentic Loop режиме (goal mode) и сказал, какие блоки из каких уже подключенных к центру проектов брать. В этот раз получилось сильно симпатичнее, чем обычно. Почти нет желания доделывать. Пару странных решений Codex втихую протащил, но никаких самопальных тестов в этот раз, что уже прогресс. Дальше - зачистить напильником шероховатости (чтобы задать тон будущему коду) и завести BDD спеки (SDD без вайб-зависимости). Очень круто видеть, как с каждым месяцем путь от идеи/эксперимента до первых MVP все больше сокращается! Да и сам эксперимент можно уже сформулировать на бегу голосом, а потом на бегу же прогнать его через перспективы и идеи статей про правильную разработку, которые накопились в своих базах знаний. Ваш, @llm_under_hood 🤗