tgindex

Данил Щуцкий | CutCode AI

описание

Внедряю AI в бизнес-процессы без хаоса и бесполезных демо. Инженерный подход: процесс → данные → MVP → внедрение. Малый и средний бизнес. ✉️ - @leeto_telegram

141
подписчиков

Лучшие посты

за три месяца
  • 9 июн.893 просмотров17 реакций12 пересылок

    На днях провел эксперимент с LLM. Занимался реализацией задачи в проекте, где генерировать код LLM-кой запрещено. Сам проект абсолютно не готов для работы с ИИ, хотя глобально там есть общие универсальные скиллы по тестам, качеству кода, архитектуре и т.д. Они общие, но индивидуального контекста под проект нет. Суть эксперимента была в том, что я со своими знаниями и экспертностью попробую дать на вход максимум контекста и в итоге оценю результат. Контекст я готовил половину рабочего дня: делал референсы из ТЗ, собирал контекст из переписок, саммари из созвонов. Было подготовлено много артефактов. Дальше я запустил генерацию и через 30 минут получил готовый код: покрытый тестами, полностью рабочий. Если отправить его в прод, никто даже не заметит подвоха. QA отчитается, что все кейсы выполнены и все гуд. Но код LLM-кой писать запрещено, значит, прежде чем отправлять его на ревью, мне нужно было поревьювить его самому. Что в итоге? Как вы думаете? Я полностью его переписал. Начиная от структуры таблиц и заканчивая кодом. Это был рабочий мусор. Думаете, вывод такой: «ха-ха, LLM делает мусор»? Нет. Эксперимент на самом деле завершился так, как я и предполагал. ИИ — это просто инструмент. Качественный контекст по задаче даст рабочее решение, но он не выполнит все ваши внутренние соглашения сам по себе. А вот чтобы все было так, как вы хотите, хотя бы приближенно, нужно потратить кучу времени на подготовку проекта к работе с LLM: выстроить harness, дать примеры того, как нужно писать, и постоянно их поддерживать. Причем это нужно внедрять не только на уровне разработки. Аналитики тоже должны сразу готовить контекст по задаче в едином стиле, желательно в кооперации с LLM, чтобы на вход уже попадал нормальный сформированный инпут, а не набор разрозненных сообщений, созвонов и догадок. То есть задача должна приходить не в формате «ну там в переписке все есть», а в виде готового артефакта: что делаем, зачем, какие ограничения, какие кейсы, какие спорные места, какие примеры, какие связи с текущей системой. А дополнительную информацию модель уже должна получать через внутренний MCP: документацию, схемы, соглашения, примеры кода, контракты, историю решений и все остальное, что нужно для нормального погружения в проект. В моей ситуации нужно было бы вложить очень много времени именно в подготовку контекста по кодовой части. И этот процесс был бы бесконечным: столкнулись с непредсказуемым поведением — дополняем инструкции, улучшаем слой валидации, добавляем новые проверки. Все это невозможно без смены мышления у всей команды. Каждый должен держать систему в тонусе, чтобы через какое-то время получить буст и постоянно его наращивать. Разработчикам в найме заниматься этим в свободное время, скорее всего, не особо захочется. А бизнес в большинстве случаев вряд ли выделит под это отдельные ресурсы. Пока как-то так. P.s. Манифест "AI Native - Новая культура мышления" уже доступен - https://ai-native.cutcode.dev

  • 10 июн.712 просмотров12 реакций4 пересылок

    ⚡️ Anthropic открыла доступ к Claude Fable 5 Это первая публичная модель нового класса Mythos - уровня выше Opus по возможностям. Fable 5 и закрытая Mythos 5 построены на одной базовой модели. Разница в ограничениях: чувствительные запросы по кибербезопасности, биологии, химии и distillation-трафик в Fable 5 перенаправляются к Opus 4.8. Модель стоит $10 за миллион входных токенов и $50 за миллион выходных - меньше половины цены Mythos Preview. До 22 июня Fable 5 доступна на тарифах Pro, Max, Team и Enterprise, потом потребуются usage credits. Интересно, что Anthropic отдельно позиционирует Mythos-класс не как обычный апдейт Claude, а как новый верхний уровень для сложной интеллектуальной работы и кодинга. Ссылки: Релиз Fable 5 и Mythos 5 Project Glasswing

  • 16 июн.712 просмотров26 реакций4 пересылок

    Есть популярный инструмент для AI-разработки — CodeGraph. Он обещает уменьшение потребления токенов (35%), меньше tool calls, быстрые ответы и лучшее понимание кодовой базы. Звучит как must-have, поэтому я решил проверить его в деле. Прогнал CodeGraph через AI Tester на двух сценариях: простой задаче и проекте покрупнее. А потом добавил длительное исследование от Ичи, разработчика из нашего комьюнити: 300+ тестов и 150 парных сравнений rg против CodeGraph. И вот тут стало интересно. Смотрите в новом видео разбор CodeGraph: https://youtu.be/4W7V4gj_jC8

  • 28 мая637 просмотров31 реакций4 пересылок

    Новый coding battle на CutCode Новые модели пришли с красивыми фирменными бенчмарками, где они доминируют по всем показателям. Поэтому я взял нашего чемпиона GPT-5.5 против новичков - Gemini 3.5 Flash и Qwen 3.7 Max и отправил их не в синтетическую табличку со столбиками, а в реальную задачу: endpoints, PDF, ограничения по версиям, Postgres, Docker sandbox, performance и ревью качества кода. На старте у каждой модели есть причина выглядеть фаворитом. В ролике есть дисквалификации, второй шанс и финал, который лучше не спойлерить: https://www.youtube.com/watch?v=NaEoiWCOdGs

  • 3 июн.503 просмотров26 реакций3 пересылок

    Тестируем новую модель от Anthropic 🔥 Столкнул Claude Opus 4.8 и GPT-5.5 в реальной задаче по коду. Получится ли у новой модели обогнать чемпиона последних батлов? Смотрите: https://www.youtube.com/watch?v=lhZvejs6lnY

  • 23 мая303 просмотров40 реакций3 пересылок

    Сегодня весь день Claude и Codex работали над сложной задачей и в итоге впервые оба отчитались, что не смогли найти решение. Я такого еще не видел, но задача была действительно нелегкой. Примечательно, что Claude в итоге исправил README проекта, где указал этот кейс и сообщил о том, что задача невыполнима. Поскольку я готовлю баттл Gemini/Qwen/GPT/Opus и у меня открыт Antigravity CLI, то просто ради эксперимента закинул такую же задачу. По инпуту она была один в один, так как работал велась через ai-factory, и план не менялся! Ну, в целом, я в шоке. Gemini 3.5 Flash (medium) за 2 итерации решил проблему, а на 3-й довёл её до идеала. Я при этом следил за tool calling и настолько глубокого исследования проблемы еще не встречал ни в одном агенте. В итоге я просто просидел минут 10 вот с такими глазами 😳! Можно подумать, что очередной рандом, но Claude и Codex пыхтели весь день, там под 30 итераций и никак! Честно говоря, на Gemini вообще не было ставки. Теперь интересно, как он себя покажет на баттле.

  • 26 июн.262 просмотров29 реакций4 пересылок

    1000 звёзд у AI Factory. Вот это поворот. Честно говоря, я пару раз обновил GitHub, просто проверить - точно ли это происходит с моим проектом. AI Factory добрался до 1000 звёзд! Это мой самый быстрорастущий Open Source. Для меня это не просто цифра. Это знак, что тема AI-разработки болит не только у меня. Мы все видели этот сценарий: дал агенту задачу, он уверенно поехал, а потом ты полдня разбираешь, куда именно. Поэтому AI Factory родился как попытка сделать не prompt casino, а нормальный инженерный workflow: контекст, спеки, планы, проверки, документация, правила для агентов. И самое крутое - проект уже давно не только про меня. В разработку влилось много сильных ребят, появились идеи, правки, обсуждения, и из этого постепенно вырос действительно полезный тул. Спасибо всем, кто поставил звезду, помог кодом, issue, советом или просто поддержал. Двигаемся дальше!

  • 23 июн.261 просмотров20 реакций1 пересылок

    AI-разработку часто подают как один сценарий: подключил модель, добавил MCP, дал агенту задачу — и команда ускорилась. Но на практике есть минимум три разных подхода: контекстная фабрика, разработка на стероидах и vibe coding, он же prompt casino. В новом ролике разбираю, почему их опасно путать, почему AI не отменяет разработчиков и почему сотни тулов не делают человека AI-native: https://www.youtube.com/watch?v=N_-GFgesQGk

  • 28 мая248 просмотров27 реакций2 пересылок

    ⚙️ Claude Opus 4.8 вышел с штукой, которая для продакшн-агентов важнее любой красивой цифры — теперь можно управлять effort То есть модель можно просить работать легче или, наоборот, выкладываться по максимуму прямо внутри продукта. Без лишней обвязки вокруг промпта. И это реально меняет практику. Где задача простая — не жжёшь лишние ресурсы. Где ошибка дорогая — включаешь тяжёлый режим. Тут уже речь не про “умнее”, а про то, насколько модель можно нормально контролировать в бою. В Claude Code ещё добавили dynamic workflows для очень больших задач. И вот это, пожалуй, самое прикладное в релизе: длинные цепочки шагов, инструменты, промежуточные решения, риск потерять контекст — всё то, где agentic-сценарии обычно и разваливаются. Anthropic также пишет, что ранние тестеры считают Opus 4.8 более надёжным и более точным в agentic tasks. А fast mode теперь работает в 2.5 раза быстрее и стоит в 3 раза дешевле, чем у прошлых моделей. И вот это уже не косметика, а вполне практичный апдейт: такие вещи реально делают автоматизации дешевле и проще в проде. Мой вывод: Opus 4.8 важен не самими бенчмарками, а тем, что делает агентные сценарии более предсказуемыми и менее дорогими. Но настоящая ценность раскроется только там, где уже есть нормальная обвязка, контроль шагов и процесс. Один промпт тут не спасёт.

  • 1 июл.236 просмотров18 реакций1 пересылок

    ⚡️ Sonnet 5 вышел! Что ж, Fable нам опять не завезли — пока смотрим Sonnet 5. Ещё не успел нормально потестить его в кодинге, но есть ощущение, что тут может повториться старая история, когда младшая модель внезапно оказывается лучше Opus. И да, мысль такая есть: Sonnet 5 вполне может оказаться сильнее Opus 4.8 — как это уже бывало раньше. Кто уже попробовал — делитесь своим мнением в комментариях. Что вам больше зашло: Sonnet 5 или Opus 4.8?

  • 1 июн.209 просмотров26 реакций1 пересылок

    Новое видео на CutCode Решил провести сравнение GPT-5.5, GPT-5.4, GPT-5.2 и GPT-5.3 в одном тесте. Результат неоднозначный: победитель по баллам - не тот, чей код я бы взял в доработку. Разбор тут: https://www.youtube.com/watch?v=iAFxk__CstY

  • 21 мая198 просмотров18 реакций1 пересылок

    🇨🇳 Alibaba выкатили Qwen3.7-Max - и это уже не просто очередной чат-апдейт, а модель под агентные задачи. Самый жирный кейс из релиза: 35 часов автономной работы, 1158+ tool calls и самостоятельная оптимизация CUDA-ядра под длинный контекст. Итог - x10 ускорение инференса. По цифрам тоже ок: • 1M токенов контекста • только текст • мультимодальности нет На SWE-bench Pro - 60.6%. Это выше DeepSeek V4-Pro, но ниже Claude Opus 4.7. Интересно и то, что Qwen прогнали через OpenClaw, Claude Code и Hermes - разброс всего около 6 пунктов. Значит, модель довольно стабильна. Главный вопрос теперь не про чат, а про реальную кодовую задачу: дотянет ли модель фронт, бэк, отладку и многошаговые tool calls до конца. В целом Qwen двигается в правильную сторону. Но решать по-прежнему будет не только модель, а вся обвязка вокруг неё.

  • 13 июл.175 просмотров30 реакций

    От скучной генерации к инженерии с ИИ ИИ быстро генерирует код, но без контекста, декомпозиции и проверок работа с агентами превращается в ожидание и бесконечные правки. В докладе поговорим об AI-разработке как об управляемом инженерном процессе. Данил Щуцкий — backend-разработчик с опытом более 15 лет, автор Laravel-сообщества и YouTube-канала CutCode. Консультирует команды по архитектуре и высоконагруженным системам, развивает open source и инструменты для работы с ИИ. На примере AI Factory и AI Workspace Данил покажет, зачем нужны отдельные этапы исследования, планирования, реализации и проверки — и как превратить работу с кодинг-агентами в повторяемый процесс с понятными правилами и контролем результата. 🌿 Присоединиться к Пыхнику

  • 9 июн.168 просмотров24 реакций2 пересылок

    Вышел новый ролик про изменения в AI Factory и экосистеме 🚀 Разбираю AI Factory, AI Workspace, HLV, AIF Handoff, MCP Unit и AI Tester: аудит артефактов, дистилляцию материалов в скиллы, память между проектами, прогрев сессий и управляемый процесс AI-разработки. Если vibe coding уже начал превращаться в хаос - показываю, куда двигаться дальше. https://www.youtube.com/watch?v=uRb04AO_13Y

  • 20 мая164 просмотров13 реакций

    У Google пачка апдейтов, и главное тут три штуки. 1. Gemini 3.5 Flash Опять обещают прорыв в кодинге — посмотрим в деле. Но есть ощущение, что модель может получиться сильной. Особенно с учётом того, что Gemini у Google уже умеет хорошо удивлять. 2. Antigravity 2.0 Систему пересобрали, переписали на Go, добавили параллельных агентов, dynamic subagents и Scheduled Tasks. По сути, просто догнали Claude Code и Codex. Хотя важный нюанс: Antigravity сейчас лёг, так что протестить всё это пока нельзя. 3. Gemini Omni Похоже, это новая SOTA-модель для генерации видео. Формулировка простая: Nano Banana, но для видео. И это уже звучит интересно. Вывод: Самое вкусное тут не Antigravity, а связка Gemini 3.5 Flash + Omni. Особенно если Flash реально окажется сильной мультимодальной моделью.

  • 20 мая155 просмотров21 реакций1 пересылок

    ⚡️ Andrej Karpathy переходит в Anthropic и, по данным CNBC, сразу подключается к pretraining-команде. Его задача — использовать Claude, чтобы ускорять research и обучение следующего поколения моделей. Это важный сигнал: AI-гонка всё сильнее смещается от красивых демо к данным, пайплайнам, экспериментам и качеству pretraining. Если подход Anthropic сработает, преимущество будет расти прямо внутри процесса обучения.

  • 15 авг.150 просмотров20 реакций1 пересылок

    Тестирую локальную Qwen 3.8 и нашёл интересный артефакт При анализе изображения Qwen ответила: «К сожалению, текущая модель (grok-4.5) не поддерживает анализ картинок». Видимо какие-то вещи уже поручает другим моделькам.

  • 12 авг.115 просмотров27 реакций

    без подписи

  • 14 авг.103 просмотров16 реакций

    ⚡️ Google выкатили Gemini 3.7 Flash И это уже не просто быстрый чат, а вполне рабочая модель для агентов и production-сценариев. Самое интересное: Google называет её своей самой умной workhorse-моделью для coding и agents. И это не пустой анонс — у модели уже есть file search, function calling, search grounding, structured outputs и thinking. По бенчмаркам Flash тоже выглядит сильно: • в кодинге она примерно на уровне GPT-5.6 Terra • и чуть лучше Sonnet 5 • на FrontierCode даже обходит обе модели Плюс цена приятная: $0.75 / $3.75 за миллион токенов на input/output. Это заметно дешевле Sonnet 5 и Terra. И ещё: у неё 1M контекста (ну этим уже не удивишь). Итог: Google снова делает Flash не эффектнее, а практичнее. А это для реального применения важнее всего.