tgindex
Данил Щуцкий | CutCode AI

Данил Щуцкий | CutCode AI

Статистика

Внедряю AI в бизнес-процессы без хаоса и бесполезных демо. Инженерный подход: процесс → данные → MVP → внедрение. Малый и средний бизнес. ✉️ - @leeto_telegram

Последний пост
15 авг.
Последнее чтение
01:55
Постов за неделю
3
Всего постов
22
Тип
открытый
Язык
русский
Категория
Бизнес
В каталоге с
13 авг.
Подписчики
141
+1 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
345
22 постов
Вовлечённость
244,7%
к подписчикам
Постов в день
0,4
всего 22
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
102
1/48двое суток
116
1/72трое суток
126

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Тестирую локальную Qwen 3.8 и нашёл интересный артефакт При анализе изображения Qwen ответила: «К сожалению, текущая модель (grok-4.5) не поддерживает анализ картинок». Видимо какие-то вещи уже поручает другим моделькам.

  • ⚡️ Google выкатили Gemini 3.7 Flash И это уже не просто быстрый чат, а вполне рабочая модель для агентов и production-сценариев. Самое интересное: Google называет её своей самой умной workhorse-моделью для coding и agents. И это не пустой анонс — у модели уже есть file search, function calling, search grounding, structured outputs и thinking. По бенчмаркам Flash тоже выглядит сильно: • в кодинге она примерно на уровне GPT-5.6 Terra • и чуть лучше Sonnet 5 • на FrontierCode даже обходит обе модели Плюс цена приятная: $0.75 / $3.75 за миллион токенов на input/output. Это заметно дешевле Sonnet 5 и Terra. И ещё: у неё 1M контекста (ну этим уже не удивишь). Итог: Google снова делает Flash не эффектнее, а практичнее. А это для реального применения важнее всего.

  • без подписи

  • 13 июл.17530из phpyhconf

    От скучной генерации к инженерии с ИИ ИИ быстро генерирует код, но без контекста, декомпозиции и проверок работа с агентами превращается в ожидание и бесконечные правки. В докладе поговорим об AI-разработке как об управляемом инженерном процессе. Данил Щуцкий — backend-разработчик с опытом более 15 лет, автор Laravel-сообщества и YouTube-канала CutCode. Консультирует команды по архитектуре и высоконагруженным системам, развивает open source и инструменты для работы с ИИ. На примере AI Factory и AI Workspace Данил покажет, зачем нужны отдельные этапы исследования, планирования, реализации и проверки — и как превратить работу с кодинг-агентами в повторяемый процесс с понятными правилами и контролем результата. 🌿 Присоединиться к Пыхнику

  • 1 июл.236181

    ⚡️ Sonnet 5 вышел! Что ж, Fable нам опять не завезли — пока смотрим Sonnet 5. Ещё не успел нормально потестить его в кодинге, но есть ощущение, что тут может повториться старая история, когда младшая модель внезапно оказывается лучше Opus. И да, мысль такая есть: Sonnet 5 вполне может оказаться сильнее Opus 4.8 — как это уже бывало раньше. Кто уже попробовал — делитесь своим мнением в комментариях. Что вам больше зашло: Sonnet 5 или Opus 4.8?

  • 26 июн.262294из laravel_cutcode

    1000 звёзд у AI Factory. Вот это поворот. Честно говоря, я пару раз обновил GitHub, просто проверить - точно ли это происходит с моим проектом. AI Factory добрался до 1000 звёзд! Это мой самый быстрорастущий Open Source. Для меня это не просто цифра. Это знак, что тема AI-разработки болит не только у меня. Мы все видели этот сценарий: дал агенту задачу, он уверенно поехал, а потом ты полдня разбираешь, куда именно. Поэтому AI Factory родился как попытка сделать не prompt casino, а нормальный инженерный workflow: контекст, спеки, планы, проверки, документация, правила для агентов. И самое крутое - проект уже давно не только про меня. В разработку влилось много сильных ребят, появились идеи, правки, обсуждения, и из этого постепенно вырос действительно полезный тул. Спасибо всем, кто поставил звезду, помог кодом, issue, советом или просто поддержал. Двигаемся дальше!

  • AI-разработку часто подают как один сценарий: подключил модель, добавил MCP, дал агенту задачу — и команда ускорилась. Но на практике есть минимум три разных подхода: контекстная фабрика, разработка на стероидах и vibe coding, он же prompt casino. В новом ролике разбираю, почему их опасно путать, почему AI не отменяет разработчиков и почему сотни тулов не делают человека AI-native: https://www.youtube.com/watch?v=N_-GFgesQGk

  • Есть популярный инструмент для AI-разработки — CodeGraph. Он обещает уменьшение потребления токенов (35%), меньше tool calls, быстрые ответы и лучшее понимание кодовой базы. Звучит как must-have, поэтому я решил проверить его в деле. Прогнал CodeGraph через AI Tester на двух сценариях: простой задаче и проекте покрупнее. А потом добавил длительное исследование от Ичи, разработчика из нашего комьюнити: 300+ тестов и 150 парных сравнений rg против CodeGraph. И вот тут стало интересно. Смотрите в новом видео разбор CodeGraph: https://youtu.be/4W7V4gj_jC8

  • ⚡️ Anthropic открыла доступ к Claude Fable 5 Это первая публичная модель нового класса Mythos - уровня выше Opus по возможностям. Fable 5 и закрытая Mythos 5 построены на одной базовой модели. Разница в ограничениях: чувствительные запросы по кибербезопасности, биологии, химии и distillation-трафик в Fable 5 перенаправляются к Opus 4.8. Модель стоит $10 за миллион входных токенов и $50 за миллион выходных - меньше половины цены Mythos Preview. До 22 июня Fable 5 доступна на тарифах Pro, Max, Team и Enterprise, потом потребуются usage credits. Интересно, что Anthropic отдельно позиционирует Mythos-класс не как обычный апдейт Claude, а как новый верхний уровень для сложной интеллектуальной работы и кодинга. Ссылки: Релиз Fable 5 и Mythos 5 Project Glasswing

  • 9 июн.8921712

    На днях провел эксперимент с LLM. Занимался реализацией задачи в проекте, где генерировать код LLM-кой запрещено. Сам проект абсолютно не готов для работы с ИИ, хотя глобально там есть общие универсальные скиллы по тестам, качеству кода, архитектуре и т.д. Они общие, но индивидуального контекста под проект нет. Суть эксперимента была в том, что я со своими знаниями и экспертностью попробую дать на вход максимум контекста и в итоге оценю результат. Контекст я готовил половину рабочего дня: делал референсы из ТЗ, собирал контекст из переписок, саммари из созвонов. Было подготовлено много артефактов. Дальше я запустил генерацию и через 30 минут получил готовый код: покрытый тестами, полностью рабочий. Если отправить его в прод, никто даже не заметит подвоха. QA отчитается, что все кейсы выполнены и все гуд. Но код LLM-кой писать запрещено, значит, прежде чем отправлять его на ревью, мне нужно было поревьювить его самому. Что в итоге? Как вы думаете? Я полностью его переписал. Начиная от структуры таблиц и заканчивая кодом. Это был рабочий мусор. Думаете, вывод такой: «ха-ха, LLM делает мусор»? Нет. Эксперимент на самом деле завершился так, как я и предполагал. ИИ — это просто инструмент. Качественный контекст по задаче даст рабочее решение, но он не выполнит все ваши внутренние соглашения сам по себе. А вот чтобы все было так, как вы хотите, хотя бы приближенно, нужно потратить кучу времени на подготовку проекта к работе с LLM: выстроить harness, дать примеры того, как нужно писать, и постоянно их поддерживать. Причем это нужно внедрять не только на уровне разработки. Аналитики тоже должны сразу готовить контекст по задаче в едином стиле, желательно в кооперации с LLM, чтобы на вход уже попадал нормальный сформированный инпут, а не набор разрозненных сообщений, созвонов и догадок. То есть задача должна приходить не в формате «ну там в переписке все есть», а в виде готового артефакта: что делаем, зачем, какие ограничения, какие кейсы, какие спорные места, какие примеры, какие связи с текущей системой. А дополнительную информацию модель уже должна получать через внутренний MCP: документацию, схемы, соглашения, примеры кода, контракты, историю решений и все остальное, что нужно для нормального погружения в проект. В моей ситуации нужно было бы вложить очень много времени именно в подготовку контекста по кодовой части. И этот процесс был бы бесконечным: столкнулись с непредсказуемым поведением — дополняем инструкции, улучшаем слой валидации, добавляем новые проверки. Все это невозможно без смены мышления у всей команды. Каждый должен держать систему в тонусе, чтобы через какое-то время получить буст и постоянно его наращивать. Разработчикам в найме заниматься этим в свободное время, скорее всего, не особо захочется. А бизнес в большинстве случаев вряд ли выделит под это отдельные ресурсы. Пока как-то так. P.s. Манифест "AI Native - Новая культура мышления" уже доступен - https://ai-native.cutcode.dev

  • 9 июн.168242из ai_chat_cutcode

    Вышел новый ролик про изменения в AI Factory и экосистеме 🚀 Разбираю AI Factory, AI Workspace, HLV, AIF Handoff, MCP Unit и AI Tester: аудит артефактов, дистилляцию материалов в скиллы, память между проектами, прогрев сессий и управляемый процесс AI-разработки. Если vibe coding уже начал превращаться в хаос - показываю, куда двигаться дальше. https://www.youtube.com/watch?v=uRb04AO_13Y

  • 3 июн.503263

    Тестируем новую модель от Anthropic 🔥 Столкнул Claude Opus 4.8 и GPT-5.5 в реальной задаче по коду. Получится ли у новой модели обогнать чемпиона последних батлов? Смотрите: https://www.youtube.com/watch?v=lhZvejs6lnY

  • 1 июн.209261

    Новое видео на CutCode Решил провести сравнение GPT-5.5, GPT-5.4, GPT-5.2 и GPT-5.3 в одном тесте. Результат неоднозначный: победитель по баллам - не тот, чей код я бы взял в доработку. Разбор тут: https://www.youtube.com/watch?v=iAFxk__CstY

  • 28 мая248272

    ⚙️ Claude Opus 4.8 вышел с штукой, которая для продакшн-агентов важнее любой красивой цифры — теперь можно управлять effort То есть модель можно просить работать легче или, наоборот, выкладываться по максимуму прямо внутри продукта. Без лишней обвязки вокруг промпта. И это реально меняет практику. Где задача простая — не жжёшь лишние ресурсы. Где ошибка дорогая — включаешь тяжёлый режим. Тут уже речь не про “умнее”, а про то, насколько модель можно нормально контролировать в бою. В Claude Code ещё добавили dynamic workflows для очень больших задач. И вот это, пожалуй, самое прикладное в релизе: длинные цепочки шагов, инструменты, промежуточные решения, риск потерять контекст — всё то, где agentic-сценарии обычно и разваливаются. Anthropic также пишет, что ранние тестеры считают Opus 4.8 более надёжным и более точным в agentic tasks. А fast mode теперь работает в 2.5 раза быстрее и стоит в 3 раза дешевле, чем у прошлых моделей. И вот это уже не косметика, а вполне практичный апдейт: такие вещи реально делают автоматизации дешевле и проще в проде. Мой вывод: Opus 4.8 важен не самими бенчмарками, а тем, что делает агентные сценарии более предсказуемыми и менее дорогими. Но настоящая ценность раскроется только там, где уже есть нормальная обвязка, контроль шагов и процесс. Один промпт тут не спасёт.

  • 28 мая637314

    Новый coding battle на CutCode Новые модели пришли с красивыми фирменными бенчмарками, где они доминируют по всем показателям. Поэтому я взял нашего чемпиона GPT-5.5 против новичков - Gemini 3.5 Flash и Qwen 3.7 Max и отправил их не в синтетическую табличку со столбиками, а в реальную задачу: endpoints, PDF, ограничения по версиям, Postgres, Docker sandbox, performance и ревью качества кода. На старте у каждой модели есть причина выглядеть фаворитом. В ролике есть дисквалификации, второй шанс и финал, который лучше не спойлерить: https://www.youtube.com/watch?v=NaEoiWCOdGs

  • 23 мая303403

    Сегодня весь день Claude и Codex работали над сложной задачей и в итоге впервые оба отчитались, что не смогли найти решение. Я такого еще не видел, но задача была действительно нелегкой. Примечательно, что Claude в итоге исправил README проекта, где указал этот кейс и сообщил о том, что задача невыполнима. Поскольку я готовлю баттл Gemini/Qwen/GPT/Opus и у меня открыт Antigravity CLI, то просто ради эксперимента закинул такую же задачу. По инпуту она была один в один, так как работал велась через ai-factory, и план не менялся! Ну, в целом, я в шоке. Gemini 3.5 Flash (medium) за 2 итерации решил проблему, а на 3-й довёл её до идеала. Я при этом следил за tool calling и настолько глубокого исследования проблемы еще не встречал ни в одном агенте. В итоге я просто просидел минут 10 вот с такими глазами 😳! Можно подумать, что очередной рандом, но Claude и Codex пыхтели весь день, там под 30 итераций и никак! Честно говоря, на Gemini вообще не было ставки. Теперь интересно, как он себя покажет на баттле.

  • 21 мая198181

    🇨🇳 Alibaba выкатили Qwen3.7-Max - и это уже не просто очередной чат-апдейт, а модель под агентные задачи. Самый жирный кейс из релиза: 35 часов автономной работы, 1158+ tool calls и самостоятельная оптимизация CUDA-ядра под длинный контекст. Итог - x10 ускорение инференса. По цифрам тоже ок: • 1M токенов контекста • только текст • мультимодальности нет На SWE-bench Pro - 60.6%. Это выше DeepSeek V4-Pro, но ниже Claude Opus 4.7. Интересно и то, что Qwen прогнали через OpenClaw, Claude Code и Hermes - разброс всего около 6 пунктов. Значит, модель довольно стабильна. Главный вопрос теперь не про чат, а про реальную кодовую задачу: дотянет ли модель фронт, бэк, отладку и многошаговые tool calls до конца. В целом Qwen двигается в правильную сторону. Но решать по-прежнему будет не только модель, а вся обвязка вокруг неё.

  • У Google пачка апдейтов, и главное тут три штуки. 1. Gemini 3.5 Flash Опять обещают прорыв в кодинге — посмотрим в деле. Но есть ощущение, что модель может получиться сильной. Особенно с учётом того, что Gemini у Google уже умеет хорошо удивлять. 2. Antigravity 2.0 Систему пересобрали, переписали на Go, добавили параллельных агентов, dynamic subagents и Scheduled Tasks. По сути, просто догнали Claude Code и Codex. Хотя важный нюанс: Antigravity сейчас лёг, так что протестить всё это пока нельзя. 3. Gemini Omni Похоже, это новая SOTA-модель для генерации видео. Формулировка простая: Nano Banana, но для видео. И это уже звучит интересно. Вывод: Самое вкусное тут не Antigravity, а связка Gemini 3.5 Flash + Omni. Особенно если Flash реально окажется сильной мультимодальной моделью.

  • 20 мая155211

    ⚡️ Andrej Karpathy переходит в Anthropic и, по данным CNBC, сразу подключается к pretraining-команде. Его задача — использовать Claude, чтобы ускорять research и обучение следующего поколения моделей. Это важный сигнал: AI-гонка всё сильнее смещается от красивых демо к данным, пайплайнам, экспериментам и качеству pretraining. Если подход Anthropic сработает, преимущество будет расти прямо внутри процесса обучения.

  • 19 мая704163

    GPT-5.5 против Claude Opus 4.7 Новый ролик на YouTube. Топовые модели получили один и тот же coding benchmark. Обе проучили reasoning на максимум, и интрига держалась до самого конца. Кто выиграл — смотри в видео👇 https://youtu.be/97EDYPWEXm0