Макеев: как перестать вайбкодить и начать жить
СтатистикаОснователь компании Surf. Рассказываю про: AI SDLC и AI. Приемная: @vmakeev
- Последний пост
- 7 авг.
- Последнее чтение
- 03:46
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 004
- 1/48двое суток
- 1 150
- 1/72трое суток
- 1 240
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Сделал CLI-утилиту, которая уже круто показала себя в проектах, называется katana. Проблема многих проектов — крупные файлы на несколько тысяч строк. Они мешают агентам: их долго читать, и забивается контекст. А агенту тяжело их разрезать — нужно долго читать, а потом долго писать куски нарезки, и т.к. это проходит через LLM, привносится недетерминированность. katana позволяет агенту архитектурно красиво разбивать файл без его чтения и записи. CLI даёт агенту сигнатуры всего содержимого файла, это работает через AST. Агент проектирует красивое разбиение, возвращает katana JSON с проектом разбиения, katana детерминированно разрезает файл, импорты фиксятся линтером. Профит. Т.е. агенту не пришлось ни читать, ни писать. И работает быстро. И ещё CLI умеет считать lines of code по проекту, чтобы задать приоритеты. В проектах обычно ставлю максимальную длину файла 700 строк + до 10% превышения, при котором разрезание ещё не срабатывает. Без такой гигиены не будет никакого AI-agent-first. Можно быстро привести к норме легаси-проект или не запустить новый. katana пару месяцев жила во внутреннем репозитории и показала эффективность, теперь переехала на GitHub — могут быть баги. https://github.com/vgmakeev/katana
Лучший мобильный терминал для агентов: https://x.com/odd_joel/status/2084538542894801031 Особенно хорошо с herdr.
Запускайте иногда uv cache prune для очистки неактуального кеша зависимостей uv. 130 Гб почистил.
Итоги Рейтинга Рунета для Surf — гордимся командой и благодарим клиентов В этом году мы снова доказали экспертизу в мобильной разработке. Забрали награды и восхищаемся всеми, кто помог достичь этого результата. Наши команды разработки, анализа, тестирования и дизайна, проджекты, девопсы — все они подтвердили профессионализм и оправдали доверие клиентов. 🏆 Достижения Surf в рейтинге: 🟠 3 место — «Подрядчики с экспертизой в отрасли Питание (разработка, интеграция)». 🟠 4 место — «Разработка и развитие мобильных приложений». 🟠 8 место — «Подрядчики с экспертизой в отрасли Торговля (разработка, интеграция)». 🟠 9 место — «Подрядчики крупного бизнеса (разработка, интеграция)». Планка поднята высоко, в нише заказной разработки участвовали более 1000 агенств, но останавливаться мы не планируем. На полке ещё полно места для наград. Ознакомиться с кейсами, которые принесли нам классные результаты, можно на сайте.
Ребятам, которые увлеклись вайбкодингом. Если вы смогли сегодня что-то навайбкодить – завтра это сможет сделать любой школьник. Вам может казаться что ваш эйджент сворм самый крутой – оглянитесь потом назад после выхода следующего opus/codex. Ценность перетекает в другие места. Отношения, нетворк, GTM, глубокая доменная экспертиза etc. Вайбкодинг – новая база. Разобрались, освоили – и вперёд отращивать то, чем вы будете ценны хотя бы через полгода.
Привет! С вами Владимир Макеев, CEO Surf. Делюсь крутыми новостями: наша компания взяла сразу четыре престижные награды на Workspace Digital Awards! Воркспейс одна из самых авторитетных премий в диджитале, победителей тут выбирают лидеры индустрии и представители крупнейших брендов. Конкуренция была жесткой, но мы в очередной раз доказали свой уровень. Наши результаты в этом году: 🥇 Два золота — мобильное приложение Бургер Кинг и По любви. 🥈 Два серебра — снова одно у Бургер Кинг и мобильное приложение Sellplus (ROWI). Хочу выразить огромную благодарность нашим клиентам, этот триумф — результат вашего доверия. Поздравляю всю компанию с большими достижениями. Ну и пишите нам, чтобы сделать проекты, которые завоюют главные рыночные награды.
А кто-то использует? Полезно? https://github.com/rtk-ai/rtk https://github.com/colbymchenry/codegraph
Наш Head of QA Маша Лещинская написала статью, который стоит прочитать всем, кто работает с AI-разработкой. Это разбор внутреннего пет-проекта (система бронирования девайсов для QA), который должен был умереть через неделю после релиза. А вместо этого живёт три месяца, оброс 23 фичами и превратился в полигон. Внутри: → Где AI облажался по-крупному. God object на 305 KB. N+1 запросов к Firestore. XSS через innerHTML. Тест для фичи, которой не существует. И главное — как ловить такое до прода, а не после. → Где, наоборот, удивил. Например, сам предложил Screenplay pattern + Page Objects на 38 задач — архитектура, которую не каждый сеньор соберёт. → Сколько по времени реально стоит фича, если делать «как надо». Спойлер: обеденный перерыв. Но с честными нюансами. https://habr.com/ru/articles/1038990/
Неделю кайфую от https://herdr.dev/ — агентский UI мечты. Сессии — это проекты/контексты слева сверху. Ниже запущенные агенты со статусами. Справа табы терминала. Я так и не разобрался в warp, чтобы сделать так наглядно. Обычно параллельно работаю с 4 проектами или 4 агентами в одном проекте. И в течение недели переключаюсь между примерно 7 проектами. UI Zellij мне не зашел. А с tmux тоже не удобно, когда много проектов. Короче, рекомендую и для работы на локальном компьютере, и на удаленном.
Anthropic сломали Opus-4.7. С конца прошлой недели стал супер-медленным и тупым. Очень его любил. Пересел на codex gpt-5.5 high — вот где оказался AGI и скорость. Вывод: компании нужно сидеть на двух стульях.
кто тут work/life баланс просил?
Помните, был такой OpenClaw?
Помните, был такой OpenClaw?
Channel name was changed to «Макеев: как перестать вайбкодить и начать жить»
SakanaAI доказали, что LLM не умеют быть случайными и предложили один промпт, чтобы заставлять модели быть более креативными Современные LLM хорошо решают задачи, где есть один правильный ответ, но заметно хуже справляются с ситуациями, где нужно выбирать между несколькими допустимыми вариантами с заданными вероятностями (исследователи вводят для такого термин Probabilistic Instruction Following). Например, подбрасывание монетки. Если сто раз попросить модель "подбросить монетку", то, по идее, распределение должно быть близко к 50/50, но на практике оно перекошено. Возникает логичный вопрос: ну и что? Так вот, такое поведение возникает не только в игрушечных симуляциях. В открытых задачах (вроде придумать название, написать поздравление, нагенерить идеи и тд) LLM тоже страдают от схлопывания разнообразия, и при многократных запусках крутятся вокруг очень похожих решений. Это мешает и обычному креативному использованию, и test-time scaling, где хочется получить много разных кандидатов, а потом выбрать лучший. Объясняется это просто: LLM не обладают внутренним источником независимой случайности и потому при стохастическом выборе следуют выученным во время обучения вероятностным смещениям, а не заданному распределению. Как это исправить? Раз внутреннего источника случайности у моделей нет, японцы предлагают его добавить. Сама идея простая: вместо наивного промпта вроде «сгенерируй случайное число» модель сначала заставляют генерировать случайную строку и потом использовать ее, чтобы выбрать или сформировать ответ. То есть примерно вот так: Сначала сгенерируй уникальную случайную строку (любой длины, без очевидной структуры). Затем используй ее как источник случайности, чтобы создать разнообразный, небанальный и качественный ответ на задачу. Это называется String Seed of Thought. Если модель сразу выбирает ответ, на нее влияют обученные смещения, но при генерации случайной строки они почти не проявляются. Затем модель преобразует строку в решение через простые вычисления (например, mod или хеш), фактически реализуя псевдослучайный выбор. Грубо говоря, метод работает, переводя задачу из семантической в вычислительную. На бенчмарках SSoT резко снижает отклонение от заданного распределения и часто приближается к уровню настоящего псевдослучайного генератора. Он стабильно обходит подкруты температуры и другие трюки на разных моделях и задачах. В открытых задачах креативность также растет, и при том без потери качества. Пользуйтесь, в общем. Блог и статья вот: https://pub.sakana.ai/ssot/
Попробовал claude.ai/design. Как по мене — переоценено. Сгенерировал не pixel perfect дизайн систему по Figma файлу. Для продуктового дизайна такое качество не подойдет. Для маркетинговых лендингов и мелкой indie AI-разработки — ok. Но для indie AI-разработки лучше взять shancd и т.п. claude.ai/design — что-то в стиле Tilda для совсем простого. Даже обидно за Figma, что ещё сильне просели акции.
С нового года веду Obsidian как личную операционную систему — задачи, контексты, рефлексии, саммари звонков. Раньше работал через Cursor, сейчас перешёл на Claude Code. Всё как говорит Карпатый. Сделал транскриптер на Whisper для Mac https://github.com/vgmakeev/free-whisper-mps-speach-to-text. Звонки с Телемоста автоматически транскрибируются, из них выделяются задачи на меня, задачи на кого-то, принятые решения, подвешенные вопросы. Храню только саммари — чтобы не раздувать контекст базы знаний. Это первый слой фактуры. Далее самое главное — рефлексии от руки. Несколько лет пишу их почти каждую неделю на Remarkable 2 — e-ink блокнот, где пишешь от руки, а получаются векторные заметки. Написал MCP-сервер, который забирает их с Remarkable через кабель и делает OCR рукописного русского. Распознавание работает в связке Claude Code и MyScript https://www.myscript.com/ — ребята специализируются на рукописном вводе, делали приложения, где школьники пишут от руки формулы, и они сразу решаются. Почему именно от руки — писать сильно лучше, чем печатать или наговаривать. Мышление включается только в момент, когда пишешь медленно. Это незаменимая вещь. Распознал рефлексии за весь 25-й год. Подсветились цикличные проблемы в бизнесе и циклы проблем с восстановлением и их причины. Имея на руках дамп коммуникации и дамп мозга с эмоциями — Claude Code реально помогает приоритизировать. Вечная проблема: 40 дел в инбоксе, всё кажется срочным и важным. Зная всё, он говорит, что на самом деле важно, а что можно задвинуть. Отдельный кайф — собесы. После каждого разговора — сразу фидбэк по транскрипции, сравнение кандидатов друг с другом. И я с ним 100% согласен. Ещё есть MCP с Google Calendar, Whoop, Garmin, анализы крови, логирование питания через Telegram-бота в Google Sheets. Общая картина здоровья, точки роста — всё в одной точке. Ключевое — не инструменты, а фактура. Рефлексии и коммуникация дают взгляд со стороны, в которых AI видит то, что сам не замечаешь.
Перевезли компанию с Cursor на Claude Code. Субъективно: агент Claude Code более внимательный к деталям по сравнению с тем же Opus-4.6 High в Cursor. Просто лучше результаты, больше фактуры. Объективно: сократили косты в 4 раза с 1 млн. ₽ в месяц до 250 тыс. Cursor — невероятно дорогой в сравнении с $200 личного тарифа Claude Code или $125 корп. И стали шарить учетки Claude между низкоинтенсивными пользователями. Съел недельный лимит $200 за 5 дней, пришлось запустить Cursor. $100 утекли за 2 дня. И не удобно переключаться между проектами. В Claude открыто 4 проекта одновременно в терминале. А Cursor мне показывает код и структуру папок, которая меня не инетресует. Да и агентские режими, где слева список агентов, справа его чат — это же не удобно. Закрыл и вряд ли вернусь.
Мы запустили телеграм-канал, в который пишут только руководители Surf. Внутри посты о том, как внедряем ИИ, как организуем проектную работу, управляем командами и развиваем свои pet-проекты. Почему вообще появилась такая идея? Просто надоели типовые тг-каналы, которые ведут как под копирку корпоративные пиарщики. В итоге получается довольно вторичный контент: кто-то что-то прочитал, переписал с помощью ИИ, и появился очередной «полезный пост» про технологии. Нам захотелось сделать другое пространство.Канал, где C-level обращается к C-level и пишет то, что реально полезно в работе: про процессы, управление разработкой, эксперименты с AI, организацию команд и всё то, что обычно остаётся внутри компаний. Пишут люди, которые этими процессами каждый день управляют. Канал получился скорее техническим, чем бизнесовым, и именно в этом его смысл. Заходите, подписывайтесь. Вот, например, один из постов — от нашего Head of QA Марии Лещинской: https://t.me/feature_museum_surf/1503
OpenAI пару часов назад зарелизил своего оркестратора: https://github.com/openai/symphony За 2 года мы прошли путь: Промты → tool calling → скилы → харнесы → оркестораторы Любопытно что будет дальше? Скорость эволюции, конечно, поражает. Подобное в другой индустрии заняло бы 10 лет.