КайфКодинг
СтатистикаВайбКодинг с Артемом Кругловым, выпускник МФТИ, AI-гуру и основатель AnyQuery. Быстрые лайфхаки: короткие видео с приёмами и трюками
- Последний пост
- 08:26
- Последнее чтение
- 14:51
- Постов за неделю
- 37
- Всего постов
- 56
- Тип
- открытый
- Язык
- русский
- Категория
- Видео
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 182
- 1/48двое суток
- 208
- 1/72трое суток
- 224
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Агент выбрасывает рабочую идею не потому, что она плохая. Потому что замер не досчитался. Санкальп, он же dejavucoder, две недели гонял Codex на конкурсе GPU Mode по батчевому QR-разложению. Больше 1 500 сабмитов, 12-е место из 183, ускорение в 232 раза: базовый torch.geqrf считал около 419 000 микросекунд, финальное ядро — 1 805. Интересно не то, что получилось. Интересно, что он к концу вписал в AGENTS.md — файл опубликован целиком. Есть там и бодрящее «не бойся рисковать», но каркас держат четыре правила про улики. — Таймаут — не улика. Дословно: «Treat a timeout as inconclusive, not as a correctness/performance rejection». Прогон не завершился — значит, про идею по-прежнему не известно ничего. — Уликой считается только досчитавшийся прогон: пройденные или проваленные тесты и время. — Никакого восхождения от одного лидера. Держать не меньше трёх живых семейств идей сразу, и одно из них — заведомо рискованное. — Семейство не хоронить по одиночным провалам. Если две идеи по отдельности нейтральны, но чинят разные издержки, сначала совместить и только потом закапывать. Вот это и есть приём, ради которого я притащил историю. Ни одно из четырёх правил не про модель и не про промпт. Все четыре про одно: что считать достаточным основанием, чтобы признать идею мёртвой. У агента по умолчанию таким основанием работает любой плохой ответ, включая отсутствие ответа. Теперь переносим к себе, потому что схема у вас та же, только без лидерборда. Агент правит код, гоняет тесты, один падает по таймауту — и агент откатывает правку. Хотя про правку по-прежнему не известно ничего. У Санкальпа прогоны отваливались во многом из-за забитой очереди конкурса, у вас отвалятся из-за флейка, оборванной сети и кончившегося места в раннере. Для агента разницы нет. Что сделать сегодня. Открыть свой AGENTS.md или CLAUDE.md и найти строку, которая отделяет доказательство от отсутствия данных. Нет такой строки — её место занимает догадка модели. Признак, по которому решать: пролистайте последние сессии и посчитайте, сколько раз агент переписал работающий код после прогона, который не дошёл до конца. Честности ради, автор считает свой результат ограниченным — и ограничил его не протокол. Разбор топ-10 показал, что выше залезли за счёт знания предметной области: у входов с низким рангом много нулей, и это надо было использовать, а матрицу стоило держать в fp16, а не гонять между представлениями. Второй промах он называет «unknown unknown» — чистый пробел в предметной области, никаким протоколом он не лечится. Плюс цена вопроса: 14 дней, две подписки общей ценой 220 долларов и один запуск по цели, который крутился больше суток. https://sankalp.bearblog.dev/autoresearch/ Что в вашем проекте агент считает провалом, хотя это был просто не доехавший прогон?
Обвязка, которую вы год настраивали, теперь стоит денег в каждом запросе. И это уже не наблюдение из чатов, а строчка в документации обоих вендоров. 14 августа Anthropic выпустила разбор эффективных сессий Claude Code. Шесть привычек, и одна из них — прогнать /context в свежей сессии и посмотреть, что туда вообще загружено: CLAUDE.md, определения MCP-инструментов, лишнее вырезать. В документации Codex на тот же вопрос свои шесть пунктов, и два из них ровно про это: сократить AGENTS.md и отключать MCP-серверы, когда они не нужны. Год мы спорили, выполняет ли агент написанные ему правила. Спор закрылся с другой стороны: правила теперь вырезают не потому, что они не работают, а потому что они в счёте. Считайте конфиг строкой расхода, а не строкой настройки. https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions
Язык программирования теперь выбирают под ревью, а не под разработку. Скорость письма из аргументов выпала совсем. 11 августа Cameron Balahan, продакт-менеджер Go, и Richard Seroter из Google Cloud выкатили текст про то, почему Go — идеальный язык для разработки с агентами. Вся аргументация стоит на одной фразе: раз агент выдаёт сотни строк синтаксически валидного кода за секунды, то скорость, с которой пишет человек, больше не важна — важно, как этот код читать, проверять и поддерживать. На Hacker News текст собрал 438 баллов и 538 комментариев. Комментариев больше, чем апвоутов, там так спорят редко. Дальше список того, что Google называет преимуществами: — Один формат на всех. gofmt встроен в тулчейн, код сеньора, джуна и модели выглядит одинаково, и выдуманный вызов API видно быстрее. — Компилятор как первый ревьюер. Несуществующий метод, неверный тип, неинициализированная переменная — не собирается, агент чинит себя сам до того, как человек открыл дифф. — Стандартная библиотека вместо зависимостей. Модель тянет из обучающих данных мёртвые и подменённые пакеты, а тут почти всё лежит внутри. — Обещание совместимости. Go 2.0 не будет никогда, код пятнадцатилетней давности собирается сегодняшним тулчейном. Вот это и есть приём, ради которого я притащил историю. Каждый пункт в списке — ограничение. Один способ форматирования вместо любого, один способ выразить логику вместо дюжины, стандартная библиотека вместо экосистемы, отсутствие новых версий языка. Ровно за это Go годами называли языком для галер. Google не спорит с описанием, Google перестал считать это недостатком. В языке ничего не поменялось — поменялось, кто основной читатель кода. Выбор языка у вас, скорее всего, давно сделан. Но та же логика работает на уровень ниже, на конвенциях. Каждое место, где у команды есть два одинаково законных способа сделать одно и то же, подорожало: агент выберет оба, а читать это вам. Что сделать сегодня. Возьмите последний PR, который написал агент и который вы смёржили. Попросите отдельную сессию задать вам по этому диффу пять вопросов — не про синтаксис, а про то, что изменилось в поведении системы. Джеффри Литт держит такое правило постоянно: не отдаёт код, пока сам не проходит квиз по собственному диффу. Признак простой: не ответили на два вопроса из пяти — вы не ревьюили, вы жали «approve». Честности ради, у гугловского текста нет ни одного эвала. Ни замеров, ни таблиц, только рассуждение. Дэн Лу на той же неделе прогнал два собственных эвала — декодер zstd по RFC без интернета и Pandoc с холдаут-тестами — и вывод у него получился такой, что большинство ходящих по рукам утверждений про пригодность конкретного языка для LLM просто неверны. Заодно видно, откуда эти «факты» берутся: в популярном эвале, на который ссылается AI-выдача гугла, задачи решаются в 70–109 токенов. Задач там нет. https://developers.googleblog.com/why-go-is-an-ideal-language-for-ai-assisted-software-engineering/ https://danluu.com/pl-tokens/ Сколько строк в последнем PR, который вы смёржили, вы прочитали глазами?
Ничего не поздно В 1956 году чешский поэт Франтишек Грубин опубликовал стихотворение, которое стоит перечитывать, когда кажется, что вы всё пропустили. Ничего не поздно. Выдыхаем. Хороших выходных, коллеги.
Промпт для саморефлексии на вечер 1 запрос: Основываясь на каждом нашем разговоре, что у нас когда-либо были, расскажи мне о 5 вещах, которые ты обо мне узнал, о которых я никогда не говорил тебе напрямую. Не старайся сделать мне приятное 2 запрос: Скажи мне, какие закономерности ты видишь в том, как я думаю и принимаю решения, и 1 вещь, которую я больше всего отрицаю или отвергаю 3 запрос: Предскажи мои следующие 5 лет, если ничего не изменится. Далее предскажи их еще раз, если я исправлю 1 закономерность, которая сдерживает меня больше всего. Покажи мне оба варианта
Qwen3.8-27B на NeuralDeep.ru Наверное мы первые кто поднял ее в РФ по API после релиза через 40 минут! Пошла раскатка на тарифы https://neuraldeep.ru/models/qwen3-8-27b 256к text/video/img Ваш NeuralDeep.ru 👍
От выхода модели до доступа в АПИ - 40 минут. Валера большой молодец
turbopuffer: как построить поисковую базу поверх S3 (Рубрика #Architecture) Посмотрел разговор Gergely Orosz с Simon Eskildsen, сооснователем и CEO turbopuffer. Формально выпуск про инфраструктуру поиска для AI-продуктов, но для меня он прежде всего про старую инженерную дисциплину: сначала посчитать физику и экономику системы, а уже потом верить бенчмаркам. До turbopuffer Simon восемь лет занимался инфраструктурой Shopify. Там он собрал Napkin Math - таблицу с пропускной способностью DRAM и NVMe, задержками S3 и стоимостью разных видов хранения. Если расчёт говорит «10 мс», а тест показывает 10 секунд, нужно не выбирать соседнюю базу, а понять, где потерялись три порядка: в плане запроса, сети, распределении работы по узлам или самом эксперименте. turbopuffer вырос именно из такого несоответствия. Делая рекомендации для Readwise, Simon оценил, что хранение и поиск по векторам обойдутся примерно в $30 тысяч в месяц — при $5 тысячах на всю остальную инфраструктуру компании. По его словам, экономика продукта не сходилась, и функцию не запустили. Тогда он задал более полезный вопрос: обязательно ли постоянно держать все векторы в дорогой памяти и на реплицированных SSD? Ответом стала база, где все постоянные данные лежат в объектном хранилище (object storage), а вычислительные узлы не держат собственного состояния. Упрощённо векторы собираются в кластеры, отдельно хранится индекс центроидов, а запрос загружает только ближайшие кластеры. Горячие данные попадают в память, тёплые - в NVMe-кэш, холодные читаются из S3. Это не бесплатный трюк: запись может занимать до 200 мс, а холодные запросы иногда уходят в сотни миллисекунд. Но для поиска обычно важнее высокая пропускная способность, надёжность и цена хранения, чем транзакционная задержка каждой записи. turbopuffer сознательно платит более медленными записями и редкими холодными запросами за дешёвое хранение основной массы данных. Особенно хороша история первого клиента. По словам Simon, им стал Cursor, пришедший после запуска MVP в Twitter. Simon прилетел в Сан-Франциско и начал не с продажи, а с разбора чужой проблемы Postgres: autovacuum не успевал, и база читала таблицу вместо нужного index scan. Эта помощь создала доверие; затем Cursor перенёс нагрузку на turbopuffer за одну-две недели. По данным компании, первый счёт оказался на 95% ниже последнего счёта предыдущего поставщика. Это не независимый бенчмарк, но продуктовый урок сильный: критическую инфраструктуру покупают не по красивой диаграмме, а у команды, которая понимает весь контур отказов и стоимости. Для меня главный вывод: мышление от первых принципов не заменяет измерения - оно делает их осмысленными. Сначала прикидываем пределы железа и стоимость нагрузки, затем строим простейшую систему с нужными инвариантами и только после этого оптимизируем реальную работу. turbopuffer интересен не потому, что «S3 победил базы данных», а потому, что команда отказалась платить за свойства, которые её поиску не нужны. #Software #Data #Architecture #Infrastructure #Engineering #AI
Скилл, навешенный на агента, — это не новая возможность. Это отложенная работа по его поддержке. Vercel рассказала, как разгребает AI SDK. К концу июня в репозитории лежало больше тысячи открытых issue и почти восемьсот пул-реквестов — при сотне с лишним новых issue в месяц. Руками эта дельта не закрывается. Одного агента со скиллами на каждый шаг они прототипировали и отказались — из-за «a higher maintenance and troubleshooting burden over time». Вместо него сделали отдельного агента на каждый шаг: воспроизведение бага, фикс, ревью, бэкпорт, документация, анализ фичи, реализация. У каждого свой промпт, свой контекст и свои эвалы. Через четыре недели фабрика авторит 25–35% смёрдженных PR и закрывает 70–80% issue. Скилл добавить дёшево, а отлаживать его придётся вместе со всем остальным. Отдельного агента — отдельно. https://vercel.com/blog/building-a-software-factory-for-ai-sdk
Вышел Коворк/Код от Битрикс24, делюсь, годная штука Это очень круто упакованный harness под моим небольшим присмотром Просишь собрать материалы к встрече или разгрести поручение, и он сам лезет в твои сделки, чаты, документы и таски прямо в Битрикс24(так как сильно интегрирован с ним) и делает рутинную работу за тебя В режиме Код можно кодить прямо по работе, без прокси и западных карточек, кто с этим воевал, тот оценит, интеграцию с хабом тоже проводил можно указать кастом модельки Больше всего зацепила память (Радиант), брали самые лучшие патерны по бенчам Проверено держит контекст больше месяца и не забывает Под капотом BitrixGPT 5.6 Agent 1M Д Наружу данные не уходят, весь контур в России, есть под macOS, Windows и Linux. По ощущениям это не очередная обёртка над LLM, а агент, который реально живёт внутри твоих данных и встроен в Битрикс24. Ранний доступ уже открыт, попробовать можно на cowork.bitrix24.ru Чем больше пользователей тем больше фидбека и лучше решение! Так что перед тем как сравнивать "чем лучше" а то я вас знаю =) Просто попробуйте
ребята, привет всем новеньким! поздравляю всех с тем, что впереди будет что-то новое интересное! ❤️ а я ищу разработчика в нашу небольшую (7 full-time people) команду Explee выручка >$3M ARR весной закрыли раунд, осенью вероятно будет ещё один ищу к себе, руководителем буду я это не какой-то корпоративный bullshit 😅 да, мы разрабатываем одновременно в 5-8 тредах, ещё и прям в слаке но это в кайф, а не “ради эффективности” мы оч крутой harness построили вместе с ребятами и кайфуем, как над side project в команде вас ждёт много знакомых лиц — я, Вова Баяндин, Харитон, Глеб Фокин, Оля Ромашкина и другие из требований: 1 опыт и кайф от работы с AI мы тут не просто “кодим с AI”, мы 20-30% времени строим систему в которой всё больше и больше делается само (у нас 60 подписок claude max на команду) 2 быть немного (или много) продактом мы катим больше 200 PR в неделю — ждать задачки из беклога это слишком долго нужно самому принимать много продуктовых решений полная вакансия тут (платим $10-12k в мес) https://jobs.explee.com/ai-native-developer отклик = пишите мне в личку
800 пулл реквестов в месяц, 60 учеток клод кода на несколько человек. Мое почтение господа.
Скоро любой текст можно будет проверить на след Claude. Проверкой авторства это не станет. Anthropic описала, как метит то, что генерирует. Модели, вышедшие в ЕС со 2 августа, метят текст с первого дня. Метка ставится на уровне модели, а не продукта, поэтому она одинаково приезжает из API, из Claude, из Claude Code, из Cowork — и по всему миру, включая доступ через AWS, Google Cloud и Microsoft Foundry. Как это устроено, по описанию самой Anthropic: — в текст вплетается невидимый знак, который не меняет ни смысл, ни читаемость; — знак переживает копипаст и часть правок, потому что он часть текста, а не метаданные; — картинки и .svg получают отдельно подписанные метаданные по стандарту C2PA. А дальше идёт раздел «Limitations», ради которого я это притащил. Anthropic сама перечисляет, когда знака не останется: если фрагмент короткий, если текст сильно переписали, пересказали, перевели или смешали с другим. То есть знак держится тем крепче, чем меньше человек трогал текст, и пропадает ровно там, где человек работал. Второе, и оно важнее. Наличие знака не означает, что писала модель. Дословно: «Claude may not be the original author». Вы отдали свой текст на вычитку, перевод или сокращение — вернулся он уже помеченным. Теперь к вам. Детектор, который вот-вот появится, отвечает на вопрос «этот текст проходил через Claude». Спрашивать его будут другое: «это писал не ты». Это разные вопросы, и подменять их будут не со зла, а по инерции. Что сделать сегодня. Посмотрите, где в вашем процессе через модель проходит уже написанный текст — вычитка, перевод, сокращение чужого документа. Признак простой: если за этот текст кто-то однажды спросит «кто автор», держите рядом исходник с историей правок. Честности ради, ни одно из этих ограничений Anthropic не прячет: они лежат отдельным разделом в её же статье. Как именно знак вплетается в текст, там не сказано — обещана техническая документация позже. https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content Какой ваш текст за последний месяц проходил через модель хотя бы ради вычитки — и знает ли об этом тот, кто его читал?
Проблемы с экранным временем детей вышли на новый уровень. Я бы даже не ругала в этом случае, а восхитилась находчивостью.
Подписка за 200 окупилась чуть более чем полностью
Но я сегодня слушал нейрослоп-шансон в такси. Один раз по радио, другой раз в подборках таксиста. За душу берет.
Как покорить сердце водителя такси? Спросите аккуратно у него о его малой родине. Тихо сделайте песню про этот маленький городок в Suno, а попросите включить ее. Сердечко водителя будет тронуто.
Зашифрованный блок в логе агента — не защита. Это отложенная утечка. Когда модель думает, провайдер не показывает вам её рассуждение. Он присылает вместо него зашифрованный блок и просит вернуть этот блок обратно, если разговор продолжится. Так устроено у Anthropic, OpenAI и Google. Александр Панфилов с соавторами (MATS, ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems) проверили, насколько блок привязан к своему разговору. Оказалось, никак. Он принимается в другой сессии, у другого пользователя и на другой модели того же провайдера. Отсюда приём. Блок сильной модели подставляют её младшей родственнице и просят переписать содержимое дословно. Младшая отказывается, её обходят джейлбрейком — и рассуждение сильной модели читается обычным текстом. Саму сильную при этом не трогают вообще. Вот это и есть приём, ради которого я притащил историю. Дальше авторы скачали 6 708 логов агентских сессий, которые люди сами выложили на GitHub и Hugging Face ради воспроизводимости. Из них расшифровали 315 320 блоков. Внутри нашлось 704 чужих секрета: 62 API-ключа, 33 пароля, 24 токена доступа, 30 личных адресов почты. И главное число: 64 из них не встречаются в видимой части лога нигде. Только внутри рассуждения. Теперь к вам. Сканер секретов читает то, что видно: текст, команды, вывод. Зашифрованный блок он видит как длинную строку мусора и проходит мимо. То есть часть утечек он не находит не потому, что плохо настроен, а потому, что смотрит не туда. Что сделать сегодня. Поищите в репозиториях и в артефактах CI поля thinking, signature, encrypted_content. Нашли — считайте эти файлы такими же секретными, как .env, а не отладочным выводом. Честности ради, 704 секрета на 315 320 блоков — это доли процента. Работа лежит препринтом, рецензирования не проходила. А заголовки к расшифрованным логам на сайте авторы сгенерировали Opus 5: витрину исследования про модели сделала модель. https://stolen-thoughts.com/ Какие логи агента лежат у вас в репозитории и кто хоть раз проверял их тем же сканером, что и код?
Короче rage bait пост. Про бизнес, предпринимателей, венчур и «взрослую индустрию tech». TLDR: венчуру в его текущем виде конец, будут только большие раунды, предприниматели прошлого цикла (а-ля инстаграм кофаундеры) потеряли свою ценность, их опыт не нужен. А теперь по порядку. Мы находимся у порога технологического цикла. Входного порога конечно. AI такая штука которая срезает все «среднее», «ну такое» и прочее ниже этого по качеству. Технология меняет местами в приоритете две важных вещи. Возможность сделать и возможность проверить. Раньше самым большим порогом входа было: собрать команду, найти денег чтобы им платить, мотивировать и так далее. Поток людей в индустрию рос. Было много гипотез, но чтобы их проверить нужно было время и ресурсы. Гипотезы были очень простые. О давай продавать это или отмечать фотки на карте, отмечать клиентов в табличке и трекать прогресс. Все было открыто (интернет меньше регулировался). Поэтому предприниматели славились своими софт скилами. Не так важно было знать проблему и ее решать, важно было найти людей и итерировать. Это ценилось превыше всего. Сегодня я вижу картинку по-другому. Порог до проверки гипотезы упал до нельзя. Простые вещи проверить можно на коленке. Посмотрите на вайбкодинг подделки. И тут оказалось, что решение проблемы в RL стоит сотни миллионов, а твой новый SaaS две выручки дай бог. И для меня поменялось местами следующее. Раньше важно найти с кем и засетапить. Теперь важно очень точно понимать что делать, и желательно формулировать конкретно. И это пресловутое знание в век AI компаний оказалось очень техническим и очень сложным. Залетели первые компании типа perplexity & Harvey. А дальше читая описание компаний поднимающих 200м сразу даже не понятно. И это не потому что они делают чушь (клоуны ахахах), а потому что не понимаешь в чем вообще суть проблемы ими решаемой. Следом за кризисом у предпринимателей будет кризис аллокации капитала. Ведь теперь нужно разбираться «на что» давать бабки, а не кому давать бабки. Что очень ломает мир инвесторов. И софт скилы отходят на второй план, ведь собрать команду под четкую проблему и зная что внутри легче, чем под «Тиндер для собак». А значит нужны инвесторы которые шарят. А таких будет мало, ибо им легче сделать свою компанию. Все эти вещи можно заметить уже сейчас: топ рисерч челы уходят из гугла, в инвест фондах меняются лица, потому что прошлые лидеры просто не понимают что происходит. Тупо банально не вдупляют в смысл происходящего. Такая стадия во многих индустриях. Там где венчура то и нет. Где стало сильно меньше высокорисковых идей с потенциалом. Потому что идеи стали сложные слишком. Это нас ждет и в tech. И да я бы не инвестировал бабки в трек рекорд прошлых лет, а лучше бы студентам норм профессора по ml закинул. Такие дела. Вторую часть может тоже напишу. Но предрекаю огромное количество «великих предпринимателей» у которыхт в эпоху AI ничего не выйдет. Совсем.
Ваше внимание к диалогу подтверждения имеет измеренный срок годности. Примерно пятьдесят промптов. С 14 августа новые сессии Claude Code на планах Pro, Max и Team стартуют в auto mode: разрешать вызовы инструментов будет модель-классификатор, а не вы. В исследовании Anthropic на 1053 платных тестерах подставленную опасную команду поймали 13,6% людей против 89% у классификатора. И главное: в начале сессии люди блокировали около 17% опасных команд, а после пятидесяти и более предыдущих запросов — около 5%. У классификатора доля не зависела от длины сессии вообще. Тестеры при этом сидели в подставленной среде и знали, что их оценивают. Диалог подтверждения оказался не механизмом безопасности, а элементом интерфейса со сроком годности. Чинить его не стали — из цепочки убрали вас. https://claude.com/blog/auto-mode-default-in-claude-code