AI: Грешно не пробовать
СтатистикаЛичный черновик о нейросетях, галлюцинациях и цифровом будущем. Пока без структуры https://t.me/schors
- Последний пост
- 14 авг.
- Последнее чтение
- 23:30
- Постов за неделю
- 2
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 14 авг.
- 1/24сутки в ленте
- 21
- 1/48двое суток
- 24
- 1/72трое суток
- 25
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
видео или голосовое, без подписи
Типовые косяки агентов (август 2026) У меня есть сложный проект, в котором 99% кода написано AI (код уровня подсистем ядра Linux и секурити: eBPF LSM, TPROXY, fanotify). На нём отлично видно, как кодинговые агенты лажают. Наиболее типичные ошибки, которые я замечаю: - Автоматические тесты через агента тестируют не реальные сценарии. Например, у юзера стартует один сервис, а в плейбуке в момент тестирования создается другой сервис. После чего, какие-то сценарии начинают валиться с ошибками и агент маркирует это как "Critical", заводит задачу "на серьезных щах" и даже порывается пофиксить. - Агенты переусложняют реализацию. Если дать им полную свободу продуктового мышления, то они навертят кучу сложностей, которые вообще не нужны (или не нужны в ближайшие пару лет точно) - Агенты всегда находят ошибки в ревью кода. То есть можно запускать на сложной кодовой базе ревьюер, потом фиксить его находки, запускать ещё раз, фиксить... и каждый раз получать новую порцию "проблем". После ревью агент обычно ещё делает триаж найденных задач, и часть из них становится Critical/Major ошибочно. Потому что если разбираться в продукте и его архитектуре, там из 23 найденных проблем, ну, может, три Major, остальные — можно смело засунуть в бэклог и никогда до них не дойти. - Сложные планы агенты реализуют неэффективно. Ну то есть человек смотрит на объем работ из плана и начинает отмечать кластеры работы, группировать изменения, делать сначала code complete, точечно проверять в реальных сценариях на реальных сервера, а потом уже тестить всё полными e2e. Агент (без специальных инструкций) послушно выполняет план и постоянно сползает в сторону "после каждого изменения запустить тесты". Сначала я думал, что проблема в моём харнессе вокруг проекта, но потом у меня появилось ещё три других проекта, где всё было совсем по-другому, а проблемы те же. Противоядие от этих проблем есть. Нужно понимать проект (как с технической, так и с продуктовой стороны). И иногда проваливаться очень глубоко в реализацию (когда начинается очевидный булщит вместо фикса кода). Это раздражает, но пока по-другому никак. Если что, у меня gpt-5.6-sol xhigh и Fable 5 xhigh. Другие модели работают ещё хуже (отдельная подстава с Opus 5 на который иногда делает авто-фолбэк Fable 5). — Если у вас нет таких проблем, скорее всего проект не сильно сложный. Ну или вы — чертов гений! Хочу с вами познакомиться, чтобы вы меня научили.
Сейчас нахожусь на стадии, когда пытаюсь соблюсти баланс между скоростью и ошибками. Начал планировать на самых мощных моделях в несколько проходов, каждый раз прося подобрать модель для следующего прохода и для реализации. Скорость увеличил - у меня год строчит соннет медиум. Но, зараза, весь этот SDD (спек драйвен) начал выедать токены как медведь малину
С ИИ тоже работает "пока объяснял - сам все понял" Если я чего-то не понял, или недопонял в плане, который предоставил ИИ, я занудно прошу пояснить с едкими комментариями: – А сейчас клюёт? – А как клюёт? – А почему клюёт? – А кто клюёт? В ряде случаев ИИ вдруг отвечает: "А чего-то лажу я гоню, давай по другому"
Прошу fable5/xhight сделать дизайн и спланировать простую задачу — выявить, что в удалённом и в локальном git репозитории тег стоит на данных, которые идентичны друг другу. Задача как часть уже написанного с использованием go-git, коммитами, пушами и так далее. Прошу сделать простой эффективный дизайн. Запустить несколько субагентов, которые с разных углов посмотрят на эту задачу и выдадут простейшее достаточное решение. Сожрав 50 зелёных президентов fable мне строит go-код с тестами, который делает локальные рабочие копии из обоих репозиториев и целую библиотеку рекурсивного обхода и сравнения. У меня конечно правило про использование сторонних библиотек осторожное. Но не до такой же степени Ещё ситуация. fable5/xhight . В CLAUDE.md стоит правило, что записанное в CR'ку поле является достаточным для проверки такого-то состояния. Прошу в каком-то месте "и проверить состояние". Библиотека на пять файлов с пограничными случаями и обработкой ошибок. НО ПОЧЕМУ? "А, я решил, что это не важное правило", — отвечает мне клод код gpt 5.6 sol гонит 115 фазу декомпиляции с одной и той же ошибкой "ой, а этот bool оказывается int32, потому что берётся их EAX", при том, что я на второй фазе попросил его записать это в правила Я боюсь кода, который пишется итерационными схождениями без ревью мясных
Месяц назад перешёл на русский язык в ИИ 🔻 Отступление • Я в гробу видел русскую культуру и не знаю что это • Я в гробу видел русский язык, довольно ужасный • Я понимаю всю боль колоний на тему русского языка • Мне вообще всё равно, что с ним будет • Я вообще…
Месяц назад перешёл на русский язык в ИИ 🔻 Отступление • Я в гробу видел русскую культуру и не знаю что это • Я в гробу видел русский язык, довольно ужасный • Я понимаю всю боль колоний на тему русского языка • Мне вообще всё равно, что с ним будет • Я вообще за общеземной один язык ☕️ Однако Это язык на котором я думаю. Можно сколько угодно говорить про "учи английский" (и это правильно), но думаю я всё равно на русском и вероятно так всегда и будет. Скорость мысли в разы, в десятки раз больше, чем на любом неродном. С переводом я теряю контекст, так же не вижу контекста в ответах. Приходится платить за это токенами. Приходится иногда отваживать его от хабра и мейл ру. Но это несравнимая цена за мощь. И да, я переобулся. До этого времени я долгое время был адептом "с ИИ всё на английском". Но, оказалось, что время и контекст — деньги. 🖖 А ещё, ИИ не переводит. Интересная тема — на каком языке он мыслит? 🇬🇧 Учите английский. На ИИ надейся, а сам не плошай
Россия вошла в состав учредителей Всемирной организации по сотрудничеству в области искусственного интеллекта (WAICO). Инициатором создания организации выступил Китай, но Россию можно по праву считать её ключевым участником: идея была публично поддержана Владимиром Путиным в феврале этого года, после чего в западных источниках её стали называть не иначе как российско-китайским проектом. Показателен и состав подписантов: в списке из 29 стран-учредителей отчетливо угадываются контуры БРИКС. Основными целями нового альянса заявлены снижение цифрового неравенства, продвижение безопасных, этичных и доверенных ИИ-решений, совместные исследования и появление единых технических стандартов. Мы становимся свидетелями формирования параллельной архитектуры глобального управления ИИ, которая будет противопоставлена западным форматам. Очевидно, что главная задача – не допустить ситуации, когда искусственный интеллект становится инструментом неоколониальной политики. Еще два года назад, перед саммитом БРИКС в Казани я предсказывал такой поворот событий и очень рад, что этот путь не просто получил развитие, но оказался магистральным направлением межгосударственного сотрудничества, построенным на принципах равенства, справедливости и взаимоуважения. 🇷🇺 Этот пост вышел в МАКС час назад
Новости из параллельной вселенной. Ключевой участник. Бакалейщик и кардинал! Мы спасем тебя, Франция!!!
А да. Fable 5 мне позавчера в панамку накидал. А потом два дня я ему. Не, без него я вообще бы нихера не сделал. Но прямо рановато ещё всё отдавать. Они все хороши находят детали и начинают в них закапываться. Не могут удержать почему-то базовую архитектуру в голове. Выдумывают кривые кейсы и защищаются рабочими, но сложными решениями
GPT-5.6 Sol на солюшн дизайне только что напихал в панамку claude fable 5. Забавно
Как ни странно, это работает лучше попытки создать портрет агента самому. Это стилистичнские правки документации
А вас выжимает AI? Смотрю на заканчивающийся личный fable и ничего не делаю. Хотя идей пруд пруди. Подвыгорел за прошлый раунд
🤖 Не совсем по теме. Сегодня Госдума РФ в третьем чтении приняла закон о сувенирном ИИ: https://sozd.duma.gov.ru/bill/1271570-8 А кто-нибудь ревью сделал? Я видел Горелкина. Кто-нибудь другой, чуть более в теме
🪨 JetBrains протестировали скилл Caveman: обещанные 65% экономии токенов превратились в 8.5% Caveman — скилл для агентов вроде Claude Code, который переводит текстовые ответы в рубленый «пещерный» стиль без служебных слов. Код и вызовы инструментов не трогает. Целых 85к звёзд на GitHub! Тест прогнали на бенчмарке SkillsBench, 86 из 87 задач, Claude Sonnet 5 с низким reasoning effort. Сравнивали одни и те же задачи без скилла и с принудительно включённым. Результат по 82 парным задачам: 1. Экономия output-токенов: 8.5% (592k против 542k), далеко от обещанных 65%. Авторы считали экономию на чатовой прозе, а в агентной работе основную массу токенов занимают код, диффы и тексты ошибок, которые скилл не сжимает. 2. Качество не пострадало: средний скор 0.326 против 0.311, статистически неразличимо (p = 0.82). 3. Экономия $ отсутствует. По логике 8.5% экономии токенов должны были дать скидку около 10% по деньгам. Но один вырожденный случай всё нивелировал: одна задача перешла порог в 200k токенов контекста и попала под дорогой тариф API, её цена выросла с $0.33 до $8.29. Из-за этого прогон со скиллом вышел на 11.6% дороже ($40.60 против $36.39). Со скиллом или без, результат по сути один и тот же, что по деньгам, что по качеству. Разве что читать ответы веселее) @ai_for_devs
Взял Fable 5 и говорю ему — делай мне harness для проекта. Ох гладко стелит. А потом говорю ему — портируй его под codex... Я руками мы лучше и быстрее сделал. Какие-то фантазии, детские ошибки, никак было не вытолкать с какого-то мифического конфига ролей. Некрасиво конечно так делать, фу
Кажется у меня появились кейсы использования локальных ллм. Эксплореры, валидаторы, всякая бюрократия
А еще – агентская разработка дико жрет. Я понимаю почему. И делает она лучше. Но медленная и много кушать P.S. У меня Claude Enterprise
А еще – агентская разработка дико жрет. Я понимаю почему. И делает она лучше. Но медленная и много кушать P.S. У меня Claude Enterprise