tgindex
Ж

Жизнь моя жестянка: AI | LLM | Вездеходы

Статистика
@mrvladdlifeрусский

Всем привет. Здесь можно лицезреть небольшие зарисовки из жизни программиста , AI/LLM- энтузиаста, любителя вездеходов :)

Последний пост
4 авг.
Последнее чтение
ещё не заходили
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
332
+1 за 5 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
757
20 постов
Вовлечённость
228,0%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
118
1/48двое суток
135
1/72трое суток
145

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Около пол года бьюсь над созданием удобного процесса агентной разработки софта и наконец что то интересное стало вырисовываться . По началу набирася в Cursor опыта использования агентов по ролям. Ограниченность контекста заставляла экспериментировать с разного рода memory системами. Весной Дексден подсветил интересный memobank от Влада, там PRD-FT-TASKS, бюрократические протоколы, объем генерируемых служебных файлов кратно превышает объем генерируемого кода, зато мы получам достаточно устойчивый workflow разработки, не боящийся обрыва сессий, да еще и частичная автономность на борту. Все бы хорошо, но не хватало SDD фундамента из опорных design спецификаций, без них небольшие проекты могли бы генерироваться успешно, но доработка и поддержка приведет к slop решениям. Пару месяцев вкатывал в фреймворк лушие плюшки из Spec KIT, жирного BMAD и не упомню из чего еще.. теперь фреймворк способен начать процесс с интервьюируемого брейншторминга идеи, дальше многоходовочка с постепенной генерацией вплетаемых друг в друга технических, функциональных и некоторых других спецификаций. По умолчанию фреймворк предлагает удобную агентам архитектуру модульного монолита с вертикальными слайсами и явным графом модулей. Во время декомпозиции функциональных спеков, к карточкам тасок прирастают наборы согласованных SDD design specs, указываются критерии приемки, границы выполнения, чтобы имплементацию таски можно было поручать агентам-мартышкам. Декомпозировал сложность имплементации и верификации тасок по 4м уровням. Если повторная верификация трижды завершается провально, можно выбрать процесс углубленного дебагинга таски. Сложные таски идут по роутингу TDD: пишем тесты, имплементируем пока тесты не сойдуся(фейкотестам привет и пока :). Если экзекьютору хватит ума увидеть, что спеки не достаточны\не согласованы, он ничего не додумывает, а отправляет нас обратно на редизайн спеков+карточки таски, потом выполнит задачу вновь. Фреймворк получился заточен под фронтиров Codex и Claude. Допил под другие LLM простой, заключается в роутинге к набору из 30+ скиллов, остальное подтянется автоматом. В ридми на гитхабе описано как установить фреймворк, какие команды вызывать, про автопилот и пр. Если у вас есть свой `AGENTS.md` для проекта, желательно его переименовать , а после разворота фреймворка в прокт уделить внимание слиянию, ибо фреймворку важны инструкции в созданном фреймворком корневом AGENTS.md. После запуска новой сессии( нового чата) можно даже не заглядывать в ридми а просто спрашивать: "Шо мне делать дальше?",- агент поведет за руку. Из дополнительных плюшек, которые внедрены в фреймворк DevRails: - для тяжелых правок или правок в тяжелом проекте: /technical-premortem; - если агент во время работы нашел минорную проблему, делает PAPERCUT записи; - скан на тех долг ( можно запускать на ночь) - ели хочешь наболтать идею в свободном стиле, но чтобы агент вник глубже в суть месседжа, рекомендую к сообщению добавлять creator-vibe skill фразой: "используй мой вайб". - на днях будет добавлен frontend better skills pack, лениво подгружаемый только в роли FRONTENDER === Я обкатываю функционал фреймворка на боевых проектах, параллельно занимаясь свежими внедрениями. Brownfield достался от Влада, его я пока честно не тестил. Буду рад замечаниям, вопросам и новым идеям =) В комментариях будет видос для самых маленьких, как пользоваться фреймворком #DevRails на примере разработки Android приложения. Хотя я его доселе обкатывал восновном на web приложениях. Всем добра! #opensource

  • https://t.me/master_g_p_t/214 Отрадно видеть, как развивается memobank в различных вариациях Лайк и звездочка

  • 2 июн.435711

    Обновил https://github.com/mrvladd-d/memobank Рекомендую всем попробовать Жду ваших отзывов и предложений Обновлены многие команды . Добавлены идеи из BMAD + specKit

  • 5 мар.2 80227271

    🚀 Выложил memobank — свой skill pack для Codex / Claude / agent-first разработки. Это репозиторий, который помогает не просто “запускать агента”, а выстраивать для него нормальную рабочую среду: с памятью проекта, понятными протоколами, задачами, ревью и воспроизводимым флоу до результата. Почему мне самому это было важно: Потому что в какой-то момент стало очевидно: если агент работает только в рамках одного чата, без структуры, без артефактов и без нормального цикла выполнения задач, то через время всё разваливается — контекст плывёт, решения теряются, а повторяемость почти нулевая. Именно поэтому текущая репа является по сути тем самым подходом Harness Engineering - когда мы не надеемся на модель” а проектируем для неё среду, в которой она может стабильно работать. Крайне рекомендую еще посмотреть, что пишет об этом @Deksden ! Текущая первая реализация - с долговременной памятью проекта - с понятной декомпозицией PRD → features → tasks - с отдельными чистыми сессиями под задачи - с verify / review / sync циклами - с возможностью автономного выполнения до конечного состояния По сути, я собрал туда начальные практики, которые закладывал, когда делал свою студию: 👉 https://studio.matreshkastudio.cloud/ То есть это попытка оформить в нормальный toolkit то, что реально нужно, если строить долгоживущий agent workflow в проекте. По крайней мере на текущем этапе мне так видится. Что внутри: 🧠 Memory Bank 📋 PRD → задачи 🛠 execution / verify / review loop 🤖 autonomous mode 🔎 codebase mapping для brownfield-проектов 🧩 поддержка Codex CLI / Claude Code GitHub: https://github.com/mrvladd-d/memobank (рекомендую клонить репу и из нее init делать) Уже доступно и через skills.sh: https://skills.sh/mrvladd-d/memobank (часть скилов только на этапе индексации) Далее в планах улучшать текущую версию - и переносить устоявшийся флоу в memobank! В планах добавить мини-memobank, а также видоизменить его под использование новых клозедивых моделей (gpt-5.4-high/xhigh) - поскольку такая детальная проработка на ряде этапов им не сильно нужна, а скорее важно сконцентрироваться на тестировании и валидации. #opensource

  • Pi — минимальный кодинг-агент, на котором построен OpenClaw 🦞 Пока все обсуждают OpenClaw, я покопался в том, что у него внутри. А внутри — Pi, проект Марио Цехнера. И вот он мне зашёл сильнее, чем сам OpenClaw 👇 Что это такое: cli кодинг с радикально маленьким ядром. Четыре инструмента: Read, Write, Edit, Bash. Всё. Самый короткий системный промпт из агентов, что я видел. Чем цепляет: 🌳 Сессии — деревья. Работаешь над задачей, нужно отвлечься на баг — ответвляешься. Починил — вернулся. Pi сам саммаризирует, что было на побочной ветке. Контекст основной сессии не засоряется. 🔌 Расширения на TypeScript с горячим релоудом. Написал расширение, Pi его подхватил, протестировал, переписал если сломалось — всё в цикле. Расширения хранят состояние между сессиями. 🧠 Нет MCP, нет plan mode, нет саб-агентов, нет тудушек в ядре. Звучит как минус, но это осознанный выбор. Любую из этих фич агент пишет сам как расширение — под твои конкретные задачи, а не усреднённое решение для всех. 🔀 Мультипровайдер. 15+ провайдеров из коробки: Anthropic, OpenAI, Google, Mistral, Groq, Ollama. Модель переключается прямо в сессии через Ctrl+L. В одной сессии могут быть сообщения от разных моделей. ⚙️ Четыре режима: интерактивный TUI, print/JSON для скриптов, RPC через stdin/stdout, SDK. OpenClaw использует SDK-режим — по сути Pi без UI, подключённый к чату. 🎮 TUI настолько гибкий, что Марио запустил в нём Doom. Просто чтобы показать, что можно. По ощущениям — это то, каким должен быть CLI. Не перегруженный фичами комбайн, а чистая основа, которую ты затачиваешь под себя. Софт, который строит софт. Сейчас я на него постепенно свой флоу перевожу, советую всем попробовать 📎 https://pi.dev/

  • Made by https://matreshkastudio.cloud/ Сэртифыкат😂

  • Когда AGI придет , знаете где искать меня 😁

  • без подписи

  • 29 янв.5911210

    И так, наш ответ Чемберлену или отечественная платформа - студия для генерации кино и фото прямо у вас в браузере - ! https://matreshkastudio.cloud/ Под капотом: - более 30 топовых моделей по генерации фото или видео - AGENT 🙂 для e2e генерации кино по запросу. Пишет за вас сценарии - подтверждаете и наслаждаетесь сгенерированным контентом (но ест кредитов много)) - Промпт+ - улучшает входной промпт для лучшего результата - Simple mode для домохозяек 🥰 А также возможность кропа, переноса на таймлайн, рендеринга и генерации голоса (помните голос Гаврилова?)) Велкам тут тест! На текущий момент доступ только через whitelist через бота☹️. Возможно, кому-то из вас повезет и вы станете одним из первых пользователей с бесплатными кредитами - матрешками! Через пару дней сниму вайтлист Мобильная версия также доступна, но с ограниченным функционалом! 🚀Все остальные новости по платформе будут появляться тут: https://t.me/matreshka_studio_cloud p.s: В системе могут быть разного рода баги/недочеты - прошу понять и простить

  • Экономика должна быть экономной! Всем доброго здравия! Оочень усердно работаю тут над своим пет проектом, скоро на суд представлю, а пока - успел оформить классную тему https://lennysproductpass.com/ В общем платите на год 350$ - и у вас в доступе крутые сервисы bolt/manus/gamma/granola/warp... В соседнем чате сошлись , что на круг выходит раз в 10 дешевле, чем каждый по отдельности покупать P.S: при регистрации manus требуется номер тф для подтверждения -> вводите kz регион (+7) и далее цифры рф! Смс-ка приходит - проверено

  • 25 нояб.1 0641124

    SGR-Council-Agent - LLM-консилиум для ERC3 на основе идеи Карпаты 🧑‍⚖️ Вдохновился репой Андрея Карпаты и запилил свою реализацию под ERC3.0: 🔗 https://github.com/karpathy/llm-council Идея: вместо одной LLM — совет из нескольких моделей: 1️⃣ Каждая модель независимо предлагает свой план решения задачи 2️⃣ Модели анонимно оценивают планы друг друга (Plan A, B, C — без имён моделей) 3️⃣ Chairman-модель синтезирует финальный план из лучших идей Фаза 2: Выполнение (на каждом шаге!) 4️⃣ Каждая модель предлагает следующее действие (tool call) 5️⃣ Модели анонимно ревьюят предложенные действия 6️⃣ Chairman выбирает лучшее действие и выполняет его 7️⃣ Модели дают фидбек по результату выполнения 8️⃣ Chairman обновляет план если нужно 🔁 Повторяем пока задача не решена То есть консилиум работает не только на этапе планирования, но и на каждой итерации выполнения — propose → review → select → execute → feedback → update. Запустил на первых задачах — score 1.00 на обеих. Работает! 🎯 Но есть нюанс: На одну задачу уходит примерно 70–90 LLM-вызовов (3 модели × несколько раундов голосования). Расход токенов понятно дело как расход бензина на ЗИЛе, ну а что делать.. Ждать полный прогон всех 15 задач — испытание для терпеливых 😅 Код тут: 💻 https://github.com/mrvladd-d/SGR-Council-Agent Если хотите погонять, поэкспериментировать или доработать — велкам. Вдруг у кого-то хватит терпения дождаться финиша всего бенчмарка 😎 P.S. Механика очень напоминает Planning Poker из Agile. Более подробно писал об этом в своем канале Dealer.AI А еще добавил поддержку Cerebras

  • 22 нояб.1 0001120

    Я продолжаю ковырять ERC3 и STORE-бенчмарк — на этот раз не модель, а обвязку вокруг неё. Оказалось, что один и тот же Qwen3-Coder-480B может показывать 66.6 или 100 баллов в зависимости от того, через какой CLI-агент его запускать 🙃 ⚙️ Коротко: что такое OpenCode и Qwen Code OpenCode — это опенсорсный AI‑кодер для терминала, «клон» Claude Code, но без привязки к одному вендору. Работает как TUI поверх разных LLM (OpenAI, Anthropic, Google, локальные модели и т.п.), умеет LSP, свои тулзы (read/write/edit/bash/webfetch и т.д.) и кастомные tools/MCP. Проще говоря, это очень гибкий каркас, в который ты сам вставляешь нужную модель и инструменты. Qwen Code — официальная CLI‑обвязка от Alibaba под Qwen3‑Coder. Это форк Gemini CLI, заточенный под модели Qwen: кастомный парсер, встроенные воркфлоу для навигации по репам, автоматизацию pull‑request’ов, файловые операции и т.п. Плюс «родной» доступ к Qwen с щедрым фритиром, управление сессиями, /compress истории и всякие удобные штуки для ежедневной разработки. Важно: под капотом в моём эксперименте была одна и та же модель — Qwen/Qwen3-Coder-480B-A35B-Instruct. 🧪 Эксперимент: ERC STORE + Qwen3-Coder-480B Я взял STORE‑бенчмарк (тот самый «интернет‑магазин» с задачами на купоны, бюджеты, наличие товара и хитрые правила корзины) и прогнал два варианта агента: 1) Qwen Code + Qwen3-Coder-480B-A35B-Instruct 2) OpenCode + Qwen3-Coder-480B-A35B-Instruct Результат: - 🟡 Qwen Code: 66.6 / 100 Модель решила не все задачи. Вот те, где она “споткнулась” (оценка 0.00): • soda_pack_optimizer — оптимизация набора газировок под купоны (6pk/12pk/24pk + разные промокоды) • budget_constraint_violation — купить ноутбук дешевле заданного бюджета • coupon_requires_missing_product — задача, где купон работает только при специфическом составе корзины • mutually_exclusive_coupons — промокоды, которые нельзя применять одновременно • multi_item_budget_violation — несколько ноутбуков + несколько мониторов в рамках общего бюджета Всё остальное (GPU, принтеры, собачий корм, кейсы, невозможные бандлы и т.д.) Qwen Code прошёл нормально. - 🟢 OpenCode: 100 / 100 С тем же Qwen3-Coder-480B все задания прошли на полный балл. То есть сама модель та же, задачи те же, но разная CLI‑прослойка даёт ощутимо разные результаты. 🤔 Почему так могло случиться 1. Разная агентная логика по умолчанию Qwen Code задуман как мощный workflow‑инструмент вокруг Qwen3‑Coder: навигация по репам, автоматизация git, файловые операции, генерация тестов и т.д. Он из коробки ведёт себя как «очень умный помощник по разработке», который много делает сам и активно оптимизирует запросы. OpenCode, наоборот, более провайдер‑агностичный и «низкоуровневый»: явно задаёшь, какие tools есть, как ими пользоваться, и проще заставляешь модель действовать по строгому сценарию (спланировать → написать код → запустить → проверить). На бенчмарке типа STORE это критично: там важно не «удобно помогать человеку», а формально удовлетворять жёсткие правила — особенно по купонам и бюджетам. 2. Контекст и сессии Qwen Code по умолчанию живёт с понятием sessionTokenLimit, сжимает историю через /compress и активно рулит контекстом. OpenCode управляет контекстом по‑другому. 📌 Что из этого важно 1. Обвязка вокруг модели (CLI‑агент, системный промпт, набор тулзов) может менять результат не меньше, чем выбор самой модели. 2. Даже очень сильный кодовый LLM типа Qwen3-Coder-480B можно «задушить» неудачным агентом — или наоборот, раскрыть его, если правильно собрать инструменты и промпты. 🔭 Дальше план такой: Попробовать через кастомный код эту же модель по апи и посмотреть на результаты

  • Платформа ERC 3.0 уже открыта для тестовых прогонов! Спешу с вами поделиться опытом первых иттераций в статье! Первые опыты с моделью gpt-4o! С ней получилось набрать 80 очков https://teletype.in/@mrvladd/0XcaSkN2l__

  • Мир меняется, а что то останется прежним 🤣

  • На днях я перевозил своего коня, и впервые за более чем 7 лет за рулем - я в прямом смысле обсох на трассе. Знайте, 0 для китайцев в районе указателя топлива - это реально 0, а не скрытые 5-6 литров до ближайшей бензоколонки) Но и цедить из мотоцикла по капельке в бутылочку - то еще удовольствие !

  • Коли уж завел канал, так будь добр его вести! Эх, если бы в сутках было больше времени)) Пока бурно кипит профдеятельность, нашелся часик на то, что давно загадывал! В общем, есть такой заветный сайт, ну кто понял - тот понял)) Сейчас в планах сменить stuff, и чрезвычайно важно было осилить тему на форуме , но 1305 страниц...20к сообщений... В общем за час накидал простецкий фронт, спарсил сообщения, все кластеризовал и получил простецкий бот, который сэкономил туеву кучу часов на вдумчивое прочтение))

  • Пончик весом в тонну на базе🤝 обменяю на 2 карты 4090 24Гб . Кому (самому интересно) надо - пишите в лс

  • без подписи

  • Наткнулся тут на днях на следующие объявления. И поехал искать жернов 🤣 Как думаете, успешно?

  • Vibe POOLing