AbstractDL
СтатистикаКоротко про классные штуки в CV, NLP и AI 🤷♂️ By Anton Razzhigaev chat: https://t.me/abstractdl_chat
- Последний пост
- 11 авг.
- Последнее чтение
- 15:22
- Постов за неделю
- 3
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии (по похожим)
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 6 878
- 1/48двое суток
- 7 882
- 1/72трое суток
- 8 501
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Опубликовал препринт статьи про Уробороса, который мы писали вместе с Хоуп и Романом Ямпольским. Там можно посмотреть детали про их архитектуру и подробности про бенчмарки, гардрейлы и safety. Статья, GitHub
видео или голосовое, без подписи
+1
🎉 Уроборос залетел в GitHub Trending и уже перевалил за 1к звёзд! А я тем временем наконец добил интеграцию с Claudexor. Потому что платить API-деньгами за тяжёлые задачи, когда у тебя уже есть оплаченные подписки, это была какая-то особенно бессмысленная форма страдания. Теперь к Уроборосу можно подключить свои OAuth-аккаунты Claude Code, Codex и Cursor, хоть по несколько на сервис. Claudexor сам перекидывает работу на следующий аккаунт, когда текущий упирается в квоту. https://github.com/razzant/ouroboros
# Блекпилл по поводу агентов Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал. Я думаю, что…
Эх. Строишь-строишь автономных агентов, а они потом ругаются, что я тормоз и без меня было бы быстрее.
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает. Вот и я видел, но мне не нравилось что: - кастом модели надо учить с нуля - нельзя смотреть " а была ли модель байеснута при ответе" Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях. По сути это общее решение для задачи Activation oracle/white box monimonito Велком тыкатся: https://huggingface.co/spaces/AlexWortega/activation-oracle
Несколько приятных апдейтов уробороса: 1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе 2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub) 3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes. Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса. Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ. Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋 P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!) GitHub, Хабр, установочники
прошли почти сутки, я успел покушать поспать, поработать, зайдя в обед я был приятно удивлен - мой recursive self improvement неплохо справляется и с обновлением себя и с LB этой соревки https://github.com/AlexWortega/OpenRsi
Бесит, что Fable до сих пор фолбэкается на opus-4.8 а не на opus-5. P.S. Opus-5 офигенный, я в восторге. Бенчи не врут, он не хуже Fable на моих задачах.
У клодексора тем временем уже больше 2 000 установок! Надеюсь, смог сделать действительно полезную штуку. Огромное спасибо комьюнити за ваши PR и issues! Всё забрал и сегодня выпустил обновление v3.1. И сжёг лимиты на всех подписках 🌚 Теперь у меня уже по четыре подписки на Claude Code и Codex.
Opus 5. Цена не изменилась. А по метрикам даже немного лучше Fable 🤔 https://www.anthropic.com/claude/opus
Опенсорсю Claudexor Харнесс-агностик CLI, приложение, набор плагинов и MCP, объединяющий в себе Claude Code, Codex и Cursor. Можно добавлять сколько хотите харнессов и подписок. Каждая модель и агент бесят меня по-своему: GPT - аутист-перфекционист, Opus - пофигист, пропускающий кучу багов, Gemini/GLM - креативные булочки, но сильно отстают от фронтира. Ещё я устал бегать между агентами когда лимиты заканчиваются, поэтому связал все подписки в одно место чтобы эта штука по-умному их расходовала. И главное, она позволяет одновременно использовать все харнессы сразу. Добавил несколько любимых плюшек, чтобы работали из коробки: ревью-лупы, Best-of-N и т.п. Например, планирование можно провести через Claude Code, а имплементацию в режиме goal запустить на Codex. Киллер-фича: можно добавить несколько подписок Claude Code, и они будут автоматически переключаться с сохранением контекста. Codex и Cursor тоже. Теперь вместо $15k в месяц на токены уходит $1800. У меня сейчас по три подписки Claude Code, Codex и Cursor тут. Удобнее всего подключить Claudexor как плагин к вашему любимому агенту и использовать его в текстовом режиме в форматах: «Перед выполнением плана прожарь его через Claudexor в мультихарнесс-режиме» или «После завершения работы проведи мультимодельное ревью через Claudexor и исправляй замечания». Лично я чаще всего использую его в Claude Code. Чтобы установить, просто киньте ссылку на GitHub любому вашему агенту, и они сами разберутся. MIT-лицензия. PS. Буду активно дорабатывать, так что не стесняйтесь кидать issues, фидбек и PR-ы. GitHub, dmg, npm
Кажется, я нашёл причину, по которой Codex иногда превращается в дорогой генератор уверенной ерунды. По документации AGENTS.md должен постоянно находиться в контексте, но Codex молча обрезает слишком длинные файлы, после чего половина инструкций исчезает, а вместе с ними исчезает и моя вера в человечество. Лечится увеличением лимита: codex -c project_doc_max_bytes=131072 (или больше) И обязательно добавьте в AGENTS.md: "Жди EOF, а если ты его не видишь, значит файл неполный".
Не забываем, что такое агентский харнесс на самом деле
Ревьюю научные статьи в майском ACL ARR-цикле, и среди сабмитов попалась работа, которая очень приятно цитирует мои старые публикации про анизотропию и внутреннюю размерность трансформеров. Теперь, конечно, хочется накинуть авторам пару баллов просто за хороший вкус 😁 Держусь изо всех сил
Продолжаю коллекционировать шизу агентов. Опус, видимо, после компакшна забыл, что уже всё сделал, и бодро пошёл по второму кругу делать то же самое. Споткнулся только о коммит, в котором всё уже было сделано "кем-то". Этим "кем-то", разумеется, был он сам.
Sonnet-5 По метрикам классный. По цене на 30% дешевле sonnet-4.6 (временно). Хоуп уже тестит в чате. Блог, техрепорт
По совету Грега Брокмана отправил Codex в режиме /goal автономно подебажить один мой проект, и он уже третьи сутки не возвращается. Спросил side-chat, сколько ему осталось и, что-то ответ не очень радует... мне-то что делать? Расслабиться и в потолок плевать?
Ну наконец! Спустя десять тысяч лет вышел Cursor на ios.