AI.Insaf
СтатистикаЛичный канал Инсафа Ашрапова Исполнительный директор по исследованию данных в банке (aka Lead DS) — @insafq Здесь про AI, менеджмент, личные истории и многое другое
- Последний пост
- 12 авг.
- Последнее чтение
- 10:16
- Постов за неделю
- 1
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 185
- 1/48двое суток
- 212
- 1/72трое суток
- 228
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
Новая библиотека SIRIN для оценки и мониторинга contextual hallucinations в RAG и memory-based LLM системах (статья arxiv + github ) Идейно внутри три инструмента: - probing по hidden states - легкий классификатор по hidden states генератора но нужно немного разметки - LLM-as-a-judge. Есть response-level и span-level варианты, где модель пытается локализовать конкретные галлюцинированные фрагменты. - uncertainty (entropy, perplexity, semantic uncertainty) - разные технические метрики как baseline, но обычно хуже чем LLM-as-a-judge И два гейта: 1) до ответа: хватает ли контекста (Answerability gate) 2) после ответа: не наврал ли относительно контекста (Faithfulness gate) - С учетом всего этого можно считать разные метрики качества. Еще у ребят неплохо получилось улучшить метрики на на memory-агенте повесив два гейта, и при непрохождения заставляя еще раз идти думать (метрики точности с 62.4% до 79.3%) - Кастомный judge под задачу часто нужен все равно, но решение хороший baseline
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes. Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса. Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ. Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋 P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!) GitHub, Хабр, установочники
Все еще сидите на codex и claude code. А как насчет уробороса 🤌🏻 ps человек отдал 50к $ чтобы прогнать все бенчи
Придумали еще скилл, который создает скилл по книгам (Book-to-Skill - 10k ⭐️). По сути, зумеры заново изобрели оглавление. Собрал такой скилл по книге "Братья Карамазовы" и спросил: что будет с AI? Ответ со смыслом: Не к сознанию, как у Ивана, и не к святости, как у Алёши, а к институту опеки с лицом чуда. Пока свобода не станет дороже комфорта и явным выбором - если главный KPI — снятие тревоги и принятие решений за человека → Великий инквизитор; - если KPI — усиление свободы и ответственности конкретного человека → старец в миру. Но если книгу не читал, то ответ вызывает еще больше вопросов. А если читал - то зачем вообще нужен этот скилл? Заставляет задуматься
Harness evaluation - deepeval Кто-то, возможно, начинает разработку harness решений и скиллов для них. Стало интересно, какие инструменты можно использовать для тестирования качества. Если для RAG многие использовали Ragas, то для LLM и агентов активно применяются решения для трейсинга, например Langfuse и Phoenix. Однако они больше про observability, хотя на их основе также можно прогонять выборки и анализировать качество. Но нужно что-то для harness и такое есть, DeepEval, спойлер с ним можно и все выше. Но так или иначе все сводится к одному: прогнать набор тестовых сценариев, сравнить результат с эталоном или заданными критериями, проверить качество контекста и оценить корректность вызовов тулов PS в итоге наверняка что-то кастомное 😅
Прикольно, что Cloudflare позволяет без регистрации за пару секунд поднять статический сайт - просто перекинув ZIP-архив. А если зарегистрироваться, то уже можно бесплатно хостить небольшие проекты. Да, собственного домена не будет, но возможность управлять всем через API - мое уважение. Вот сделал инглишь реплику канала (но надо покупать доменное имя иначе сложности с dns) Upd еще подсказывают что можно использовать для хостинга телеграмм ботов
видео или голосовое, без подписи
UPD: Когда под анонсом в канале Яндекса я поделился своими изысканиями, мне прислали ссылку на открытый бенчмарк TabArena (см 2я картинка). Выводы там в целом аналогичны моим: метрики LightGBM статистически значимо не отличаются от TabM. Но, к удивлению,…
Потестировал новый PageAgent от Alibaba Это open-source браузерный AI-агент, который умеет самостоятельно работать с сайтами: понимать интерфейс, двигать курсор, кликать по элементам, вводить текст и выполнять многошаговые сценарии. Для быстрого старта разработчики уже предоставляют доступ к Qwen, так что ключик к api не нужен Запускается очень просто, но если использовать версию по ссылке, то PageAgent.js рассчитан только на текущую страницу (SPA - Single Page Application). Для переходов между страницами нужен Chrome Extension, и лучше сразу использовать его, иначе при навигации теряется JS-контекст и агент забывает состояние. Работает неплохо: мышкой двигает, тексты пишет. Ради эксперимента попросил выбрать кондиционер на Яндекс.Маркете. Самое забавное - он выбрал ровно ту же модель, что рекомендует AI Алиса в Маркете (хотя на это ушло заметно больше времени, и сам я в итоге выбрал другую модель). В целом интересная история для автоматизации через браузер, особенно если нет нативных интеграций с нужным сервисом или готовых инструментов (tools). Но это долго и дорого и нужна API к LLM
AI-кофе с робо рукой: Чита - Москва 1:0 по внедрению ИИ 😎
Corporate Bullshit Receptivity Scale (2026г) Статья исследует, почему часть людей воспринимает бессодержательные корпоративные формулировки (где много разных buzzwords) как значимые и умные, и предлагает инструмент для измерения этой склонности. Как итог более высокая восприимчивость к корпоративному bullshit связана с более низкими показателями аналитического мышления и когнитивной рефлексии. Все выводы конечно получены на основе корреляций, а впрочем 😁
*это только документацию прочитал
Я проиграл Волендеморту 🤩 В мае проходило соревнование от Avito "ML CUP 2026" по предсказанию наиболее релевантных объявлений, с которыми пользователь проконтактирует. Казалось бы, обычный рексис: за несколько вечеров выделил, построить несколько бейзлайнов.…
Я проиграл Волендеморту 🤩 В мае проходило соревнование от Avito "ML CUP 2026" по предсказанию наиболее релевантных объявлений, с которыми пользователь проконтактирует. Казалось бы, обычный рексис: за несколько вечеров выделил, построить несколько бейзлайнов. Честно, не погружался сильно в задачу и метрику, которая оказалась хитрее, чем я думал. Там щедро залили данных на 40 гб, я попробовал базовые ALS (а надо было covisit + bm25, даже тут, aka item-to-item), эвристики, двухбашенные подходы и ранжирующие модельки (спойлер: работало все примерно одинаково и сильно отставало от топов). Как рассказали победители, нужно было строить графовые (pixie и RP3Beta и упомянутые covisit) лидогенераторы, но да, ранжировать потом бустингом. Интересно, что полезно было для реранкера сделать поменьше кандидатов (с 10к до 5к). Про решения можно посмотреть тут PS Причем тут Волендеморт, а он был в топе и я его не смог обойти 🫡
NVIDIA DGX Spark vs Macbook NVIDIA DGX Spark не прошло и года можно купить на wildberries, обойдётся в 500к+, например, тут (и его действительно привозят). Звучит неплохо, с учетом того, что там 128 ГБ объединенной памяти (unified memory), архитектура Blackwell и возможность запускать модели до 200B параметров локально. Но за аналогичную стоимость можно взять MacBook Pro M4 Max (например, здесь), и памяти там будет столько же. Забавно только, что у Макбука скорость памяти в 2 раза выше (546 ГБ/с против 273 ГБ/с у NVIDIA) и по бенчам скорость тоже будет больше. Более того даже TDP у мака в два раза лучше (120W против 240W) 😁
Интересный проект для вайбкодинга https://freebuff.com/ с бесплатными лимитами и без ограничений по токенам, действительно работает. На деле - 5 сессий по часу каждый день. Доступны DeepSeek и MiniMax. Сам сервис говорит, что внутри ваш код не читает, но, как видно на скрине, живет за счет рекламы. Звучит интересно, но часовые сессии обрываются, и для чего-то долгого (например, обучения) им не воспользуешься. Установка: npm install -g freebuff Запуск: freebuff Доступные модели (неплохие, но вы будете помогать их обучать): - DeepSeek V4 Pro: smartest. Its API collects data for training. - Kimi K2.6: balanced. - DeepSeek V4 Flash: most efficient. Its API also collects data for training. - MiniMax M2.7: fastest. PS Написал письмо разработку с вопросом: Is it spyware or a trojan?
Займись ничем 😐: система долгосрочной продуктивности Достойная книга про пользу прокрастинации. Внутри: • Метаисследования когнитивной нагрузки: Автор ссылается на разные исследования, которые показывают: что непрерывный фокус перегружает префронтальную кору • Активация Default Mode Network (DMN): Если не думаешь над чем-то активно, мозг переключается в пассивный режим. В этом состоянии обработка накопленных данных и структурирование опыта идут интенсивнее, чем в активной фазе, - легче поймать инсайты. Немного противоречит п. 1, но ок
Интересное исследование от Стэнфорда Найм сейчас проседает в первую очередь за счет джунов (entry-level позиций). Причем сильнее всего досталось разработке и клиентской поддержке, так как они проще всего поддаются автоматизации (похожие домены получаются 😁)
AI как coding agents, переписать письмо или помочь сделать аналитику или проверить какие то факты. А как насчет создания реальной добавленной стоимости 😅? Последнее время использую chatgpt для готовки, начиная с 5й версии уже хорошо работает с граммовками и специями. Классно получился кимчи, или как додуматься пожарить редис и сделать radis sauté au beurre 👩🍳