tgindex
AI.Insaf
@ai_tabletрусский

Личный канал Инсафа Ашрапова Исполнительный директор по исследованию данных в банке (aka Lead DS) — @insafq Здесь про AI, менеджмент, личные истории и многое другое

Последний пост
12 авг.
Последнее чтение
10:16
Постов за неделю
1
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
1 177
−1 за 3 дн.
Сутки
−2
−0,17%
Неделя
 
Месяц
 
Просмотров на пост
694
20 постов
Вовлечённость
59,0%
к подписчикам
Постов в день
0,1
всего 20
Упоминаний
3
каналов
Охват размещения
оценка
1/24сутки в ленте
185
1/48двое суток
212
1/72трое суток
228

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • видео или голосовое, без подписи

  • 5 авг.5311611

    Новая библиотека SIRIN для оценки и мониторинга contextual hallucinations в RAG и memory-based LLM системах (статья arxiv + github ) Идейно внутри три инструмента: - probing по hidden states - легкий классификатор по hidden states генератора но нужно немного разметки - LLM-as-a-judge. Есть response-level и span-level варианты, где модель пытается локализовать конкретные галлюцинированные фрагменты. - uncertainty (entropy, perplexity, semantic uncertainty) - разные технические метрики как baseline, но обычно хуже чем LLM-as-a-judge И два гейта: 1) до ответа: хватает ли контекста (Answerability gate) 2) после ответа: не наврал ли относительно контекста (Faithfulness gate) - С учетом всего этого можно считать разные метрики качества. Еще у ребят неплохо получилось улучшить метрики на на memory-агенте повесив два гейта, и при непрохождения заставляя еще раз идти думать (метрики точности с 62.4% до 79.3%) - Кастомный judge под задачу часто нужен все равно, но решение хороший baseline

  • 31 июл.4421515из abstractDL

    Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes. Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса. Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ. Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋 P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!) GitHub, Хабр, установочники

  • Все еще сидите на codex и claude code. А как насчет уробороса 🤌🏻 ps человек отдал 50к $ чтобы прогнать все бенчи

  • Придумали еще скилл, который создает скилл по книгам (Book-to-Skill - 10k ⭐️). По сути, зумеры заново изобрели оглавление. Собрал такой скилл по книге "Братья Карамазовы" и спросил: что будет с AI? Ответ со смыслом: Не к сознанию, как у Ивана, и не к святости, как у Алёши, а к институту опеки с лицом чуда. Пока свобода не станет дороже комфорта и явным выбором - если главный KPI — снятие тревоги и принятие решений за человека → Великий инквизитор; - если KPI — усиление свободы и ответственности конкретного человека → старец в миру. Но если книгу не читал, то ответ вызывает еще больше вопросов. А если читал - то зачем вообще нужен этот скилл? Заставляет задуматься

  • 23 июл.7061313

    Harness evaluation - deepeval Кто-то, возможно, начинает разработку harness решений и скиллов для них. Стало интересно, какие инструменты можно использовать для тестирования качества. Если для RAG многие использовали Ragas, то для LLM и агентов активно применяются решения для трейсинга, например Langfuse и Phoenix. Однако они больше про observability, хотя на их основе также можно прогонять выборки и анализировать качество. Но нужно что-то для harness и такое есть, DeepEval, спойлер с ним можно и все выше. Но так или иначе все сводится к одному: прогнать набор тестовых сценариев, сравнить результат с эталоном или заданными критериями, проверить качество контекста и оценить корректность вызовов тулов PS в итоге наверняка что-то кастомное 😅

  • Прикольно, что Cloudflare позволяет без регистрации за пару секунд поднять статический сайт - просто перекинув ZIP-архив. А если зарегистрироваться, то уже можно бесплатно хостить небольшие проекты. Да, собственного домена не будет, но возможность управлять всем через API - мое уважение. Вот сделал инглишь реплику канала (но надо покупать доменное имя иначе сложности с dns) Upd еще подсказывают что можно использовать для хостинга телеграмм ботов

  • видео или голосовое, без подписи

  • 15 июл.7131819

    UPD: Когда под анонсом в канале Яндекса я поделился своими изысканиями, мне прислали ссылку на открытый бенчмарк TabArena (см 2я картинка). Выводы там в целом аналогичны моим: метрики LightGBM статистически значимо не отличаются от TabM. Но, к удивлению,…

  • 14 июл.5561512

    Потестировал новый PageAgent от Alibaba Это open-source браузерный AI-агент, который умеет самостоятельно работать с сайтами: понимать интерфейс, двигать курсор, кликать по элементам, вводить текст и выполнять многошаговые сценарии. Для быстрого старта разработчики уже предоставляют доступ к Qwen, так что ключик к api не нужен Запускается очень просто, но если использовать версию по ссылке, то PageAgent.js рассчитан только на текущую страницу (SPA - Single Page Application). Для переходов между страницами нужен Chrome Extension, и лучше сразу использовать его, иначе при навигации теряется JS-контекст и агент забывает состояние. Работает неплохо: мышкой двигает, тексты пишет. Ради эксперимента попросил выбрать кондиционер на Яндекс.Маркете. Самое забавное - он выбрал ровно ту же модель, что рекомендует AI Алиса в Маркете (хотя на это ушло заметно больше времени, и сам я в итоге выбрал другую модель). В целом интересная история для автоматизации через браузер, особенно если нет нативных интеграций с нужным сервисом или готовых инструментов (tools). Но это долго и дорого и нужна API к LLM

  • 7 июл.584134

    AI-кофе с робо рукой: Чита - Москва 1:0 по внедрению ИИ 😎

  • 28 июн.7861812

    Corporate Bullshit Receptivity Scale (2026г) Статья исследует, почему часть людей воспринимает бессодержательные корпоративные формулировки (где много разных buzzwords) как значимые и умные, и предлагает инструмент для измерения этой склонности. Как итог более высокая восприимчивость к корпоративному bullshit связана с более низкими показателями аналитического мышления и когнитивной рефлексии. Все выводы конечно получены на основе корреляций, а впрочем 😁

  • 14 июн.1 2171412

    *это только документацию прочитал

  • Я проиграл Волендеморту 🤩 В мае проходило соревнование от Avito "ML CUP 2026" по предсказанию наиболее релевантных объявлений, с которыми пользователь проконтактирует. Казалось бы, обычный рексис: за несколько вечеров выделил, построить несколько бейзлайнов.…

  • Я проиграл Волендеморту 🤩 В мае проходило соревнование от Avito "ML CUP 2026" по предсказанию наиболее релевантных объявлений, с которыми пользователь проконтактирует. Казалось бы, обычный рексис: за несколько вечеров выделил, построить несколько бейзлайнов. Честно, не погружался сильно в задачу и метрику, которая оказалась хитрее, чем я думал. Там щедро залили данных на 40 гб, я попробовал базовые ALS (а надо было covisit + bm25, даже тут, aka item-to-item), эвристики, двухбашенные подходы и ранжирующие модельки (спойлер: работало все примерно одинаково и сильно отставало от топов). Как рассказали победители, нужно было строить графовые (pixie и RP3Beta и упомянутые covisit) лидогенераторы, но да, ранжировать потом бустингом. Интересно, что полезно было для реранкера сделать поменьше кандидатов (с 10к до 5к). Про решения можно посмотреть тут PS Причем тут Волендеморт, а он был в топе и я его не смог обойти 🫡

  • NVIDIA DGX Spark vs Macbook NVIDIA DGX Spark не прошло и года можно купить на wildberries, обойдётся в 500к+, например, тут (и его действительно привозят). Звучит неплохо, с учетом того, что там 128 ГБ объединенной памяти (unified memory), архитектура Blackwell и возможность запускать модели до 200B параметров локально. Но за аналогичную стоимость можно взять MacBook Pro M4 Max (например, здесь), и памяти там будет столько же. Забавно только, что у Макбука скорость памяти в 2 раза выше (546 ГБ/с против 273 ГБ/с у NVIDIA) и по бенчам скорость тоже будет больше. Более того даже TDP у мака в два раза лучше (120W против 240W) 😁

  • Интересный проект для вайбкодинга https://freebuff.com/ с бесплатными лимитами и без ограничений по токенам, действительно работает. На деле - 5 сессий по часу каждый день. Доступны DeepSeek и MiniMax. Сам сервис говорит, что внутри ваш код не читает, но, как видно на скрине, живет за счет рекламы. Звучит интересно, но часовые сессии обрываются, и для чего-то долгого (например, обучения) им не воспользуешься. Установка: npm install -g freebuff Запуск: freebuff Доступные модели (неплохие, но вы будете помогать их обучать): - DeepSeek V4 Pro: smartest. Its API collects data for training. - Kimi K2.6: balanced. - DeepSeek V4 Flash: most efficient. Its API also collects data for training. - MiniMax M2.7: fastest. PS Написал письмо разработку с вопросом: Is it spyware or a trojan?

  • 21 мая847138

    Займись ничем 😐: система долгосрочной продуктивности Достойная книга про пользу прокрастинации. Внутри: • Метаисследования когнитивной нагрузки: Автор ссылается на разные исследования, которые показывают: что непрерывный фокус перегружает префронтальную кору • Активация Default Mode Network (DMN): Если не думаешь над чем-то активно, мозг переключается в пассивный режим. В этом состоянии обработка накопленных данных и структурирование опыта идут интенсивнее, чем в активной фазе, - легче поймать инсайты. Немного противоречит п. 1, но ок

  • 18 мая809114

    Интересное исследование от Стэнфорда Найм сейчас проседает в первую очередь за счет джунов (entry-level позиций). Причем сильнее всего досталось разработке и клиентской поддержке, так как они проще всего поддаются автоматизации (похожие домены получаются 😁)

  • 14 мая808212

    AI как coding agents, переписать письмо или помочь сделать аналитику или проверить какие то факты. А как насчет создания реальной добавленной стоимости 😅? Последнее время использую chatgpt для готовки, начиная с 5й версии уже хорошо работает с граммовками и специями. Классно получился кимчи, или как додуматься пожарить редис и сделать radis sauté au beurre 👩‍🍳

AI.Insaf — tgindex