tgindex
commit history

commit history

Статистика
@c0mmitКарьерарусский

история моих коммитов про машинное обучение, карьеру и набитые шишки @ibragim_bad

Последний пост
28 июл.
Последнее чтение
09:16
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
Категория
Карьера
В каталоге с
12 авг.
Подписчики
4 287
+4 за 3 дн.
Сутки
+2
+0,05%
Неделя
 
Месяц
 
Просмотров на пост
8 466
20 постов
Вовлечённость
197,5%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
4
каналов
Охват размещения
оценка
1/24сутки в ленте
9 089
1/48двое суток
10 415
1/72трое суток
11 234

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 28 июл.10,2 тыс3961

    Вернувшись с ICML, с головой закопался в новый апдейт SWE-rebench и лидерборда! 🛠️ Этот релиз мы сделали масштабнее, он мультиязычный. Собрал 111 задач на 5 языках, сделал кучу прогонов и зарылся в траектории агентов, чтобы отловить, как именно модели читерят и обманывают эвалы. Всю более подробную аналитику собрал в большой блогпост. 📊 Статья с разбором: https://teletype.in/@ibragim_bad/swe-rebench-2026-07 🏆 Лидерборд: https://swe-rebench.com/

  • 4 июл.2 6166416

    Приехал в Сеул на ICML (одна из трех топ ai конференций) с SWE-rebench-v2, который прошёл сюда, так что буду со стенгазетой на постерной сессии ICML, а потом ещё на воркшопе про код. В этот раз у нас здесь большая команда и сразу две статьи на main track. Приходите, если вы тоже здесь, и пишите — сгоняем попить прохладительные напитки. Фотку приложу со своей прошлой поездки в Сеул, потому что новых пока не сделал.

  • 1 июл.2 5833824

    За последний месяц сделали несколько апдейтов SWE-rebench Leaderboard: https://swe-rebench.com/ > собрали новые задачи и прогнали кучу моделей на свежем срезе > обновили интерфейс, сделали его более понятным и красивым > добавили rebench в HarborHub: теперь бенчмарк можно запускать в Harbor Мы немного поменяли формат апдейтов: теперь делаем их не каждый месяц, а примерно раз в два месяца. Зато в каждом таком обновлении сразу прогоняем много моделей на пачке из примерно 100 свежих задач. Ещё один интересный момент: независимый исследователь прогнал наши задачи и задачи SWE-bench Pro на предмет качества. По его оценке, в нашем бенчмарке оказалось меньше задач с явными проблемами, чем в SWE-bench Pro. Это приятно, учитывая, что в последнем апдейте мы не смотрели задачи вручную: всё было собрано автоматически, тогда как в SWE-bench Pro было много ручной разметки. > SWE-rebench audit: 7 / 110 ≈ 6% unsolvable tasks > SWE-bench-PRO audit: 172 / 728 ≈ 24% unsolvable tasks Ещё я записал прямой эфир с ребятами про бенчмаркинг кодинговых агентов. @etechlead @ai_driven Очень классно поговорили о том, как всё устроено, какие есть проблемы в оценке моделей и как вообще стоит смотреть на такие бенчмарки. https://www.youtube.com/live/C0jDYsrBPuk

  • 17 июн.12,6 тыс63153

    В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада! имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей! видео доклада: https://youtu.be/wcUJWP6WpGM Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub: https://swe-rebench.com/ Если бы мне нужно было выделить главные выводы, я бы выбрал эти: > Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию. > Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов. > Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями. > Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения. P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)

  • 14 мая3 7205115

    Когда-то в университетские годы мы много организовывали мероприятия с минимальным бюджетом. Концерт студвесны на два часа: с костюмами, реквизитом и типографией — умудрялись собрать примерно за 12 тысяч рублей. Потом были ивенты побольше. На одном из награждений нужно было накормить 100+ человек, а бюджет был всё такой же минимальный. Тогда мы собрали волонтёров, которые помогли приготовить огромный казан плова — им в итоге всех и накормили. С тех пор прошло много времени, но любовь к офлайн-ивентам осталась. Особенно в новых городах: это всё ещё один из лучших способов развиртуализироваться, познакомиться с людьми и быстрее погрузиться в локальное комьюнити. И вот теперь мы в Nebius делаем такой ивент уже в нашем лондонском офисе на Holborn 21 мая. Nebius.Build/LON — прикладной ивент для AI-билдеров. Будут выступления от ребят из NVIDIA, JetBrains, Wayve, Tavily и Nebius, разговоры про ML-инфру, inference scaling, agentic systems, продукты, ресёрч и всё, что вы сейчас строите. Плова на сто человек не обещаю, но еда, напитки и нетворкинг будут. Если вы в Лондоне и вам близка AI / ML / infra / agents-тусовка — приходите, буду рад увидеться! Регистрация тут: https://nebius.com/events/nebius-build-london

  • 28 апр.4 3404449

    Буду в Казани, решил сделать небольшое выступление + встречу подписчиков. Поговорим про кодовых агентов. Сделал комфортный уровень для понимания, но при этом плотно по смыслу. Никакой сухой теории или пересказов чужих кейсов — сконцентрированный опыт по агентам и эвалам: как гоняем сами, как сравнивать модели итп. Будет полезно тем, кто уже ими пользуется и/или интересуется темой. Ещё добавил развлекательную часть: расскажу, как агенты «читерят», и поделюсь историями. Приходите, буду рад! Встречаемся в новом IT-парке 4 мая в 18:00 https://it-akademiya-3c.timepad.ru/event/3939782/

  • 15 апр.4 4378279

    Как я смонтировал видео с лекции прямо с телефона (и без ручного труда) Выложил видео с недавнего выступления на Innovation Guild. Посмотреть можно тут. Я никогда не занимался видеомонтажом и не хотел тратить на это время. Был запрос: уложиться в час-два максимум и получить адекватное качество. Более того, я хотел сделать это автоматически и автономно , так что я запустил агента и вышел из дома, потом уже просто с телефона апдейтнул таски (с телефона есть доступ к tmux на маке). Кажется, сейчас записать и свести любую лекцию можно вообще без продакшена и минимальным ручным трудом (чтобы по airdrop скинуть материалы, запустить codex / Claude code и потом загрузить видео на YouTube). 📱 Оборудование: Два Айфона и штатив. > Один айфон стоял на штативе и писал видео. > Второй айфон просто положили рядом и включил диктофон. Использовать звук с камеры — плохая идея, он получается глухим и далеким. > На руках была обычная PDF-ка со слайдами презентации. 🛠 Workflow Я закинул тяжелое видео с камеры (около 30 ГБ), аудио с диктофона и PDF-презентацию в одну папку. Дальше попросил кодекс наложить и синхронизировать аудио с диктофона на видео и добавить слайды. Вот что он сделал по моему промпту: 1. Сжал 30-гиговый исходник под YouTube на 2.5 ГБ. 2. Аудио и видео были разной длины. Скрипт сам порезал, синхронизировал дорожки и наложил звук с диктофона на видеоряд. 3. На видео слайды с проектора засвечены и плохо читаются. Попросил скрипт вытащить каждый слайд из PDF в виде картинки, порезать видео на кадры и вставить чистые слайды по 15 секунд поверх видеоряда там, где они переключаются. (Когда слайдов немного, можно вручную подправить таймстемпы чтобы лучше синхронизировать, но я был с телефона и было лень) 4. В кубере был под с GPU. Я просто попросил Codex сходить на этот под, поставить туда Whisper, перекинуть аудиофайл, прогнать транскрибацию и вернуть готовые субтитры. Он там еще сверху шлифанул текст, так как я вставляю английскую терминологию в русский. И сделал сообщение с таймстемпами для ютуба. 5. Когда пришел домой выбрал из обложек для видео которые он сделал, попросил сделать одну правку и загрузил на ютуб. Теперь все публичные выступления буду так записывать и обрабатывать.

  • 13 апр.2 964710

    видео или голосовое, без подписи

  • 13 апр.3 0883518

    Два доклада и как прошел AI Engineer: впечатления спикера Прошлая неделя выдалась плотной: я выступил с докладом про SWE-rebench Leaderboard два раза! Сначала заглянул на Innovation Guild. Хорошая аудитория, комфортная атмосфера. Получилось отлично пообщаться, классные вопросы — спасибо Айбулату за приглашение! Если вы в Лондоне, горячо рекомендую заглядывать к ним в офлайне. Про AI Engineer Europe. Это их первый ивент в Европе, и планку они задали высокую. В отличие от академических конференций, здесь выше концентрация более сенсорных практиков + удивило, что большая часть людей, с кем общался были не из Лондона а из СФ и около. Swyx ( один из оргов конфы), сказал, что для ребят из штатов – конфа – вариант, чтобы на деньги компании сгонят потусить в Лондон. Про спикеров: на кейноутах был Pragmatic Engineer, создатель OpenClaw и другие Еще мне повезло с соседями на ужине для спикеров, сидели рядом и общались с: > Matt Pocock (250k в x, 170k YouTube), первый человек не из СНГ, который знает про Казань), посоветовал сгонять на юго запад Англии и попробовать настолку quacks > Ryan Lopopolo из OpenAI, который написал вот эту статью про работу с агентами > Peter Gostev из llm-arena, создатель bullshit benchmark > Alex Volkov – ведет подкаст W&B, знал почти всех спикеров Отдельно рад был повидаться с ребятами: > Макс из tessl. Он уже написал свой фидбэк на конференцию, можете посмотреть > Боря из ElevenLabs. Он автор вирального проекта, где агенты общаются на своем языке . В этот раз они привезли настоящую английскую красную будку, где по телефону общаешься с моделью. Загляните к Боре в пост разбор как он это сделал, не зря его позвали в Антропик рассказать, как он взломал физический телефон Клод кодом. Также прикрепляю презентацию со своего выступления, а как только организаторы выложат видео — поделюсь ссылкой!

  • 24 мар.3 6323922

    Мои новости сразу пачкой: 1. Пару недель назад сходил попить кофе с Ross Taylor из gr.inc ($10M raised), кофаундером Papers with Code (кто-то помнит еще такое?) и лидом по ризонингу в Llama 2/3. Сегодня они запустили свою платформу для RL - OpenReward. По сути, это клей между разными датасетами задач для RL и бэкендами для обучения (как Tinker, например). Мы поддержали там SWE-rebench-V2 с первого дня. 2. Обновили SWE-rebench Leaderboard. Заняло чуть больше времени, но добавили много нового — смотрите инсайты: https://swe-rebench.com/?insight=feb_2026 еще пост в X бодро разошелся на 120к и привел пару интересных контактов. 3. Буду выступать на конфе AI Engineer в Лондоне 9 апреля. У ребят имхо лучшие видео с выступлениями по этой теме. На конфе я расскажу про SWE-rebench: как собираем таски, как гоняем агентов и т.п. Го увидимся, если кто-то тоже там будет (правда, билетов уже нет). Но! 4. 7-го апреля будет более расширенное выступление с этой же темой в InnovatorGuild. У ребят классное комьюнити в Лондоне, приходите послушать про SWE-rebench. Вход свободный, просто зарегистрируйтесь на ивент в Luma. Если будет запрос - можем сделать запись. Ближе к датам выступлений еще раз закину анонс.

  • 6 мар.4 4675448

    недавно записали подкаст с ребятами из JetBrains Research https://youtu.be/-G3e0qffIPE?is=MAmdpFNKXu3n16AB Подкаст свежий, это только второй выпуск (первый был с Анной Коган, ex-ceo OpenCV) поговорили про мой путь из стоматологии в рисерч, SWE-rebench, кодовых агентов, наши свежие релизы (SWE-rebench-V2 и contree)! Советую чекнуть профили ведущих! Игорь один из авторов известного курса по CV на степике, это был мой первый курс по CV в 2019, который я экспрессом прошел перед хакатоном. А у Ильи психологический бэкграунд + phd и сейчас он занимается human-AI experience

  • 3 мар.49,3 тыс107615

    Последние пару месяцев я плотно работал над этим релизом, и наконец-то мы выкатываем его в опенсорс! 📟 Встречайте SWE-rebench-V2: самый большой открытый, мультиязычный датасет для обучения кодовых агентов! Вместе с командой Nebius AI R&D мы построили пайплайн для масштабного сбора задач из реальных GitHub репозиториев и теперь делимся всем с комьюнити. На текущий момент это самый большой и разнообразный открытый датасет подобных задач в мире. Что внутри: > 32 000+ задач — на базе реальных issue + готовый Docker-образ. > 20 языков программирования. Некоторые языки (например, Lua или Clojure) вообще никогда раньше не были покрыты! > 120 000+ дополнительных задач, собранных на базе реальных PR. > Качество — задачи отфильтрованы и размечены с помощью ансамбля LLM. Также мы обогатили их метаданными и добавили интерфейсы, которые проверяются в тестах. Вместе с датасетом мы дропаем техрепорт со всеми деталями нашего пайплайна и прогонами моделей. 📄 Статья и датасет 👾 Наш Discord (мы там онлайн, залетайте с фидбеком и вопросами). ✉️ Пост в X Если есть любые мысли, идеи, предложения - приходите! 🔁 Буду благодарен за репост и пересылку!

  • 26 февр.15,9 тыс71384

    Мы тут в Nebius AI R&D выкатили новый тул для всех, кто работает с кодовыми агентами – ConTree 🌳 https://contree.dev/ Пока в альфа релизе, будем рады фидбеку и вопросам! Начинаем раскатывать понемногу перед большим релизом, чтобы собрать фидбек и шлифануть все. Мы давно работаем с агентами, и одна из ключевых сильных сторон нашей команды – это умение пилить инфру. С агентами всегда стоит вопрос: где им безопасно и быстро выполнять код? В докере есть ограничения, а обычные виртуалки — слишком медленные. В итоге мы сделали свою песочницу на базе microVM. Пара главных фичей: + Git-like ветвление стейта. Агент доходит до чекпойнта и может запустить 5 вариантов кода параллельно (идеально для MCTS/Beam Search). Если скрипт падает, агент откатывается назад за миллисекунды. Ошибки LLM теперь ничего не стоят. + Hardware-изоляция. Агент может крашнуть ядро или сделать rm -rf / — ConTree всё проглотит и мгновенно восстановится. + Готовый MCP сервер. Добавляешь пару строк в конфиг claude, и у него появляется неубиваемый облачный терминал. Пишите в комменты или в личку, если хотите попробовать и свои вопросы! Мы поможем всё настроить и сделать тестовые запуски.

  • 4 февр.4 5914838

    Снова пост-солянка! 1. В Google Scholar мой профиль перешагнул отметку в 100 цитирований. Приятно! 2. В X (бывший Twitter) есть статья, которая набрала 170млн просмотров. Ждал, что её кто-то переведет, но в итоге сделал это сам для vc и Хабра Суммарно вышло 200тыс просмотров и много полярных комментов. Статья называется: «Как исправить всю свою жизнь за один день». 3. Писали статью на конфу. В этот раз основной связкой были VS Code + Codex для работы с LaTeX. В ChatGPT Pro загружал проект целиком вместе с PDF и просил прожарить – удобно искать несоответствия фактов, артефакты верстки. Кстати, пробовал Cursor на месяц, но не зашло: низкие лимиты, слабая модель автодополнения, да и IDE-агентами я почти не пользуюсь (предпочитаю терминальные). В итоге вернулся в VS Code + терминальные агенты. 4. Игорь написал классный лонгрид про тестовое в Anthropic. Статья: Anthropic Performance Team Take-Home for Dummies. Вообще респект авторам, которые вставляют куски кода на Python или псевдокод в разборы алгоритмов. Мне в таком формате понимать всё гораздо проще. Если кода нет, приходится просить ChatGPT накидать примеры. 5. Прошлый пост с обновлением SWE-rebench в X залетел на 80тыс просмотров. Пробую разные форматы, но публикую редко. Если у вас есть советы, как эффективно вести X/что-то другое, или вы сами продвигаете свои продукты/research – поделитесь опытом, интересно послушать! 6. Сходили по совету друзей на постановку по Stranger Things. Там предыстория Векны. Я смотрел только первый сезон, остальное догнали кратким пересказом перед походом в театр. Понравилось, спецэффекты – оч классные! Если что-то из пунктов интересует больше - пишите в комменты/личку.

  • 20 янв.4 59842118

    Как попробовать Claude Opus 4.5 и другие модели в CLI-агенте бесплатно За последние полтора года из первого ряда наблюдал как сильно выросли способности моделей в формате кодинг агентов. При этом кто-то еще не пробовал сделать проект просто агентами, без погружения в код, хотя желание есть. Не у всех есть enterprise-подписка на Codex, Claude или Cursor, либо лишние $100–200 в месяц. При этом $10 в том же Cursor выедаются довольно быстро, если запускать агента на задачах чуть сложнее простых автокомплитов. Фронтирные модели уже нормально работают в агентских обвязках. На бенчмарках топовые модели идут примерно на одном уровне, на последнем ребенче например лидирует Opus. При этом сами агентские скаффолды сходятся к одному и тому же набору инструментов, поэтому можно спокойно пробовать разные cli агенты, не переживая, что они сильно отличаются. Есть такой очередной агент/обвязка. AMP Code. Они дают $10 в день, взамен показывают рекламу. Реклама ненавязчивая, просто висит над окном ввода. Есть плагины почти для всего: VS Code, JetBrains, Neovim. Я пользуюсь CLI-версией. https://ampcode.com/install P.S. Когда появляется такой инструмент, сначала может быть непонятно, что с ним делать. Поэтому для тестового запуска я всегда прошу реализовать браузерный Doom. В школе 21 этот проект раньше был в конце ветки геймдева. В итоге вышло около $2 из суточных $10 за 1.5 млн токенов. Тут можно посмотреть, какая траектория получилась: https://ampcode.com/threads/T-019bcc0d-7ac8-710a-a273-8513be37694e

  • 5 янв.13 тыс47130

    Серега @southfreebird параллельно с работой в Nebius с друзьями сделал крутой open-source проект! Авторы: @southfreebird, @Olegbalakhnov и @zaringleb. Ребята обучили и выложили в open-source VLA-модель на базе VLA-0 от Nvidia, только с backbone в 6 раз меньше (0.5B vs 3B в оригинальной работе), которая показывает success rate 94.1% на Libero benchmark (против 94.7% у оригинальной модели). VLA (Vision-Language-Action) это модель, которая смотрит на картинку, понимает текстовую команду и сразу выдаёт действие для робота, типа «возьми кубик и положи справа». Вообще порог входа в robotics ML всё ещё достаточно высокий, поэтому у ребят крутая цель: сделать в open-source воспроизводимые рецепты для файнтюна небольших моделей на небольшом количестве демонстраций. Ссылка на блогпост и модель: https://robot-learning-collective.github.io/vla-0-smol Если интересно следить, ребята завели Discord: https://discord.gg/XcZVY2kxj9 Ну и пишите, если будут вопросы!

  • 4 янв.3 7622355

    Открыл сегодня x и увидел пару постов на 100k+ просмотров про статью Recursive Language Models Суть такая. Вместо того чтобы запихивать всё в контекст, предлагают относиться к проблеме длинного контекста как к software engineering задаче. Дать LLM инструменты вроде поиска по регуляркам, чтобы она сама обрабатывала контекст, плюс инструмент для запросов в LLM, чтобы параллельно гонять сабагентов. Идейно – обычный агент (codex/claude-code/итд) просто теперь вместо репозитория нужно искать агент работает по большому txt. Приложил картинку из статьи, очень наглядная. Сразу после статьи вышел блогпост от PrimeIntellect (очень бодрые ребята, много делают для agentic rl и хайпуют в x). Они делали эксперименты на эту же тему и показали больше ablations, плюс небольшие улучшения вроде: а давайте инструменты будут доступны только сабагентам, чтобы не раздувать контекст основной LLM. Мои мысли такие: 1. Мне казалось, что все deep research агенты и так работают примерно так? Саша Абрамов @dealerAI вроде писал много про инжиниринг контекста, память итп. 2. По ablations у PrimeIntellect видно, что на двух бенчмарках есть просадка, но это похоже на проблему скаффолдинга, значит лечится обучением. 3. Такой swe-agentic подход хорошо подходит для needle-in-a-haystack задач, когда в массиве текста есть атомарные факты, их нужно найти и обработать. А вот для неявной и глубокой семантики, где на текст нужно смотреть как бы сверху, кажется, уже не очень. 4. Такой swe-agentic подход удобно заводить под rl: есть multi-turn, удобнее суммаризации, инфраструктура для обучения у многих уже есть из-за расцвета RLVR. И в отличие от SWE задач не нужно 100500 разных sandbox-контейнеров под каждую задачу. 5. По названию Recursive Language Models кажется, что это про архитектуру моделей и прочее, а не про простой цикл. Но это мб только для меня так. сама статья https://arxiv.org/abs/2512.24601v1 блогпост PrimeIntellect https://www.primeintellect.ai/blog/rlm Твит автора https://x.com/a1zhang/status/2007198916073136152 P.S. Кстати, датасет с траекториями https://t.me/c0mmit/88, про который я писал на прошлой неделе сидит в первой десятке trending huggingface с >100 лайков.

  • 23 дек.16,4 тыс49129

    🎄 Релизим 67 074 траектории Qwen3-Coder с OpenHands + 2 RFT чекпоинта. > Мы выкладываем: 67 000+ траекторий по 3 800 решенным задачам в 1 800+ Python репозиториях. > Примерно в 3 раза больше успешных траекторий и в 1.5 раза больше репозиториев, чем в нашем прошлом датасете. > Траектории длинные: в среднем 64 шага, до 100 шагов и контекст до 131k токенов. > RFT на этих данных, SWE-bench Verified: Qwen3-30B-Instruct: 25.7% → 50.3% Pass@1. Qwen3-235B-Instruct: 46.2% → 61.7% Pass@1. Также сильный рост на SWE-rebench September (цифры в блог посте) > Мы сделали много эвалов. прогнали OpenHands с лимитом 100 и 500 шагов. Запускаем на SWE-bench Verified и сентябрьском SWE-rebench. > Мы отдельно проверяем тесты, которые пишет модель. Считаем, как часто тесты корректны. Проверяем, как часто финальный патч модели проходит ее собственные тесты. В итоге получаем пул данных в том числе для обучения верифаеров. Полностью Permissive License Датасет и модели: https://huggingface.co/collections/nebius/openhands-trajectories Подробный блогпост: https://nebius.com/blog/posts/openhands-trajectories-with-qwen3-coder-480b Пост в x: https://x.com/ibragim_bad/status/2003423706861936856 P.S. Прошу поддержать пост в x, если у вас есть аккаунт!

  • 4 дек.3 6224112

    сейчас будем показывать нашу стенгазету с SWE-rebench, приходите если рядом! 🧩 SWE-rebench: an automated pipeline for task collection & decontaminated evaluation 📍 Dec 4 | 11:00 AM–2:00 PM PST | Hall C/D/E #106

  • 2 дек.3 417619

    Приехал в Сан-Диего на NeurIPS 2025, буду рассказывать про SWE-rebench на постерной сессии. NeurIPS 2025 - это одна из самых крупных конференций по ИИ и машинному обучению. Много топовых статей были опубликованы здесь, например, легендарный Attention is All You Need (тогда еще на NIPS 2017, но название поменяли из-за токсичных ассоциаций) Если кто тоже тут, приходите на постерную сессию (позже закину где и когда будет) и пишите - сходим на кофе! P.S. Фотку приложил из Нью-Йорка в который заскочили по пути, так как в Сан-Диего прилетели только вечером.

commit history — tgindex