tgindex
Нескучный Data Science

Нескучный Data Science

Статистика

Нюансы работы в Data Science, о которых ты не узнаешь в школе 👨‍💻 Managing AI Director, Sber @smirnovevgeny https://www.linkedin.com/in/smirnov-evgeny/ По вопросам сотрудничества @datascience_assist Регистрации в Роскомнадзор № 5278866657

Последний пост
09:03
Последнее чтение
10:20
Постов за неделю
4
Всего постов
56
Тип
открытый
Язык
русский
Категория
Познавательное
В каталоге с
12 авг.
Подписчики
11 994
0 за сутки
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
7 419
35 постов
Вовлечённость
61,9%
к подписчикам
Постов в день
0,6
всего 56
Упоминаний
8
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 🧠 10 бит в секунду, или Почему люди тупые Когда я учился в университете, мой сосед любил повторять: — Люди тупые. В том числе и я. Вторая часть фразы нравилась мне гораздо больше первой. В ней была полезная мысль: свои когнитивные ограничения лучше учитывать заранее, а не обнаруживать постфактум. 💾 Позже я попал к научному руководителю, у которого одновременно со мной было ещё несколько десятков студентов. Он честно предупреждал: — Женя, я обещаю, что забуду всё, о чём мы сегодня говорили. Он просто хорошо понимал ограничения собственной памяти и не делал вид, что способен удержать в голове всё. 🔬 Ещё в 1952 году психолог Уильям Хик оценил скорость обработки информации в задачах выбора примерно в 5 бит в секунду. Спустя семь десятилетий исследователи из Caltech проанализировали самые разные виды человеческой деятельности — от чтения и печати до игр и запоминания — и получили величину того же порядка: около 10 бит в секунду, или 1,25 байта. ⚠️ Это не скорость всего мозга. Сенсорные и двигательные системы работают значительно быстрее. Скорее, речь об узком канале, через который информация превращается в осознанный выбор и контролируемое действие. 🤔 Отсюда простой вывод. Если вы задали человеку сложный вопрос, а через секунду получили уверенный ответ, возможны три варианта: 1. Перед вами гений. 2. Человек уже долго думал об этом раньше. 3. Он озвучил первое, что пришло в голову. Чаще, чем нам хотелось бы, срабатывает третий вариант. 🤖 Для GPT мы специально включаем thinking mode и соглашаемся немного подождать. А от человека почему-то ожидаем качественного решения немедленно — желательно прямо на созвоне, между двумя уведомлениями и вопросом «ну что тут вообще думать?». Но человеку тоже можно включить thinking mode. 📝 Поэтому сложные вопросы лучше задавать заранее, а важные договорённости — записывать. И не стоит путать скорость ответа с качеством мышления. 🗂 Кажется, единственный выход с учётом наших ограничений — учиться структурировать знания и сохранять их так, чтобы потом быстро находить. Такая внешняя память медленнее оперативной, но гораздо быстрее, чем каждый раз вспоминать или придумывать всё заново. 🛡 И тут начинается самое интересное: если мы понимаем ограничения естественного интеллекта, становится понятнее, как работают некоторые виды атак на него — и как от них защищаться. Возможно, об этом поговорим в следующих постах.

  • Исследуйте сферу AI в T-Lab Т-Образование зовет участников в проект T-Lab. Это годовая программа научно-исследовательской работы в области AI. Станьте соавтором научных открытий, которые меняют индустрию! Вы сможете выбрать один из проектов в сфере AI и участвовать в исследовании на всех этапах. Итоги вашей работы могут лечь в основу научных публикаций и стать вектором новых продуктов. Кого ждут в T-Lab? Студентов бакалавриата и магистратуры, недавних выпускников технических направлений. Участники получат: 🔴Официальное трудоустройство с зарплатой. 🔴Доступ к ресурсам бигтеха для исследований. 🔴Возможность получить оффер в IT-компанию. Узнайте больше и оставьте заявку до 23 августа по ссылке

  • Конференция Ozon Tech, уже успевшая заслужить высокоранговую славу, обещает и в этом году собрать много интересного для тех, кто работает с ML&DS. Программа E-CODE 2026 еще пополняется, но трек уже выглядит вполне серьезно: сложный индустриальный ML, генеративные подсказки, уровни дообучения и агентский Cotype. Такое нам определенно надо. Еще и участие бесплатное - осталось только зарегистрироваться: https://ecode.ozon.tech/ Ну и в рамках соблюдения work-life balance вечерком прям там же можно и под «Хлеб» с «Нейромонахом Феофаном» отжечь 😅

  • ИИ крадёт у нас или учится у нас? 🧠 Недавно сидел на панельной дискуссии. Во время вопросов из зала прозвучало примерно следующее: — Как быть с тем, что ИИ будет обучаться на наших данных? Как защитить то уникальное, на создание чего человек потратил столько времени? Но тут возникает неудобный вопрос: а в чём именно заключается эта уникальность? Я люблю сравнивать работу ИИ с ЕИ — естественным интеллектом. Такое сравнение помогает лучше замечать некоторые паттерны человеческого мышления и обучения. Так вот: ЕИ тоже учится на чужих данных 📚 Человек читает книги, слушает преподавателей, разбирает чужие работы, наблюдает за другими людьми и запоминает удачные решения. В творческих профессиях это называют насмотренностью и начитанностью. А затем человек комбинирует знания и приёмы, придуманные до него, — и создаёт нечто, что мы считаем уникальным. Даже гены в некотором смысле можно рассматривать как накопленный поколениями опыт 🧬 Это, конечно, не обучение в обычном смысле, а результат эволюционного отбора. Но принцип сохранения успешных решений здесь тоже просматривается. Поэтому мне немного странно слышать от ЕИ, что ИИ обязательно что-то у него «украдёт». Ведь ИИ обучается на созданном людьми примерно так же, как сам человек когда-то учился на наследии предыдущих поколений. Возможно, главное, чему ИИ пока не научился, — это вкус 🎨 Не просто способность скомбинировать знакомые элементы, а умение почувствовать: что действительно стоит создавать, зачем и для кого. Хотя и вкус, если честно, тоже формируется не в вакууме. На фото мы с Радославом @girafe_ai — довольные тем, что обсудили эту тему и поняли друг друга с полуслова 🤝 💬 Как думаете, что на этом изображении создано с ИИ?

  • Как понять по письму, что задача не выполнена? 📨 За годы работы в крупных компаниях мне пришлось прочитать очень много писем. Иногда их приходит до сотни в день. Поэтому навыки анализа данных приходится применять и здесь. Представьте: вы поставили кому-то задачу, подошёл срок — и вам присылают отчёт. Это может быть один абзац, а может быть целый лист А4. Вы читаете про процесс, коллег, сложности и то, как все героически преодолевали препятствия. Первый абзац, второй, третий… Очень интересно. Все явно вспотели 😅 Письмо заканчивается, а вы так и не поняли: задача выполнена или нет? 😅 Чем выше вы поднимаетесь в компании, тем сильнее вас интересуют две вещи: какой результат получен и сколько пользы он принёс бизнесу в рублях 💰 Письма с результатом обычно короткие: ✅ «Задача выполнена. Конверсия выросла с X до Y. Эффект для компании — N миллионов рублей». Но даже если письмо длинное, при наличии результата о нём напишут в первом абзаце. В крайнем случае — в последнем. Поэтому длинные письма можно читать по простому алгоритму 🔍: сначала первый абзац, затем последний. Если ответа нет ни там ни там, скорее всего, внутри будут процесс, сложности и оправдания. А если вам сложно писать короткие и ёмкие тексты, советую прочитать книгу «Пиши, сокращай: Как создавать сильные тексты» 📘 Она хорошо учит убирать лишнее и сразу доносить главную мысль. Конечно, бывают исключения. Но в классификации статусных писем и отчётов длина письма — топ-фича 🎯 Если результата нет в первом или последнем абзаце, с большой вероятностью его нет. Более того, если такие письма вам приходят постоянно от одного и того же оправителя, то результат можно вовсе не ждать.

  • 8 авг.из rads_ai

    На конференциях только и разговоров, что об агентах. Вообще, я бы назвал это harness'ами. Они могут приносить кучу пользы, и их огромное количество: Claude Code, Codex, pi, Hermes, OpenClaw, Cursor, Muse Code... Хорошая новость в том, что под капотом +- одни и те же механизимы, и если в них разобраться, почти не важно, какой harness у вас под рукой. Поэтому проведу в понедельник, 10 августа в 18:30 открытый вебинар «Агенты без магии». Разберём: * как правильно ставить задачи агенту * что такое скиллы, MCP и зачем они нужны * в чем разница с пайплайнами, и почему для повторяемых задач они лучше подходят (например, n8n) И с теорией, и с примерами. Свои подписки не требуются (но точно не будут лишними :) ) Участие, как и в предыдущий раз, свободное. Но нужно будет заполнить формочку (чтобы я знал, сколько вас будет). А если есть вопросы или кейсы, которые хочется разобрать – пишите в комментарии. А для тех, кто хочет глубоко погрузиться в ИИ и стать магистром AI ☕️ – у нас целая программа в МФТИ есть, с которой успешно выпустилось пять потоков. Онлайн, на английском, совместимо с работой, в небольшой группе. Подача документов через Госуслуги до 11 августа, вам достаточно оставить заявку, дальше мы проведем по шагам. Присоединяйтесь! P.s. Долго думал, какие аналогии провести, получилось вот такое: Claude Code – для храбрых Codex – для спокойных Goose – для желающих пропатчить KDE2 под FreeBSD Hermes – для отаку pi – 🐭

  • ❓ Научитесь отвечать на вопрос «зачем?», прежде чем ставить задачу ИИ Моё знакомство с Codex началось, когда появилась вполне конкретная задача: собрать сайт для @mirabistro. Сайты я делал и раньше — первый написал на PHP ещё в восьмом классе. Но никогда не вайбкодил и относился к этому довольно скептически. Несмотря на десять лет работы в анализе данных, мне казалось, что нормальный рабочий продукт всё равно придётся долго собирать руками. А тратить время на проект без понятной цели я не хотел. 🌐 Здесь наконец появилась конкретная цель. К тому же все «эксперты по ИИ» в соцсетях уже рассказывали, что теперь такие вещи можно собрать чуть ли не за один вечер. Я решил проверить — и сайт действительно получился. Напишите в комментариях, как он вам 👇 После этого я начал вайбкодить почти каждый день. 😁 Но именно тогда я понял главное: когда ИИ позволяет очень быстро собрать практически любой MVP, становится особенно важным ещё до начала работы ответить на вопрос: «зачем?» 🏠 Недавно у меня появилась новая «задача». Дома стоит старый видеодомофон Tantos. У него есть приложение vhOme, которое работает довольно медленно, не присылало уведомления о звонках на iPhone и просто не нравилось мне визуально. Приложения под Android я тоже писал — как вы помните. Правда, это было ещё в 2014 году. И самое смешное, что vhOme выглядело примерно так же, как мои приложения того времени. Но у меня хотя бы не было дизайнера. Точнее, дизайнер был — я сам 😅 Я такой: — Сейчас сделаю своё приложение. 📱 Закинул в Codex APK Android-приложения. Он разобрал его, вытащил используемые методы, нашёл механизмы подключения к домофону и получения видеопотока. Ещё немного — и можно было начинать писать полноценное приложение под iOS. Можно было упороться окончательно: сделать системный экран входящего звонка, после ответа сразу открывать видео, добавить две кнопки — «Открыть» и «Не открывать», оформить аккаунт разработчика и попробовать выложить всё это в App Store. В целом многие приложения теперь действительно можно допиливать и переделывать под себя. Если есть работающий клиент, ИИ способен исследовать его поведение, разобраться с протоколами и собрать свое решение. В итоге я потратил несколько часов на исследование vhOme. 🤔 Но перед тем, как переходить к полноценной разработке и публикации в App Store, я всё-таки остановился и задумался: а точно ли эту задачу нужно решать таким сложным способом? Нет ли чего-то проще? И главное: зачем мне вообще собственное приложение? Мне было нужно не приложение само по себе. Мне было нужно не пропустить звонок в дверь. 🔔 А потом выяснилось, что проблема была не в домофоне: пришлось поиграться с режимами «Фокусирование» на iPhone и правильно настроить допуск уведомлений. После этого они начали приходить. Собственное приложение с быстрым переходом к видео и двумя кнопками всё ещё было бы удобнее. Но когда пуш уже работает, потенциальный аплифт от разработки резко снижается. 🎓 Если, конечно, перед вами не стоит образовательная цель. Тогда ответ на вопрос «зачем?» тоже есть: разобраться в чужом приложении, исследовать протоколы и научиться собирать собственные продукты под iOS. В этом случае само исследование уже становится результатом. 🤔 Но изменилось ли что-то с появлением вайбкодинга? В вопросе целеполагания — ничего. Ведь и раньше существовало огромное количество бесполезных стартапов, научных статей и корпоративных проектов, которые пятый год подряд делают одно и то же второй раз. ИИ не решает проблему целеполагания. Он помогает быстрее написать код и дешевле проверить гипотезу, но не способен решить за вас, какой результат действительно нужен и стоит ли вообще браться за проект. 🎯 Поэтому главный навык сейчас — умение отвечать на вопрос «зачем?». Так было всегда: на вопрос «зачем?» должен уметь отвечать заказчик и любой руководитель, который несёт ответственность за результат. Но теперь, когда вы ставите задачу ИИ и с его помощью пишете код, вы тоже становитесь руководителем — как минимум собственного проекта. А значит, теперь и вам нужно уметь отвечать на главный вопрос: «зачем?»

  • 🔥 ODS Moscow × Нескучный Data Science: бранч в эту субботу После поста про МИРА можно уже не делать вид, что выбор места — случайное совпадение и не очень нативная рекламная интеграция 😅 В эту субботу снова собираемся там на офлайн-бранч вместе с ODS Moscow. Будем знакомиться, есть и обсуждать ИИ, Data Science, карьеру и собственный бизнес. Заодно можно будет посмотреть на тот самый «очень дорогой pet-проект» из предыдущего поста и спросить, что в нём уже удалось оцифровать, а где операционка пока побеждает ИИ. 📆 Когда: суббота, 8 августа 🕛 Время: 12:00 📍 Место: @mirabistro, МИРА бистро, Тверская ул., 16, стр. 1 Вход со стороны метро «Тверская» / «Пушкинская» Бронь на имя Даниель ODS. Ставьте 👍, если планируете прийти — будет полезно понимать примерное количество людей. Буду рад увидеться!

  • 🎉 Мы запустили МИРА бистро — это очень дорогой pet-проект 😅 👀 Внимательные читатели уже могли что-то заподозрить: последние бранчи ODS Moscow × Нескучный Data Science проходили именно там. Пора признаться — это было не случайное совпадение и не очень нативная рекламная интеграция. 🏦 Четыре с половиной года назад, когда мой банковский стаж уже перевалил за пять лет, в самом первом посте я признался, что никогда не собирался работать в крупных компаниях, тем более в банках. К настоящему моменту стаж приблизился к десяти годам, а я прошёл путь от джуна до управляющего директора с командой из 150 человек. Прогноз оказался неточным, зато обучающая выборка получилась отличной. 🤖 Все эти годы главной темой канала было практическое применение ИИ в бизнесе — ровно то, чем я занимался в финтехе: находил точки применения ИИ, оценивал потенциальный эффект и встраивал решения в бизнес-процессы. Теперь похожую задачу мы уже решаем в собственном бизнесе. 🏪 Главное отличие — в начальной точке: в бигтехе и финтехе данные обычно собираются и логируются, хотя используются далеко не всегда, а в небольшом офлайн-бизнесе их обычно не собирают системно. 📊 Но в главном небольшой бизнес ничем не отличается от крупного: путь к AI-native компании начинается с data-driven фундамента. Сначала мы описываем и оцифровываем процессы, организуем сбор данных и выстраиваем систему метрик, а затем внедряем ИИ. 🔬 Основные принципы при этом остаются прежними: начать с изучения бизнес-процесса — подобно тому, как физик изучает природу, понять, как его можно улучшить и где ИИ принесёт измеримый эффект, а затем довести решение до внедрения. 👨‍🏫 Этим же принципам я учил руководителей на курсе «Принятие решений на основе данных», а теперь применяю их уже в роли владельца компании. В МИРА мой опыт в данных, ИИ и построении процессов соединился с ресторанной операционкой — на том самом стыке ортогональных областей, о котором я писал в посте про настоящий аплифт от ИИ. 🚀 Для подписчиков это будет кейс о том, как перенести опыт из ИИ и крупного бизнеса в собственную компанию. В предыдущем посте я писал, что работодатель больше платит тем, кто помогает ему больше зарабатывать. Но эта сделка работает в обе стороны: когда вы относитесь к чужой компании как к своей и выбираете сложный путь, который приносит ей дополнительный результат, вы одновременно накапливаете опыт и инструменты. Теперь проверим, насколько хорошо этот опыт переиспользуется уже в собственном бизнесе. 🎁 Но прежде чем рассказывать о применении ИИ, нужно понять сам продукт и изучить его процессы. Только после этого станет ясно, где и зачем нужен ИИ. Поэтому в следующем посте будет первая коллаборация с каналом @mirabistro и акция для подписчиков. Сначала познакомлю вас с продуктом, а уже потом перейдём к данным, метрикам и применению ИИ.

  • От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬 Наконец-то дождались 🗿 Чуть больше года назад вы заполнили мой зарплатный опрос. Я обещал проанализировать результаты, но 695 анкет превратились в технический долг, о котором мне регулярно напоминали в комментариях. Сегодня я этот долг возвращаю. Кажется, даже с процентами: вместо очередной таблицы «кто сколько получает» получилось большое исследование карьер в Data Science. Да, за прошедшее время зарплатные вилки успели сдвинуться. Но карьерные зависимости никуда не делись, поэтому статья не только о суммах, а о профессиональном росте, удовлетворённости работой и готовности её сменить. Внутри вас ждет лонгрид, где в том числе есть ответы на пять не самых очевидных вопросов: 1️⃣ Можно ли удержать недовольного дата-сайентиста высокой зарплатой и запереть его в золотой клетке? 2️⃣ Какие навыки помогут быстрее вырасти в грейде и больше зарабатывать? 3️⃣ Одинаково ли зарабатывают мужчины и женщины с одним грейдом и опытом? 4️⃣ Что дата-сайентисты хотят сказать Head of DS, когда отвечают анонимно? 5️⃣ Как часто дата-сайентисты ******* и связано ли это с доходом и удовлетворённостью работой? Ещё там премии стажёров, ШАД на скейтборде, зарплата CDS до 4,5 млн рублей 😳, переработки и попытка понять, где заканчивается развитие и начинается менеджмент. В анализ вошли 694 анкеты. Спасибо «Start Career in DS», «DziS Science | Data Science», «girafe.ai», «Artificial stupidity», «LightAutoML framework» и «Борис опять» 👉 Читать на Хабре

  • 24 сентября скучно не будет – в этот день пройдёт Yandex Scale 2026, флагманская технологическая конференция Yandex Cloud. 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 Четыре офлайн-трека: Data – обновления сервисов управляемых баз данных, новые возможности аналитики и честный разбор одного из самых сложных кейсов миграции данных, плюс AI, Hybrid Infrastructure & DevOps и Security. А в онлайне — отдельный технологический трек DeepTech: реальные воркшопы, в которых можно принять участие, игровые механики и эксклюзивные гости.🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 Кроме того — виртуальный стенд VibeCraft, где можно завайбкодить проект. Плюс отдельная онлайн-студия с интерактивной программой где можно: 🔴 оценить юмор на Лиге IT-шуток; 🔴 задать вопросы СТО Yandex Cloud; 🔴 послушать известных научпоп-спикеров и задать им свои вопросы; Зрители голосуют и в реальном времени влияют на взаимодействие в студии. И это ещё не всё! 🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨 Актуально для дата-сайентистов, ML-инженеров, аналитиков и всех, кто хоть раз чинил пайплайн в пятницу вечером. 24 сентября, Москва + онлайн. Оставить заявку можно по ссылке – участие бесплатное! Реклама. ООО «Яндекс.Облако». ИНН 7704458262. Erid: 2VtzqwwQoy4

  • 🥩 Как перестать быть жирным как поезд пассажирный? Сейчас я снова в «отпуске» и наконец возвращаюсь к серии постов про work-life balance. Год назад в предыдущем посте я рассказывал про свой первый подход к снаряду — борьбе с лишним весом: Я собрал дома спортзал, регулярно тренировался, купил велосипед и иногда проезжал на нём по 80 километров. Но желаемого результата не было. Тем не менее я продолжал пытаться. 🌍 Как мне помогли полгода путешествий Волею судьбы я провёл полгода в путешествиях: Турция, Казахстан, Таиланд, ОАЭ, Сейшелы и Армения. Вроде ничего не забыл. С едой возникло сразу несколько проблем. Во-первых, я довольно привередлив. Во многих ресторанах мне не нравится, когда настоящий вкус продукта пытаются спрятать под тонной соуса. Во-вторых, в каждой стране своя кухня. А ежедневные эксперименты создавали дополнительную нагрузку не только на желудок, но и на бюджет. В-третьих, с тех времён, когда я качался и переставал быть дрищом (как сейчас, лол), я люблю мясо. Но приходишь в Турции, Таиланде или даже ОАЭ выбирать мясо — и абсолютно ничего не вызывает доверия. А отравиться за рубежом без медицинской страховки совсем не хочется. 🥩 Так появилась стейковая диета Я начал сам готовить себе на обед стейк с гарниром и овощами, а на ужин — красную рыбу с овощами. Рецептом стейка со мной ещё в студенческие годы поделился сосед по общаге. Он уже тогда был аспирантом и поэтому мог позволить себе стейк на ужин. Изначально главным преимуществом такого рациона для меня было стабильное и предсказуемое качество. Я сам выбирал продукт и полностью контролировал приготовление. Неожиданно именно такой рацион помог мне начать сбрасывать вес. 🔍 Как это сработало в моём случае? Раньше я ел курицу. Чтобы нормально наесться, её требовалось много. Но даже после большой порции довольно быстро снова хотелось есть. Отсюда появлялась проблема перекусов: я заходил на кухню и сметал всё, что плохо лежало. А иногда и то, что лежало хорошо. После стейка с гарниром и овощами я просто не думал о еде до ужина вообще. Стейк — достаточно калорийный, сытный и питательный продукт. Но именно поэтому после него у меня пропала потребность постоянно перекусывать. В результате общая калорийность моего дневного рациона снизилась, и дефицит наконец сошёлся. 🏠 Что было после возвращения? Вернувшись в Россию, я продолжил придерживаться этого рациона и стал развивать навык приготовления стейков. Купил домой гриль и постепенно начал получать от самого процесса эстетическое удовольствие. Дошло до того, что на командных тимбилдингах я вставал за гриль и готовил стейки уже на всех. Разнообразие в собственный рацион начал добавлять только примерно через три года. В студенчестве я пять лет ел куру с гречкой и не страдал. А тут всего три года — практически высокая кухня. В результате я сбросил чуть больше десяти килограммов. ⚠️ Важная ремарка Это мой личный опыт с выборкой из одного наблюдения, а не рекомендация переходить на стейки. Перед регулярным употреблением красного мяса лучше проконсультироваться с врачом. Я со своим консультировался. ВОЗ и IARC относят красное мясо к вероятно канцерогенным продуктам, а переработанное мясо — к канцерогенным. Риск зависит в том числе от количества: Поэтому повторять мой эксперимент бездумно не стоит. А какой способ похудеть неожиданно сработал у вас?

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • +5

    🔥 Как прошёл офлайн-бранч ODS Moscow × Нескучный Data Science 🧠 Начали с доклада Альберта про то, как в Avito обучают собственную LLM. Это не история про «взяли открытую модель и немного дообучили», а полноценный процесс: выбор базовой модели, собственный токенизатор, адаптация на данных Avito, SFT и дальнейшее обучение с помощью RL. Для SFT собрали больше 800 тысяч примеров: открытые датасеты, синтетические данные, олимпиадные задачи, внутренние бизнес-кейсы и диалоги пользователей с большими моделями. На этапе RL отдельно развивают несколько навыков модели: решение математических задач, следование сложным инструкциям и корректный вызов инструментов. Причём для каждого навыка нужен свой автоматически проверяемый reward. В математике система извлекает финальный ответ и проверяет его эквивалентность правильному. В instruction following — смотрит, выполнила ли модель все заданные ограничения. В function calling — проверяет название инструмента, аргументы и их значения. Отдельно поговорили про инфраструктуру. Для моделей на 8B параметров можно относительно быстро запускать эксперименты и проверять гипотезы. Но при переходе к большим MoE-моделям главным вызовом становятся масштабирование, распределение модели по GPU, батчинг, инференс и offloading. 👨‍🔬 После продуктовых LLM резко переключились на химию. Константин начал с важной мысли: химическая информация — это не один универсальный тип данных. Одну и ту же молекулу можно представить текстом, строкой SMILES, двумерным графом, трёхмерной структурой или структурой, которая изменяется во времени. И под каждое представление нужны свои методы и модели. Поговорили о том, почему даже на фоне сложных нейросетевых архитектур связка Morgan fingerprints + XGBoost всё ещё остаётся очень сильным базовым решением для многих задач с химическими данными. Затем перешли к геометрическим графовым нейронным сетям. Они учитывают расположение атомов и позволяют предсказывать свойства молекул в десятки раз быстрее традиционных DFT-расчётов. Отдельно разобрали нейронные потенциалы и delta-ML. Идея в том, чтобы не выполнять каждый раз дорогой квантово-химический расчёт полностью: часть свойства можно посчитать более дешёвым методом, а нейросети поручить предсказать необходимую поправку. Дошли и до LLM с агентами. Здесь пока всё не так магически, как иногда выглядит в заголовках: модели могут по-разному отвечать на один и тот же вопрос в зависимости от того, передали им обычное название соединения, IUPAC или SMILES. А некоторые агенты, которые должны самостоятельно запускать вычислительные эксперименты, пока скорее напоминают roadmap, чем полностью автономного исследователя. Зато роботизация лабораторий уже вполне реальна: специализированные платформы, роборуки, автоматическое проведение серий экспериментов и превращение обычного оборудования в high-throughput-системы. 🎬 После двух технических докладов разговор с Денисом про ИИ в кино оказался очень кстати 😅 Обсудили, где новые инструменты уже помогают при работе с контентом, какие процессы способны ускорить, где вызывают сопротивление и в каких задачах пока остаются скорее экспериментом. Но, как обычно, самое ценное происходило не только во время выступлений. После докладов продолжили обсуждать услышанное за завтраком, задавать вопросы, спорить, знакомиться и делиться своими кейсами. Спасибо Альберту, Константину и Денису за содержательные выступления, ODS Moscow — за очередную совместную встречу, МИРА бистро — за пространство, а всем, кто пришёл, — за вопросы и атмосферу. Формат «бранч + несколько докладов» точно будем повторять. Поэтому уже начинаем собирать темы для следующего бранч-митапа. Если вам есть о чём рассказать — про рабочий кейс, исследование, неожиданный эксперимент, применение ИИ в своей индустрии или даже неудачу, из которой можно сделать полезные выводы, — присылайте тему доклада и пару предложений о себе в комментарии или личные сообщения. P.S. Будем учиться фотографироваться до того, как все разошлись 😅

  • 🔥 ODS Moscow × Нескучный Data Science: офлайн-бранч в эту субботу В эту субботу снова собираемся на офлайн-бранч вместе с ODS Moscow. Раньше наши бранчи проходили совсем без программы: просто встречались, ели и разговаривали про ИИ, data science и рабочие истории. В этот раз хотим сохранить этот живой формат, но добавить несколько докладов — чтобы было от чего оттолкнуться в обсуждении и куда глубже копнуть. На позапрошлом бранче мы обсуждали, зачем Avito вообще обучать свою LLM. Тогда тема вызвала много вопросов, и я предложил Альберту рассказать об этом подробнее — уже не на уровне «а зачем», а на уровне технических деталей. Альберт Акопян LLM research engineer Avito | ex. Alfa Bank | MIPT & YSDA alumni «Как мы в Avito делаем RL для нашей LLM» Поговорим про то, как выглядит RL для LLM внутри большого продукта: какие задачи этим решают, как это связано с качеством модели и что вообще приходится учитывать, когда LLM живёт не в демке, а в реальном сервисе. На прошлом бранче у нас была очень живая дискуссия про применение ИИ в медицине. В этот раз продолжим смотреть на ИИ в науке, но уже со стороны химии. Ушенин Константин ведущий научный сотрудник AIRI | кандидат физ-мат наук | препод в УрФУ и ТГУ | ex. Академия наук РФ | автор канала «эйай фор сайенс» — @not_only_llm «Применение ИИ в химии» Константин расскажет, как ИИ применяется в химии: где он действительно помогает исследователям, какие задачи уже можно решать с помощью моделей и как это выглядит не в хайповых заголовках, а ближе к реальной научной практике. А ещё мне не хочется, чтобы наши бранчи превращались исключительно в разговоры про работу, метрики и продакшен. Это полезно, но иногда получается слишком душно 😅 Поэтому я позвал Дениса рассказать про ИИ в кино. Если вы давно читаете канал, возможно, помните, что он помогал вытаскивать книжный сериал «Дата Сапиенс», а сейчас сам активно начинает применять ИИ в жизни и творческих проектах. Ну и, конечно, у нас будет шанс разведать, что произойдёт в следующем сезоне одного из сериалов с его участием. Скажу честно: у меня пока не получилось 😅 Денис Бузин актёр театра и кино | выпускник ВГИК | основатель бренда одежды CNSTRCTR | снимался в «Универ. 15 лет спустя», «Кузя. Путь к успеху», «Полицейский с YouTube», «Солдаты», «Полярный» «Как использует ИИ индустрия кино в РФ» Обсудим, как ИИ уже используется в киноиндустрии: где он помогает, где вызывает сопротивление, какие задачи действительно закрывает, а где пока остаётся игрушкой. 📆 Когда: суббота, 11 июля 🕛 Время: 12:00 📍 Место: МИРА бистро, Тверская ул., 16, стр. 1 Вход со стороны метро «Тверская» / «Пушкинская» Бронь на имя Александр ODS. Ставьте 👍, если планируете прийти — будет полезно понимать примерное количество людей. Буду рад увидеться!

  • Оффер на Senior Data Science роль за 1 неделю — реально? 🚀 Да. Авито запускает Fast Track — ускоренный отбор для Senior и Senior+ Data Science специалистов. Одна неделя на все технические этапы и финал → оффер в классифайд №1 в мире по количеству пользователей. 📅 Основные этапы — 20–26 июля. Регистрация по ссылке открыта до 15 июля, 23:59 МСК. Как проходит: 🟣 До 15 июля — заявка + HR-скрининг 🟣 До 24 июля — техническая секция (ML-теория + Python) 🟣 25 июля — ML System Design 🟣 26 июля — финал 🟣 До 28 июля — оффер Преимущества фаст-трека: 🟣 Быстрый отбор и совмещённые этапы 🟣 Все даты известны заранее 🟣 Возможность оценить свои скилы — результат закрепляется на год Кого ждут: 🟣 От 4 лет опыта в крупных российских и международных IT, BigTech и FinTech компаниях 🟣 Полный цикл разработки моделей — от ресёрча до выкатки в прод 🟣 От 1 года самостоятельного лидирования проекта, автономность и инициативность Команды на выбор: антифрод и модерация, монетизация и реклама, поиск и рекомендации, вертикальные DS-команды. ⏳ Регистрация — до 15 июля. Успей оставить заявку. Рекрутеры проведут тебя через все этапы за рекордно быстрые сроки!