Datalytics
СтатистикаКанал для аналитиков данных про Python, карьерное развитие в анализе данных, всякое разное Автор – @ax_makarov Отдельный канал про ChatGPT и его практическое применение — @ai_forge Чат канала — @pydata_chat Вакансии — @data_hr
- Последний пост
- 12 авг.
- Последнее чтение
- 17:56
- Постов за неделю
- 1
- Всего постов
- 22
- Тип
- открытый
- Язык
- русский
- Категория
- Карьера
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 368
- 1/48двое суток
- 421
- 1/72трое суток
- 454
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
🔥 Подборка-сохраняшка самых полезных эфиров с канала. В этом году у нас 3 фокуса - разборы резюме, мок - собесы, анализ рынка от клиентов Этот пост будет постоянно актуализироваться новыми ТОПовыми статьями, подписывайтесь, чтобы не потерять! • разборы резюме • мок собесы (вы очень просили на последнем эфире) • офферы 📹 ЭФИРЫ - РАЗБОРЫ РЕЗЮМЕ 🔴Разборы резюме project manager 🔴Разборы резюме product manager (эфир с нанимающим) 🔴Разборы резюме аналитики (разные) 🔴Разборы резюме разработчиков (эфир с нанимающим) 🔴Разборы резюме. Project, Delivery, Analyst, Developers (эфир с нанимающим) 🔴RTE, Scrum master, Agile Coach - кто все эти люди?) 🔴Разборы резюме управленцев. РМО, СТО, CIO, СРО, СМО 📹 ЭФИРЫ - МОК собесы 🔴МОк собес на проджекта 🔴МОК собес на продакта 🔴МОК собес на аналитика 1С 🔴МОК собес на аналитика (бизнес/системный) Дополнительно: 🔴Что происходит на рынке труда прямо сейчас - рассказывают мои клиенты, с функциями РМО/ СТО / delivery / ФА 1С 🔴Как повысить ЗП на текущем рабочем месте 🔴пошаговая схема, как выйти на 1 млн руб в найме 👀 КТО? СКОЛЬКО ПОЛУЧАЕТ? Все наши каналы с анонимными историями по ЗП аналитики, проджекты, продакты, разработчики, HR 💵 Офферы и истории 🔴Оффер на 14,6 млн в год на Head of engineering за 5 месяцев 🔴Куда расти аналитику, который достиг стеклянного потолка 🔴Оффер на продакта на 930к по году!!! 🔴Оффер на Project manager на 575к 🔴32 оффера в апреле 🔴47 Офферов в МАРТЕ Запись на бесплатную КАРЬЕРНУЮ ДИАГНОСТИКУ, чтобы примерно прикинуть свои шансы на рынке труда: по ЗП, роли, оценить сроки на поиск https://forms.gle/W6jTrFNDtgvJakte8
📊 Глубокое погружение в профессиональные инструменты на реальных проектах. Записывайтесь на курс «Системный аналитик. Экспертный уровень». 🎁 Учавствуйте в 3 бесплатных вебинарах — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам! 6 августа, 20:00 мск — «Пользовательские сценарии (Use Cases) на реальном примере»: от бизнес-требования до задачи разработчику. Анализ требований, создание Use Cases, связь с разработкой, Q&A. 13 августа, 20:00 мск — «Управление данными в MSA»: цена ошибок дублирования данных, оптимизация инфраструктуры и выбор БД (SQL vs NoSQL), единый глоссарий и контракты данных без бюрократии, требования к качеству данных для ИИ, чтобы модели не «галлюцинировали». 20 августа, 20:00 мск — «Аналитическая дженга»: как проектировать и управлять изменениями системы через BACCM, (4+1) и C4, чтобы архитектура не рассыпалась. Записывайтесь Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576, www.otus.ru
Приглашаем аналитиков на встречу с командой Алисы и умных устройств 26 июля проводим Welcome Time* — неформальную офлайн-встречу. Расскажем о «внутрянке» проектов, поделимся экспертизой и ответим на ваши вопросы. 💠 Приглашаем датасаентистов, дата-аналитиков и ML-аналитиков с опытом работы на Python от трёх лет и опытом с LLM. ⏬ На встрече можно будет пообщаться с командой и коллегами из индустрии, а также по желанию пройти диагностику навыков по Python и SQL. На диагностике интервьюер подсветит ваши сильные стороны и покажет зоны роста. Хороший результат можно будет зачесть как одну техническую секцию, если решите пройти собеседование в Яндекс. ♾ Подробная программа и регистрация — на сайте: https://yandex.ru/project/events/welcometimes-all
видео или голосовое, без подписи
📊 Данные сейчас растут быстрее, чем компании успевают под них перестраиваться. Поэтому всё больше переходят на Lakehouse — архитектуру, которая совмещает гибкость Data Lake и надёжность классического хранилища данных. Почему это важно прямо сейчас: переход на Lakehouse в среднем снижает затраты на инфраструктуру на 40% и ускоряет получение аналитики с недель до дней. А ещё 85% компаний уже строят на Lakehouse свои ИИ-модели — без такой платформы AI-проекты просто не на чем разворачивать. В России эта технология только набирает обороты, поэтому специалисты, которые умеют такие системы проектировать и разворачивать, — на вес золота. Yandex Cloud предлагает два экзамена, чтобы подтвердить это официально: 1⃣ Data Engineer — базовый экзамен для тех, кто работает с данными на Yandex Cloud: загрузка, хранение, обработка данных, оркестрация ETL/ELT-процессов. Рассчитан на специалистов с опытом работы от 6 месяцев, 50 вопросов, 90 минут. 2️⃣ Lakehouse Data Engineer — продвинутый экзамен для тех, кто уже проектирует и разворачивает решения на архитектуре Lakehouse. Для специалистов с опытом работы от 2 лет, 30 вопросов, 45 минут. 🎓 На оба экзамена — скидка 50%, если успеть зарегистрироваться до 25 сентября 2026.
⚡ Почему аналитики данных так востребованы и как стать аналитиком в 2026 году? Большинство новичков совершают одну и ту же ошибку: учат всё подряд. SQL, Python, Power BI, статистика… Но работодатели оценивают кандидатов не только по базовым навыкам, но и по другим критериям. Из-за этого многие месяцами рассылают резюме и получают только отказы или полное игнорирование. Андрон Алексанян - аналитик с опытом 9 лет и СEO Симулейтив проведет бесплатный урок и покажет, как выглядит путь к первой работе аналитиком в 2026 году. Вы узнаете: 🔶Какие навыки действительно проверяют на собеседованиях; 🔶Что должно быть в портфолио, чтобы его открывали работодатели; 🔶Почему многие резюме аналитиков сразу отправляются в отказ; 🔶Как искать работу без коммерческого опыта; 🔶Какие преимущества есть у кандидатов после 30, 40 и даже 50 лет; 🔶Какие ошибки чаще всего мешают получить первый оффер. Дополнительно на эфире разберем реальные примеры резюме и портфолио кандидатов, которые смогли пройти отбор. 🎁 ПОЛУЧИТЕ 3 КУРСА (PYTHON, SQL, PANDAS) В ПОДАРОК ЗА РЕГИСТРАЦИЮ НА ЭФИР! Эти курсы - база для того чтобы вкатиться в профессию! Если вы хотите войти в аналитику и перестать тратить время на лишнее обучение — этот урок поможет понять, на чем действительно стоит сосредоточиться. 🛎️Регистрируйтесь, эфир совсем скоро!
Совместная магистратура Авито и МФТИ — начните карьеру в Data Science! Будущие магистранты, это для вас — бесплатная программа «Прикладное машинное обучение и анализ данных». Готовьтесь получить актуальную теорию по ML, писать диплом под руководством эксперта Авито и выйти на рынок топовым DS-специалистом. Вас ждут: — Востребованные навыки в Data Science, преподаватели из индустрии и практические задания, основанные на реальных задачах Авито. — Работа с реальными данными и помощь с диссертацией от экспертов компании. — Комьюнити и поддержка, ведь поток — всего 18 человек, чтобы уделить внимание каждому. Будем много нетворкать и обмениваться опытом! — Бесплатное обучение и стипендия лучшим студентам до 25 000 ₽ в месяц. А еще — шанс попасть на оплачиваемую стажировку в Авито с перспективой остаться в команде! Если владеете Python, знаете структуры данных и SQL — это знак, что пора подаваться в магистратуру от Авито и МФТИ. Успейте до 12 июля!
Присаживайся на диван к аналитикам Авито 👀 Команда AvitoTech запустила проект «Диванная аналитика». Это серия материалов, где специалисты из Авито рассказывают, как принимают решения в одной из крупнейших экосистем страны. Если ты работаешь с данными, то вот 3 причины зайти на лендинг прямо сейчас: 1️⃣ Все выпуски опираются на реальный опыт — аналитики рассказывают о том, что уже применили у себя и что сработало. 2️⃣ Царит приятная атмосфера: по сути, все видео — это недушные мини-лекции с наглядной презентацией. 3️⃣ Разбираются разные темы — от ML до стратегического планирования. Контент может пригодиться опытным аналитикам и менеджерам, которым надо говорить с командой на одном языке. Смотри готовые выпуски и подпишись на новые — телеграм-бот пришлёт уведомление о новом видео! Посмотреть, что там интересного
🔥 Okko Analysts’ One Day Offer* — твой шанс попасть в команду аналитиков Okko 🛎️ Регистрация скоро закроется: подать заявку можно только до 28 июня, 23:59 МСК. 😁 Okko ищет продуктовых и дата-аналитиков уровня middle+ и senior. ✅Подходит, если у тебя есть опыт в аналитике от 2 лет, ты уверенно работаешь с SQL, Python, BI-инструментами, умеешь быть партнёром для бизнеса и понимаешь влияние задач на продукт. Твои возможности в Okko: 👉 Работа в удобном формате — гибрид или удалённо 👉 Забота о здоровье — ДМС со стоматологией 👉 Льготные условия ипотеки в рамках зарплатного проекта 👉 Задачи, которые влияют на миллионы зрителей 👉 Комьюнити, внутренние активности и многое другое 📎Подробнее об условиях, этапах интервью и возможностях работы в Okko — на сайте. 📌 Подай заявку до 28 июня, 23:59 МСК по ссылке. * Okko Analysts’ One Day Offer — формат быстрого найма для аналитиков от Okko.
Гарантируем вам трудоустройство в аналитике уже в 2026 году! Ребята, если вы давно смотрите в сторону аналитики или хотите прокачаться как специалист, для вас есть классная новость: сейчас ваше время сделать первый шаг! Симулейтив гарантируют ваше трудоустройство и берут оплату только после вашего трудоустройства! Данных вокруг всё больше, бизнесу нужны люди, которые умеют превращать цифры в решения. И именно этим занимаются аналитики данных - профессия, которая стабильно востребована уже много лет и не собирается сдавать позиции. Курс-симулятор «Аналитик данных» от Simulative Что внутри: ➖12 модулей: SQL, Python, BI, статистика, продуктовые метрики и не только; ➖Практика на реальных кейсах, которые помогут нарастить ваше портфолио; ➖Свободный формат, можно легко совмещать с другой учебой или работой; ➖Наставники, которые реально помогают и ведут за руку; ➖Рекомендации по составлению резюме и поиску работы; ➖Возможность трудоустройства сразу после курса. Кому будет полезно: 1. Тем, кто хочет войти в аналитику с нуля; 2. Тем, кто устал от своей текущей работы и хочет получить новую профессию; 3. Тем, кто начал учиться самостоятельно, но нуждается в системном обучении. Simulative сейчас дают возможность получить грант на обучение и гарантию трудоустройство своих студентов! 🔗 ПОЛУЧИТЬ ГРАНТ НА ОБУЧЕНИЕ
Почему AI-агенты ошибаются, даже если у них есть доступ ко всем данным? 🤖 Многие компании уже экспериментируют с AI-агентами для поиска информации, аналитики и работы с корпоративными знаниями. Однако на практике доступ к данным еще не гарантирует качественный результат. Причина часто кроется не в самой модели, а в архитектуре данных: отсутствует семантический слой, бизнес-логика не формализована, а данные не готовы к работе с ИИ. 📆 23 июня в 11:00 мск компания Lasmart приглашает на бесплатный вебинар «Почему 90% данных не готовы к работе с ИИ: архитектурный фундамент AI-агентов». 👨💻 Спикер: Павел Хамрин — руководитель AI-направления Lasmart. Более 10 лет занимается внедрением аналитических решений, DWH и BI-систем, развивает практики применения AI в аналитике и работе с данными. В программе вебинара: — почему прямого доступа к данным недостаточно для AI-агентов; — откуда берутся «галлюцинации» при работе с корпоративными данными; — зачем нужен семантический слой; — какие компоненты включает AI-Ready архитектура; — как подготовить DWH, BI и корпоративные данные к работе с ИИ; — практическая дорожная карта внедрения и масштабирования AI-агентов. Вебинар будет полезен CTO, CIO, CDO, руководителям AI-проектов, Head of BI, Head of Analytics, архитекторам данных и специалистам, отвечающим за развитие корпоративной аналитики. 🎁 Бонус участникам — персональный разбор стека данных и рекомендации по подготовке архитектуры для запуска AI-агентов. 🔗 Регистрация по ссылке
Лучший аналитик — ленивый аналитик Если вы когда-нибудь пользовались Авито, то знаете, что в сервисе есть доставка. Она платная, зато удобная: можно купить вещь в городе на другом краю страны. Чтобы рассчитать цену на неё, нужно учесть много деталей: категорию товара, службу доставки, города, скидки и комиссии. Нужно найти такую стоимость, чтобы и бизнес не ушёл в минус, и покупателю с продавцом было выгодно. Эту задачу решал аналитик Илья Цедяков, и в новом выпуске «Диванной аналитики» он рассказал, как подходил к работе: 1️⃣ Сначала оценил исходный алгоритм и его проблему медленной работы. 2️⃣ Затем попробовал эволюционный алгоритм — скорость стала отличной, но упала точность. 3️⃣ В итоге подход пересобрали при помощи линейного программирования. Подробный рассказ о том, как разрабатывали новый алгоритм, смотрите в свежем выпуске «Диванной аналитики»: 📌 YouTube 📌 VK Видео
AI-компании начали менять токены на доли в компаниях В мае 2026 OpenAI предложила каждому стартапу текущего батча Y Combinator $2M в API-токенах за долю. И токены — не по себестоимости: маржинальная стоимость инференса в разы ниже розничной цены, по которой считается сделка Но дело не в том, что инференс дёшев. Инференс стоит денег — GPU, электричество, мощности. Дело в другом: эти мощности и так бы крутились. OpenAI отдаёт то, что и так производит Но обычно он продаёт инференс за деньги. Разовая сделка, конец. А здесь он отдаёт тот же инференс — и берёт долю Стартап не может обналичить токены. Не может потратить на зарплаты, на аренду. Токен тратится только на инференс — то есть обратно у OpenAI. И тем же инференсом стартап строит свой продукт быстрее. Тот самый продукт, долей в котором OpenAI теперь владеет Это как если бы магазин давал тебе кашу, от которой ты лучше работаешь, и брал за это долю твоей выросшей зарплаты Токен из операционного расхода становится капитальной валютой. Расход остаётся расходом — мощности всё равно горят. Меняется то, чем он становится: долей в будущем, которое сам же производишь Один и тот же токен и товар, и доля: стартап потребляет товар, OpenAI владеет долей Это уже было. В конце девяностых Cisco, Lucent и Nortel давали телеком-стартапам оборудование в долг и брали долю — стартапы на это оборудование строились, вендоры росли вместе с ними И если довести до конца — это уже не про один батч и не про $2M. Если инференс — это сырьё, то поставщик сырья берёт долю в каждом, кто из сырья что-то строит. Как если бы электрическая компания владела долей в каждом заводе, работающем на её токе Тот, кто владеет вычислениями, начинает владеть тем, что на вычислениях построено
Как вкатиться в аналитику, с зарплатой в 3 раза выше, чем у остальных 2026 году❓ Если следовать обычному треку развития карьеры аналитика, рост зп будет медленным и постепенным. К тому же во время кризисов бизнес, хуже нанимает и чаще сокращает тех, кто не расширяет свой стек и не прокачивает знания вокруг основной области. Все это не относится к фулл-стек аналитикам, доля вакансий которых активно растет в общей массе вакансий аналитиков. В связи с этим приглашаю вас на эфир 📉📉📉📉📉📉 📹 На эфире будет разобрано: — Почему рынку реже нужны узкие специалисты и чаще — fullstack-аналитики — Как войти в профессию с нуля и устроиться на работу быстро — Кому подходит fullstack-путь, что нужно изучить и как новичку дойти до оффера Эти и ещё кучу важных вопросов для вас разберёт Илья Ковалёв - лид команды клиентской аналитики в Dodo Brands. Илья нанимает аналитиков и проводит собеседования: знает, что реально требует рынок в 2026 🎁 Всем зарегистрировавшимся на вебинар мы пришлют видеоурок по собеседованиям и карту компетенций fullstack-аналитика. 📊 Зарегистрироваться бесплатно
⚡️Вышло новое исследование Self-Service-круг Громова 2026 Оно показывает, как российские платформы помогают бизнес-пользователям работать автономно во всей архитектуре данных, а не только в BI. В отчет вошло 20+ российских решений: от BI, ETL и IBP-систем до облачных сервисов и платформ по работе с семантическим слоем. Среди которых: Yandex DataLens, Modus BI/ETL, Loginom, Dat. ax, DataForge,Visiology, PIX BI, Rapeed и другие. ➡️Отчет поможет понять: – где self-service – реальная управляемая модель, а где – набор разрозненных функций или маркетинговая декларация, – какие элементы инфраструктуры критичны и как безопасно интегрировать AI, – как балансировать свободу пользователя и управляемость среды. ➡️Особое внимание уделено: – AI в self-service: без бизнес-контекста AI может давать убедительные, но неверные ответы. – и семантическому слою: пользователю недостаточно просто дать доступ к данным; нужно зафиксировать показатели, правила расчета, связи и ограничения интерпретации. 📌Исследование Self-Service-круг Громова 2026 основано на анализе документации и тестировании систем. Полный отчёт доступен на сайте центра «Круги Громова» – скачать бесплатно! Используйте готовые ориентиры для оценки зрелости self-service в вашей компании. Круги Громова | Подписаться и стать частью Data-сообщества ⬅️ #КругиГромова #ИИ #AgenticAI #SelfService #SemanticLayer
У вас проблемы с визуализацией графиков в Python? Моя новая книга по Seaborn уже вышла и доступна для покупки всего за 1199 руб! Друзья, я написал свою третью книгу, и она посвящена графической библиотеке Seaborn в Python (фотки в предыдущем посте)! Полгода назад мне попалось одно иностранное издание про Seaborn, я сначала хотел его перевести, но в итоге написал собственную книгу, в которой подробно описал библиотеку Seaborn. А изюминкой книги стал полный экскурс в новый объектный интерфейс seaborn.objects, который вышел не так давно и навсегда изменил методику создания графиков в Python. Если при работе в Python у вас постоянно возникают проблемы с тем, чтобы построить тот или иной график или диаграмму, и вы идете в интернет за примерами, то эта книга – для вас! После нее вы будете двумя-тремя строчками кода визуализировать все что угодно! 350 страниц в цвете позволят вам полностью погрузиться в мир простой и понятной визуализации данных, а в качестве бонуса – два проекта с визуализацией t-критерия Стьюдента и созданием простой сверточной нейросети. Ознакомиться с фрагментом книги и купить ее вы можете в моем боте (@alexanderginko_books_bot), нажав на кнопку Купить книги, или по ссылке ниже: Ссылка: https://www.dmkpress.com/catalog/computer/programming/python/978-5-93700-404-8/ Промокоды: Бумажная версия: промокод (22%) Ginko_Seaborn_paper (1247 руб) Версия PDF: промокод (25%) Ginko_Seaborn_PDF (1199 руб)
Данные давно перестали быть только инструментом аналитиков — сегодня они влияют на продукты, клиентский опыт, риски, эффективность и стратегические решения. 9 июля на Форуме Data Day эксперты и практики по работе с данными и ИИ из Сбера, Т-Банка, ГПБ, ВТБ, Альфа-Банка, X5 Tech, Ozon Fintech, Lamoda, ДОМ РФ и других компаний расскажут, как данные и искусственный интеллект помогают ускорять бизнес в финтехе, ритейле, промышленности, транспорте и агросекторе. В программе форума: ✅ Тренды AI и данных «из первых уст». На какие технологии и подходы делают ставку лидеры рынка? ✅ Как превратить хаос данных в надежный бизнес-навигатор и сделать данные стратегическим активом компании. ✅ Практика внедрения AI и data-driven подходов в финтехе, ритейле, логистике, промышленности и агросекторе. ✅ Как находить новые точки роста, используя опыт цифровых лидеров и сильные data-команды. ✅ AI-hub: выставка и центр экспертизы готовых AI-решений и автономных агентов для бизнеса. Выступают: – Руслан Булатов, директор Департамента финансовых технологий, Банк России – Алексей Бондаренко, Газпромбанк, вице-президент — начальник департамента управления данными. – Артём Летин, ВТБ, начальник управления моделирования КИБ и СМБ, вице-президент – Дмитрий Рузанов, Альфа-Банк, директор департамента разработки моделей. – Валерий Поляков, Т-Банк, лидер по данным группы Т-Технологии (Chief Data Officer). – Александр Лукьянов, ДОМ РФ Технологии, генеральный директор. – Павел Денисенко, X5 Tech, директор департамента развития платформы больших данных. – Екатерина Демкина, Банк России, заместитель директора юридического департамента. – Дмитрий Криволапов, Lamoda, директор департамента по данным и аналитике. – Андрей Скачёк, М.Видео, директор по маркетингу И другие. Вас ждет самый масштабный Data Day: 🔥 6 отраслевых треков (Финтех, Агропром, Транспорт и логистика, Промышленность, Ритейл, Персональная эффективность) 🔥 1500+ участников 🔥 60+ спикеров Присоединяйтесь! Форум соберет экспертов по данным и AI из банков, ритейла, телекома, транспорта, агропрома, ИТ-компаний и индустриальных лидеров. 👉 Программа и регистрация
⚡️ Стек собран — а оффера всё нет? Самый бесячий парадокс аналитика в 2026. Знаешь SQL на уровне оконок и CTE. Задачки с собесов Т-банка щёлкаешь за вечер. По технике — молодец. А на финальных этапах что-то идёт не так. И в какой-то момент уже не понимаешь — это со мной что-то не так или рынок просто сломался ⚙️ Заходите на бесплатный эфир, на котором не будет информации «как стать аналитиком за 30 дней», но будет подробный разбор карьеры аналитика и то как им стать в 2026 году. Ведет Андрон Алексанян — CEO школы аналитики 📉📉📉📉📉📉, 8 лет в аналитике, работал с крупнейшими компаниями РФ и мира. Что обещают разобрать: 🔶Как реально устроен вход в аналитику в 2026 🔶Как думают нанимающие менеджеры — и что прямо бесит их в резюме 🔶Какое портфолио сегодня реально смотрят (спойлер: пет-проекты с Kaggle уже никого не впечатляют) 🔶Почему кандидаты с меньшим стеком получают офферы первыми — и как этим воспользоваться 🔶Ну и про возраст 30 / 40 / 50+ тоже разберут — есть ли смысл стартовать сейчас Вообще нравится, когда люди объясняют, как сегодня реально устроен найм и что у нанимающих в голове. Плюс всем зарегистрировавшимся дают урок по прохождению собеседований — обычно он только в платных курсах. Эфир стартует уже совсем скоро! 📊 Зарегистрироваться бесплатно
⚡ А вы полагаетесь на случайность при делении на тест-контроль? В среднем рандом должен дать идеальный баланс по всем — даже ненаблюдаемым — признакам между тестовой и контрольной группой. Но конкретный АБ-тест — это конкретные тест и контроль. Поэтому случайное распределение на группы наверняка окажется несбалансированным, что приведёт к проблемам с интерпретацией результатов теста. Итог — неверные бизнес-решения. Андрей Романов, тимлид команды аналитики Sales Tech, преподаватель и ментор по AБ-тестам, расскажет: 🔸 почему случайное деление на группы — это не лучшая стратегия; 🔸 по каким метрикам балансировать группы и каким алгоритмом это можно сделать; 🔸 как балансировка влияет на чувствительность тестов. И всё это — на реальных примерах и цифрах из эксперимента, где рандом дал дисбаланс. Это новый выпуск «Диванной аналитики» — серии видео, в которых аналитики рассказывают об опыте Авито. Смотреть: VK YouTube
Как по всему GPT расползись гоблины В общем, у чатагпт есть разные настройки личности. Одна из таких личностей — это «Nerdy». По-нашему, ботан. Модель в этом режиме становится излишне занудной, но при этом такой а ля глубокой и игривой. Её ключевая фишка в том, чтобы пользователь посмотрел на мир с немного странноватой и несерьезной точки зрения Когда обучают модели, то используют разметку — либо автоматическую, либо ручную. Как оказалось, на этапе разметки датасета для личности «Nerdy» хорошие оценки ставили таким ответам, в которых есть какие-то фантастические твари типа гоблинов, единорогов и троллей. Это не то, чтобы специально произошло, то есть в инструкции не было явно указано: если ответ содержит «гоблина» — ставь лайк. Но по какому-то стечению обстоятельств именно такие ответы больше цепляли разметчиков Как итог режим «Nerdy» стал питать исключительную слабость к сказочным долбаебам существам. Проблема тут в том, что модели не обучают под каждый режим отдельно — есть единая «тушка», которую обучают под все режимы сразу. Слишком дорого было бы обучать под каждый профиль отдельную модель. Потом системный промпт задаёт контекст, который смещает вероятности следующих токенов, нужных для качественной работы в стиле «ботана» Отдельно стоит заметить про техническую особенность обучения, которая сделала эффект таким сильным. Когда модель обучают, то часто используют так называемые rollouts. Это процесс, при котором модель генерирует примеры, которые дальше размечаются и идут в обучение. И вот тут самый цимес: модель «инфицированная» гоблинами начинает чуть чаще создавать генерации с гоблинами → эти ответы проходят оценку и получают балл выше по каким-то другим причинам (например, структура и детальность ответа) → попадают в обучающие данные → модель начинает вставлять гоблинов ещё чаще. И дальше по кругу: в rollouts гоблины встречаются ещё чаще В результате этого обычная GPT 5-1 (без включенного режима «ботана») начала выдавать слово «гоблин» сильно чаще чем это нужно: использование слова «goblin» выросло на 175% (а «gremlin» — на 52%, какая-то незаслуженная дискриминация гремлинов). Это при том, что доля ответов ChatGPT с помощью личности «Nerdy» составляла всего 2,5% и давал 66% всех упоминаний слова «гоблин» по всем диалогам чатагпт Как финал «гремлинов» и «гоблинов» почистили (и заменили на марсиан и рептилоидов) — саму личность «Nerdy» убрали, а обучающие данные отфильтровали. Ещё при анализе в GPT-5.5 нашли целый зоопарк — еноты, тролли, орки и голуби (в чем магия голубей не знаю). В OpenAI признают, что GPT 5.5 обучался всё ещё на этом зоопарке, поэтому пришлось запилить отдельную инструкцию, которая подавляла бы гоблинов и прочую живность Мораль сей басни в том, что этот механизм может проявится не только в виде «гоблинов». Опаснее, когда у нас появляется устойчивая предвзятость, которую не так просто обнаружить, например, какой-то не очень полезный совет в рамках ответов на медицинские вопросы пользователей. И для меня эта история — сильная иллюстрация того, что любые модели искусственного интеллекта — это прежде всего набор статистических закономерностей. Они не «понимают», они оптимизируют то, что им явно указали, но при этом «схватывают» и неявное, а объяснить что именно «схватили» — не могут. И получается, что от качества обучающих выборок и процесса дальнейшей валидации на стороне провайдера (в данном случае OpenAI) будет зависеть будет ли ответ на важный для вас вопрос, сделанный с помощью ChatGPT, пестрить гоблинами, павлинами и прочими дивностями или даже вредными советами