Dealer.AI
СтатистикаЖоский ИИ Дядя Твой личный поставщик AI 🦾🤖 Канал о мире интересного AI: теория, приклад и meme👾 Head of AI, AI-евангелист, AI-энтузиаст Для связи @dealer_ai (реклама и консультации по AI для бизнеса). РКН: 6348592885
- Последний пост
- 14 авг.
- Последнее чтение
- 09:04
- Постов за неделю
- 4
- Всего постов
- 30
- Тип
- открытый
- Язык
- русский
- Категория
- Бизнес
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 2 534
- 1/48двое суток
- 2 903
- 1/72трое суток
- 3 132
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Модели, агенты и будущее, которое уже наступило 👁 Во втором выпуске подкаста мы пригласили Александра Абрамова, Head of AI и автора Telegram-канала Dealer․AI, чтобы поговорить о мире ИИ — от практики до агентной экономики и будущего технологий. В программе: ▶️Нейропластичность и какие еще навыки сегодня важно развивать ▶️Можно ли доверить свой бизнес полностью ИИ-агентам ▶️Перспективы агентной экономики ▶️Парадигма обучения ИИ ▶️Токен-экономика и как оптимизировать расходы ▶️ИИ в кино, новые профессии и наше будущее Смотрите на удобной площадке: YouTube / VK Видео / Rutube
Про культурный код моделей и соответствие каким-то ценностям LLM. Мне много стали присылать в лс такую новость. 😬 Тлдр. Модели AI будут проверять на соответствие культурным ценностям, для получения звания национальных или суверенных. 😐 Я очень много писал о том, почему такие проверки сделать непросто. Вот пример. 🦻 Если коротко, на просторах сети мало русских текстов в отношении доли к английским. И тк модели учатся в тч на этих текстах, их доля там превалирует, ну иначе, вам не обучить модель на 700B параметров только на ру базе, это будет не оптимально. Да есть синта, соглашусь, но синта не даёт такой буст, как мультилингв данные. Таким образом, на этапе уже предобучения у вас лежит возможность сгенерировать не то, что соответствует культурном коду вашей страны. Особенно если перейти на запрос на английском или китайском языках. Что же с ру LLM? А теперь если посмотреть на все модели в ру сегменте, то это или Qwen-like модели, с инициализацией с весов (а значит часть информации уже лежало там с претрена китайцами), или модели, где 65%+ не ру дата в претрене. Отсюда остаётся вопросы: Как пройти проверку? Какие эксперты, на каких сетах и на каком языке будут проверять соответствие? В целом, тк уже на уровне языков в обучении можно пробить модель на чужой культурный код, то остаются только методы: - гвардов сверху и спец логики рядом, тот же RAG (если обстрел по апи), но это не модель уже а система - sft и RL элаймент модели под нужное поведение под сеты оценки, а я не уверен, что методология и сеты оценки будут закрыты от оцениваемых. И оба способа НЕ идеальны, тк и в гардах и sft/RL есть понятие OOV примеров, те запросов, которые модель никогда не видела и даже не смогла на уровне "эмерджентности" аппроксимировать. Те вас рано или поздно пробьют всеравно. А ещё есть галлюцинации... 🚬 Таким образом, пройти проверку можно, есть и хаки, и честные способы, но и есть понятные причины рисков. И будет жутко интересно, особенно, когда какая-то модель пройдёт тесты, а потом в какой-то соц сети её пробьют, выложат скрины и скажут, ну как так. Что уже не раз бывало. 👍 #ИИзнанка
Матрица уже здесь? 😆 Пришла моя любимая тема симулякров в тренд. Вместо пары сотен тестировщиков – миллиарды виртуальных пользователей со своими характерами, привычками и тараканами. Всё в одной инфраструктуре – MatrAIx ⚠️ Что внутри: - 8,3 млрд персона-профилей - 1 290 характеристик на каждого - 1 010 сценариев в 25+ сферах (от софта до медицины) - 4 среды: опросы, чаты, веб, приложения - ~1 млн открытых персон для исследований Авторы прогнали 18 189 испытаний на GPT‑5.5, Claude Opus 4.8 и Claude Haiku 4.5. В 91,5% случаев поведение виртуалов точно соответствовало заданным чертам. Не иллюзия, а симуляция. Суть простая: хочешь проверить новую цену, задержку ответа или интерфейс – опрашивай не сотню живых людей, а миллионы цифровых двойников. И получай статистику, которая раньше требовала космических бюджетов. Такой вот он-лайн АБ тест 😜 Это не просто тестирование – это шаг к полноценным симуляциям общества. Цифровые клоны человечества уже среди нас. 🆒 📄 Paper: https://huggingface.co/papers/2608.04205
Dealer.AI pinned a file
Уже начали
Скоро наступят выходные и у Вас будет шанс пообщаться с 📦 лично. Буду ждать Вас 8.08 на ИТ пикник от Тбанк, где в зоне отдыха ВкусВилл проведу небольшую открытую сессию ответов на вопросы (всего час времени). Начало сессии в 15-00. За лучшие вопросы даём мерч.…
Dealer.AI pinned «🕸 "не проиграл - он вышел из гонки ИИ добровольно"(с) С такого тезиса начинает автор статьи. Основные тезисы: 1. OpenAI и Anthropic вышли на петлю самоулучшения (RSI). 📈 RSI-концепция – модель А создаёт модель Б, которая создаёт модель В, и так далее по…»
Скоро наступят выходные и у Вас будет шанс пообщаться с 📦 лично. Буду ждать Вас 8.08 на ИТ пикник от Тбанк, где в зоне отдыха ВкусВилл проведу небольшую открытую сессию ответов на вопросы (всего час времени). Начало сессии в 15-00. За лучшие вопросы даём мерч. 👍 Ждём Вас!
🕸 "не проиграл - он вышел из гонки ИИ добровольно"(с) С такого тезиса начинает автор статьи. Основные тезисы: 1. OpenAI и Anthropic вышли на петлю самоулучшения (RSI). 📈 RSI-концепция – модель А создаёт модель Б, которая создаёт модель В, и так далее по…
🕸 "не проиграл - он вышел из гонки ИИ добровольно"(с) С такого тезиса начинает автор статьи. Основные тезисы: 1. OpenAI и Anthropic вышли на петлю самоулучшения (RSI). 📈 RSI-концепция – модель А создаёт модель Б, которая создаёт модель В, и так далее по экспоненте. Их подход опирается на "горький урок" Ричарда Саттона: "грубая сила вычислений и масштабирование решают всё". 🧠 2. Сегодня те, кто сможет сделать модели топ уровня 2025-2026 годов, будут быстрее убегать от конкурентов и их уже будет сложно догнать. Это и есть "скорость убегания" (escape velocity) – скорость, необходимая, чтобы вырваться из гравитационного поля планеты и не упасть обратно. 🪨 Китайцы молодцы, но что же делать любителям суверенов и нац моделей. 😩 3. Google при этом "стоит в стороне" PR компаний Anthropic и openAI с RSI, но делает экзистенциальный выбор, цена которому или всё или ничего. Что это за выбор? Помимо удержания лидерства в поисковых технологиях и обучении своих LMок. 1. World models и VLA. Модели позволяющие имитировать и ориентироваться в физическом мире. Пример, Genie 3 – интерактивная модель мира, которая генерирует играбельные среды с интуитивной физикой. Это все то, что бустанет робосистемы и автопилоты на новый уровень. 2. Альтернативные архитектуры, нежели трансформер. Гуглы верят, что текущие модели предсказания следующего токена терминальная ветка. 📦 бы конечно добавил сюда диффузионки, JEPA парадигму и др, как потенциальные. Что они тогда имеют ввиду? Узнаем. ⏰ 3. Упор на AI for science и DeepMind. Проекты по сервисам для исследователей Co-scientist, модели AlphaFold3, Evolve, Genome и др. Итог. Это не соревнование моделей. Это битва двух теорий развития ИИ: · RSI → быстрая, но рискованная экспонента. · World Models → долгая, но фундаментальная игра. Что победит – узнаем через пару лет. А пока следим за архитектурными релизами DeepMind, и читаем презентацию с моего выступления на Urban ML conf во вложении ниже 👍
Я «отпилил» себе две ноги, чтобы стать senior tech manager’ом Мой руководитель в одном из интервью очень точно подметил динамику карьерного роста в корпорации: «чтобы перейти на новый уровень управления тебе нужно отпилить себе любимую ногу, которая тебя делает успешным на текущем уровне, и отрастить новую». Я очень люблю эту метафору именно за точность ощущений в процессе. В инженерных профессиях подавляющее большинство руководителей начинают линейными инженерами. Ты набираешь экспертизу, все ловчее справляешься со все более сложными проблемами, и вот однажды, тебе предлагают (или ты сам принимаешь решение) стать тимлидом. И в этот момент очень важно не обманывать себя: тебе предлагают много денег за то, что ты начнешь постепенно терять свою хардовую экспертизу, все больше погружаясь в организационные вопросы. Взамен ты получаешь проявленность в организации и больше власти. Худшее, что можно сделать в этой ситуации: это попытаться усидеть на двух стульях. Именно в таком сетапе рождаются микроменеджеры с пачкой джунов, которые «в соло держат небо на плечах». Не буду расписывать к чему это приводит, думаю вы и так таких ребят встречали. В крупных технологических компаниях это отлично понимают, и там есть понятие «терминального грейда», выше которого расти не обязательно - можно работать и заниматься любимым делом. А иногда и полезно вернуться на этот уровень из менеджмента, чтоб освежить тех скиллы (сам такое практиковал - жив здоров). Этот фазовый переход с отпиливанием инженерной ноги оканчивается примерно на уровне мидл-менеджмента, где ты уже ведешь группу команд. Ты уже окончательно попрощался с чисто-инженерными вопросами. Ты гораздо более силен в управлении людьми и проектам, становишься лицом крупных инициатив и на контакте с ключевыми бизнес лидерами. И после нескольких крупных побед в полный рост встает новая развилка. Выход в senior-level менеджмент предполагает очень важный сдвиг роли: тебе нужно уйти на вторые роли в конкретных проектах, и дать дорогу новому поколению лидеров. Теперь у тебя нет никакой возможности схватить штурвал инициативы и вытащить ее из канавы (потому что в это время на твоем уровне начнут решать вопросы без тебя). Твоя цель здесь - это сводить капитал с людьми, которые в состоянии его приумножить. Создавать для этого условия и управлять рисками. Уходить от ручного управления талантами в сторону создания систем, которые сами подымают талантливых людей вверх. Теперь нет никакого «твоего» успеха. Есть только успех твоих ребят. Это на самом деле очень сложная перестройка, от которой иногда нужно осознанно отказываться. Например, когда ты еще чувсьвуешь, что ты хочешь побыть на первых ролях в интересных тебе проектах ради опыта/портфолио. Или ты в принципе чувствуешь в себе драйв быть на острие классных продуктов и инициатив с возможностью сказать «я это сделал». Причин может быть много, но как и в прошлый раз попытка усидеть на двух стульях приведет к полному разочарованию. На мой взгляд правильная мотивация здесь - это искреннее желание поделиться опытом и взрастить людей, которые через какое-то время могли бы занять твою текущую позицию. Тогда новый уровень дохода поможет закрыть бытовые вопросы и даст больше уверенности в будущем, а сложности политики, стратегии и бюрократии будут понятной ценой, которую ты платишь, чтобы вырастить крутых лидеров.
Dealer.AI pinned a photo
Интересный случай продажи кота в мешке под соусом новой нац.модели. Открываем неделю с поста рубрики #ИИзнанка 😜 Да, да, знаю, что вышел Kimi3, читаю техрепорт, обзор будет позже. 📦 Вышла итоговая правка закона о развитии и поддержке суверенного ИИ. Максимально похудевший, где возможно, от фрейминга закон, дал почву бодрым кобанчикам для спекуляции в открытом поле. Теперь все пытаются залезть в нишу моделей среднего размера и назваться гордым именем "национальной" всея 🎉. При этом цимис понятен, b2g рынок (и бюджеты) - это золотая жила, прикоснуться хотят многие, однако можно случайно пойти по пути автоваза. Расскажу замечательную свежую историю о том, как не попасться на пустые инвестиции бодрым кабанчикам и что проверять, если вам предлагают "аналоговнет" за ХХмлн енотов. Кейс. Приходят к вам ребята с просьбой посмотреть на интересный проект и оценить потенциал инвестиций. Вы открываете презентацию и КП. А там: предлагаются новые модели, заявляется отличие от всех типовых transformers архитектур на рынке (llama, Qwen, Saiga, Vikhr и тп). При этом, заявляются размеры 9b, 35b, 122b; размер контекста более К млн токенов 🚬 Модели первой волны уже прошли К этапа обучения из М, но уже сопоставимы результаты с Claude 😜, но требуют дополнительных ХХ млн руб. (не млрд) инвестиций, чтобы показать всем кузькину мать и таки выйти на М этапов 💪. История собирательный образ, несёт образовательный смысл и все совпадения случайны. Итак, что вы должны сделать, чтобы провести фаст аудит: 1. Проверить размеры открытых популярных моделей на обнимашках. Тут мы видим, подозрительные совпадения с семейством Qwen 😐. А нам заявляют, что аналогов нет. Задумались. Ладно может совпадение и перед вами генИИ отрасли. Тогда идём к П2. 2. Просим тех.документы/добавить в репо/ссылку на патент или статью, или иную доказательную базу, естественно, под расписку, а лучше под NDA договор. Также важно запросить состав команды и их mindset, будет странно, если ребята делали раньше условный рексис, а сегодня они сами уже запилили грамотно К этапов обучения LLM, да так успешно, что аж на уровне Claude моделей. Не дают? Очень странное, ну может решают перестраховаться и мы идём к П3. 3. Допустим, вы понимаете, что модели аналоги Qwen, тогда в соответствии с scaling laws вы должны понимать сколько нужно пролить токенов данных, а значит шагов моделей на GPU, чтобы получить оптимальную сходимость для 9b,35b,122b. Те ваша модель на выходе будет адекватно работать. Отсюда же, вы можете посчитать сколько надо 💸 - это самое важное. Тут и спросите за бюджет, сколько gpu нужно, чтобы модель прошла все оставшиеся фазы и была prod ready, ну хотя бы MVP/PoC. Сколько токенов, gpu часов и тп. И увы если ХХХ млн не вписываются в создание заявленного числа параметров модели, gpu и gpu часов, то... В общем, получив такой чеклист, далее решать вам. 👍 Уже не говорю о том, что если внезапно это Qwen или аналоги, зачастую в открытом доступе уже лежат full обученные модели, прошедшие все этапы обучения, и сделать ещё сверху серьезный posttrain, расширить словарь и ничего при этом не сломать, требует компетенций и ресурсов. 😐 Удачи и stay tuned. 🦾 #ЖизаДня, #ИИнфоцыганство, #ДоверяйНоПроверяй А какие вы кейсы видели на своём опыте? Пишите в комментариях. 👇👇👇
Вот именно по следам этих кейсов и не только авторы статьи выше предлагают подход к оценке пользы от внедрения ИИ. OpenAI предлагает перейти к инженерному подходу - измерять не затраты на ресурс, а эффективность преобразования ресурса в полезный завершённый…
Если подумать, на многие известные популярные порталы ведутся атаки с помощью ИИ. Об этом мало говорят... Но именно сейчас в момент появления Fable, Mythos, внезапно, неожиданно, раскрывается атака на HF. С помощью продвинутой версии Sol модели... Больше хайпа, богу хайпа... Никак кроме, как пиар ходом это не назвать... Ждём ответку от китайцев или антропик. Мы продолжаем качать пузырь в эхо камере. 🚬 Все это, чтобы набрать классы (с) Upd. P. S. HF портал открытых моделей и логично, что закрываться будут публичной моделью китайцев. Это не только пиар китайской модели, но и в первую очередь защита OpenSource стратегии HF. 🧠
Dealer.AI pinned «Время на "мы просто пробуем ИИ" уже закончилось. Как измерять реальную ценность от внедрения ИИ? Именно с этого отрезвляющего тезиса стартует статья от OpenAI. Теперь вы не можете как в 2023-2024, а кто-то все ещё сейчас просто экспериментировать ради любопытства…»
Время на "мы просто пробуем ИИ" уже закончилось. Как измерять реальную ценность от внедрения ИИ? Именно с этого отрезвляющего тезиса стартует статья от OpenAI. Теперь вы не можете как в 2023-2024, а кто-то все ещё сейчас просто экспериментировать ради любопытства…
Время на "мы просто пробуем ИИ" уже закончилось. Как измерять реальную ценность от внедрения ИИ? Именно с этого отрезвляющего тезиса стартует статья от OpenAI. Теперь вы не можете как в 2023-2024, а кто-то все ещё сейчас просто экспериментировать ради любопытства, сегодня ИИ - это реальная производственная мощность, и нужно её измерять также, как электроэнергию или выч ресурсы. 📦 помнится, как оценивали качество от автоматизации ручных процессов или поддержки с ИИ: 1. Общий трафик DAU, MAU, WAU и тп. 2. Интерес, через возвращаемость ака retention rate. На самом деле, не так важно, что в первый день запуска вы вывалили большой трафик, как то, что если сервис полезен к вам будут возвращаться снова и снова. 3. Число принятых подсказок с ИИ - ака acceptation rate. К примеру, вы работаете с ИИ суфлером или код агентом копайлотом и вот число принятых подсказок по ответу оператора или коду можно было измерить так. 4. Польза в конечной бизнес ветке или ноде. Если вы работали с сценариями поддержки, на самом деле, автоматизация должна считаться не только числом закрытых вопросов в чате без перевода на оператора, но и измеряться закончился ли диалог на самом деле решением проблемы пользователя или он через час снова придёт с этой темой в чат (а тут уже retention rate работает против вас). Да это можно проксировать через CSI, NPS, но в век LLM и агентов можно верифицировать и без оценки человека, достигнуто ли было намерение юзера и решена проблема с которой он придёт. А ещё у нас была система штрафов за возвращаемость юзера по проблеме ещё раз в чат или к оператору. 5. Фин эффекты в лице ROI. Тут просто (на самом блин деле, ни фига не просто) отношение прибыли к затратам на ИИ сервис, фичу, решение, проект и тп. - скок заработали к тому сколько потратили на разработку, аммортиазцию железа и токены на эксплуатацию. Обычно измеряется в %, умножаетсы естественно на 100. Однако помимо этого, мало посчитать таким образом потенциал, ещё нужно посчитать срок окупаемости. ROI показывал, что мы имеем такой потенциал, а срок окупаемости за какое время мы его можем достичь. 6. Рост эффективности труда. Вот моё "любимое", что над именно считать на сколько уменьшится время на выкатку фичи, сервиса, продукта или нового кода/программы, ускорить принятие решения и тп. Ака Lead Time, Time to Market и аналоги. И да современный ИИ тут помогает. Почитали? Интересно? А теперь забудьте все не так радужно. Начну с ROI прям сразу - компании не умеют, а некоторые оунеры решений и не хотят считать это честно (не в смысле врут, а в смысле не все переменные учитывают). Часто в текущей реальности заканчивается оценкой скорости а-ля ТТМ, но никто не хочет посчитать деньги в конечной бизнес ноде. К примеру, вы смогли автоматизировать аналитику, сказали что ускоритель на К%, но почему-то не получаете оценку оборачиваемости капитала или out-of-stock (упущенные продажи) в денежках, на которые и повлияет ускорение принятия решения от внедрения ИИ. Но окей, вы посчитали это, но в знаменатель забудете положить кроме фот на разработку, ещё токен экономику и аммортизацию ваших мощностей (если они онпрем). Почти все не понимают, сколько токенов они будут кушатс. На самом деле, ну и не должны, вопрос ж в динамическом изменении этого, особено с МАС под капотом. Но раз тут у нас динамический показатель, то ROI не будет фиксой, как и поправки в срок окупаемости придётся вносить. Ну и мякотка, все хотят на старте это посчитать, а в вводных выше мы понимаем, что посчитать можно только по факту в начале (порой пальцем в небо) или за период (на конец отчетного), а без этого даже стартовать порой отказываются. Второе любимое это про экономию на ФОТ через автоматизацию. Ну тип дали людям огонь Claude Code и ща кааак начнём сокращать разрабов и экономить на дорогих манки кодерах. В итоге хороший agent developer с инструментом на max подписке кушает за себя и за Сашку. Те вы почти не экономите на ФОТ, тк сопоставимо тратите на токены.
Gemma4 техрепорт и честный omnimodal на 12b от 🕸 Вот ждал 📦, что будет пример в лоб, как кодировать без предобученных бэкбонов аудио, видео и картинок информацию и кидать в модель. Это и есть настоящее omnimodal, тк multimodal работает именно с доп моделями в своих модальностях + слой проекции. 😮💨 Ребята из 🏳️🌈 с выходом Gemma4 зарепортили инфу о такой модели. Теперь информация с разных модальностей кодируется напрямую в матрицы и проходит всего лишь слой эмбеддингов внутри модели без доп внешних clip'ов и тп. Почитать можно в тех репорте тут. 🤙 Как это работает детально: 1. Изображение. Не используется ни vit, ни clip, ни resnet. Только патчи 48x48х3 (rgb канал 🧠) в нарезке серией. После выпрямляется в flatten и эмбедится в плотном слое (чисто факторизация а-ля как в SVD и als). 2. Аудио. Никаких мелспектров, а только сырой PCM сигнал. Нарезка также по 40мс частотой 16кГц, выпрямление и снова проекция. Все это порождает эмбы токенов картинок и аудио, которые кормятся в слои внимания вместе с текст эмбами. Важный нюанс с позицией: Чтобы модель знала, где находится патч, инженеры не используют сложные 2D-RoPE эмбы. Они добавляют факторизованные координатные вложения - отдельные обучаемые векторы для координаты X и координаты Y, которые просто прибавляются к полученному токену картинки или звука. 🧠 Upd. Почему это все работает, но так просто и в лоб??? Да все гениальное просто, также, как с рексисом на матричной факторизации, дело в объёме проливаемой датки и подборе размеров слоев вложений. А далее уже дело больших данных и чисел. 💪 В общем, для меня это было самое интересное. Тк в остальном в мире уже видны лучшие практики, которые комбинируй как можешь: и по локально-глобальному вниманию, и по sparsed attention, и хаки с KV, rope, скрытое рассуждение (только тут оно не в латентах, а тупо скрывают тексты от юзера), и обобщенные слои с early exit для MTP (multi token prediction). Итого, читаем. Образовываемся и stay tuned 🦾
Dealer.AI pinned «Мы начинаем наш стрим "Харнесс будущего. Какой он?" Подключайтесь: https://youtube.com/live/LAUdN1-4mgI»