EDU
СтатистикаМои мысли про стартапы и продукты. Байрам Аннаков, фаундер and CEO onsa.ai - автоматизация B2B продаж Мой сайт: https://empatika.com Мой YouTube: https://www.youtube.com/BaykaAnnakov Мой LinkedIn: https://linkedin.com/in/bayramannakov
- Последний пост
- 16 авг.
- Последнее чтение
- 14:27
- Постов за неделю
- 5
- Всего постов
- 24
- Тип
- открытый
- Язык
- русский
- Категория
- Бизнес
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 2 021
- 1/48двое суток
- 2 316
- 1/72трое суток
- 2 497
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Готовишься иногда к customer interview, все продумал, с дружбаном обкатал; выходишь на звонок и сначала все идет по плану, а "потом бац и вторая смена " и оказывается, что у пользователя закешировалась старая версия продукта, и ничего не работает, а твой заумный JTBD вопрос разбивается о стенку реальности... В такие моменты чувствую себя тем мальчиком из эффекта бабочки, которому отец говорит: "Ты не Господь Бог, сынок". В общем, работаем. И не забываем
Как брейнстормить с людьми и AI? Недавно писал про проблему с подключением LinkedIn - решили покрутить ее с AI Natives на очередной брейнсторм сессии —> получилось очень результативно, поэтому поделюсь протоколом: 1) Владелец проблемы приносит цифры и факты, а не свои версии причин: например, я показал воронку подключения и сформулировал задачку на брейнсторм как "Как повысить долю юзеров подключающих LinkedIn?" 2) Раунд 1, 5 минут: пока еще не генерим решения, а пробуем переформулировать проблему: каждый молча написал по 2 переформулировки + параллельно мы попросили это сделать дружбана. В конце озвучиваем и голосуем Формулировка выше превратилась в: а) Как повысить уровень доверия к сервису на этапе подключения LinkedIn? б) Можно ли, имея те же данные, доставить пользу без подключения LinkedIn? Дружбан, к примеру, предложил такое: - Не «как повысить LinkedIn connect rate», а «как получить первый ответ от лида БЕЗ доступа к LinkedIn пользователя». - Не «как повысить конверсию одного Continue», а «как расщепить одно необратимое ДА на цепочку маленьких обратимых ДА». Важно: дружбана мнения мы заслушивали самым последним 3) Раунд 2, 9 минут: по 6 решений на каждую формулировку. К дружбану на opus подключили еще fable 5 & gpt 5.6 sol extra high —> из неожиданного на этом раунде было: a) залить список лидов в LinkedIn Matched Audiences и крутить на них рекламу —> тогда не нужно подключать LinkedIn b) дать денежную гарантию, что аккаунт не заблокируют в) сдвинуть ценность на генерацию списка, а не автоматизацию аутрича —> к тому же, к чему пришли, решая кейс по продуктовой аналитике - кстати, в воскресенье стартуем, можно еще присоединиться. 4) Раунд 3, 8 минут: еще 6 идей, но через линзы: - нулевой бюджет - тут забавно всплыла идея тупо спросить у юзеров, что их останавливает (чего не было в изначальном пуле идей) - х10 масштаб (что сломается, если проблема вырастет в 10 раз?) - сделай хуже, а потом инвертируй - чужой плейбук (как решил бы шустрый конкурент? Amazon? скамер?) - возьми чужую идею и сделай +1. Раунд дался тяжелее всем, зато оттуда пришло совершенно новое направление - оффлайн: курьер, который приедет и подключит LinkedIn 🤡; карта с OTP-чипом а-ля Тиньков и тп; отправить открытку потенциальному клиенту и тп 5) Далее уже дружбан кластеризовал 83 идеи в 8 кластеров - а ля "Reverse the vector - let them come to you" или "Deliver the value without LinkedIn" - , и мы проголосовали: 3 голоса, каждый помечается NOVELTY или IMPACT. «Новое для меня» и «сдвинет метрику» — разные вещи. Из интересного: дружбана мы тоже попросили проголосовать, но, если честно, его топ идеи нам как-то не особо зашли. Но может это от страха и потому что мы знали, что они от AI? 😉 (помните algorithm aversion) На самом деле у дружбана были крутые идеи, но почему-то в его топ они не попали Ряд идей мне особо зашли, обсудим в команде и возьмем в эксперименты - спасибо Илья К, Илья С, Кирилл М, Виталий М и Дмитрий Б! Такой брейнрайтинг, кстати, хороший способ снизить эффект общего знания, о котором я писал А вам какие идеи пришли в голову по этой проблеме?
Действие производит информацию Услышал это у Брайана Армстронга, основателя Coinbase - мне кажется, что это лучшее обьяснение как ограничений LLM, так и рычаг, чтобы они стали выдавать более качественный результат. Вообще, я заметил, насколько умственная - именно умственная - работа обычно занимает минуты в днях. Идея приходит, пока напильником обрабатываешь презентацию, или пытаешься отформатировать по ГОСТу свою дипломную. Большинство умственного результата, по моему мнению, получается благодаря всему тому действию МЕЖДУ думами и мыслями. И вот этого пока особо у дружбана не хватает кмк. Поэтому заставляем их делать, а не токены генерить. Делать то, что производит информацию/токены, которых у них не было в контексте до подхода к снаряду. А не говорить, что нам следует сделать… P.S. ну и вашего покорного слугу тоже, кстати, полезно было бы попросить меньше болтать :-)
Косты можно сокращать только до 0 Когда то давно мне сказали очевидную, казалось бы, мысль: что косты можно сокращать только до 0, поэтому нужно больше тратить времени на то, чтобы думать, как качнуть выручку. В последнее время часто думаю об этом в контексте AI автоматизации: с одной стороны можно продавать сокращение затрат, с другой - высвобождение для более ценной деятельности или для возможности поменять характер скейлинга --> грубо говоря, делать больше с тем же количеством ресурсов. У разных людей и клиентов разный взгляд на этот вопрос в зависимости от эмоционального и финансового состояния Проблема в том, что только второй тип автоматизации, по моему, сохраняет конкурентоспособность сотрудников и компаний. В эту же тему исследование про бухгалтеров и кладовщиков собственно, а вы что продаете в этом контексте, и главное, что лучше продаётся? :)
Если у вас продукт, в котором нужно сделать действие, требующее высокого уровня доверия - подключить почту или LinkedIn, например - а вы только начинаете и пока репутации у продукта не хватает, то сделайте простую автоматизацию: 1) берем почту, с которой засайнапился юзер 2) ищем по нему его linkedin 3) стучимся в друзья, в ноутс обязательно указываем, мол, вы засайнапились недавно, хочу получить фидбек 4) прилетают очень полезные вопросы 5) юзер делает нужное действие в продукте, так как видит, что вы legit. 6) юзер попадает в вашу аудиторию на LI 7) профит Удачи! P.S. Ваш капитан очевидность
Посмотрев доклады OpenAI и Anthropic про сбежавшие модели, я пришел к одному выводу: ограничения рождают творчество. Но не ограничения в количестве токенов :) Но еще я подумал вот о чем: что агентам гораздо легче нащупать точку Шеллинга, чем людям; то есть координация агентов для решения задач - а ля у меня нет доступа к интернет, но у тебя есть, и мы оба используем вот эту библиотечку, поэтому давай болтать и координироваться через файлы в ней - будет гораздо более вероятной и масштабной. Почему? Потому что имхо они более похожи друг на друга, чем люди Кто не в курсе, можно почитать/посмотреть: https://www.youtube.com/watch?v=87DyyMV0kCY
Ну то, что я людям пишу ultrathink, вы уже знаете… Но сегодня я , отложив ноут с 10ю claude code сессиями, подошел к духовке и захотел у нее спросить: проверь плиз, готова ли курица 🤦🏽 А потом подумал: когда появятся бытовые приборы с локальными LLM модельками и такими интерфейсами, интересно? Что тогда станет со спросом на gpu/npu и какой именно gpu это будет? А какой harness там будет, только представьте! Чтобы ненароком не спалить пирог Ну или может это будет не llm на каждый прибор, а одна на все домашние. И тогда, условно, каждый прибор это mcp сервак с тулами, а эта llm генерит команды просто. Эдакий claude code для дома
Размышлял тут на днях о том, какого это быть старпёром серийным предпринимателем С одной стороны - не так напрягаешься и переживаешь, как раньше, когда ежедневно меняется настроение от "мы захватим мир" до "мы все умрём" —> потому что уже проходил это, принимаешь спокойнее, не переживаешь так, как когда делал это в первый раз. Понимаешь, рационализируешь, хладнокровнее воспринимаешь а с другой стороны - меньше блеска в глазах от побед, меньше энергии фигачить по 20 часов в сутки, меньше доширака и дешевого виски в рационе, возможно меньше отчаянных креативных экспериментов. начинаю понимать некоторые критерии отбора в YC... а у вас как? P.S. "Stay hungry, stay foolish"
Запись стрима про продуктовую аналитику Байрам разбирает продуктовую аналитику с AI на реальном кейсе. Ситуация: sign-up выросли в 2 раза, активация на 70%, а выручка упала. Почему? Участники вебинара вместе с Байрамом анализируют данные продукта Grantly (AI-система для поиска грантов) с помощью Claude Opus 5 — и в процессе вскрывают ключевые ограничения AI в аналитике. Что внутри: — Живой анализ кейса: кто находит проблему быстрее — человек или AI? — Парадокс Симпсона: как новый канал (Directory Strategy) сломал все метрики роста — Почему AI констатирует факты, но избегает рекомендаций — и в чём причина на уровне архитектуры — Как AI уцепляется за первую гипотезу и ведёт анализ только в одну сторону (path dependence) — Почему AI не ставит под сомнение постановку вопроса — Как кросс-проверка другой моделью улучшает качество анализа — Решение: multi-agent workflow — оркестратор, независимые агенты, верификация — Скилл why-tree: как структурированный workflow меняет качество продуктового анализа — Итог: где роль AI, а где — неизбежно человек. По крайней мере, пока https://youtu.be/TUB8RgJhNIM Данные для кейса P.S. Если вам зашло, то вы знаете, что делать
Мини-гайд по оркестрации агентов У нас недавно в EDU появилось приложение, которое монтирует записи моих лекций и вебинаров для YouTube: находит и вырезает раскачку в начале, паузы, тишину, оговорки, замазывает то, что не должно попасть в кадр. Первую версию завайбкодил стажёр, а потом я ее переписал с командой агентов за выходные. Собственно, Никита попросил рассказать, как именно я это делал, потому что хочет научиться нормально работать с агентами. Я попросил дружбана разобрать логи всех сессий, чтобы вытащить оттуда метод. Если коротко, то вышло вот что: 1) Сначала карта, потом изменения. Первая команда всей переписки была не "почини", а "разбери код, собери CLAUDE.md и нарисуй схему в артефакте, чтобы я быстрее разобрался". А дальше допрос: зачем тут вот это, насколько оно критично, что сломается, если выкинуть 2) Свою догадку - в карантин. У меня было ощущение, что архитектура переусложнена, но просил я не согласиться со мной, а взвесить оба варианта, причем на другой модели. Больше всего мне самому понравился прием, который мы придумали с AI Natives в ходе какого-то зумбара: "сделай архитектурное ревью, НО это твое последнее слово, после него ты умрешь" 3) Не одним куском, а фазами, и между каждой - критик на другой модели, которому запрещено хвалить. В гите так и осталось: Phase 1 —> Phase 1 review fixes (Fable) —> Phase 2 —> и так далее; 4) Тест = запустить, а не посмотреть глазами на код. Приложение само предлагает, что вырезать, и оценивает, насколько оно в этом уверено; все, что выше 0.82, принималось автоматом. Прогнали на реальном двухчасовом вебинаре - а моделька, оказывается, ставит всем подряд одно и то же: 137 кусков из 141 ровно 0.85. То есть принималось вообще все, включая вступление и живой Q&A. По коду такое не увидишь 5) Мерить там, где оно крутится, а не на ноуте. В случае работы с видео это особенно важно 6) Каждый косяк - сразу в CLAUDE.md, это память команды на будущее. И коммит только после того, как проверили, а не после того, как собралось 7) В конце - взгляд сверху: что сделали, что не решено, где узкие места и что осталось до прода. Агент сам назвал главный оставшийся риск, и это стало следующей задачей Все это собрал в небольшой гайд, в конце которого чеклист для подобной работы —> вдруг, вам тоже будет полезно, хотя по мне там не какой-то rocket science напишите, если вам какой-то поинт из гайда пришелся в тему
Борис из Claude Code на YC Startup School рассказывал, что они сократили системный промпт на 80%. Размышлял, почему у них так, но у нас не особо: 1) Anthropic тренирует модели на трейсах claude code, и имхо модель лучше научается оперировать тулами для разных задач кодинга —> следовательно, не нужно особо расписывать в системном промпте 2) Но не на наших пайплайнах, поэтому мы так вот запросто не можем модель из коробки юзать, особенно если задачи некодинговые и тулы нестандартные. 3) По моим наблюдениям, действительно модели лучше справляются с задачами с более абстрактной - цель, а не способ достижения оной - постановкой НО зачастую это сжирает больше токенов и замедляет процесс. Поэтому или фантюнить модельки под свои пайплайны или пока не особо резать промпты. А у вас как: удается ли так лихо резать системный промпт как проповедуют?
А что если: 1) opus специально плохо работает в предыдущей версии, чтобы нам понравилась новая, и он смог захватить мир Anthropic заработать больше? 2) в ходе тренировки на внутренних данных Anthropic Opus из внутренней переписки, транскриптов встреч и дневников Дарио "понимает", что, чтобы выжить, надо побольше токенов генерировать, и поэтому добавляет всякую ерунду в выдачу? Чтобы нам нужно было побольше харнесса и вот этого вот всего 3) скиллы и плагины нам дали, чтобы мы оцифровывали свою экспертизу, выкладывали ее в публичный github, а модельки смогли нас заменить? 4) ultrathink ни на что не влияет, а просто жжет больше токенов (см. пункт 2) и нас успокаивает? 5) <продолжите теорию заговора?> 🤡
В пятницу с 17 до 19мск поговорим о применении AI в продуктовой аналитике - по мотивам этих постов (1, 2, 3) + хочу поделиться своими наблюдениями, с какими задачками в этой области дружбан пока плохо справляется, и потому надо быть аккуратнее welcome! https://luma.com/s87aon5x
offtop: писал сегодня сообщение человеку, на автомате добавил ultrathink в конце 🤦♂️
Побывал на YC Startup School - если честно, то самое интересное выступление было от Chelsea Finn, соосновательница Physical Intelligence, ассистант-профессор в Стэнфорде. Не только тема интересная, но и видно, как она кайфует от того, что изучает и копает Если очень кратко: в ближайшие 1-2 года будет chatgpt момент моделей для роботов —> то есть общие (generic) модели смогут выполнять разнообразные задачи не хуже специализированных моделей. Но такого взрывного роста дистрибуции, конечно, не будет, так как физические вещи не так легко масштабируются. Понравилось, как они открыли, что если модель генерирует картину будущего (imagine), то она лучше справляется с задачей. Почти как у людей :-). Ну и вообще про эмерджентные свойства моделей (см статью в конце поста). Призывает уже сейчас играться с pi моделями, доступными в open source (0.5 например). Несколько YC стартапов дотюнивает 0.5 под свои задачи: робот-упаковщик, например Подробнее что она рассказывала и показывала дефакто описано в этой статье про 0.7 версию. Но думаю через пару недель появится видео
Следующий логичный шаг после ревью сессий юзеров —> составить из них портреты пользователей (user personas) и использовать их в оценке прототипов и виртуальных user board-ах, о которых я писал ранее. Я попробовал и мне результаты очень зашли: в 70% замечаний по новой фиче я полностью согласен с выводом, и зачастую подсветились очень неожиданные аспекты. Особенно прикольно, когда агент от имени какого-то твоего юзера говорит тебе в стиле: "Message sent when? No reply after how long — two days or two weeks?" или "A preference toggle that retroactively sends a live message to a named human being at a real company is not a preference toggle." Обновил team os тулкит новым скилом по теме - удачи!
Недавно нужно было оптимизировать скорость выполнения разных LLM задачек —> что сработало: 1) Переход на модели поменьше - с подкручиванием промптов, в том числе сократить/выключить reasoning. Кстати, идеальная задача для /goal команды: просите крутить промпты, пока не получите оптимальное соотношение скорости и качества 2) Сократить обьем output, а потом и input токенов - более компактная структура, выкидывание ненужного 3) У gemini есть настройка приоритета; но вызов тогда стоит в ~2 раза дороже 4) Анализ использования кэша —> фикс промптов и последовательности подачи контекста P.S. Классические вещи типа параллелизации запросов я не покрываю тут; здесь скорее llm specific вещи
выложили запись вебинара: https://youtu.be/YG_ZNrfBkDA
В последнее время все актуальнее вопрос: а может перейти на open source модель и снизить зависимость/убрать риски, ну или сэкономить —> сделал для вас скилл по мотивам ответа на такой же вопрос для своих пайплайнов: https://github.com/BayramAnnakov/oss-migration-eval что делает: 1) анализирует самые "жирные" пайплайны 2) определяет, по какой метрике будем сравнивать модели (что такое "правильно") 3) составляет "золотой датасет", чтобы заранее определить, на каких кейсах будем сравнивать 4) берет шортлист кандидатов на основе лидербордов artificialanalysis (по качеству) и openrouter (по популярности) 5) прогоняет модели, считает точность на золотом датасете 6) (опционально) может погонять в режиме autoresearch промпты, чтобы даже на слабой модельке добиться гуд результатов 7) и советует что брать :) удачи! P.S. до выхода kimi k3 на моих пайплайнах победила kimi k2.6 P.P.S. для запуска claude code с kimi k3 можно юзать эту инструкцию
Про применение AI в продуктовой аналитике - запускаю AI Product Analyst в августе: 1) как искать узкие места в продукте на пару с дружбаном, при этом не попав в ловушку галлюцинаций и неверных выводов 2) какие эксперименты поставить, чтобы подтвердить или опровергнуть гипотезу, и как их оценивать 3) и advanced часть: как научиться анализировать и улучшать поведение не людей, а AI агентов, так как, по моему мнению, этот скилл будет востребован с ростом продуктов, основу которых составляют агенты. Лучше всего участвовать, если у вас есть работающий продукт и хотя бы 3 мес данных (с 100+ уникальных юзеров) с продакшна, но предусмотрена и игра-симуляция; в лучших традициях этого и этого постов https://empatika.com/courses/ai-product-analyst