ИИ в Европе
СтатистикаМеня зовут Серёжа (@serega6678) Последние 4 года я работаю ИИ исследователем. Я пишу про ИИ и ИИ стартапы. Подпишись, чтобы быть в теме
- Последний пост
- 26 мая 2025 г.
- Последнее чтение
- 11:52
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- Категория
- Бизнес
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Завтра в 16:30 мск выступаю онлайн на ODS Advanced LLMs Буду рассказывать про то: — Как надо и не надо строить Computer Use — Текущие SOTA и трюки, которые реально работают — Как мы сделали рабочий и полезный продукт на основе Computer Use одними из первых в индустрии Приходите, кому интересно как ИИ контролирует компьютер и чем это все закончится! Ссылку скину завтра
Маск продолжает вставлять палки в колёса OpenAI Группа инвесторов, во главе с Илоном, предложила 97,4 миллиарда долларов за OpenAI. Компанию продавать им никто не собирается, о чём уже заявил Сэм Альтман, но такое предложение само по себе создаёт OpenAI с инвесторами огромные проблемы. Дело в том, что у OpenAI крайне необычная структура - компания всё ещё принадлежит нонпрофиту со своим советом директоров. Это уже привело к инциденту с увольнением Сэма Альтмана в конце 2023, когда основного инвестора — Microsoft, даже не предупредили. Представьте шок, когда вы инвестировали более 10 миллиардов долларов и узнаёте о том, что совет директоров сместил CEO, из новостей. После таких финтов ушами, следующий крупный раунд OpenAI уже был с условием превращения компании в коммерческую в течении двух лет. В противном случае, OpenAI обязались вернуть инвестированные 6 миллиардов. Но выполнить требования инвесторов так просто нельзя - коммерческую структуру OpenAI нужно выкупить из под контроля нонпрофита. До предложения Маска, такую сделку можно было достаточно легко провернуть за относительно небольшую сумму, теперь всё сильно усложнилось. Если совет директоров нонпрофита согласится на меньшую ставку, то такое решение придётся объяснять целой куче инстанций, которые могут легко заблокировать сделку. А перебить предложение Маска будет сложно — в его предложении вишенкой на торте служит обещание перебить предложение любых других инвесторов такой же либо ещё большей ставкой. То есть у OpenAI выходит неприятная ситуация — либо вступать в ценовую гонку с Маском, что сильно облегчит кошельки инвесторов, либо их затаскают по судам. Если отменить превращение в коммерческую организацию, то компания будет в минусе на 6 миллиардов и с туманными перспективами будущих инвестиций. В ситуации есть ещё куча неизвестных, кажется, мы ещё долго будем обсуждать новую драму с OpenAI. @ai_newz
56 это до или после налогов? 🤔
🍵 Почему Сэм Альтман поднимает миллиарды, а вы... Почему Сэм Альтман поднимает миллиарды на продвижение своей версии будущего с доминирующим ИИ, а остальным венчурные фонды даже не отвечают на емейлы? Почему инвесторы вкладываются в выпускников Стэнфорда и Гугла после одного разговора в кафе, а вам отказывают после успешного due diligence? Почему в большинстве стартапов инвесторы смотрят в первую очередь на основателей, а в биотехе – на экспертов и профессоров? О трех совершенно разных типах стартапов и их способах управления организационной и рыночной неопределенностью. 🍵 Читать пост: https://telegra.ph/Pochemu-Sehm-Altman-podnimaet-milliardy-a-vy-02-01 🍵 Strategic Tea Room. Где потенциальные проблемы? О блоге и авторе: https://t.me/teastrategy/6
Друг делает AI safety стартап про автоматическую детекцию уязвимостей в ллм Если вы - Умеете тренировать и деплоить ллм'ки - Знакомы с агентскими системами - Горите темой AI Safely - 🆎🅾️🅱️🅰️ Пишите @mixedenn Вилка от 80-130k/eur+ опционы
Коротко про релиз o3-mini или o3-mini-high или как их там, забыл уже
Делаем OpenAI Operator дома Как я писал в прошлом посту, есть несколько возможных архитектур для веб агентов, но самая "рабочая" сейчас - архитектура, сочетающая две модели: планнер и локатора Давайте на примере: Допустим, перед агентом стоит задача - найти самый высокорейтинговый фильм Как человек бы выполнил эту задачу? 1. Открыл бы гугл 2. Набрал бы там запрос самые высокорейтинговые фильмы 3. На высветившейся странице зашел бы на самый верхний сайт 4. Внимательно просмотрел бы страницу и нашел бы ответ Так вот, агент делает точно так же. За "мышление" и принятия решения что сделать отвечает планнер - умная модель типо GPT-4. Ее задача - проанализировать скриншот сайта и понять, какое следующее действие стоит предпринять Действие может быть: — Нажать определенный элемент — Напечатать текст в определенном элементе — Проскроллить страницу — Вывести ответ пользователю Однако GPT-4 не может управлять мышью и не может указать координаты элемента, который нужно нажать, например Поэтому появляется необходимость в еще одной модели - локаторе. Ее роль - понимать что хочет GPT и, при необходимости, говорить куда надо поставить мышь. Например, GPT может сказать "текущее действие - Click('синяя кнопка логин')" Тогда модель локатор найдет синюю кнопку логин на экране, определит ее координаты И благодаря этим координатам мы сможем поставить туда мышь и совершить клик! Без модели локатора это было бы невозможно Вообще первая стоющая локатор модель (OS-ATLAS) вышла в конце октября, а в ноябре/декабре вышло сразу 4 крутые модели аналога, так что тема набирает обороты. Лучшая модель локатор сейчас - UGround, ей меньше месяца. Из интересного, локаторы стали возможны благодаря Qwen-2, которого китайцы во время обучения научили неплохо понимать интерфейсы и иконки. Попытки добавить понимание интерфейсов в LLaVA особо успехом не увенчались и поэтому все лучшие модели-локаторы основаны именно на Qwen-2. Ждем новых на основе Qwen-2.5 :) @ai_in_europe - у нас про ИИ и Стартапы, подпишись
Qwen 2.5 VL - лучшая агентская базовая модель Версия Qwen 2 уже немного понимала интерфейсы программ, но 2.5 сделала в этом огромный шаг: модель отдельно обучена на оч много агентских задач (контроль компьютера и телефона, понимание интерфейсов) В целом, агентские показатели очень даже неплохие, хоть и не сота. Что интересно, с выходом прошлой Qwen-2 перформанс лучших агентов вырос на +5-10% процентов за счет смены базовой модели для файнтюна на qwen-2 . Те обучающие данные остались те же, единственное, что поменялась - базовая модель и эта смена дала +10% (в след посте чуть больше про это) Поэтому я реально жду, когда текущие SOTA агентские файнтюны qwen'а 2 обновят на qwen 2.5 vl Из остального, модель научили: — находить и выделять объекты на изображениях — парсить скриншоты документов в HTML — лучше понимать видео Классная модель короче. Тред agentic vision моделей все больше набирает обороты. Подробнее читать тут. @ai_in_europe - у нас про ИИ и Стартапы, подпишись
Люди ждут)
Я решил начать серию постов про веб агентов Конкретно этот про то, как эволюционировали агенты последние 2 года 1. Текстовый агент С выходом GPT-3.5 люди начали пытаться начать делать веб агентов для автоматизации самых простых вещей аля бронирования ресторана. Тогда модели были менее умными, не работали с изображениями/скриншотами и имели крайне скромный контекст (несколько тысяч токенов) Поэтому единственным вариантом было подавать сжатую версию HTML или Accessibility Tree и просить модель подумать и сгенерировать js код для подходящего взаимодействия со страницей (аля кликнуть кнопку "бронировать"). Такие агенты плохо работали, тк часто полный HTML был почти нечитаем, чего говорить о его сжатой версии и моделям явно не хватало изображения для целостного понимания контекста веб страницы 2. Гибридный агент (Set-Of-Marks) Когда модели научились принимать скриншоты, люди сразу придумали, что каждый кликабельный элемент и поле ввода можно обвести в рамочку, занумеровать и добавить на скриншот (пример - прошлое сообщение). Модель, посмотрев на скриншот, будет выводить номер элемента и что с ним сделать (кликнуть / ввести текст) Таким образом агенты стали лучше понимать, что происходит на странице, но и этот метод был не идеальный. Для детекции кликабельных элементов использовались разные ивристики, а качественно найти все кликабельные элементы на сайте просто невозможно (из-за js кода), поэтому часто агент не мог кликнуть на нужную кнопку тк вокруг нее не было занумерованной рамочки. 3. Vision-grounding агент Идея очень простая - давайте умной моделью (типо GPT) анализировать скриншот и так же генерировать следующее действие, но для взаимодействуемого элемента мы будем генерировать его описание (например, красная кнопка). Дальше специальная модель-локатор (OS-Atlas / UGround / ...) по текщему скриншоту и описанию элемента вернет его координаты. А с ними мы можем и нажать на элемент / ввести в него необходимый текст :) Преимущество этого подхода в том, что тут агент уже получает тот же вход, что и человек и тут нет проблем с тем, что мы неверное определим кликабельные элементы. Из недостатков - что планировщик и локатор разделены. Так, например, из-за неоднозначного описания, локатор может указать на не тот элемент. В следующем посте расскажу чуть больше про актуальные модели-локаторы 4. End-to-end vision модель Принимает скриншот и по нему сразу дает координаты элемента и действие (кликнуть / ввести текст). Более менее всем понятно, что будущее за end-to-end моделями из-за их простоты в улучшении и использованиии. Однако в данный момент такая модель для веба это что-то за гранью фантастики, текущие модели более менее норм работают только для телефонов. Недавно вышла одна (UI-TARS, про нее потом), но она слабовата, чтобы быть пригодной заменой Vision-grounding агентов. Поэтому остается лишь ждать. Но я уверен, что через 4 месяца максимум будет отличная web модель в опен сорсе. @ai_in_europe - у нас про ИИ и Стартапы, подпишись
Пример входа к гибридному агенту
OpenAI Оператор не "убил" ни один стартап Вчера много читал, что этот Веб агент обесценил сотни миллионов долларов инвестиций в схожие компании, но, на мой взгляд, это не совсем так Для начала, обзор нескольких компаний: — Adept (350M$ raised) - начали делать AI Web агентов до того как это стало мейнстримом (и до того как это стало хоть сколько-то технически возможно), в итоге фаундеры ушли в amazon и про компанию ничего не слышно — H company (100M$ raised) - 22х летний CEO обещал супер пупер Web AGI инвесторам. В реальности ничего не выходит, 3 со-основателя ушли, в компании сумасшедшая текучка (менеджер может меняться каждый месяц), в итоге пивотнулись от идеи web агента куда подальше — Browser Use - компания, которая не делает ресерч, а собирает существующие алгоритмы в один пайплайн и дальше продает его. Я не думаю, что им хоть как-то угрожает выход оператора. Напротив, он поможет им: — Продавать свой пайплайн еще проще, демонстрируя неприменимость OpenAI оператора для реальных задач — Улучшать свой пайплайн при помощи опен сорсных моделей, которые теперь начнут выходить еще чаще — Хайпануть благодаря релизу оператора Итого — В компании типо BrowserUse, которые соединяют существующие технологии в пайплайн, итак инвестируют на основе выручки, которую Operator в данный момент у них никак не заберет и будущие инвестиции не уменьшит — В компании, которые делают research в веб агентах итак никто бы не инвестировал, тк в них чаще всего бардак. А с октябрьского релиза Computer Use от Anthropic всем инвесторам окончательно стало понятно, что конкуренции с большими лабами типо Anthropic и OpenAI не избежать, а конкурировать с ними бесполезено. @ai_in_europe - у нас про ИИ и Стартапы, подпишись
Вышел Operator от openai а я уже год строю Web агента Что я думаю об этом релизе и почему он не применим в жизни? Коротко: Operator - "автономный" агент для автоматизации задач в браузере (например, купить билет на самолет). Хороший по бенчмаркам, не слишком медленный, но людям нужно не совсем это По моему опыту чаще всего компании (не пользователи) хотят использовать веб агентов на сайтах: 1. защищенных аутентификацией 2. для сбора информации / изменения состояния сайта (добавления, удаления данных, например) Так вот, проблема этого агента в том, что для каждого из этих сценариев оператор отдельно передает контроль пользователю, например, чтобы ввести пароль от аккаунта сайта. В этот момент юзер по сути делает работу агента. Аналогично с изменением состояния сайта - слишком много работы делает пользователь. Получается каламбур, что для работы Operator'а нужен оператор 🤯 С тем же успехом можно самому задачу сделать и времени на это уйдет столько же, а то и меньше. И даже если запускать несколько агентов параллельно, я крайне сомневаюсь в пользе и экономии времени. Но что голова заболит и перехочется дальше работать, я точно уверен. Поэтому оператор - классная технология, которая в данный момент не подойдет почти ни для одного реально полезного юз кейса. Возможно в ближайшее время часть проблем исправят в API (по-крайней мере будут требовать меньше верификаций действий), но я крайне скептичен, ведь, что они точно хотят избежать - агента, который будет ходить по интернету и совершать вредоносные для пользователей действия @ai_in_europe - у нас про ИИ и Стартапы, подпишись
Мой любимый линкедин комик
Наверное мой любимый модельный релиз за последнее время Сам в последние 2 года постоянно удивлялся, почему никто не обучит хороший берт и не опен сорснет его (E5 и тп не в счет - они обучены на подмножество тасок берта и абсолютно не подходят, например, для token classification задач типо NER) Знаю некоторые учили, но вот выложили не те и только сейчас :) Так что очень круто, что люди вспоминают про енкодер модели тоже А то меня всегда удивляло, почему у BERT 68 млн загрузок месяц (для сравнения LLama 3.3 ~ 0.3 млн), но при этом обновленной версии берта все еще нет
ModernBERT. Новый, модный,классный, твой.💃😊 Тут челики дали новую жизнь архитектуре BERT. Модель обогнала всех своих собратьев из энкодер семейства: DeBERTa,AlBERT и RoBERTa, и да GTE не в счет тк спецом обучена контрастивно. Сделали все это за счёт много чего: 1. Оптимизации внимания,делают каждые 3 слоя глобал внимание, остальное sliding window attention (swa это как в лонгформерах). 2. Такое внимание помножено на RoPE позиционные эмбы. 3. Присыпано такое все 8к контекстом, а не 512 токенов. 4. Убрали смещения из нормализации и линейных слоев. Сдедали пренормализацию. 5. Добавили GeGLU активации. 6. Токенизация из OLMo модели, а не BPE. Но cls/sep токены оставили. 7. Сделали больше глубины: 22 и 28 слоев, для base и large версий соответственно. Обучение на 2Т токенов: 1.7Т с контекстом 1024 далее 300B с 8к. Убрали NSP задачу ("предсказание" следующего предложения), оставив MLM как в RoBERTa. Для оптимизации инфера и обучения добавили torch.compile улучшений и flash attention3, убрали паддинги, сделав раздельную обработку внимания на сиквенс без pad. Крч накрутили всего современного и круто работающего. Если бы у них не получилось, я бы даже удивился. Глядеть модельки тут.
✊
Наглядный пример того как ИИ не забирает рабочие места, а создает их из-за своей сырости 😁 P.S. Иван - друг мой, а не апп Оригинальный пост
Пару дней назад в одну из самых популярных библиотек для Computer Vision попал майнер Да, именно крипто майнер Люди это заметили благодаря Google Colab, который блокировал сессии за подозрительные действия В итоге выяснилось, что вирус попал в код Ultralytics благодаря github action script injection'y, который и запускал майнер на компьютере пользователя. Но только если у него мак и линукс; виндоус бояре снова в пролете 😂 Так вот, эта версия библиоткеи Ultralytics также попала в новые версии ComfyUI и SwarmUI, так что всем любителям диффузионок советую тоже провериться От себя добавлю, что после этого успеха в ближайшее время жду еще больше кул хацкеров, троянов и рекламы казино на своем мак буке, и потому всем советую загрузить dependencies сейчас, пока такие новости не стали чем-то обыденным :) Гайд по удалению крипта майнера прилагаю
Там вышла ллама 3.3 Но самое интересное - цена По метрикам ± как GPT-4o, но в 25 раз дешевле Заставляет задуматься