tgindex
{

{AI} love you | Агент-native

Статистика
@ai_lav_uрусский

Исследую, как AI-агенты меняют программирование, создание продуктов и интеллектуальную работу. Практические разборы, эксперименты и честные выводы. Автор — @troclap

Последний пост
23 июн.
Последнее чтение
ещё не заходили
Постов за неделю
0
Всего постов
22
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
222
0 за 2 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
458
22 постов
Вовлечённость
206,3%
к подписчикам
Постов в день
0,0
всего 22
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • без подписи

  • ⚽️ (почти) автономная контент-фабрика по матчам ЧМ по футболу Сразу поделюсь свежаком. Из любви к футболу и уважения к турниру собрал генератор футбольных карточек. Внутри две части. Программная (made by Claude Code + Codex): сбор открытых данных, живая трансляция, сборка карточки по шаблону, публикация. И агентская (by Claude Cowork): веб-сёрч, подбор углов и рубрик, обработка фото, фактчекинг и evaluation. А чтобы шестерёнки крутились вовремя — Windows-scheduler и scheduled-таски Claude Cowork. Главная работа агента — найти сюжет и не соврать. Например, он сам раскопал, что Месси обновил абсолютный рекорд ЧМ — 18 голов, обойдя не только Клозе, но и Марту из женского футбола. Работает бесперебойно за двумя исключениями: 1. фото матчей ищу сам (агенту запрещено качать картинки с авторскими правами); 2. финальную карточку перерисовываю через браузерный ChatGPT Image 2 — по API так красиво не выходит. Всё уезжает в @one_touch_wc, обычно минут через 30 после финала: топ-3 из 10 вариантов. Огонь? 😄

  • Привет! Спустя два года и один цикл захода в найм возвращаюсь сюда. Просматривая посты двухлетней давности, возникает ощущение жизни "в" или "после" той реальности, которая тогда описывалась как будущее. Например, переверстка интернета не случилась в былом интернете, но произошла в универсальных чат-агентах: текстовой стандарт ответа которых постепенно сменился на HTML веб-страницу или артефакт, который может быть распространен через веб-страницу. Генераторы изображений и музыки еще не подменили собой соцсети, но обросли шеринговыми инструментами, чтобы бесшовно заполонять реальные соцсети и мессенджеры контентом. По факту феномен "переверстки интернета" стал вытеснением старого веба на периферию примерно в той же степени, как веб-парсеры замещают людей в структуре интернет-трафика. Короче, многие фантазии того времени стали реальностью, хоть возможно в иной форме. Крупнейший сдвиг за два года связан с тем, что единичный вызов LLM как фундаментальный компонент сменился единичным вызовом AI-агента (который под капотом часто делает столько LLM-вызовом, сколько пользователи двухлетней давности не делали за сутки). Самой точной формулой того времени было "do tasks not jobs", теперь это скорее job с поправкой на те tasks, которые агент не может осилить до сих пор. Первые джобы, которые уверенно закрыты или близки к закрытию (например, разработка ПО), показали, что мир с изобилием AI-работы приводит не к производству нового богатства, а скорее к обесценению старого богатства (нематериальных активов, которые больше не защищены от копирования). Удивительный мир. Буду делиться с вами здесь личными наработками и наблюдениями из эпохи мирного сосуществования с AI-агентами. Нечасто, но чаще чем раз в два года 😁

  • Claude снова побил GPT-4(o) Только вчера думал, что Anthropic сдали: уступили второе место Gemini, а еще отключили большое контекстное окно в бесплатной версии Claude (ограничили примерно 25 страницами русскоязычного текста). Это было вчера. #release #llm #leaderboard #benchmark

  • 😮🔥😮🔥😮 В генерации видео происходит что-то невообразимое. Все один за другим преодолевают зловещую долину между качеством Sora и условным Pika Labs. Три релиза подряд (один китайский, два американских). Происходит что-то именно революционное: все предыдущие видео-генераторы слегка анимировали изображение (зачастую через zoom in/out и тому подобное), а теперь в архитектуру генерации предположительно добавляют World Model (понимание пространства). И это работает, это становится стандартом. Видео к посту от Runway — компании, придумавшей Stable Diffusion и запустившей генерацию видео через Gen-1. Теперь они представляют Gen-3, практически GPT-3. #release #video

  • #ОбзорГены №8 Две добротные недели. Всё крутится, всё движется. { Свежак } 🔠 Apple наконец внедрил AI в iPhone, пожалуй, самая сильная фича — голосовое управление приложениями. 🔠 Случилось аж два мощных релиза среди видеогенераторов: Kling и Luma. Последние очевидно используют свое лидерство в 3D. 🔠 Выложили веса Stable Diffusion 3 Medium — культовой визуальной нейросетки для сообщества. Полный open-source уходит в прошлое. 🔠 Anthropic запустил AI-агентов на базе чат-бота Claude. 🔠 Eleven Labs теперь генерирует любые звуки, не только речь. { Пульс } ⚡️ У Udio появился Audio2Audio режим. Режим редактирования — это первый шаг к полной адаптации новой технологии. ⚡️ В мире анимации фурор вызвала межкадровая интерполяция от ToonCrafter. Посмотрите сами. ⚡️ Окончательное решение вопроса с джейлбрейкерами: близко к тому, чтобы мошенничество с LLM пресекалось на уровне нейронов. ⚡️ В мире животных: учёные принялись за распознание лая собак. { Текстуры } ✅ Грядет Action Engine — центр интернета действий ✅ Анализ емкости данных для обучения ИИ — данные закончились или ещё есть? ✅ Гайд, как использовать GPT-Vision для настоящего OCR ✅ Как достать любой кастомный промпт из GPT? ✅ Обзор российских агрегаторов ботов (без vpn) ✅ AI-инструменты для маркетинга ✅ "Панельск" — прекрасный художественный проект, берущий сок из множества нейросетей ✅ Актуальная цитата из Стругацких { Находки } 😯 Два сервиса по дешёвой аренде GPU: GPUDeploy и Vast. { Перекресток мнений } ❓ С чего начать? Apple на этой неделе выступил не как технологический лидер, а как отраслевой гигант, которого конкуренция вынудила внедрить AI. Другие крупные компании ощущают себя схоже: AI не угрожает их положению на рынке, а вот конкуренты с глубоко внедренным AI угрожают. Если присмотреться к тому, что именно внедряют корпорации, то можно увидеть "консервативный" AI: суммаризация, перевод, генерация картинок, общение с документом. Топ-4 для старта. #gadget #image #video #aiagent #audio #speech #llm #science #animation #marketing #data #gpu #vision #prompts

  • Переверстка интернета Недавний фейк вокруг AI Overview (Google), сделанный простым изменением текста в HTML-коде веб-страницы, привлек внимание к тому, насколько легко подменить то, что мы видим в интернете. Это только на первый взгляд "из песни слова не выкинешь". На самом деле, динамические веб-страницы и их переверстка в браузере давно с нами. На ум сразу приходит adblocker, был как-то забавный случай: я выбрал рабочий сервис, на мой взгляд, с минималистичным дизайном, послал его коллегам, а для них всё выглядело как "ад и израиль" с рекламой, вылезающей отовсюду 😜 Adblocker или авто-перевод страницы — это верхушка айсберга, есть специальный плагин Tampermonkey, в котором собрана коллекция пользовательских скриптов для изменения веб-верстки, например, можно добавить кнопку "скачать изображение" для одной известной запрещенной соцсети без такой функции. AI-переверстка веба (AI UI) до сих пор не на слуху и не на виду. В веб-страницы активно встраивают динамический AI-контент, но более менее все пользователи видят одно и то же. Технологически это проще, с этого и начали, но реально переверстка веб-страницы под конкретного пользователя уже посильное действие и напрашивается. Есть отличный эксперимент Bespoke UI от Google, вышедший еще в декабре. Можно придумать два понятных захода на эту территорию: со стороны веб-разработчиков как персонализация страниц и со стороны веб-браузера как персонализация интернета. Второй естественно симпатичнее, потому что дает пользователю контроль за своим веб-путешествием. "Не хочу никаких всплывающих окон и прочих отвлекающих элементов" - "Пожалуйста". "Наоборот, хочу спонтанности и случайности, хочу попасть туда, где раньше не бывал" - "Пожалуйста". #uiux #frontend #browser #code

  • Картинка с метриками. Ключевые выводы: 1. GPT-4o лучше GTP-4V, выходит, OpenAI не врали, когда говорили, что модель мультимодальна с самого начала. 2. Gemini существенно лучше для анализа видео любой длительности, и чем длиннее видео — тем больше разница. 3. Субтитры могут существенно накинуть в качестве. Ну, не зря модели всё же языковые 4. Открытые модели отстают от флагманских, но в коротких видео (до 2 минут) кое-как можно использовать. 5. Чем длиннее видео, тем хуже качество — что логично, ведь у модели куда больше шанс ошибиться, не учесть то или подумать другое. 6. OpenAI пора бы тоже выпускать модели с длинным контекстом 👶 7. Мне не хватило анализа изменения качества по годам/месяцам релиза видео. Думаю, что если бы мы увидели падение метрик на последнем квартале 23-го, то можно было бы смело говорить про переобучение. А так — хз, может модели видели, может, нет 🤷‍♂️ 8. И странно, что они не замерили качество Gemini с теми же кадрами, что брали для GPT-4o/других моделей, чтобы проверить разницу метрик именно за счёт контекста. Я бы рад сравнить метрики с человеческими, чтобы понять, насколько модельки далеки, но авторы не написали, какое качество было бы у людей, которые смотрят видео в первый раз. Думаю, на long-категории (30-60 минут) люди бы очень сильно провалились и были хуже моделей уже сейчас.

  • Первый бенчмарк для video-to-answer Называется Video-MME. Тестирует мультимодальные нейросети на закрытых тестовых вопросах по содержанию видео. На вход подают кадры и расшифровку, на выходе нейросеть выбирает один из вариантов ответа в тесте. Как я не раз говорил, в этой задаче уверенным лидерством владеет Gemini 1.5. Она на голову сильнее GPT-4(o) за счет своего огромного контекста и очевидно гигантского преимущества из-за возможности обучаться на Youtube-видео. #video #multimodal #benchmark

  • Action Engine Optimization (AEO) Youtube-канал Marketing Against the Grain продолжает поставлять инсайты на стыке GenAI и маркетинга. В предыдущих сериях были важные мысли про AI-подрыв поиска (и соответственно органического трафика), возрастающую роль Youtube и маркетинговые LLM-опросы (в итоге я сделал кейс про это). В новом выпуске ключевая мысль, что на смену Search Engine может прийти Action Engine. Поисковой движок распределяет интернет-трафик между отранжированными веб-сайтами, а движок действий может распределять "трафик" (лучше сказать ИИ-запросы) между отранжированными AI-агентами или API, которые будут совершать действия от имени пользователя. То есть после запроса ИИ-ассистенту: "Запиши меня в парикмахерскую сегодня вечером" — начинается конкуренция между AI-агентами и API за то, что именно будет выбрано для осуществления одной конкретной записи в парикмахерскую. Очень вовремя случилась масштабная утечка Google о том, что лежит в основе ранжирования веб-сайтов в поисковике. Много полезных деталей из текущей (уходящей) эпохи. Интересно, что именно у Google все шансы построить первый полномасштабный Action Engine благодаря лидерству в поиске. #aiagent #marketing #search #action

  • без подписи

  • без подписи