nlp_daily
Статистикаnlp_daily - это канал о крутой части машинного обучения, связанной с обработкой естественного языка (NLP). Здесь будут последние новости, исследования и туториалы. Ничего лишнего, только самое необходимое для NLP самурая. Контакт админа: @Markus85
- Последний пост
- 14 авг.
- Последнее чтение
- 15:48
- Постов за неделю
- 5
- Всего постов
- 23
- Тип
- открытый
- Язык
- русский
- Категория
- Образование
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 679
- 1/48двое суток
- 778
- 1/72трое суток
- 839
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Теперь клод позволяет публиковать свои нейрослопные артефакты. Ну хоть что-то
видео или голосовое, без подписи
А вот и курс по материалам 🔼на платформе Валеры Ковальски https://neuraldeep.ru/learn/books/agenty-vajbkoding/
@aostrikov первая редакция, клод пизданул гайд на почти 200 страниц в пдф. по всей нашей полугодовалой истории переписки.
Однажды у пачки AI-инфлюенсеров резко закончились подписки, Tibo не порадовал ребят ресетом и они пошли трогать траву. Трогали на лужайках, трогали в парках, трогали в контактных зоопарках и постепенно судьба привела их в лес. В лесу они разожгли костер, набили свои трубки и долго и упорно спорили по разным аспектам AI. - что такое модель и что такое контекст? - а что такое агенты и что такое тулзы, скиллы и мсп? - сколько субагентов смогут написать луп из семи харнессов? Казалось бы, простые вопросы, но эти ребята курили трубки до самого раннего утра и спорили, спорили, спорили. Но они не знали, что всё это время в кустах сидел Пух со включенным микрофоном и записывал все их разговоры. А потом он пошел домой, включил клода, скормил ему записи и все тайные, секретные, но родные для ребят истории улетели в контекст модели. Случилась глобальная протечка базы. И родилась книга. ——— Ну а если по-простому, перед вами квинтэссенция полугода переписок в нашем чатике, скормленная Пухом в клод и дистиллированная в книгу. Книгу, за которой уже начинает охотиться O’Reilly, Манн Иванов и Фербер и все лучшие издательские дома нового света, не зная что она была написана под воздействием самого душевного скилла. Но для вас эта книга бесплатна. Пока. На след неделе будет 15к 👇🏻👇🏼👇🏽
Все кодинг бенчмарки врут в одном и том же месте - выдают модели всё тз сразу. В жизни так не бывает: требования приезжают порциями, и код надо менять, не ломая уже сделанное. Но наконец-то появился честный бенчмарк от народа SlopCodeBench - тут постарались приблизиться к реалиям на земле: задача раскрывается чекпоинтами, модель на каждом шаге наследует свой же код без прошлого контекста, а зачёт дают, только если вместе с новыми тестами продолжают проходить и все старые Через бенч прогоняли три модели клода (самый последний прогон) и наблюдали как агенты превращают кодовую базу в отборный слоп. Opus 5 выбил 24% чекпоинтов, Opus 4.8 и Sonnet 5 - по 6%, и ни одну задачу до конца не довёл никто (те до последнего чекпоинта) Слоп кстати тоже потом меряют линейкой: детекторы клонов кода, обёрток-пустышек, try/except лесенок итд. Ну и все-таки есть прогресс поколений: опус 4.8 к концу доезжает до состояния, когда каждая шестая строка копия другой (копия имеется в виду структурная, а не дословная), а опус 5 держит строй - чуть больше 9% повторений. Промптами слоп не лечится, ни make no mistake, ни пиши чисто и планируй не помогают - разве только в начале Ну и выводы автора бенча - пока модель не выбивает хотя бы 80%, оставлять агентов с кодом один на один рано, зато потом можно будет спокойно захлопнуть крышку гроба ноута и пойти домой и ждать перевода базового дохода на карточку. За подгон материала спасибо Максу
Антропики выкатили новый опус 5, который по некоторым бенчам бьет даже фейбл, однако пожадничали и не обнули лимиты, минус вайб, ребятки - так вы кодекс не заборите Модельку пока серьезно не тестировал, но первые впечатления двоякие: с одной стороны, она лучше делает таски, чем опус 4.8, но все-таки пока не идет ни в какое сравнение с фейблом. На коротких задачах особого профита против 4.8 нет, только дольше все делается раза в два (думаю, тут надо effort снижать до medium). Скорее всего, мы имеем дело с дистиллятом кими 3 модели тиром выше- возможно, это как раз новый фейбл 5.1 Вместе с моделью вышел и новый гайд по промтингу. Поскольку изделия антропиков становятся все более интеллектуальными, общаться с ними также следует иначе, например вместо правил давать общие ориентиры, не включать конкретные примеры, использовать автопамять (тут я бы не стал следовать этому совету, либо проводить периодический аудит этой памяти). Статья также предлагает завести агента-проверяльщика, который посмотрит работу и выскажет мнение. Здесь, наверное, не соглашусь: всё, что выразимо кодом, должно быть зашито в хуки и скрипты скиллов - это дешевле, быстрее и не зависит от настроения модели К большей части советов я уже пришел самостоятельно, особенно это касается лаконичности и генерализации скиллов. Раньше я клод писал клоду огромные портянки - теперь это небольшие файлики. В какой-то момент я натолкнулся на репозиторий Мэтта, который серьезно вправил мне мозги. Его скилл grill-me - это какое-то произведение искусства, категорически рекомендую к использованию
Что ж, двигаемся с опережением графика Февраль 2027 Руководство КПК осознаёт важность Agent-2 и отдаёт приказ своим спецслужбам и кибервойскам выкрасть веса модели. Ранним утром агент мониторинга трафика Agent-1 обнаруживает аномальную передачу DeepCent протестировал, развернул и дообучил украденные веса Agent-2. Но они всё равно двигаются вдвое медленнее OpenBrain — в основном из-за дефицита вычислительных мощностей
Продолжая предыдущую тему, глянул, как выглядит Кими 3 в индексе (считается по формуле грамм-градус-копейка intelligence index против цены за задачу) Картина занятная: K3 набирает 57 баллов при почти $1 за задачу - вплотную к GPT-5.6 Sol и выше Claude Opus 4.8, который вдвое дороже. Батя Fable номер 1, но почти $3 за задачу - втрое дороже китайца Никакой тряски В преддверии IPO фронтиров удар очень серьезный, так что пора уже что-то вытаскивать из широких штанин и понижать цены
Кими 3 видимо неплохо так взбодрила антропиков. Пташки принесли новость, что Fable 5 остаётся в подписке насовсем (правда только для Max и Team Premium планов). Официального подтверждения я пока не нашел, но очень похоже на правду. Из официального - увеличили лимиты на 50 % до 19 августа
Как вы понимаете, мои предыдущие посты про fast mode и туториал по кодексу были прогревом. Наконец-то это день настал, и мой курс по AI разработке всего за 99 999 р готов обогатить меня знаниями всех желающих. Нет. Курса не будет. Но есть кое-что получше - скиллы, которые собирают уроки для вас самостоятельно podcast-deepdive - даёшь ссылку на ютуб, получаешь интерактивную страницу-разбор: главы с переходом на нужную секунду видео, ключевые идеи с диаграммами и иллюстрациями, цитаты спикеров, глоссарий и вопросы для самопроверки book-deepdive - то же самое для целой книги: структура по частям, концепты с визуализациями, глоссарий, Q&A Забрать можно отсюда: https://github.com/mldogs/skill-factory Для примера собрал страничку по материалам ролика моего самого верного комментатора
видео или голосовое, без подписи
После выхода GPT-5.6 многие слабые духом задумались, какой же стул всё-таки выбрать. На самом деле можно использовать силу обеих моделек: например, я использую кодекс в качестве ревьюера внутри клода - и в этой роли он отлично справляется Но мало кто знает, что режим codex exec таит в себе гораздо больше возможностей, чем кажется. Раскрыл тему в отдельном туториале - если зайдёт, лайк/репост приветствуется
видео или голосовое, без подписи
Fable, верим, что ты вернешься
Было время, когда, чтобы освоить какой-то новый материал, нужно было либо долго гуглить, либо искать готовый курс (последнее существенно экономит время - и поэтому породило целую индустрию эдтеха). Помню, что моё вкатывание в ML началось с прохождения подобного курсика Но времена изменились, и новая эпоха диктует свои форматы селф-лернинга. С появлением современных нейронок курсы умерли - по крайней мере для меня. Если я и буду что-то проходить, то только у какого-то проверенного ai-джедая с эксклюзивным материалом. С клод кодом/кодексом можно разложить любую сложную тему на молекулы и потом собрать обратно в той форме, в которой её способен воспринять ваш мозг. То есть ты буквально можешь создать курс для самого себя с крутой визуализацией, демками, квизами - всё, что пожелает душа и на что хватит подписки Например, после интересного подкаста я обычно делаю из него интерактивную выжимку и разбираюсь в деталях. Недавно вот смотрел у Дваркеша выпуск про то, как обучают и обслуживают фронтир модели, как устроен инференс под капотом. Там много довольно сложных тем (рекомендую глянуть на досуге) и он улетел в мою золотую коллекцию. Как пример, разобрал для своих подписчиков не очень знакомых с машинерией под капотом ллм только отдельный топик из этого подкаста, про механику fast mode https://mldogs.github.io/nlp-daily/fast-mode/
Если вы не знаете, то я работаю криптовалюте в стройке, а это одна из самых консервативных с точки зрения применения технологий отраслей (но зато есть куда расти). Я уже больше года веду проект по внедрению ИИ в различные процессы компании, но в основном это касалось бэкофиса и продаж. Но недавно руки дошли до автоматизации процессов, происходящих максимально близко и к самой стройке Попросили помочь с аудитом приемки квартир. А это мир экселей: есть одна сводная таблица, к ней сотни отдельных файлов с дефектными ведомостями и ещё столько же фототаблиц - вордовских и пауэрпоинтовских документов, куда фотографии дефектов вставлены прямо в файл. Все пару десятков гигабайт данных. По классике - все на яндекс диске, с именами файлов кто во что горазд ("04.06 таблица Эт.2 пом.1", "пом. 136" - этаж угадай сам). Работать с этим очень сложно: диск падает, фототаблицу не открыть, что устранено - не знает никто Я пересобрал всё это в компактный веб-инструмент. Теперь все найденные дефекты превратились в структурированную базу данных: у каждого дефекта статус, фото, история и ответственный. Ответственный за приемку может выставить приоритет выполнения, создать новый инцидент или принять исправление, подрядчик тоже все в носит в саму приложуху - и все максимально прозрачно. Бонусом можно всегда сходить клодиком и поспрашивать всякое по деталям и собрать статистику Естественно сам инструмент был построен агентами за семь шесть дней. Батя фейбл собрал мне аналитический доклад и нашел скрытые уязвимости - все уже в беклоге. Вот такой вот эай нейтив
идея украдена из одного чатика
Как батя Fable зашёл в проект и разрулил вопросики Акт 1: Так, что тут у вас На входе: PRD.md, CLAUDE.md и ни строчки кода. Ну, батя сам код с порога не пишет - батя сначала собирает планёрку. Запустил 93 субагента: разведчикb прошерстили донорскую кодовую базу, потом несколько бригад нарисовали конкурирующие варианты нарезки, панель из судей их отранжировала, а каждый слайс прогнали через адверсариальную проверку. В итоге батя выдал 26 issues с DAG и покрытие всех 70 user stories и 4 вопроса владельцу - очень, очень affordable Акт 2: Коллеги, давайте поработаем Дальше классика бати: сам не работаю - раздаю наряды. Схема на каждый issue одна и та же: 1. Агенту выдаётся наряд: прочитай CLAUDE.md, возьми проблемку, тесты должны быть зелёные, один коммит 2. Параллельные агенты - каждый в своём git worktree со своей веткой и своим .venv 3. Батя мержит по мере готовности, гоняет полный прогон тестов, пушит - проблемка закрывается Реализация строго по графу. Конфликты на стыках бригад, а их было под десяток - батя разруливал сам. Один раз батя и сам накосячил при мерже, но быстро исправился Акт 3: Кожаный - принимай работу В итоге батя фейбл шуршал всю ночь и без всякого goal все зарешал, На макс подписке потратил 12% недельного бюджета (нужно учесть, что было еще обнуление в процессе, на запуск 93 агентов улетело где-то 25%). В первом приближении все запустилось и сразу заработало Антропик свяжитесь со мной shut up and take my money
последняя преграда, оберегающая кожаных от прихода AGI