tgindex
nlp_daily

nlp_daily - это канал о крутой части машинного обучения, связанной с обработкой естественного языка (NLP). Здесь будут последние новости, исследования и туториалы. Ничего лишнего, только самое необходимое для NLP самурая. Контакт админа: @Markus85

Последний пост
14 авг.
Последнее чтение
15:48
Постов за неделю
5
Всего постов
23
Тип
открытый
Язык
русский
Категория
Образование
В каталоге с
12 авг.
Подписчики
2 152
−5 за 4 дн.
Сутки
−1
−0,05%
Неделя
 
Месяц
 
Просмотров на пост
1 402
23 постов
Вовлечённость
65,1%
к подписчикам
Постов в день
0,7
всего 23
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
679
1/48двое суток
778
1/72трое суток
839

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Теперь клод позволяет публиковать свои нейрослопные артефакты. Ну хоть что-то

  • видео или голосовое, без подписи

  • 10 авг.9301220

    А вот и курс по материалам 🔼на платформе Валеры Ковальски https://neuraldeep.ru/learn/books/agenty-vajbkoding/

  • 10 авг.1 0031363

    @aostrikov первая редакция, клод пизданул гайд на почти 200 страниц в пдф. по всей нашей полугодовалой истории переписки.

  • 10 авг.76678из aostrikov_ai_agents

    Однажды у пачки AI-инфлюенсеров резко закончились подписки, Tibo не порадовал ребят ресетом и они пошли трогать траву. Трогали на лужайках, трогали в парках, трогали в контактных зоопарках и постепенно судьба привела их в лес. В лесу они разожгли костер, набили свои трубки и долго и упорно спорили по разным аспектам AI. - что такое модель и что такое контекст? - а что такое агенты и что такое тулзы, скиллы и мсп? - сколько субагентов смогут написать луп из семи харнессов? Казалось бы, простые вопросы, но эти ребята курили трубки до самого раннего утра и спорили, спорили, спорили. Но они не знали, что всё это время в кустах сидел Пух со включенным микрофоном и записывал все их разговоры. А потом он пошел домой, включил клода, скормил ему записи и все тайные, секретные, но родные для ребят истории улетели в контекст модели. Случилась глобальная протечка базы. И родилась книга. ——— Ну а если по-простому, перед вами квинтэссенция полугода переписок в нашем чатике, скормленная Пухом в клод и дистиллированная в книгу. Книгу, за которой уже начинает охотиться O’Reilly, Манн Иванов и Фербер и все лучшие издательские дома нового света, не зная что она была написана под воздействием самого душевного скилла. Но для вас эта книга бесплатна. Пока. На след неделе будет 15к 👇🏻👇🏼👇🏽

  • 28 июл.1 5963036

    Все кодинг бенчмарки врут в одном и том же месте - выдают модели всё тз сразу. В жизни так не бывает: требования приезжают порциями, и код надо менять, не ломая уже сделанное. Но наконец-то появился честный бенчмарк от народа SlopCodeBench - тут постарались приблизиться к реалиям на земле: задача раскрывается чекпоинтами, модель на каждом шаге наследует свой же код без прошлого контекста, а зачёт дают, только если вместе с новыми тестами продолжают проходить и все старые Через бенч прогоняли три модели клода (самый последний прогон) и наблюдали как агенты превращают кодовую базу в отборный слоп. Opus 5 выбил 24% чекпоинтов, Opus 4.8 и Sonnet 5 - по 6%, и ни одну задачу до конца не довёл никто (те до последнего чекпоинта) Слоп кстати тоже потом меряют линейкой: детекторы клонов кода, обёрток-пустышек, try/except лесенок итд. Ну и все-таки есть прогресс поколений: опус 4.8 к концу доезжает до состояния, когда каждая шестая строка копия другой (копия имеется в виду структурная, а не дословная), а опус 5 держит строй - чуть больше 9% повторений. Промптами слоп не лечится, ни make no mistake, ни пиши чисто и планируй не помогают - разве только в начале Ну и выводы автора бенча - пока модель не выбивает хотя бы 80%, оставлять агентов с кодом один на один рано, зато потом можно будет спокойно захлопнуть крышку гроба ноута и пойти домой и ждать перевода базового дохода на карточку. За подгон материала спасибо Максу

  • 27 июл.1 0741036

    Антропики выкатили новый опус 5, который по некоторым бенчам бьет даже фейбл, однако пожадничали и не обнули лимиты, минус вайб, ребятки - так вы кодекс не заборите Модельку пока серьезно не тестировал, но первые впечатления двоякие: с одной стороны, она лучше делает таски, чем опус 4.8, но все-таки пока не идет ни в какое сравнение с фейблом. На коротких задачах особого профита против 4.8 нет, только дольше все делается раза в два (думаю, тут надо effort снижать до medium). Скорее всего, мы имеем дело с дистиллятом кими 3 модели тиром выше- возможно, это как раз новый фейбл 5.1 Вместе с моделью вышел и новый гайд по промтингу. Поскольку изделия антропиков становятся все более интеллектуальными, общаться с ними также следует иначе, например вместо правил давать общие ориентиры, не включать конкретные примеры, использовать автопамять (тут я бы не стал следовать этому совету, либо проводить периодический аудит этой памяти). Статья также предлагает завести агента-проверяльщика, который посмотрит работу и выскажет мнение. Здесь, наверное, не соглашусь: всё, что выразимо кодом, должно быть зашито в хуки и скрипты скиллов - это дешевле, быстрее и не зависит от настроения модели К большей части советов я уже пришел самостоятельно, особенно это касается лаконичности и генерализации скиллов. Раньше я клод писал клоду огромные портянки - теперь это небольшие файлики. В какой-то момент я натолкнулся на репозиторий Мэтта, который серьезно вправил мне мозги. Его скилл grill-me - это какое-то произведение искусства, категорически рекомендую к использованию

  • 22 июл.1 139103

    Что ж, двигаемся с опережением графика Февраль 2027 Руководство КПК осознаёт важность Agent-2 и отдаёт приказ своим спецслужбам и кибервойскам выкрасть веса модели. Ранним утром агент мониторинга трафика Agent-1 обнаруживает аномальную передачу DeepCent протестировал, развернул и дообучил украденные веса Agent-2. Но они всё равно двигаются вдвое медленнее OpenBrain — в основном из-за дефицита вычислительных мощностей

  • 20 июл.1 169610

    Продолжая предыдущую тему, глянул, как выглядит Кими 3 в индексе (считается по формуле грамм-градус-копейка intelligence index против цены за задачу) Картина занятная: K3 набирает 57 баллов при почти $1 за задачу - вплотную к GPT-5.6 Sol и выше Claude Opus 4.8, который вдвое дороже. Батя Fable номер 1, но почти $3 за задачу - втрое дороже китайца Никакой тряски В преддверии IPO фронтиров удар очень серьезный, так что пора уже что-то вытаскивать из широких штанин и понижать цены

  • 20 июл.1 06125

    Кими 3 видимо неплохо так взбодрила антропиков. Пташки принесли новость, что Fable 5 остаётся в подписке насовсем (правда только для Max и Team Premium планов). Официального подтверждения я пока не нашел, но очень похоже на правду. Из официального - увеличили лимиты на 50 % до 19 августа

  • 15 июл.5 53112323

    Как вы понимаете, мои предыдущие посты про fast mode и туториал по кодексу были прогревом. Наконец-то это день настал, и мой курс по AI разработке всего за 99 999 р готов обогатить меня знаниями всех желающих. Нет. Курса не будет. Но есть кое-что получше - скиллы, которые собирают уроки для вас самостоятельно podcast-deepdive - даёшь ссылку на ютуб, получаешь интерактивную страницу-разбор: главы с переходом на нужную секунду видео, ключевые идеи с диаграммами и иллюстрациями, цитаты спикеров, глоссарий и вопросы для самопроверки book-deepdive - то же самое для целой книги: структура по частям, концепты с визуализациями, глоссарий, Q&A Забрать можно отсюда: https://github.com/mldogs/skill-factory Для примера собрал страничку по материалам ролика моего самого верного комментатора

  • 13 июл.1 3372311

    видео или голосовое, без подписи

  • 13 июл.1 440732

    После выхода GPT-5.6 многие слабые духом задумались, какой же стул всё-таки выбрать. На самом деле можно использовать силу обеих моделек: например, я использую кодекс в качестве ревьюера внутри клода - и в этой роли он отлично справляется Но мало кто знает, что режим codex exec таит в себе гораздо больше возможностей, чем кажется. Раскрыл тему в отдельном туториале - если зайдёт, лайк/репост приветствуется

  • 10 июл.1 5791413

    видео или голосовое, без подписи

  • 7 июл.1 53813

    Fable, верим, что ты вернешься

  • 7 июл.1 5941847

    Было время, когда, чтобы освоить какой-то новый материал, нужно было либо долго гуглить, либо искать готовый курс (последнее существенно экономит время - и поэтому породило целую индустрию эдтеха). Помню, что моё вкатывание в ML началось с прохождения подобного курсика Но времена изменились, и новая эпоха диктует свои форматы селф-лернинга. С появлением современных нейронок курсы умерли - по крайней мере для меня. Если я и буду что-то проходить, то только у какого-то проверенного ai-джедая с эксклюзивным материалом. С клод кодом/кодексом можно разложить любую сложную тему на молекулы и потом собрать обратно в той форме, в которой её способен воспринять ваш мозг. То есть ты буквально можешь создать курс для самого себя с крутой визуализацией, демками, квизами - всё, что пожелает душа и на что хватит подписки Например, после интересного подкаста я обычно делаю из него интерактивную выжимку и разбираюсь в деталях. Недавно вот смотрел у Дваркеша выпуск про то, как обучают и обслуживают фронтир модели, как устроен инференс под капотом. Там много довольно сложных тем (рекомендую глянуть на досуге) и он улетел в мою золотую коллекцию. Как пример, разобрал для своих подписчиков не очень знакомых с машинерией под капотом ллм только отдельный топик из этого подкаста, про механику fast mode https://mldogs.github.io/nlp-daily/fast-mode/

  • 3 июл.1 3663112

    Если вы не знаете, то я работаю криптовалюте в стройке, а это одна из самых консервативных с точки зрения применения технологий отраслей (но зато есть куда расти). Я уже больше года веду проект по внедрению ИИ в различные процессы компании, но в основном это касалось бэкофиса и продаж. Но недавно руки дошли до автоматизации процессов, происходящих максимально близко и к самой стройке Попросили помочь с аудитом приемки квартир. А это мир экселей: есть одна сводная таблица, к ней сотни отдельных файлов с дефектными ведомостями и ещё столько же фототаблиц - вордовских и пауэрпоинтовских документов, куда фотографии дефектов вставлены прямо в файл. Все пару десятков гигабайт данных. По классике - все на яндекс диске, с именами файлов кто во что горазд ("04.06 таблица Эт.2 пом.1", "пом. 136" - этаж угадай сам). Работать с этим очень сложно: диск падает, фототаблицу не открыть, что устранено - не знает никто Я пересобрал всё это в компактный веб-инструмент. Теперь все найденные дефекты превратились в структурированную базу данных: у каждого дефекта статус, фото, история и ответственный. Ответственный за приемку может выставить приоритет выполнения, создать новый инцидент или принять исправление, подрядчик тоже все в носит в саму приложуху - и все максимально прозрачно. Бонусом можно всегда сходить клодиком и поспрашивать всякое по деталям и собрать статистику Естественно сам инструмент был построен агентами за семь шесть дней. Батя фейбл собрал мне аналитический доклад и нашел скрытые уязвимости - все уже в беклоге. Вот такой вот эай нейтив

  • 2 июл.1 1616

    идея украдена из одного чатика

  • 2 июл.1 5441939

    Как батя Fable зашёл в проект и разрулил вопросики Акт 1: Так, что тут у вас На входе: PRD.md, CLAUDE.md и ни строчки кода. Ну, батя сам код с порога не пишет - батя сначала собирает планёрку. Запустил 93 субагента: разведчикb прошерстили донорскую кодовую базу, потом несколько бригад нарисовали конкурирующие варианты нарезки, панель из судей их отранжировала, а каждый слайс прогнали через адверсариальную проверку. В итоге батя выдал 26 issues с DAG и покрытие всех 70 user stories и 4 вопроса владельцу - очень, очень affordable Акт 2: Коллеги, давайте поработаем Дальше классика бати: сам не работаю - раздаю наряды. Схема на каждый issue одна и та же: 1. Агенту выдаётся наряд: прочитай CLAUDE.md, возьми проблемку, тесты должны быть зелёные, один коммит 2. Параллельные агенты - каждый в своём git worktree со своей веткой и своим .venv 3. Батя мержит по мере готовности, гоняет полный прогон тестов, пушит - проблемка закрывается Реализация строго по графу. Конфликты на стыках бригад, а их было под десяток - батя разруливал сам. Один раз батя и сам накосячил при мерже, но быстро исправился Акт 3: Кожаный - принимай работу В итоге батя фейбл шуршал всю ночь и без всякого goal все зарешал, На макс подписке потратил 12% недельного бюджета (нужно учесть, что было еще обнуление в процессе, на запуск 93 агентов улетело где-то 25%). В первом приближении все запустилось и сразу заработало Антропик свяжитесь со мной shut up and take my money

  • 30 июн.1 124286

    последняя преграда, оберегающая кожаных от прихода AGI

nlp_daily — tgindex