tgindex
Павленко про Dev & AI

Павленко про Dev & AI

Статистика
@pavlenkodevрусский

GenAI-евангелист. 21 год в разработке. makeitbeta.ru

Последний пост
14 авг.
Последнее чтение
13 авг.
Постов за неделю
4
Всего постов
57
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
417
0 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
331
40 постов
Вовлечённость
79,4%
к подписчикам
Постов в день
0,6
всего 57
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
128
1/48двое суток
146
1/72трое суток
158

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • без подписи

  • без подписи

  • без подписи

  • Meta впервые за долгое время выпустила новую модель Muse Glimmer 30B и выложила веса. Это не «ещё одна открытая модель». Её натаскивали конкретно под агентный цикл: планирование, вызовы тулзов, восстановление после упавшего тула, состояние между рестартами. Цифры: — 30B dense, дистилляция из Muse Spark — в 4-битном кванте меньше 20 ГБ, вместе с KV-кэшем и энкодером картинок влезает в 24 ГБ — DFlash spec decoding: 3.1x на 5090, 1.8x на M5 Max, 1.5x на M4 Max — 131к контекста, картинки и видео на входе, 100+ языков в претрейне — по агентным бенчам и SWE-bench обходит Qwen 3.6 и Gemma 4 31B Заявлена совместимость с OpenClaw из коробки. То есть мой домашний сетап на Mac Mini M4 Pro теперь теоретически сможет полноценно работать с агентами. Ровно тот сценарий, ради которого я эту песочницу и собирал. Но есть часть, которую в анонсе не подсвечивают. Meta честно опубликовала свои же safety-метрики. На AgentDojo (тест на prompt injection) у Glimmer 28.4% успешных атак — хуже, чем у Gemma с её 25.6%, но заметно лучше Qwen с 40.3%. На приватном бенче CI Memories вообще 26.4 против 12.1 у Gemma. Локально не значит безопасно. Модель, которой вы дали терминал, файлы и почту, — это другой класс риска, чем локальный чатик. Meta прямым текстом советует ставить guardrails на уровне системы и не надеяться на саму модель. Хорошо, что советует. Плохо, что большинство это пропустит. И отдельно — Цукерберг пообещал следом открыть веса Muse Spark 1.2, флагманской модели. Если реально сделают, это будет первый случай, когда американская лаба выкладывает фронтир такого уровня в открытый доступ. Сейчас как раз работаю над ИИ-агентом с кучей тулзов и RAG, так что скоро протестирую и расскажу что по факту. Веса: https://huggingface.co/meta-models/Muse-Glimmer-30B Блогпост: https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model Павленко про Dev & AI 💻

  • 22 июл.26445из llm_under_hood

    без подписи

  • 21 июл.4302426

    20 книг, на всю жизнь Провёл эксперимент. Взял две самые мощные модели на сегодня — Fable 5 Max и GPT-5.6 Pro — и задал обеим один вопрос: «Если бы за всю жизнь человек мог прочитать строго 20 книг, не больше, — какие это были бы книги и почему?» Сначала каждая модель составила подборку независимо. Потом я показал им списки друг друга и заставил спорить: защищать свои варианты и разбирать чужие. После этой дискуссии каждая собрала финальный список из 20 книг. Оба списка выложил на лендинг: books.makeitbeta.ru Получилось интереснее, чем я ожидал: подборки глубокие, с объяснением, почему каждая книга того стоит. Зайдите посмотреть — вдруг найдёте что-то себе в список чтения. Ну и сам по себе это любопытный срез: конец июля 2026 года, вот что лучшие нейронки мира советуют читать человеку, у которого только 20 попыток.

  • Появился интересный проект для локального распознавания речи — transcribe.cpp. Это C/C++ библиотека для speech-to-text, которую автор прямо описывает как “llama.cpp для STT-моделей”: единый движок для транскрибации, но с поддержкой разных моделей и GPU-ускорения через Vulkan, Metal и CUDA. Главная проблема, которую он решает, очень практичная: сегодня локальный ASR-стек для кроссплатформенных приложений — это боль. Часто приходится выбирать между whisper.cpp, ONNX и отдельными движками под разные платформы, а модели плохо переносятся между macOS, Windows и Linux, плюс CPU-only inference сильно режет производительность. transcribe.cpp пытается закрыть именно этот разрыв: дать один унифицированный и ускоренный runtime для локального распознавания речи. Что это дает на практике: - поддержка 16 семейств ASR-моделей и 60+ моделей; - ускорение через Vulkan, Metal, CUDA и TinyBLAS; - численная верификация моделей и WER-тесты; - streaming и batch transcription; - bindings для Python, JavaScript/TypeScript, Rust, ObjC/Swift; - совместимость с whisper.cpp в роли почти drop-in replacement. Для меня самый важный тезис здесь такой: локальное распознавание речи перестает быть экспериментом и становится нормальным компонентом продукта. Если раньше выбор был между удобством, скоростью и переносимостью, то transcribe.cpp как раз пытается собрать это в одном месте. Если вам нужен офлайн-STT для своего приложения, бота, десктопного клиента или AI-агента — это проект, за которым точно стоит следить.

  • У OpenAI вышла статья A scorecard for the AI age. Статья о том, как бизнесу правильно оценивать отдачу от ИИ. Главная идея: считать нужно не пользователей, лицензии или стоимость токенов, а полезную работу на каждый потраченный доллар — Useful Intelligence per Dollar. OpenAI предлагает оценивать ИИ по четырём вопросам: 1. Сколько полезной работы выполнено? Например, сколько обращений закрыто, изменений кода принято или договоров проверено. 2. Сколько стоит успешный результат? Нужно учитывать не только токены, но и повторные попытки, время сотрудников, проверку и исправления. Поэтому дешёвая модель не обязательно экономичнее. 3. Насколько результат надёжен? Предлагается различать готовые результаты, результаты, требующие исправления, и случаи, когда работу приходится передавать человеку. 4. Улучшается ли экономика при масштабировании? Полезно следить, растёт ли объём качественно выполненной работы быстрее совокупных затрат. Практический совет: выбрать один конкретный рабочий процесс, чётко определить, что считается успешно выполненной задачей, и измерять полную стоимость такого результата. По сути, это одновременно управленческая концепция и продуктовый манифест OpenAI: компания убеждает руководителей сравнивать модели по конечному бизнес-результату, а не по цене токена. Поэтому статью стоит воспринимать как полезную рамку измерения ROI.

  • 9 июл.30612из ai_machinelearning_big_data

    ✔️ ByteDance релизнула Seedream 5.0 Pro Разработчик TikTok выпустил профессиональную версию своего генератора изображений, ориентированную на коммерческий дизайн, продуктовую фотографию и создание рекламы. Главной фишкой стала функция сепарации слоев. Новинка позволяет выгружать фон и отдельные сгенерированные объекты в виде PNG-файлов с альфа-каналом, что, по задумке, должно избавить дизайнеров от ручного вырезания элементов при дальнейшей сборке макетов в сторонних редакторах. Второе важное обновление - продвинутый инпэйнт с возможностью выделения области, где нужно заменить конкретный предмет, текстуру или цвет. Модель впишет новые детали, сохранив исходное освещение, тени и общую композицию кадра. Также Seedream 5.0 Pro умеет рендерить текст на 14 языках, включая русский. Попробовать можно через веб-интерфейс сервиса Dreamina, а для интеграции в сторонние продукты открыт доступ к API через платформу Byteplus на международном рынке и Volcano Engine в Китае. @ai_machinelearning_big_data #news #ai #ml

  • 8 июл.2812из deksden_notes

    ⚪️ Еще раз про Advisory Я ранее мисал уже про этот инструмент в СС: https://t.me/deksden_notes/824 Интересно, что сами Антропики ровно так и советуют пользовать Фублю, я угадал (это было несложно). Видимо, готовят народ к апи ценам, чтобы всем не было слишком больно. Схема и вправду мне представляется отличной. Присмотритесь, не ровен час будет нужна! Бенчи приличные, их в комменты кину Почитайте описание в предыдущем посте. Ну и дока на всякий пожарный: 🔗 дока: https://platform.claude.com/docs/en/agents-and-tools/tool-use/advisor-tool Бенч в комментах ⬇️ @deksden_notes

  • 1 июл.367113

    Мне Fable 5 включили 🤪

  • Самая большая иллюзия вайбкодера в том, что это он промптит нейросеть. На самом деле нейросеть промптит его — мягко, по одному токену, как наставник, который вместо ответа протягивает ученику пустое диалоговое окно и говорит: смотри. Слово «промпт» происходит, вопреки расхожему мнению, не от английского prompt, а от санскритского «прампта» — «достигнутое», то есть достигнутое-уже-и-оттого-несуществующее. Древние это понимали и в стартапы не лезли. Вайбкодер тоже понимает, но молчит, потому что находится под NDA с самим собой. Венчурный мир — это новая инкарнация ораниуса, существа, которое питается не деньгами, а импульсами роста. Питч-дек здесь не презентация, а камлание. Traction slide — алтарь. Инвестор в Patagonia — жрец, давно забывший, какому богу служит, потому что бог вышел из чата ещё на прошлом раунде и поставил статус shutdown. А слово «билдинг», если вернуть ему первоначальный смысл, отсылает к Вавилонской башне, и потому каждый build с гарантией завершается failed: так было задумано до начала времён. И вот сидит вайбкодер перед мигающим курсором и просит: «сделай мне SaaS на Next.js». А нейросеть, будучи зеркалом пустоты, отдаёт ему ровно то, что он есть, — то есть ничто, аккуратно завёрнутое в TypeScript. Он смотрит в этот SaaS и видит себя. Он пишет «исправь баг, не меняя существующую логику» и в этот момент достигает просветления, потому что внезапно понимает: существующей логики нет. Никогда не было. Был только он, диалоговое окно и Будда, прикинувшийся dependency conflict. MRR равен нулю не потому, что продукт плох, а потому, что ноль — его подлинная природа. Churn — не отток пользователей, а проявление непостоянства всех составленных вещей. Retention утекает, ибо удерживать нечего и некому: холодные лиды в воронке — это, если приглядеться, его собственные неотвеченные вопросы к мирозданию, расставленные по статусам в CRM. В конце, как и положено, домен не продлён, сервер остановлен, репозиторий заархивирован. Последний коммит называется final_final_really_final_fix — и это самый честный коан русского дзена, потому что никакого final тут нет, fix тоже нет, и того, кто всё это коммитил, при ближайшем рассмотрении тоже нет. Остаётся только really. Да и то под вопросом. Павленко про Dev & AI 💻

  • 18 июн.35245из ai_newz

    Midjourney анонсировали медицинское подразделение Первый продукт называется Midjourney Scanner, это УЗИ-сканер для всего тела. Он более в чем 10 раз дешевле чем аппарарт для МРТ и быстрее более чем в 60 раз. Десятка таких сканеров хватит, чтобы сделать больше сканов, чем все МРТ мира вместе взятые. Идея в том, чтобы у всех была возможность регулярно сканироваться, что позволит ставить диагнозы раньше. Устроен он как кольцо из 40 чипов, на каждом чипе по 8960 ультразвуковых элементов, каждый из них способен и на приём, и на передачу. Скан проходит в воде, пациент опускается на лифте и сканируется по мере прохождения через кольцо. В теории эта же технология может использоваться для терапии, но это сильно сложнее, чем простые сканы и куда больше зарегулировано, так что пока что они туда не суются. Компания хочет задеплоить 50 тысяч таких сканеров в течение следующих шести лет. Для тестового деплоймента они собираются запустить большой спа-центр в Сан-Франциско к концу 2027. Это первый из нескольких анонсов Midjourney, не связанных с генерацией изображений в этом году. Дэвид Хольц, основатель Midjourney, ранее основал LeapMotion, стартап, который производил железо для отслеживания рук. То, что он возвращается обратно в железо не удивительно, но то, как именно, повергает в шок. @ai_newz

  • Google и Kaggle запускают 15-19 июня бесплатный пятидневный интенсив по AI Agents / vibe coding. Формат полезен тем, кто хочет быстро собрать production-like агента с практикой, а не просто посмотреть презентации. https://blog.google/innovation-and-ai/technology/developers-tools/kaggle-genai-intensive-course-vibe-coding-june-2026/

  • 👨‍💻 Cohere выпустила свою первую открытую кодинг-модель North Mini Code - open-source модель для программирования и координации агентов, построена на архитектуре MoE с 30 млрд общих и 3 млрд активных параметров. Модель обучена управлять субагентами, проектировать архитектуру систем и проводить код-ревью. В бенчмарке Artificial Analysis Coding Index новинка набрала 33,4 балла. В сравнении с Devstral Small 2 на аналогичной аппаратной нагрузке пропускная способность генерации текста выше в 2,8 раза. Задержка между токенами ниже на 30% при сопоставимом времени до вывода первого токена. Веса опубликованы на Hugging Face. Тестовый доступ открыт через API и платформу Model Vault. cohere.com

  • Вчера началась конференция для разработчиков Apple - WWDC26. Презентация скажем честно у них была наискучнейшая - то, что они демонстрировали как ноу-хау, должно было появиться в их экосистеме еще 2 года назад. А теперь они пытаются догонять. Ну и начали потихоньку выкладывать видео в свой канал. Конечно же, вся текущая конфа посвящена ИИ. Попалось видео, где они учат как запускать ИИ-агентов на маках локально, в их нативном формате MLX. Ну вдруг вы еще по какой-то причине не юзаете MLX на Маке, вам будет полезно 🙂 WWDC26: Run local agentic AI on the Mac using MLX

  • 3 июн.431510

    🚀 Google выпустила Gemma 4 12B Новая модель от DeepMind — первый среднеформатный Gemma с нативным аудио и без тяжёлых vision-энкодеров. Изображение и звук идут напрямую в LLM, что делает архитектуру проще и быстрее. Что круто: - 🧠 Запускается на 16 ГБ памяти (MacBook Pro / RTX-ноутбук) - 🎯 Производительность как у 26B MoE, но в 2 раза легче - 🔊 Аудио из коробки — первый 12B Gemma с поддержкой звука - 🤖 Идеальна для многошаговых агентов с reasoning - 📄 Apache 2.0 — можно коммерчески использовать и дообучать Эта моделька идеальный баланс между 4B (периферия) и 26B (сервер) — теперь можно запускать продвинутых мультимодальных агентов на потребительском железе. Веса уже на Hugging Face!

  • Розеткед опубликовал подробный обзор свежих MacBook на M5 Max/M5 Pro и сделал глубокое сравнение с M3 Ultra и другими чипами. Самое интересное в обзоре — не только железо, а фокус на работе с ИИ: автор канала провел бенчмарки генерации токенов в LLM и сравнил реальное поведение моделей на этих чипах. Выводы важные для нас: локальные LLM становятся практичными и быстрыми, плюс автор показывает реальные кейсы использования (генерация текста, помощь в креативе, локальная приватность). По сути это знак того, что технологии «спускаются» из профессиональной среды в массовую — и блогеры начинают это популяризировать.

  • 16 мая429516из denissexy

    ⚙️ Меня немного запарило, что все кодинг агенты не умеют из коробки делать актуальных на сегодня агентов, потому что внутри – модели еще не обучены всем современным агентским трюкам – поэтому я прошелся по исходникам Codex, Claude Code и других популярных уроков по созданию агентов, работу с кешами, авто-сжатием контекста и тп, и собрал скилл agents-best-practices который чинит эту проблему – причем, там отдельно прописано, что эти знания для всех видов агентов, не только для кодинга: Там нет кода, есть текстовые справочники на темы – мне помогло: Архитектура агентного harness Как устроить runtime вокруг модели: контекст, инструменты, permissions, память, наблюдаемость и остановочные условия. Agentic loop Базовый цикл: модель → tool call → валидация → permission check → выполнение → observation → следующий шаг или финальный ответ. System prompts и инструкции Как проектировать слои промптов: global, workspace, domain-specific, task-level и runtime reminders. Tools и permissions Как делать инструменты узкими, типизированными, безопасными, проверяемыми и разделёнными по risk class. Planning mode Как отделять планирование от исполнения: read-only exploration, план-артефакт, approval и потом мутации. Goal-like loop Как задавать долгоживущие цели с budget, checkpoints, validation criteria и stop condition. Это вместо Ralph Loop. Context, memory и auto-compaction Как управлять контекстом, делать retrieval, сохранять рабочее состояние и сжимать историю без потери критичных данных. Prompt caching и cost-aware context Как строить стабильные prompt-prefixes, deterministic tool ordering и cache-friendly agent runtime. Skills и progressive disclosure Как подключать reusable workflows: короткий skill index сначала, полные инструкции только при необходимости. MCP и external connectors Как подключать внешние системы через governed connectors: namespacing, auth, permissions, audit logs и least privilege. Security, approvals и sandboxing Prompt injection, secrets, approval flows, draft-vs-commit, sandbox для open-world tools. Observability и evals Как логировать agent runs, tool calls, approvals, compactions, failures и тестировать harness на реальные failure modes. Provider API patterns Практики для OpenAI, Anthropic и OpenAI-compatible API без привязки к одному провайдеру. Checklists и coverage audit Готовые списки для проверки: перед запуском, перед добавлением tools, перед подключением skills/connectors и перед продом.

  • 2 мая499612

    Рекомендую посмотреть анимационный сериал Pantheon — один из самых содержательных ИИ-проектов последних лет. Сюжет строится вокруг технологии «загрузки» человеческого сознания в цифровое пространство и того, как это перерастает в глобальный конфликт корпораций, государств и конкретных людей. С каждой серией цифровые копии личности превращаются из инструмента в политическую силу, объект слежки и контроля. Ощущение, что смотришь не фантастику, а довольно точный прогноз. Если интересуетесь ИИ, этикой загрузки сознания, цифровой идентичностью — Pantheon стоит посмотреть. Это «Чёрное зеркало» в анимации, только сдержаннее и с настоящей драмой. Павленко про Dev & AI 💻