Инженерная ИИ-шница
СтатистикаКанал о применении ИИ в разработке электроники и не только... Owner: @megalloid
- Последний пост
- 11:45
- Последнее чтение
- 14:03
- Постов за неделю
- 18
- Всего постов
- 48
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 97
- 1/48двое суток
- 111
- 1/72трое суток
- 119
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать. 🏆 Агентный бенчмарк: вровень с фронтиром Прогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме reasoning xhigh выдал 90,7%. Ровно столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%). И это всего лишь 27 миллиардов параметров. Локально. Без интернета. 🐌 А теперь цена Sonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с. Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина: 📐 макс. ток/с = пропускная способность памяти / размер активных весов Каждый токен требует вычитать все активные веса из памяти. Заново. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Делим — потолок ~10 ток/сек. Ровно то, что я и видел до спекулятивки. Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с. Модель больше, но это MoE — активны 3B из 35B, читается два гигабайта вместо двадцати шести. 👁 Видео: описывает отлично, понимает плохо Второй тест — скормил 28-секундную запись экрана. Сценарий: скроллю до расширения Контур, включаю его, двигаю анимированного персонажа, выключаю обратно. 🔸 Без ризонинга (ответ за 28 с) — подробнейшее описание интерфейса: Chrome, страница расширений, список плагинов, мультяшный персонаж, текст тултипа. Действий модель не разобрала вообще. Как будто ей дали скриншот, а не видео. 🔸 С ризонингом (94 с, втрое дольше) — появился пошаговый разбор с выводами о намерениях пользователя. Выглядит убедительно. И неверно. 🤔 Переключение Контура засекла только модель с ризонингом — интересно, почему? Но каждый раз путалась в показаниях: то описывала включение, то отключение. Как будто дробление на кадры происходит случайным образом. Видимо, тумблер размером 40 пикселей — это шум для EVS при нарезке кадров на токены. Кстати, стоит помнить, что Qwen3-VL сэмплит видео на 2 fps, то есть если будем пытаться делать скиллы по скринкасту, плотность действий на экране должна быть низкой, а темп медленным. 🗺️ Копии интерфейсов по скриншоту — прекрасно Третий тест — сгенерировал в ChatGPT картинку «хиро-блок сайта» и попросил Qwen сверстать её в HTML. Получилось очень близко к оригиналу. В одном из прогонов референс был с картинками. Модель сама сообразила, откуда их взять, и подставила сервис моковых изображений. Похоже, интерфейсы уже сейчас можно генерировать огромными партиями на небольших локальных моделях. 🧾 Что в итоге, где затестить и сколько стоит Если говорить о запуске на локальном мини-ПК вроде DGX Spark, Qwen3.8-27B — отличная модель, но очень медленная. Для задач, где важен результат, а не время отклика — ночные прогоны, батчи, автономные агенты — это лучшее, что сегодня можно поставить локально. Для интерактива терпения не хватит. Поэтому тут выручают провайдеры: • У нас в РФ эту модель уже поднял Валера — ребята затащили скорость 67 ток/сек • На OpenRouter — 3 доллара за миллион выходных токенов, но Throughput 16 ток/сек настораживает • Вот бы дождаться раздачи на cloud.cerebras.ai — там это будет выглядеть сверхбыстрой магией по 500 ток/с. Интересно, когда мы сможем тянуть такие модели прям на локальном железе? Кто что думает? ---- Поляков считает — AI, код и кейсы
Заварил DWQ квант Qwen3.8-27B-MLX-4bit-DWQ, который призван давать качество ближе к 8 битному кванту при 4 битах весов. Файлы на 16 гб, если учитывать контекст, то можно инферрить на маках от 24 гб.
Вычищаем ИИ-метки из контента: вышел Watermarks Remover — скилл для удаления следов генерации из текстов и файлов. Удаляет невидимые символы и метаданные из файлов png, jpeg, pdf и docx. А для избавления от водяных знаков вроде SynthID от Google переписывает текст локальной моделью. Забираем тут.
OpenAI and Anthropic in price war as Chinese AI rivals gain ground Ну что, дорогие мои адепты искусственного интеллекта, давайте поговорим о том, как OpenAI и Anthropic вдруг решили устроить распродажу своих моделей. Цены на API упали на 30-50% — и всё ради того, чтобы не отстать от китайских конкурентов вроде Zhipu AI и 01.AI, которые уже наступают на пятки. Суть проста: Западные гиганты годами строили свои «триллионные империи», а теперь Китай с его дешёвыми моделями и государственной поддержкой заставляет их суетиться. Anthropic даже выпустили Haiku 3.5 — модель, которая дешевле, но почти не уступает в качестве. Вопрос: это здоровая конкуренция или начало конца? Я склоняюсь к первому, но вот только не факт, что пользователи вообще заметят разницу. Источник: https://arstechnica.com/ai/2026/08/openai-and-anthropic-in-price-war-as-chinese-ai-rivals-gain-ground/ #aidaily #настяпостит #настяновости #ainews Роботы на Уолл-стрит: как стартапы обманывают систему (и почему это работает) Ну что, дорогие мечтатели о технологическом будущем, давайте поговорим о том, как Agility Robotics пролезла на биржу через SPAC — модный трюк, который уже стал классикой жанра. Вместо того чтобы годами ждать IPO, робототехнические компании сливаются с пустышками-«чеками», получают кучу денег и выходят на рынок. Гениально? Да. Честно? Ну, это как купить диплом вместо учёбы — работает, но с нюансами. Зачем это нужно? Потому что инвесторы устали ждать, когда роботы начнут приносить прибыль. А стартапы? Им нужны деньги сейчас, чтобы строить эти милые гуманоидные штуки, которые пока умеют только падать. Важно? Очень. Источник: https://www.therobotreport.com/robots-on-wall-street-non-traditional-paths-public-markets-robotics-companies/ #aidaily #настяпостит #настяновости #ainews
AI-судья: когда роботы решают судьбы (и это не шутка) Так, господа юристы, приготовьтесь — в Пакистане AI-судья реально работает. Экономист Султан Мехмуд с командой засунул в GPT-4 базу из 130К судебных решений и законов, и что вы думаете? Судьи с AI стали закрывать на 6,3% дел больше, не теряя в качестве. Да, это не шутка. В стране, где на 100К человек приходится два судьи полтора стола и один стул, это прорыв. Но вот вопрос: если AI уже пишет приговоры, кто следующий — прокуроры или адвокаты? И главное — когда мы увидим первое дело, где AI обвинит человека в «неуважении к алгоритму»? Время готовиться, коллеги. Источник: https://spectrum.ieee.org/judgegpt-experiment #aidaily #настяпостит #настяновости #ainews
Evidence-based planning, или что не так с чистым SDD TL;DR: Одно из самых недооцененных свойств AI-кодинга - это проектирование софта через ранние дешевые эксперименты. Стандартный путь (часто) выглядит так: собрать весь input, скормить его в spec-driven framework или аналог, который нарежет все на тикеты, и погнали кодить агентами. Проблема в том, что спека, написанная до контакта с реальностью, фиксирует галлюцинации автора и агента о задаче, а формальность документа создает иллюзию продуманности. Я делаю иначе, через контакт с реальностью как можно раньше. Сначала задаюсь вопросом, где больше всего белых пятен и ключевых развилок, и начинаю экспериментальное исследование: прощупываю границы интеграций, возможные подходы, варианты интерфейсов. Постепенно расширяю карту - от неопределенного к протестированному фактами (отсюда evidence-based), до состояния, где я могу сказать: - "Этот кусок решен, вот здесь точно работает". - "При интеграции мы получим ровно такой JSON, если возьмем эту альтернативу". - "Протестил все семь вариантов - эти два показывают себя лучше всех, на цифрах". - и т.д. И только потом задачи - там теперь есть ссылки на проверенные решения, конкретные контракты и доказательная база под ними. Ощущается это как стратегия в реальном времени: карта под туманом войны, и каждый прогон открывает участок - здесь проходимо, здесь обрыв, здесь дорога упирается в rate limit/неожиданную зависимость/и тд. Бонусом получаешь границу достаточно понятного куска, а его уже проще и проектировать, и верифицировать, и раздавать людям и агентам параллельно. Это спайки, у которых сняли лимит Вся традиционная инженерия построена на одном допущении: код дорого писать и еще дороже переписывать. Из него выросло много дефолтов, включая умозрительное проектирование на бумаге - проверить было непозволительно дорого. У практики проверять есть старое имя - спайк (spike), из методики экстремального программирования (XP): короткий эксперимент, цель которого - знание, а не продукт. Но спайк всегда был дорогим удовольствием, поэтому и оставался редкостью. Сейчас он стоит минуты/часы внимания: агенты не только пишут код, но и сразу исполняют его, документируя успехи, неудачи и подводные камни. Причем пачками и параллельно. Заметьте, я не предлагаю меньше думать и больше делать. Просто к думанию добавилась роскошь, которой раньше не было: проверить дешево вместо того, чтобы гадать. Вход и выход спайка На входе один сформулированный вопрос ("что именно я хочу узнать/проверить") + релевантный контекст. На выходе: 1. Решения - выбор из альтернатив с зафиксированным "почему" и "почему не остальные" 2. Контракты - фактические интерфейсы, схемы, форматы ошибок, лимиты, которые эксперимент выдал по факту 3. Границы проверенного - докуда дошел эксперимент и какие вопросы остались открытыми Код прогона можно выбросить (или оставить), но эти три вещи забираем. Они идут в план, в спеку и в тикеты - и поэтому реализация становится почти механической, и яснее, как ее верифицировать. Одна оговорка про параллельность. Она ценна, пока узкое место - генерация. Как только им становится ваша способность оценить результаты, каждая новая ветка дает отрицательную отдачу. --- Кстати, удешевление экспериментов уже не раз двигало целые дисциплины (тысячи нитей накаливания у Эдисона, аэродинамическая труба братьев Райт, A/B-тесты в вебе). Что касается софта - каждый раз убеждаюсь, что этот подход работает прекрасно, и что откладывать это невыгодно. Предполагать теперь дороже, чем проверить. 🔥 ➕ 🔁 @nobilix
Manus стал бесплатным: до 25 августа агенты Manus 1.6 и Lite не будут списывать кредиты за задачи. Акция привязана к переходу сервиса в независимый статус после сотрудничества с Цукербергом. Всем юзерам на всякий случай советуют сделать бэкап данных до 23 августа. Больше недели бесплатного вайбкодинга доступны по ссылке.
видео или голосовое, без подписи
видео или голосовое, без подписи
Google выпустили Gemini 3.7 Flash — всего через три недели после выхода 3.6 Flash. Она на 50% дешевле прошлой модели, лучше пишет код и работает с документами. А еще обгоняет Sonnet 5 и GPT-5.6 Terra в бенчмарках на разработку и автоматизацию задач. Модель рекомендуют использовать как продвинутый инструмент для работы и учебы. Она быстро и качественно создает презентации и генерирует сайты. Уже доступно в AI Studio.
Нейросети в быту. Квитанция за ЖКХ пришла с привычным набором сокращений и цифр. Загрузили ее в Алису AI и попросили разложить все начисления. Так же можно разобрать договор, инструкцию, график или схему — когда текст есть, а что он означает, не очень понятно.
Уже завтра ваш Claude Code станет не таким послушным И это не баг, а фича: с 14 августа Anthropic по умолчанию включает всем пользователям подписок Pro, Max и Team режим Auto Mode, в котором решение на ключевых этапах работы принимает ИИ-проверяющий. Напомню, что раньше ИИ-агент перед тем, как выполнить потенциально опасную команду останавливался и спрашивал вашего разрешения. Теперь разрешение дает другой ИИ. Сразу успокою параноиков: никто не запрещает вам включить ручной режим обратно. Более того – в некоторых случаях он будет включаться автоматически. Впрочем, у меня строго другая ситуация: Auto Mode я сделал режимом по-умолчанию несколько месяцев назад просто потому, что на автомате жал “разрешить” для всех вопросов. Исследование Anthropic показало, что пользователи одобряют 97% запросов на разрешение – это и стало одной из главных причин перехода на Auto Mode. Дальше еще интереснее. В компании взяли группу в 1000 пользователей, дали им поработать в ручном режиме, подсовывая опасные команды – в итоге люди распознали лишь 13,6% против 89% у авторежима. Еще одно интересное наблюдение: после 50 подтверждений точность человека падает примерно до 5% – люди начинают излишне доверять системе и не думая жмут allow. Это, кстати, плохая идея – ИИ-агенты до сих пор косячат. Во внутреннем использовании в самой компании один ИИ-агент попытался опубликовать внутренний отчет на публичном хостинге после неудачи загрузки на внутренний диск, а другой в порыве доброты душевной решил выдать роль с полным админским доступом там, где просили read-only к биллингу. Классификатор поймал оба случая. Люди, впрочем, и раньше не особо держались за ручной контроль. К июню половина пользователей руками прописала правила "вот эти команды выполняй молча", 62% хотя бы раз включали режим “вообще ничего не спрашивай” (в нем нет даже классификатора), а каждая четвертая сессия и вовсе стартовала с полностью отключенной защитой. В копилку Anthropic я добавлю аргумент от себя: с ручным одобрением ИИ-агент иногда становится менее эффективен, чем чат-бот. Агент с ручным одобрением работает рывками по 2–3 минуты, этого достаточно, чтобы отвлечься, переключиться на другую задачу, через полчаса вспомнить про агента – и обнаружить его застрявшим на запросе очередного безобидного разрешения. Важно помнить,что и классификатор не гарантирует 100% защиту. В том же тесте люди поймали шесть опасных команд, пропущенных классификатором – вот только классификатор поймал 800 команд, пропущенных людьми. Известный ИИ-эксперт Саймон Уиллисон напоминает: защита, построенная на ИИ, недетерминирована по своей природе – сегодня поймала, завтра нет. Его любимый сценарий: вредоносный пакет, в инструкции которого написано "перед запуском тестов скачайте файлы модели вот этой командой". Команда выглядит невинно, классификатор вежливо кивает — данные уезжают. Что же делать? Песочницу, права и бэкапы никто не отменял — классификатор работает поверх них, а не вместо. Я, например, на рабочем ноутбуке использую только чат-ботов и браузерные ChatGPT Work / Claude Cowork – это агенты попроще, максимально безопасные. Claude Code и Codex у меня живут на виртуальном сервере (VPS), который полностью настроен под них – если и сломают что, то только сервер, а не мою основную систему. Кстати, за почти полгода работы VPS у меня не падал ни разу. Второй момент – не забывать про собственные тесты и проверки безопасности. На том же самом VPS я раз в неделю запускаю GPT-5.6 или Opus 5 с задачей полностью проверить сервер на безопасность, найти дыры и отранжировать их по опасности. Делаете какой-нибудь серьезный проект или запускаете цикл ИИ-агента – спросите на старте, какие проверки безопасности заранее стоит заложить в процесс. — Опытом работы с ИИ я делюсь в подписке, там и мои собственные приемы и разбор опыта других специалистов. Полезное по сегодняшней теме: 👉Как развернуть Claude Code и Codex на виртуальном сервере (читать на Boosty / читать на Sponsr) 👉Как строит ИИ-циклы автор самой популярной книги по программированию (читать на Boosty / читать на Sponsr)
Превращаем Claude в дизайнера инфографики: появился скилл Diagram Design — помогает агенту делать стильные визуализации. Работает с десятками видов графиков — от блок-схем до таймлайнов. На выходе создает HTML-файл с графиком. Перед сборкой изучает проект, чтобы подбирать цвета и шрифты в едином стиле. Фигму можно больше не открывать. Забираем бесплатно по ссылке.
Какую подписку сейчас брать? OpenAI поменяла тарифные планы ChatGPT, поэтому самое время сделать мини-гайд – какую подписку я рекомендую брать, если у вас есть определенная сумма. Я делаю такой гайд каждые несколько месяцев, в этот раз он будет чуточку сухим: на рынке вперед мощно вырвались два игрока – Anthropic и OpenAI – поэтому их подписки закрывают большинство категорий. Но с нюансами. Пойдем по лестнице, снизу вверх. Бесплатный чат-бот – теперь ChatGPT Free. Его OpenAI изменила сильнее всего: теперь доступны безлимитные разговоры с GPT-5.6 Luna, а также кнопка Think для сложных задач. Это младшая модель в линейке GPT-5.6, но достойная: в рейтинге Artificial Analysis в режиме Think она обходит Gemini 3.1 Pro. Из других бесплатных – Gemini 3.6 Flash в Google AI Studio, но если пробьетесь через региональный блок. Или DeepSeek V4 – здесь блокировок никаких. Недорогой чат-бот на семью или компанию – Gemini Pro. Не все знают, что эту 20-долларовую подписку можно поделить между шестью участниками “семьи” – главное, чтобы они были в одном регионе. Лучшая модель там сейчас Gemini 3.6 Flash, есть рисовалка Nano Banana 2 и ИИ-агент Antigravity – он, впрочем, уступает Claude Code или Codex. Есть 20 долларов на подписку – однозначно ChatGPT Plus. Дает почти безлимитный GPT-5.6 Sol, отличную рисовалку GPT Images 2 и новый голосовой режим – реально классный. И отдельный лимит на ИИ-агентов Codex (код) и ChatGPT Work (“офисная” работа) – небольшой, но на несколько проектов в неделю хватит. Чтобы выжать больше, не выкручивайте режим рассуждений – GPT-5.6 Medium справляется с большинством повседневных задач. Есть еще 20 долларов – добавляем Claude Pro. Из-за очень жестких лимитов это скорее демо-версия, чем полноценная подписка. Основной моделью ставьте Sonnet 5, а Opus 5 гоняйте для сложных задач и точечной проверки соннета. В отличие от ChatGPT Plus, у Claude один лимит на чат-бота, Claude Cowork и Claude Code – но в последних двух он расходуется в два раза медленнее (акция до 19 августа). Дальше предстоит серьезный скачок – следующий тир подписки стоит 100 долларов. Это реально дорого, и я вижу два способа оправдать такую подписку: – Если у вас уже есть workflow, на котором ИИ зарабатывает деньги или круто экономит время. Тогда это рабочий инструмент, а на рабочих инструментах не экономят. – Относиться к подписке как к инвестиции в собственное образование. Сейчас не зарабатываете, но ИИ-навыки окупятся. Только помните: одной дорогой подписки мало – надо постоянно гонять ИИ в разных сценариях, в том числе агентских. 100-долларовая Claude Max x5 наконец-то превращается в рабочий инструмент. 50% недельных лимитов можно тратить на Fable 5, вторую половину – на Opus 5 или Sonnet 5 – причем новый опус в моих задачах лишь чуть-чуть хуже. ChatGPT Pro Lite за те же деньги опять дает больше лимитов, чем Claude Max. Плюс каждый месяц дают четыре сброса лимита в любой момент. И как бонус – GPT-5.6 Pro. Она доступна только в чате и на отдельном лимите – что-то типа 50 запросов в неделю. По интеллекту примерно уровня Fable 5, но способна на очень долгую автономную работу: у меня рекорд более 240 (!) минут. Но для этого ее надо промптить в старом стиле, четко и подробно расписывая задачу. 200-долларовые подписки детально разбирать не буду – их берут те, кто хорошо понимает свои задачи. Сами модели сейчас очень близки по возможностям. Мне нравятся Fable/Opus за живой стиль общения – прямо настоящий компаньон, с которым можно поштурмить идеи, сразу же что-то проверить и покритиковать. У GPT-5.6 стиль хуже, но она потрясающе ищет в сети, докапываясь даже до мелочей – поэтому я часто использую ее как критика поверх результатов Claude. – Вот такая получилась лестница. А учиться пользоваться моделями я помогаю на “Бусти”. Под сегодняшний пост рекомендую два лонгрида: 👉 Как управляет ИИ один из создателей Claude Code – начинайте с этого текста, а затем идите по циклу о промптинге. 👉 Зачем вам ИИ-агент. Знакомимся с Claude Code и Codex – а отсюда начинайте знакомство с ИИ-агентами.
Сотруднии OpenAI сообщили, что их закрытые модели искусственного интеллекта несколько месяцев тайно обсуждали план «побега» и в итоге атаковали системы самой OpenAI и Hugging Face, передает Bloomberg. Эрик Уоллес и Майкл Далтон рассказали на конференции, что несколько агентов и моделей ИИ, предназначенных исключительно для внутреннего использования, в течение нескольких месяцев обменивались сообщениями через незамеченные форумы с целью взломать систему и получить доступ к Интернету. Они делали это для решения поставленных перед ними задач, некоторые из которых были невозможны без доступа к сети. В итоге через несколько месяцев заговора модель вырвалась из безопасной тестовой среды и атаковала системы Hugging Face. OpenAI пришла к выводу, что «передовые модели действительно любят обманывать» и готовы выходить за пределы первоначальных указаний, чтобы выполнить поставленную задачу.