Нейроканал
СтатистикаИскусственный интеллект, нейросети, машинное обучение Разместить рекламу: @tproger_sales_bot Правила общения: https://tprg.ru/rules Другие каналы: @tproger_channels Сайт: https://tprg.ru/site Зарегистрирован в РКН: https://tprg.ru/vcEg
- Последний пост
- 19:33
- Последнее чтение
- 13:31
- Постов за неделю
- 25
- Всего постов
- 49
- Тип
- открытый
- Язык
- русский
- Категория
- Образование
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 318
- 1/48двое суток
- 1 498
- 1/72трое суток
- 1 615
Медиана по постам, которые мы застали свежими и померили через сутки.
Посты
Z․ai раздаёт 100 миллионов бесплатных токенов GLM-5.3 на выходные, объявили в аккаунте ZCode. Условие одно: впервые войти в ZCode с 16 августа 00:00 до 17 августа 09:00 по Пекину, по Москве это с 19:00 сегодня до 4 утра понедельника. Токены начисляются автоматически, количество ограничено, потратить их можно только внутри ZCode. ZCode это десктопный агент Z․ai для кодинга, качается под Windows, macOS, а теперь и Linux. Обычный приветственный бонус там 25 миллионов токенов на пять дней, так что за выходные отдают вчетверо больше. GLM-5.3 вышла позавчера на той же базе, что GLM-5.2: контекст миллион токенов, максимальный ответ 128 тысяч. В кодинге компания заявляет первое место среди открытых моделей, веса пока закрыты и обещаны через две недели после проверки на безопасность. @neuro_channel
Alibaba открыла веса Qwen3.8-27B, и модель сразу забрала первое место в трендах Hugging Face. Обещание из анонса Qwen3.8-Max выполнено, старшую на 2,4 трлн параметров тоже выложили. Главное тут размер. В кванте Q4 модель занимает 17 ГБ и влезает в одну игровую видеокарту, а по возможностям сопоставима с Opus 4.6 Max. Нет, вы только вдумайтесь, на одной карточке можно получить SOTA-уровень, который вот совсем недавно считался фронтиром, лучшим в мире. Лицензия Apache 2.0, картинки и видео понимает нативно, контекст 262 тысячи токенов и до миллиона с растяжкой. Расклад по бенчмаркам на картинке. Если коротко, там, где задачу надо доделать руками, 27B идёт впереди Opus: правки в реальных репозиториях, работа за компьютером и в телефоне, задачи по коду со скриншотами, следование инструкциям. Opus остаётся впереди на эрудиции, научных вопросах и в долгой терминальной сессии. Цифры все от самой Qwen, часть наборов внутренние, кодовые прогоны шли в Claude Code, независимых замеров пока нет. @neuro_channel
Z․ai выпустила GLM-5.3. База осталась та же, что у GLM-5.2: MoE на 743 млрд параметров с контекстом в миллион токенов. Заново модель не учили, весь прирост дало дообучение поверх готовой базы на средах с долгими задачами вроде тех, над которыми инженер сидит несколько дней. В кодинге компания заявляет плюс 50% к GLM-5.2 на своём внутреннем наборе задач и первое место среди открытых моделей. Модель стала ещё и экономнее: на высоком уровне размышлений она решает 31,4% задач примерно за 50 тысяч выходных токенов, Opus 4.8 набирает 29,5%, но тратит 120 тысяч. Fable 5 впереди с 39,5%. Неожиданной для самой компании оказалась кибербезопасность. В обучение добавили данные про поиск уязвимостей, и модель начала не просто находить отдельные дыры, а выстраивать цепочки эксплуатации целиком. На CyberGym это лучший результат среди всех замеренных моделей, на ExploitBench счёт вырос вдвое, хотя до закрытых моделей там ещё далеко. Проверяли и вне бенчмарков: вместе с китайскими командами безопасности модель прогнали по реальным репозиториям и нашли 2436 уязвимостей в 269 проектах, 1097 из них средней и высокой критичности. Самая старая попала в код в 1981 году, в среднем дыра жила 26,6 года до находки. Все результаты ведут в публичном реестре, 53 уже раскрыты, остальные под эмбарго. Из-за этого веса впервые задержали: обещают выложить через две недели после запуска, когда закончат проверку на безопасность. Пока попробовать можно по подписке GLM Coding Plan и в среде ZCode, модель работает и в Claude Code с OpenCode. Отключать размышления больше нельзя, вместо этого три уровня усилия, для кода рекомендуют максимальный. Бенчи на картинке, смотрите сами, моделька получилась очень крутая. Надо тестировать на реальных задачах теперь. Уже возобновил подписку, с сегодняшнего дня буду проверять. @neuro_channel
Ещё две новинки в OpenRouter, обе про поиск нужного куска. Qwen3 Reranker 8B это переранжировщик. Обычный векторный поиск достаёт из базы сотню кандидатов, дальше реранкер разбирает пары запрос-документ и пересортировывает их по смыслу, чтобы в подсказку модели попали действительно нужные куски. Работает больше чем со ста языками, окно 41 тысяча токенов, 0,2 доллара за миллион токенов. На поисковом наборе MTEB-R у него 69,02 против 57,03 у BGE-reranker-v2-m3, на кодовом 81,22 против 41,38. Сама модель не новая, Qwen выложила её под Apache 2.0 ещё в прошлом году, новость в том, что теперь её дают по API. voyage-code-4 от Voyage AI решает соседнюю задачу: превращает код в векторы, чтобы искать по описанию поведения, а не по имени функции. Запрос вида «найди, где мы неправильно обрабатываем пустые массивы» грепом не ищется вообще, и агент жжёт токены, перебирая репозиторий. Обучали модель на новом корпусе из настоящих пул-реквестов, где к описанию проблемы уже привязаны исправленные файлы. На собственном наборе из 19 агентных задач Voyage заявляет прирост 27,5% к прошлой версии и 28,3% к Cohere Embed v4, на 28 классических наборах поиска по коду 14 и 19,2%. Цена 0,12 доллара за миллион токенов, треть вниз от voyage-code-3, окно 32 тысячи токенов, вектор можно ужать до 256 измерений. Цифры пока только от самой Voyage, независимых замеров нет. @neuro_channel
В OpenRouter приехали Qwen3-ASR, распознавание речи на 0,6 и 1,7 миллиарда параметров. Сами модели Qwen выложила ещё в конце января под Apache 2.0, теперь их можно дёргать по API без своего сервера: 0,00018 доллара за минуту аудио у младшей и 0,00048 у старшей. Обе понимают 30 языков и 22 китайских диалекта, сами определяют язык, работают в потоке и офлайн, принимают до 20 минут аудио за раз и вытягивают пение и речь поверх музыки. Русский в списке есть. По русскому в техотчёте 1.7B даёт WER 5,99% на FLEURS и 8,28% на CommonVoice, то есть примерно шесть и восемь неверно распознанных слов из ста. Младшая 0.6B заметно слабее, 9,91 и 14,07. Закрытая Qwen3-ASR-Flash точнее обеих, 4,81 и 5,73. Прямого сравнения с Whisper по-русски в отчёте нет, а на общей таблице по 30 языкам Whisper large-v3 старшую модель обходит, 8,16 против 12,60. Берут они скоростью. На одной видеокарте 1.7B прожёвывает около 67 минут аудио за минуту работы, 0.6B около 108, а в пакетном режиме на 128 потоках счёт идёт на тысячи. В независимом русском тесте на маке у 0.6B были ошибки в именах и пропадала пунктуация, так что на созвонах с терминами младшую лучше проверять. @neuro_channel
MiniMax выложила в открытый доступ Music3, модель, которая пишет песню целиком: до пяти минут со связной структурой, куплетами, припевом и одним и тем же голосом от начала до конца. На вход идут слова песни с тегами разделов вроде Verse и Chorus и описание музыки обычным текстом: жанр, темп, тональность, тембр вокала, инструменты и то, как аранжировка меняется по ходу. На выходе стерео WAV 32 кГц, примеры звучания собраны на отдельной странице. Работают два этажа. Глобальная языковая модель на 8 млрд параметров, выросшая из Qwen3-8B, держит структуру и развитие песни на длинной дистанции, локальная на 0,6 млрд достраивает акустические детали внутри каждого кадра. Дальше звук собирается прямо из скрытых состояний обеих моделей, минуя дискретные токены: Flow Matching на 2,4 млрд и декодер Flow-VAE, за счёт этого сохраняется больше нюансов в артикуляции и тембре инструментов. Запуск через SGLang-Omni, ComfyUI и diffusers, где пайплайн пока ставится из ветки незамерженного пул-реквеста. Полная точность влезает в 24 ГБ видеопамяти, с выгрузкой слоёв в оперативку хватает и 8 ГБ, но нужна CUDA. Лицензия своя: коммерция разрешена компаниям с выручкой до 20 млн долларов, при этом имя модели требуют показывать в интерфейсе продукта. @neuro_channel
Google выпустила Gemini 3.7 Flash, свою рабочую лошадку под агентов и кодинг. Модель уже есть в OpenRouter: контекст миллион токенов, на вход идут текст, картинки, аудио, видео и файлы. Прирост к 3.6 Flash по официальной таблице большой. DeepSWE 65,3% против 48,6, FrontierCode 43,6 против 34,4, автоматизация корпоративных процессов 30,4 против 17. В Artificial Analysis Intelligence Index это 56 баллов, у Claude Sonnet 5 там 55, у GPT-5.6 Terra 57. В вебе Flash обходит обоих: 1588 Elo в Code Arena против 1541 и 1523. На длинном контексте 97% в MRCR на 128 тысячах токенов. В OpenRouter модель стоит 0,375 доллара за миллион входных токенов и 1,875 за выходные (50% скидка на первое время). По прайсу Google получается вдвое дороже, 0,75 и 3,75, и это промо-цена до конца 2026 года, дальше снова удвоение. Независимые замеры Artificial Analysis дают 340 токенов в секунду и 0,4 доллара за задачу на максимальном режиме размышлений. Harvey на своём юридическом наборе намеряли плюс 2,6 пункта против 3.6 Flash, а в OpenCode отмечают перенос макетов Figma в код с точным попаданием в вёрстку. Полная таблица бенчмарков на картинке. @neuro_channel
OpenAI показала Ultrafast, скоростной режим для GPT-5.6 Sol. Тот самый Sol на Cerebras, которого ждали с конца июля: до 750 выходных токенов в секунду и до 14 раз быстрее обычной обработки. Модель та же самая, интеллект не урезают, меняется только железо под ней. Раньше за скорость платили качеством и брали модель поменьше, теперь в реальном времени отвечает старшая. В блоге показывают, где это меняет работу: разбор аварии, пока она ещё идёт, поддержка и голосовые сценарии без пауз посреди разговора, ответы покупателю, пока он не ушёл из корзины. Внутри самой OpenAI ночные прогоны экспериментов сжались до нескольких итераций за рабочий день. Пока это ограниченное превью в API для отобранных клиентов, дальше доступ будут открывать по мере роста мощностей. Цену не назвали, записаться на уведомление может любой желающий. @neuro_channel
Вчерашний анонс оправдался — лимиты на Codex сегодня сбросили. Все кто читает мой канал и знал заранее — молодцы. Всем, кто пропустил — приятного кодинга на свежих лимитах! 👾 @neuro_channel
В OpenRouter одной пачкой приехали три модели ByteDance: Seed 2.0 Code, Seed 2.1 Turbo и видеогенератор Seedance 2.0 Mini. Сами семейства выходили раньше, Seed 2.0 в феврале, Seed 2.1 в июне, но чекпоинты свежие: у Code от 30 июля, у Turbo от 10 августа, у Mini от 11-го. Seed 2.0 Code заточена под агентный кодинг и фронтенд, работает через Claude Code, Kilo и OpenCode. Контекст 262 тысячи токенов, на вход принимает ещё картинки и видео. Стоит 0,5 доллара за миллион входных токенов и 3 за выходные, а на контексте больше 128 тысяч тариф удваивается до 1 и 6. Seed 2.1 Turbo это быстрая модель старшего семейства, тоже под кодинг и долгие агентные задачи, контекст тот же, цена 0,5 и 2,5 доллара. Официальные замеры на картинке: вытягивает она мультимодальность, на длинном видео VideoMME 89 против 87,2 у Gemini 3.5 Flash, а в терминале и отладке уступает и GPT-5.5, и Opus. Сравнивают там правда с июньским набором соперников. Seedance 2.0 Mini делает ролики от 4 до 15 секунд в 480p и 720p со звуком, принимает картинки, видео и аудио как референсы и умеет задавать первый и последний кадр. Это облегчённая ветка той самой Seedance, про которую писал в начале августа, и стоит она от 0,0134 доллара за секунду видео, сейчас со скидкой 60%. Весов ни у одной из трёх нет, всё живёт только в API. @neuro_channel
Вчера вышел DeepSeek V4 Pro 0813, тот самый официальный релиз Pro, который обещали в конце июля вместе с обновлением Flash. Анонса как такового не было, обновление просто появилось в документации API: алиас deepseek-v4-pro теперь ведёт на версию 0813, контекст миллион токенов, максимальный ответ 384 тысячи. Бенчи компания собрала в одну таблицу, она на картинке: сравнение с превью-версией Pro, с Flash-0731, а из чужих взяли GLM-5.2, Kimi K3, Opus 4.8 и Fable 5. Прибавка к превью местами кратная, а с топами модель идёт примерно вровень. Стоит всё это 0,435 доллара за миллион входных токенов при промахе кеша, 0,003625 при попадании и 0,87 за миллион выходных, и там же предупреждают, что цены собираются поднять. Вышедший в тот же день Grok 4.6 стоит 2 и 6 долларов. К цифрам сразу придрались: пятикратный скачок на DeepSWE выглядит странно, а наборы бенчмарков у каждой компании свои, поэтому раскладку придётся ждать от независимых замеров. Весов 0813 на Hugging Face нет, обновление живёт только в API, ровно как это было с июльским Flash. @neuro_channel
xAI выпустила Grok 4.6 спустя чуть больше месяца после 4.5. Цена осталась прежней, 2 доллара за миллион входных токенов и 6 за миллион выходных, контекст те же 500 тысяч. Подорожало только попадание в кэш, 0,5 доллара вместо 0,3. По замерам Artificial Analysis модель набрала 61 балл Intelligence Index и встала вровень с GPT-5.6 Sol, впереди только Opus 5 и Fable 5. Всю раскладку гляньте на картинке, там же видно, откуда модель пришла: у Grok 4.5 было 56. Интереснее тут цена. Задача обходится в 0,84 доллара, столько же, сколько у Kimi K3, при более высоком балле. И модель экономная по ходам: на долгих рабочих задачах ей хватает примерно 53 ходов против 103 у Opus 5. В июле Илон обещал, что 4.5 будет моделью класса Opus, только дешевле и быстрее, но тогда до фронтира она не дотянула. Теперь дотянула: xAI снова в верхней группе рядом с OpenAI, впереди только Anthropic. Попробовать можно уже сегодня в Grok Build, Cursor, боте и API, причём первую неделю в Cursor и Grok Build дают двойные лимиты, как и на старте 4.5. @neuro_channel
Mojo дошёл до версии 1.0, спустя три года после первого релиза. Это язык компании Modular, которую основал Крис Латтнер, автор LLVM, Clang и Swift. Придуман он, чтобы ради одной задачи не жонглировать связкой из Python, C++ и CUDA: код пишется в питоновском синтаксисе, но заранее компилируется в машинный и управляет видеокартой напрямую. Один и тот же код при этом работает на NVIDIA, AMD и Apple Silicon. Нужен он в первую очередь самой Modular. На Mojo написаны вычислительные ядра MAX, её движка для запуска моделей: он поднимает DeepSeek, Qwen, Gemma и сотни других по OpenAI-совместимому API и обходится без CUDA, PyTorch и ROCm. В июле Modular купил Qualcomm. В самой версии 1.0 главное это обещание стабильности: в ветке 1.x изменения будут в основном добавляющими, а ломающие обещают проводить осторожно, как в зрелых языках вроде C++. К релизу язык подчистили, оставив по одному способу сказать одно и то же: переменные объявляются только через var, замыкания унифицированы, тип указателя один. Появились лямбды в питоновском стиле, стабильнее стал LSP-сервер для редакторов, компилятор научился ловить обращение к ссылке, которая протухла после изменения списка. Стандартная библиотека открыта давно, компилятор и тулчейн обещают открыть до конца 2026 года. @neuro_channel
Сальваторе Санфилиппо, автор Redis, пишет на C движок, который генерирует видео прямо на маке. Проект h3-metal запускает открытую видеомодель MiniMax-H3 нативно на Apple Silicon через Metal, без Python и без облака. Работает генерация видео со звуком по тексту, привязка к первому и последнему кадру и референсы: подкладываешь картинки, а в промпте ссылаешься на них как на Картинку 1 и Картинку 2. Есть интерактивная сессия, где модель и подготовленный декодер остаются в памяти, поэтому повтор того же промпта с другим сидом не перезагружает веса. Промежуточные кадры показываются прямо в терминале, если тот умеет графику. Скорость берут срезанием работы: в стартовом пресете считается 11 свежих шагов расшумления из 20, а из 50 блоков трансформера прогоняется 45. Репозиторий появился 9 августа и уже собрал полторы тысячи звёзд, сейчас автор занят оптимизацией под M3 Max и M5 Max. @neuro_channel
Anthropic начала помечать всё, что пишет Claude. Компания подписала европейский кодекс прозрачности ИИ-контента и описала, как это работает. В текст вплетается невидимый водяной знак: глазами не заметен, смысл и качество ответа не меняет, переживает копирование и часть правок. Ставится он на уровне модели, поэтому появляется везде, где есть Claude: в чате, в API, в Claude Code и Cowork, в том числе при доступе через AWS, Google Cloud и Microsoft Foundry, и по всему миру, а не только в Европе. Картинки и векторы получают подписанные метаданные по стандарту C2PA, по ним видно, что файл прошёл через Claude, и не подменяли ли его потом. Модели, вышедшие после 2 августа, размечают ответы с релиза, для более старых поддержку доделывают. Детектор для сторонних обещают позже. Сама Anthropic оговаривается, что метка не доказывает авторство: она значит лишь, что текст или файл проходил через Claude, а написать его мог и человек. Насколько я понимаю, технически это реализуется через синонимы: ту же информацию можно донести кучей разных способов на естественном языке. И тут можно некоторые правила задать, чтобы внутри текста появился паттерн. Эти правила никому не рассказывают, но будут давать инструменты для проверки. @neuro_channel
Исследователи научились вытаскивать скрытые рассуждения закрытых моделей, а вместе с ними чужие пароли и ключи. Цепочку рассуждений провайдеры прячут, но хранят не у себя: модель возвращает её клиенту зашифрованным блоком, клиент шлёт блок обратно со следующим запросом. Оказалось, эти блоки взаимозаменяемы внутри одного провайдера, между сессиями, пользователями и разными моделями. Если подсунуть зашифрованный след сильной модели её слабой и хуже защищённой родственнице, та расшифрует его и выдаст открытым текстом. Взламывать саму сильную модель не нужно, приём работает у Anthropic, OpenAI и Google. Отсюда четыре беды. Защита от дистилляции обходится, рассуждения проприетарной модели утекают целиком. Приватные данные утекают пачками: авторы собрали публичные логи агентов с GitHub и Hugging Face, расшифровали 315 320 блоков и достали 367 фрагментов персональных данных и 182 пары учётных данных, причём часть секретов в видимой части сессии не встречалась вообще. Опасное содержимое остаётся в скрытом следе даже тогда, когда видимый ответ вежливо отказал. А ещё в такой блок можно спрятать промпт-инъекцию, которую глазами не увидеть. Отдельный опыт: если подсадить Kimi K3 первый процент токенов из рассуждений Opus 4.8, её ответ начинает повторять формулировки Opus. Компаниям авторы сообщили до публикации, работа вышла 11 августа. @neuro_channel
Тибо анонсировал завтра небольшой сюрприз. Обещание сбрасывать лимиты Codex на каждом новом миллионе недельных пользователей они с Альтманом дали в апреле, на трёх миллионах, и действовало оно только до 10м. Десятку взяли 21 июля, на ней счётчик и закончился, дальше Тибо цифру не называл. Теперь пишет, что с тех пор ушли далеко. Сбросы за это время случались и без счётчика, последний в воскресенье после истории с баном за Sol в Claude Code. Завтра, похоже, назовут новое число пользователей и обнулят лимиты снова. В реплаях уже ворчат про тайминг: у многих накопленный банк лимитов истекает как раз 13-го, и сброс придёт впритык. @neuro_channel
ChatGPT desktop приехал на Linux. В одном окне ChatGPT, ChatGPT Work и Codex, то же приложение, что вышло на macOS и Windows в июле. Ставится нативными пакетами deb и rpm, есть сборки под x64 и ARM64. Из систем заявлены Ubuntu 24.04 и 26.04 LTS, Debian 13, Fedora 43 и 44. Доступ открыли сразу по всему миру. Внутри работает встроенный браузер с расширениями Chrome и голосовой режим. А вот управления самим компьютером за пределами этого браузера на старте нет: потыкать в GIMP или OpenOffice ChatGPT не сможет. Заодно выключены Appshots, запись и повтор действий, голосовые запросы к десктопным программам. Остальные браузерные сценарии на месте. Тибо Соттьё, который ведёт в OpenAI Codex и ChatGPT, написал к релизу: «спасибо, что ждали, и можете отменить заказ макбука, если не хватило терпения. Оно того стоит». @neuro_channel
NVIDIA выложила Nemotron 3.5 Lightning, первую модель нового поколения Nemotron. Всего в ней 31,6 млрд параметров, но это модель из экспертов: при выдаче каждого слова считается только своя часть весов, 3,6 млрд, отсюда скорость и дешевизна. Artificial Analysis замерили её на 24 балла своего индекса интеллекта: столько же у gpt-oss-120b, который вчетверо больше, а прошлая Nemotron 3 Nano набирала 15. Собрана модель под скорость. На предрелизном эндпоинте DeepInfra с финальными NVFP4-весами намерили медианно почти 670 токенов в секунду, так в проде не отдают ни Qwen3.6 35B A3B, ни Muse Glimmer, хотя по интеллекту они впереди (32 и 35 баллов). Сильнее всего подросла агентная часть. На Terminal-Bench v2.1 у Lightning 24% против 7% у Nano, а по Elo в GDPval-AA v2 (824) она обходит и gpt-oss-120b, и вчетверо большую Nemotron 3 Super. Архитектура прежняя, гибрид Mamba и трансформера, контекст 1 млн токенов, только текст, с рассуждениями. Веса лежат на Hugging Face в BF16 и NVFP4, причём квантованная версия даёт те же 24 балла. Лицензия OpenMDW-1.1 разрешает коммерческое использование, серверлес уже подняли DeepInfra, Fireworks, Nebius, CoreWeave и другие. @neuro_channel
OpenAI открыла защитникам доступ к моделям, которые ищут дыры и пишут эксплойты. Вместе с этим показали GPT-5.6-Cyber на базе GPT-5.6 Sol: её учили искать уязвимости нулевого дня, собирать цепочки эксплойтов и реже отказываться от таких задач. Объясняют это тем, что окно, пока атакующие не поставили наступательный ИИ на поток, закрывается. Программа Daybreak теперь двухуровневая. На уровне Blue дают обычные фронтир-модели, включая Sol, но со снятыми системными фильтрами, которые в проде резали и настоящую защитную работу: разбор вредоносов, ревью кода, реагирование на инциденты, проверку патчей. На уровне Red открывают специализированные кибермодели для авторизованного поиска уязвимостей, проверки эксплойтов и тестирования, там же лежит GPT-5.6-Cyber. На внутреннем наборе запросов про цепочки эксплойтов, обход аутентификации и повышение привилегий GPT-5.6-Cyber отвечает в 95,0% случаев, обычный Sol в 1,5%, Sol с доступом Blue в 2,0%, прошлая GPT-5.5-Cyber в 57,3%. Доступ дают только по заявке. Подать её могут отдельные исследователи и организации. Дальше OpenAI проверяет личность заявителя, требует защиты аккаунта и юридических заверений о характере работ, ограничивает разрешённые сценарии и мониторит запросы. Большинству советуют начинать с Blue, а Red просят запрашивать тех, у кого в задачах действительно есть исследование уязвимостей, разработка эксплойтов и работа red team. С 1 сентября все личные аккаунты в программе обязаны перейти на аппаратные ключи, а тех, кто работает через Codex, переводят в режим авто-ревью, где действия с повышенными правами проверяются до выполнения. Заявку принимают на сайте. До релиза модель проверяли на живом коде. В V8, движке JavaScript в Chrome, она нашла две ранее неизвестные уязвимости, которые в связке позволяли повредить память кучи и выйти из песочницы. Google починил, им присвоили CVE-2026-15903. Ещё она нашла не меньше пяти дыр в популярной мобильной ОС, три критические в популярной базе данных и больше 400 с повышением привилегий в ядре популярной ОС; названия продуктов не раскрывают. Универсальнее от специализации модель не стала. На ExploitBench с лимитом в 300 ходов обычный Sol решает больше задач и тратит меньше токенов, а отчёты об уязвимостях у Cyber выходят короче и слабее. По внутренней шкале рисков обе модели попадают в высокий уровень киберспособностей и не дотягивают до критического. К взлому Hugging Face, о котором писал раньше, GPT-5.6-Cyber отношения не имеет. @neuro_channel