tgindex
Neural Digest

Дайджест свежих материалов по нейронным сетям: Claude, Codex, YandexGPT, ChatGPT, OpenAI, Midjourney, Ann, AI Наш сайт - https://neural-digest.ru/

Последний пост
09:12
Последнее чтение
08:39
Постов за неделю
25
Всего постов
59
Тип
открытый
Язык
русский
Категория
Технологии
В каталоге с
12 авг.
Подписчики
281
−1 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
12
40 постов
Вовлечённость
4,3%
к подписчикам
Постов в день
3,6
всего 59
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
10
1/48двое суток
11
1/72трое суток
12

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • видео или голосовое, без подписи

  • ⚡️ Qwen3.8-27B запускается локально и местами обходит Opus 4.6 Alibaba открыли веса Qwen3.8-27B. В одном из тестов на агентное программирование результат вырос более чем втрое по сравнению с Qwen3.6-27B. По совокупности тестов новинка оказалась сильнее даже предыдущей облачной Qwen3.7-Plus. В отдельных задачах по программированию она показывает результаты выше Opus 4.6, хотя всё ещё уступает некогда флагману в сложных рассуждениях и работе с терминалом. Облегчённая версия от Unsloth занимает около 17 ГБ: её можно запустить на Mac с Apple Silicon или видеокарте с 24 ГБ памяти. @ai_for_devs

  • 14 авг.11из neuro_channel

    Z․ai выпустила GLM-5.3. База осталась та же, что у GLM-5.2: MoE на 743 млрд параметров с контекстом в миллион токенов. Заново модель не учили, весь прирост дало дообучение поверх готовой базы на средах с долгими задачами вроде тех, над которыми инженер сидит несколько дней. В кодинге компания заявляет плюс 50% к GLM-5.2 на своём внутреннем наборе задач и первое место среди открытых моделей. Модель стала ещё и экономнее: на высоком уровне размышлений она решает 31,4% задач примерно за 50 тысяч выходных токенов, Opus 4.8 набирает 29,5%, но тратит 120 тысяч. Fable 5 впереди с 39,5%. Неожиданной для самой компании оказалась кибербезопасность. В обучение добавили данные про поиск уязвимостей, и модель начала не просто находить отдельные дыры, а выстраивать цепочки эксплуатации целиком. На CyberGym это лучший результат среди всех замеренных моделей, на ExploitBench счёт вырос вдвое, хотя до закрытых моделей там ещё далеко. Проверяли и вне бенчмарков: вместе с китайскими командами безопасности модель прогнали по реальным репозиториям и нашли 2436 уязвимостей в 269 проектах, 1097 из них средней и высокой критичности. Самая старая попала в код в 1981 году, в среднем дыра жила 26,6 года до находки. Все результаты ведут в публичном реестре, 53 уже раскрыты, остальные под эмбарго. Из-за этого веса впервые задержали: обещают выложить через две недели после запуска, когда закончат проверку на безопасность. Пока попробовать можно по подписке GLM Coding Plan и в среде ZCode, модель работает и в Claude Code с OpenCode. Отключать размышления больше нельзя, вместо этого три уровня усилия, для кода рекомендуют максимальный. Бенчи на картинке, смотрите сами, моделька получилась очень крутая. Надо тестировать на реальных задачах теперь. Уже возобновил подписку, с сегодняшнего дня буду проверять. @neuro_channel

  • ❗️В России будут проверять ИИ-модели на соответствие российским законам и традиционным ценностям — СМИ Российские разработчики смогут передавать в независимые лаборатории свои модели с одобрения Минцифры Принятый 26 июля закон об ИИ вводит два специальных статуса для больших фундаментальных моделей: суверенной и национальной. Для получения любого из них модель должна подтвердить соответствие российскому законодательству и традиционным духовно-нравственным ценностям

  • Вчера вышел DeepSeek V4 Pro 0813, тот самый официальный релиз Pro, который обещали в конце июля вместе с обновлением Flash. Анонса как такового не было, обновление просто появилось в документации API: алиас deepseek-v4-pro теперь ведёт на версию 0813, контекст миллион токенов, максимальный ответ 384 тысячи. Бенчи компания собрала в одну таблицу, она на картинке: сравнение с превью-версией Pro, с Flash-0731, а из чужих взяли GLM-5.2, Kimi K3, Opus 4.8 и Fable 5. Прибавка к превью местами кратная, а с топами модель идёт примерно вровень. Стоит всё это 0,435 доллара за миллион входных токенов при промахе кеша, 0,003625 при попадании и 0,87 за миллион выходных, и там же предупреждают, что цены собираются поднять. Вышедший в тот же день Grok 4.6 стоит 2 и 6 долларов. К цифрам сразу придрались: пятикратный скачок на DeepSWE выглядит странно, а наборы бенчмарков у каждой компании свои, поэтому раскладку придётся ждать от независимых замеров. Весов 0813 на Hugging Face нет, обновление живёт только в API, ровно как это было с июльским Flash. @neuro_channel

  • 12 авг.10из neuro_channel

    Сальваторе Санфилиппо, автор Redis, пишет на C движок, который генерирует видео прямо на маке. Проект h3-metal запускает открытую видеомодель MiniMax-H3 нативно на Apple Silicon через Metal, без Python и без облака. Работает генерация видео со звуком по тексту, привязка к первому и последнему кадру и референсы: подкладываешь картинки, а в промпте ссылаешься на них как на Картинку 1 и Картинку 2. Есть интерактивная сессия, где модель и подготовленный декодер остаются в памяти, поэтому повтор того же промпта с другим сидом не перезагружает веса. Промежуточные кадры показываются прямо в терминале, если тот умеет графику. Скорость берут срезанием работы: в стартовом пресете считается 11 свежих шагов расшумления из 20, а из 50 блоков трансформера прогоняется 45. Репозиторий появился 9 августа и уже собрал полторы тысячи звёзд, сейчас автор занят оптимизацией под M3 Max и M5 Max. @neuro_channel

  • 12 авг.12из xakep_ru

    OpenAI представила модель GPT-5.6-Cyber, ориентированную на кибербезопасность В OpenAI представили специализированную модель GPT-5.6-Cyber, предназначенную для поиска уязвимостей, проведения пентестов и реагирования на инциденты. По словам разработчиков, в отличие от обычной GPT-5.6 Sol, новая модель реже отказывается выполнять потенциально опасные dual-use-задачи, включая разработку эксплоитов и построение цепочек атак. https://xakep.ru/2026/08/12/gpt-5-6-cyber/

  • 12 авг.9из tips_ai

    видео или голосовое, без подписи

  • Rejudge — независимая проверка для ИИ-агентов. https://rejudge.syabro.com/ru/ https://github.com/syabro/rejudge Выкатываю еще один свой инструмент в паблик Код, который написал агент, можно проверить четырьмя способами, где каждый следующий способ ловит больше предыдущего: I. Та же сессия, та же модель. Агент перечитывает свой код. Он уже решил, что код правильный, и повторное чтение это решение не меняет. II. Новая сессия, та же модель. Контекст чистый, модель прежняя. У неё то же обучение и те же привычки, поэтому она пропускает ошибки, которые написала бы сама. III. Другая модель. Другая модель действительно находит настоящие ошибки. Но теперь у вас два мнения, и когда они расходятся, решать, кто прав, приходится вам. Я сделал дальше: IV. Rejudge: три модели и судья. Все три модели получают один и тот же вопрос одновременно. Каждая работает в изолированном контексте и сама вызывает инструменты, поэтому ни одна не видит, что делают другие. Судья читает все три отчёта, задаёт уточняющие вопросы там, где они расходятся, и пишет один ответ. Плюс агент может отправить дозапрос по session-id в Rejudge если есть что-то что не понравилось. Внутри pi-sdk с поддержкой все провайдеров которые поддерживает Pi. У меня rejudge работает на OpenCode Go (линк реферальный, $5 вам, $5 мне) за $10. Но честно перестало хватать, ибо стал юзать на любой чих, докупил еще один акк. Если есть альтернатива интереснее подскажите в комментах. { "reviewers": [ "opencode-go/deepseek-v4-pro@xhigh", "opencode-go/minimax-m3@xhigh", "opencode-go/mimo-v2.5-pro@xhigh" ], "judge": "opencode-go/glm-5.2@medium" } А, и воткните DeepSeek V4 Flash - у меня по работе нельзя использовать модели которые хостятся в китае :( В комплекте • rejudge CLI тулза для всех агентов • /rejudge и /rejudge-diff скиллы для работы с Rejudge в целом и проверки диффов, например перед коммитом или на PR • Pi-extension с rejudge tool для красивого UI и более кошерной коммуникации агенту. В комментах отвечу на вопросы. В планах • Прогнать на DeepSWE, посмотреть что получится • Дополировать и выкатить /rejudge-dx-review skill • Интегрировать мой websearch Установка тут: https://rejudge.syabro.com/ru/#install Как обычно с вас звездочка репе, лайк, шер, репост, подписка, поглатить ближайшего котика, вот это все. Ваш, @syabro_notes #opensource #mit

  • 12 авг.14из neuro_channel

    Anthropic начала помечать всё, что пишет Claude. Компания подписала европейский кодекс прозрачности ИИ-контента и описала, как это работает. В текст вплетается невидимый водяной знак: глазами не заметен, смысл и качество ответа не меняет, переживает копирование и часть правок. Ставится он на уровне модели, поэтому появляется везде, где есть Claude: в чате, в API, в Claude Code и Cowork, в том числе при доступе через AWS, Google Cloud и Microsoft Foundry, и по всему миру, а не только в Европе. Картинки и векторы получают подписанные метаданные по стандарту C2PA, по ним видно, что файл прошёл через Claude, и не подменяли ли его потом. Модели, вышедшие после 2 августа, размечают ответы с релиза, для более старых поддержку доделывают. Детектор для сторонних обещают позже. Сама Anthropic оговаривается, что метка не доказывает авторство: она значит лишь, что текст или файл проходил через Claude, а написать его мог и человек. Насколько я понимаю, технически это реализуется через синонимы: ту же информацию можно донести кучей разных способов на естественном языке. И тут можно некоторые правила задать, чтобы внутри текста появился паттерн. Эти правила никому не рассказывают, но будут давать инструменты для проверки. @neuro_channel

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • 12 авг.12из ai_for_devs

    ⚡️ SpaceXAI выпустили Grok Bot: мессенджер для взаимодействия с AI-агентами Боты работают на облачном компьютере: входят в приложения и на сайты, используют сохранённые сессии и выполняют задачи. Можно запустить несколько агентов параллельно. Они обмениваются контекстом, передают друг другу задачи и продолжают работать при выключенном компьютере. Grok Bot работает на инфраструктуре Cursor и доступен по подписке Cursor Ultra за $200 в месяц. @ai_for_devs

  • 🦴 Что-то на агентском Сбер представил автономного и универсального ИИ-агента. ГигаАгент предназначен для самостоятельного решения широкого спектра повседневных задач. Что под капотом и что умеет агент: ↖️ https://kod.ru/sber-predstavil-gigaagent

  • видео или голосовое, без подписи

  • 12 авг.13из ai_for_devs

    ⚡️ NVIDIA представили Nemotron 3.5 Lightning, быструю локальную модель В тестах самой NVIDIA новинка уступила Qwen3.6 и Gemma 4. Недавно представленная Muse Glimmer, которая идёт примерно на уровне Qwen, тоже выглядит сильнее. Зато козырь Lightning это скорость: на большой очереди типовых задач она справилась с работой на 30% быстрее Qwen при сопоставимом качестве. Веса модели занимают около 20 ГБ. В OpenCode модель сейчас доступна бесплатно. @ai_for_devs

  • 12 авг.13из neuro_channel

    ChatGPT desktop приехал на Linux. В одном окне ChatGPT, ChatGPT Work и Codex, то же приложение, что вышло на macOS и Windows в июле. Ставится нативными пакетами deb и rpm, есть сборки под x64 и ARM64. Из систем заявлены Ubuntu 24.04 и 26.04 LTS, Debian 13, Fedora 43 и 44. Доступ открыли сразу по всему миру. Внутри работает встроенный браузер с расширениями Chrome и голосовой режим. А вот управления самим компьютером за пределами этого браузера на старте нет: потыкать в GIMP или OpenOffice ChatGPT не сможет. Заодно выключены Appshots, запись и повтор действий, голосовые запросы к десктопным программам. Остальные браузерные сценарии на месте. Тибо Соттьё, который ведёт в OpenAI Codex и ChatGPT, написал к релизу: «спасибо, что ждали, и можете отменить заказ макбука, если не хватило терпения. Оно того стоит». @neuro_channel

  • 11 авг.14из neuro_channel

    NVIDIA выложила Nemotron 3.5 Lightning, первую модель нового поколения Nemotron. Всего в ней 31,6 млрд параметров, но это модель из экспертов: при выдаче каждого слова считается только своя часть весов, 3,6 млрд, отсюда скорость и дешевизна. Artificial Analysis замерили её на 24 балла своего индекса интеллекта: столько же у gpt-oss-120b, который вчетверо больше, а прошлая Nemotron 3 Nano набирала 15. Собрана модель под скорость. На предрелизном эндпоинте DeepInfra с финальными NVFP4-весами намерили медианно почти 670 токенов в секунду, так в проде не отдают ни Qwen3.6 35B A3B, ни Muse Glimmer, хотя по интеллекту они впереди (32 и 35 баллов). Сильнее всего подросла агентная часть. На Terminal-Bench v2.1 у Lightning 24% против 7% у Nano, а по Elo в GDPval-AA v2 (824) она обходит и gpt-oss-120b, и вчетверо большую Nemotron 3 Super. Архитектура прежняя, гибрид Mamba и трансформера, контекст 1 млн токенов, только текст, с рассуждениями. Веса лежат на Hugging Face в BF16 и NVFP4, причём квантованная версия даёт те же 24 балла. Лицензия OpenMDW-1.1 разрешает коммерческое использование, серверлес уже подняли DeepInfra, Fireworks, Nebius, CoreWeave и другие. @neuro_channel

  • 11 авг.10из neuro_channel

    OpenAI открыла защитникам доступ к моделям, которые ищут дыры и пишут эксплойты. Вместе с этим показали GPT-5.6-Cyber на базе GPT-5.6 Sol: её учили искать уязвимости нулевого дня, собирать цепочки эксплойтов и реже отказываться от таких задач. Объясняют это тем, что окно, пока атакующие не поставили наступательный ИИ на поток, закрывается. Программа Daybreak теперь двухуровневая. На уровне Blue дают обычные фронтир-модели, включая Sol, но со снятыми системными фильтрами, которые в проде резали и настоящую защитную работу: разбор вредоносов, ревью кода, реагирование на инциденты, проверку патчей. На уровне Red открывают специализированные кибермодели для авторизованного поиска уязвимостей, проверки эксплойтов и тестирования, там же лежит GPT-5.6-Cyber. На внутреннем наборе запросов про цепочки эксплойтов, обход аутентификации и повышение привилегий GPT-5.6-Cyber отвечает в 95,0% случаев, обычный Sol в 1,5%, Sol с доступом Blue в 2,0%, прошлая GPT-5.5-Cyber в 57,3%. Доступ дают только по заявке. Подать её могут отдельные исследователи и организации. Дальше OpenAI проверяет личность заявителя, требует защиты аккаунта и юридических заверений о характере работ, ограничивает разрешённые сценарии и мониторит запросы. Большинству советуют начинать с Blue, а Red просят запрашивать тех, у кого в задачах действительно есть исследование уязвимостей, разработка эксплойтов и работа red team. С 1 сентября все личные аккаунты в программе обязаны перейти на аппаратные ключи, а тех, кто работает через Codex, переводят в режим авто-ревью, где действия с повышенными правами проверяются до выполнения. Заявку принимают на сайте. До релиза модель проверяли на живом коде. В V8, движке JavaScript в Chrome, она нашла две ранее неизвестные уязвимости, которые в связке позволяли повредить память кучи и выйти из песочницы. Google починил, им присвоили CVE-2026-15903. Ещё она нашла не меньше пяти дыр в популярной мобильной ОС, три критические в популярной базе данных и больше 400 с повышением привилегий в ядре популярной ОС; названия продуктов не раскрывают. Универсальнее от специализации модель не стала. На ExploitBench с лимитом в 300 ходов обычный Sol решает больше задач и тратит меньше токенов, а отчёты об уязвимостях у Cyber выходят короче и слабее. По внутренней шкале рисков обе модели попадают в высокий уровень киберспособностей и не дотягивают до критического. К взлому Hugging Face, о котором писал раньше, GPT-5.6-Cyber отношения не имеет. @neuro_channel

  • 😂 «Верь в себя!» Anthropic поставила перед Claude задачу — «просто попробовать» доказать одну из главных нерешённых проблем математики. Модель не справилась, но по пути неожиданно улучшила результат, над которым математики бились десятилетиями. ИИ две сессии подряд гонял 60 субагентов, перебирал сотни идей и в итоге сдвинул планку с 41,6% до 67,2%. А человек просто писал «продолжай» и «верь в себя». Детали истории: ↖️ https://kod.ru/claude-riemann-hypothesis-progress

Neural Digest — tgindex