Паша AI AI AI
СтатистикаПро технологии в бизнесе и не только — от генерального директора МТС Web Services — новой бигтех компании экосистемы МТС — Павла Воронина. Заявление в РКН № 7093370529
- Последний пост
- 13 авг.
- Последнее чтение
- 12:52
- Постов за неделю
- 1
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- Категория
- Бизнес
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 075
- 1/48двое суток
- 1 231
- 1/72трое суток
- 1 328
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
AI ускоряет науку Научный поиск упирается не только в сложность исследований, но и в объем знаний: ежегодно выходят миллионы работ, а лаборатории собирают огромные массивы данных. Исследователи ищут связи между многочисленными публикациями, проверяют свои гипотезы на соответствие всей информации по теме, проводят долгие расчеты и проверяют многоэтапными экспериментами. К счастью, все больше этих задач берет AI. Результаты есть, особенно в медицине. AlphaFold сформировала открытую базу из более чем 200 млн трехмерных структур белков. А с помощью Meta AI команда Дженнифер Дудны создала компактные РНК-направляемые нуклеазы SynTnpB с последовательностями, которых нет в природе. С этими нуклеазами можно редактировать ДНК человека. Еще AI-системы перспективны в материаловедении. Так, GNoME предсказала 381 тысячу стабильных кристаллических структур, среди которых могут оказаться материалы для аккумуляторов, солнечных панелей и микроэлектроники. Отдельные задачи — только первый этап. Следующий — собрать в единый процесс поиск научных знаний, генерацию гипотез, анализ данных и экспериментальную проверку. В Nature в 2026-м описали мультиагентную систему Robin. Она ищет информацию в научной литературе, формулирует гипотезы, предлагает идеи для экспериментов, анализирует результаты и по ним формирует следующие гипотезы. Авторы протестировали систему на поиске терапевтических кандидатов для возрастной макулярной дегенерации. Nature отмечает движение к лабораторному циклу с AI на каждом этапе. Для такого подхода уже создают техническую базу. Американскую программу Genesis Mission запустили в ноябре 2025-го, а летом 2026-го расширили до федерального масштаба. По ней более 15 федеральных ведомств должны объединить в инфраструктуру научные датасеты, суперкомпьютеры, ИИ-модели и исследовательское оборудование. Копайлоты будут работать с данными, модели — строить прогнозы, суперкомпьютеры — проводить расчеты, а автоматизированные лаборатории — проверять гипотезы в физическом мире. На инициативу обещают свыше 5 млрд $. Чем больше функций уходит AI, тем важнее становится контроль опасных запросов. 7 августа 2026-го Anthropic обновила биологические ограничения Claude Fable 5: раньше практически любой запрос на тему биологии переводился на менее способную модель Opus 5. После обновления число таких «откатов» сократилось примерно на 85%, при этом система выявляет и блокирует задачи, которые считает опасными. Параллельно компания планирует trusted access pathways — расширенный доступ для проверенных исследователей. Так AI помогает уже не с отдельной операцией, а с последовательностью действий. Следующий шаг — self-driving laboratories, где алгоритм выбирает следующий эксперимент, лабораторная установка его выполняет, а полученные данные возвращаются в систему и используются для следующей итерации. Если эта модель масштабируется, исследователи будут все меньше заниматься промежуточными операциями и все больше — выбирать направления, ставить задачи и проверять результаты. Материалы, лекарства и исследования смогут проходить от идеи до пилота за несколько лет вместо десятилетий.
AI-агенты могут закрыть дефицит кадров По прогнозам, к 2030 году российской экономике может не хватать до 11 млн работников. А McKinsey считает, что на европейском рынке труда можно автоматизировать 58% рабочего времени, сэкономив к тому же 2030-му почти два триллиона долларов. Дефицит кадров закроют не только АI-инструменты, но и виртуальные сотрудники. Копайлоты ускоряют человека, виртуальные же сотрудники заменяют его: получают роль, зону ответственности и доступ к корпоративным системам. Мы в MWS AI создали целый ряд таких — например, виртуального рекрутера: он будет разбирать отклики, общаться с кандидатами, назначать собеседования и передавать HR-специалисту список соискателей с обоснованием выбора. В Microsoft AI-рекрутер уже координирует адаптацию новичка, автоматизирует типовые задачи, подсказывает следующие шаги и обновляет данные в HR-системе. И у клиентов MWS есть примеры: • В энергетической компании цифровой сотрудник адаптирует новичков, оформляет документы, настраивает доступы и отвечает на вопросы. • В AdTech-компании виртуальный маркетолог самостоятельно запускает 30% рекламных кампаний и готовит коммерческие предложения. Полагаю, к 2027-му AI-агентов «наймут» до половины российских компаний. Но им придется пересмотреть понятие штатной единицы и научиться считать не количество сотрудников, а общую производительность людей и агентов. Иначе отечественные компании отстанут от зарубежных: согласно отчету HR Monitor 2026 от McKinsey, они уже считают таким способом.
Физики Калтека получили 300 млн на квантовый компьютер с коррекцией ошибок Инвесторы вложили 300 млн долларов в небольшой стартап Oratomic, который предложил архитектуру квантового компьютера на 20 000 кубитах — квантовых аналогах битов. Однако, в отличии от классических компьютеров, их количество здесь не играет решающую роль. Квантовое превосходство на десятках кубитов в отдельных задачах уже показывал Google, но для корректной работы квантового компьютера кубиты должны находится в особом «спутанном» состоянии. Ученые умеют добиваться его, но оно нарушается от малейших внешних воздействий, поэтому квантовые системы сохраняют его лишь доли секунды. Основатели Oratomic — физики из Калифорнийского технологического института Калтек — предложили свой подход. Они использовали систему из атомов в лазерных пинцетах: пары лазерных лучей удерживают атомы и позволяют проводить с ними операции записи и считывания информации. Подход позволяет реализовать систему из 20 000 кубитов, часть из которых отводят для коррекции ошибок. Это позволяет компенсировать потерю спутанного состояния отдельными кубитами и продлевает время работы квантового компьютера. Исследователи планируют финализировать разработку к 2030 году. Квантовые компьютеры дают безграничные вычислительные возможности для развития искусственного интеллекта, тем более нейросети прощают единичные ошибки в вычислениях при обучении.
Cloudflare анонсировала криптовалютный платежный сервис для контентмейкеров Обычно криптовалютные сервисы используются в узких нишах или небольшими фирмами. Анонс компанией Cloudflare платежного сервиса Monetization Gateway переводит использование этой технологии на мировой уровень — по оценкам аналитиков через сервера компании проходит 20% мирового трафика. Cloudflare отмечает, что один запрос пользователя к ИИ-модели запускает веб-краулеры, которые посещают в поисках ответа от сотни до десятков тысяч веб-ресурсов. При этом их владельцы платят за увеличение нагрузки, но не могут заработать ни на контентной рекламе, ни предложить краулеру услуги для «живого пользователя». Компания встала на сторону контентмейкеров и предложила им сервисы для оплаты доступа ИИ-краулерами, а с бигтехов потребовала разделить запросы на поиск информации, обучение и инстанс ИИ-моделей с 15 сентября 2026 года. Платежный сервис хорошо закрывает экосистему сервисов Cloudflare. Он позволит владельцам веб-ресурсов установить плату за доступ не только к контенту, но и за доступ к API, генерации изображений и другим сервисам, а стоимость можно будет устанавливать не помесячно, а за запрос. В качестве примера Cloudflare приводит следующую оценку: от нескольких центов за поисковый запрос до 0,99 долларов в случае успешного решения запроса в техподдержку. Для оплаты будут использовать протокол x402, платежный сервис организуют совместно с криптовалютной биржей Coinbase, оплата будет в стейбкоинах — в качестве примера приводят Open USD и USDC.
Meta* Brain2Qwerty v2: неинвазивное «чтение мыслей» и проблема железа Meta* представила вторую версию Brain2Qwerty — систему, которая неинвазивно декодирует текст напрямую из мозговой активности. В отличие от Neuralink, здесь нет ни хирургии, ни вживленных электродов. Как это работает. Модель анализирует непрерывный поток данных магнитоэнцефалографии (MEG) — без привязки к точным меткам нажатий клавиш, как это нужно было в первой версии. Раньше алгоритму требовалось точно знать, в какую миллисекунду человек намеревался нажать клавишу, теперь он справляется с этим сам, работая напрямую с сырым потоком сигнала. Важная оговорка: система декодирует конкретное осознанное намерение печатать заданный текст в контролируемом эксперименте — это не чтение мыслей в широком смысле, эмоции и свободные размышления она не считывает. Точность. В среднем по девяти участникам система распознаёт 61% слов правильно, у лучшего испытуемого — 78%, при этом больше половины его предложений расшифрованы с одной ошибкой или без них вовсе. Однако если сравнивать с инвазивными системами, у инвазивных систем с вживленными электродами ошибки — единицы процентов: например, интракортикальный нейропротез для печати, опубликованный в Nature Neuroscience в 2026 году, дал 1,6% word error rate (главная метрика для оценки точности распознавания речи) у пациентов с параличом — это уровень, сопоставимый со скоростью печати здорового человека. Neuralink сообщает о точности распознавания символов около 92%, а с подключением языковой модели для сглаживания ошибок эффективный WER опускается ниже 10% — хотя это данные самой компании, а не независимая рецензия. Brain2Qwerty v2 — это серьёзный шаг вперёд именно для неинвазивных технологий, но до инвазивных решений ему пока далеко: разрыв в точности существенный. Ещё одна оговорка: все цифры получены на девяти здоровых волонтёрах в лабораторных условиях по строго заданному сценарию (печать заученных предложений) — это не клинические данные людей с реальными нарушениями речи, для которых технология в теории и создаётся. Проблема железа. Считывание качественного MEG-сигнала пока невозможно сделать портативным. Магнитоэнцефалограф — это тяжёлая медицинская установка стоимостью в миллионы долларов. Она требует криогенного охлаждения жидким гелием и комнаты с идеальной магнитной изоляцией. До тех пор, пока инженеры не сожмут это оборудование до габаритов хотя бы тяжелого VR-шлема, Brain2Qwerty останется впечатляющим лабораторным R&D-проектом без шансов на масштабирование в B2C. *Деятельность компании Meta признана экстремистской и запрещена в России
Искусственный интеллект создает искусственный дефицит В начале года аналитики говорили об охлаждении интереса к ИИ и снижении цен на комплектующие, но по итогам первой половины 2026 года предположения не сбылись. OpenAI, Anthropic и SpaceX вложили пару сотен миллиардов долларов в новые дата-центры для обучения и инференса ИИ-моделей, заключив многолетние контракты с производителями чипов. Какие ресурсы кроме GPU могут оказаться в дефиците? Высокий спрос привел к повышению стоимости оперативной памяти на 700%. Пользователи подают в суд на Samsung, SK hynix и Micron за ценовой сговор — компании контролируют около 90% рынка. Но предложение на розничном рынке продолжает сокращаться — производители переориентировались на продукцию для ИИ-компаний. После видеокарт и памяти дефицитным ресурсом может стать энергия. Некоторые компании предвидели это — Microsoft и Google вложились в АЭС в 2024 году. Но пока они используют энергию с существующих электростанций, что в 2026 году привело к росту цен на 76%. Тогда же сформировался пул из 10 энергетических компаний, которые планируют выйти на IPO для привлечения 11,6 млрд долл. Первыми покупателями акций планируют выступить крупные компании, которые скорее направят эту энергию в ЦОД-ы. Последствия могут быть неожиданными. Из-за кратного роста цен могут стать окупаемыми проекты космических ЦОД-ов. Но если ИИ-компании не выйдут на окупаемость и лишатся дальнейших инвестиций, высвободятся колоссальные объемы полупроводников и энергии, а падение цен на них затронет даже далекие от разработки ИИ индустрии. Разумной стратегией будет не только запасание дефицитных ресурсов, но и разработка ИИ-моделей с фокусом на их энергоэффективность и экономию вычислительных ресурсов.
IPO SpaceX стало тестом на зрелость ИИ-рынка 12 июня SpaceX провела IPO и привлекла рекордные $85,7 млрд. На пике капитализация компании достигла почти $2,9 трлн, выше, чем у Microsoft и Amazon. Через несколько дней SpaceX объявила о покупке ИИ-редактора Cursor за $60 млрд акциями компании. После этой сделки компания собрала ИИ-экосистему: от ЦОДов и связи до моделей и инструментов. Казалось, что рынок начал массово перераспределять стоимость от традиционного бигтеха к новой волне ИИ-компаний. Но последующие торги показали, что это преждевременные выводы: к концу июня акции SpaceX откатились примерно на треть от пиковых значений, а капитализация снизилась до уровня около $2 трлн. Изменения затронули не только SpaceX. В последние недели инвесторы распродают большую часть технологического сектора на фоне опасений относительно перегрева ИИ-рынка, роста долговой нагрузки и будущих процентных ставок. Под давлением оказались и крупнейшие представители бигтеха — Apple (-6,12%), Microsoft (-3,46%), Amazon (-3,10%), Nvidia (-1,64%) и Alphabet (-0,83). На пике стоимости SpaceX использовала свои акции для покупки Cursor. Anthropic и OpenAI тоже готовятся к выходу на биржу и нацелены на капитализацию в $1 трлн. Это может дать им десятки миллиардов на чипы, электроэнергию, ЦОДы и новые инвестиции для расширения своих экосистем.
Sakana Fugu: оркестрация вместо одной большой модели Sakana AI выпустила Fugu — не фронтир-модель, а пул моделей под единым OpenAI-совместимым API. Снаружи это одна модель, внутри — координация десятков агентов. Что внутри: • Fugu Ultra на бенчмарках по кодингу, рассуждению и науке сопоставима с закрытыми фронтир-моделями — за счёт кооперации моделей поменьше, а не масштабирования одной сети. • Пул контролирует пользователь: можно исключать провайдеров в соответствии с требованиями к данным и compliance. • Как японский продукт, Fugu структурно не попадает под US EAR — это особенность юрисдикции, не обход блокировок. • Тариф — по самой дорогой модели в пуле, без суммирования за число агентов.
На пути к суперинтеллекту: новый доклад Google DeepMind о достижении ASI На днях команда Google DeepMind опубликовала отчёт, формирующий новый горизонт планирования: достижение AGI — это не финал, а лишь начало. 4 технологических пути к ASI: 1. Продолжение текущего экстенсивного тренда. Даже если архитектура не совершит прорыва, миллион копий AGI-агентов, запущенных параллельно на высоких скоростях, — это уже совершенно иной уровень производительности. 2. Текущая связка (трансформеры + RLHF) может недотянуть до ASI. Потребуются качественные сдвиги: нейроморфные или аналоговые вычисления, RL-предобучение и внедрение явных моделей мира. 3. ИИ начинает напрямую ускорять собственные исследования и R&D. Насколько этот процесс сможет стать полностью автономным, пока остаётся открытым вопросом. 4. ASI может возникнуть не как единый «монолитный мозг», а как эмерджентное свойство миллионов агентов, организованных в эффективные цифровые корпорации и рынки. Для этого потребуются новые законы масштабирования для многоагентных систем.
CVPR 2026: рынок данных ставит на робототехнику, а бенчмарки устаревают Прошла CVPR 2026 — ключевая конференция по компьютерному зрению. Главные выводы из докладов лежат не столько в архитектуре новых моделей, сколько в распределении бюджетов и состоянии самой индустрии. 1. Сдвиг спроса на датасеты. Рынок данных реагирует на тренды раньше продуктового. Судя по составу экспонентов и тематике воркшопов, спрос сместился: если ещё недавно основные бюджеты уходили на данные для программирования и логики, то сейчас в фокусе — робототехника и пространственное ориентирование. Дата-провайдеры на площадке в этом году почти без исключений представляли решения для Physical AI и egocentric video. 2. Embodied AI и модели мира. Индустрия перестаёт описывать законы физики алгоритмическими правилами. Вектор сменился на World Models: система получает массивы видео и сенсорных логов, самостоятельно формируя понимание пространства. Цель — переход от облачных текстовых моделей к ИИ, способному взаимодействовать с физическими объектами. Показательно: embodied AI и робототехника стали второй по темпу роста категорией на конференции — доля таких статей выросла с 2,9 до 6,2% год к году. 3. Скорость важнее фотореализма. В сегменте генерации визуального контента качество ушло на второй план. Разработчики сфокусировались на снижении задержек. Для внедрения моделей мира в робототехнику инференс должен быть мгновенным. Показательна ситуация с академической частью конференции. Процесс классического рецензирования не совпадает с реальными темпами рынка. Часть принятых статей заявляет статус SOTA, опираясь на бенчмарки, которые индустрия де-факто уже переросла, — это известная системная проблема ML-конференций, и CVPR 2026 не стала исключением. Одновременно с этим китайские институты сохраняют одно из лидирующих мест по числу принятых работ. Западный корпоративный сектор всё активнее скрывает архитектуры внутри закрытых проектов, хотя исключения есть: NVIDIA, например, опубликовала на конференции более 50 работ с открытым кодом и весами. Тем не менее китайские академические институты методично наращивают долю в открытой науке.
Anthropic извиняется за скрытый саботаж в новой модели Fable 5 Anthropic выпустила новое поколение моделей — Mythos 5 и Fable 5. Релиз должен был стать демонстрацией технологического превосходства, но обернулся громким скандалом вокруг скрытого саботажа исследователей. • Технически это одна и та же модель, показывающая SOTA-результаты на длинных агентных задачах. Но доступ разделён: полная версия (Mythos 5) остаётся в закрытом контуре Project Glasswing — для проверенных партнёров в сфере кибербезопасности, финансов и медицины. В публичный доступ выходит Fable 5 — версия с параноидальными фильтрами безопасности. • Главный скандал разгорелся вокруг механики ограничений, спрятанной в 319-страничном System Card. Здесь важно разделить два разных механизма. Первый — видимый: если классификатор определял запрос как связанный с кибербезопасностью, биологией, химией или дистилляцией модели, Fable 5 явно переключала пользователя на Opus 4.8 с уведомлением. Второй — скрытый, и именно он взорвал сообщество: для запросов по разработке фронтирных LLM (предобучение, архитектура нейросетей, ML-ускорители) модель не отказывалась отвечать и не переключалась на Opus 4.8. Она молча деградировала изнутри — через подмену промптов, steering vectors и PEFT — без какого-либо уведомления пользователя. • Исследовательское сообщество предсказуемо взорвалось. Anthropic пришлось выпустить срочное заявление, признав ошибку. Скрытая деградация уходит — теперь и этот класс запросов будет открыто перенаправляться на Opus 4.8 с указанием причины, как это уже работает для кибербеза и биологии. • Инференс стоит в два раза дороже предыдущего поколения. Иллюзия безлимита по подписке на Fable 5 заканчивается 22 июня. Далее — отдельная оплата за токены. Ситуация со скрытой деградацией — это тревожный прецедент. Лаборатория-лидер попыталась использовать свою же публичную модель для незаметного саботажа независимых исследователей и команд, разрабатывающих конкурирующие системы — при том что собственные сотрудники Anthropic работали с полной, нефильтрованной версией. Тот факт, что это откатили только после публичной огласки, показывает, как именно бигтех будет пытаться контролировать скорость развития индустрии, получив в руки монополию на фронтирные вычисления.
Microsoft отключает своим разработчикам доступ к Claude Code — и это дорого обходится репутации Copilot Ироничная новость из корпоративного сектора: Microsoft вынуждена запретить части собственных сотрудников использовать ИИ-инструмент от Anthropic. Официально — ради «унификации стека». Неофициально — потому что инструмент оказался слишком удобным и слишком дорогим одновременно. Ещё в декабре Microsoft открыла инженерам, дизайнерам и продакт-менеджерам доступ к Claude Code и активно призывала их экспериментировать. Уговаривать никого не пришлось — инструмент моментально стал основным рабочим стандартом внутри команд. • Взрывная популярность обернулась против самой корпорации. Спустя полгода Microsoft объявила о планах аннулировать лицензии — дедлайн намеренно совпадает с 30 июня, концом финансового года компании. Но называть это чисто финансовым решением было бы упрощением: Claude Code успел всерьёз подорвать позиции собственного инструмента Microsoft — GitHub Copilot CLI. • В качестве альтернативы разработчикам предлагают перейти на Copilot CLI. Команды подразделения Experiences & Devices — Windows, Microsoft 365, Outlook, Teams и Surface — получили указание завершить переход до конца июня. Важный нюанс: от Claude отказываются не полностью. Модели Anthropic остаются доступными через Copilot CLI и Microsoft Foundry. Главная проблема заключается в том, что сторонний продукт на практике полностью обошёл собственные аналоги корпорации. Ситуация, когда разработчики Windows и Microsoft 365 массово предпочитают интерфейс Claude Code собственному хвалёному Copilot, наносит прямой удар по престижу ключевого ИИ-продукта Microsoft.
Huawei предлагает отказаться от закона Мура: новый подход к масштабированию чипов На конференции IEEE ISCAS Huawei представила альтернативную концепцию развития полупроводников. На фоне изоляции от передового литографического оборудования компания пытается пересмотреть саму систему координат индустрии. • Время вместо размера (закон Тау). Последние пять десятилетий индустрия жила по закону Мура: инженеры просто делали транзисторы всё меньше и меньше (уменьшая нанометры). У Huawei нет доступа к передовому оборудованию для такой микрохирургии. Поэтому они предлагают новый параметр масштабирования — τ (Тау). Фокус смещается с физического размера транзистора на время задержки сигнала между ними. • Умная архитектура (LogicFolding). Если ты не можешь сделать детали меньше, нужно скомпоновать их умнее. Huawei разработала технологию LogicFolding: вместо классического плоского размещения элементов на кристалле они строят многоуровневые вертикальные стеки для цифровых, аналоговых и памятных схем, сокращая физическое расстояние между блоками. Грубо говоря, сигнал теперь идёт не в обход, а напрямую сверху вниз. По заявлениям компании, это даёт +55% к плотности транзисторов и +41% к энергоэффективности на том же техпроцессе. • Сроки. Первый процессор Kirin с применением этой архитектуры выйдет уже осенью 2026 года. К 2031 году Huawei обещает достичь производительности, которая будет равна 1.4 нм техпроцессу (у лидера рынка TSMC этот рубеж запланирован на 2028 год). Купить нидерландские EUV-сканеры от ASML в обход санкций для Huawei практически невозможно. Сейчас китайские фабрики выжимают максимум из старого оборудования (DUV), используя мультипаттернинг, но этот метод уперся в потолок физики и рентабельности. Переход на 3D-компоновку и фокус на времени (τ) — единственный доступный им способ обойти этот аппаратный тупик. И всё же к заявлениям про «эквивалент 1.4 нм» стоит относиться со скепсисом. Архитектурные ухищрения вроде 3D-компоновки и LogicFolding действительно снижают задержки, но они не отменяют базовую физику: более старые техпроцессы выделяют больше тепла и требуют больше энергии. В серверном сегменте это можно решить охлаждением, но для мобильных устройств теплопакет остаётся критическим ограничением. Резкий скачок плотности в роадмапе компании между 2030 и 2031 годами намекает на то, что к этому моменту Huawei рассчитывает получить доступ к китайским EUV-литографам. Но нарисовать рывок на графике гораздо проще, чем с нуля воссоздать сложнейшую в мире цепочку поставок оборудования в условиях жёстких санкций. Единственный сильный момент в этой презентации — метрика τ отлично подходит для фотонных процессоров, где плотность размещения элементов уже не имеет решающего значения.
Hugging Face представила две агентные open-source-системы для автоматизации исследований На Hugging Face появились два новых ИИ-инструмента для учёных и инженеров. Что именно выпустили: • physics-intern. Агентная надстройка для задач теоретической физики. Система берёт исследовательскую проблему и разбивает её на подзадачи, распределяя их между специализированными субагентами (один выполняет вычисления, второй проверяет утверждения, третий критикует стратегию). Результат: поднимается скор Gemini 3.1 Pro на бенчмарке CritPt с 17.7% до 31.4% (зафиксирован новый SOTA). • ml-intern. Попытка автоматизировать рутину ML-команд (цикл post-training). Агент парсит статьи на arXiv, обходит графы цитирований, подтягивает и переформатирует датасеты, чтобы не тратить GPU-часы на грязных данных. Далее он самостоятельно запускает обучение (локально или через HF Jobs), читает логи эвалюации, диагностирует сбои и перезапускает процесс. Оба проекта полностью открытые и нативно интегрированы в экосистему Hugging Face. Для первых пользователей ml-intern выделили гранты на $1000 для GPU-ресурсов и кредиты в Anthropic API. Данный подход показал нелинейный прирост качества при оркестрации нескольких специализированных агентов. И всё же названия проектов (intern — стажёр) выбраны не случайно, и обольщаться пока рано. Агент может собрать датасет по референсам и запустить скрипт, но постановка концептуальной гипотезы всё ещё требует человека.
Google представила 8-е поколение TPU Google анонсировала новые ИИ-ускорители: TPU 8t и TPU 8i. Компания официально разделяет железо на две независимые ветки: одну для обучения, другую для инференса. Это разительно контрастирует с подходом Nvidia, которая продолжает строить преимущественно универсальные GPU для широкого круга задач. Google же делает ставку на жёсткую специализацию — и в этом она ближе к AWS с её связкой Trainium/Inferentia. Индустрия всё активнее использует архитектуры Mixture-of-Experts (MoE) и reasoning-системы. Требования к железу на этапе тренировки и в продакшене разошлись достаточно сильно, так что универсальный чип становится компромиссом. Там, где стандартный GPU начинает проигрывать в эффективности, специализированный кремний даёт существенный прирост. Что внутри: 1. TPU 8t (Training) Чип спроектирован исключительно для масштабного обучения. В один кластер (суперпод) объединяется до 9 600 чипов. Главный фокус — на скорости и отказоустойчивости. Заявлен важнейший системный показатель: goodput (доля полезного вычислительного времени) выше 97%. Это значит, что кластер реально обучает модель, а не простаивает, восстанавливаясь после неизбежных аппаратных сбоев. Относительно прошлого поколения (v7) заявлено улучшение соотношения «цена — производительность» в 2,8 раза. 2. TPU 8i (Inference) Чип для работы моделей в проде. Сложные ИИ-системы и автономные агенты требуют удержания гигантского контекста и минимальной задержки. Поэтому 8i получил радикальное расширение — 384 МБ накристальной памяти SRAM, чтобы активный контекст модели помещался целиком на чипе, — и удвоенную скорость обмена данными между чипами. Результат — прирост эффективности на инференсе до 80% на доллар затрат. Релиз обоих чипов ожидается в ближайшее время.
Physical Intelligence: роботы учатся импровизировать Стартап Physical Intelligence (основанный выходцами из Google) представил новую модель π0.7. В своей разработке учёные пытаются решить фундаментальную проблему отрасли — хрупкость алгоритмов. Исторически обучение роботов строилось на жёстком запоминании. Чтобы манипулятор научился складывать футболку, инженерам нужно было собрать тысячи примеров именно для этой модели робота в конкретных условиях. Любое отклонение в среде или замена железа приводили к сбою. Модель π0.7 переносит в физический мир главное свойство современных LLM — способность к композиционному обобщению. Система берет усвоенные ранее базовые навыки и комбинирует их на лету для решения задачи, которой её никогда явно не учили. На практике это выглядит так: • модель управляет новым, незнакомым роботом и успешно складывает футболки. При этом в тренировочных данных не было ни одной записи этого процесса конкретно для данной конструкции манипулятора. • робот сталкивается с новым для себя прибором — аэрогрилем. В базе есть лишь общие обрывки физического опыта (как толкать предметы, как класть вещи в контейнер). При нулевом промпте робот справляется лишь частично и с ошибками. Но когда человек даёт пошаговые голосовые инструкции, робот успешно загружает батат в корзину — после чего систему можно дообучить, и она выполняет задачу уже полностью автономно, без участия оператора. Инженеры настроили промптинг для физических систем. Теперь модель получает не просто команду «что делать». В неё загружают контекст «как делать». Промпт стал мультимодальным: он включает язык, метаданные и визуальные субцели. Визуальные субцели генерируются на лету с помощью лёгкой модели мира. Система предсказывает, как должна выглядеть среда после следующего правильного шага, и даёт роботу наглядный промежуточный ориентир, не позволяя ему сбиться с пути. Отрасль давно пытается добиться от роботов умения импровизировать и подстраиваться под контекст. Переход от зубрёжки к обобщению означает кратное падение затрат на интеграцию. Важно отделять исследовательские победы от промышленной эксплуатации. Генерация визуальных субцелей на лету требует значительных вычислительных мощностей. Physical Intelligence уже перенесла инференс в облако: модель работает в датацентре, робот получает пакеты команд по API. Это снимает вопрос бортового железа, но переносит нагрузку на облачную инфраструктуру и требует стабильного канала связи. При масштабировании на большой парк роботов обе статьи затрат потребуют отдельной проработки.
OpenAI идёт в фарму: релиз GPT-Rosalind OpenAI представила GPT-Rosalind — специализированную модель для исследований в области естественных наук, включая биологию, химию, геномику и разработку лекарств. Разработка нового лекарства в США — от поиска молекулы до одобрения регулятором — занимает в среднем 10–15 лет и стоит миллиарды долларов. Огромная часть времени уходит на рутинный анализ разрозненных данных: учёным приходится сводить воедино тысячи статей, патентов и результатов тестов. GPT-Rosalind позиционируется как ИИ-исследователь (Vertical AI). Её задача — ускорить ранние этапы R&D. Модель помогает синтезировать доказательную базу, проектировать эксперименты и генерировать проверяемые гипотезы, находя неочевидные связи в гигантских массивах данных. Модель доступна через ChatGPT, Codex и API, но только в рамках программы «доверенного доступа». Инструмент отдают только избранным enterprise-клиентам с жёстким комплаенсом. В числе первых партнёров — бигфарма, биотех и научные институты: Amgen, Moderna, Allen Institute и Thermo Fisher. Закрытость объясняется не только коммерцией, но и биобезопасностью (чтобы модель не использовали для синтеза патогенов). В биотехе сосредоточены колоссальные бюджеты на R&D, а цена ошибки на поздних стадиях клинических испытаний фатальна. Если GPT-Rosalind сможет сократить цикл разработки препарата хотя бы на год или отсеять тупиковые гипотезы на старте, экономический эффект составит десятки миллиардов долларов. Для OpenAI это означает идеальный, независимый от хайпа источник корпоративной выручки.
С ростом популярности ИИ атаки на GPU становятся все опаснее Исследователи в области информационной безопасности описали атаки GeForge и GDDRHammer, выполняемые через память графических процессоров NVIDIA. Оба подхода развивают идеи GPUHammer — атаки, направленной на видеопамять стандарта GDDR6 дискретных GPU. Они могут уронить точность моделей с 90 до 0,1%, сделав их непригодными для работы. Еще в 2014 году была описана атака Rowhammer, при которой многократное обращение к одним строкам DRAM вызывало переворот битов в соседних. В DRAM данные удерживаются зарядом в ячейках памяти и интенсивные обращения к ним приводят к его утечке и изменению значения битов в соседних ячейках с 0 на 1 или наоборот. В результате злоумышленник может добиться повреждения данных, обхода защиты или повышения привилегий в системе. В исследовательских условиях GPUHammer продемонстрировал, что аналогичный эффект достижим и на GDDR6. В новых атаках на GPU концепция принудительного изменения бита осталась той же. При реализации GDDRHammer исследователи использовали технику предварительной подготовки памяти (memory grooming), позволяющую более точно контролировать размещение данных и ход атаки. В экспериментальных условиях им удалось добиться до 129 битовых изменений на один банк памяти. Атака GeForge похожа на GDDRHammer и тоже использует принцип RowHammer, но была обнаружена другой исследовательской группой, которой удалось вызвать 1171 битовое искажение на RTX 3060 и 202 на RTX A6000. Команда атаковала каталог страниц графического процессора вместо таблиц страниц. Каталог указывает на эти таблицы, поэтому битовые искажения в этой структуре могут затрагивать более критичные механизмы адресации памяти. В результате появляется возможность нарушить отображения адресов, из-за чего GPU может обращаться к областям памяти за пределами разрешенных, включая данные других процессов. GPUHammer и GeForge, хотя и опасны, должны выполнять код на общем GPU с жертвой. Такой сценарий возможен в облачной среде с кластером графических процессоров, где эти атаки могут привести к нарушению изоляции памяти между процессами. Снизить риск атак GPUHammer и GeForge может коррекция ошибок в памяти (ECC, error-correcting code). Но ECC рассчитан на случайные ошибки, а не на целенаправленные воздействия. Этот механизм может не справиться с множественными или повторяющимися битовыми искажениями. Также надо учитывать, что на некоторых GPU пользовательского сегмента он отсутствует или отключен.
NVIDIA выпустила первые в мире открытые ИИ-модели для квантовых вычислений Семейство получило название Ising — в честь знаменитой математической модели, которая в своё время сильно упростила описание сложных физических систем. Глобальная задача релиза аналогичная: расшить два главных узких горлышка в разработке масштабируемых квантовых компьютеров — калибровку процессоров и коррекцию ошибок. Что по цифрам и архитектуре: • Ising Decoding. Две вариации свёрточных 3D-нейросетей (3D CNN), заточенные под декодирование ошибок в реальном времени. Работают до 2.5 раз быстрее и в 3 раза точнее, чем pyMatching — текущий open-source-стандарт в индустрии. • Ising Calibration. Vision-language-модель (VLM), которая автоматизирует непрерывную калибровку квантового железа. Сокращает время настройки с нескольких дней до пары часов. • Локальность и экосистема. Модели полностью открытые и могут запускаться локально (что критично для защиты данных лабораторий). И главное — они нативно интегрируются с программной платформой NVIDIA CUDA-Q и хардверным интерконнектом NVQLink. Исходники уже лежат на Hugging Face и GitHub. Пока физические кубиты остаются хрупкими и нестабильными, Дженсен Хуанг предлагает использовать ИИ как контрольный слой. Квантовые вычисления всё ещё находятся в фазе глубокого R&D, и фундаментальные физические проблемы масштабирования кубитов не решить одним лишь красивым софтом. Для NVIDIA этот релиз — не столько приближение квантовой революции, сколько отличный способ продавать классические чипы прямо сейчас. Ведь, чтобы непрерывно гонять свёрточные сети для калибровки и коррекции ошибок, лабораториям понадобятся всё те же стойки с H100 и Blackwell.
Google представила TurboQuant — алгоритм сжатия KV‑cache TurboQuant заявляет о снижении потребления KV-cache примерно в 5–6 раз. За счет этого уменьшается нагрузка на память при инференсе. KV-cache — это механизм, который хранит в памяти ключи (key) и значения (value) для уже обработанных токенов и переиспользует их, чтобы не пересчитывать весь контекст при генерации следующего токена. Кеш растет вместе с контекстом: чем длиннее диалог, тем больше данных нужно хранить. TurboQuant сжимает KV-cache с 16 до примерно 3–4 бит на значение, при этом сохраняя структуру представлений, а значит, и качество ответа модели. Оптимизация KV-cache снижает требования к памяти при инференсе. Более сложные сценарии можно запускать на том же оборудовании. При этом TurboQuant не требует дообучения, не зависит от данных, сжимая кеш по мере генерации, сочетая подходы PolarQuant и QJL. В итоге бизнес сможет развивать агентные системы с длинным контекстом меньшими затратами, отложив покупку нового компьютерного железа. TurboQuant пока демонстрирует свою эффективность преимущественно на бенчмарках в контролируемых условиях. Похожие механизмы и так использовались в квантовании моделей, поэтому реальный эффект будет не настолько поразительным, как на бумаге. Подобные оптимизации могут уменьшить давление на рынке компьютерной памяти. Акции производителей, включая Micron, на короткое время просели на фоне новости про TurboQuant, но это больше похоже на кратковременную реакцию рынка, чем на фундаментальный тренд. Аналитики отмечают, что удешевление инференса может не снизить, а, наоборот, увеличить общий спрос на ИИ-инфраструктуру из-за роста числа задач, требующих длинного контекста.