tgindex
VLSI HUB

О Чипмейкерстве и ПЛИСоводстве от реального инженера 🧙‍♂️ Если хотите рассказать мне интересное 👉 @iDoka

Последний пост
7 авг.
Последнее чтение
12:42
Постов за неделю
0
Всего постов
58
Тип
открытый
Язык
русский
Категория
Технологии (по похожим)
В каталоге с
12 авг.
Подписчики
3 583
+11 за 3 дн.
Сутки
+3
+0,08%
Неделя
 
Месяц
 
Просмотров на пост
3 152
40 постов
Вовлечённость
88,0%
к подписчикам
Постов в день
0,0
всего 58
Упоминаний
3
каналов
Охват размещения
оценка
1/24сутки в ленте
834
1/48двое суток
955
1/72трое суток
1 030

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Nemotron 3 Ultra [2/2] (часть 1) Результаты: Усреднённо по девяти категориям связка ACE-RTL + Nemotron 3 Ultra выдаёт pass rate 97% против 95% у Kimi K2.6 и 92% у GLM 5.2 при фиксированном агенте (то есть изолированно измеряется вклад самой модели). На категории отладки cid016 сам агентный контур поднимает точность драматически: GLM 5.2 идёт с 44% в одиночку до 94% в агенте, Kimi K2.6 - с 68% до 97%, Nemotron - с 65% до 100%. Вывод для практика очевиден: без итеративной петли с инструментами реалистичные RTL-задачи не берутся, каким бы сильным ни был базовый LLM. Но главная цифра - не pass rate, а стоимость. Nemotron 3 Ultra достигает лидирующей точности при 7k токенах на итерацию против 9k у GLM 5.2 и 22k у Kimi K2.6 - примерно на 28% и на 71% меньше соответственно. Для агентного RTL это критично: контекст одной итерации отладки распухает мгновенно - туда входят спецификация, сгенерированный RTL, вывод симулятора, сработавшие ассерты и прошлые попытки фикса. При равном compute-бюджете меньший расход токенов означает больше взятых задач и более быстрый оборот итераций. В агентном коде это часто важнее, чем лишний процент на лидерборде. Отдельно стоит отметить, как модель учили под RTL. Пайплайн синтетических данных из статьи ACE-RTL стартует с отобранных из публичных репозиториев seed-дизайнов, а затем генерирует не только пары «спецификация → эталонный RTL», но и задачи на редактирование и на отладку: в seed инжектируются реалистичные ошибки (неверные переходы конечного автомата, нарушения handshake и таймингов), а спецификация снабжается диагностикой наблюдаемого сбоя. Всё это проходит через фильтр - синтаксические проверки, деконтаминацию относительно бенчмарков и rubric-скоринг через LLM-as-judge на семантическое соответствие. Именно тренировка на edit/debug-задачах, а не только на генерации с чистого листа, объясняет, почему модель хорошо себя ведёт внутри агентной петли. @vlsihub

  • 7 авг.8991316

    Свежая публикация NVIDIA про Nemotron 3 Ultra читается как ещё один пресс-релиз в жанре «наша модель обошла всех на бенчмарке». Но если убрать маркетинговую обёртку, остаётся вещь поинтереснее: NVIDIA и методично продолжает перформить на тему проектирования микросхем (RTL и верификацию), но в качестве соперников для сравнения выбрала не GPT и не Claude, а два сильнейших китайских open-weight-семейства: GLM и Kimi. Это не случайный выбор бейзлайнов. Это заявка на то, где именно проходит линия конкуренции в EDA-стеке ближайших лет. Соперники, выбранные для сравнения, намеренно китайские. В мае 2025-го Bureau of Industry and Security ввело лицензирование экспорта EDA-софта в Китай (классификация ECCN 3D991/3E991), мотивируя это риском military end-use; Synopsys, Cadence и Siemens EDA приостановили поставки и поддержку. Уже 2 июля 2025-го ограничения отозвали - в рамках торгового перемирия, размороженного на переговорах в Лондоне и связанного с китайскими редкоземельными металлами. Эпизод продлился меньше шести недель, но показал, насколько EDA стал рычагом в большой геополитике. Причём рычаг работает в обе стороны. «Большая тройка» контролирует около 70–80% китайского рынка EDA (глобально по TrendForce за 2024-й: Synopsys ~31%, Cadence ~30%, Siemens EDA ~13%), и Китай методично финансирует собственный EDA-стек, чтобы снять зависимость. Но вот в чём тонкость нового витка: инструменты можно поставить под лицензию, а open-weight-модель - нельзя. GLM, Kimi (и Alibaba Qwen3.8-Max из прошлого поста с её автономным chip-design-агентом) свободно скачиваются с HuggingFace. Вишенка в качестве LLM поверх проектирования чипов оказывается тем фронтом, где экспортный контроль в привычном виде просто не применим. Ответ NVIDIA симметричен и показателен: выпустить собственную открытую модель, которая обыгрывает китайские открытые модели на профильном для железа бенчмарке, и захардкодить её в западный EDA-стек. Nemotron 3 Ultra - это MoE на 550 млрд суммарных параметров при 55 млрд активных, гибрид Mamba-Attention, предобученный на 20 трлн токенов и растянутый до контекста в 1 млн токенов. Гибридная архитектура здесь работает не ради красоты спецификации: Mamba-часть режет стоимость внимания и размер KV-кэша, MoE поднимает точность на активный параметр, и вместе это даёт заявленный выигрыш до 5× по пропускной способности и до 30% по стоимости против сопоставимых open-моделей. Ровно то, что нужно долгоживущему агенту, чей контекст не влезает в заданные ограничения. Модель тестировали внутри агента ACE-RTL - стандартной для RTL петли «сгенерировал ➡️ прогнал симуляцию/проверки ➡️ проанализировал провал ➡️ уточнил». Агент состоит из трёх кооперирующих компонентов: генератора (пишет и правит RTL), рефлектора (разбирает фидбек симулятора, локализует вероятную первопричину, даёт высокоуровневые указания на фикс) и координатора (ведёт эволюционирующий контекст отладки между итерациями, решая, какую историю и какой фидбек тащить в следующую попытку). Смысл - чтобы агент строил на прошлых провалах, а не наступал на те же грабли по кругу. @vlsihub

  • 3 авг.1 7272027

    Китайский ИИ «спроектировал чип» Alibaba выкатила Qwen3.8-Max (2,4T параметров) и главным аттракционом сделала не SWE-бенч, а автономный chip-design. Таргет - GCD/RSA-ускоритель с модульным умножением и возведением в степень: компактный, логически плотный блок. На входе - минимум: описание задачи, stub-воркспейс с пустыми модулями и eval-скрипт. Песочница с настоящим тулчейном (Iverilog → Yosys → OpenROAD), корректность - bit-exact через рандомизированный cocotb на WIDTH 4/6/8/16. Ни golden reference, ни человека в контуре. Пока всё выглядит как нормальный closed-loop, а не как демо на синтетике. Метрики для пресс-релиза: ~500 turns, 71 eval, улучшайзинг gate count с 8298 до 678, die 106×106 → 46×46 мкм, wirelength 33 369 → 4187 мкм, WNS из −4,46 нс вытянут в +0,66 нс, timing closure на 500 МГц. Минус 81% площади. Красиво - ровно до момента, когда начинаешь читать, от чего считали проценты... ..а считали от 8298 вентилей «первой функционально рабочей версии». Переведём на инженерный: baseline был раздутым черновиком, и добрая половина хвалёного улучшения - это модель, героически побеждающая собственную криворукость на старте. 6288 из 6288 сэкономленных на 22-м turn'е вентилей - это замена аппаратного restoring-делителя по модулю на итеративный shift-subtract. Отличное решение! Которое любой RTL-джун держит в голове как дефолт, а не как откровение на 22-й итерации. То есть «прорыв» - это когда агент наконец перестал синтезировать делитель там, где нужен сдвиговый цикл. Дальше - про масштаб, о котором маркетинг тактично молчит. WIDTH=16. Настоящий RSA - это 2048/4096 бит; шестнадцатибитный «RSA-ускоритель» - это лабораторка второго курса, а не то, что кто-то тейпаутит. Разводили в Nangate45 - академическом PDK, а не на реальном foundry-ноде, где начинается веселье с DRC, antenna rules, EM/IR-дропом и corner'ами. 46×46 мкм с 4187 мкм трассировки роутится без единого congestion-хотспота - тут и OpenROAD не вспотел. Timing closure на 500 МГц в такой конфигурации - это не достижение, это отсутствие проблемы. И всё же кидаться помидорами целиком - глупо. Реально ценное здесь - не итоговые 678 вентилей, а то, что агент держал когерентную стратегию сотни turn'ов и продолжал вытаскивать структурные улучшения (module fusion, resource sharing одного субтрактора глобально, FSM-прунинг) на 400-м шаге, а не залипал на косметике после ранних лёгких вентилей. Вот это - сигнал. Петля «edit ➡️ simulate ➡️ synthesize ➡️ P&R ➡️ читаю числа ➡️ рефакторю» с жёсткой верификацией на каждом шаге масштабируется туда, куда single-shot-генерация RTL не масштабируется никогда. Резюме для тех, кто дочитал: «ИИ проектирует чипы» - маркетинговый буллшит; до полноценного SoC-флоу тут как до Луны. А вот «агент способен держать инженерную стратегию на сотнях итераций закрытого цикла и находить architecture-level, а не syntax-level улучшения» - правда, и это важнее любого заголовка. PS: Контекст: прошлый 3.7-Max уже крутил 35-часовую автономную оптимизацию Triton-ядра под кастомный чип с 1158 tool-call'ами. Alibaba методично докручивает один и тот же сюжет - long-horizon под железо - от релиза к релизу. Это не случайный выброс, это дорожная карта. Только напомню в скобках: все числа - из собственного launch-репорта, third-party репликации нет, а «лучше всех протестированных моделей» - это их эвал на их постановке. Верить на слово в EDA - примерно как верить в тайминги по datasheet без своего STA. PPS: о том, о чём в отчёте - ни строчки: это RSA/крипто-блок. Оптимизировали его исключительно под area × correctness. Никто, судя по описанию, не проверял constant-time. А в трейсе прямым текстом: «early-exit для чётных», «MSB субтрактора как компаратор», data-dependent число итераций. Поздравляю - вы получили компактный крипто-датапас с шикарным timing side-channel'ом. На реальном RSA такое «оптимизированное» железо утекает секрет по задержке ещё до того, как доедет до fab. Метрика PPA сошлась, threat model - нет. @vlsihub

  • 10 июл.2 2123924из positiveslack

    Какой? #meme @positiveslack

  • 9 июн.3 67512

    видео или голосовое, без подписи

  • 9 июн.3 461813

    𝗖𝗹𝗮𝘂𝗱𝗲 𝘄𝗶𝘁𝗵 𝘃𝘀. 𝘄𝗶𝘁𝗵𝗼𝘂𝘁 𝗦𝗩𝗔-𝗥𝗔𝗚 𝗳𝗼𝗿 𝗙𝗼𝗿𝗺𝗮𝗹 𝗩𝗲𝗿𝗶𝗳𝗶𝗰𝗮𝘁𝗶𝗼𝗻 - тут народ пытается к Клоду прикрутить RAG для SVA. ❓Пейпер также сгенерён Клодом (Судя по обилию эмодзи) ✅ Автор: Ben Cohen (написал книгу Fast-Tracking SVA through Exposure) ✅ ASCII-art красивый 😍 PS: файлы в первом комменте @vlsihub

  • 8 июн.3 1031112из positiveslack

    Мечтают ли ИИ-агенты об анализе вейвформ? Мероприятие прошло. Было очень круто 🎧 Спасибо всем кто пришел, и с кем удалось пообщаться! Если вдруг упустили, то я рассказывал про CLI инструмент для анализа и работы с вейвформами, написанный специально для "рук" LLM-агентов. https://github.com/kleverhq/wavepeek Слайды в первом коменте к посту, ну а выступление есть на YouTube Жажду получить любую обратную связь, особенно отзывы по использованию в реальных задачах. Любая движуха приветствуется, кроме нейрослоп-PR конечно 😎 #llm #tools @positiveslack

  • 5 июн.3 1342922

    пятничное? @vlsihub

  • 12 мая3 7971413

    Verible - проект под патронажем гугл (для парсинга, линтинга, форматирования SystemVerilog). Просто цифры: ▫️4000 коммитов ▫️2500 ишью ▫️более 60ти контрибьюторов ▫️почти 300 форков ...и 5 лет понадобилось, чтобы, вероятно, закрыть мой ишью, открытый в беззаботном 2021м 👉👈🥹 @vlsihub

  • 16 апр.3 968247

    Мне одному кажется, что цены на FPGA платы на али за последние несколько месяцев сделали 2х в цене? 🤯 @vlsihub

  • 10 апр.3 9994

    видео или голосовое, без подписи

  • 10 апр.4 0534

    видео или голосовое, без подписи

  • 10 апр.3 831104

    Как похорошел Линкедин в эпоху AI: если раньше 80% сообщений в личке было от рекрутеров, то теперь каждое первое сообщение от создателя ULTRA LLM ASIC SUPER DRUPER VLSI AI FPGA ONE BUTTON SOLUTION продукта 💡 А что обычно вам присылают на линкедин? @vlsihub

  • 1 апр.4 046775

    Как сказал бы один мой знакомый велосипедист: "Сомнительно, но Okay" Пока что впечатления от "Opus 4.6 with high effort" как от слепого котёнка: пришлось через /btw подсказать что искать надо не на сайтах $CDNS и $SNPS, а на github. Посмотрим чем закончатся философские рассуждения Клода. BTW, если кому-то попадались на линкедин или гитхаб best practice по CLAUDE.md для RTL разработки, то поделитесь добром 👀 PS: ставь 🕊 если смог прочесть этот пост через телеграм

  • 24 мар.3 3601915из AGI_and_RL

    прикольно дизайнить процессоры агентами Design Conductor: An agent autonomously builds a 1.5 GHz Linux-capable RISC-V CPU https://arxiv.org/abs/2603.08716 https://www.alphaxiv.org/ru/overview/2603.08716

  • 23 мар.3 01221

    видео или голосовое, без подписи

  • 23 мар.3 1003621из markovdrankthechains

    iCTS: Iterative and Hierarchical Clock Tree Synthesis With Skew-Latency-Load Tree [ссылка] Прикольная статья, в которой китайцы предлагают интересный метод оптимизации тактового дерева. Если кратко, то синхронная цифровая схема держится на одном допущении: каждый триггер видит фронт тактового сигнала одновременно (иначе данные защёлкнутся раньше, чем вычисление закончилось, и триггер захватит некорректный результат). Но "одновременно" физически невозможно. Сигнал идёт от одного источника до тысяч триггеров по металлическим проводам с сопротивлением и емкостью, разные триггеры находятся на разном расстоянии, и сигнал приходит в разное время (эта разница называется skew). Решение - буферы. Они восстанавливают деградировавший фронт и добавляют контролируемую задержку, и если вставить буферы в нужных точках сети, суммарная задержка по всем путям выравнивается и каждый триггер получает фронт в +/- одно и то же время. Собственно, автоматическое построение такого дерева буферов и называется Clock Tree Synthesis. Звучит как инженерная задача с однозначным решением, но внутри три цели, которые конфликтуют между собой: минимальный skew, минимальная длина проводов и минимальная latency. Получить всё три одновременно - NP-hard. Стандартный CTS flow разбит на два независимых шага без обратной связи: сначала DME (алгоритм балансировки топологии тактового дерева) фиксирует структуру дерева: где провода соединяются и как ветвятся. Потом отдельный алгоритм (как правило, ван Гинекен) вставляет буферы уже в готовую структуру: обходит дерево снизу вверх, в каждом узле оценивает варианты буферов с учётом ёмкостной нагрузки downstream и выбирает лучший. Топологию изменить уже нельзя, поэтому алгоритм подстраивается под то, что есть. Чтобы выровнять задержки на коротких ветках, DME добавляет wire elongations - буквально удлиняет провода змейкой, из-за чего растёт ёмкость и мощность. Буферы потом сайзятся под худший случай нагрузки, часто избыточно. И это бьёт не только по мощности. Буферы занимают площадь кристалла, тактовые провода съедают ресурсы роутинга, рядом с кластерами буферов нужны decap-ячейки. Место, которое могло быть вычислениями, занято инфраструктурой доставки сигнала. Тактовое дерево переключается каждый такт, независимо от того что делает логика. На высокопроизводительных процессорах это может отъедать до 50% от TDP, то есть если чип греется на 100 Вт, то до 50 Вт уходит только на доставку тактового сигнала, а не на вычисления (пара статей про это - [тык], [тык], [тык]) Исследователи из CUHK и Pengcheng Lab предложили строить топологию и буферизацию одновременно с явным trade-off между skew, latency и wirelength. В классическом DME точка слияния двух поддеревьев единственная, где задержки выравниваются, и никакого выбора нет. iCTS расширяет это до отрезка допустимых точек слияния, где любая точка даёт skew в пределах заданной границы, и на этом отрезке алгоритм выбирает точку, минимизирующую сумму с явными весами для latency и wirelength. Поверх этого иерархическая кластеризация группирует синки не по геометрической близости, а по ёмкостной нагрузке, потому что физически близкие синки могут нагружать дерево по-разному и ломать балансировку. Результат кластеризации дополнительно оптимизируется отжигом. Буферы оцениваются до вставки, что позволяет отсекать плохие варианты раньше. После буферизации ISCA итеративно перезапускает BST-DME на зафиксированной топологии, каждый раз уточняя оценки задержек, пока skew не достигает целевого значения. На бенчмарках ISCAS'89, OpenLane, OpenCores и ysyx (от 1248 до 22810 flip-flop) при 28nm результат такой: коммерческий P&R инструмент проигрывает iCTS на 39.5% по skew, 13.0% по latency и 18.5% по capacitance, OpenROAD - на 101.6%, 50.7% и 25.5% соответственно. По clock power коммерческий инструмент потребляет в среднем на 32% больше, OpenROAD - на 81% больше. Хоть в максимальном бенчмарке всего ~23к триггеров, иерархическая архитектура iCTS должна масштабироваться. Не знаю, применит ли это кто-нибудь в продакшене, но звучит многообещающе

  • 11 мар.2 8564632из vvzvlad_lytdybr

    видео или голосовое, без подписи

  • 6 мар.3 68561

    видео или голосовое, без подписи

  • 6 мар.4 18161

    видео или голосовое, без подписи

VLSI HUB — tgindex