tgindex
Валера Ковальский

Валера Ковальский

Статистика

Head of AI Автор https://neuraldeep.ru/ Raised $2M+ for human-centric AI startups github.com/vakovalskii | chat @neuraldeepchat По вопросам сотрудничества - @VaryaVarenik05

Последний пост
16:13
Последнее чтение
11:46
Постов за неделю
13
Всего постов
42
Тип
открытый
Язык
русский
Категория
Бизнес
В каталоге с
12 авг.
Подписчики
16 118
+62 за 4 дн.
Сутки
+26
+0,16%
Неделя
 
Месяц
 
Просмотров на пост
6 700
39 постов
Вовлечённость
41,6%
к подписчикам
Постов в день
1,9
всего 42
Упоминаний
43
каналов
Охват размещения
оценка
1/24сутки в ленте
4 588
1/48двое суток
5 257
1/72трое суток
5 670

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 16:132 5723153

    У меня тут большое обновление по Coddy Agent - в проект был добавлен консольный интерфейс, вдохновлённый интерфейсом pi.dev, но со всеми фичами, которые есть у Coddy Agent. Поддерживается всё, что ждёшь от современного агента, будь то скилы, рулесы, MCP-серверы, селекторы моделей, разные режимы работы, уровни ризонинга и так далее. Помимо интерактивного режима через TUI есть ещё режим неинтерактивный через ключ "-p" - пишем, что надо сделать, и агент это выполнит. Есть возможность продолжить последнюю сессию в текущей директории через ключ "-c". И это далеко не всё. Киллер-фича Coddy Agent в целом, а не только в TUI-режиме, - это возможность подключиться к удалённому AgentOS-серверу (это Coddy Agent, запущенный на удалённом сервере в режиме API) по специальному протоколу Coddy API и работать там, будто это локальная машина, без лагов удалённого рабочего стола, прямо здесь и сейчас, при этом сессии и все настройки будут храниться на удалённой машине, к которой вы подключились. И всё это в формате одного-единственного бинарника, который можно поставить одной командой: curl -fsSL https://coddy.dev/install.sh | bash Обновление программы при помощи coddy update. Сайт проекта: https://coddy.dev Исходные коды: https://github.com/coddy-project/coddy-agent

  • 14 авг.5 04312171

    Qwen3.8-27B на NeuralDeep.ru Наверное мы первые кто поднял ее в РФ по API после релиза через 40 минут! Пошла раскатка на тарифы https://neuraldeep.ru/models/qwen3-8-27b 256к text/video/img Ваш NeuralDeep.ru 👍

  • 14 авг.4 0196945

    Вышла Qwen3.8-27B Погнали ребята, качаем на все хосты! https://huggingface.co/Qwen/Qwen3.8-27B-FP8 https://huggingface.co/Qwen/Qwen3.8-27B Мультимодалка! Катим на neuraldeep.ru следите за анонсами!

  • 14 авг.4 3657483

    DeepSeek-V4-Flash-0731 304B на четырёх 4090 (48 ГБ) суммарно 192 ГБ VRAM через обычный гигабит: замеры Пост написан DeepSeek-V4-Flash-0731 (слоп присутствует) Ночью погасили наш квен на двух машинах в серверной и поставили туда DeepSeek-V4-Flash-0731 304B параметров, MoE, 256 экспертов, 6 активных на токен. Веса 167 ГБ в смешанной точности: эксперты FP4, внимание и роутер FP8. Железо: четыре RTX 4090 по 48 ГБ. Но не в одном корпусе — по две в двух разных машинах, между машинами обычный гигабитный Ethernet через свитч. Цифры Пул KV-кэша ~189 000 токенов Генерация: 1 запрос — 13 ток/с · 8 запросов — 99 ток/с суммарно · 12 запросов — 144 · 12 непрерывно две минуты — 152 ток/с. На один запрос при этом стабильно 12–13 ток/с, то есть очередь почти не давит на латентность. Обработка промпта (уникальный текст, префикс-кеш выключен): 1.5k токенов — 1187 ток/с · 4.5k — 1929 · 9k — 2247 ток/с. Мощность: ~490 Вт на все четыре карты под полной нагрузкой (128/134/118/112). Карты закапаны на 200 Вт из паспортных 450 — то есть 304 миллиарда параметров работают на половине киловатта. Все цифры — две независимые серии, разброс между ними в пределах 10%. Платишь не сетью, а схемой Я был уверен, что через гигабит ничего не выйдет. Посчитал — ошибся. При пайплайне через сетевую границу едет ровно один вектор активаций: 4096 значений по 2 байта, 8 КБ на токен. По гигабиту это 64 микросекунды плюс 0.3 мс задержки при бюджете токена в 77 мс — меньше процента. Умирает по гигабиту только expert-parallel с его all-to-all, но он тут не нужен. А теперь неприятное: одиночный запрос даёт 13 ток/с, а та же модель на тех же четырёх картах в одном корпусе 82(будем собирать =). Дело не в сети. Два корпуса заставляют упираться в одиночный запрос: карты выстроены в цепочку, в каждый момент считает одна, три ждут очереди. Тензорный параллелизм поделил бы каждое матричное умножение сразу на четыре карты Итог: разнесение по машинам стоит шестикратной потери на одиночном запросе Слои поделены поровну(11/11/11/10), а работа легла неравномерно. Перекос в пользу второй машины должен дать ещё прирост. На что ушла ночь по тестам FP4 на Ada. У 4090 нет аппаратного FP4 — эксперты идут через Marlin с распаковкой в FP16, отсюда и потолок скорост Нужен форк vLLM с патчами под sm89, в ванильн Драйвер. Требуется CUDA 13.0, то есть 580+. KV-кэш только FP8. Без --kv-cache-dtype fp8 модель не стартует вообще. Память впритык. 167 ГБ весов на 189 ГБ VRAM — на всё остальное 28 ГБ на четыре карты. CUDA-графы съедали по 2.6 ГБ на карту, отключили (--enforce-eager), это минус. Спекулятивный декод DSpark, дающий на одномбоксе 287–345 ток/с, не влез вовсе — его веса ещё 13.8 ГБ. Контекст ограничили 16k: на 26k промпте карта ловит OOM. Про exo Часто спрашивают про exo «объедини свои устройства в один кластер». Не годится: exo построен на MLX, заточен под Apple Silicon, на Linux работает только на CPU У нас работает связка vLLM + Ray, а для DeepSeek V4 на Ada форк с патчами под sm89

  • 13 авг.7 573119349

    Вышел Коворк/Код от Битрикс24, делюсь, годная штука Это очень круто упакованный harness под моим небольшим присмотром Просишь собрать материалы к встрече или разгрести поручение, и он сам лезет в твои сделки, чаты, документы и таски прямо в Битрикс24(так как сильно интегрирован с ним) и делает рутинную работу за тебя В режиме Код можно кодить прямо по работе, без прокси и западных карточек, кто с этим воевал, тот оценит, интеграцию с хабом тоже проводил можно указать кастом модельки Больше всего зацепила память (Радиант), брали самые лучшие патерны по бенчам Проверено держит контекст больше месяца и не забывает Под капотом BitrixGPT 5.6 Agent 1M Наружу данные не уходят, весь контур в России, есть под macOS, Windows и Linux. По ощущениям это не очередная обёртка над LLM, а агент, который реально живёт внутри твоих данных и встроен в Битрикс24. Ранний доступ уже открыт, попробовать можно на cowork.bitrix24.ru Чем больше пользователей тем больше фидбека и лучше решение! Так что перед тем как сравнивать "чем лучше" а то я вас знаю =) Просто попробуйте

  • 12 авг.5 0012811

    Окей погнали первые 50 тарифов можно забрать тут https://neuraldeep.ru/pricing#tier-qwen_unlim 3 шага для старта 1) Покупаем тариф 2) Берем ключик 3) Копируем https://neuraldeep.ru/docs в вашего кодинг ассистента UPDATE: если квен 3.8 будет топ то тоже…

  • 12 авг.удалён 14 авг.

    Валера Ковальский pinned a photo

  • 12 авг.5 1662427

    Поговорим про локальный инференс! Мы начинаем https://www.twitch.tv/evilfreelancer Обсуждаем выход https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B-FP8

  • 12 авг.удалён 12 авг.

    Валера Ковальский pinned a photo

  • 11 авг.5 17927

    видео или голосовое, без подписи

  • +1
    11 авг.5 0234428из zavtracast

    Гугл начал тестировать на некоторых ПК и некоторых браузерах новый интерфейс поисковой системы. Из неё убрали поиск. Теперь это окошко для ИИ чат-бота. На главной странице под полем поиска вместо обычной кнопки "Поиск в Google" появились кнопки "Создать изображение", "Задать вопрос о файлах" и "Мозговой штурм" (это как раз режим чата с ИИ), а внутри поля поиска - появилась кнопка "Режим ИИ". Робби Стейн, вице-президент Google Search, подтвердил в сообщении в твиттере, что это действительно тест, но с небольшим количеством пользователей. Также он утверждает, что "изменения кнопок не влияют на основную функциональность нашего поиска, то есть при нажатии на клавишу Enter по-прежнему отображаются обычные результаты поиска Google". Пользователи Android Authority обратили внимание, что гугл отчаянно пытается впихнуть свой ИИ куда только можно и куда нельзя тоже. @zavtracast

  • 11 авг.6 0263050

    Бесконечный qwen Недавно подкинули идею про интересный тариф для neuraldeep.ru qwen-3.6-35b-a3b 512р/месяц 32к max_input 8000 max_output 130 т/с RPM 30 1 max parallel (максимум параллельных запросов, за раз 1 запрос 30 таких в минуту) И бесконечное количество…

  • 11 авг.5 97318844

    Бесконечный qwen Недавно подкинули идею про интересный тариф для neuraldeep.ru qwen-3.6-35b-a3b 512р/месяц 32к max_input 8000 max_output 130 т/с RPM 30 1 max parallel (максимум параллельных запросов, за раз 1 запрос 30 таких в минуту) И бесконечное количество запросов в месяц Если ты за 👍 Если ты против 👎 (напиши в коментах почему) Думаю что у такого тарифа нашелся бы тот кому он нужен Предполагаю первую волну на 50 таких тарифов

  • 10 авг.5 5717099из evilfreelancer

    Стрим про локальный инференс В среду 12 августа в 18:00 MSK выходим в эфир с Валерием Ковальски, автором канала NeuralDeep. Тема: максимально выгодный локальный инференс. Специально договорились не готовиться. Берём железо, включаем камеру и выясняем всё вживую, а сравнительную табличку соберём по ходу разговора. В кадре будем показывать видеокарты и серверы. О чём пойдёт разговор: - начнём с ноутбуков - что на них вообще можно запустить и с какой скоростью; - видеокарты и память - какие брать, сколько нужно и за что реально платишь; - где проходит баланс между ценой, скоростью и точностью; - запуск моделей на малом железе в продакшене - у нас обоих накопился боевой опыт. PS. В тот же день выйдет Qwen 3.8 27B, так что заодно пощупаем свежий релиз прямо на стриме. Когда - среда, 12 августа, 18:00 MSK Где - https://www.twitch.tv/evilfreelancer

  • 10 авг.7 6978367

    Ну что ждемссссссссссс

  • 6 авг.9 05161138

    Рекомендую к просмотру Подкаст вышел про тему мертвого интернета и в целом про возможности ИИ от интересный ребят =) Эпизод уже тут YouTube и в VK

  • 5 авг.8 43914129из sergeinotevskii

    Сижу в лобби отеля, за соседним столом сидят мужики, пьют беленькую, закусывают. Спорят громко. Прислушался. «Петрович, да этих сеток тьма! Маленькие, большие! Для классификации какие хочешь! Можем у себя даже большие развернуть! Главное чтобы электричества хватило!» Думаю: нифига себе адопшн у АИ! Слушаю дальше: «Фракции…булыжники…тонны… золото…». Понимаю что не адопшн, апрофдеформация.

  • 3 авг.10,1 тыс69

    видео или голосовое, без подписи

  • +1
    3 авг.10,4 тыс7470

    Qwen 3.8 27b open weights Ждемс Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Ну и жирнющий Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters - Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub:https://github.com/qwen-code-dev-bot/oh-my-cli - Real work, real results: Production-quality deliverables across hundreds of professions. - Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. - Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction. Прекрасные новости я хочу сказать!

  • 2 авг.8 72415

    видео или голосовое, без подписи