РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ
СтатистикаДелаем нейросети удобными и доступными. Made by @Neuro_Cartel
- Последний пост
- 18:41
- Последнее чтение
- 19:13
- Постов за неделю
- 4
- Всего постов
- 40
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 2 509
- 1/48двое суток
- 2 875
- 1/72трое суток
- 3 101
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
без подписи
без подписи
без подписи
📉 Заметили, что я уже несколько недель не ною про лимиты Клод Кода? Привет! Заметили, же да, никаких жалоб на лимиты. Может, я стал меньше работать и больше отдыхать? Может, завёл себе ещё один аккаунт? Может, проектов поубавилось? О нет, всё совершенно не так. Работаю я ровно столько же, сколько и раньше, пет-проектов как всегда парочка. Но теперь вдруг, внезапно, токенов стало хватать. Причём не просто хватать, а с запасом — как ещё зимой, когда к концу недели оставалось 30-40%. Что за магия? Неужто Дарио Амодей на меня подписался и прочитал мои жалобы в почте? Вовсе нет, друзья. Всему виной китайцы и конкуренты. Но я не только заметил — я, как обычно, сел и проверил. Мне давно говорят, что я считаю спички в коробке и пишу письма на Балабановскую фабрику. Так вот, я пересчитал свою выгрузку той же методикой, что и в июле: на неделе 20 июля, ещё на Opus 4.8, я сжёг 3854 M токенов и упёрся в стену, а на первой неделе Opus 5 — 9366 M и 25 586 сообщений вместо 12 696. В 2.4 раза больше при том же объёме работы. И спички, как всегда, сошлись — сначала с независимыми бенчмарками, потом с вашими же цифрами в комментах. Теперь вспомним, что было до этого. Fable 5, а потом и Sonnet 5 — это была попытка содрать с рынка больше денег. Все мы знаем, что компания убыточна и пытается заработать деньжат, но попытка была крайне мерзкой: подкрученный токенайзер и запуск супердорогой модели. Цифры это подтверждают: по замерам Artificial Analysis одна задача на «подешевевшем» Sonnet 5 обходится в $2.29 против $1.20 на старом Sonnet 4.6. И тут Китай ответил. Шестнадцатого июля вышла Kimi K3, которую я и сам успел потрогать: $0.94 за задачу против $2.75 у Fable 5 — втрое дешевле при сопоставимой производительности. У Дарио, конечно, загорелось. И ровно через восемь дней срочно пришлось выпускать Opus 5, который оказался и дешевле, и лучше — $5/$25 против $10/$50 и почти то же качество. Ровно то, чего все ждали. Просто нормальная рабочая модель, которая не пытается содрать с тебя больше денег, а нормально выполняет свои задачи. Охренеть, правда? Fable 5 я с тех пор не включал ни разу — в выгрузке за три недели ровно ноль. Нахрена козе баян, если Opus делает то же самое вдвое дешевле. И это не мои фантазии: Bernstein пишет прямым текстом, что лаборатории «начали ценовую (лимитную) войну», а OpenAI следом срезала цены на GPT-5.6. Кстати, про убыточность бедных компаний тоже интересно: SemiAnalysis насчитал Anthropic миллиард операционной прибыли за третий квартал при маржинальности API выше 80%. Резали, получается, не от бедности. Вот как не хочется в очередной раз демонизировать большие компании, но оно как-то само получается — пока жареный китайский петух не клюнет Дарио Амодея в темечко, он не почешется. Ну будем надеяться, что система конкурентных сдержек и противовесов продолжит работать и дальше. А не до первого обновления в команде маркетологов, которые тоже придумают новый гениальный план, как содрать с пользователей побольше денег. Тем более повод для паранойи есть: щедрое промо +50% к недельным лимитам действует до 19 августа. Девять дней. А вы заметили улучшение с переходом на Opus 5? Пишите в комментариях. Всех обнял, нескончаемых лимитов, ваш - Nerual Dreming ❤️
🎬 Maestro ● локальная студия видео, картинок и музыки: один промпт — готовый клип ● EN ● by Blizaine Ссылка на GitHub: Blizaine/Maestro Автор: Blizaine (GitHub) Дата обновления: 6 августа 2026 Версия: 1.6.1 Категории: #видео #картинки #музыка #Pinokio #локально Платформа: Windows 10/11, Linux — установка в один клик через Pinokio Язык интерфейса: EN Совместимость: только NVIDIA CUDA (AMD и macOS не поддерживаются) Системные требования: от 6 ГБ видеопамяти (рекомендуется 24 ГБ), 16 ГБ ОЗУ, 150 ГБ на диске 🖥 Описание софта Открытые видеомодели давно обогнали платные сервисы по возможностям, но добраться до них можно было двумя путями: собирать паутину из нод в ComfyUI или ковыряться в командной строке. Maestro выбирает третий: обычное окно с кнопками и ползунками, где уже собрано всё — MiniMax H3 со звуком, LTX-2.3, Wan, Hunyuan, Flux 2, ACE-Step. Ставится одной кнопкой из Pinokio, при первом запуске сам щупает видеокарту и подбирает настройки. А главный козырь — режим «Режиссёр»: кидаешь музыкальный трек или пишешь историю, и локальная нейросеть сама раскладывает всё на кадры и собирает готовый клип. 😬 Что умеет Maestro 🛑Режиссёр, клип под музыку: разбирает твой трек по темпу, куплетам и припевам, расставляет склейки точно на доли, распознаёт и разделяет голоса — можно дать имя каждому певцу и снимать кадры адресно 🛑Режиссёр, короткометражка: пишет сценарий с именованными героями и диалогами, держит их внешность от кадра к кадру, ползунок темпа задаёт частоту склеек 🛑Всё это можно запустить одной кнопкой от начала до конца, а можно вмешаться на каждом шаге и переписать 🛑 Мозг локальный и бесплатный: сам качает Gemma 4 4B (~600 МБ), цепляется к видеокарте и выгружается через минуту простоя, чтобы не занимать память. Есть варианты пожирнее — Gemma 4 26B/31B, Qwen3.6 27B 🛑 Студия — ручной режим: видео с родным синхронным звуком, картинки Flux 2 Klein 9B и Krea 2, озвучка Qwen3 TTS, музыка ACE-Step, звуковые эффекты MMAudio 🛑 Монтаж: переснять кусок с новым промптом, дорисовать кадр за границы, перекрасить героя или сцену сохранив движение камеры, и Recast — подменить людей в готовом видео на других персонажей, даже в групповых сценах 🛑 Ролики любой длины: скользящее окно, склейка клипов внахлёст, вживление кадров, чтобы лицо героя не поплыло 🛑 Встроенный магазин CivitAI: ищешь LoRA, ставишь в один клик, и нейросеть тут же пишет к ней инструкцию — что она делает, примеры промптов и рекомендуемый вес, который подставляется сам 🛑 Автотюн подбирает профиль, квантование и запас видеопамяти. Если генерация упала по памяти — сверху появится плашка с готовым исправлением в одно нажатие 🛑 Рабочие пространства под разные проекты, три темы оформления со светлым и тёмным вариантом, журнал всех прогонов Режиссёра — любой кадр можно перегенерить, не запуская всё заново 💿 Установка и запуск ⁍ Поставить Pinokio ⁍ Вкладка Discover → найти Maestro (или Download from URL и вставить адрес репозитория) ⁍ Нажать Install — лаунчер сам создаст окружение, поставит torch и соберёт интерфейс ⁍ Нажать Start, дождаться кнопки Open Web UI ⁍ Модели качаются при первой генерации — на это уйдёт 10–20 минут ⁍ Обновляется кнопкой Update в лаунчере ⭐️ Поставить звезду на GitHub 📦 Страница в каталоге Pinokio 💬 Обсудить в нашем чате 👾 РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ
🍿 MiniMax H3 — открытые веса: видео со звуком генерируется у тебя на компьютере 3 августа MiniMax выложила веса модели, которая стоит за Hailuo. Это не очередной видеогенератор: 33.1B dense-трансформер держит в одном контексте текст, картинки, видео и аудио, а на выходе даёт видео со стерео-звуком за один проход. Звук не приклеивается потом отдельной стадией — он рождается вместе с кадром. До сих пор ни одна открытая видеомодель так не умела: у Wan звука нет вообще, у LTX он отдельным этапом. Что открыли Два чекпоинта H3-Base. FL2VA — генерация из текста, из первого кадра, из последнего или из первого и последнего сразу. Ref2VA — по референсам: до 9 изображений, 3 видео и 3 аудиодорожек в одном запросе. Локально это 768p, 4–15 секунд, 24 fps, стерео 32 kHz. Апскейл до 2K и препроцессор промптов остались закрытыми, они только в API. Сколько нужно видеопамяти Полная BF16 — 62–66 ГБ, это для серверов. Дальше начинается интересное: ▪️ прунед INT8 — 21 ГБ, влезает в 3090 и 4090, лучшее качество для домашней карты ▪️ INT4 — 11.3 ГБ, для 12–16 ГБ карт ▪️ GGUF Q8_0 — 21 ГБ, Q4_0 — 11.4 ГБ ▪️ GGUF U16G — 15 ГБ, специально собран под 16 ГБ видеопамяти и работает быстрее Q4 ▪️ NVFP4 — только для Blackwell (5090) Минимальный комплект скачивания — 42.5 ГБ против 123.6 ГБ в полной точности: около 13B параметров сидят в AdaLN-ветках, и при инференсе их грузить не нужно. С выгрузкой в оперативную память модель заводится даже на 3060, но там нужно много RAM. На 4090 дефолтный прогон text-to-video занимает примерно 100 секунд, Sage Attention ускоряет почти вдвое. Не забудь: кроме самой диффузионки нужен текстовый энкодер Qwen3-VL-32B (25–27 ГБ в INT8) и два VAE — видео 5.2 ГБ и аудио 605 МБ. В 24 ГБ всё одновременно не поместится, ComfyUI выгружает энкодер после кодирования промпта. ComfyUI поддержал в день релиза — нужна версия 0.30.0 или новее, добавлены четыре ноды и шесть готовых воркфлоу. Лицензия жёсткая. Из разрешённых территорий исключены США, ЕС, Великобритания и Южная Корея, причём запрет распространяется и на результаты генерации. Коммерческий продукт обязан показывать надпись «MiniMax H3». При выручке выше $20 млн в год нужно отдельное письменное разрешение MiniMax. Ссылки 🔹 Официальные веса: huggingface.co/MiniMaxAI/MiniMax-H3 🔹 Репак под ComfyUI: huggingface.co/Comfy-Org/MiniMax-H3 🔹 GGUF: huggingface.co/molbal/MiniMax-H3-GGUF 🔹 GGUF (альтернативный): huggingface.co/Abiray/MiniMax-H3-GGUF 🔹 Кванты INT4/INT8/NVFP4: huggingface.co/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot 🔹 Гайд ComfyUI: docs.comfy.org/tutorials/video/minimax/minimax-h3 🔹 Рецепт vLLM: recipes.vllm.ai/MiniMaxAI/MiniMax-H3 В ролике — то, что нагенерировали обычные люди на своих видеокартах за первые сутки после релиза. 🎯 НЕЙРО-ПУШКА ● НОВОСТИ И ОБЗОРЫ НЕЙРОСЕТЕЙ
🎙 CrisperWhisper 2.0 ● распознавание речи дословно, с точностью до слова ● EN ● by Nyra Labs Ссылка на GitHub: nyrahealth/CrisperWhisper Автор: Nyra Labs (nyra health) Дата обновления: 27 июля 2026 Версия: 2.0.1 (PyPI) Категории: #ASR #речьвтекст #субтитры #Whisper Платформа: Windows / Linux / macOS, ставится через pip Язык интерфейса: EN (Python API) Совместимость: NVIDIA CUDA через CTranslate2, либо PyTorch — включая голый CPU Системные требования: четыре размера — turbo / small / medium / large, квантование float16 и int8_float16 🖥 Описание софта Все системы распознавания речи молча решают за вас один вопрос: записывать то, что человек сказал, или то, что он имел в виду. Решают неосознанно — как получилось в обучающих данных, и каждый раз по-разному. CrisperWhisper 2.0 впервые делает этот выбор явным переключателем. Одна запись — две расшифровки: дословная, со всеми «э-э», запинками, оборванными словами и смехом, — и чистая, где числа, даты и почта уже приведены к человеческому виду. Плюс лучшие в индустрии пословные тайминги: 29,6 мс средней ошибки границы слова против 64,8 мс у WhisperX. 😬 Что умеет CrisperWhisper 2.0 🟠 Два режима одной командой: verbatim — каждый филлер, повтор, заикание и фальстарт; intended — чистый читаемый текст 🟠 Пословные тайминги 29,6 мс на читаной речи и 41 мс на разговорной — первое место, обгоняет Grok, ElevenLabs Scribe v2, Deepgram и WhisperX 🟠 Детекция запинок 87,8 F1 в среднем по десяти языкам. Для сравнения: ElevenLabs Scribe v2 — 79,2, Deepgram Nova-3 — 37,8, AssemblyAI Universal-3 Pro — 30,5, прошлая версия CrisperWhisper — 64,8 🟠 Verbatimize — уникальная штука: даёте аудио и уже готовую чистую расшифровку, модель вставляет в неё ровно те запинки, что реально звучат. Узнаваемость редких слов взлетает с 6,8% до 96,1% против повторной расшифровки с нуля 🟠 Длинное аудио без швов: каждое окно продолжает уже расшифрованные слова, поэтому на стыках не пропадают и не задваиваются куски 🟠 Подавление галлюцинаций встроено в декодер и включено по умолчанию — та самая беда Whisper, когда он зацикливается и сочиняет текст на тишине 🟠 Спекулятивное декодирование: маленькая модель предлагает токены, большая проверяет — тот же результат в 1,3–1,4 раза быстрее 🟠 Оба режима за один проход, принудительное выравнивание готового текста по аудио, буст на нужные имена и термины 🟠 Мультиязычность на уровне обычного Whisper — оба режима работают на большинстве поддерживаемых им языков 💿 Установка и запуск ⁍ NVIDIA + Linux, самый быстрый путь: pip install "crisperwhisper[ct2]" ⁍ Windows, macOS или просто CPU: pip install "crisperwhisper[transformers]" from crisperwhisper import CrisperWhisperModel model = CrisperWhisperModel() result = model.transcribe("meeting.wav", language="en", word_timestamps=True) ⁍ Веса скачиваются с HuggingFace при первом запуске ⭐️ Поставить звезду на GitHub - звёзд уже больше тысячи 🌐 Онлайн демо - для тестирования в браузере 🤗 Модели на HuggingFace - четыре открытые и одна Pro по заявкам 💬 Обсудить в нашем чате 👾 РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ
👋 Project AIRI ● опенсорсная Neuro-sama, свой ИИ-компаньон на десктопе ● RU/EN/JP/CN ● by moeru-ai Ссылка на GitHub: github.com/moeru-ai/airi Автор: moeru-ai (GitHub) Дата обновления: 28 июля 2026 Версия: 0.10.2 Категории: #AIwaifu #VTuber #компаньон #опенсорс #локально Платформа: Windows (winget/.exe), macOS (brew/.dmg), Linux, браузер, мобилка (PWA) Язык интерфейса: RU / EN / 简体中文 / 日本語 / 한국어 Совместимость: NVIDIA CUDA + Apple Metal (десктоп); браузер — на WebGPU Системные требования: зависят от LLM — локально через Ollama/vLLM или облачный ключ 🖥 Описание софта Neuro-sama — знаменитая ИИ-вебтюберша, которая сама играет в игры и переругивается со зрителями в чате, но она закрытая: стрим кончился — и с ней уже не поиграть. AIRI переносит эту идею в опенсорс и отдаёт её тебе: собственный цифровой персонаж живёт на рабочем столе как тамагочи, видит твой экран, играет вместе с тобой и болтает голосом. Главное — всё можно поднять полностью локально: Ollama или vLLM за мозг, локальный Kokoro-TTS за голос, распознавание речи прямо в браузере, а картинка рендерится на WebGPU. Ни один байт не обязан улетать в облако; а не хочешь возиться с локальным — подключи Claude, GPT или Gemini. 🙌 Что умеет AIRI 🟣 Сама играет в Minecraft, Factorio и Kerbal Space Program (в планах — кооп в Helldivers 2) 🟣 Слышит тебя (распознавание речи и детекция голоса на клиенте) и отвечает синтезом — локальный Kokoro или ElevenLabs/Azure/OpenAI 🟣 Имеет тело — 3D-модели VRM и Live2D: моргает, следит взглядом, живёт своей жизнью 🟣 Общается в Telegram и Discord, помнит контекст (браузерная БД DuckDB/pglite прямо в WASM) 🟣 Десктоп жмёт нативные CUDA и Metal через candle от HuggingFace; есть браузер и телефон (PWA) 🟣 Мозги на выбор: Ollama, vLLM, SGLang локально — или десятки облачных провайдеров 💿 Установка и запуск ⁍ Windows — winget install MoeruAI.AIRI (или Scoop), либо .exe из Releases ⁍ macOS — brew install --cask airi, либо .dmg ⁍ Linux — пакеты из GitHub Releases ⁍ Браузер — открыть airi.moeru.ai (и поставить как PWA на телефон) ⁍ Мозг — указать локальный Ollama/vLLM или ключ облачного провайдера в настройках ⭐️ Поставить звезду на GitHub (их уже 44 000+) 🐱 Скачать релиз под свою платформу 💬 Обсудить в нашем чате 👾 РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ
🎬 OpenChatCut ● Опенсорсный локальный ИИ-видеоредактор: агент правит настоящий таймлайн ● EN, 简体中文 ● by 0xsline Ссылка на GitHub: https://github.com/0xsline/OpenChatCut Автор: #0xsline Обновлено: 21 июля 2026 Версия: 0.1.2 (в активной разработке) Категории: #AIvideo #видеомонтаж #ИИагент #MCP #opensource Платформа: #Windows 10/11 x64 + #macOS (Apple Silicon/Intel) Язык интерфейса: EN, 简体中文 Лицензия: AGPL-3.0 Системные требования: свои API-ключи (BYOK) для ИИ-функций; для ускоренного экспорта — NVENC (NVIDIA) или VideoToolbox (Mac) 🖥 Описание софта Свободная альтернатива платному ChatCut — видеоредактор, где разговорный ИИ-агент и профессиональный таймлайн живут в одном окне. Ключевая идея: агент не выдаёт «сгенерированный ролик, который уже не поправишь», а пишет реальные правки в дорожки, клипы, переходы, субтитры и эффекты внутри проекта. Дальше ты продолжаешь монтаж руками, отменяешь, версионируешь или передаёшь проект другому агенту. Проекты и медиа по умолчанию лежат локально (~/.openchatcut), API-ключи хранятся на стороне сервера, а не в браузере. 😬 Основные возможности Встроенный агент и внешние (Claude Code, Codex — по протоколу MCP) дёргают одни и те же инструменты редактирования: 🟣 Опиши задачу словами → агент читает проект → предлагает правки → пишет их на таймлайн 🟣 Каждая правка отслеживаемая и отменяемая (через команды EditorCore) 🟣 Один формат проекта — внешний агент и редактор не «разъезжаются» 🟣 Мультитрек: перемещение, обрезка, сплит, ripple, снаппинг, кейфреймы, маркеры, undo/redo 🟣 WebGL-эффекты, LUT, хромакей, зумы, переходы, кастомные шейдеры 🟣 Аудио: несколько дорожек, SFX, музыка, запись озвучки, авто-дакинг, выделение вокала 🟣 Монтаж по транскрипту: пословная расшифровка, резка текстом, сжатие пауз, спикеры 🟣 Субтитры: авто-генерация, стили, перевод, оверлеи, экспорт SRT 🟣 Motion Graphics: встроенные шаблоны в песочнице + генерация редактируемых MG-клипов 🟣 Генерация картинок, видео, речи, музыки и звуковых эффектов прямо в проект 🟣 Экспорт MP4 / аудио / субтитры / FCPXML + полный дамп проекта 🟣 Аппаратное ускорение H.264: NVENC на Windows, VideoToolbox на Mac, софт-фолбэк 💿 Установка и запуск ⁍ Скачать инсталлер с GitHub Releases: DMG (Apple Silicon/Intel) или Windows x64 ⁍ macOS-сборки пока без подписи — при первом запуске подтвердить вручную ⁍ Либо из исходников: git clone → npm install → cp .env.example .env.local → npm run dev → http://localhost:5199 (нужен Node.js 24) ⁍ В .env.local добавляешь только те ключи, что реально юзаешь — остальное работает локально Проект молодой и активно пилится (Product Hunt, AGPL). Если полезно — поставьте автору звезду на GitHub ⭐️, так проект проще найти другим 🙏 🌐 Сайт проекта: https://openchatcut.com 🐱 README: https://github.com/0xsline/OpenChatCut 📦 Скачать (Releases): https://github.com/0xsline/OpenChatCut/releases 💬 Обсудить в нашем чате 👾 РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ
без подписи
без подписи
без подписи
без подписи
🎬 Dub Studio 2.5 ● Дубляж и перевод видео + клон голоса + локализация текста на экране ● RU, EN, ES, PT, FR, ZH ● by NerualDreming Ссылка на GitHub: https://github.com/timoncool/dub-studio Автор: #NerualDreming Обновлено: 16 июля 2026 Версия: 2.5.1 (нативная, стабильная) Категории: #AIvideo #дубляж #voicecloning #TTS #перевод #opensource Платформа: #Windows 10/11 x64 Язык интерфейса: RU, EN, ES, PT, FR, ZH · дубляж на 100+ языков Место на диске: ~15 ГБ (качается при первом запуске) Системные требования: NVIDIA GPU от 12 ГБ VRAM 🖥 Описание софта Опенсорсный «CapCut для ИИ-дубляжа»: берёт любое короткое видео и переозвучивает его на другой язык — полностью локально и бесплатно, без облака и загрузок. Авто-анализ делает первый проход (распознавание речи, разделение спикеров, перевод, чтение текста на экране), а дальше ты в живом редакторе с превью правишь каждую реплику, голос, субтитр, плашку и заголовок. 🛠 Полностью переписал с нуля с Python на нативный стек Первая версия жила на embeddable-Python + torch + CUDA-wheels — тяжело, медленный старт, гигабайты зависимостей, ~30 ГБ на диске. Новая версия — чистый Rust + Tauri + нативные C++/CUDA-движки (GGUF/ONNX). Что это дало: 🟣 Ни одного Python-процесса в рантайме — один нативный процесс, быстрый старт, меньше VRAM 🟣 Настоящий установщик — .exe + .msi + портатив, а не «распакуй архив и молись» 🟣 Встроенный авто-апдейт — приложение обновляется само 🟣 Кнопка «Скачать всё» при первом запуске сама тянет модели, движки, CUDA-рантайм и ffmpeg 🟣 В 2 раза легче — ~15 ГБ вместо ~30, полностью портативно (ничего не пишет в профиль) 😬 И за это время добавилось прилично всего: 🟣 5 режимов: полный дубляж · закадровый (голос поверх приглушённого оригинала) · только субтитры · Funny-режим (Gemma переписывает сценарий и переозвучивает) · транскрипт+диаризация 🟣 Клон голоса оригинала (движок Higgs Audio v3), авто-кастинг разных голосов по спикерам или голос из пака 🟣 Мультиспикерная диаризация (NVIDIA Sortformer, до 4 голосов) — каждому спикеру свой голос 🟣 Текст на экране распознаётся (PP-OCR) и локализуется прямо на кадре — блюр оригинала + свой заголовок в подобранном стиле 🟣 Импорт готовых субтитров (SRT/ASS) — берём текст и тайминг из файла вместо распознавания; галочка «уже на языке перевода» → дубляж напрямую из них, без ASR и перевода 🟣 Мультиязычный экспорт — одно видео сразу на несколько языков, каждый наследует все твои правки 🟣 Выбор ASR-движка — Parakeet-TDT (GPU) или Whisper (можно на CPU), с выбором размера модели и кванта 🟣 26 стилей субтитров (караоке / по словам / hormozi / неон…), рендер прямо на твоём кадре в реальном времени 🟣 Сохранение проектов, поиск по сотням голосов и 100+ языкам, batch-обработка папок, живое превью ~0.17 с/кадр 🟣 100% оффлайн — ничего не уходит в облако 💿 Установка и запуск ⁍ Скачать установщик Dub.Studio_2.5.1_x64-setup.exe (рекомендуется — с авто-апдейтом) или портатив Dub-Studio-2.5.1-portable.zip ⁍ Запустить → на первом экране нажать «Скачать всё» (модели/движки/CUDA/ffmpeg тянутся автоматически, ~15 ГБ, один раз) ⁍ Единственное, что ставится руками — свежий драйвер NVIDIA. Путь до приложения — без кириллицы и пробелов. Я реально горжусь этим проектом. Это моё первое по-настоящему приложение — в виде .exe с нормальным установщиком, авто-обновлениями и всеми делами, а не «портатив-архив». Так что если не сложно — поставьте звёздочку на GitHub ⭐️, мне будет очень приятно, а другим будет проще найти проект 🙏 🌐 О проекте + видео до/после 🐱 README на русском языке 📦 Скачать установщик или Portable (.zip) 💬 Обсудить в нашем чате 👾 РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ
✂️ AutoShorts ● авторезка длинных видео в вертикальные шортсы ● Rust/Tauri Признаюсь честно: такую штуку я и сам давно хотел собрать — авто-нарезку подкастов и стримов на шортсы, — да руки всё не доходили. А тут захожу в тренды GitHub, и вот оно, готовое, да ещё и на моём уже любимом стеке: Tauri 2 + Rust. Приятно, что не один я подсел на Раст 😊 Возможно, форкну проект под свои задачи, как только добью портирование Dub Studio. А пока — рассказываю, что это, и предлагаю заценить и потестить. 🖥 Описание софта AutoShorts — локальное десктоп-приложение (не веб-сервис!), которое превращает часовую запись — подкаст, интервью, стрим, вебинар — в пачку готовых вертикальных клипов 9:16. Само расшифровывает речь, ищет «цепляющие» моменты, ранжирует по вероятности «залететь» и нарезает вертикалки. Конвейер «длинное → короткое» на одном экране. 😬 Как устроен пайплайн 🔸 Импорт — закидываешь видео или аудио. 🔸 Звук + транскрипт — Deepgram (облако) или локальный Whisper. 🔸 Поиск моментов — LLM находит хуки, эмоциональные пики и острые цитаты, оценивает «виральный потенциал» (в UI — % совпадения). 🔸 Нарезка — авто-центр-кроп в портрет 9:16, H.264, через нативный ffmpeg → готовые mp4. Локально или в облаке — на выбор 🔸 Полный офлайн: Ollama (LLaMA 3.2 3B / Qwen 2.5 3B/7B) + локальный Whisper. 🔸 Облако: DeepSeek (дёшево, рекомендуют авторы) или Claude (лучшие хуки) + Deepgram. ⚠️ Честная оговорка Офлайн-режим есть, но авторы сами предупреждают: маленькие локалки (3B–7B) слабее в поиске моментов — не хватает контекста и точности с таймкодами. Для качества советуют облачный DeepSeek (доли цента за прогон). «Локальность» тут прежде всего про приложение и хранение; Whisper и история — честно офлайн. 💿 Ставится нативно, на всё 🔸 Windows — .msi / портативный .exe 🔸 macOS — .dmg (Apple Silicon и Intel) 🔸 Linux — .deb / .AppImage Требование одно — FFmpeg и FFprobe в PATH. 🔗 GitHub: JayWebtech/autoshorts ⭐️ Зашло — поставьте звезду проекту. 👾 РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ
Походу, Питон — всё 👩💻 Всем привет! В момент субботнего вайбкодинга я неожиданно понял, что Питон — всё. Ну, не совсем прям всё, но уже всё. Почему? Потому что я сидел и портировал свои последние питон-поделки на Rust + Tauri. А почему? Потому что это проще, быстрее и надёжнее. Когда я собирал портативку Higgs Ultimate, я не испытал ни одной из проблем, которые обычно ловлю при сборке питона: не ебался с venv и окружениями, не было ни намёка на Градио, который заебал уже сам по себе, не было нелепых тупняков с версиями. Всё просто разобралось, поменялось и собралось обратно. А ведь мне, как вайбкодеру, вообще пофиг, на чём вайбкодить — лишь бы быстро увидеть результат и потыкать пальцами. Так вот: Rust + Tauri закрывает всё то же самое, что раньше закрывал мой стек Питон + Градио. Только быстрее, приятнее и надёжнее. Но это я уже говорил 😄 Может, конечно, я просто окрылён опытом разработки на новом стеке. А может, Питон уже и правда всё. Какие у него по факту остались преимущества перед тем же Растом — при условии, что я не знаю ни того языка, ни другого? То-то же 😏 Сейчас вот портирую Dub Studio на Rust + Tauri — и, как будто бы, она станет работать в разы быстрее, сборка станет меньше размером, надёжность вырастет, и всё будет в одном файле. Посмотрим, как оно выйдет в реальности. А какие мысли у вас? Меняли ли вы язык своих вайбкодинг-поделок в последнее время? Делитесь в комментах 👇 Всех обнял, увидимся на стриме всегда ваш - Nerual Dreming ❤️
🎙 Higgs Ultimate 0.4.0 — транскрипт, диаризация и голоса из любой записи Большое обновление, и оно уже доступно: https://github.com/timoncool/Higgs-Ultimate/releases/tag/v0.4.0 Что нового: 🆕 Вкладка «Транскрипт и диаризация» — закидываешь аудио или видео (или пишешь с микрофона) и получаешь транскрипт с разбивкой по спикерам: кто и когда говорит (до 4 голосов), тайминги по словам, прослушивание любого куска, экспорт в .txt и .srt. 🎭 Голоса из спикеров в один клик — главная фича релиза. Кнопка «Сделать голос» рядом с любым спикером: приложение само нарежет его самые чистые реплики, соберёт референс с транскриптом и сохранит готовую персону в галерею. Понравился голос из подкаста, фильма, собственной записи — через 3 секунды им уже можно озвучивать. ✨ Очистка голоса — вокал-сепарация референсов перед клонированием на модели Mel-Band Roformer (текущий SOTA по разделению вокала, нативный C++ движок, на CUDA работает в ~26 раз быстрее реального времени). Музыка и шум из референса убираются — клон цепляется за чистый голос, а не за подложку. Тумблер включён по умолчанию. ⚡️ Новый движок распознавания речи — Parakeet переехал на ONNX Runtime: транскрипция стала на 36% быстрее, модель похудела на 270 МБ, появились пословные тайминги. Зачем меняли движок? Ради диаризации: определение спикеров есть только в новом рантайме, а на нём стоят все фичи этого релиза. То, что стало ещё и быстрее/легче — приятный бонус. ⚠️ Важно для тех, кто обновляется с 0.3.x: модель распознавания Parakeet нужно перекачать один раз (~670 МБ — приложение само предложит при первом использовании). Модель Higgs и все ваши голоса переносятся без изменений, ничего не теряется. 📦 Скачать: Portable-версия (рекомендую), setup.exe или MSI — всё в релизе. 💡 И совет: на GitHub у любого любимого софта можно нажать Watch → Custom → Releases — и уведомления о новых версиях будут приходить сами 😉 💬 Обсудить в нашем чате 👾 НЕЙРО-СОФТ - делаем нейросети доступнее
без подписи
без подписи
без подписи