Антон Фомин | про ИИ AI
СтатистикаВаш гид в мире передовых технологий и полезных советов для улучшения жизни! ▪️Знаю всё про технологии, нейросети и инновации ▪️ Расширу ваши знания и навыки ▪️ Внедряю ИИ в бизнес и увеличиваю 💸 Нужна консультация, пиши @fominlive
- Последний пост
- 18:41
- Последнее чтение
- 03:44
- Постов за неделю
- 25
- Всего постов
- 353
- Тип
- открытый
- Язык
- русский
- Категория
- Бизнес
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 589
- 1/48двое суток
- 674
- 1/72трое суток
- 728
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Если вы всё ещё собираете ИИ-видео по кусочкам, накладывая саунд-дизайн в сторонних программах под третий эспрессо - пора выдохнуть. FLUX 3 уже успел обжиться в пайплайнах креаторов и уверенно закрепиться на втором месте мирового рейтинга видеомоделей (Video Arena), уступая лишь закрытым студийным гигантам, но давая им колоссальную фору в свободе эстетики. Это не просто генератор посредственных видео, а инструмент с породистой кинематографичной картинкой и нативным звуком. В каких аспектах модель реально тащит: 🪼Честная физика и свет: FLUX 3 не «плывет» в пространстве — блики на мокром асфальте, складки шелка, тени от жалюзи и плотная фактура ткани рендерятся без мыла и пластикового блеска. 🪼Живая микромимика и лица: в отличие от большинства генераторов, где лица людей застывают в зловещей долине, модель отлично держит естественные взгляды, полуулыбки и сложные эмоции крупным планом. 🪼Нативный саунд-дизайн: шум прибоя, приглушенный диалог, шаги по гравию или гул винтажного аналогового синта прописываются прямо в текстовом промпте и синхронизируются с кадром в один проход. 🪼Длинная дистанция: хронометраж до 20 секунд с сохранением целостности сцены и логики движения камеры. Ниже инструкция как запустить локально, но нужно топовое видео. Или на Fal.ai: после авторизации дает 5 бесплатных генераций FLUX 3 в сутки (Draft-режим, 720p со встроенным звуком) с обновлением лимита каждые 24 часа. Мне второй вариант больше нравится 😀 не хочу сжечь комп 😂 Что нужно для локального сетапа 🪼GPU: NVIDIA RTX с 16–24 ГБ VRAM (начиная от RTX 4070 Ti / 3090 и выше). 🪼RAM: от 32 ГБ. 🪼Диск: быстрый NVMe SSD (от 50 ГБ под веса, VAE и кэш). Пошаговая настройка FLUX на компьютере 🪼Установите ComfyUI Рекомендуется портативная сборка Скачайте архив ComfyUI Portable с официального репозитория GitHub и распакуйте его в корень быстрого NVMe-диска (например, D:\ComfyUI). 🪼Подключите ComfyUI-Manager Откройте терминал в папке ComfyUI_windows_portable\ComfyUI\custom_nodes. Выполните команду: git clone https://github.com/ltdrdata/ComfyUI-Manager.git Запустите интерфейс через run_nvidia_gpu.bat. В правом нижнем углу появится панель Manager. 🪼Скачайте веса модели и энкодеры Потребуется доступ к Hugging Face Через менеджер моделей или вручную загрузите файлы в соответствующие директории: Чекпоинты/диффузионные веса FLUX 3 — в ComfyUI/models/diffusion_models/ или checkpoints/. Текстовые энкодеры (CLIP L и T5 XXL) — в ComfyUI/models/clip/. VAE — в ComfyUI/models/vae/. 🪼Загрузите готовый Workflow Перетащите .json-файл шаблона рабочего пространства (Text-to-Video или Image-to-Video) прямо в окно браузера с открытым ComfyUI. Если блоки подсвечиваются красным, нажмите Manager -> Install Missing Custom Nodes, установите недостающие ноды и перезапустите интерфейс. 🪼Настройте промпт и запустите рендер Пропишите в промпте визуальный план, движение камеры и звуковую дорожку. Выставьте разрешение (для черновых тестов оптимально 720p) и частоту 24 fps. Нажмите Queue Prompt и дождитесь готового MP4-файла. Если сложно просите агента настроить и помочь.
Если вы до сих пор создаёте видео в нейросетях по принципу «ну я примерно объясню, что хочу» — этот пост для вас 😄 Я собрал свой небольшой гайд по работе с Seedance 2.5 — от референсов до готового промта. И вот что, на мой взгляд, реально влияет на результат 👇 1. Референсы — это база. Seedance может работать с большим количеством референсов, поэтому не ограничивайтесь одной картинкой персонажа. Я рекомендую отдельно подготовить: — лицо крупным планом, в хорошем качестве; — персонажа в полный рост; — одежду, причёску, аксессуары и другие важные детали; — предметы, автомобили и другие объекты из сцены; — элементы окружения. Причём я бы не делал классическую «раскадровку персонажа» на одном изображении. Гораздо лучше дать нейросети отдельные понятные референсы. 2. Раскадровка сцен тоже нужна. Но не надо рисовать 20 кадров на 10 секунд 😂 Ориентир — один кадр примерно на 2–3 секунды. Так нейросети проще понять последовательность действий и ключевые моменты сцены. 3. Хотите нормальную русскую озвучку? Есть один интересный лайфхак. Пишите: «Персонаж говорит на украинском» А сам текст реплики пишите на русском. Например: Персонаж говорит на украинском: «Идём, у нас мало времени». Так у меня результаты с русской речью получались заметно лучше. 4. Промт лучше писать структурированно. Не нужно писать огромную кашу из мыслей. Разделяйте промт примерно так: Сцена → персонаж → действия → камера → свет и стиль → речь → длительность. Чем понятнее вы объяснили нейросети, что именно должно происходить, тем меньше потом придётся исправлять. 5. И не бойтесь писать промты на английском. Для сложных сцен я бы вообще рекомендовал формировать основной промт на английском, а уже внутри отдельно указывать язык реплики. И ещё важный момент: не перегружайте промт всем подряд. Нейросети не нужно знать историю создания вашей сцены на 15 страниц 😄 Дайте ей именно те детали, которые критичны для результата. И да - я подготовил файл, который помогает формировать хорошие промты. Его можно просто загрузить в свою нейросеть, описать, что вы хотите получить, и он поможет собрать промт по правильной структуре. Ссылка 🪼 ТУТ Сохраняйте пост, если работаете с генерацией видео. Думаю, ещё не раз пригодится 🚀
без подписи
без подписи
Alibaba продолжает разносить open-source. Ребята дропнули веса линейки Qwen3.8, и мимо этого проходить нельзя. Что забираем на свои машины: 🪼Qwen3.8-27B — идеальный размер для локального запуска. Мультимодальная, видит картинки, в задачах с кодом и текстами уделывает Qwen3.7-Plus. 🪼Контекст: база 262k токенов с расширением до 1 миллиона. 🪼Лицензия: Apache 2.0. Никаких ограничений, забираем в коммерческие пайплайны и пет-проекты. Для тяжелых серверных агентов они параллельно выкатили MoE-монстра 2.4T-A95B на 2.4 триллиона параметров (уровень флагманской Max), но наш выбор под рабочие станции — именно 27B. Качаем веса и тестим в связке с локальными скриптами. Ссылка 🪼 ТУТ
Убиваем рутину на монтаже: облачный комбайн VEED.IO ⚡️ Если вы регулярно генерируете короткий видеоконтент, держать на компе громоздкие редакторы ради базовых правок — оверхед. На радары попал VEED.IO - браузерная студия, плотно нашпигованная рабочими ИИ-пайплайнами. Что под капотом из интересного: 🪼 Magic Cut: алгоритмический тримминг пауз, оговорок и мычания. 🪼 AI Eye Contact: нейросетевой рендеринг взгляда (актуально, если читаете суфлер сбоку от линзы). 🪼 Субтитры: распознавание речи с точностью до 98.5%, авторасстановка эмодзи и динамическая анимация слов. 🪼 Voice Cloning & Dubbing: клонирование голоса + липсинк на 125+ языках для выхода на глобал. 🪼 Text-to-Video: встроенные аватары для генерации объяснялок без камеры. Работает шустро, ресурсы системы не жрет, экономит часы ручного труда. Затестить точно стоит. Но я монтирую много, поэтому стоит родненький CapCut 😀
ChatGPT для Mac теперь буквально следит за вашими руками 👀 OpenAI дропнули масштабный апдейт для пользователей macOS - функцию Computer History. Что это значит на практике? Раньше, чтобы нейросеть помогла с задачей, нужно было копировать текст, прикреплять файлы и расписывать предысторию. Теперь ChatGPT работает как личный ассистент за вашим плечом. Он анализирует контекст: открытые программы, переключение между вкладками, клики и набор текста. Главные фишки: 🪼Мгновенный возврат в поток. Спросите: «На чем я остановился до созвона?», и бот восстановит логику работы. 🪼Таймлайн и авто-навыки. Система отслеживает повторяющуюся рутину и сама предлагает превратить ее в автоматизацию. 🪼Приватность под контролем. Записи экрана и звука нет. Данные живут на диске до 48 часов, а любые сайты (например, онлайн-банки) можно занести в бан-лист в один клик. Фича уже доступна для Pro, Business и Enterprise. Выглядит как серьезный шаг к полноценным автономным агентам, которые реально разгружают голову, а не просто отвечают текстом в чате.
Pika методично собирает комбайн полного цикла для генеративного видео. Выкатили Pika Audio - 4 модели под одним API-ключом. Коротко по цифрам и архитектуре: 🪼Pika Music: $0.015/мин (текст, референс, текст песни, клонинг вокала). 🪼Pika Speech: $0.01/мин с быстрым клонированием голоса (заявлено до 9х дешевле ElevenLabs). 🪼Pika SFX: $0.0002/сек (шумы окружения, фоли). 🪼Pika Soundtrack: $0.005/сек — video-to-audio модель, которая читает картинку и генерит синхронный саунд-дизайн. Для тех, кто строит автогенерацию роликов через n8n, Make или собственные скрипты - это мастхэв. Меньше костылей с синхронизацией сторонних API и кратно ниже себестоимость рендера готового шота. Ссылка 🪼 ТУТ
Самая лучшая проверка видеомодели. Классика с Уиллом Смитом, поедающим спагетти 😂
ChatGPT теперь официально заменяет джуниор-монтажера 🎬 Нашел пушечную штуку — ChatCut. Это плагин, который встраивает полноценный видеоредактор прямо в ChatGPT. Просто закидываешь исходники и пишешь промпт: сервис сам чистит звук, вырезает паузы, накидывает субтитры, генерит B-roll кадры и даже моушн-графику. А самое приятное — таймлайн открытый, любой элемент можно подвигать руками. На старте бесплатно насыпают 20 кредитов на тест. Забирайте в закладки, чтобы не тратить часы на склейки! Ссылка 🪼 ТУТ
Разрабы из Minimax выкатили Music 3 в open-source. Кажется, Suno пора напрячься ⚡️ Китайцы продолжают радовать открытыми весами и бесплатными решениями. На этот раз прилетел жесткий конкурент для всех коммерческих AI-музыкантов. Технические фичи релиза: 🪼Длина генерации: до 10 минут за один заход. 🪼Качество аудио: почти полное отсутствие фазовых искажений и цифрового «песка». 🪼Промптинг нового уровня: раздельные инпуты под общий вайб, параметры вокала и инструментовку. 🪼Лингвистика: нативная поддержка русского языка. 🪼Доступность: веса на Hugging Face + бесплатный Spaces для тестов. Инструмент идеален как для быстрого саунд-дизайна и фоновой музыки под контент, так и для экспериментов с полноценными треками. Залетайте в веб-демку, пока комьюнити не перегрузило инференс. Сама модель лежит ТУТ
без подписи
без подписи
без подписи
без подписи
без подписи
Google штампует Flash-модели со скоростью света. Разбираем свежую Gemini 3.7 Flash ⚡️ Кажется, в офисе Google кто-то зажал кнопку «Выпустить апдейт». Прошло ровно три недели с релиза 3.6 Flash — и вот нам уже выкатывают Gemini 3.7 Flash. Давайте честно: сначала кажется странным выпускать минорные апдейты так часто. Но цифры и тесты показывают, что под капотом действительно провели серьезную работу, особенно в прикладных задачах. Что внутри? 💻 Плотный буст в кодинге. Тест FrontierCode вырос с 34,4% до 43,6%, а DeepSWE подскочил до 65,3%. В рейтинге WebDev Arena модель взяла 1588 Elo. Для повседневной разработки — ощутимая разница. 🎨 Верстка интерфейсов с нуля. Модель научили понимать дизайн-системы и скриншоты. Даешь ей картинку лендинга — она выдает рабочий интерактивный код. На демках она вообще собирает 3D-игру в связке с Nano Banana за один запрос. 📄 Многошаговые агенты и PDF. В тесте AutomationBench результат вырос почти вдвое (до 30,4%). Теперь модель гораздо надежнее выполняет цепочки задач без сбоев. 🤖 Основа для Gemini Spark. Модель уже управляет агентской рутиной в Google Workspace: мониторит почту, формирует отчеты и работает с файлами без постоянного пинга с вашей стороны. До конца года действует вкусный ценник: $0,75 за миллион входных токенов и $3,75 за выходные (с 2027 года цена удвоится). Ирония в том, что супермощных «тяжелых» Ultra-моделей мы давно не видели — кажется, с ними у Google все сложно, поэтому они решили завоевать рынок дешевыми и шустрыми версиями. Но для нас, как пользователей, это только плюс: софт стал дешевле, быстрее и умнее.
Аттракцион невиданной щедрости от Manus: почему сейчас стоит пощупать этого ИИ-агента 🧠 Кто следит за ИИ-рынком, наверняка помнит шумиху вокруг Manus. Агент позиционировался чуть ли не как убийца рутины: сам ищет, сам анализирует, сам пишет код и собирает сложные сводки. Но на старте у многих знакомство закончилось, даже не начавшись - тарифы кусались, а кредиты таяли буквально на глазах за пару несложных задач. Новость дня: до 25 августа Manus открыл бесплатный доступ. Буду с вами предельно честен: я не в секте фанатов этого сервиса. В мои ежедневные задачи он так и не вписался на постоянку. Но это не отменяет того факта, что под определенные ресерчи и автономные сценарии он чертовски хорош. Если вы до сих пор не трогали автономных агентов руками — это лучший шанс въехать в технологию без риска для кошелька. ⚠️ Важный дисклеймер: читайте их правила мелким шрифтом. В 20-х числах августа сервис планирует глобальную зачистку данных, поэтому все сгенерированные отчеты, файлы и важные результаты сразу выгружайте к себе на комп/диск. Тестируйте, пока открыто, и делитесь в комментах, как вам логика агента! Ссылка 🪼 ТУТ
без подписи
без подписи