Метаверсище и ИИще
СтатистикаЭто не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие. Для связи: @SergTsyp
- Последний пост
- 21:33
- Последнее чтение
- 09:42
- Постов за неделю
- 44
- Всего постов
- 80
- Тип
- открытый
- Язык
- русский
- Категория
- Криптовалюты
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 4 887
- 1/48двое суток
- 8 333
- 1/72трое суток
- 8 987
Медиана по постам, которые мы застали свежими и померили через сутки.
Посты
Pika Music Минимакс покусал Пику, она запустила собственное семейство аудиомоделей, и самая интересная тут(для меня) Pika Music - типаполноценный генератор песен в духе Suno/MiniMax Music. Все по моде. На вход можно дать обычный промпт, свой текст песни, референс голоса, музыкальный референс или всё это одновременно. На выходе - законченный трек длительностью до 6 минут. Pika утверждает, что 90-секундный трек модель генерирует в среднем за 6.21 секунды, примерно в 14.5 раза быстрее реального времени. Главный прикол - цена: $0.015 за минуту музыки. То есть 4-минутная песня стоит примерно 6 центов, шестиминутная - 9 центов. Pika заявляет, что Music получается до 10 раз дешевле "сопоставимых" музыкальных моделей. Пока модель доступна только через Pika API Club, но там уже есть нормальный веб-Playground, Заодно Pika выпустила Soundtrack, SFX и Speech Тут пробуем: https://dev.pika.art/models/pika/pika-audio/pika-music/playground Тут примеры: https://experiment.pika.art/blog/pika-audio-models @cgevent
#Нейропрожарка «Супер-Дружба» Автор: @Sergei_108 Мульт про ёжика Соника в стиле Pixar. Делал специально ко дню рождения 7-милетних племянников, с их участием в мульте. Это был первый опыт создания видео с сюжетом и героями. Понимаю, что ролик далёк от идеала). Консистентность персонажей немного плывёт, но для детей это непринципиально) Делал в марте и начале апреля. В основном Клинг 2.5 Турбо, Сиданс в открытый доступ только вышел и две сложные сцены по 15 сек. хотел сделать через него, но он упорно не хотел генерить сцены с Соником, даже по текстовому описанию. Пришлось делать в Клинге и потом склеивать до 15 секунд сцены. Пайплайн: 0. Создание карт персонажей Соника, Сони и Никиты на основе их фото в Nano Banana 2. 1. Сценарий в Qwen. 2. Раскадровка Nano Banana 2. 3. Промпты для видео Claude Opus. 3. Анимация Kling 2.5 Turbo. 4. Голоса реальные, клонированные через kikivoice: мой, Соника (взял для клонирования голос самого популярного актёра, который дублировал Соника, Михаил Тихонов), племянников: Сони и Никиты, Др. Роботника. 5. Стихи для песни написал Gemini. 6. Песня и музыка в Suno 5.5. 7. Монтаж и фоновые звуки CapCut. Понимаю, что достаточно сыро и криво, но это был первый опыт. Родителям племянников зашло даже больше, а у племянников была неоднозначная реакция, когда им это показали в лоб без предварительного объяснения: они стали оценивать и сравнивать со своей внешностью, стали говорить: типа у меня не такие волосы, голос и тп. В итоге мальчик не смог принять, а девочка сказала, что ей понравилось. Стоимость: чуть больше 3тр на подписку Клинг и токенов в Syntx. Сроки: делал полтора месяца в свободное время. @cgevent
видео или голосовое, без подписи
Вы будете смеяцца, но у нас новый видео генератор. И это просто конский монстр. По сравнению с ним Минимакс - это Stable Diffusion 1.5 на два килобайта. Итак MAGI-2 Preview - открытая unified audio-video модель на 114B параметров, построенная как очень мелкозернистый MoE. Единовременно активируется около 6B параметров, то есть примерно 5% всей ёмкости модели. Sand AI называет это Ultra-Fine-Grained MoE / MagiMoE. Модель одновременно работает с текстом, видео и аудио в одном Transformer backbone. Главная архитектурная фишка интереснее самого числа 114B. Backbone - **40 Transformer layers**, из них средние **36 слоёв MoE**, четыре крайних dense. Hidden width 3072 разбивается на **12 независимых head по 256 dimensions**. У каждого head собственный набор из **256 экспертов**, а на токен выбираются Top-6. То есть на одном MoE-слое потенциально существует 12 × 256 = **3072 маленьких expert-блоков**, но конкретный токен использует всего 72 из них. Это позволяет хранить огромное количество специализированных параметров, не прогоняя 114B целиком на каждом diffusion step. Сейчас заявлены T2V и I2V, причём звук генерируется совместно с изображением, а не приклеивается отдельной моделью после генерации. Выход пока жёстко ограничен 10 секундами. Референсов и редактирования нет. Генерация двухступенчатая: - base/preview: 512 × 896 - refiner: 1088 × 1920 - затем при необходимости output ресайзится до настоящих 1080 × 1920. А теперь праздник: системные требования Официальный MINIMUM(!): 8 × NVIDIA Hopper GPU. Типа 8×H100/H200. Общий размер весов - около 307 GB: - main preview transformer - 228 GB - Qwen3.5-27B text encoder - 56 GB - refiner - 14 GB - Stable Audio Open audio VAE - 5 GB - Wan 2.2 video VAE - 3 GB - Turbo VAE decoder - 2 GB. То есть полный зоопарк - особенно напрягает Stable Audio и древний ВАН. По счастию Монстр уже есть на Artificial Analysis. И среди open-weight video models with audio сейчас картина такая: 1. MiniMax H3 - 1192 2. MAGI-2 Preview - 1108 3. LTX-2.3 Fast - 958 Наверное можно расходиться, но впереди еще MAGI-2 distilled, которой нет. Ну и надо подсобрать тесты, пока мало примеров. А теперь самое главное - дешевая цена (в облаке): MAGI-2 Preview теоретически обходится Sand.ai примерно в $0.074 за 10 секунд 1080p, но официальную пользовательскую цену API за такой ролик Sand.ai публично не раскрывает. Более того, по идее это цена за distilled модель, которой пока нет. Cсылки: https://platform.sand.ai/ https://platform.sand.ai/docs/api-v2 https://platform.sand.ai/app/buy-credits https://sand.ai/blog/magi-2-preview https://github.com/SandAI-org/MAGI-2-preview https://huggingface.co/sand-ai/MAGI-2-preview https://artificialanalysis.ai/video/leaderboard/image-to-video @cgevent
Мемы с Уиллом Смитом и спагетти никогда не надоедают. покрал отсюда
Google выкатил Gemini 3.7 Flash Их прорвало что ли? Или летние нагрузки меньшие освободили GPU для тренинга? – Цена не изменилась: $0.75 / $3.75 за 1M токенов. Для сравнения: Claude Sonnet 5 – $2 / $10, GPT-5.6 Terra – $2 / $12 (он типа круче Луны) То есть Flash в 2.5–3 раза дешевле конкурентов. Но это промо-цена до конца 2026. С января – $1.50 / $7.50. Хах, тут каждые 2 недели выходят новые модели, а они рассказывают, что будет через 5 месяцев :) – FrontierCode 43.6% – лучший результат среди всех, включая Sonnet 5 и GPT-5.6. Огоняет флагманы конкурентов в production-коде – AutomationBench (автоматизация enterprise-процессов): 30.4% против 10.7% у Sonnet 5 – Длинный контекст: 97% на MRCR при 128k. – Понимание PDF (GDP.pdf): 34% – тоже лучший результат, хотя абсолютные цифры показывают, что до "решённой задачи" всем ещё далеко Слабые места тоже есть: агентские задачи (Terminal-bench 3.0, OSWorld) – GPT-5.6 заметно впереди, а в знаниевой работе (GDPVal) лидирует Muse Spark. Короче, перейти с 3.5/3.6 наверное стоит после тестов, для больших доков, обработок и кодовых баз должно быть норм. https://deepmind.google/models/model-cards/gemini-3-7-flash/
видео или голосовое, без подписи
видео или голосовое, без подписи
Кому в Требло? Приведу вот такой такой пост из коментов от Александра. Он обозначает довольно интересные плюсы Treblo и минусы Suno. Очень любопытно, особенно про датасеты. На днях стало интересно проверить, насколько у них (Требло) реально большая база. Спарсил список из 35 000 исполнителей по 6 странам (брал топы из last.fm, строго в порядке убывания популярности). По косвенным признакам понял, что метаданные для обучения они тянули из MusicBrainz. Сопоставил списки, чтобы вытащить все возможные варианты написания. Написал скрипт и аккуратно прогнал всю эту базу через их валидатор. По цифрам: из 35 000 артистов валидацию успешно прошли около 15 000. База действительно огромная. Даже когда скрипт дошел до самого конца списка и проверял глубокий андеграунд, процент узнавания держался в районе 40%. Судя по наличию одних артистов и отсутствию других, сам датасет они собирали где-то в 2022–2023 годах. Русскоговорящих исполнителей там сильно меньше, чем западных. Если из топа США пробивается около 90% имен, то из нашего сегмента от силы 30%. Но у такого гигантского датасета есть крутое преимущество. В отличие от Suno, у которого большинство треков страдает от одинакового мастеринга и шаблонных тембров, Treblo выдает сумасшедшее разнообразие в звучании. Этим платформа очень напоминает ранние версии Udio. Если правильно подобрать теги, можно вытащить всё что угодно: хоть хор балканских бабушек, хоть ритуальные богослужения (в Suno такое получить практически нереально). Правда, из-за такой всеядности и огромной базы нейронка гораздо чаще ловит звуковые артефакты и галлюцинации. Но за пределами моего списка лежат еще десятки тысяч рок-групп, финских метал-бэндов, блюзменов из 30-х годов и аниме-композиторов, чьи альбомы когда-то были выгружены в сеть и размечены в MusicBrainz. Так что, не удивлюсь, если количество артистов в их базе переваливает за 50 000. P.S. Вообще, учитывая, как бескомпромиссно они сожрали гигантские объемы защищенного копирайтом контента, ребята ходят по очень тонкой грани. P.P.S. Я не говорил, что Suno в принципе не может сгенерировать хор как таковой или какой-нибудь специфический жанр. Речь о том, что он очень скуден тембрально и текстурно. Suno выдает дистиллированный, прилизанный звук. У него всё звучит так, будто это записано в 2010/20-х на одной и той же аппаратуре. Грубо говоря, если попросить Suno написать гранж в стиле Nirvana, это будет звучать так, словно Курта Кобейна загнали в современную студию, дали новенькие блестящие инструменты из магазина, а сводил всё это дело модный поп-продюсер из 2010-х. А сразу за Нирваной в очереди в эту же студию стоят те самые балканские бабушки, чтобы записаться в тот же микрофон. Звучать они в итоге будут так же стерильно, как бэк-вокалистки Дуа Липы. Нет грязи, нет аутентичности пространства и времени. Примеры (текст просто эхолалия под языки тех регионов, смысла в нём нет): 1.mp3 Балканский хор. У Treblo слышна аутентичность региона, специфическое звукоизвлечение и народное пространство. Suno, возможно, взял бы специфичные для региона гармонии и узкое звукоизвлечение, но на этом всё. 2.mp3 Биг-бэнд в стиле 50-х. Звук похож на запись 50-х, с нужной сатурацией и артефактами, которая записана на оборудовании 50-х и снята с оригинальных носителей. В Suno такого винтажа не добиться, модель всё равно попытается сделать звук чистым и современным, максимум, искусственно добавит треск пластинки. Она возьмёт структуру, инструменты и аранжировки из 50-х, но звучать это будет как современный Big Band. 3.mp3 Африканский хор. Очень крутая детализация, там слышно характерное пощелкивание языков и артикуляцию. Suno бы свёл африканский хор к американскому госпелу. В общем, в Suno хор получится масштабным, но это будет скорее универсальный хор из голливудского трейлера с щепоткой каких-то вариативных характеристик. При этом я ни в коем случае не хочу сказать, что Suno плохой, а Treblo хороший. Они оба крутые. Просто Suno больше заточен под современный коммерческий продакшен и аранжировки, а Treblo лучше справляется с аутентичной фактурой @cgevent
Замузыку. Заумные мысли Я вот гляжу на новый Suno Studio 2, и странное чудится мне. Сейчас приведу аналогию с видеогенераторами, ибо некоторые из которых пыжатся изо всех сил, чтобы стать новым Премьером или Резолвом. Монтажка, таймлайн (в браузере это адъ), эффекты, переходы. В веб-монтаже нет никакого смысла, потому что на итоге юзеры понесут свой результат в Премьер, Афтер, ДаВинчи. Точно также как уносят картинки в Фотошоп для доводки. И в этом смысле горазд важнее, что можно подавать на вход в генератор, а не что получать на выходе. Максимальное разнообразие на входе, и унифицированный выход, идущий в монтажку\фотошоп. Чего хочется от генераторов: разборка на слои\стемы, редактирующие возможности (не в смысле монтажа, а в плане регенерации\инпайнта\екстенда\заполнения), послойная регенерация. И в этом смысле процесс идет. И таймлайн тут нужен для контроля генераций, а не для монтажа. А вот замашки на DAW\монтаж\эффекты можно пропустить. Ну и конечно, управляемость. И в этом смысле показателен следующий пост из коментов. @cgevent
Для конченых гиков MiniMax Music 3 в ComfyUI сейчас фактически дает два уровня генерации: AR: seed + CFG + top_k + duration ↓ hidden representation песни ↓ Flow/DiT: seed + steps + CFG + sampler + scheduler ↓ DAV/Flow-VAE ↓ audio Temperature/top_p пока отсутствуют, но это именно недостающие 10-30 строк sampling-кода, а не ограничение весов. Главное: официальный workflow связывает AR seed и DiT seed одним SeedNode. И в принципе seed и CFG можно развязать. Типа AR seed: 12345 DiT seed: 67890 Также: AR CFG 2.5 + DiT CFG 1.0 и AR CFG 1.0 + DiT CFG 2.5 Могут звучать сильно по разному. Но это уже дебри... @cgevent
Minimax Music 3. Open Source!! Музыкальная тема не отпускает, будем жечь дальше, хотя там вышла Gemini 3.7 Flash и GLM 5.3 Их позже обсудим. Для ботов: ACE < Minimax < Suno. Для тех, кто физическим не может в длинные тексты: MiniMax Music 3 - новая локальная open-weight модель, которая уже завелась в ComfyUI и умеет генерировать длинные полноценные песни с вокалом. Под капотом гибрид: 8B LLM на базе Qwen3-8B держит структуру трека, 0.6B LLM занимается локальными деталями, а Flow Matching + Flow-VAE превращают это в аудио. Теперь для гиков. Технически MiniMax Music 3 устроен заметно интереснее обычных audio-token моделей. Под капотом гибридная схема: 8B LLM на базе Qwen3-8B отвечает за длинную структуру трека, развитие куплетов, припевов и общую музыкальную логику; отдельный 0.6B LLM дорисовывает более локальные, покадровые акустические детали. После этого звук не декодируется напрямую из токенов: объединенные hidden states идут в 2.4B Flow Matching-модуль + Flow-VAE, которые уже синтезируют финальное аудио. Уже есть поддержка ComfyUI Официальный workflow MiniMax Music 3 сейчас выводит такие основные параметры: - Caption - стиль, BPM, тональность, вокал, инструменты, аранжировка - Lyrics - текст + структурные теги [Intro], [Verse], [Chorus], [Bridge], [Solo], [Outro] и т.д. - max_duration - длительность, до примерно 300 секунд - `seed` - есть. - tiled_decode - экономия VRAM при декодировании длинных треков. Самое главное: железо Не так все плохо, однако. MiniMax официально пишет: - full precision помещается менее чем в 24 GB VRAM - с automatic CPU offload расход GPU около 22 GB - с layer-by-layer streaming можно запустить даже на 8 GB VRAM, но заметно медленнее. Для ComfyUI уже есть три чекпойнта(на момент написания): - minimax_music3_dit_fp16.safetensors - minimax_music3_dit_int8_convrot.safetensors - minimax_music3_text_encoder_pruned_int8_convrot.safetensors Плюс отдельный VAE. Comfy прямо рекомендует INT8 + tiled decode для длинных песен на картах с нищебродской VRAM. Скорость 140 секунд музыки за примерно 125 секунд генерации в r/comfyui. То есть примерно около realtime(!!!!). Очень круто: длительность не абсолютно жесткая. У MiniMax авторегрессионная часть умеет выдать end-of-audio раньше лимита. В API max_new_tokens ограничивает максимум аудиофреймов, причем модель может закончить песню раньше. В ComfyUI max_duration работает аналогично как целевая/максимальная длительность. Плюсы: - вокал заметно лучше большинства предыдущих локальных/open моделей - композиции действительно похожи на законченные песни, а не на двухминутные бесконечные лупы - длинная структура держится прилично Минусы: Пока это в основном Text-to-Music. Нет нормального: - audio reference - song-to-song - cover/remix существующего трека - extend собственного аудио - replace section/inpaint - reference style через загруженный трек. И непонятки с обучением. А вот с промптами все нарядно - Structured Caption из трех частей: 1. Global Metadata - жанр, subgenre, BPM, key, scale, эмоциональная дуга, production profile. 2. Vocal Details - пол, тембр, манера, backing vocals, harmonies, эффекты. 3. Arrangement - инструменты, развитие по секциям, groove, bass, percussion, spatial FX. И отдельно lyrics с секционными тегами. Ссылки: https://docs.comfy.org/tutorials/audio/minimax/minimax-music-3 https://huggingface.co/MiniMaxAI/MiniMax-Music3 https://huggingface.co/Comfy-Org/MiniMax-Music-3 https://github.com/Comfy-Org/workflow_templates/blob/main/templates/audio_minimax_music_3.json https://github.com/Comfy-Org/ComfyUI/pull/15570 https://www.reddit.com/r/comfyui/comments/1vni9fq/minimax_music_3_is_live_in_comfyui_enjoy_state_of/ @cgevent
За Суно. Много. Бахнули Suno Studio 2.0 - большое обновление браузерной студии, которая теперь уже всерьёз пытается изображать полноценную DAW, а не просто место, где можно немного поковырять сгенерированный трек. Главная новость - нормальная работа с MIDI: его можно импортировать, записывать и редактировать прямо на таймлайне, подключать MIDI-клавиатуры и контроллеры, а сами MIDI-клипы использовать как промпт(!) для новой генерации аудио. То есть сыграл аккорды или мелодию - и Suno может на их основе продолжить партию или сгенерировать новый кусок. Есть musical typing с обычной клавиатуры, арпеджиатор и chord mode. Заодно Studio обросла вполне взрослыми инструментами: встроенный wavetable-синт, автоматизация параметров, EQ, компрессия, delay, distortion, reverb, включая sidechain compression и convolution reverb. Но главный аттракцион - Chat Bar в бете. Ему можно человеческим языком заказать новый звук, пресет синта, обработку вокала или вообще собственный эффект-плагин, который потом сохраняется в аккаунте. Чат понимает контекст текущего проекта и способен сам собрать цепочку обработки. Плюс обновили stem separation, можно импортировать свои аудиофайлы и стемы, экспортировать песню целиком, отдельные дорожки или выбранные участки. До Ableton или Logic, конечно, пока как до Исландии - например, сторонние VST-плагины Studio 2.0 пока не понимает. Но направление любопытное: Suno постепенно метит в AI-first музыкальную рабочую станцию. А теперь жиза. Доступ к Studio остаётся только у подписчиков Premier. Причём именно в Premier Сунченко запирает всю новую игрушку: Studio 2.0, MIDI, плагины, автоматизацию, Chat Bar, новые эффекты и DAW-интерфейс. В комплекте 10 000 кредитов в месяц, примерно до 2000 генераций песен, коммерческие права, приоритетная очередь и прочие возможности. При этом экспорт из Studio заявлен без лимитов по количеству и весьма приличный - multitrack/stems в 32-bit / 48 kHz. Кстати, за создание собственных плагинов через Chat Bar ПОКА не расходются кредиты. https://suno.com/blog/studio-2 https://suno.com/studio-welcome @cgevent
Рыбаков что-то знал... Там Suno Studio обновилсо. Завтра бахну. P.S. для названия нового музыкального стиля просто отлично, ящетаю... @cgevent
#Нейропрожарка Тизер к (существующему) короткому метру "MOTHER". (12 минут) Автор: Ник Костомаров В данный момент фильме поправляются мелочи и после хотим отправить на несколько ИИ фестивалей, поэтому пока не показываем публично. Цель: попробовать свои силы в качестве сценариста и режиссера + для студии проработать пайплайн создания подобных фильмов. Изначально была идея делать это на Клинге, Гугле, но сразу поняли, что генераций будет много, поэтому полностью отказались от платных и построили весь пайплайн на ЛТХ 2.3 Да, возможно он далеко не топовый, но зато бесплатный, поэтому генерить могли столько сколько было нужно. Были написаны инструменты автоматизации запускающие генерацию прямо из Нюка в комфи и обратно Картинки все генерились ГПТ. Все звуки, голоса и музыка ЭлевенЛаб. Липсинг везде родной. Признаюсь много было ошибок в начале, пока выстраивали, настраивали и т.д. Мое личное заключение - далеко от идеала. Но учитывая, что это мой первый проект + бесплатные модели + опыт полученный в процессе производства, доволен. @cgevent
Для Минимаксеров: ComfyUI Minimax-H3 FaceRefine Улучшатор маленьких лиц, которые обычно портятся. - tracks, crops, regenerates faces at native resolution to fix distance-blurring - YOLOv8 + InsightFace for identity-locked tracking - img2img latent injection + temporal denoise scaling - влезает в 12GB VRAM via GGUF. https://github.com/Carasibana/ComfyUI-H3-FaceRefine @cgevent
DeepSeek Harness DeepSeek официально выложили DeepSeek Harness (dsh) - свой open-source харнесс для AI-агентов. Главная идея у них буквально «everything is a plugin»: модель, инструменты, skills, сессии, sandbox, политика разрешений, хранение данных и даже интерфейс собираются как плагины. По сути это собственный аналог инфраструктурного слоя вокруг Claude Code / OpenCode / Codex-подобных агентов. Причем Harness напрямую связан с новыми DeepSeek V4. В официальной документации DeepSeek указано, что V4-Flash на coding/agent-бенчмарках тестировали именно через DeepSeek Harness в minimal mode, с max reasoning effort, top_p=0.95, temperature=1.0. Результаты у V4-Flash заявлены приличные: Terminal Bench 2.1 - 82.7, DeepSWE - 54.4, Toolathlon Verified - 70.3, DSBench-FullStack - 68.7. Уже можно запускать локально: npx @deepseek-ai/dsh web После этого поднимается Web UI на 127.0.0.1:3080. Есть и headless-режим, sandbox, shell/terminal tools, persistence, credentials, approval policy и возможность подключать другие модели через плагины. Пока статус Developer Preview. Одновременно выкатили V4 Pro из превью под лицензией MIT https://github.com/deepseek-ai/deepseek-harness https://github.com/cordiverse/paper Тут DeepSeek V4 Pro 0813 А почему такая странная фотка из отпуска в заголовке? А просто эта странная шняга на поясе тоже называется harness (трапеция)... @cgevent
Ну, за Фотошоп В последнее время слои в генераторах появляются все чаще: ideogram, Qwen Layered, Stability AI (Лора для Квена, писал вчера). И вот уже долгожданный апдейт для Seedream 5.0 Pro. Там появился Layer Separation - модель берет готовую картинку и автоматически разбирает ее на независимые слои: персонажей, предметы, фон и другие элементы. На выходе получаем отдельные PNG с прозрачностью, которые можно двигать, удалять и редактировать независимо друг от друга. Через fal можно получить от 2 до 17 слоев, а промптом указать, что именно нужно отделить. На fal функция уже доступна в Playground и API. Цена считается за полученные слои: $0.03375 за слой для изображений до 1536×1536 по площади и $0.0675 за слой выше этого размера. То есть разбор картинки, например, на 10 слоев обойдется примерно в $0.34 или $0.68. Попробовать: https://fal.ai/models/bytedance/seedream/v5/pro/layerize API: https://fal.ai/models/bytedance/seedream/v5/pro/layerize/api Официальный анонс Seedream 5.0 Pro: https://www.byteplus.com/en/activity/seedream5-0 @cgevent
Мемные миры Зацепило. Не просто обычный оживляж мемов и I2V, а разметка и монтаж. Подробнее про воркфлоу и промпт тут: https://x.com/Flovaai/status/2087541198529683866 Там как бы: reference image → Flova задаёт режиссуру/движение камеры → Seedance 2.5 генерирует продолжение сцены → модель удерживает персонажей и перестраивает композицию → псина @cgevent
Wan 3.0 начинают раскатывают по API Сейчас подтверждённо доступен: WaveSpeedAI - LIVE, Playground + API. 480p - $0.06/сек 720p - $0.12/сек 1080p - $0.24/сек. Pixazo: 480p - $0.043/сек 720p - $0.085/сек 1080p - $0.17/сек. wan.video - официальный Public Beta. Цена в публичном интерфейсе зависит от кредитной системы/аккаунта. VivaReel - Wan 3.0 доступен через пользовательский интерфейс. Фал и репликейт - coming soon Ссылки: https://wavespeed.ai/collections/wan-3.0 https://www.pixazo.ai/models/wan https://help.aliyun.com/zh/model-studio/wan3-0-video https://wan.video/ https://vivareel.ai/ @cgevent