immers.cloud | Облако с GPU
Статистикаimmers.cloud — облачный GPU-сервис с широким выбором видеокарт для ML, генеративных моделей, 3D и рендеринга. Самый большой ассортимент GPU Tesla и RTX 💻 👉 Наш сайт https://immers.cloud/ 🎧 @immerscloudsupport Чат по ИИ - https://t.me/immersAI
- Последний пост
- 14 авг.
- Последнее чтение
- 00:42
- Постов за неделю
- 8
- Всего постов
- 30
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 418
- 1/48двое суток
- 479
- 1/72трое суток
- 516
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
без подписи
без подписи
без подписи
без подписи
без подписи
без подписи
Unlimited-OCR: как распознавать многостраничные документы за один проход 👋 Unlimited-OCR — открытая мультимодальная OCR-модель от компании Baidu. MoE-архитектура на 3 млрд параметров из которых при генерации активируются только 500 млн. 📌 Главная особенность — возможность обрабатывать несколько страниц одновременно за один проход. Что важно: ▪️ Ключевая научная новелла модели — Reference Sliding Window Attention (R-SWA). Этот механизм позволяет зафиксировать объём KV-cache и не увеличивать его при генерации токенов, при этом постоянно сохраняя доступ ко всем исходным токенам: изображениям и запросу-промпту. ▪️ Страницы PDF преобразуются в изображения и загружаются в общий контекст. Это позволяет непрерывно распознавать книги, архивы, отчёты и комплекты документов без отдельного запуска для каждой страницы. ▪️ DeepEncoder сжимает страницу размером 1024 × 1024 до 256 визуальных токенов. Контекстное окно модели составляет 32K токенов, поэтому фактическое количество одновременно обрабатываемых страниц зависит от их разрешения и объёма опорного префикса. 📲 Подробнее в слайдах. 📎 При выборе GPU учитывайте не только размер весов, но и KV-cache, а также объём префикса, который увеличивается с количеством и разрешением страниц. ➡️ Бесплатно протестировать Unlimited-OCR можно через публичный API-эндпоинт. Чтобы получить доступ, необходимо создать аккаунт, пройти верификацию и выпустить токен. ☁️ Если для рабочих задач нужен изолированный сервер, модель можно развернуть на Tesla A2 от 33,74 ₽/ч. 📎 Об особенностях направления запросов по API в модель можно узнать по ссылке.
🚀 Бесплатные публичные AI-эндпоинты В каталоге Immers Foundation Models можно бесплатно протестировать open-source модели через чат или API — без оплаты за токены. Это удобный способ оценить качество генерации, проверить tool calling и собрать прототип. 1. GPT-OSS-20B Компактная модель OpenAI для рассуждений, программирования и агентных задач. ▶️ Протестировать GPT-OSS-20B 2. Llama-3-8B-GPT-4o-RU Версия Llama 3, дообученная для качественной работы с русским языком. ▶️ Протестировать Llama-3-8B-GPT-4o-RU 3. NVIDIA Nemotron-3-Nano-30B-A3B Модель для агентных систем, RAG, обработки длинного контекста и генерации кода. ▶️ Протестировать NVIDIA Nemotron-3-Nano 4. Qwen3-Coder-Next Модель для программирования и автономных coding agents: анализирует репозитории, находит ошибки и предлагает патчи. ▶️ Протестировать Qwen3-Coder-Next 5. Qwen3.5-35B-A3B Мультимодальная модель для текста и изображений с режимами Thinking и No-thinking. ▶️ Протестировать Qwen3.5-35B-A3B 6. Gemma-4-26B-A4B-it Мультимодальная MoE-модель Google для работы с текстом, изображениями и агентными сценариями. ▶️Протестировать Gemma-4-26B-A4B-it 🆕 Новые модели для обработки документов: 7. Unlimited-OCR Распознаёт сразу несколько страниц документа в одном запросе. Подходит для технической документации, архивов и многостраничных контрактов. ▶️ Протестировать Unlimited-OCR 8. PaddleOCR-VL-1.6 Компактная модель для распознавания текста, таблиц, формул и структуры документов. ▶️ Протестировать PaddleOCR-VL-1.6 Выберите модель и тестируйте ее бесплатно на immers.cloud.
без подписи
без подписи
без подписи
без подписи
без подписи
PaddleOCR-VL-1.6: как компактная модель разбирает сложные документы 👋 PaddleOCR-VL-1.6 — открытая мультимодальная модель PaddlePaddle (Baidu) на 0,9 млрд параметров, специализированная на преобразовании PDF, сканов и фотографий в структурированные Markdown и JSON. 📌 Главное изменение относительно версии 1.5 — не новая архитектура и не увеличение числа параметров, а точечная оптимизация областей данных, в которых предыдущая модель работала нестабильно. Что важно: ▪️ Обработка документов в исходном масштабе Визуальный энкодер NaViT работает с динамическим разрешением и обрабатывает фрагменты изображения без обязательного приведения всей страницы к фиксированному размеру. Это помогает сохранять мелкий текст, формулы и детали сложных таблиц. ▪️ Оптимизация слабых областей Система подготовки данных ищет нестабильные примеры, редкие типы документов и ошибки разметки. Проблемные области используются для расширения данных, а неподтверждённые метки проверяются независимыми экспертными парсерами. ▪️ Разбор структуры документа В полном конвейере PaddleOCR-VL-1.6 используется вместе с PP-DocLayoutV3: модель анализа макета локализует области страницы, а PaddleOCR-VL-1.6 распознаёт текст, таблицы, формулы, графики, печати и порядок чтения. 📲 Подробнее об архитектуре, бенчмарках и сценариях использования — в слайдах. 📎 При тестировании обратите внимание на особенности направления запросов по API и рекомендации по синхронизации с моделью PP-DocLayoutV3, подробнее по ссылке. ➡️ PaddleOCR-VL-1.6 можно бесплатно проверить через публичный эндпоинт по API. Для доступа к API достаточно зарегистрироваться, пройти верификацию и получить токен. Если потребуется частный сервер, модель доступна на Tesla A2 от 33,74 ₽/ч. #ИИ_Модели #LLM
без подписи
без подписи
без подписи
без подписи
без подписи
без подписи