- Последний пост
- 3 июн.
- Последнее чтение
- 15 авг.
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- Категория
- Право
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Первый день ПМЭФ подходит к концу. Выпустили сегодня первую версию модели из нашего семейства Optimal Cognitive Core, OCC-RAG. Это компактная SLM для Q&A по контексту. Модель доступна в 2 размерах: 0.6B и 1.7B. Несмотря на маленькое число параметров обе уверенно отвечают на сложные multi-hop вопросы, рассуждают пошагово и корректно, отказываются отвечать, когда контекста недостаточно. Как мы этого добились? 1. Сложные синтетические данные. Открытые QA-датасеты, как правило, маленькие и не таргетируют задачу faithfulness. Модели учатся отвечать, но не всегда следовать контексту. Поэтому мы построили собственный пайплайн генерации данных: с помощью метода Wikontic (https://t.me/Ivan_Oseledets/283) извлекаем граф знаний из текстов и генерируем вопросы по путям в этом графе. Получаются по-настоящему сложные multi-hop задачи, где нужно объединить факты из нескольких источников, например: «В каком городе родился режиссёр фильма, получившего Оскар в год рождения Леонардо ДиКаприо?». Дополнительно пайплайн умеет генерировать вопросы, на которые в контексте нет ответа, чтобы отдельно учить модель отказываться. В итоге наш метод позволяет генерировать данные из любых неструктурированных документов в почти неограниченном количестве! 2. Mid-training В качестве базы взяли Qwen3-0.6B-Base и Qwen3-1.7B-Base и провели масштабный mid-training на пороядка 8 млрд токенов. Мы также дополнили данные специальным форматом рассуждения, который цитирует источники прямо в ответе. Это дополнительно повышает faithfulness. Прогнали OCC-RAG на HotpotQA, MuSiQue и TAT-QA. Добавили ConFiQA, один из самых сложных бенчмарков на faithfulness, где модель должна следовать контексту, даже если он противоречит общеизвестным фактам. Итого: Качество на уровне моделей в 2–6 раз больше по размеру; на ConFiQA обходят даже Qwen3-32B; заметно лучше следуют контексту и реже подменяют его внутренними знаниями; среди специализированных малых QA-моделей (например, Pleias-RAG) показывают лучший результат. Репорт на HuggingFace Daily Papers: https://huggingface.co/papers/2606.00683 Отмечу, что работа по согласованности, четкости и скорости в команде — эпичная. Продолжаем работать над улучшенной версией для tool-calling и Agentic RAG задач. Ждите обновлений! P.S. Не успел выйти с форума, уже увидел новости у ТАСС, РГ, в телеграм, Forbes, Код Дурова, много где. Радует, когда наши медиа следят за повесткой, реагируя не только на «что-то новое от Гугла». Кстати, про значимость малых моделей сегодня как раз хорошо написал Андрей Себрант из Яндекса. Почитайте — https://www.forbes.ru/mneniya/562028-maly-da-udaly-pocemu-vazny-ii-modeli-kotorye-sovsem-ne-na-sluhu
Плохо, когда Human-in-the-Loop оказывается судья, а не компонент AI-системы... По следам нашумевшего штрафа за ИИ-галлюцинации, присужденного Арбитражным судом Западно-Сибирского округа (ИИ штраф поддержали, а обман осудили🙂) - небольшой обзор практики судов США в отношении нейро-галлюцинаций. 👉 [Ссылка на обзор - zakon.ru]
Почему-то в AI-индустрии все чаще возникает почти религиозная вера в то, что если сильнее зажать модель grammar constraints, JSON-схемами и валидаторами, то она будто бы становится ближе к пониманию языка. Но это удобная инженерная иллюзия. Да, constrained decoding отлично дисциплинирует вывод: меньше синтаксических ошибок, стабильнее формат, проще парсинг, надежнее пайплайны. Но между "валидный JSON" и "модель понимает смысл" - дистанция примерно как между хорошо оформленным полицейским протоколом и реальным знанием о мире. И вот здесь Хомский для AI-адептов особенно неудобен. Потому что его критика бьет не по частным настройкам inference, а по самому соблазну подменить семантику синтаксисом, а объяснение мира... 👉 Читать: Почему Хомский неудобен для AI-индустрии Кликбейтное фото, пожалуй, стоит назвать так: Syntax OK. Semantics failed. 🙂
https://www.youtube.com/watch?v=1oWR_gpR6GY Дела у Legal AI идут в гору! Jude Law и Legora.
Генеративный ИИ, похоже, делает с интеллектуальной собственностью то, что все большие информационные технологии делали с правом всегда: сначала спокойно ломает старую конструкцию, а потом с интересом наблюдает, как юристы пытаются собрать ее обратно по частям. Парадокс в том, что чем настойчивее право требует человеческого авторства, тем больше AI-generated контента оказывается вне привычной охраны. То есть система защищает себя ценой сужения собственной территории - довольно изящный способ проигрывать, формально не признавая поражения... Читать лонгриды, как известно, намного сложнее, чем их писать... Увы, не жалеем читателя. 🙂 👉 Длинно и по-русски: Искусственный интеллект и конец эпохи интеллектуальной собственности: неожиданное освобождение от бремени авторства 👉 Кратко и по-английски: Generative AI and the End of Intellectual Property: Freedom from the Burden of Authorship
Уроки LegalTech-археологии Многие идеи, которые сегодня подают как новый AI frontier, вообще-то обсуждались еще полвека назад. В 1968 году уже моделировали движение дел через суд, а в 1973 — предлагали математические подход к симуляции legal systems для инженеров и юристов. Вывод на удивление современный: в праве нужно моделировать не "цифрового юриста", а систему. Не только текст, но и процесс... Вобщем, как вы догадались, очередная заметка на Хабре: 👉 Алгебра правосудия: как инженеры оцифровывали суды за 50 лет до ИИ Также не оставил в неведении заморских товарищей: 👉 Don’t Model the Lawyer, Model the System: AI Architecture Lessons from the 1970s
⚡️ Дело на 1,44 млрд руб.: ИИ предсказал исход дела ФИТ v. Сбербанк Пока все обсуждают внезапный разворот в деле "СберФИТнеса" (как окрестили его юристы), где апелляция взыскала со Сбербанка колоссальные 1,44 млрд рублей за товарные знаки PayQR, устроим-ка краш-тест неШемяке!. На вход только raw data - два судебных акта: 259 тысяч символов постановлений первой инстанции (АСГМ) и апелляции (9ААС). Переварив этот судебный канцелярит, SOTA-модели (Claude Opus 4.6, Gemini 3.1 Pro и GPT-5.4) рассчитали шансы Сбербанка отбиться в кассации. 📊 Вердикт LLM: Консенсусный прогноз выдал 67% вероятности на успешную отмену постановления (Confidence Score: 8.2/10). Модели хладнокровно раскопали критические баги: от взыскания астрономической суммы на базе внесудебной оценки (в обход запрета СИП на экспертизу) до игнорирования старой доброй практики ВАС РФ. 🔥 Спойлер: 13 марта Суд по интеллектуальным правам снес акт апелляции и оставил в силе отказное решение первой инстанции. Само постановление еще не опубликовано - и тем интереснее будет сравнить аргументы LLM с реальной мотивировкой кассации 👉 Подробный прогноз 👉 Заметка на habr с таймлайном дела
⚖️ Представляю Lexometrica Ground Truth Два месяца трудов, связанных с практическим вопросом - какие модели поставить под капот "неШемяки!" Проблема в том, что открытые бенчмарки сегодня в глубоком кризисе. Из-за Test-Set Leakage нейросети просто заучивают ответы из интернета, создавая "метрическую иллюзию" интеллекта. На бумаге они отличники, а на реальном кейсе из практики Верховного суда — "плывут". Чтобы найти истину, я собрал Lexometrica Ground Truth — закрытый blackbox из 30 анонимизированных кейсов, которых нет в сети. Нейросети были вынуждены не вспоминать, а реально думать. Главные выводы исследования: 🥇 SOTA-дуополия: Лидеры рейтинга - GPT-5.4 Pro и Claude Opus 4.6. Только они показывают стабильный reasoning (0.80+) и безошибочно видят скрытые риски там, где другие просто пересказывают фабулу. 🥈 Феномен Gemini: Модель от Google набрала рекордные 0.99 в векторе "знание норм", но провалилась в их применении. Это идеальный цифровой справочник, который, увы, иногда в сложных сценариях теряет нить рассуждения. 🥉 Азиатский парадокс: У китайских Qwen и GLM — мощнейшие логические движки, но нулевое знание российского контекста. Вывод: идеальны для работы, но только в связке с RAG. 🏗 Локальный "парадокс безопасности": Наши GigaChat и YandexGPT пока в роли догоняющих. Одна из проблем — гипер-осторожность. Коллеги из Яндекса так перекрутили корпоративные фильтры, что модель часто отказывается отвечать даже на невинные вопросы по гражданскому праву. Это "зона роста", которую нужно превращать в "зону пользы". 👉 Разбор методологии: в статье на zakon.ru и на habr.com 📊 Рейтинг : https://lexometrica.com/bench/ Результаты какой модели удивили вас больше всего? 👇
ИИ против «дела Долиной»: угадали аргументы, но вняли статистике Шум вокруг дела Долиной утих, решил препарировать стандартным "нешемяковским" пайплайном - консенсусом трех топовых LLM (Claude, Gemini, GPT). Скормил им только решения первых трех инстанций и на выходе получил прогноз финала в Верховном Суде (веса моделей о нем, естественно, не знали). Результат очень интересный: ✅ Нейросетки указали на 5 аргументов для отмены из 7, использованных ВС РФ (реституция, стандарт осмотрительности покупателя и т. п.). Reasoning! ❌ Итоговый прогноз на успех - всего 7%. Почему? Потому что ИИ оказался большим практиком, чем мы. Модели посмотрели на суровую статистику ("три инстанции засилили - шансов почти нет") и не поверили, что Верховный Суд сломает статус-кво. 👉 [Ссылка на обзор - zakon.ru] 👉 [Ссылка на ИИ-прогноз - neshemyaka.ru] В "неШемяке!" появился раздел "Публичные прогнозы". Присылайте в комментариях ссылки на интересные дела (свежие, лучше арбитражные и в стадии обжалования). Разберем вместе!
⚖️ Новый модуль "Стоит ли обжаловать" в "неШемяке!" Закончил работу над модулем оценки шансов на обжалование. Уже выкатил на прод. Параллельно, выбирая LLM под капот этого блока, прогнал 150 свежих арбитражных дел, которые уже прошли апелляцию, через последние версии нейросеток — Claude Sonnet 4.6, GPT-5.2 Thinking и Gemini 3.1 Pro. "Голый" текст решения первой инстанции нейросети анализируют хорошо — точность прогноза 72–78%. Но стоит добавить слабую позицию с вводной "наш клиент считает...", как ИИ впадает в сикофантию (угодливость). Вместо критики алгоритм начинает слепо поддакивать, завышая шансы на выигрыш до абсурдных 93%. Один из главных выводов — оценивать свои судебные перспективы в обычном ChatGPT — путь к самообману. Нейросеть будет за вас "болеть". Выход один — устраивать AI-баттлы, искать программный консенсус. Только такой баланс дает юристу трезвый risk assessment. Общее описание исследования - в статье на Хабре. Всю математику сейчас упаковываю в небольшой препринт для arxiv.org.
📉 Минус $300 млрд за сутки: Anthropic убивает динозавров LegalTech? 🦖🩸 На прошлой неделе на фондовом рынке США случилась настоящая "кровавая баня" для гигантов, на которых юристы молились десятилетиями. Thomson Reuters, Gartner, LexisNexis и др. - все полетели вниз на 15-20%. Причина? Anthropic выкатила новые специализированные плагины для Claude Cowork. Рынок испугался не просто очередного чат-бота. Anthropic показала агентов, которые интегрируются прямо в рабочие процессы: сами проводят due diligence, проверку договоров, сверку комплаенса и готовят правовые справки. Инвесторы рассудили просто: "Зачем платить тысячи долларов за подписку на базу судебной практики, если агент Клод сделает это быстрее и дешевле?". Эффект домино задел даже LegalZoom (-18%), показав, что "рвы" старых корпораций, казавшиеся неприступными, пересыхают на глазах. Гиганты не умрут завтра, но их маржинальность в 40% - уже история. Для AI LegalTech-разработчиков же открываются перспективы, от которых захватывает дух...
Небольшое, но важное обновление в "неШемяке!" До сих пор важный блок "ключевые факторы" (конкретные обстоятельства, на которые нейросеть обратила внимание при оценке шансов) оставались "служебной информацией": мы использовали их для валидации ответов LLM, но не выводили в интерфейс. Теперь "ключевые факторы" стали доступны пользователям: ✅ В базовом тарифе — топ-3 фактора ✅ В премиуме — все факторы от каждой модели Зачем это нужно? Вместо абстрактного «вероятность 85%» вы видите на что именно опирается прогноз. Это помогает понять, какие документы критичны, где у вас сильная позиция, а где — уязвимость.
Когда роботы судят роботов: китайский эксперимент SimCourt Пока мы тут прикручиваем RAGи и строим скромные пайплайны, исследователи из Университета Цинхуа выкатили интересный препринт. Они построили полноценную симуляцию суда, где все роли — от судьи до подсудимого — исполняют AI-агенты. В чем суть? Китайцы запустили ролевую игру (Role-Playing Simulation). Агенты жестко следуют 5 стадиям уголовного процесса. — 👮♂️ Прокурор (агент с установкой "Attack Strategy") ищет дыры в алиби. — 🧑💼 Адвокат (агент "Defense Strategy") давит на смягчающие. — 👨⚖️ Судья слушает этот спор и выносит вердикт. Некоторые результаты ✅ AI-судья лучше удерживает структуру процесса и идеально цитирует нормы (ну, это ожидаемо). ✅ Агенты отлично ловят оппонентов на противоречиях. ❌ С присяжными работать пока не умеют - слишком логичные. Вывод: Ваш следующий процессуальный оппонент, возможно, уже прогнал свою позицию через такой симулятор. 💀 🔗 Ссылка на разбор статьи на Хабре 📄 Оригинал препринта #LegalAI #Tech
Китайцы доказали: "голая" GPT не тянет юриспруденцию Опубликовал новую статью на Zakon.ru с разбором свежего исследования «Chinese Labor Law Large Language Model Benchmark» (январь 2026). Суть эксперимента: Авторы сравнили мощные универсальные модели со специализированной LabourLawLLM, дообученной (SFT) на трудовом праве - набор из 12 типов задач. 📉 Результат предсказуем, но болен: Универсальные модели проигрывают специалистам, как только дело доходит до: 1️⃣ Точных расчетов (компенсации, неустойки) — GPT пытается угадать цифру, а не посчитать. 2️⃣ Строгого цитирования норм — галлюцинации цветут пышным цветом. 3️⃣ Квалификации спора — путаются в нюансах, если не задать жесткую структуру. Инженерный вывод: Эпоха «промпт-инжиниринга» (когда мы просто просим GPT «быть хорошим юристом») уходит. Будущее — за пайплайнами, где задача разбивается на атомы: сначала NER (вытащить факты), потом Classification (понять суть спора), и только в конце — Reasoning. Именно эту логику «декомпозиции» постепенно внедряю в "неШемяку!". Вместо того, чтобы просить нейросеть «написать ответ», заставляем ее сначала найти слабые места, потом проверить факты, и только потом — выдать прогноз. Работает дольше, но галлюцинирует реже.🙂 👉 Читать разбор на Zakon.ru: ссылка 👉 Сама статья на arXiv: ссылка
неШемяка! ИИ для юристов pinned «🎁 АКЦИЯ: премиум-прогноз бесплатно Хотите получить разбор вашей ситуации с аргументами от GPT, Claude и других премиум-нейросетей бесплатно? 👇 Всего 2 простых шага 1️⃣ Подпишитесь на наш канал @neshemyaka 2️⃣ Расскажите о сервисе neshemyaka.ru в любой…»
🎁 АКЦИЯ: премиум-прогноз бесплатно Хотите получить разбор вашей ситуации с аргументами от GPT, Claude и других премиум-нейросетей бесплатно? 👇 Всего 2 простых шага 1️⃣ Подпишитесь на наш канал @neshemyaka 2️⃣ Расскажите о сервисе neshemyaka.ru в любой соцсети 📩 Как получить награду Пришлите в комментарии к этому посту или на support@neshemyaka.ru ссылку на вашу публикацию. ✅ Magic Link вышлем в течение часа (в рабочее время)
Друзья, в "неШемяке!" небольшое, но важное обновление. Теперь при анализе дела обязательно явно указывать свою роль в процессе: истец или ответчик (третьих лиц пока не завезли🙂). В LLM Studies это называется Role-Based Prompting. Когда мы явно задаем роль, происходит несколько важных вещей на уровне архитектуры модели: 1. "Смена вектора внимания" (attention mechanism) - без указания на роль модель чаще выдает общие фразы, которые верны, но бесполезны для стратегии. 2. "Юридической силлогизм" (legal syllogism) - есть исследования, на этот раз - не "британских", а "китайских ученых"🙂, что LLM лучше справляются с прогнозом, когда их заставляют следовать структуре "Факты -> Норма -> Вывод" с позиции конкретной стороны. Указание роли сужает search space до релевантных прецедентов, отсекая шум. 3. "Снижение галлюцинаций" - когда роль не задана, модель пытается угодить всем сразу и часто выдумывает несуществующие "компромиссные" нормы. Заходите тестить! Выбирайте свой меч ⚔️ или щит🛡 https://neshemyaka.ru/
Итоги 2025: Как «неШемяка!» научился предсказывать будущее (судебное) Друзья, сегодня 31 декабря — время подвести итоги года! 🥂 ⚡️ ЧТО СДЕЛАНО С нуля до production за 2 месяца: 🏗 Техническая база → Взрослый ci/cd → Контейнеризация → Боевой VPS → Максимально оптимизированная PostgreSQL → Рефакторинг архитектуры: гибкая система LLM-провайдеров 🤖 AI-движок → Подключили премиум-модели: Claude, Gemini, GPT и др. → Fallback-механизм: если одна модель недоступна, автоматически переключается на другую → Работает как для бесплатного, так и для премиум анализа → Максимально докрутили скоринг ответов → Немаловажная часть - исследовательская, об этом - в следующем году. 💎 Продукт → Запустили премиум-тариф с пакетами (1/5/10/30 запросов) → Интеграция с Robokassa — полноценный платежный пайплайн → Magic links: доступ без регистрации через email → Автоудаление данных через 48 часов 🎨 UX/UI → Переработали всю структуру HTML → Добавили FAQ 🚀 **ЧТО ДАЛЬШЕ В 2026?** Это только начало! В планах: 📊 Q1 2026: Расширение функционала → Добавление контекстных полей (тип документа, роль пользователя) → Новые услуги: оценка обжалования, анализ рисков → AI-генерация документов: проекты исков и жалоб 🔧 Q2: API и интеграции → API для юристов и компаний → Telegram-бот для быстрого доступа 📈 Q3-Q4: Масштабирование → B2B-направление для юридических фирм → Корпоративные подписки → White label решения Спасибо всем, кто верит в проект!
Почему простые «AI-судьи» бесполезны в реальности Опубликовал на zakon.ru обзор свежего препринта с EMNLP 2025. Исследование бьет в самую боль всех, кто делает LegalTech — разрыв между рафинированными датасетами и реальностью. Идея, вобщем-то, на поверхности. В большинстве исследований по Legal Judgment Prediction модели тренируются на «юридических фактах», а это читерство. «Юридический факт» — это то, что прошло судейский фильтр и зафиксировано в решение. В реальной жизни на входе в судебный процесс у нас этого нет. Есть только куча противоречивых доказательств от истца и ответчика. Авторы предлагают внедрить промежуточный слой — Legal Fact Prediction (LFP). И пайплайн тогда становится таким: Сырые доказательства → AI восстанавливает картину мира (факты) → AI применяет право. То есть сначала генерируем нарратив «как это видит суд» (fact-finding), и только потом применять нормы права. Именно по такому пути мы пойдем в неШемяке) О некоторых результатах исследования читайте здесь. Сама статья.
Channel photo updated