tgindex

Draft AI | Иван Кундиль

описание

Практикующий юрист. Делаю AI-инструменты для права: RAG-системы, агенты и юридические сервисы. Показываю процесс разработки, тесты моделей, ошибки и реальные результаты. IP-сервис: https://draftlaw.ru/ IP-бот: @GetINNinfo_bot Связь: @ivankundil

328
подписчиков
Охват к подписчикам
151,8%
ERR
Реакции к просмотрам
2,65%
264 на 20 постов
Пересылки к просмотрам
2,71%
270
Постов в день
0,0
всего 20

Где отзываются чаще

доля реакций к просмотрам
  • 12 июл.Как большие лимиты могут лишать нас опыта Последние несколько месяцев я довольно экономно работал с Claude и Codex. Перед каждой задачей сам разбирался в проблеме, продумывал архитектуру, дробил работу на этапы и проверял результат. Не из-за особой дисциплины, а из-за лимитов. Но именно благодаря этому я стал лучше понимать собственный проект и в целом разбираться в таких вещах, как архитектура, пайплайны, RAG и связи между отдельными компонентами. Недавно мне удалось попользоваться Claude Max с гораздо большими лимитами. Уже не боясь в них упереться, я ставил Opus крупную задачу и подключал других агентов для ревью. Один пишет код, второй проверяет, первый исправляет замечания и снова отправляет результат на проверку — и так до выполнения задачи. Большие лимиты позволяют передать агентам не только написание кода, но и почти весь процесс принятия решений. Через несколько часов ты получаешь готовый результат и огромный отчёт, который уже почти не читаешь. А даже если прочитать итоговое резюме и посмотреть изменения, это не заменяет участия в процессе: ты знаешь, что было сделано, но не всегда понимаешь, какие решения принимались по пути и почему. Получается парадокс: лимиты замедляют разработку, но заставляют учиться. А почти безлимитный доступ позволяет получить результат, не приобретая опыт, который раньше неизбежно возникал в процессе. Мне не хочется терять связь с собственным проектом и опыт, который я получаю благодаря участию в разработке. Поэтому для меня важно найти баланс: что полностью отдавать агентам, а в какие процессы и решения продолжать погружаться самому. А как вы находите этот баланс — или считаете, что с учётом возможностей ИИ опыт разработки уже и вовсе не нужен?6,46%
  • 31 маяПока ставил серверный Linux, поймал себя на мысли. По мере роста проекта и появления новых идей я стал упираться в ресурсы сервера, а докупать мощности выходит ощутимо дороже. Поэтому решил переделать старенький ноутбук под сервер: так я почти бесплатно получаю заметно больше ресурсов под проект и другие свои идеи. Накатил серверную Ubuntu без графического интерфейса, голую командную строку. И в какой-то момент поймал себя на странной мысли: ещё пару лет назад я бы за это просто не взялся. Юрист, без опыта в IT - человек, для которого слово «сервер» долго было чем-то из другого мира. Чем-то, для чего вызывают специалиста. А сейчас ты просто открываешь Claude или любую другую нейросеть, описываешь задачу и идёшь по инструкции. И дело даже не в том, что ИИ «экономит время» - об этом уже сказали примерно все. Мне кажется, он незаметно меняет другое - смещает границы того, что ты вообще готов попробовать сделать сам. Раньше между мыслью «хочу поднять домашний сервер» и результатом стояла куча вопросов: какую систему выбрать, подойдёт ли железо, как всё установить, что делать, если сломается. Каждый такой вопрос легко превращался в тупик, а идея так и оставалась нереализованной. Сейчас большинство из них превращается не в тупик, а в диалог с ИИ. Делать всё равно приходится самому, но можно получить инструкцию именно под свою ситуацию, а не абстрактный гайд из 2017 года под другое железо и другой контекст. ИИ очень сильно снижает порог входа в новые области. Не делает тебя специалистом за вечер, но убирает тот самый внутренний барьер, из-за которого раньше ты даже не пробовал.6,09%
  • 17 апр.Провел онлайн-лекцию в Томском государственном университете для студентов программы «Специалист по цифровой трансформации юридической деятельности» Рассказал, как устроен процесс вайбкодинга, с чего начать, и на примере своего проекта показал архитектуру, стек и инструменты. По результатам получил 87 заполненных форм обратной связи. Студенты сделали 207 запросов к боту как на основе реальных, так и смоделированных ситуаций и оценили его работу по трём критериям: 🔵точность ссылок - 4,29 из 5, 🔵обоснованность вилки - 4,28 из 5, 🔵практическая полезность - 4,69 из 5. Важными оказались не только оценки студентов, но и их рекомендации по улучшению проекта: ➡️Увеличить количество дел в базе (всё никак руки не дойдут); ➡️Ввести режим краткого и развёрнутого ответа - полная версия многим кажется перегруженной; ➡️Улучшить формат ответа: выделить жирным ключевое, разбить на понятные блоки; ➡️ Улучшить логику уточняющих вопросов - бот теряет контекст судебной практики, на которую сам ссылается в первом ответе. Были и ошибки, бот иногда ссылается на дела, которые не относятся к ситуации, или даёт неточные расчёты. Это видно и по оценкам - точность ссылок получила самый низкий балл из трёх критериев. Есть над чем работать. Судя по объёму и стилю обратной связи, некоторые студенты проверяли ответы бота через другую нейросеть. Содержание ожидаемое - «бот ссылается на несуществующую ст. 1252.1 ГК РФ», «на несуществующий повышающий коэффициент в п. 2 ст. 1301 ГК РФ» и что «применение редакции 2026 года - анахронизм». Насколько мы знаем, это далеко не так😁 Вывод простой: ответы любой нейросети, включая мой бот, нужно проверять, прежде чем доверять "на слово". Но проверять нужно по источнику (текст закона, карточка дела), а не прогоном через другую LLM. Спасибо Татьяне Трубниковой и студентам НИ ТГУ за возможность рассказать о вайбкодинге как современном навыке юриста и поделиться опытом построения своего проекта.5,98%
  • 22 июн.А у нас новый вебинар! Пожалуй с самым холиварным вопросом для юристов) Как использовать нейросети для поиска судебной практики. 24 июня в 18:00 (МСК) Разберём инструменты - от привычных чат-ботов до DIY сервисов. Юлия Вербицкая, HoReCa-юрист, расскажет о своём опыте использования нейросетей для поиска и анализа судебной практики. Поговорим о мифах и рабочих сценариях применения ИИ в повседневной работе юриста. Иван Кундиль - автор Draft AI, расскажет о создании AI-сервиса для оценки IP-споров и поиска судебной практики, а также о сложностях, с которыми столкнулся. Ведущий: Степан Леонтьев Регистрация в боте4,89%
  • 2 июл.На ПМЮФ-2026 прошла сессия «Юрист будущего: портрет профессии в эпоху искусственного интеллекта». Для видео к сессии я записал короткий комментарий о том, как изменилась моя работа с появлением ИИ, — спасибо Павлу Мищенко и команде Транснефти за приглашение. Пока готовил этот комментарий, поймал себя на нескольких мыслях — ими и хочу поделиться. Разговоры юристов вокруг ИИ становятся заметно серьезнее в части технической составляющей. Обсуждение промптов, подготовка черновиков или саммари документов — это уже базовый уровень, к которому многие за 2025 год привыкли. Сейчас все чаще встречаются темы вроде RAG, агентных и мультиагентных систем, оркестрации, MCP, метрик. И даже в таких технических вопросах роль юриста никуда не исчезает. Именно юрист как доменный эксперт понимает, какой ответ качественный, где модель ошиблась и какую ценность инструмент должен давать бизнесу или юридической команде. Поэтому профессия постепенно меняется. Мало просто знать право и готовить документы. Некоторые юристы уже совмещают несколько ролей: юриста, продакт-менеджера и технического специалиста. Они понимают, какую задачу закрывает инструмент и как он должен работать, проверяют правовую часть и качество ответа, а иногда и сами «вайбкодят» решение под конкретную задачу.4,40%
  • 21 апр.💻 Запись вебинара с Иваном Кундилем - разбираем IP Agent изнутри Друзья, час пролетел незаметно - спасибо всем участникам! Приятного просмотра! В этом выпуске: ➡️Как появилась идея IP Agent и какую задачу он решает ➡️Демонстрация бота вживую на реальных кейсах ➡️Чем специализированный RAG-бот отличается от NotebookLM и Яндекс Нейроюрист ➡️Как юрист без технического образования создаёт работающий продукт (демонстрируем вайбкодинг на примере создания калькулятора госпошлины) ➡️Архитектура изнутри: RAG, эмбеддинги, реранкер, агентный поиск ➡️Тест 10 моделей: какие LLM справляются с юридическими задачами, а какие больше галлюцинируют ➡️Юрист vs IT-специалист - где юридические знания дают преимущество ➡️Агентный RAG: реальная польза или переоценённый хайп ➡️Сколько времени занял проект и что дальше Если у вас есть идеи, какую тему необходимо рассказать более детально - жду в комментариях!4,36%
  • 27 апр.Реранкер: оставить, заменить или выкинуть? После того как учёл ошибки в бенчмарке эмбеддингов, решил поменять модель эмбеддинга в боте и наконец-то дозалить новую судебную практику. Но столкнулся с тем, что заодно нужно определиться с реранкером: оставить старый, выбрать новый или вовсе убрать. Что сделал. На уже размеченных данных прошлого теста прогнал четыре реранкера по тем же 30 вопросам и семи эмбеддингам. Делать новую разметку не пришлось, поэтому всё заняло несколько часов. Реранкеры в тесте: mmarco-mMiniLMv2 - мой текущий, обучен на английском MS MARCO bge-reranker-v2-m3 - мультиязычный от BAAI, 568M параметров jina-reranker-v3 - листвайз-архитектура, 0.6B параметров mxbai-rerank-base-v2 - на базе Qwen-2.5, 0.5B параметров Плюс baseline без реранкера (raw). Главные выводы: ➖Не каждый реранкер подходит для русского юридического корпуса. Mxbai в моём корпусе значимо ухудшил результаты на большинстве эмбеддингов, английский mmarco на русском ожидаемо нейтрален. Работают только bge и jina. ➖ Эффект реранкера зависит от качества эмбеддинга. На сильных эмбеддингах (OpenAI, Voyage, USER2-base) приросты в пределах погрешности - на 30 вопросах их математически невозможно отличить от нуля. На слабых эмбеддингах эффект уже ощутимый и статистически значимый: Yandex (raw 0.630) → bge 0.755 (+12.5 пункта) Cohere (raw 0.700) → jina 0.793 (+9.3 пункта) OpenAI настолько хорошо ранжирует юридические дела сам, что реранкеру нечего улучшать. На слабом эмбеддинге пространство для улучшения есть, и реранкер реально вытягивает результат. ➖USER2-base + jina как локальная альтернатива OpenAI. USER2-base в raw даёт 0.773. С jina связка выходит 0.797. Для сравнения: OpenAI без реранкера - 0.809. Разница на этой выборке в пределах погрешности - нет смысла выбирать OpenAI вместо локальной связки. Решение для бота Поставлю USER2-base, если позволят ресурсы сервера, плюс jina-reranker-v3. Если jina по железу не пойдёт - оставлю bge. Mmarco убираю, пользы от него нет. Ограничения теста те же, что в прошлом посте. Часть выводов подтверждена статистически, часть - наблюдения в рамках выборки 30 вопросов.4,36%
  • 9 июл.Тест 14 нейросетей: всегда ли нужна топовая модель? Мой сервис по каждому судебному делу составляет «паспорт» — выжимку из акта в виде таблицы на 28 полей: кто с кем судился, что просил истец, что взыскал суд, какие статьи применил и т.д. Ранее писал, что эти выжимки позволяют снизить количество галлюцинаций при ответе сервиса. Составляет такие паспорта DeepSeek v4-flash, это одна из самых дешёвых, но эффективных моделей на рынке. И у неё встречаются пробелы в работе: то обстоятельство перепутает, то оставит поле пустым, хотя ответ есть в тексте судебного акта. Хочется больше точности, и логичное решение — взять модель посильнее и подороже. Но прежде чем менять модель, я решил проверить, можно ли ещё что-то выжать из DeepSeek v4-flash, и провёл тест. Взял выборку из 100 судебных дел и 14 нейросетей — от топовых GPT-5.5, Opus 4.8 и Sonnet 5 до бюджетных (все модели можно увидеть на графике). Каждая модель читала судебный акт и составляла по нему паспорт (выжимку). Для каждого дела заранее готовился эталон: его совместно составляли Opus 4.8 и GPT-5.5, а спорные поля дополнительно сверялись с текстом акта. Дальше всё просто: чем больше полей в паспорте модели совпало с эталоном, тем выше ее точность. Проверка шла вслепую — оценщик не знал, паспорт какой модели перед ним. Результат: топы набрали 96–98%, а DeepSeek v4-flash — 90,4% и десятое место (рейтинг на картинке). Не стал спешить с заменой модели и разобрал, на чем именно DeepSeek v4-flash теряет точность. Ошибки оказались двух типов — и лечатся они по-разному. ➡Первый тип — путаница в обстоятельствах дела. Подсказка нашлась ещё при подготовке эталонов паспортов: даже Opus 4.8 и GPT-5.5 иногда трактовали одно и то же поле по-разному. Оказалось, дело не в том, что одна модель сильнее другой, а в самой инструкции\промте — некоторые формулировки в инструкции можно было понять двояко. Переписал спорные места, и путаница в ответах DeepSeek v4-flash почти полностью ушла. ➡Второй тип — пустые поля паспорта. Здесь DeepSeek v4-flash не выдумывает, а ленится: суд расписал, как считал компенсацию, а в поле «способ расчета» все равно пусто. Правки в инструкцию больше не помогали: заставляешь модель заполнять все пустые поля и она начинает галлюцинировать. Но пустое поле, в отличие от выдумки, легко обнаружить автоматически. Поэтому я дописал скрипт (доработал код в инструменте, который собирает паспорта) — после составления паспорта он проверяет, какие поля остались пустыми, и просит DeepSeek v4-flash дозаполнить только их. Уже заполненные поля трогать ему запрещено. Итог: паспорт подорожал примерно на 37%, а точность выросла с 90,4% до 96,2%. Для сравнения: у Sonnet 5 — 98,7%, но он дороже DeepSeek v4-flash в 15 с лишним раз. Этот тест ещё раз показал, как сильно на результат влияет окружение (обвязка) модели. И что даже топовые нейросети ошибаются в простой на первый взгляд задаче: пересказать судебное дело в таблицу.3,78%
  • 20 маяВыкатил апдейт для IP Agent В боте теперь работают кликабельные ссылки на документы. Раньше приходилось копировать номер дела и вручную искать решение или постановление на сайте - теперь просто тыкаешь на ссылку, и текст открывается прямо из бота. Если где-то не открывается или ссылка не подсветилась - напишите, починю.3,63%
  • 26 июн.Как использовать нейросети для поиска судебной практики: запись вебинара 24 июня мы провели вебинар, на котором разобрали два практических кейса применения ИИ в юридической работе. Если вы практикуете в IP, для вас есть сервис от Ивана Кундиля @Draft_AI_Law — IP Agent Иван рассказал, как создал ИИ-ассистента для оценки споров в сфере интеллектуальной собственности. Сервис работает на базе 3 500+ реальных судебных дел и помогает рассчитать вилку компенсации, подобрать релевантную практику и аргументы для позиции. Главный вывод: собрать MVP без опыта в программировании можно быстро, но сделать юридически надежный инструмент сложнее. Нужно бороться с галлюцинациями, переписывать промпты и проверять источники. Если вы пробуете искать судебную практику через нейросети, будет полезен эксперимент Юлии Вербицкой @horecaurist Юлия проверила 9 нейросетей на поиске уголовных дел по ст. 183 УК РФ о коммерческой тайне. Лучшие результаты показали DeepSeek, Perplexity и ChatGPT. Часть моделей уверенно выдавала несуществующие дела с правдоподобными ссылками. Главный вывод: нейросети можно использовать как помощника для обработки и систематизации массива данных, но не как замену СПС и ручной проверки юриста. ➤ Посмотреть запись Приятного просмотра и до встречи на следующих вебинарах!3,07%
  • 15 июн.Собрал юридический плагин для Claude Code и сравнил результаты При подготовке документа с несколькими моделями часто можно заметить, что каждая из них (например Claude Opus 4.8 и GPT-5.5) предлагает разные аргументы. Одна делает упор на процесс, другая лучше подмечает пробелы в доказательствах, и по итогу они по-разному могут оценить суммы. Я начал использовать их как стороны спора — давал одной модели позицию другой и просил дать комментарии, опровергнуть, потом наоборот. Получается ручной мульти-агентный процесс: одна модель предлагает, другая критикует, а я дополняю фактами, контекстом, опровергаю тот или иной аргумент и по итогу собираю всё в единую позицию. По сути, это работа оркестратора, которую можно попробовать отдать агентам. Так и пришла идея сделать плагин под юридическую работу — legal-brief. Я не писал его с нуля, за основу взял плагин superpowers от obra / Jesse Vincent и форк superpowers-strigov-ver от strigov. Переделал этот подход с разработки кода на юридическую работу. Этапы работы плагина отображены в схеме к посту. В конце плагин предоставляет файл со списком всех норм и практики, на которые сослался в документе, и проверяет, что ссылки открываются. Актуальность и применимость норм/практики нужно проверять самостоятельно. Для теста запустил плагин на своём реальном деле — попросил составить возражения на взыскание судебных расходов. Чтобы понять, насколько удачным получился документ, я решил сравнить три подхода: 🔵 ручной вариант: я + Claude + GPT 🔵 плагин legal-brief 🔵 Cowork: Claude Opus 4.8 в один проход (без агентного конвейера) Итог: 🔵Ручной вариант — субъективно лучший для подачи. 🔵Плагин — на втором месте. Хорошо раскрывает вопрос объёма работы представителей, предлагает умеренный контррасчёт, но упустил один тезис, на который стоило бы сослаться, и местами документ получился длинноватым. 🔵Cowork — рабочий черновик, но слабее. Основная мысль есть, но местами слишком категорично, слабее контррасчёт и меньше аргументов. Да, ручной вариант получился лучше. И, честно говоря, я сомневаюсь, что даже при более тонкой настройке плагин будет идеально отрабатывать такие задачи без участия человека. Но в этом и не была цель. Плагин может снять пул работы, который обычно делается вручную: собрать саммари, прогнать документ через несколько ролей, получить критику, альтернативный взгляд и доработанный черновик. Его можно использовать для первых 70–80% работы, а дальше вручную проверять, усиливать позицию и добавлять то, что видит только человек, погружённый в дело. Кому интересно потестировать и сравнить свои результаты с результатами плагина — ссылка на репозиторий ниже. Репозиторий https://github.com/KunDeal/legal-brief2,61%
  • 23 апр.Апелляция на собственный бенчмарк: как я искусственно раздул метрики реранкера Недавно я публиковал бенчмарк эмбеддинг-моделей для юридического RAG и делал в нём крайне убедительные выводы: про реранкер, про эмбеддинги, про гибриды. Как оказалось, часть этих выводов была неверной. На эту мысль меня подтолкнула Екатерина, отдельное ей спасибо. В методике моего расчета была брешь, которую я не заметил. Что переделал: разметил 2751 пару (вместо 635) на уровне сырой выдачи, до этапа реранкинга, добавил к тесту еще одну локальную модель - deepvk/USER2-base. Вопросов по-прежнему 30. Что получилось: 〰️Реранкер не даёт значимого прироста. Разница между выдачей "до" и "после" реранкера на моих данных в пределах погрешности, а для некоторых моделей эффект даже отрицательный (видно в таблице). То есть фактически прироста нет. Оговорка: вывод касается только конкретного реранкера, который у меня установлен. С другим реранкером результат может быть совсем иной. 〰️Вывод про гибрид двух эмбеддингов устоял, но стал скромнее. Эффект от объединения двух моделей на честной разметке уменьшился, но остался. Оговорка: это сработает только если найти «нормальный» реранкер, который хорошо сортирует результаты. Без него гибрид расширяет корзину кандидатов, но до пользователя нужные дела всё равно могут не дойти. А существует ли "нормальный" реранкер - я пока не знаю. 〰️ О рейтинге эмбеддингов. На старой разметке все модели после реранкера были статистически неотличимы. К тесту я добавил ещё одну модель, которую часто рекомендуют в юридическом сообществе нейросетей, — deepvk/USER2-base. Значения и рейтинг в таблице к посту. Из рейтинга выделяется топ-3, но в рамках теста разница между этими тремя моделями считается погрешностью (30 вопросов — это небольшая выборка для уверенных выводов). Так что на этой выборке их результаты можно считать равными. Главная находка - USER2-base. Локальная русская модель от deepvk, бесплатная, при этом по качеству не уступает OpenAI ($2.84 за индексацию моего корпуса) и Voyage ($0.63). Без API, без санкционных рисков. Полная версия поста с таблицами и детальным разбором.2,34%