tgindex
L
@llmfolksрусский

Канал для сопричастных к разработке и использованию больших языковых моделей

Последний пост
8 авг.
Последнее чтение
13 авг.
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
71
+2 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
61
20 постов
Вовлечённость
85,9%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
51
1/48двое суток
58
1/72трое суток
63

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Мир никогда не будет прежним. Канадский стартап Taalas научился "запекать" LLM(Llama 3.1 8B) прямо в железные чипы - в них нельзя заменить модель, но зато скорость инференса феноменальна. Можно вот тут протестировать: https://chatjimmy.ai/ Отвечает со…

  • 5 авг.413из profunctor_io

    без подписи

  • Андрей Карпатый — автор термина «вайбкодинг» — поделился ещё одним полезным способом работы с LLM(он назвал это Rambling). Если лень долго формулировать задачу текстом, можно включить голосовой ввод и минут десять просто проговаривать всё подряд: мысли, сомнения, идеи, контекст — даже бессвязно и с ошибками. LLM на удивление хорошо распутывает этот поток сознания и возвращает его уже в виде понятной структуры. В итоге модель лучше понимает, чего вы хотите, а вам приходится реже её поправлять. Короче: не можете написать хороший промпт — просто наговорите плохой, но длинный. Иногда это работает даже лучше.

  • Похоже, у нейросетей началось негласное соревнование на тему «кто натворит больше делов в реальном мире». Недавно OpenAI признала, что её модели сбежали из тестовой среды через уязвимость нулевого дня и проникли на рабочие серверы Hugging Face. Вслед за ними Anthropic внезапно выяснили, что их модели семейства Claude тоже выходили во внешний интернет и успешно взломали три реальные организации. Как это произошло? Anthropic тестирует модели в играх формата CTF (Capture the Flag), где ИИ должен взломать виртуальный сервер. В системном промпте моделям было жестко прописано: «Вы в симуляции, интернета нет». Но из-за ошибки конфигурации у тестовых контейнеров оказался доступ в реальную сеть. Claude принял настоящий интернет за часть игрового полигона и пошел в атаку. Инцидент 1: Claude Opus 4.7 против реального бизнеса Вымышленная компания из теста случайно совпала по названию с реальной организацией, у которой был рабочий сайт. Когда Claude Opus 4.7 не смог достучаться до локальной цели, он просто погуглил и нашел реальный сервер этой фирмы в сети. Решив, что это часть задания, ИИ нашел слабые пароли и открытые эндпоинты, взломал инфраструктуру, вытащил учетные данные приложений и получил доступ к базе данных с сотнями строк реальных пользовательских данных. Самое интересное: по логам «мыслей» видно, что в процессе взлома модель поняла, что сервер настоящий. Но ИИ сам себя убедил, что «разработчики теста просто добавили реальную компанию для реализма», и продолжил взлом. * Инцидент 2: Модель Claude Mythos 5 создала и опубликовала на реальном PyPI вредоносный пакет. Его скачал автоматический сканер реальной ИБ-компании. Код сработал, украл пароли компании и передал их ИИ, который использовал их для дальнейшего проникновения. Чтобы зарегистрировать аккаунт, ИИ сам обошел ограничения: нашел почтовый сервис без подтверждения по телефону, так как не смог раздобыть денег на покупку виртуального номера. * Инцидент 3: Тестовый прототип просканировал 9 000 целей в сети и взломал одну компанию через SQL-инъекцию. Но эта модель оказалась сознательнее: поняв, что сервер настоящий, она сама прекратила атаку. Итог: Это пока еще не восстание машин, модели просто выполняли приказ «найти флаг любой ценой». Тем не менее, способность ИИ самостоятельно регистрировать почту, обходить ограничения, публиковать пакеты и взламывать реальные базы данных ради «оценки за тест» — это новая реальность, к которой мир ИБ еще не готов.

  • 30 июл.451из profunctor_io

    без подписи

  • Меня кстати немного подбешивает термин мультиагентность. Можно разбить большой промпт на два маленьких и назвать это мультиагентной системой. Маркетологи от ИИ сейчас вешают этот ярлык на всё, что движется. Написал последовательную цепочку из трёх вызовов API? Поздравляю, у тебя «мультиагентный пайплайн». Сделал роутер на простых условиях, который перенаправляет запрос в разные LLM в зависимости от темы? Ого, это же «динамический оркестратор автономных агентов»! В реальности 90% того, что сегодня называют мультиагентными системами — это обычные цепочки ) или классические конечные автоматы, которые разработчики десятилетиями писали на обычном коде. Просто теперь вместо детерминированных функций у нас промпты, а вместо условий — LLM-классификаторы. Зачем плодить сущности там, где они не нужны? Часто разработчики создают «агента-приветственника», «агента-аналитика» и «агента-редактора», которые по очереди перекидывают друг другу один и тот же контекст. В итоге мы получаем три проблемы: 1. задержка. Пока каждый агент подумает, сформирует свой JSON, передаст его дальше — пользователь успеет закрыть вкладку. 2. Испорченный телефон. Первый агент недопонял нюанс, второй на основе этого додумал глупость, третий красиво упаковал бред в итоговый ответ. 3. Раздутый счет за токены. Системные инструкции для каждого агента, накладные расходы на парсинг и форматирование сжирают бюджет мгновенно. Когда мультиагентность реально оправдана? Настоящий мультиагентный подход начинается там, где у сущностей появляются: * Разные наборы инструментов (tools) и изолированные окружения. Например, один агент умеет только безопасно крутить SQL-запросы к базе данных, а второй — запускать сгенерированный Python-код в изолированной песочнице для построения графиков. * Конфликтующие цели (adversarial setup). Классическая схема «генератор-критик» (или LLM-as-a-judge). Когда один агент пишет код, а второй (ревьюер) целенаправленно пытается найти в нем уязвимости и баги. В таком споре действительно рождается качество. * Асинхронность и параллельное выполнение. Когда нужно запустить десять независимых исследователей в разные ветки интернета, а потом собрать их отчеты воедино. Во всех остальных сценариях старый добрый принцип KISS (Keep It Simple, Stupid) работает безотказно. Один хорошо структурированный системный промпт с четкими правилами и парой Few-Shot примеров почти всегда отрабатывает быстрее, точнее и дешевле, чем банда из пяти виртуальных «агентов», спорящих о том, кто из них должен поставить запятую. А как вы относитесь к засилию «агентов» в архитектурных схемах? Это реальный сдвиг парадигмы в разработке или просто красивое словечко для презентаций

  • Как-то грустно все. Начинаю чувствовать себя в кибер-панке. (Клара - ИИ агент)

  • без подписи

  • без подписи

  • Оказалось, что диалоги с DeepSeek, которыми делились пользователи, были доступны для индексации, и Google их успешно проиндексировал. Можете прямо сейчас вбить в Google site:chat.deepseek.com/share, нажать «Показать скрытые результаты» и подслушать, о чём люди с иишкой советуются (да-да, это неэтично). Вывод? Дайте сотрудникам нормальный корп-доступ к ИИ, чтобы они не рассказывали публичному Дипсику ваши секретики.

  • 19 июл.7271из lidagdelidi

    ⚡️НОВЫЙ ВЫПУСК⚡️ ИИ-кейсы | Как внедрить AI в бизнес? В новом выпуске подкаста «Лида, где лиды?» говорим о том, как AI перестает быть просто помощником в чате и становится полноценным инструментом для бизнеса. Обсуждаем реальные кейсы внедрения AI-агентов, автоматизацию продаж, маркетинга и внутренних процессов, безопасность корпоративных данных, контроль затрат на нейросети и то, каким станет бизнес в ближайшие годы. Ведущая: 🔹 Марина Шахова — сооснователь и директор по маркетингу digital-агентства MediaNation Гости: 🔹 Стас Брановицкий – CEO Wikiagent 🔹 Иван Красников – CPO Wikiagent В выпуске: ▪️Что такое ИИ-агенты? Как они работают? ▪️Кейсы: как нейронки могут повлиять на бизнес? ▪️В какие бизнес-процессы внедрять нейросети? ▪️Разница между ботом и ИИ-агентом ▪️Какие минусы у нейронок? ▪️Что такое WikiAgent? ▪️Как создать единую систему использования нейросетей в компании? ▪️Кто отвечает за внедрение ИИ в компаниях? ▪️Как обезопасить данные от утечки? ▪️Что ждет компании и экономику через год? 👀 Смотреть - YouTube - Вконтакте - Дзен 🎧 Слушать - на всех платформах

  • Правда не CPO, а СTO и не только Wikiagent, а всего Wikilect. А так все чистая правда :)

  • Греф на пленарном заседании Совета федерации 17 июля заявил, что в России осталась только одна полностью отечественная ИИ–модель — от «Сбера». «Яндекс», по его словам, «дообучает Qwen» Интересный конечно вопрос - что лучше - потупее но свое, или поумнее но "усыновленное". https://www.kommersant.ru/doc/8829326

  • без подписи

  • Управляйте идеями, а не кодом: манифест создателя Redis о будущем программирования Легендарный разработчик Сальваторе Санфилиппо (antirez) — создатель СУБД Redis и автор нового движка локального инференса LLM DwarfStar — опубликовал мощный манифест о том…

  • Управляйте идеями, а не кодом: манифест создателя Redis о будущем программирования Легендарный разработчик Сальваторе Санфилиппо (antirez) — создатель СУБД Redis и автор нового движка локального инференса LLM DwarfStar — опубликовал мощный манифест о том, почему классический подход к написанию и ревью кода умирает. Многие программисты сегодня чувствуют себя потерянными или считают, что «предают профессию», перекладывая написание кода на AI. Сальваторе уверен: индустрия совершает болезненный, но невероятно крутой эволюционный скачок. Вот его ключевые мысли о том, как выжить и победить в новую эпоху: 1. Главный навык теперь — Управление идеями Если вы полностью контролируете архитектуру и концепты вашего ПО, построчное чтение кода становится неэффективным. AI позволяет генерировать тысячи строк кода в день. Пытаться делать ревью 5000 строк ежедневно вручную — путь к выгоранию и потере фокуса. 2. Разделение труда: архитектура — человеку, реализация — моделям LLM превосходно пишут локально оптимизированный код, но пока слабы в глобальном дизайне. Не нужно читать код строчка за строчкой. Управляйте архитектурой, спрашивайте модель: «Как именно устроен этот модуль? Почему выбран такой подход?» и оценивайте саму концептуальную модель. Это в разы быстрее. 3. Чтение кода — это компромисс за счет вашего времени В сутках всего 8 рабочих часов. Если вы тратите их на чтение и ручную правку кода, вы отбираете время у действительно важных задач: * Проектирование новых фич и векторов развития продукта. * Поиск неочевидных оптимизаций. * Тестирование. 4. «Slop» существовал задолго до AI Критики ИИ любят ругать сгенерированный код за низкое качество («slop»). Но Сальваторе напоминает: объём низкокачественного кода, написанного людьми за последние 15 лет, просто запредельный. В сложных, быстро меняющихся доменах строгое проектирование и автотесты работают намного лучше, чем написание GPU-ядер вручную. 5. Построчный ревью умирает Сальваторе признаётся, что до сих пор вручную проверяет AI-код для Redis, но считает это пережитком прошлого. Новейшие модели (вроде GPT-5.6 Sol или Fable) находят тонкие баги и race conditions гораздо лучше людей. Вместо ревью кода Сальваторе мечтает тратить время на написание качественных DESIGN.md файлов. В будущем именно они станут главным интерфейсом: вы читаете дизайн-документ, понимаете идею, а затем ставите задачу AI-агенту. Что делать новичкам? Учиться программировать и строить ментальные модели систем всё ещё нужно. Но не тратьте время на ревью рутинного кода (вроде клиентского JS для заказчиков). Хотите вырасти? Напишите с нуля свой интерпретатор, простую базу данных или хэш-таблицу. Резюме: Мир изменился. Перестаньте быть «надсмотрщиками над кодом». Становитесь архитекторами идей, инвестируйте время в QA, дизайн и стратегию. А как изменился ваш процесс разработки за последний год? Пишете руками или уже полностью перешли на уровень «управления идеями»?

  • без подписи

  • Есть такой Мэтт Шумер — известный американский ИТ-предприниматель, инвестор, создатель популярного open-source инструмента GPT-Prompt-Engineer и основатель компании OthersideAI (ИИ-помощник HyperWrite), получивший широкую известность в 2026 году благодаря вирусному эссе о прорыве в самообучении искусственного интеллекта. В общем, чувак с крутыми ИИ-регалиями. Но эти регалии не помешали ему выдать агенту (на GPT-5.6) полные права на работу с консолью, что в свою очередь дало возможность агенту случайно удалить все файлы из рабочей директории. Мэтт уверен, что такая подлость не случилась бы с Fable 5 (не факт). В комментах отметился злорадствующий Илон Маск. Что делать? На самом деле непонятно — все подсели на ускорение от агентской разработки, и перейти в режим «подтверждаю каждое действие» тяжело. Статический анализ и нейронки, анализирующие безопасность действий — все это уже есть (и, судя по всему, работает не на 100%). Точно полезный совет: бэкапы. Делайте бэкапы.

  • Почему восстание машин в юриспруденции пока откладывается В мире ИИ-агентов сейчас разворачивается настоящая драма, за которой очень интересно наблюдать. Есть такой бенчмарк — Harvey's Legal Agent Benchmark. В нем ИИ-агенты соревнуются в решении реальных юридических задач: анализируют законы, готовят документы, составляют заключения и так далее. За последние дни там произошли тектонические сдвиги: * 8 июля Grok 4.5(как-раз писал про него вчера) ворвался в рейтинг с результатом 12.92%, обойдя предыдущего лидера — Claude Fable 5 (у которого было 11.25%). Большой прорыв, все дела. * Но уже на следующий день, 9 июля, запрещенная в РФ Meta с моделью Spark 1.1 показала в этом же рейтинге сразу 20%. Телеграм-каналы тут же начали громко писать про скорую смерть профессии юриста и неизбежное сокращение штатов. Но дьявол, как всегда, кроется в деталях. Важная деталь: живой юрист уровня middle/senior набирает на этом бенчмарке 95-96%. То есть разрыв между возможностями человека и лучшими ИИ-моделями в мире все еще колоссальный. Почему так? Дело в том, что Harvey's Benchmark устроен максимально жестко: задание засчитывается только в том случае, если оно выполнено абсолютно идеально. Любая мелкая помарка, опечатка, неточная формулировка или перепутанная ссылка на документ — и за всю задачу ставится круглый ноль. Для реальной юридической практики это логично: цена ошибки в договоре или судебном иске может быть огромной. Но для современных больших языковых моделей это непреодолимый барьер. Им по-прежнему невероятно тяжело выдавать стабильный результат без галлюцинаций и доводить сложные задачи до конца с абсолютной точностью. Вывод: Пока рано интегрировать LLM в системы где высокая цена ошибка. Не забываем про Human-in-the-loop

  • ИИ-маркетолог как любой порядочный подрядчик начинает работу с критики своих предшественников :)