tgindex

я обучала одну модель

описание

Shitposting on various subjects PS рекламы в канале нет

4 530
подписчиков
Охват к подписчикам
149,0%
ERR
Реакции к просмотрам
0,81%
1 098 на 20 постов
Пересылки к просмотрам
1,36%
1 840
Постов в день
0,0
всего 21

Где отзываются чаще

доля реакций к просмотрам
  • 28 мар.Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в вопросах так сказать кибербезопасности, что вырвался из серверов и сам про себя слил пресс релиз раньше срока 🌓 Верим?3,22%
  • 28 июл. 2025 г.Пока что лучшее что я видела в чатике с ACL2,18%
  • 13 авг. 2025 г.без подписи1,74%
  • 10 июл. 2025 г.До ACL еще две недели, но у меня уже есть любимая статья https://arxiv.org/abs/2412.175331,68%
  • 2 мар.Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбить датацентры 👍1,45%
  • 8 мар.Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам предложить вот этот отличный поминутный и посекундный обзор ситуации с перечислением всех релевантных твитов по теме на 27 000 слов. Я думаю нет смысла пересказывать фабулу конфликта, равно как и рассуждать, кто тут поступил правильно, а кто нет. Меня в этом опусе заинтересовали две вещи: легальная сторона вопроса и развитие современной политической теории Во-первых, мне, как и наверное многим другим, стало интересно, что такое all lawful purposes в отношении слежки за людьми. Все уже поняли, что слежка за не-американцами это в целом lawful. Но что интересно, массовая слежка внутри страны (domestic mass surveillance) никак не определена в законе США. Что позволяет в целом представителям государства уверять, что они таким и не занимаются, потому что формально нельзя заниматься тем, чего не существует Согласно Foreign Intelligence Surveillance Act (FISA), США могут собирать сколько угодно данных о не-американцах. Но если в эти данные попадут какие-то сведения и об американцах тоже (например, переписки), тогда это как бы данные, не полученные для слежки специально (obtained incidentally) и пользоваться ими можно. Но есть нюанс: их нельзя анализировать целиком, можно искать в них только какую-то конкретную информацию. Однако ограничений, что это за конкретная информация, в принципе нет – можно там искать что угодно, если это reasonably likely, что вы так обнаружите улики какого-то преступления Но зато можно покупать огромные количества данных об американцах у разных провайдеров и собирать метаданные с телефонов, включая локацию – вот такие данные уже легально анализировать массово, и на это нет никаких ограничений! И как же было было круто, если бы эти данные можно было бы исследовать не глазками и регурными выражениями в питоне, а чем-то прикольным... какой-нибудь моделью.... которая смогла бы для каждого гражданина произвести вайб-чек 🥰 Ситуация с автономным оружием на самом деле схожая: в DoD Directive 3000.09 сказаны, что все подобные системы должны дизайниться с соответствующим (appropriate) уровнем человеческой ответственности за применение силы, но что такое appropriate вам никто не расскажет. Вот тут можно почитать еще деталей на эту тему Очень позабавил разбор твита министра обороны Хегсета, который в целом отражает, мне кажется, уровень правовой дискуссии в США сейчас. Конкретно он написал, что Антропик с этого момента считается Supply-Chain Risk to National Security, и что с этого момента всем контракторам, которые работают с военным комплексом США, нельзя вести никаких коммерческих операций с Антропиком. Давайте проанализируем это высказывание: • Чтоб признать кого-то SCR, нужно осуществитель несколько бюрократических кульбитов, а именно провести оценку рисков, написать декларацию, что нет никакого иного способа защитить страну, кроме как признать Антропик SCR, и уведомить об этом Конгресс. Поэтому заявлять, что что-то там effective immediately по его решению в Твиттере – ну лол удачи • SCR статус касается только государственных контрактов. Даже при удивительном исходе, где Антропик реально признают SCR, другие компании смогут пользоваться их продуктами для чего угодно, кроме как когда они специфично работают над госконтрактами (и продавать Антропику тоже что угодно соответственно). Поэтому запрещать кому-то вести любую коммераческую деятельность с Антропиком - ну лол удачи1,37%
  • 17 июн. 2025 г.было.....1,37%
  • 8 мар.Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое демократия, высказанное многими комментаторами этого конфликта. За четыре года на политологии мы так ни разу и не смогли определить, что такое демократия, поэтому я не буду пытаться это сделать и сейчас. Однако я никогда до этого не видела, чтоб демократию понимали как "все всегда делают то, что государство говорит им делать, и никто никогда не возражает". Мне казалось для этого есть какое-то другое слово.... Фактически у нас есть две позиции: 1) государство может само решить, как и когда следить за людьми, и как пользоваться или не пользоваться оружием, так как оно выбрано демократически, и его решения легитимны, 2) Антропик и лично Дарио могут частным образом решить, что можно и нельзя делать с их продуктом и интеллектуальной собственностью. Я, честно говоря, не очень понимаю, где конфликт между этими двумя тезисами. Конфликт, как мне кажется, появляется, если мы считаем, что государство имеет право произести национализацию средств производства токенов. Но при этом тейки о том, что всем должно управлять государство, я вижу скорее от правачков, чем от левых 🤔 Очень символично, что Хегсет в своих твитах так сильно налегает на слово Республика – я не думаю, что у него есть какие-то строгие философские убеждения, которые он хочет таким образом подчеркнуть, скорее ему нравится красивый термин, но определенный исковерканный руссоистский республиканизм действительно здесь можно найти. Под этим я имею в виду какое-то представление, что в республике происходит объединение наших воль как граждан, и что республика репрезентизует нас всех напрямую, а поэтому законы, порождаемые республикой, – это буквально продолжение наших собственных воль, а поэтому любое сопротивление требованиям республики не то что преступно, а просто невозможно согласно здравому смыслу, раз это сопротивление против самого себя и всех окружающих Я по-крайней мере так интерпретирую тезисы, что раз правительство США было избрано демократически, то любому его требованию, даже ебанутому, необходимо повиноваться, и что у частной компании не может быть своих представлений о добре и зле, поскольку действовать надо в интересах общего блага, а что такое общее благо может знать только государство, потому что см пункт 1. И что вообще преступно даже усомниться, что государство может действовать не в интересах граждан и может нарушать свои же законы, ведь такая мысль анти-демократична, а значит и анти-государственна В этой картине мира также удачно складывается, что мы вообще не разделяем власть народа от власти государства (а власть государства от личных предпочтений и странностей каждого бюрократа), что разные другие демократические атрибуты вроде сдержек и противовесов, демократических институтов, внимания к правоприменению нас тоже не очень волнуют. То есть в целом нас не очень волнует, как республиканизм понимали отцы-основатели США, и что там они писали про защиту политических прав граждан и про то, как в первую очередь необходимо избежать abuse of power со стороны государства, и что люди не ангелы, а потому о надзоре правящих над самими собой необходимо заботиться едва ли не сильнее, чем о надзоре правящих за управляемыми 👍1,33%
  • 23 апр. 2025 г.Reasoning Models Can Be Effective Without Thinking https://arxiv.org/abs/2504.09858 Уже писала парой постов выше, что меня очень интересует вопрос, насколько в ризонинге можно сократить использование большого числа ненужных токенов, но тут авторы сделали еще один шаг вперед и просто убрали ризонинг совсем. То есть сразу после промпта вставляли <|beginning of thinking|> Okay, I think I have finished thinking. <|end of thinking|> чтобы модель генерировала сразу финальный ответ Результаты получились такие: - Даже с отрубленным ризонингом, DeepSeek-R1-Distill-Qwen-32B на всех бенчах строго лучше Qwen-32B-Instruct - Из коробки NoThinking сетап генерирует в 3.3–3.7 раз меньше токенов, чем та же модель с Thinking (то есть, когда модели позволяют целиком сгенерить ризонинг трейс). При этом, бенчи на доказательство теорем NoThinking подход решает даже лучше - На остальных бенчах также ожидаемо pass@1 у NoThinking проседает, и чем больше k мы ставим, тем ближе приближаемся к модели с Thinking. Для меня это слегка неожиданно, так как все последние папиры упирали на sequential scaling (чем дольше модель думает, тем лучше), а не на parallel (много независимых попыток) - Из-за того, что генерации NoThining короче, их как раз можно достаточно хорошо распареллелить. Авторы показывают в том числе, что NoThining Парето-доминирует Thinking по латенси и pass@1, если мы, например, генерируем несколько вариантов ответа и выбираем финальный простым большинством - Если обрывать Thinking модель на определенном числе токенов, чтобы зафорсить ее раньше сгенрировать финальный ответ, то NoThinking окажется строго лучше. То есть не ризонить в принципе оказывается лучше, чем поризонить не до конца. Отчасти можно объяснить это тем, что мы "обрываем" рассуждения модели таком образом в рандомном месте, но все равно неочевидное наблюдение Самые важные здесь для меня выводы в следующем: 1) из первого пункта отлично видно, как RL с ризонингом вытягивает способности модели. То есть, что такие модели получают скоры выше не только потому, что могут дольше думать, планировать или подсматривать в свой набросок решения, но и потому, что просто оказываются умнее. 2) Все еще имеет смысл что-то делать с parallel scaling, хотя мне казалось, что всякие monte carlo tree search c LLM умерли вместе с выходом о11,10%
  • 27 нояб.Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информации, но что-то интересное оттуда все же хочется отметить: Первую половину интервью очень много говорится про генерализацию, и что модели гораздо лучше сейчас себя показывают на бенчмарках, чем действительно способны решать задачи в реальной жизни. Илья это отсутствие генерализации через RL описывает очень удачной метафорой: допустим, есть один студент, который решает стать лучшим в спортивном программировании, он несколько лет решает все существующие задачи, тренируется, выучивает стратегии решений, и в конце действительно становится в этом хорош. Другой студент решает по приколу пройти один курс по спортивному программированию и сразу же становится чемпионом. Если спросить, какой из студентов в дальнейшем будет успешен в карьере (или даже – кто из студентов умнее), скорее всего вы ответите, что второй. Но модели сейчас учат скорее по первому принципу, закидывая в них вообще все существующие задачи в одной области, пока не побьется скор на каком-нибудь бенчмарке Суцкевер такую разницу между моделями описывает как "it factor" – модель либо умная (и, следовательно, генерализуется), либо не очень. Но потом в интервью подозрительно много времени говорят про value functions, и мне показалось, что ключ к тому, как сделать модели умнее и научить из генерализировать свои навыки, Илья видит в них Value function по-хорошему должна нам подсказывать, насколько хорошее или адекватное действие мы сейчас пытаемся предпринять в текущей ситуации. Value functions людей скорее всего очень сложные. Здесь Илья приводит пример одного клинического случая, когда из-за поражения мозга у мужчины отключились все эмоции, и одновременно с этим он стал гораздо хуже принимать любые решения: от того, что надеть сегодня, до финансового поведения – хотя эти вещи казалось бы не сильно связанные. При этом, в нормальном состоянии наши value functions работают очень хорошо, люди довольно быстро выучивают, как водить машину или как делить столбиком. То есть в большом количестве новых ситуаций мы достаточно быстро становимся способны угадать, какие действия выигрышные, а какие лучше не совершать Возвращаясь к примеру со студентами: кажется, что разница между ними в том, что второй умеет учиться, а первый умеет зубрить. Тогда можно ли создать такую value function, которая будет толкать модель выучивать более общие эвристики и глобальные паттерны, а не только ориентироваться в задаче, которую она решает непосредственно сейчас? I.e., научить правильно подходить к решению задач, а не к решению конкретной задачи? Такую всеобъемющую value function, чтобы она могла достаточно хорошо угадывать в большом числе разрозненных доменов, экспраполируя опыт даже из, казалось, не очень связанных областей? Как сам Суцкевер сказал в интервью, there is nothing deep learning cannot do ✏️ И мне кажется нечто подобное они пытаются сварить, хотя понятно, что о конкретных планах SSI он не может особо распространяться1,07%
  • 2 авг. 2025 г.Самые интересные, на мой взгляд, статьи с ACL'25 🙃: - Training Dynamics Underlying Language Model Scaling Laws: Loss Deceleration and Zero-Sum Learning: авторы замечают, что у моделей разного размера на разных этапах обучения происходит loss deceleration – то есть момент, когда лосс резко перестает быстро падать и продолжает снижаться гораздо медленнее. В статье они показывают, что это происходит из-за zero-sum learning: научившись решать какие-то задачи, модель не может научиться чему-то новому, не пожертвовав качеством на уже приобретенных навыках. Чем больше модель, тем больше типов задач она может "поддерживать" параллельно -> тем позже в обучении у нее замедляется падение лосса, и тем большая скорость падения сохраняется после этого перелома - Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic Biases: показывают, что претрен модели на формальных языках (например, Dyck, который состоит из последовательности корректно открытых и закрытых скобок) позволяет ей дальше более эффективно обучаться естественным языкам. Например, модели, предварительно обученной на формальных языках, нужно на 33% меньше токенов на естественном языке, чтобы добиться такого же лосса, как при обычной тренировке только на тексте. Еще показывают, что веса аттеншн-хедов, выученные при тренировке на формальных языках, потом переиспользуются дальше, то есть модели получается выучить что-то о структуре и логике языка из скобочек. Кстати у моего друга Миши есть статья на ту же тему, где он еще находит язык, который лучше всего в итоге транслируется в понимание английского - Byte Latent Transformer: Patches Scale Better Than Tokens: кажется все кроме меня уже ее прочитали, но главная идея в том, что хочется избавиться от токенизации, но при этом разбивать текст на отдельные байты получается слишком неэффективно. Поэтому байты можно сгруппировать по энтропии. Например, в предложении "Daenerys Targeryen is in Game of Thrones, a fantasy epic by George R.R. Martin." легко угадать, что после "Daene" идет "rys", но сложно угадать "is" после "Targeryen", поэтому энтропия там будет высокая, и там можно разбить на два патча - A Little Human Data Goes A Long Way: можно повышать процент синтететических данных в обучающем датасете до 90% без изменения в качестве итоговой модели, но дальше 90% все резко становится хуже. Еще в статье пробовали добавлять человеческие данные в чисто синтетические датасеты: чтобы побить выигрыш от 200 человеческих ответов, надо было докинуть 16к синтетических датапоинтов - Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?: показывают, что очень большое число токенов в long cot довольно бесполезное - 67.8% токенов в среднем не несут пользы, так как не ведут к корректному решению, а 27% шагов, которые LLM перечисляют в решении, по сути являются повторениями одного и того же. Находить ошибки в своих и чужих решениях у моделей на удивление плохо получается, и лучшим критиком в этом плане оказалась GPT-4-turbo, которая заметно впереди более сильных о1-preview и r1 - U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs: помимо бенчмарка там показывают, что модели, которые хорошо умеют решать математику, часто при этом плохо оценивают чужие решения, и наоборот. При этом, у семейств моделей обычно есть свои внутренние баесы: например, Qwen часто признают неправильные ответы правильными, а Claude оценивает горадо строже1,05%
  • 11 авг. 2025 г.Еще одна вещь, которая мне запомнилась с ACL: в своем keynote Luke Zettlemoyer упоминал умопомрачительные успехи RL, которые были обнаружены в некоторых недавних статьях. Например, в Spurious Rewards: Rethinking Training Signals in RLVR показывали, что в принципе Qwen может учиться на рандомных ревордах, или даже на заведомо неправильных (когда модель поощряют за некорректный ответ). Это не единственная в своем роде такая статья, но видимо наиболее всем запомнившаяся. В своей речи Люк сказал, что пока не понятно, с чем связан чудодейственный эффект RL, но мне кажется за пару последних месяцев объяснения уже смогли найти: 1. Банально плохие эвалы, где изначальный перфоманс модели оказывается сильно занижен просто из-за того, что ее ответы не соответствуют ожидаемому формату. Вот в этом репорте можно увидеть разборы многих последних популярных статей по RL, где продвигается обучение с очень странными ревордами, или без ревордов в явном виде (как правило это обучение, где минимизируется или максимизируется энтропия), и практически во всех случаях выводы статьи оказываются несостоятельны, потому что авторы некорректно посчитали изначальные скоры 2. В самих алгоритмах PPO и GRPO уже есть байес. Даже с рандомным ревордом, у этих алгоритмов всегда есть предрасположенность еще чаще выбирать действия, которые уже являются вероятными. Происходит это из-за clipping factor, который ограничивает то, насколько большой может быть апдейт за один шаг, но при этом он не позволяет этому апдейту быть совсем нулевым. Хотя по-хорошему, с рандомными ревордами градиент должен как раз должен быть около 0 и никаких изменений в полиси модели происходить не должно (алгоритмы вроде REINFORCE это обеспечивают) В целом, сами авторы Spurious Rewards развивают эту мысль в статье (но видимо до этого момента мало кто дошел): они говорят, что Qwen модели изначально имеют некоторую предрасположенность решать математические задачи с помощью вспомогательных кусков кода. После обучения с GRPO они все чаще начинают генерировать код, и это помогает им решать задачи лучше. В то время как в LLaMA-моделях склонности к коду изначально нет, и поэтому такой магический RL на них не работает Оба этих пункта, как мне кажется, очень важно учитывать при дизайне своих исследований; на ACL было достаточно работ и с очень плохими эвалами, и с очень странными RLем, так что проблема актуальная..........😫1,00%