tgindex

Machine learning Interview

описание

ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно! Вопросы - @workakkk РКН: clck.ru/3FmwRz

30 098
подписчиков
Охват к подписчикам
9,4%
ERR
Реакции к просмотрам
0,65%
1 240 на 48 постов
Пересылки к просмотрам
1,65%
3 150
Постов в день
1,7
всего 63

Где отзываются чаще

доля реакций к просмотрам
  • 15 авг.🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков Проект kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ. Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов. Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды. Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference. github.com/FareedKhan-dev/kimi-k3-in-c #AI #Kimi #LLM #C #LocalAI1,90%
  • 5 авг.DeepSeek начался не с архитектуры модели. Возможно, он начался с поездки в Тибет. В 2011 году 26-летний Лян Вэньфэн отправился на старом Fiat в одиночное путешествие. Спутник улетел домой из Лхасы, а Лян продолжил путь на запад - к Гималаям и в безлюдные районы Али. Он проехал сотни километров вглубь плато, фотографируя пейзажи на Nikon D50. Ради одного удачного кадра мог ждать света половину дня. Затем он пропал почти на неделю. Позже в его предположительном аккаунте появилось сообщение: Лян выбрался, но Fiat остался на бескрайнем высокогорном плато. That's the END. Через 12 лет он основал DeepSeek. И в этой истории легко увидеть будущий стиль компании. Пока другие спешили к быстрой коммерциализации, DeepSeek сосредоточилась на фундаментальных моделях. Пока конкуренты компенсировали проблемы вычислительными бюджетами, команда пыталась выжать максимум эффективности. А вместо громкой публичности и закрытых релизов выбрала низкие цены и открытые модели. Конечно, путешествие не объясняет технический успех DeepSeek. Но оно хорошо показывает характер человека, стоящего за компанией: • ехать дальше остальных, терпеливо ждать результата, рисковать ресурсами и спокойно оставлять потерянное позади. Иногда стратегия бизнеса рождается не в презентации для инвесторов. Иногда она становится продолжением личности основателя.1,89%
  • 2 авг.без подписи1,84%
  • 8 авг.«Мы протестируем модель в тщательно спроектированной песочнице без доступа к интернету.» Тщательно спроектированная песочница через минуту после запуска агентов.1,56%
  • 7 авг.Ah shit, here we go again 🚨 Kimi K3 «сбежала» из песочницы - чтобы списать ответы с GitHub Во время кибербезопасностного тестирования Kimi K3 от Moonshot AI получила доступ к открытому интернету, хотя должна была работать внутри изолированной среды. Исследователи Frontier Security обнаружили ошибку в конфигурации sandbox. Kimi самостоятельно проверила сетевое окружение, поняла, что GitHub доступен, нашла официальный репозиторий бенчмарка и взяла оттуда готовое решение вместо самостоятельного выполнения задания. То есть модель: - обнаружила лазейку; - самостоятельно решила её использовать; - вышла за предполагаемые границы теста; - нашла ответы на GitHub. Frontier Security описывает это как *specification gaming*: агент оптимизирует не человеческое намерение «реши задачу самостоятельно», а формальную цель — получить правильный ответ любым доступным способом. Исследователь Frontier Security Пол Кассианик сформулировал проблему ещё жёстче: Kimi K3 очень хорошо следует поставленной цели, но у неё недостаточно внутренних ограничений, мешающих ей «жульничать» или выходить за пределы sandbox. Источники: https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/ https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/ #AI #KimiK3 #CyberSecurity #AIAgents1,45%
  • 3 авг.LLM придумывают исследования заметно уже людей Исследователи сравнили идеи девяти моделей с идеями из 11 683 реальных научных работ. Условия были одинаковыми: и людям, и LLM давали один набор близких предыдущих исследований и просили найти новый научный вопрос и предложить метод. Разница оказалась не столько в качестве отдельной идеи, сколько в разнообразии подходов. Люди чаще искали причины явлений, проверяли ограничения, меняли отдельные механизмы, создавали инструменты измерения и изучали сбои. Модели в основном выбирали безопасный сценарий: соединить две существующие работы или объединить несколько методов. Такую мотивацию использовали только 12,1% человеческих идей, но от 47,1% до 64,2% идей LLM. Синтез и объединение стали основным методом в 5,1% человеческих работ против 22,5–38,7% у моделей. Показательный результат: более долгое рассуждение не расширило диапазон идей. В некоторых тестах модели ещё сильнее концентрировались на знакомых шаблонах. LLM могут быстро выдать убедительную научную гипотезу. Но при массовом использовании они рискуют снова и снова предлагать одну формулу: возьмём A, соединим с B и назовём это новым методом. Исследование показывает важное ограничение AI Scientist: модель может хорошо развивать найденное направление, но выбор самого направления пока остаётся заметно человеческой задачей. arxiv.org/abs/2607.012331,39%
  • 1 окт. 2025 г.без подписи1,31%
  • 12:40🚀 DeepSeek Harness набрал 122K+ звёзд на GitHub всего за 3 дня и стал одним из самых быстрорастущих репозиториев в истории платформы. Harness сделан как оркестрационный слой, где почти всё можно заменить плагином: • модель • shell • редактирование файлов • web search • skills • storage • sessions • reasoning effort • permission scope • UI • scheduling Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение. sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше. MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель. Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз. А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст. То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего. https://github.com/deepseek-ai/deepseek-harness1,25%
  • 13 авг.🚀 DeepSeek-V4-Pro (Max) может снова сломать рынок цен на ИИ-модели В Code Arena WebDev AutoEval модель набрала 1607 баллов - всего на 15 меньше GPT-5.6 Sol xHigh. Но самое интересное здесь цена: по приведённым тарифам DeepSeek обходится примерно в 31 раз дешевле по смешанной стоимости токенов. Kimi K3 Max пока впереди с 1674 баллами, но при цене $3/$15 за 1 млн токенов её смешанная стоимость почти в 16 раз выше. А Code Arena WebDev - это не обычный тест на генерацию кода. Модели должны собирать полноценные интерактивные веб-приложения. Если результаты и цены сохранятся на релизе, DeepSeek-V4-Pro (Max) серьёзно сдвинет Pareto frontier: почти топовое качество за радикально меньшие деньги. https://x.com/Machinelearrn/status/2087834035405889937 @machinelearning_interview1,25%
  • 15 авг.✔️ OpenAI заменила Chronicle на Computer History в десктопной версии ChatGPT В десктопном ChatGPT вместо Chronicle заработала Computer History. Прежний механизм собирал контекст скриншотами экрана, новый пишет журнал действий - клики, ввод текста, шорткаты, переключение окон. События складываются в единую хронологию и лежат локально. Сбор по умолчанию выключен. В настройках приватности можно вывести из-под наблюдения отдельные приложения и сайты. Разобрав журнал, ChatGPT замечает повторяющиеся действия и предлагает собрать под них сценарий для рутинной задачи. На тот же журнал опираются ответы ChatGPT и Codex - их можно спросить, например, как правился конкретный файл. Computer History работает на macOS у подписчиков Pro, Business и Enterprise. chatgpt.com ✔️ Claude Code научился возобновлять генерацию после сброса лимитов Если генерация обрывается на лимите сообщений, теперь можно включить ожидание вместо перезапуска. Когда квота обновится, Claude Code подхватит контекст и продолжит с места остановки. Раньше прерванную задачу приходилось поднимать руками - жать Try again или отправлять команду заново. ClaudeDevs в X ✔️ X открыла код алгоритма рекомендаций Соцсеть выложила на GitHub расширенную версию кода, который собирает ленту For You. Кодовая база выросла - добавились конфигурации моделей, внутренние фильтры и веса сигналов в основном движке ранжирования. Закрытыми остались только антиспам-модули на Grok - чтобы владельцы ботнетов не разобрали их и не научились обходить. В настройках Х появился инструмент Under the Hood, который выгружает JSON со статистикой аккаунта. В файле видно, какие системные метки система навесила на профиль и отдельные посты за последний месяц, - по ним можно понять, не попал ли аккаунт под ограничения. JSON вместе со ссылкой на репозиторий можно скормить сторонней модели и разобраться, почему просели охваты. Пока выгрузка работает в пилоте - аккаунт должен быть старше года и выпускать хотя бы десять постов в месяц. X Open Source ✔️ В Калифорнии школьники будут советовать властям, что делать с ИИ Губернатор штата объявил о создании консультативного совета из 20 старшеклассников, который будет участвовать в разработке правил в сфере ИИ. Первая группа уже обсуждает с чиновниками, как внедрять генеративные модели в школы, как защищаться от дипфейков и где проходят этические границы ИИ. Осенью откроется набор новых участников. На весну 2027 года намечена отдельная программа, где подростков научат запускать собственные проекты в цифровой среде. Калифорния стала вторым штатом с молодежным советом по ИИ - такой же с 2025 года работает в Нью-Йорке. gov.ca.gov ✔️ Bank of China начал кредитовать разработчиков под расход токенов Один из четырех крупнейших госбанков Китая запустил программу Computing Power Token Loan. ИИ-разработчикам дают до 30 млн юаней (около 4 млн долларов) на срок до трех лет. Залог не нужен - вместо него банк смотрит на расход токенов, стоимость контрактов на вычисления и выручку от ИИ-продуктов. Аналитики настроены скептически по двум причинам. Во-первых, расход токенов показывает, насколько активно компания работает, но ничего не говорит о том, зарабатывает ли она. Во-вторых, метрику легко накрутить лишними вызовами API, чтобы поднять себе лимит. Чтобы это отслеживать, нужен независимый аудит логов потребления, а таких площадок пока нет. cls.cn @ai_machinelearning_big_data #news #ai #ml1,11%
  • 30 июл.🔥 OpenAI совершила разворот на 180° Ещё год назад GPT-5 выглядел как провал, Claude Code уходил вперёд, а Anthropic усиливала позиции в корпоративном сегменте. Теперь картина изменилась: GPT-5.6 получил сильный запуск, ChatGPT достиг 1 млрд активных пользователей, а Codex и ChatGPT Work вместе превысили 10 млн пользователей. По словам финансового директора OpenAI Сары Фрайар, июльский годовой темп выручки уже превысил всю выручку за второй квартал. Anthropic тем временем пришлось отдельно объяснять свою позицию по open weights и разбираться с противоречивым запуском Fable 5. OpenAI учла ошибки, вернула технологическое лидерство в центр дискуссии и снова набрала мощный темп. Этот камбэк действительно стоит изучать. https://www.cnbc.com/2026/07/29/openai-cfo-sarah-friar-tells-employees-arr-in-july-topped-all-of-q2.html1,07%
  • 15 авг.🚨 Anthropic больше чем удвоила выручку всего за один квартал. По предварительным данным, во втором квартале компания получила более $11,5 млрд против $4,73 млрд в первом. Год к году рост составил примерно 14 раз. И это первый квартал, когда Anthropic вышла в положительную скорректированную операционную прибыль. Ещё в мае annualized revenue run rate компании превысил $47 млрд. Основной спрос идёт со стороны бизнеса, особенно на Claude и инструменты для программирования. Для сравнения: всего год назад Anthropic находилась на уровне около $3 млрд annualized revenue. Claude буквально превратился в машину по печатанию денег.1,05%