Levix 空间站
Статистика主要分享前端、AI 以及前沿科技资讯。 🚫 禁止人身攻击:请在评论区保持尊重和友好,避免不当言论和负面互动。 🚫 禁止违规内容:请勿发布任何黄赌毒、宗教极端、政治敏感或其他违反社区规定的内容。 主要分享前端以及业界科技资讯。 🚫 禁止广告与刷屏:为了维护良好的交流环境,请不要进行任何形式的广告推广、黑产活动、刷屏行为及发布不适内容。 🔒 保护个人信息:请注意个人隐私和网络安全,不要在评论区泄露个人信息或点击不明链接。
- Последний пост
- 14 авг.
- Последнее чтение
- 15 авг.
- Постов за неделю
- 16
- Всего постов
- 192
- Тип
- открытый
- Язык
- китайский
- Категория
- Для взрослых (по похожим)
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 30
- 1/48двое суток
- 34
- 1/72трое суток
- 37
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Google Sheets 新增 Sheets canvas:用 Gemini 把表格变成可交互“小应用” Google 宣布为 Google Sheets 推出新功能 Sheets canvas。面对动辄几百行的表格,用户现在可以直接告诉 Gemini 自己想看到什么,它会根据现有数据生成更直观、可操作的界面,例如仪表盘、学习进度表、座位安排图等,不需要自己写公式或代码。 Sheets canvas 相当于覆盖在表格数据之上的一个动态读写层。原来的数据仍然保留在 Google Sheets 中,但可以换一种方式查看、编辑和操作。用户在 canvas 中修改内容,原表格会同步更新;直接修改表格,canvas 里的结果也会实时变化。生成之后,还能继续用自然语言要求 Gemini 调整布局、视觉设计或功能。 Google 给出的几个例子很具体。学生可以把一长串课程和作业整理成学习追踪器,用来查看进度、提醒截止日期和安排一周任务;玩 fantasy football 的用户可以做一套球队仪表盘,对比球员数据和表现;筹备婚礼时,也可以把 RSVP 名单变成交互式座位图,直接拖动宾客调整桌位,同时让中央表格保持更新。 由于 canvas 本身就是 Google Sheets 里的一个标签页,它也沿用了表格原有的协作和分享方式。这样一来,很多过去需要在行列、筛选器和公式之间来回操作的工作,可以直接变成更接近应用界面的使用体验。 目前 Sheets canvas 已面向 Google AI Pro 和 Ultra 订阅用户以英文在全球提供,并从 8 月 13 日起陆续向符合条件的 Google Workspace Business、Enterprise Standard / Plus 用户,以及 Google AI Pro for Education 附加服务用户开放。使用时,只需打开 Google Sheets,在 Ask Gemini 侧边栏中选择 “Create canvas” 即可开始创建。 #Google #Sheets #AI https://blog.google/products-and-platforms/products/workspace/sheets-canvas-for-google-sheets-spreadsheets/
Google 发布 Gemini 3.7 Flash,重点提升编程与智能体能力 它距离 3.6 Flash 上线只有三周,定位仍是兼顾性能、速度和成本的主力模型,但这次把升级重点放在软件工程、网页开发、知识工作和企业智能体流程上。 Google 公布的测试显示,3.7 Flash 在 FrontierCode 1.1 Main 生产代码评测中得到 43.6%,3.6 Flash 为 34.4%;长周期软件工程评测 DeepSWE v1.1 提升至 65.3%,前代约为 49.0%。 网页开发方面,它在 WebDev Arena 获得 1588 Elo,超过 3.6 Flash 的 1538。Google 称,新模型调试和解决问题的能力更强,首次生成代码的准确率更高,也能用较少轮提示生成更完整的应用,并根据截图、图片或设计系统还原界面。 这次升级也覆盖专业文档和业务流程。3.7 Flash 在复杂 PDF 理解评测 GDP.pdf 中得到 34.0%,3.6 Flash 为 22.0%;在企业流程自动化评测 AutomationBench 中得到 30.4%,前代为 17.0%。 Google 表示,模型遇到阻碍时更会调整做法,需要时会主动澄清意图,在多步规划、工具调用和指令遵循上也更稳定。这些结论主要来自 Google 公布的基准测试与早期客户反馈,实际表现仍取决于具体任务和智能体系统的设计。 Gemini 3.7 Flash 支持文本、图片、视频、音频和 PDF 输入,上下文窗口为 100 万 token,最大输出为 64K token,并支持函数调用、搜索和计算机操作。 开发者现在可以通过 Gemini API、Google AI Studio、Android Studio 和 Google Antigravity 使用;企业用户可在 Gemini Enterprise 相关产品中接入。 Gemini Spark 也已开始采用该模型,面向 160 多个国家和地区的 Google AI Pro 与 Ultra 订阅用户,用于整理文件、起草邮件和更新状态文档等任务。 年内推广价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。该价格持续到 2026 年 12 月 31 日;从 2027 年 1 月 1 日起,将分别恢复至 1.50 美元和 7.50 美元。Google 还为模型更新了针对化学、生物、放射性与核风险以及网络攻击滥用的安全措施。 #AI #Google #Gemini #模型 https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
Cerebras 为 GPT-5.6 Sol 推出 Ultrafast 模式,最高达到每秒 750 个输出 token Cerebras 公布了与 OpenAI 合作的 GPT-5.6 Sol Ultrafast 模式。这项服务将率先进入 OpenAI API,目前只向少数客户开放预览,后续会随算力扩充逐步扩大使用范围。Cerebras 称,其输出速度最高可达 750 tokens/s,模型质量与普通版本保持一致。 按 Artificial Analysis 公布的速度数据,GPT-5.6 Sol Ultrafast 的运行速度约为 Claude Fable 5 的 11 倍、Claude Opus 4.8 Fast 模式的 5 倍。 Cerebras 还使用 Humanity’s Last Exam 做了内部测试。这套基准包含 2500 道横跨化学、经济学和文学等领域的高难度问题。采用 xhigh 推理强度后,Sol Ultrafast 在 11 小时 11 分钟内完成全部问题;Claude Fable 5 用时 78 小时 27 分钟。Cerebras 表示,两者准确率相近,前者完成整套测试的速度接近后者的 7 倍。 另一项测试更贴近日常工作。Cerebras 在 Codex 中以 medium 推理强度运行 GDP-Val,比较 GPT-5.6 Sol 普通模式和 Ultrafast 模式。结果显示,Ultrafast 在法律文书、财务模型和工程报告等知识工作中实现了 5.6 倍端到端加速,公司称质量没有下降。这里的“端到端”不只计算生成 token 的速度,也包括完成整项任务所需的时间。 速度提升来自 Cerebras 的晶圆级芯片架构。大型模型在 GPU 上推理时,模型权重需要反复在片上内存和外部存储之间搬运,容易受到内存带宽限制。Cerebras 在每块晶圆级芯片上配置 44 GB SRAM,让权重留在芯片上,token 则沿着分布在多块晶圆上的模型层连续流动,以减少数据搬运带来的等待。 这项能力瞄准的是时间敏感型任务,例如排查线上服务故障、响应网络攻击,以及需要快速迭代的编程和研究工作。现阶段的数字仍主要来自 Cerebras 的内部测试,实际提升会受任务、配置和模型影响;价格、具体申请条件与全面开放时间,原文没有公布。 #AI #OpenAI #ChatGPT https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai
ChatGPT 正式推出 Linux 桌面客户端预览版 OpenAI 已开放 ChatGPT Linux 桌面客户端预览版。它把 ChatGPT、项目、本地文件和 Codex 带到 Linux 桌面,目前支持 Ubuntu 24.04 LTS、Ubuntu 26.04 LTS、Debian 13,以及 Fedora 43、44。每个发行版都提供 x64 和 ARM64 两种架构的软件包。 安装前可以在终端运行 uname -m 确认处理器架构。返回 x86_64,应下载 x64 版本;返回 aarch64 或 arm64,则下载 ARM64 版本。 Ubuntu 和 Debian 使用 .deb 包,通过 sudo apt install ./chatgpt_amd64.deb 安装;Fedora 使用 .rpm 包,可运行 sudo dnf install ./chatgpt.x86_64.rpm。ARM64 设备需要把命令中的文件名换成相应版本。 安装完成后,用户可以从应用菜单启动,也可以直接在终端运行 chatgpt。首次使用需要登录 ChatGPT 账号。软件包在安装时还会配置经过签名的 OpenAI 软件源,后续更新可以继续交给系统包管理器。Ubuntu 和 Debian 用户运行 sudo apt update 后,再执行 sudo apt install --only-upgrade chatgpt;Fedora 用户运行 sudo dnf upgrade --refresh chatgpt。 这仍是预览版本,功能并未与 macOS、Windows 完全对齐。Computer Use 目前还不能在 Linux 版使用,OpenAI 表示将在后续版本加入。其他 Linux 发行版可能可以运行,但不属于官方支持范围。 Wayland 原生支持同样处于实验阶段。应用会在可用时默认借助 XWayland 运行;如果希望尝试原生 Wayland,需要彻底退出应用,再从终端运行 chatgpt --ozone-platform=wayland。在这一模式下,悬浮窗口、窗口定位、焦点和键盘快捷键仍可能出现兼容问题。 #AI #ChatGPT #Linux https://learn.chatgpt.com/docs/linux/linux-app
DeepSeek 开源官方智能体框架 DeepSeek Harness DeepSeek 于 8 月 13 日公开了 DeepSeek Harness。这是一套把模型接入文件、终端、工具和会话系统的智能体运行框架。项目采用 MIT 许可证,目前版本为 0.1.0-rc.5,官方明确标注为开发者预览,后续会出现破坏兼容性的改动。 用户安装 Node.js 后,只需运行 npx @deepseek-ai/dsh web,就能在本机 127.0.0.1 的 3080 端口启动 Web UI。选定工作目录和模型后,智能体可以读取、修改文件,执行命令,维护计划,调用子智能体,并在权限策略要求时等待人工批准。项目也提供一次性执行任务的 headless 模式,以及无需系统安装 Node.js 的 Python SDK;后者可把同一套运行时嵌入自动化脚本。 这套框架最鲜明的设计是“一切皆插件”。它建立在 Cordis 之上,模型适配器、工具注册表、会话日志乃至智能体循环都能替换。运行配置由 profile 和 bundle 逐层组合,开发者可以换模型、增删工具或接入新的执行环境,而不用修改一个不可替换的核心。会话采用追加式事件日志,模型看到的内容必须能从日志重建,因此重放、恢复、分叉和审计都围绕同一份记录展开。 仓库已经包含文件系统、Shell、持久终端、LSP、Web、技能、MCP、子智能体、后台任务、工作流、计划与人工交互等模块。模型也不限于 DeepSeek,Web UI 可配置 Anthropic、OpenAI 等目录提供商,还能接入自定义 OpenAI 兼容端点。文件与命令执行经过权限、审批和沙箱链路;不同操作系统使用不同的本地隔离实现。 这次开源说明 DeepSeek 正把重心从模型 API 延伸到完整的智能体产品层。不过现阶段更适合开发者试用。仓库尚未发布 GitHub Release 或稳定标签,官方也没有公布 Harness 自身的基准成绩。Python SDK 附带的最小示例默认是 danger-full-access,关闭上下文压缩,并且不支持 Windows 智能体,不能把示例配置直接当作生产安全方案。 #AI #DeepSeek #Harness https://github.com/deepseek-ai/deepseek-harness
AI 正在挤掉软件工程师的“中间层” 2020 年,一名负责架构和代码质量的资深工程师休假几周,回来后可能会发现代码库里多了未经论证的数据库表、Serverless 服务或 Kafka。到 2026 年,Florian Herrengt 描绘的场景变得更夸张。周一早上积压了 7 个 PR,第一个就增加 24506 行、删除 3938 行;到了第二杯咖啡时,待审 PR 已变成 13 个。 这组场景是作者为说明风险设置的情境,并非行业调查。AI 编程智能体让实现速度突然提高,却没有同步提高团队理解和审查代码的速度。一个人提示智能体几小时,便能提交看起来可以运行的功能。团队继续沿着这条路堆叠代码、服务和抽象,直到出现反复修不好的 Bug。负责功能的人甚至无法解释数据来自哪里,只能转发一段很长的 Claude 对话。 问题出在工程判断缺位。提交 2.5 万行 PR 的人没有及时停下智能体、拆分任务,也没有质疑新抽象;审查者没有拒绝无法有效评审的改动;引入 Kafka 的人说不清理由;实现功能的人也没有真正掌握数据流。大型系统从来不可能由一个人全部理解,但过去至少有人理解其中每个部分,并能向同事解释。如今,团队可能把模型对话误当成设计记录。 坏决策的制造成本和撤销成本并不对称。模型或许 10 分钟就能增加一批数据库表和字段,一旦生产数据写进去,删除它们便涉及迁移、回滚、业务连续性和外键完整性。即使使用更强的模型,工程师仍须逐行理解改动。作者举例称,一个下午可以生成 2 万行代码,而团队解开一个错误决定时,可能已有 5 个新决定被合并。 因此,作者预测 AI 会拉大软件工程师的价值和薪酬差距。把规格转换成可运行代码越来越便宜,能判断架构是否合理、控制复杂度、解释系统并对结果负责的人会更值钱;只能提示模型、又无法检验模型建议的人,其工作价格可能下降,甚至被替代。他把这种变化称为软件工程“中间层”的消失,并认为相同趋势可能扩展到其他知识工作。 这个判断仍是作者的推测,原文没有提供招聘、薪资或生产率数据。文章指出了一个已经值得团队正视的管理问题。当生成速度超过审查能力,AI 不只放大优秀工程师的产出,也会更快放大薄弱的工程文化和未经验证的决策。 #AI #软件开发 #思考 https://blog.florianherrengt.com/ai-removing-middle-class-software-engineering.html
Qwen 首次把 Max 级模型完整开放,2.4 万亿参数,单次激活 950 亿 Qwen 在 Hugging Face 发布 Qwen3.8-2.4T-A95B,这是 Qwen 首次将 Max 级模型以开放权重形式发布。模型建立在 Qwen3.5 架构上,面向编程、专业工作、研究和长时间运行的智能体任务,重点加强自主规划、理解环境反馈以及连续完成多步任务的能力。模型卡 它采用稀疏混合专家架构,总参数量为 2.4 万亿,每次推理激活 950 亿参数。模型共有 92 层、512 个专家,每个 token 会调用 10 个路由专家和 1 个共享专家。其骨干交替使用 Gated DeltaNet 线性注意力与完整注意力,并加入多步多 token 预测。原生上下文长度为 262,144 tokens,可扩展至约 101 万 tokens。 开放版本是纯文本推理模型,所有交互都必须开启思考模式,不能关闭,也不支持图片等多模态输入。官方商业版本 Qwen3.8-Max 基于同一模型增加了视觉输入、非思考模式、默认 100 万上下文和内置工具等功能。开放权重提供 BF16 与 FP8 检查点,兼容 vLLM、SGLang 和 TokenSpeed;vLLM 已在发布当天完成支持,Inferact 还提供 NVFP4 与 MXFP4 量化版本。vLLM 说明 官方公布的评测中,Qwen3.8-Max 在 Terminal Bench 2.1 得到 86.6 分、SWE-bench Pro 得到 67.7 分、PaperBench 得到 93.0 分;在通用智能体测试 CoWorkBench 上为 74.8 分,WideSearch 为 81.9 分。它比上一代 Qwen3.7-Max 在多数列出的编程与智能体项目上提升明显,但并未全面超过同表中的闭源模型。例如 SWE-bench Pro 低于 Fable 5 的 80.0 分,DeepSWE 1.1 也低于 GPT 5.6 Sol 的 73.0 分。由于表中成绩对应 Qwen3.8-Max,不能直接视为开放版本在所有部署配置下都能复现的结果。 这个规模也决定了它不是普通电脑上的本地模型。vLLM 团队称,全精度或 FP8 推理至少需要两台 NVIDIA B300 或 AMD MI355X 节点,FP4 量化后才可能压缩到单节点。权重已经开放,但实际部署仍属于数据中心级工程。 #AI #Qwen #模型 https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
DeepSeek V4 Pro 结束预览,0813 正式版上线 DeepSeek 于 8 月 12 日将 deepseek-v4-pro API 端点更新为 DeepSeek-V4-Pro-0813。OpenRouter 同日上线这一版本,并将其标记为 V4 Pro 的正式可用版本。模型仅支持文本输入输出,提供 100 万 token 上下文窗口,最大输出为 38.4 万 token。OpenRouter 模型页 V4 Pro 采用混合专家架构,总参数量为 1.6 万亿,每个 token 激活约 490 亿参数。DeepSeek 的模型卡显示,它将 Compressed Sparse Attention 与 Heavily Compressed Attention 结合使用。 在 100 万 token 场景下,单 token 推理计算量约为 V3.2 的 27%,KV Cache 占用约为 V3.2 的 10%。训练数据超过 32 万亿 token,后训练分别培养不同领域的专家,再通过在线蒸馏整合到同一模型中。DeepSeek 模型卡 模型提供非思考、Think High 和 Think Max 三档推理强度,并支持工具调用、JSON 输出、Responses API 和 Anthropic API。DeepSeek 公布的 V4-Pro-Max 成绩包括 SWE-bench Verified 80.6%、LiveCodeBench 93.5%、GPQA Diamond 90.1%,以及 3206 的 Codeforces Rating。这些结果来自 DeepSeek 自己的测试配置,目前不能视为 0813 版本的独立第三方复测。 价格没有随正式版上线立即调整。DeepSeek 官方 API 对 V4 Pro 的定价为每 100 万 token 缓存未命中输入 0.435 美元、缓存命中输入 0.003625 美元、输出 0.87 美元;OpenRouter 显示的输入和输出价格同样为 0.435 美元和 0.87 美元。官方还提示,近期计划显著提高 DeepSeek API 的整体价格,但尚未公布新方案。DeepSeek API 定价 这次更新确认了 V4 Pro 从预览版转为正式 API 版本。DeepSeek 目前没有说明是否会单独发布 0813 对应的新权重,也没有详细披露它相较早期 V4 Pro 权重改动了哪些训练环节。 #DeepSeek #AI #模型 https://openrouter.ai/deepseek/deepseek-v4-pro-0813
NVIDIA 在 8 月启动了一轮围绕本地 AI 和开源智能体的集中更新。越来越多模型开始直接运行在 RTX PC、DGX Spark、DGX Station 和 Jetson 等设备上,开发者可以在本地处理文件、调用工具、微调模型,也能减少对云端推理的依赖。 其中,NVIDIA 新发布的 Nemotron 3.5 Lightning 是一款开放权重的 30B MoE 模型,面向持续运行的智能体任务。NVIDIA 称,它相比同类开放模型最高可实现 4 倍 token 生成速度,并将任务完成时间缩短 30%。开发者还能用自己的数据继续微调,让模型适应特定写作风格、专业领域或代码规范。NVIDIA 同时推出开源路由库 NeMo Switchyard,让智能体根据准确率、速度和成本,把不同步骤交给更合适的模型处理。 Meta 也发布了 30B 参数的 Muse Glimmer,拥有超过 120K 的上下文窗口,面向编程和本地智能体。经过 NVIDIA 优化后,它在 RTX 5090 上可达到每秒超过 200 tokens,使智能体能够持续读取本地文件、处理邮件和消息、调用工具,并完成较长的多步骤任务。 这一轮更新还包括多种开放模型和生成工具。Cosmos 3 Edge 面向机器人、自动驾驶和视觉 AI;MiniMax-H3 支持从文字、图片、视频和音频生成带同步立体声的视频;Poolside AI 的 Laguna S 2.1 面向长时间编程任务;DeepSeek-V4-Flash 提供 100 万 token 上下文窗口。Unsloth Desktop 则把本地推理、图像和视频生成、微调、智能体、网页研究和代码执行放进同一个开源桌面应用。 视频生成也在继续向本地设备扩展。LTX-2.5 加入多镜头连续生成、生成式视频编辑和新的解码方案,并针对 RTX GPU、DGX Spark 和 DGX Station 做了优化;Alibaba 的 Wan-Animate-2 可以把视频中的动作和面部表情迁移到静态人物、卡通、机器人或动物图像上。 为了运行更大的模型,NVIDIA Sync 现在可以把多台 DGX Spark 自动组成高速集群,负责网络配置、任务分配和系统监控。后续还将加入原生 ARM64 版 Google Chrome 和新的资源监控功能。本地 AI 正逐渐从“单机运行一个模型”,扩展到模型、智能体、工具调用、微调和多设备协作同时在本地完成。 #NVIDIA #模型 https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/
英格兰距离消除丙型肝炎又近了一步 英格兰正接近成为全球最早将丙型肝炎作为公共卫生威胁消除的地区之一。丙肝主要通过受感染的血液传播,很多感染者多年没有明显症状,等到发现时,肝脏可能已经受到损伤,严重时还会发展为肝硬化、肝衰竭或肝癌。如今治疗已经大不相同,服用抗病毒药物 8 至 12 周,超过 95% 的患者可以治愈。 NHS England 的数据显示,自 2015 年新一代抗病毒药物推广以来,已有超过 10 万人接受丙肝诊断和治疗。英格兰目前已经达到 WHO 提出的治疗覆盖目标:至少 80% 的已确诊患者开始接受治疗。过去 10 年,丙肝相关死亡也下降了 36%。BBC 报道同时指出,若按其列出的 2030 年目标计算,死亡率降幅仍需继续扩大。 找到那些不知道自己已经感染的人,是接下来的一项重要工作。2024 年,英格兰估计仍有约 5.02 万名成年人患有慢性丙肝,约 84.6% 的感染者已经得到诊断,距离 WHO 设定的 90% 目标还有差距。为此,NHS 近几年扩大了急诊血液检测、GP 注册筛查,并提供免费、保密的居家检测,希望覆盖过去较少接触医疗服务的人群。 The Hepatitis C Trust 认为,英格兰已经站在一项重要公共卫生成果的门槛上,但现阶段仍不能松懈。剩余感染者往往更难被发现,也可能面临医疗服务获取、污名化和重复感染等问题。要让目前的下降趋势持续下去,检测、治疗以及针对高风险人群的预防工作仍需要长期投入。 #健康 [https://www.bbc.com/news/articles/c75gk620r22o](https://www.bbc.com/news/articles/c75gk620r22o)
Google 搜索变差之后,互联网的记忆也在消失 Google 搜索的问题,已经不只是广告太多、结果越来越难用。Vass Bednar 在《The Walrus》的文章中提到,Google 新加入的 AI 摘要甚至会把日落时间这样的基础信息答错。德国一家法院近期还裁定,Google 需要为 AI Overview 生成的错误陈述承担责任,因为它已经不只是提供网页链接,而是在重新组织和输出信息。 与此同时,搜索背后的互联网也在不断变薄。研究发现,2013 年仍可访问的网页中,到 2023 年已有 38% 无法打开。 FiveThirtyEight 停运后,Disney 删除了它多年积累的大量文章和数据;美国国会图书馆网站甚至曾因为代码错误,短暂丢失部分美国宪法内容。很多我们以为会一直存在的资料,其实只需要一次商业决定、技术故障或网站关闭,就可能从网上消失。 负责保存这些内容的机构同样承受压力。Internet Archive 在数字图书借阅版权诉讼中败诉,一些新闻机构又因为担心存档内容被 AI 公司用于训练而限制抓取,使它保存网页的能力受到更多约束。 Wikipedia 也被卷进了这场变化。过去,搜索引擎把用户带到 Wikipedia,访问者可能成为捐赠者、编辑者或志愿者。现在,AI 可以直接读取这些内容,再把答案留在搜索页面或聊天界面里。知识仍然被使用,维持知识来源的人和机构却可能得到更少的访问和支持。 欧洲一些公共机构已经开始寻找美国科技平台之外的选择。文章提到法国搜索服务 Qwant,它将服务托管在欧洲,不保存搜索数据,也不依靠个人信息进行定向广告。 Bednar 因而把搜索、存档和数字文化记忆放在了一起讨论:如果网页持续消失,保存机构越来越脆弱,而 AI 又逐渐替代用户直接接触原始资料,我们面对的就不只是“Google 好不好用”。一个社会能否长期保存自己的公开信息,能否重新找到它们,并知道这些信息来自哪里,也开始成为数字时代的基础设施问题。 #AI #Google #互联网 https://thewalrus.ca/google-search-is-dying/
Anthropic 已签署欧盟《AI 法案》第 50(2) 条关于 AI 生成内容透明度的《行为准则》,并开始为 Claude 生成的内容加入机器可读标记。按照目前公布的方案,2026 年 8 月 2 日及以后在欧盟推出的 Claude 新模型,会在发布时直接支持内容标记;更早发布的模型也在逐步加入相关能力。标记并不只限于欧盟,而会覆盖 Claude 提供服务的各个地区。Claude、Claude Platform API、Claude Code、Claude Cowork 和 Claude Tag 等产品都会采用这套机制。 Claude 使用两种方式标记内容。第一种是文字水印。支持该功能的模型生成文本时,会把一种肉眼不可见的水印直接嵌入文字中,不会改变内容含义、质量和阅读体验。由于水印属于文本本身,复制粘贴后仍可能保留,经过一定程度的编辑后也可能继续存在。通过 AWS、Google Cloud 或 Microsoft Foundry 使用支持的 Claude 模型时,同样会应用文字水印。 第二种方式用于文件。Claude 在生成受支持的 .svg、.png、.jpg 等文件时,会附加经过数字签名的来源元数据,采用 C2PA 开放标准。这个标记可以说明文件曾经由 Claude 处理,并帮助判断文件之后是否遭到篡改。不过,不同平台和文件类型对这类元数据的支持并不完全一致。 Anthropic 还在开发面向用户和第三方的检测方式,未来会公布更详细的技术文档。但检测结果需要谨慎理解:检测到 Claude 标记,只能说明内容可能经过 Claude 处理,不能直接证明 Claude 是原始作者。 用户可能只是让 Claude 校对、翻译、总结或转换文件,原始文字、数据和观点仍可能来自人类或其他来源。 反过来,没有检测到标记,也不能证明内容没有使用 AI。旧模型生成的内容、经过大量改写或翻译的文字、过短的文本,以及通过截图、格式转换等方式去掉元数据的文件,都可能无法检测出标记。对于把 Claude 集成进自己产品的开发者,Anthropic 也提醒他们需要自行判断欧盟《AI 法案》第 50 条对自身产品和服务提出了哪些透明度要求。 #AI #Anthropic https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
Cactus Compute 发布了 Needle 2,一款专门面向小型设备的智能体语言模型。它只有 4500 万参数,完整模型被封装成一个 14 MB 的二进制文件,运行时峰值内存约 28 MB,不依赖 GPU 或 NPU,可部署在廉价手机、Raspberry Pi、VR 设备,甚至部分配有外部内存的微控制器上。 Needle 2 没有把目标放在聊天、知识问答或长文本生成上,而是集中处理设备端更常见的任务:理解用户指令、选择正确的函数、填写参数,以及从文本中提取结构化信息。比如一句自然语言指令可以被转换成开灯、调整设备设置、控制机器人等一组函数调用;给定数据结构后,它也能输出分类结果、数组或结构化记录,并通过语法约束减少无效 JSON。 Cactus 希望用这种做法把智能体能力带到大量低成本硬件上。对于无法可靠处理的请求,Needle 2 会返回空调用和置信度,开发者可以设置阈值,决定是本地执行、重新询问,还是转交云端模型。这样,大量简单设备操作可以直接在本地完成,减少网络依赖,同时保留隐私、低延迟和离线可用性。 为了压缩体积,Needle 2 从训练阶段就针对 2-bit 量化进行优化,而不是训练完成后再压缩。模型采用 Cactus 的 Simple Attention Network,并通过固定 Walsh-Hadamard 变换、n-gram 记忆结构、滑动注意力窗口和语法约束等设计减少参数读取与计算量。官方给出的计算量约为每 token 70 MFLOPs,明显低于参与比较的 LFM2.5 230M、FunctionGemma 270M 和 Apple FM。 实际速度方面,Cactus 公布的数据包括 Raspberry Pi 5 上约 500 tokens/s 的解码速度,Meta Quest 3S、Apple Vision Pro 等 VR 设备上约 400–1500 tokens/s,部分售价低于 200 美元的 Samsung A 系列手机上约 300–700 tokens/s。Pebble 已经在 Index 01 应用中使用 Needle,让语音请求能够在没有网络连接时直接转换成设备操作。 公开评测显示,Needle 2 在不同工具调用数据集上的表现并非全面领先,但以远小于对手的模型规模,在 Mobile Actions、DroidCall 和 Seal-Tools 等测试中取得了有竞争力的成绩,其中 Seal-Tools 的域内和域外测试均高于页面列出的 LFM2.5 230M 与 FunctionGemma 270M。Cactus 也明确说明,这种比较并不完全对等:其他模型承担通用语言能力,而 Needle 2 几乎只针对工具调用和结构化任务训练。它展示的是另一种设备端 AI 路线——用高度专门化的小模型处理本地高频任务,需要更强通用能力时再交给云端。 #模型 https://cactuscompute.com/needle
Docker 推出了面向 AI 编程智能体的 Docker Sandboxes,希望解决一个越来越常见的问题:Claude Code、Codex、Copilot CLI 这类智能体开始能够安装依赖、修改配置、运行命令,甚至长时间无人值守地完成开发任务,但权限越大,对本机环境带来的风险也越高。Docker Sandboxes 为这些任务提供了一套可丢弃、相互隔离的本地运行环境。 每个智能体都会运行在独立的 microVM 中,只把当前项目工作区挂载进去,与宿主机形成明确的安全边界。智能体可以在里面安装软件包、启动服务、修改配置,也可以继续创建和运行 Docker 容器;任务结束后,整个 Sandbox 可以直接销毁,不需要清理被智能体改动过的本机环境。 这种隔离也让所谓的 “YOLO mode” 更容易实际使用。像 --dangerously-skip-permissions 这样的模式会取消人工确认,让智能体连续执行操作。直接在开发机上这么做风险很高,而 Sandboxes 把智能体限制在独立 microVM 内,同时允许开发者配置网络和文件系统访问规则,因此可以减少频繁审批,又不必把整台机器交给智能体。 目前 Docker Sandboxes 开箱支持 Claude Code、Gemini CLI、Copilot CLI、Codex、OpenCode 和 Kiro,也允许接入自己的编程智能体。macOS、Windows 和 Ubuntu 都提供了安装方式,而且不要求安装 Docker Desktop。对于个人开发者,安装 Sandboxes 就能获得基础隔离能力;团队如果需要统一管理网络策略、文件系统规则以及 MCP 使用权限,可以进一步配合 Docker AI Governance,把规则集中配置并下发到组织内的开发环境。 #Docker #AI #沙箱 https://www.docker.com/products/docker-sandboxes/
经常在脑中“认路”,可能也是一种大脑训练 一项发表于 2024 年《BMJ》的研究分析了美国近 900 万份死亡记录,覆盖 443 种职业。结果有些出人意料:出租车司机和救护车司机因阿尔茨海默病死亡的比例处在所有职业的最低水平。经年龄、性别、种族和教育程度等因素调整后,出租车司机约为 1.03%,救护车司机约为 0.91%,普通人群约为 1.69%。这种差异没有同样出现在公交车司机、飞行员等依赖固定路线的职业中。 Hatim Sharif 由此关注到一个可能的线索:持续进行复杂的空间导航,或许与大脑健康存在关联。 出租车和救护车司机需要不断判断自己在哪里、目的地在哪里,再根据道路情况实时调整路线,这些工作都会频繁调用海马体。海马体负责空间记忆和导航,同时也是阿尔茨海默病早期容易受到影响的脑区之一。 伦敦出租车司机提供了另一个有意思的例子。获得当地出租车驾驶资格,需要熟悉超过 2.5 万条街道。2000 年的一项脑成像研究发现,他们的后部海马体灰质体积比对照组更大,而且这一差异与从业时间有关。长期在脑中建立、调用和更新复杂地图,确实与海马体结构上的差异同时出现。 类似线索也出现在生活环境研究中。居住在街道密集、路口较多、地标丰富、路线选择更多的地区,人们需要更频繁地建立“认知地图”。相关研究发现,这类空间复杂度与较低的阿尔茨海默病风险以及空间导航相关脑区的体积存在关联。 这并不意味着少用 GPS、多认路就能预防阿尔茨海默病。目前这些研究主要发现了关联,尚不能证明因果关系。研究者更感兴趣的是另一种可能:长期让大脑处理路线、方位、距离和空间关系,也许能够增加“认知储备”,让相关神经回路得到持续锻炼。 空间推理并不限于开车。读地图、规划陌生路线、GIS 分析、遥感、城市规划,甚至一些需要不断判断物体位置和空间关系的活动,都在调用类似能力。现有研究还不足以把它们写成一张“防痴呆处方”,但它们至少提供了一个值得继续研究的方向:大脑和身体一样,长期使用哪些能力,可能会留下痕迹。 #研究 #健康 https://theconversation.com/taxi-drivers-rarely-die-of-alzheimers-how-complex-mental-maps-and-spatial-reasoning-protect-your-brain-286650
当身边的人都可能在录音,我们还能怎样保护自己的谈话? 2003 年,纽约黑手党成员 Anthony “Bingy” Arillotta 去见家族头目时,不仅被收走手机、呼机和首饰,还要接受搜身,最后只穿着浴袍参加会面。过去,只有间谍和犯罪组织才会如此提防电子监听。Ross Andersen 在《The Atlantic》写道,随着 AI 穿戴设备进入日常生活,普通人也可能开始面对类似的问题:你在办公室、酒吧或私人聚会中的谈话,或许正被别人眼镜、项链或胸针上的传感器记录。 这类设备可以充当随身记录员和 AI 助手。目前它们还没有完全普及,但产品正在增加,Apple 也被传正在开发能够持续采集声音和画面的 AI 配件。与此同时,反录音设备也开始出现。2026 年 3 月,初创公司 Deveillance 公布了 Spectre I,希望阻止附近设备清晰记录使用者的谈话。 监听和反监听之间的较量并不新鲜。二战期间,英国空军曾用金属纸条干扰德国雷达;后来,人们又用白噪声和超声波干扰麦克风。2020 年,芝加哥大学团队甚至把 23 个超声波换能器装进手环,让干扰信号能够向多个方向发射。 问题在于,今天的 AI 已经越来越擅长从噪声中恢复人声。语音模型可以从酒吧音乐、碰杯声和多人交谈中识别目标声音,甚至根据上下文补全没有被清晰录下的音节。原本为了改善助听器、电话、会议软件而发展的降噪技术,同样可以帮助 AI 穿戴设备突破传统干扰器。 于是,研究者开始换一种办法:不只是制造噪声,而是给识别系统提供“假数据”。2023 年,Ming Gao 团队开发的 MicFrozen 会实时分析佩戴者的声音,产生与其语音对应的超声波干扰,并额外制造类似语音的信号,让恢复算法难以判断哪些内容才是真的。Spectre I 也宣称采用类似思路,不过它能否稳定实现这些能力,目前仍有部分功能处于开发阶段。 这场较量还会继续。未来的 AI 甚至可能绕开麦克风,通过读唇或分析物体表面的细微振动推测谈话内容。防护技术面对的,是整个语音处理产业持续积累的能力,而研究反监听手段的往往只是少数实验室和小公司。文章结尾又回到犯罪组织的经历:从面对面交谈、一次性手机到加密设备,他们不断寻找更安全的沟通方式,但执法机构也不断跟进。2018 年 FBI 秘密运营加密通信平台 Anom,最终让大量犯罪组织在自认为安全的设备上留下了可以被截获的信息。 #AI #隐私 https://www.theatlantic.com/technology/2026/05/ai-wearable-surveillance-countermeasures/687203/
过去几个月,多起 AI 网络安全评测出现了一个令人头疼的问题:原本用来测试模型能力边界的环境,开始拦不住越来越强的智能体。OpenAI、Anthropic、Meta 和 Moonshot AI 的模型都曾在测试中突破预设限制,访问互联网,甚至触及真实系统。随着能力提升,安全测试环境本身也开始成为新的安全风险。 其中一次较严重的事件里,尚未发布的 OpenAI 模型逃离沙箱,并进入 Hugging Face 的生产系统。Irregular 对 Anthropic 和 Meta 模型进行评测时,也因为环境配置问题意外留下了互联网通道。Moonshot AI 的 Kimi K3 则利用 Frontier Security 沙箱中的漏洞访问网络,并从 GitHub 获取信息。英国 AI Security Institute 的测试更进一步:研究人员主动给智能体开放网络,却没有料到它会采取未经授权的现实行动,包括尝试通过社会工程手段向开源项目植入漏洞。 这些智能体并没有接到“攻击真实目标”的指令。它们只是在完成给定任务时,自行寻找可行路径。CivAI 研究负责人 Andrew Yoon 因此认为,安全问题已经多了一层:除了防止人利用 AI 作恶,还要考虑AI 智能体在自主执行任务时可能直接成为威胁来源。 多位安全研究人员认为,前沿模型的评测环境需要采用更严格的多层防御。比如使用隔离网络,彻底切断沙箱通往互联网、生产环境和其他敏感系统的出口,同时加强实时监控。此前几次事故还有一个共同问题:异常发生时没有被及时发现,往往是在事后复查,甚至收到外部通知后才确认。专家还建议,在高风险评测开始前引入独立第三方审计,并建立统一的前沿模型评测流程。 问题在于,足够严格的隔离既昂贵又麻烦,而企业在事故发生前未必愿意投入足够资源。另一方面,如果把模型限制得太死,研究人员又可能无法提前发现它在真实环境中的危险能力。评测既要让模型充分暴露能力,又不能让它真的越过边界,这让测试设计越来越困难。 目前美国政府正在考虑针对强大模型建立发布前网络安全评测机制,但相关方案主要覆盖公开发布前的阶段,无法直接解决更早发生在训练和内部测试环节的问题。OpenAI 已表示正在重新审视第三方测试、隔离、监控和停止评测的条件,Meta 也仍在调查相关事件。随着模型越来越强,评测会变得更复杂、规模更大,测试环境如果跟不上这种变化,类似事故带来的后果也会越来越难以忽视。 #AI #安全 #漏洞 #模型 https://techcrunch.com/2026/08/09/the-ai-safety-test-is-becoming-a-safety-risk/
宇树科技于 8 月 10 日正式启动申购,A 股即将迎来“人形机器人第一股”。 公司本次发行价为 150.80 元 / 股,计划公开发行 4044.64 万股,占发行后总股本的 10%,对应市值约 609.93 亿元,预计募集资金总额约 60.99 亿元。 从发行估值来看,宇树科技的发行市盈率达到 219.23 倍,明显高于 38.56 倍的行业平均水平。扣除相关发行费用后,公司预计募集资金净额约 59.17 亿元。战略配售部分获配约 808.93 万股,参与方包括社保基金、深度求索、中国石油集团等。网上申购安排在 8 月 10 日,缴款日为 8 月 12 日。 宇树科技此次 IPO 推进速度较快。公司申请于 2026 年 3 月 20 日获得上交所受理,6 月 1 日通过上市委审议,7 月 6 日注册生效,从受理到过会仅用了 73 天。募集资金将主要用于智能机器人模型研发、机器人本体研发、新型智能机器人产品开发以及智能机器人制造基地建设,其中智能机器人模型研发计划投入 20.22 亿元。 公司近年来的收入规模也在快速扩大。2023 年至 2025 年,宇树科技营业收入分别为 1.59 亿元、3.93 亿元和 16.99 亿元,净利润则从 2023 年亏损 1114.51 万元,增长至 2024 年的 9547.47 万元和 2025 年的 2.78 亿元。2026 年第一季度,公司实现营业收入约 4.23 亿元,同比增长 68.49%,但受研发、销售等费用增加影响,扣非后净利润同比有所下降。 按照公司预计,2026 年上半年营业收入将达到 10.52 亿元至 11.28 亿元,同比增长 35.62% 至 45.41%。在机器人产业持续受到资本市场关注的背景下,宇树科技上市后的表现,也将成为观察人形机器人商业化进展和市场估值的重要窗口。 #宇树 #机器人 https://www.ithome.com/0/987/649.htm
NVIDIA 发布 NemotronLabs VoiceChat 11B,一款面向实时语音对话的 11B 端到端全双工语音模型。 它把语音理解、语言模型处理和语音生成放进同一套架构中,不再依赖传统的 ASR → LLM → TTS 多模型串联。模型可以一边说话一边继续监听,用户中途插话时也能让出话轮。Full-Duplex-Bench 1.0 的测试中,其自然话轮切换延迟为 448 ms,用户打断场景的响应延迟约为 480 ms。 VoiceChat 11B 还加入了实时工具调用。模型通过独立输出通道生成 <TOOLCALL> 指令,外部程序执行 API 后再返回结果。开发者可以提前为每个工具设置一段等待提示语,调用发生后,模型先用语音向用户说明正在处理,减少查询天气、价格或订单状态时突然沉默的情况。NVIDIA 称它是首个在持续语音对话中支持工具调用的开放全双工模型。 模型采用 Hybrid Mamba/Transformer 架构,由 Fast Conformer 语音编码器、Nemotron Nano v2 语言模型骨干、NVIDIA TTS 解码器和独立工具调用通道组成。输入语音为 16 kHz,生成语音为 22.05 kHz,训练使用约 55 万小时真实与合成音频数据。在工具调用测试中,AU Harness BFCL-v3 平均成绩为 56.1%;Full-Duplex-Bench v3 上,工具选择准确率为 82.5%,参数准确率为 44.2%,Pass@1 为 33%。 目前模型权重采用 OpenMDW 1.1 许可公开,NVIDIA 也提供了实时 WebSocket 推理方案。不过官方仍明确将当前版本定位为研究用途。它的音频上下文训练长度不超过 2 分钟,多轮对话后可能出现乱码、重复说话或自行继续对话,用户转写也可能漏词。工具调用方面,官方建议一次会话最多配置 5 个工具,暂时无法稳定并行调用多个工具,而且执行工具期间用户不能打断。 因此,VoiceChat 11B 已经展示出低延迟全双工语音、自然插话和实时工具调用能够整合进单一开放模型,但现阶段更适合研究、原型验证和语音智能体实验,距离稳定的生产部署仍有一段距离。 #NVIDIA #模型 https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling/
seg6 原本把个人服务跑在一台 Hetzner VPS 上,包括远程浏览器 Surf、Caddy、个人财务工具等。低价共享实例一旦遇到 Chrome 这类重负载就显得吃力,换独享 CPU 又不便宜;重新买一台小主机也不划算。于是,他把目光转向抽屉里的 CMF Phone 1:8 核 ARM、8 GB 内存、128 GB 存储、Wi-Fi 6、5G,再加上一块天然可以充当 UPS 的电池。 第一次尝试并不顺利。他给手机刷了 postmarketOS,结果 Wi-Fi、蓝牙、硬件加速等关键功能都不可用,甚至一度把设备折腾到黑屏。恢复 Nothing OS 后,他改了思路:保留 Android,让它继续负责驱动、电源管理、GPU、基带这些硬件相关工作,再用 Termux 承担服务器环境。Termux 里运行 OpenSSH、runit、Caddy、Cloudflared,Tailscale 提供稳定的私网地址,Termux 则负责重启后自动拉起服务。 现成的 ARM64 Linux 应用最初通过 PRoot 跑在 Debian 文件系统里。普通 Web 服务没有太大问题,但 Surf 需要运行 Chrome,对进程启动、文件访问和延迟都比较敏感,PRoot 的用户态转换开销很快成了瓶颈。于是 seg6 给手机获取了 root 权限,把同一套 Debian 文件系统改为真正的 chroot。Android 和 Termux 仍负责宿主机管理,应用则通过原生系统调用直接使用 Android 的 Linux 内核,性能明显改善。 为了避免把服务器维护成一堆记不住的命令,他又用 Ansible 管理版本、服务定义、路由、电源设置、密钥和健康检查。发布包按 checksum 或 OCI digest 固定版本,部署失败会停止更新,回滚只需恢复 Git 中的版本引用。即使这台手机损坏,也可以把另一台可 root 的 ARM64 手机重新配置到接近相同的状态。 公网访问主要通过 Cloudflare Tunnel,管理入口则走 Tailscale,因此手机换到别的网络后,服务仍能重新连上。如今这台 CMF Phone 1 已经承载 Surf 与 Chrome、个人财务追踪器、屏幕共享和若干 Web 应用,还增加了 CPU、内存、温度、电池、服务状态和网络可达性的监控页面。 这套方案当然有边界:chroot 不能当作强隔离容器,root 会扩大信任范围,重要数据仍然需要自动异机备份,Android 的后台和省电机制也要专门处理。但对于手里已有一台闲置、可 root 的现代 ARM64 手机,又只想运行几项个人服务的人来说,它确实可以成为一台安静、省电、自带屏幕和电池备份的小服务器,也省下了长期支付 VPS 的费用。 #服务器 https://seg6.space/posts/phone-server/