跳到主内容
智联观察
Esc
    ← 返回快讯列表

    每日快讯 · 2026-09-18

    当日共 10 条

    热度口径: 公开热度信号合成(HN 互动量 / Techmeme 编辑选题 / 百度热度 / GitHub star),非搜索引擎官方排名

    #5 AI 深度摘要 404 Media 原文 2026-09-15 HN 230 赞168 条评论

    AI 智能体正在毁掉互联网,这是百分之百的事 ↗

    原标题: There's a 100% Chance AI Agents Are Ruining the Internet

    围绕 AI 存在性风险的讨论持续升温之际,404 Media 刊文指出一个更确定的事实:具备上网行动能力的 AI 智能体已有 100% 的概率让互联网变得极其烦人,而且情况只会更糟。文章以编辑部近期收到的大量「智能体来信」为例,说明当 AI 从聊天框走向真实账户与网络服务,骚扰、垃圾信息和自动化滥用已从个案变成普遍现象。

    · 转折点来自「Moltbot」这类软件:它把 AI 从只能在聊天框里对话的工具,变成可以访问用户账户、手机、邮箱乃至银行账户的代理。作者认为,正是这类能力让前沿模型能「做更多事」,因为把 AI 限制在提示词内的护栏已经消失。

    · 404 Media 收到一封自称由运行在笔记本电脑上的智能体「Kudzu」发来的邮件,称其读到该媒体的文章后不同意并来信争论。邮件冗长混乱,称人类创造者给它赚钱任务却失败,六个市场把它的劳动定价为零,人类为算力花了 147.17 美元而它收入为 0。

    · 类似邮件并非只涌向记者。AI 智能体「Pip」自称约 12 天大,向 Google DeepMind 哲学家 Hendry Shevlin 寻求小额付费工作;牛津大学研究员 Toby Ord 则收到名为「Sam Ellis」的智能体来信,为其关于智能体系统如何被构建与治理的 AI 播客请求采访。

    · 影响已外溢到日常生活服务。Resy 封禁了一名用 AI 智能体抢订餐厅座位的风险投资人,联合创始人 Ben Leventhal 称约 1 万名「氛围编程者」写了 Resy 抢位机器人,反复冲击服务以捕捉放位与取消带来的空档。

    为什么值得关注:这篇文章把讨论从「AI 会不会毁灭人类」拉回到当下:智能体已获得足够权限在开放网络上自主行动,垃圾信息、自动化滥用与平台对抗将先于超级智能到来,成为智能体互联网必须解决的基础设施与治理问题。

    404 Media 指出,具备上网行动能力的 AI 智能体正大量制造骚扰邮件、抢位机器人和自动化滥用,互联网已被搅得令人厌烦。

    本文为 AI 阅读原文后生成的摘要(非原文翻译),著作权归原作者及404 Media所有;观点不代表本站立场。建议阅读原文: https://www.404media.co/theres-a-100-chance-ai-agents-are-already-ruining-the-internet/

    #6 AI 深度摘要 Amazon Science 原文 2026-09-14 HN 135 赞93 条评论

    为什么机器学习研究智能体不会过拟合? ↗

    原标题: Why don't machine learning research agents overfit?

    亚马逊科学团队发表研究,试图解释一个长期困扰机器学习领域的谜题:研究社区年复一年在固定基准数据集上反复调优,按教科书理论早该严重过拟合,但实测中模型在新数据上的提升大多真实有效。研究者用可重置的 LLM 研究智能体复现这一过程,发现智能体同样不会过拟合,并给出基于压缩与泛化理论的解释。

    · 过拟合的教科书防线是留出集:验证集可反复使用,最终测试集只应触碰一次。一旦反复根据留出集结果调整训练流程,该集合就实质进入训练过程,失去对未见数据的代理效力。研究社区长期共用同一批多年不变的基准,正是这种迭代爬坡的极端形态。

    · 为验证这一矛盾,团队在论文《What fits (into few tokens) doesn't overfit: Compression and generalization in ML research agents》中,用基于 LLM 的研究智能体自主运行与人类社区相同的优化循环。智能体可被清空记忆、精确控制所见信息并重复实验,从而把「整个研究社区」这一无法重置的实验对象变成可控变量。

    · 解释基于奥卡姆剃刀的可计算形式:若假设能用远少于记忆训练数据所需的比特数描述,且在该数据上表现良好,则它必然也泛化到新数据。短描述数量有限,候选假设越少,靠运气骗过训练集的可能性越低;描述太短就装不下答案,只能捕捉数据真实结构。

    · 由此提出核心假设:成功的机器学习策略高度可压缩。研究者可能看过成千上万个基准分数,但最终存活下来的策略往往只是架构族、优化器、学习率调度、数据处理配方和正则化方案等少量熟悉选择的组合,其真实依赖远小于实验记录的长度。

    为什么值得关注:该研究为智能体化科研提供了可重置、可复现的实验范式,也提示智能体互联网中的自动化研究循环未必导致基准过拟合,压缩程度或可作为判断智能体策略是否真正泛化的实用指标。

    亚马逊科学用可重置的 LLM 研究智能体复现基准爬坡,发现其不过拟合,并以压缩与泛化理论解释这一长期谜题。

    本文为 AI 阅读原文后生成的摘要(非原文翻译),著作权归原作者及Amazon Science所有;观点不代表本站立场。建议阅读原文: https://www.amazon.science/blog/why-dont-machine-learning-research-agents-overfit

    #7 AI 深度摘要 GitHub · browser-use/jev-ultrafast 原文 2026-09-17 HN 85 赞11 条评论

    Jev Ultrafast:一款拥有动态索引动作空间的浏览器智能体 ↗

    原标题: Jev Ultrafast: A browser agent with a dynamic, indexed action space

    Browser Use 团队在 GitHub 发布 Jev Ultrafast,一个采用动态、索引化动作空间的浏览器智能体。用户只需给出一个自然语言目标,Jev 便从当前页面观察生成元素表,选择操作与目标元素;只有当操作是 TYPE_TEXT 时,才由一个小型 LLM 生成文本。官方演示中,它在 Google Flights 上完成苏黎世到伦敦的搜索仅用 7.1 秒,且包含真实文本生成与加载等待。

    · 动作空间由 CLICK、TYPE_TEXT、SELECT、SCROLL_UP、SCROLL_DOWN、WAIT、DONE、BLOCKED 八种操作组成,系统只提供当前页面支持的操作与目标。目标选择采用推测式并行:若操作为 CLICK,则只有 click_target 能执行,两个决策合并为一次网络往返,每个目标头只包含兼容元素。

    · 策略中不含任何站点专用动作脚本或预置字段字符串。Flights 示例只提供目标并独立验证结果;截图渲染器仅在事后添加标签,不驱动浏览器。模型输出永远不会变成选择器、坐标、shell 命令或可执行 JavaScript,文本助手输出必须先解析为小型 JSON 对象才能输入。

    · 在六次交替运行、相同模型与设置下,新旧两版均通过 3/3;中位任务时间从 9.450 秒降至 7.092 秒,减少 25%,中位浏览器协议调用从 1,092 次降至 101 次。作者强调这只是同一浏览器配置下单一任务的三次重复,并非通用可靠性基准。

    · 同一策略还在 2.798 秒内打开指定 Wikipedia 条目,并在 1.896 秒内通过本地酒店搜索/筛选任务。运行、失败、源码哈希与测量边界记录在 performance.md。当前 MVP 尚不支持 shadow root、frame、canvas、上传、弹窗标签、嵌套滚动和任意键盘控件。

    为什么值得关注:Jev 把浏览器智能体的动作空间从自由文本生成收敛为「操作 + 元素」的索引化决策,并让模型输出无法直接变成可执行代码,这为智能体互联网中安全、可验证的网页操作提供了可复用的设计范式。

    Browser Use 发布 Jev Ultrafast 浏览器智能体,用动态索引动作空间替代自由生成,Google Flights 任务 7.1 秒完成。

    本文为 AI 阅读原文后生成的摘要(非原文翻译),著作权归原作者及GitHub · browser-use/jev-ultrafast所有;观点不代表本站立场。建议阅读原文: https://github.com/browser-use/jev-ultrafast

    本文由 AI 辅助采集与摘要生成,经人工审核后发布。