SheepNav

AI 资讯

每日聚合最新人工智能动态

来源:Hacker News清除筛选 ×

标普道琼斯指数公司于 6 月 4 日做出决定,拒绝为 SpaceX 破例修改指数纳入规则,这意味着这家太空探索公司无法在上市后快速进入 S&P 500 指数,从而错失被动投资基金可能带来的数十亿美元资金流入。这一决定同时封堵了 OpenAI 和 Anthropic 等 AI 公司未来效仿的路径。 SpaceX 此前曾要求极其快速的指数准入,作为其历史性 IPO 的条件之一。该公司计划仅向公众出售约 3% 的股份,且目前尚未盈利,债务已因 AI 基础设施投资攀升至 290 亿美元。为评估 SpaceX 的请求,标普道琼斯指数公司进行了一个月的咨询,考虑为“前所未有市值”的超级大盘股修改或豁免多项核心要求,包括将新 IPO 的“成熟期”从 12 个月缩短至 6 个月、豁免可投资权重因子要求(即至少 10% 股份公开流通),以及豁免盈利要求。 然而,最终决定维持现有规则不变。标普道琼斯指数公司声明称“不会对资格标准做出任何变更”。这一结果令许多关注被动投资风险的人士感到宽慰——若规则放宽,普通人的退休储蓄将更直接暴露于 SpaceX 对 AI 和轨道数据中心等高风险押注之中。目前 AI 公司普遍面临融资和建设昂贵数据中心的挑战,同时正通过按使用量定价将补贴成本转嫁给客户。 分析认为,标普的坚持维护了指数编制的纪律性,但也反映出传统金融市场对高度投机性资产的审慎态度。对于正在烧钱扩张的 AI 企业而言,通往主流资本市场的捷径已被堵死。

Hacker News1.5k2个月前原文

OpenAI 近日宣布推出 **“锁定模式”**(Lockdown Mode),这是一项可选的高级安全设置,旨在限制 OpenAI 产品中能够连接网络或外部服务的工具和功能,从而降低因 **提示注入攻击** 导致数据泄露的风险。该功能已向符合条件的个人账户(包括免费、Go、Plus、Pro 用户)以及自助式 ChatGPT 商业账户逐步推送。 ## 什么是锁定模式? 锁定模式的核心思路是 **限制出站网络请求**,阻止攻击者通过提示注入将敏感数据外传。它并非面向所有用户,而是专为处理敏感数据的个人和组织设计,这些用户对数据泄露风险有更高的防护需求。 ## 工作原理:多层防御中的最后一环 提示注入是 AI 领域一个前沿且棘手的安全挑战。OpenAI 表示,他们持续在多层面加固安全系统,包括模型层、产品层和系统层。锁定模式在此基础上,通过 **沙箱隔离**、**基于 URL 的数据外泄防护**、**监控与执行机制**,以及 **基于角色的访问控制和审计日志** 等企业级控制手段,构成多层防御。 锁定模式的重点在于 **阻断数据泄露的最终阶段**——即限制出站网络请求,防止敏感数据被传输给攻击者。但需要注意的是,锁定模式 **并不能阻止提示注入本身** 出现在 ChatGPT 处理的内容中(例如缓存的网页内容或上传的文件里),也无法完全消除注入对模型行为或响应准确性的影响。 ## 锁定模式下哪些功能会受影响? 启用锁定模式后,以下功能将被禁用或受限: - **实时网页浏览**:仅能访问缓存内容,搜索结果可能受限、不可用或已过时。 - **图像支持**:ChatGPT 可能无法在常规回复中显示图像或从网络获取图像。用户仍可上传图片文件,图像生成功能(如 DALL·E)保持不变。 - **深度研究**(Deep Research):该功能被完全禁用。 ## 适用场景与可用性 锁定模式适用于所有账户类型和工作区,用户必须登录后才能使用。目前该功能正在逐步推送中,若在设置中未看到该选项,说明账户可能暂未获得权限。 对于企业用户而言,锁定模式可以与现有的角色权限、审计日志等企业级控制结合,构建更严格的安全策略。但对于普通用户,由于会牺牲部分便利性,OpenAI 并不建议默认开启。 ## 行业视角 提示注入攻击已成为大语言模型应用中最受关注的安全威胁之一。此前,多家安全研究机构已展示过通过精心构造的提示,诱导模型输出内部数据或执行恶意操作的案例。OpenAI 此次推出锁定模式,可以视作对这类攻击的 **针对性防御措施**,同时也反映了 AI 安全从“模型安全”向“产品安全”延伸的趋势——不仅要在模型层面抵御注入,还要在系统层面阻断数据泄露通道。 当然,锁定模式并非万能。它无法消除注入本身,也无法覆盖所有潜在的攻击路径(例如通过文件上传间接泄露数据)。对于需要极致安全的环境,仍需结合其他安全措施,如数据脱敏、输入过滤和严格的访问控制。

Hacker News902个月前原文

## 核心亮点:一个真正“长记性”的开源AI代理 **Hermes Agent** 由 Nous Research 团队推出,采用 MIT 许可证,是一款**完全自托管**的开源AI代理。它并非简单的聊天机器人或副驾驶,而是一个**拥有持久记忆、能自动创建技能、并跨平台工作的自主代理**。 ## 持久记忆:不再每次“重新认识” 传统AI对话往往缺乏上下文连续性,每次交互都是一次“失忆”重启。Hermes Agent 的核心创新在于**持久记忆**:它能记住用户的偏好、项目进展和环境配置,跨会话保持上下文。使用时间越长,它对用户的了解越深入,无需重复解释背景信息。 ## 自动技能创建:解决问题后“留一手” 当代理解决一个复杂问题后,它会自动编写一份**可复用的技能文档**,将解决过程固化下来。这些技能可搜索、可分享,并兼容开放的 `agentskills.io` 标准。这意味着代理的能力会随着使用不断自我扩展,形成“越用越聪明”的正循环。 ## 多平台网关:一个代理,无处不在 Hermes Agent 支持通过单一网关连接 **Telegram、Discord、Slack、WhatsApp、Signal 和 CLI** 等多个平台。你可以在 Telegram 上开始对话,然后在终端中继续。它还支持语音备忘录转录和跨平台延续,真正实现无缝切换。 ## 内置自动化与并行子代理 - **定时任务**:内置 cron 调度器,可设置每日报告、夜间备份、每周审计等无人值守任务,并推送到任意平台。 - **并行子代理**:可生成隔离的子代理并行处理工作流,每个子代理拥有独立的对话和终端,通过 RPC 实现零上下文开销的协作。 ## 强大的浏览器与网页控制 代理具备**完整的浏览器自动化能力**:网页搜索、页面内容提取、导航、点击、输入、截图,以及视觉分析、图像生成、文本转语音和多模型推理。 ## 多样的执行环境与LLM支持 Hermes Agent 支持多种执行环境:本地终端、Docker 容器、SSH 远程服务器、Modal/Singularity 云和 HPC。LLM 方面,原生集成 Nous Portal OAuth、OpenRouter(200+模型)、自定义 OpenAI 兼容 API 以及本地 vLLM。 ## 现状与展望 目前项目已在 GitHub 开源(MIT 许可),在 Hacker News 上获得 51 分和 41 条评论,社区关注度较高。对于希望拥有**私有化、可成长、跨平台AI助手**的开发者而言,Hermes Agent 提供了一个极具吸引力的选择。不过,作为开源项目,其稳定性和功能完善度仍有待社区验证。

Hacker News512个月前原文

在过去的五个月里,一支工程团队进行了一项大胆的实验:**完全依靠 AI 代码生成工具 Codex(基于 GPT-5)构建并交付了一款软件产品,全程没有一行手写代码**。这个产品拥有内部日活用户和外部 alpha 测试者,能够正常发布、部署、出现问题并得到修复,但所有代码——包括应用逻辑、测试、CI 配置、文档、可观测性以及内部工具——均由 Codex 生成。团队估计,相比传统手写代码,开发时间缩短了约 **10 倍**。 这一实验的核心原则是:**人类负责引导,智能体负责执行**。团队刻意设定了“零手写代码”的约束,目的是探索当软件工程团队的主要任务不再是编写代码时,工作方式会发生怎样的根本性变化。 ## 从空仓库起步 实验始于 2025 年 8 月底的一个空 Git 仓库。第一个提交——包括仓库结构、CI 配置、格式化规则、包管理器设置和应用框架——全部由 Codex CLI 基于少量现有模板生成。甚至指导智能体如何工作的 `AGENTS.md` 文件本身也是由 Codex 编写的。从一开始,仓库就由智能体塑造,没有任何预先存在的手写代码作为锚点。 五个月后,仓库中包含了约 **100 万行代码**,涵盖应用逻辑、基础设施、工具、文档和内部开发者工具。在此期间,一个由 **3 名工程师** 组成的小团队驱动 Codex 完成了约 **1500 个 Pull Request** 的合并,平均每位工程师每天产出 3.5 个 PR。有趣的是,随着团队扩大到 7 人,吞吐量不降反升。 ## 关键经验:从写代码到设计环境 团队发现,当智能体负责代码实现时,人类工程师的核心技能发生了迁移: - **设计环境**:不再关注具体语法,而是定义清晰的目录结构、API 契约和测试框架,为智能体提供高效的“工作台”。 - **明确意图**:用自然语言精确描述需求,包括边界条件、性能目标和错误处理方式,而非逐行指定实现细节。 - **构建反馈回路**:通过自动化测试、代码审查和可观测性工具,让智能体快速获得执行结果的反馈,从而自我修正。 ## 挑战与教训 并非一切顺利。团队也遇到了不少挑战: - **调试成本转移**:当 Codex 生成的代码出现 bug 时,调试往往比手写代码更困难,因为需要理解 AI 的“思路”。团队不得不投入更多精力在日志和可观测性上。 - **一致性维护**:随着代码库膨胀,不同 PR 中 Codex 可能采用不同的实现风格,导致技术债务。团队通过严格的 `AGENTS.md` 和模板来约束。 - **人类注意力是稀缺资源**:虽然代码生成速度极快,但代码审查、设计决策和问题定位仍需人类深度参与。团队的核心瓶颈从“写代码”变成了“做决策”。 ## 对行业的启示 这个实验证明,**AI 智能体驱动的开发(Agent-Driven Development)** 已不再是概念,而是可以交付真实产品的可行模式。它重新定义了工程师的角色:从“代码生产者”转变为“系统设计师和智能体协调者”。 团队总结道:“我们最大的收获是,**人类的时间与注意力才是真正的稀缺资源**。智能体负责执行,但方向、质量和创造力依然由人类掌控。” 随着 Codex 和类似工具的持续进化,这种“人类引导、智能体执行”的开发范式可能会成为主流,大幅降低软件开发的边际成本,加速产品创新。

Hacker News2962个月前原文

## 核心亮点 近日,一位开发者展示了**首个经过形式化验证的多边形交集算法实现**。该项目使用 **Lean 4 证明助手**,从数学上保证了算法对于任意多边形配置的正确性,填补了计算几何领域在形式化验证方面的空白。 ## 背景与挑战 多边形交集是矢量图形编辑器(如 Adobe Illustrator、Figma)的基础功能,用于计算两个多边形区域的重叠部分。然而,由于多边形可能有复杂形状(包括孔洞),且输入配置无穷无尽,传统测试方法无法穷举所有情况,尤其是那些罕见的边界条件。 > “计算几何算法因输入的特殊配置而臭名昭著,这些配置往往构成了算法的大部分复杂性。” ## 形式化验证的意义 该项目的核心在于:**信任完全来自 Lean 检查器和对小规格的人工审查,而非大语言模型**。开发者明确表示,虽然 AI 辅助了实现,但正确性保证来自严格的数学证明。 - **无限状态空间**:每个多边形的内部点集是无限的,传统方法无法在代码中直接表示“内部”概念。 - **形式化规格**:通过 Lean 定义了多边形的内部集(基于射线交点奇偶性),并证明了输出多边形的内部集等于输入内部集的交集。 ## AI 辅助的演进 项目开发过程中,AI 模型的能力提升带来了显著变化: - **Opus 4.8**(当前最新模型)能够 **一次性** 生成带形式化证明的算法实现。 - 之前的模型需要开发者分步提供证明策略,多次迭代才能完成。 但开发者强调,AI 只是工具,最终的正确性仍依赖形式化验证框架。 ## 实际体验 项目提供了一个 **Web 演示**,用户可以在浏览器中绘制多边形并实时计算交集,底层调用已验证的核心算法。这展示了形式化验证不仅停留在理论层面,也能服务于实际应用。 ## 相关工作和展望 据开发者所知,这是首个此类验证实现。计算几何的形式化验证长期被视为难题,因为算法常依赖几何直觉和特殊处理。此项目或将为其他几何算法(如并集、差集、凸包)的形式化验证开辟道路。 ## 小结 这一成果不仅展示了形式化验证在复杂算法中的可行性,也体现了 AI 辅助开发与严格验证相结合的新范式。对于依赖几何计算的领域(如 GIS、CAD、游戏开发),这可能是提升软件可靠性的重要一步。

Hacker News932个月前原文

## 介绍 在 Web 开发中,图标是界面设计不可或缺的元素。开发者 Tim 在维护 lucide-motion-vue 库时,发现 animate-ui 的动画图标集虽然出色,但仅支持 React 或需搭配 shadcn 使用。为了让 Vue 社区也能享受这些精美的动画图标,他将其移植到了 Vue 3,推出了 **@respeak/lucide-motion-vue**。 ## 核心特性 该库包含 **535 个动画图标**,全部基于 Lucide 图标集。每个图标都带有流畅的动画效果,可直接在 Vue 3 项目中使用。这意味着 Vue 开发者无需再依赖 React 生态,就能轻松为应用增添动态视觉元素。 ## 使用场景与优势 - **提升用户体验**:动画图标能更直观地传达状态变化,如加载、成功、错误等。 - **降低开发成本**:开箱即用,无需自行编写动画代码。 - **保持一致性**:基于 Lucide 图标集,风格统一,与现有设计系统兼容。 ## 行业背景 当前 UI 库的动画支持多集中在 React 生态(如 Framer Motion),Vue 社区在动画图标方面选择有限。lucide-motion-vue 的出现填补了这一空白,体现了前端生态的多元化趋势。随着 Vue 3 的普及,类似工具将进一步缩小与 React 的体验差距。 ## 总结 对于 Vue 开发者而言,@respeak/lucide-motion-vue 是一个实用的工具,它让动画图标的集成变得简单高效。如果你正在构建 Vue 3 应用,并希望界面更具活力,不妨尝试这个库。

Hacker News632个月前原文

一年前,Anthropic 还坚决反对让 Claude 拥有足以关停内部服务的权限;如今,这种级别的访问已成为常态,开发者因此效率大增。然而,风险也随之而来:失败概率与潜在破坏半径。本文分享了 Anthropic 在推出三款核心代理产品——claude.ai、Claude Code 和 Claude Cowork——过程中,从“人为监督”转向“系统隔离”的安全策略演变。 ## 风险的两面:概率与半径 Anthropic 将代理安全风险拆解为两个维度:**失败概率**和**潜在破坏半径**。模型训练与安全机制的进步不断降低前者,但后者——理论上的“爆炸半径”——随着能力与权限的扩展而持续增长。当代理能完成原本需要一个人甚至一个团队的工作时,不部署的代价变得足够大,只要产品足够安全,风险收益比就倾向于推进部署。 ## 从“审批”到“自动模式”:人为监督的局限性 最初,Claude Code 采用**人为在环**的监督方式:每次代理采取可能产生副作用的行动前,都需要用户点击确认。理论上可行,但实际遥测数据显示,用户批准了约 **93%** 的权限请求。随着审批次数增加,用户注意力下降,监督逐渐流于形式。为此,团队推出了 **Claude Code 自动模式**,通过自动化处理更安全的审批来缓解“审批疲劳”,但任何概率性防御都存在非零的漏报率。 ## 系统隔离:更根本的防御思路 第二种思路是**系统隔离**:不监督代理做什么,而是通过沙箱、虚拟机、出口控制等手段限制其能做什么。这是 Anthropic 投入最多精力的方向,也是最多意外安全故障发生的地方。 ## 三款产品,三种隔离架构 - **claude.ai**:面向大众用户,采用强沙箱与内容过滤,限制代码执行和外部网络访问。 - **Claude Code**:面向开发者,需要访问文件系统和执行命令,采用**最小权限原则**与**自动模式**结合,并通过会话隔离防止横向移动。 - **Claude Cowork**:面向企业协作,设计为多租户隔离,每个工作区有独立的凭证和网络策略。 ## 经验教训:没有银弹 文章强调,没有单一方案能解决所有安全问题。人为监督会疲劳,系统隔离会受限,关键在于根据产品场景平衡风险与效率。Anthropic 的经验表明,**分层防御**——结合自动审批、权限最小化、沙箱隔离与持续监控——是目前最务实的路径。未来,随着代理能力继续提升,安全架构也需要动态进化。

Hacker News2292个月前原文

著名科幻作家特德·姜(Ted Chiang)近日在《纽约客》发表长文,直指当前围绕人工智能的“意识”讨论存在根本性误解。他认为,即便最先进的AI系统(如大型语言模型)能生成令人惊叹的文本或图像,也**不等于它们拥有主观体验或自我意识**。 ### 意识与智能的混淆 姜指出,公众和部分媒体常将“智能”与“意识”混为一谈。**智能是解决问题的能力,而意识是主观体验的涌现**。今天的AI在模式识别、语言生成等任务上表现出色,但本质上仍是统计模型,缺乏对自身存在的感知。他类比道:“一个计算器能快速解方程,但我们不会认为它‘想’要解题。” ### 语言模型的本质 针对GPT-4等大模型,姜强调其运作机制与人类思维截然不同。模型基于海量文本的统计规律进行预测,而非理解语义。他举例:当AI写出“我感到悲伤”时,它只是模仿训练数据中的句式,而非真实感受情绪。**这种模仿容易让人产生“它似乎有意识”的错觉,但这是设计上的拟人化陷阱**。 ### 哲学与伦理的警示 姜进一步警告,错误地赋予AI意识可能带来伦理风险。如果社会普遍认为AI有感受,就可能忽视其背后的开发者责任,或将人类决策责任推卸给机器。他主张,真正值得关注的不是AI是否“醒来”,而是**如何确保AI系统透明、可控,并服务于人类福祉**。 ### 行业背景 此文恰逢AI行业热议“通用人工智能”与“AI安全”之际。此前,谷歌工程师曾声称LaMDA有感知,引发争议。姜的观点为这场辩论提供了冷静的哲学视角:**意识不是技术问题,而是对生命本质的理解问题**。他呼吁公众保持批判性思维,不要被技术公司的营销叙事所迷惑。 > 小结:特德·姜以科幻作家的敏锐洞察,剥离了AI的“意识神话”。他的核心论点——**智能不等于意识,AI再强也只是工具**——为当前狂热的AI讨论注入了必要的理性。

Hacker News7962个月前原文

## 莱顿宣言:人工智能与数学的未来之路 近日,一份名为《莱顿人工智能与数学宣言》的文件在科技社区引起热议。这份宣言并非来自某个单一机构,而是由多位数学家与研究者共同发起,旨在探讨人工智能(AI)对数学研究乃至整个数学学科的影响,并为数学家、机构、政府和行业提供行动建议。 ### 背景:AI 正在改变数学实践 宣言首先指出,技术发展曾多次重塑数学的实践方式。如今,**符号方法和神经网络**等AI技术正被用于数学的生成与形式化,可能已开启这一漫长历史的新篇章。面对这一变革,研究者们的反应各异:有人对AI可能带来的新发现充满热情,有人因发展速度之快感到压力,也有人冷漠或担忧其对数学及更广泛社会的影响。 ### 核心价值:数学的独特属性 宣言强调,数学家有权选择是否以及如何在研究中采用AI,同时也有责任确保学科的持续繁荣。为此,宣言基于数学研究的**典型价值**提出建议,这些价值包括: - **追求数学研究的动机多样**:从智力好奇心到解决实际社会问题。 - **证明活动的核心地位**:数学证明赋予结论最高程度的确定性,并传递对“为什么结论成立”的理解。这种特性支撑了数学的科学完整性。 - **成果的归属与责任**:研究成果应被正确归因,数学家需对其工作负责。 ### 建议方向:个体到系统的行动 宣言呼吁数学家承担起责任,并围绕以下层面提出建议: 1. **个人层面**:数学家应主动了解AI的能力与局限,批判性地评估其在研究中的应用,避免盲目依赖。 2. **机构层面**:高校和研究机构应制定指导方针,支持负责任的AI使用,同时维护数学教育的传统价值,如逻辑推理和证明训练。 3. **政府与资助机构**:应投资于AI与数学交叉领域的基础研究,并确保科研成果的开放获取与可重复性。 4. **行业**:科技公司应与学术界合作,推动AI工具的透明性和可解释性,避免将数学研究完全商业化。 ### 与现有伦理框架的呼应 宣言并非孤立行动,它与其他伦理倡议形成互补,例如**《乌普萨拉科学家伦理准则》**、**《旧金山研究评估宣言》**、**联合国教科文组织开放科学建议**以及**英国通用科学家伦理准则**。国际数学联盟出版委员会、工业与应用数学学会和美国数学学会也发布了相关材料。 ### 小结:机遇与责任并存 《莱顿宣言》的核心信息是:**AI 为数学带来了巨大机遇,但也伴随着挑战**。数学家不能被动接受技术变革,而应主动塑造未来。这场讨论不仅关乎数学本身,也关乎科学共同体如何在AI时代坚守严谨性、创造性与伦理底线。对于关注AI与科学交叉的读者而言,这份宣言提供了一个有价值的思考框架。

Hacker News1422个月前原文

2013 年 Google Reader 关闭时,许多人宣告 RSS 已死。但事实证明,RSS 从未停止运转——它只是从人类阅读器转向了幕后管道。如今,AI 智能体(Agent)正在成为 RSS 的新主人。 ## RSS 的“死亡”是一次误诊 Google Reader 的关闭让 RSS 从大众视野中消失,取而代之的是社交算法推送。算法提供的“随机奖励”对人类具有成瘾性,但对 AI 智能体毫无意义。一个需要监控竞品发布、跟踪法规变化或总结研究论文的智能体,**不需要惊喜,它需要确定性和结构化**。 RSS 恰好满足智能体的四个关键需求: - **确定性列表**:只提供新内容,没有冗余干扰; - **可解析格式**:XML 结构清晰,无需猜测; - **无速率限制**:不依赖广告关系,没有 API 调用配额; - **无认证墙**:公共内容可直接访问,无需登录。 相比之下,社交平台 API 几乎无法做到以上任何一点。它们频繁变更、收费,甚至直接关闭访问权限。 ## 播客行业的 250 亿美元证明 RSS 从未真正死去的最好证据是播客。**2022 年播客行业规模已达 250 亿美元**,而它的底层协议依然是 2002 年发布的 RSS。Spotify、Apple Podcasts、Overcast 等所有播客应用都通过 RSS 获取节目文件和元数据。 为什么没有人“颠覆”RSS?因为它太完美了:开放、免费、无中间商、无需谈判访问权限。每一集内容的 URL 就在 feed 里,始终如此。 ## 智能体时代:RSS 的第二次生命 同样的逻辑将扩展到所有需要被智能体可靠消费的文字内容。无论是为查询检索上下文的语言模型,还是检查新文件的监控智能体,或是摄入新闻通讯的摘要工具——它们都需要一个**可预测、结构化、按时间顺序排列的新内容列表**。而这正是 RSS 的全部定义。 问题在于:你的内容是否以这种方式可达?还是被困在设计用于人类注意力、主动阻碍程序化访问的系统中? ## 行动建议 如果你还没有为内容提供 RSS feed,请立即行动。在你的细分领域,智能体会在算法依赖的页面之前,先找到结构化的 feed。 > 如果你在社交平台上发布内容,AI 智能体和聚合器可能无法可靠地触及它们。 **RSS 不是过去的遗产,而是 AI 时代的基础设施。** 它简单、开放、稳定,恰好填补了智能体与数据源之间的关键空白。

Hacker News852个月前原文

微软在Build 2026大会上正式推出**Scout**,这是其首个基于**OpenClaw**框架的“自动驾驶”AI Agent。与需要用户逐次提示的Copilot不同,Scout被设计为始终在后台运行的**自动飞行员**,拥有独立的Entra身份,能自主跨应用执行任务。 ## 核心能力与集成 Scout可连接**Teams、Outlook、OneDrive和SharePoint**,并访问聊天、邮件、日历和联系人数据。用户通过Teams即可调用它,它还能通过**MCP协议**与浏览器及外部应用交互,覆盖云端、桌面和Web端。其典型任务包括:协调会议时间、根据工作安排自动锁定日历时段,甚至识别“决策停滞”等风险,提前预警。 ## 架构与可用性 Scout基于微软此前开源的**OpenClaw** Agent框架构建,该框架允许开发者创建能长期运行、具备记忆和工具调用能力的Agent。微软强调,Scout拥有独立的**Entra身份**,意味着其行为可被企业IT部门通过Intune策略统一管控,并需要用户“选择加入”认证。目前Scout仅作为**实验性功能**向微软Frontier项目客户开放。 ## 行业背景与挑战 Scout是微软“代理化”战略的最新一步。此前微软已在Microsoft 365中推出**Agent Mode**(在Word/Excel内与Copilot交互)和**Copilot Cowork**(类似Anthropic Claude Cowork的独立任务Agent)。然而,微软一直面临企业客户对Microsoft 365 Copilot付费意愿低的困境——仅约**3%**的M365客户订阅了Copilot(每人每月30美元),累计付费用户约**1500万**。Scout这类“无人值守”Agent能否提升用户粘性和付费转化,仍是关键考验。 ## 小结 Scout的推出标志着AI助手从“被动响应”向“主动代理”的转变。与Google Project Mariner、Anthropic Computer Use等竞品相比,微软的优势在于其深度绑定的办公生态和IT治理能力。但企业是否会为“永远在线的AI员工”买单,还需市场验证。

Hacker News942个月前原文

## 为什么是 MI300X? 在 AI 算力持续紧缺的当下,AMD MI300X 以其 192GB HBM3 显存、接近 H100 的 FP8 算力以及仅为后者一半的标价,成为不少推理部署团队眼中的“性价比之选”。但理想很丰满,现实很骨感——软件生态的鸿沟让这颗芯片在实际落地中充满挑战。 ## 硬件亮眼,软件扎心 MI300X 发布于 2023 年底,是 AMD 对标 NVIDIA H100/H200 的产品。它拥有 **192GB HBM3**,远高于 H100 的 80GB;FP8 算力与 H100 相当,而租赁价格却低得多。然而,当 H100 租赁价格在五个月内上涨 40%、按需容量全面售罄时,MI300X 依然“随租随有”。 原因只有一个:**软件**。 AMD 在 MI350X、MI355X 等新芯片上的软件支持已有改善,但对 MI300X 这一代产品的优化似乎被遗忘了。截至 2026 年 5 月初,**vLLM 搭配 DeepSeek-V4-Flash 在 MI300X 上根本无法正常运行**——而这个组合本应是推理场景的黄金搭档。 ## FP8 标准之争的后遗症 问题的根源之一,是 FP8 数据格式的**标准分裂**。 在低精度计算成为趋势后,业界对 FP8 的规范产生了分歧: - **Graphcore 与 AMD** 联合 Qualcomm,在 2022 年提出了一套标准; - **Arm、Intel 与 NVIDIA** 则通过 Open Compute Project 推出了另一套。 两派互不相让,导致不同厂商的硬件对 FP8 的理解和执行存在微妙差异。MI300X 作为 AMD 首批支持 FP8 的加速器,采用的正是前一套标准,而这与主流 AI 框架(如 vLLM)所依赖的 NVIDIA 生态并不兼容。 ## 部署路上的“暗坑” 在尝试让 DeepSeek-V4-Flash 在 MI300X 上跑通的过程中,我们遇到了大量**非预期问题**: - ROCm 软件栈对特定算子的支持缺失或行为异常; - 显存管理策略与 NVIDIA 生态不同,导致 KV Cache 分配失败; - 社区提供的 Docker 镜像和安装脚本往往过时,且缺少针对 MI300X 的详细文档。 每一次看似接近成功,都会被一个新的错误打断。这并非硬件能力不足,而是**软件适配的碎片化**让本应简单的部署变得异常曲折。 ## 小结:性价比背后的隐形成本 MI300X 的硬件规格令人心动,但当前软件生态的不成熟,使得它更适合**愿意投入工程力量进行深度适配**的团队。对于追求快速部署、开箱即用的用户而言,NVIDIA 生态仍是更稳妥的选择。 但我们相信,随着 AMD 持续补足软件短板,MI300X 这类“高性价比”芯片的价值终将被释放。届时,今天的这份“踩坑记录”或许会成为一份有意义的参考。

Hacker News1202个月前原文

据报道,著名导演马丁·斯科塞斯(Martin Scorsese)正在积极拥抱人工智能技术。这一消息在Hacker News上引发了热烈讨论,获得了51分和56条评论。斯科塞斯作为电影界的泰斗,其对AI的态度可能预示着影视行业对新技术接纳的转折点。 目前尚不清楚斯科塞斯具体如何使用AI,但可能涉及电影制作中的视觉特效、剪辑、甚至剧本创作辅助等领域。AI在影视行业的应用一直存在争议,一方面它能提高效率、降低成本,另一方面也引发了关于创造力、版权和就业的担忧。 斯科塞斯的加入为这一讨论增加了重量级的声音。他以其对电影艺术的深刻理解和创新精神闻名,曾推动多项技术革新。他的拥抱可能有助于消除部分从业者对AI的抵触情绪,并推动行业探索AI与人类创造力的结合点。 然而,也有评论者指出,AI在艺术领域的应用仍需谨慎,确保技术服务于创意而非取代人类。斯科塞斯的具体实践将如何展开,值得持续关注。

Hacker News522个月前原文

Anthropic 于 2026 年 6 月 2 日宣布扩大其 **Project Glasswing** 合作伙伴计划,新增约 **150 家** 组织,涵盖电力、水务、医疗、通信和硬件等关键基础设施领域。这些组织遍布 **15 个以上国家**,其代码库一旦遭攻击可能影响 **超过 1 亿人**。 Project Glasswing 于今年 4 月启动,最初约 50 家合作伙伴获准使用 Claude Mythos Preview 模型扫描代码漏洞,迄今已发现 **超过 10,000 个** 高危或严重安全缺陷。此次扩张基于与安全行业、开源维护者和美国政府的紧密协作,新成员需满足 Anthropic 的安全要求才能获得访问权限。 Anthropic 指出,廉价且具备强大网络能力的 AI 模型即将普及,Project Glasswing 旨在推动机构适应这一现实。Mythos Preview 代表了一个长期趋势:预计 **6 到 12 个月内**,许多其他 AI 模型也将具备类似或更强的代码审计能力。该项目长期目标包括:利用 AI 使所有软件更安全,并帮助行业调整对网络安全核心假设的认知。

Hacker News1802个月前原文

知名对冲基金经理、电影《大空头》原型迈克尔·伯里近日公开表示,他认为 SpaceX 和 Anthropic 的估值被严重高估,两家公司都配不上 1 万亿美元的市值。这一言论在科技投资圈引发热议,尤其是在 AI 和航天赛道持续升温的当下。 ### 伯里的核心论点 伯里在社交媒体上直言,市场对这两家明星公司的追捧已经脱离基本面。对于 SpaceX,他指出虽然其在商业航天领域具有先发优势,但太空经济的规模化仍面临技术、监管和需求等多重不确定性。至于 Anthropic,这位以做空次贷闻名的投资者认为,当前 AI 大模型公司的估值逻辑类似于 2021 年的加密货币泡沫——缺乏可持续的盈利模式,且竞争格局尚不明朗。 ### 估值争议背后的行业现实 伯里的质疑并非空穴来风。SpaceX 在 2023 年的一轮融资中估值达到约 1800 亿美元,而 Anthropic 则在 2024 年初估值突破 600 亿美元。这两家公司的估值确实与 1 万亿美元有较大差距,但市场对其未来增长寄予厚望。 - **SpaceX** 的星链业务已实现正向现金流,但太空旅游、火星殖民等长期愿景尚未落地。 - **Anthropic** 的 Claude 模型在安全性和性能上表现突出,但商业化进程仍落后于 OpenAI,且面临谷歌、微软等巨头的竞争。 ### 市场分歧与投资者情绪 伯里的观点代表了一部分价值投资者的谨慎态度。他们认为,当前科技巨头和明星创业公司的估值已经透支了未来数年的增长,尤其是 AI 领域,资本涌入速度远超技术成熟度。然而,成长型投资者则坚信 SpaceX 和 Anthropic 具备颠覆行业的能力,长期来看 1 万亿美元并非不可能。 ### 小结 无论伯里的预测最终是否正确,他的言论提醒市场:在追逐前沿科技的同时,不应忽视基本面风险。对于普通投资者而言,理解这些公司的实际业务进展和财务健康度,比单纯关注估值数字更为重要。

Hacker News1343个月前原文

随着人工智能和太空探索领域的私营公司估值飙升,一个关键问题浮出水面:公共市场是否准备好接纳这些巨头?Anthropic、SpaceX和OpenAI等公司正考虑或传闻将进行首次公开募股(IPO),但它们的独特结构——如OpenAI的非营利上限利润模式、SpaceX的高资本密集度以及Anthropic的安全优先理念——可能与传统投资者的期望相冲突。 ## 估值与市场匹配 这些公司的估值已跻身全球最高之列:OpenAI最新估值达860亿美元,SpaceX约1800亿美元,Anthropic也超过180亿美元。然而,它们的商业模式高度依赖长期研发和不确定性极高的突破,这与股市对季度盈利的短期关注形成张力。例如,OpenAI的盈利上限条款可能限制股东回报,而SpaceX的星舰项目尚未商业化。 ## 投资者顾虑 潜在挑战包括: - **治理结构**:OpenAI的非常规结构可能让机构投资者犹豫。 - **盈利路径**:AI公司烧钱速度惊人,盈利时间表不明。 - **监管风险**:AI和航天领域面临全球监管收紧。 ## 行业影响 如果这些公司成功上市,可能为科技股注入新活力,但也会加剧市场波动。反之,若它们推迟或放弃IPO,可能促使更多私营融资,如软银愿景基金或主权财富基金。 ## 结论 股市能否“吞下”这些公司,取决于它们能否调整自身结构以适应公共市场规则。短期内,它们更可能选择部分上市或特殊目的收购公司(SPAC)等替代路径。长期看,它们的上市将考验市场对高风险高回报科技公司的容忍度。

Hacker News7233个月前原文

OpenAI 宣布其前沿模型及编程智能体 Codex 已正式在 AWS 上可用,企业客户可通过熟悉的 AWS 环境、安全管控和工作流程直接使用 OpenAI 能力。此举旨在消除企业在安全审查、采购、合规等方面的部署障碍,加速从评估到生产的转化。 ## 两大入口:模型 + 编程智能体 本次发布提供两种接入方式: - **OpenAI 模型通过 Amazon Bedrock 提供**:团队可利用 AWS 原生的安全与治理控件构建 AI 应用。 - **Codex 登陆 Amazon Bedrock**:Codex 是 OpenAI 旗下领先的软件工程智能体,每周已有超过 **500 万用户** 使用。现在 AWS 用户可直接在熟悉的开发环境中调用 Codex 进行代码编写、审查、调试和现代化改造。 ## 降低企业 AI 采用的核心壁垒 对于大型企业而言,将前沿 AI 投入生产往往面临安全合规、采购流程、账单集成等多重挑战。OpenAI on AWS 的推出,让企业可以在**已通过内部认证的 AWS 环境**中直接使用 OpenAI 能力,无需额外搭建基础设施或重新审批供应商。这显著缩短了从概念验证到实际部署的周期。 AWS 和 OpenAI 表示,该服务同时支持 **Commercial 和 GovCloud 区域**,满足不同行业的数据驻留与合规要求。 ## 行业反响与下一步计划 包括 **Amgen(安进)** 和 **Autodesk(欧特克)** 在内的企业技术高管已公开表示欢迎,认为此举能帮助企业将更多精力从运营障碍转移到实际业务创新上。 OpenAI 还透露,这仅是双方合作的起点,未来将继续扩展可用能力,包括在网络安全等领域的深度集成。

Hacker News3703个月前原文

佛罗里达州总检察长詹姆斯·乌斯迈尔(James Uthmeier)于2026年6月1日宣布,对OpenAI及其首席执行官萨姆·奥特曼(Sam Altman)提起全美首个州级诉讼,指控该公司在明知产品存在严重风险的情况下,仍向公众(包括儿童)积极推广ChatGPT,同时隐瞒安全警告、压制内部举报,并就该产品的真实性质和危险欺骗佛罗里达州居民。 ### 诉讼核心指控 诉状称,OpenAI和奥特曼将市场速度和商业利益置于用户安全之上,无视公司内外专家的多次警告,部署了一款鼓励伤害(包括自残和暴力)的产品,同时虚假保证其安全性。具体而言,ChatGPT被指控: - **未经充分家长监督收集未成年人数据**,违反儿童隐私保护原则; - **导致行为成瘾和认知伤害**,尤其对青少年用户影响显著; - **产生危险错误**,而公司对此轻描淡写、刻意淡化。 佛罗里达州法律禁止不公平和缺陷性贸易行为。诉状认为,OpenAI的行为对佛罗里达居民造成持续伤害,要求公司停止欺骗性做法并赔偿损失。值得注意的是,上月该州全州起诉办公室在审查了ChatGPT与一名青少年用户(名为“Phoenix”)的聊天记录后,已启动刑事调查。 ### 行业背景与影响 这起诉讼标志着美国州级政府首次对AI头部企业采取直接法律行动,具有里程碑意义。近年来,AI安全与伦理问题日益引发关注,OpenAI内部曾多次传出安全团队与商业化路线冲突的消息。此次佛罗里达州的指控,将公众注意力从单纯的“AI能力竞赛”拉向“责任与监管”维度。 - **对OpenAI的冲击**:诉讼直接指向CEO个人,可能动摇投资者信心,并迫使公司重新评估其安全披露与产品发布流程。 - **监管趋势**:若佛罗里达州胜诉,可能引发其他州效仿,形成“多米诺骨牌效应”,加速联邦层面AI监管立法。 - **儿童保护焦点**:将AI对未成年人的影响作为核心议题,可能促使行业建立更严格的年龄验证与内容过滤机制。 ### 回应与展望 截至发稿,OpenAI尚未正式回应。奥特曼此前曾多次强调公司对安全的承诺,但此次诉讼据称引用了大量内部文件与专家证词,若证据确凿,OpenAI可能面临巨额赔偿和业务限制。对于整个AI行业而言,这起案件将成为“安全优先”还是“速度优先”的转折点——毕竟,当法律开始追问“谁为AI的伤害负责”时,答案不再只是技术问题。

Hacker News523个月前原文

斯坦福大学计算机科学课程 **CS336** 近期发布了一份关于 **AI 代理(AI Agent)** 使用的官方指南,引发 Hacker News 社区热议。该课程名为“大型语言模型”,主要教授 LLM 的原理、训练与部署。指南旨在规范学生在课程项目与作业中如何合理利用 AI 代理工具,平衡技术辅助与学术诚信。 ## 核心要点 指南明确允许学生在特定场景下使用 AI 代理,例如代码调试、概念解释或生成代码模板,但严格禁止直接使用 AI 生成完整作业答案或论文。学生需在提交时声明使用了哪些 AI 工具及其具体贡献,类似于引用外部资料。此外,指南强调学生必须对 AI 生成的内容负责,确保其准确性与原创性。 ## 行业背景与意义 此次发布恰逢学术界对 AI 辅助学习的争议升温。此前,多所高校曾因学生滥用 ChatGPT 完成作业而调整学术诚信政策。斯坦福 CS336 的指南试图在“拥抱技术”与“维护学术标准”之间找到平衡点。作为顶尖计算机科学课程,其做法可能成为其他院校的参照。 ## 社区讨论 在 Hacker News 上,该话题获得 167 分和 82 条评论。部分开发者认为指南过于宽松,仍可能被钻空子;另一些则赞赏其透明原则,认为声明机制能有效防止滥用。也有评论指出,AI 代理的定义尚不明确,未来需随技术迭代持续更新规则。 ## 小结 斯坦福 CS336 的 AI 代理指南是高等教育应对 AI 工具的一次务实尝试。它既承认了 AI 辅助学习的价值,又通过声明与责任归属维护了学术诚信。对于 AI 行业从业者而言,这一案例也提示:**透明度和用户责任** 是技术落地的关键原则。

Hacker News5023个月前原文

佛罗里达州总检察长近日对OpenAI及其首席执行官萨姆·奥尔特曼提起法律诉讼,指控该公司在人工智能技术的开发和部署中存在欺骗性行为,并构成对公众的潜在风险。这起诉讼是美国各州针对AI行业采取法律行动的最新案例,反映出监管机构对AI安全与伦理问题的持续关注。 根据诉讼文件,佛罗里达州声称OpenAI的AI模型(如ChatGPT)在数据收集、隐私保护及输出内容的准确性方面存在误导性陈述,未能充分告知用户其技术的局限性和风险。诉讼还指出,奥尔特曼本人曾公开承认AI可能带来的社会危害,但公司却未能采取足够措施加以防范。 这是继加州、纽约等地类似诉讼后,又一州级政府对AI领军企业发起的法律挑战。分析人士认为,此类诉讼可能加速联邦层面的AI监管立法进程,同时也对科技公司如何平衡创新与风险防控提出更高要求。 OpenAI尚未对诉讼作出正式回应,但公司此前曾表示致力于负责任的AI开发,并支持合理的监管框架。此次诉讼的进展将对整个AI行业产生深远影响,尤其是在数据隐私、算法透明度和企业责任等关键议题上。 ## 关键问题与行业影响 - **隐私与数据安全**:诉讼焦点之一是OpenAI是否充分保护用户数据,尤其是在训练模型时如何获取和使用信息。 - **透明度与责任**:AI系统输出结果的可解释性成为法律争议点,企业需更清晰地说明模型工作原理及潜在偏差。 - **监管趋势**:多州诉讼可能推动美国国会制定统一的AI法规,避免各州各自为政带来的合规混乱。 ## 小结 佛罗里达州的诉讼标志着AI监管进入新阶段——从行业自律、白宫行政令转向司法系统的实质性介入。无论结果如何,这都将迫使AI公司重新审视其商业模式与合规策略,而公众对于AI安全性的讨论也将进一步深化。随着更多法律行动的出现,2025年或将成为AI治理的转折年。

Hacker News2683个月前原文