Hacker News 热门 · 338 分 · 344 评论
Hacker News 热门 · 75 分 · 76 评论
Hacker News 热门 · 240 分 · 111 评论
Hacker News 热门 · 216 分 · 190 评论
I think agent-first chat interfaces will be a primary software modality and busy dashboard/UI will go away. I’m not sure who exactly wins it, but I want my knowledge to grow/go with me.A lot of the “knowledge” ie research, analysis, reasoning will be done by agents as the primary user. Our
在探索几何代数的过程中,我构建了一套交互式可视化工具,用以展示旋转、缩放、平移等几何变换如何仅通过反射的复合来构造。将反射视为最基本的几何操作,对我来说是一个令人眼前一亮的时刻。 ## 核心思想:反射作为基本操作 传统上,旋转通常被理解为绕轴转动,缩放是比例变换,平移则是沿向量移动。然而,在几何代数框架下,这些变换都可以统一为反射的组合。例如,**旋转可以通过两次反射实现**:先关于一条直线反射,再关于另一条直线反射,两次反射的复合效果等价于绕两线交点的旋转,旋转角度为两线夹角的两倍。这种视角不仅优雅,而且揭示了变换之间的深层联系。 ## 交互式可视化:让抽象变得直观 为了帮助理解这一概念,我开发了交互式可视化工具,用户可以通过调整反射轴的位置和方向,实时观察变换效果。这种直观的演示方式,使得抽象的数学原理变得触手可及。例如,用户可以直观地看到,当两条反射轴平行时,两次反射产生平移;当它们相交时,产生旋转;而当反射轴经过原点且角度变化时,可能产生缩放效果。 ## 为何重要:从理论到应用的桥梁 几何代数在计算机图形学、机器人学和物理模拟中有着广泛应用。理解反射作为基本操作,有助于简化复杂变换的推导和实现。例如,在三维空间中,旋转矩阵的构建可以通过反射矩阵的乘积得到,这在某些场景下可能更高效或更稳定。此外,这种视角也为处理更高维空间中的变换提供了统一框架。 ## 个人感悟 学习几何代数时,将反射视为最基础的操作,让我对几何变换有了更深的理解。这种“由简入繁”的构建方式,不仅展示了数学之美,也启发我在解决问题时寻找更根本的出发点。 如果你对几何代数或变换可视化感兴趣,欢迎体验这些工具,并分享你的想法。
DeepSeek 近日发布了全新的视觉语言模型 **deepseek-v4-flash-vision-exp**,该模型在原有文本能力基础上新增了图像理解功能,支持用户上传图片并进行描述、OCR、图表分析等操作。模型兼容 OpenAI 的 Chat Completions 和 Responses API,开发者可通过三种方式传入图像:Base64 编码内联、外部 URL 以及文件上传。 ## 核心能力与使用方式 新模型支持 JPEG、PNG、GIF 和 WebP 格式,格式检测基于文件内容而非文件名或 MIME 类型。用户可以通过标准的 `content` 数组结构同时传递文本和图像,实现多模态对话。 三种图像传入方式各有适用场景: - **Base64 编码**:适合本地文件,直接嵌入请求,但受 48 MiB 请求体大小限制。 - **外部 URL**:适合网络图片,模型会自行下载,URL 长度不超过 8192 字符,图片大小不超过 32 MiB,下载需在 60 秒内完成。 - **文件上传**(通过 Files API):适合大文件或需要持久化存储的场景。 官方示例提供了 Python 和 curl 两种调用方式,开发者可以快速上手。 ## 行业意义与前景 DeepSeek 此举标志着其在大模型多模态领域的进一步布局。当前,多模态能力已成为大模型竞争的关键方向,从 GPT-4V 到 Gemini,各大厂商都在强化视觉理解。DeepSeek 以开源和性价比著称,此次推出视觉模型有望降低多模态应用的门槛,吸引更多开发者和企业用户。 值得注意的是,该模型目前标注为“exp”(实验性),意味着其性能和稳定性可能仍在优化中。不过,对于希望在中文环境下构建图像理解应用的团队来说,这无疑是一个值得关注的新选项。 未来,随着 DeepSeek 不断完善视觉模型,我们或许能看到更多基于该能力的创新应用,如智能客服、内容审核、教育辅助等。
近期,OpenAI 的 Codex CLI 在 Amazon Bedrock 上使用时,因缺乏显式缓存控制而引发严重成本问题,用户报告费用高达正常水平的 10 倍。该问题在 GitHub 上引发热议,获得 145 分和 61 条评论,凸显了 AI 编码工具在云环境中的成本管理挑战。 ## 问题根源 根据 GitHub 问题 #37674,Codex CLI 0.147.0 版本在调用 Bedrock Mantle 服务时,无法启用 GPT-5.6 Sol 的显式提示缓存。在代理式编码工作负载中,这导致大量缓存写入令牌,推高了成本。 用户 apexethdev 提供了生产环境数据:在 2026 年 8 月 5 日至 8 日期间,共发起 **3,656 次请求**,产生 **1.7194 亿缓存写入令牌**,估算成本 **1,182.09 美元**,占总成本约 85%。本地会话中,每次请求平均产生约 88K 缓存写入令牌,且无缓存读取。尽管 CloudWatch 指标无客户端错误,但费用依然飙升。 ## 技术原因 Codex 虽已生成会话级 `prompt_cache_key`,但 HTTP 和 WebSocket 请求均未包含 `prompt_cache_options` 或 `prompt_cache_breakpoint`。AWS Bedrock 提供的内置配置仅支持传输和认证设置,无法通过 `config.toml` 修改请求体,使用户无法自行调整缓存策略。 ## 影响与建议 此问题与 #35300 相关,但提供了原生 Bedrock 提供商的独立证据。对于依赖 Codex 进行大规模编码的团队,成本控制至关重要。建议用户密切关注 AWS 账单,并考虑在修复前使用其他模型或提供商。同时,OpenAI 和 AWS 需协作,提供明确的缓存配置选项,以避免类似成本激增。 该事件提醒我们,在采用 AI 工具时,不仅要关注功能,还需评估其云服务集成的成本效率。随着 AI 代理编码的普及,类似问题可能会更频繁出现,优化缓存策略将成为降低开销的关键。
2026年初,AI编程助手的能力突飞猛进,让许多开发者体验到了前所未有的高效。然而,蜜月期过后,开发者们开始感到疲惫:每天用长篇英文描述每个改动,不仅繁琐,而且效率低下。Huzzah应运而生,它提出了一种全新的范式:用伪代码代替自然语言,用声明式指令代替命令式指令,让意图持久化而非转瞬即逝。 ## 痛点:自然语言的低效与意图的丢失 传统的AI编程助手(如GitHub Copilot)依赖自然语言对话。开发者需要将每个改动描述成一步步的指令,这不仅耗时,而且充满冗余。更重要的是,对话记录往往被丢弃,导致AI无法理解代码的长期意图。Huzzah的创始人指出,这种模式缺乏“人类意图的可靠记录”,使得代码质量难以保证,也让开发者逐渐失去对项目的掌控感。 ## Huzzah的解决方案:伪代码与声明式编程 Huzzah的核心创新在于改变了与AI交互的方式。它不再使用长篇自然语言,而是采用**伪代码**——一种接近自然语言但更结构化的表达。同时,指令从“命令式”转为“声明式”,即描述“想要什么”而不是“怎么做”。这些指令是**持久化**的,会作为项目的一部分被保存下来,成为代码库的“意图文档”。 以经典的FizzBuzz为例,在传统AI编程中,你可能需要写:“写一个循环100次,如果数字能被3整除,打印fizz;如果能被5整除,打印buzz……”而在Huzzah中,你只需用伪代码描述目标,AI会自动生成实现。 ## 对开发者的意义 Huzzah的尝试反映了开发者对AI编程工具的深层需求:**既要AI的高效,又要人类的控制权**。它试图解决三个关键问题: - **效率**:减少重复描述,节省token和时间。 - **意图**:让AI理解代码的“为什么”,而不仅仅是“是什么”。 - **掌控**:开发者能通过伪代码审查AI的决策,确保输出符合预期。 当然,Huzzah仍处于实验阶段,其可行性有待验证。但它代表了一种值得关注的趋势:AI编程工具正在从“对话式”向“结构化”演进,以更好地服务于专业开发者。 ## 未来展望 Huzzah目前只是一个原型,但其理念可能引发更多思考。如果成功,它或许会改变我们与AI协作的方式,让编程回归到“表达意图”的本质。对于厌倦了提示词工程的开发者来说,这无疑是一个令人兴奋的方向。
Vendo 是一个开源的可定制化层,允许用户在他们已经使用的软件内部创建新功能。用户描述他们需要的仪表盘、工作流或小型应用,Vendo 就会基于产品现有的数据、API 和界面来构建它。Vendo 面向那些客户不断要求定制功能的 B2B SaaS 团队。它作为一个嵌入式代理,通过产品自身的 API 以登录用户的身份操作,并在沙盒化的、品牌原生的界面中渲染生成的 UI。你的源代码永远不会被触碰。 ## 快速上手 安装只需 60 秒: ```bash npm install @vendoai/vendo npx vendo init ``` 或者,你也可以通过编码代理来安装,只需将指令粘贴到你的应用仓库中。 ## 核心能力 - **构建视图**:提出问题,即可获得由宿主自身组件和 API 组成的实时视图。 - **重塑界面**:悬停组件,描述更改,就地应用。 - **跨工具自动化**:用自然语言描述,即可生成自动化流程,每个工具的操作都需经过审批。 ## 工作原理 Vendo 运行一个流式代理,可与任何 AI SDK 的 LanguageModel 配合使用。它首先读取你的 API 并将其转化为代理可执行的工具;然后代理根据格式标签的 UI 文档生成视图和用户拥有的应用,生成的组件在 iframe 沙箱中运行(connect-src 'none'),仅在需要时升级到沙箱服务器;最后,策略、审批、授权、断路器和审计都集中在执行控制点进行管控。 ## 适用场景 无论你已有代理(一个 AI SDK 工具包)还是产品没有代理,Vendo 都能提供相应的集成方式。它还可以通过 MCP 暴露你的产品,让 Claude、ChatGPT、Cursor 等以登录用户身份操作。 Vendo 由 Yousef 和 Nour 创立,目前是 YC S26 的一员。你可以访问 vendo.run 了解更多,或阅读 docs.vendo.run 上的文档。
近日,Anthropic 的编程工具 Claude Code 在 GitHub 上收到一项功能请求,希望其支持 AGENTS.md 文件。该提案获得了社区广泛关注,在 Hacker News 上引发热议,获得 342 分和 212 条评论。 ## 背景:AGENTS.md 的崛起 AGENTS.md 是一个统一的 Markdown 文件,旨在帮助编码代理(coding agents)理解代码库。目前,Codex、Amp、Cursor 等工具已开始采用这一标准(参见 agents.md)。相比之下,Claude Code 目前依赖的 CLAUDE.md 文件被认为过于特定于 Claude Code,不利于与其他开发者协作,尤其是那些不使用 Claude Code 的开发者。 ## 社区声音:协作与标准化 在 GitHub 问题 #6235 中,用户 DylanLIiii 提出了这一请求,并获得了不少支持。评论者普遍认为,支持 AGENTS.md 将提升 Claude Code 与其他 AI 编程工具之间的互操作性,促进团队协作。一位开发者评论道:“当我们切换工具时,不希望重写配置文件。”另一位则指出:“标准化是趋势,AGENTS.md 正在成为事实标准。” ## 行业分析:AI 编程工具的标准化竞赛 这一事件折射出 AI 编程工具领域的一个关键趋势:标准化。随着越来越多的 AI 编码助手涌现,开发者希望在不同工具间无缝切换,而配置文件的一致性是其中的重要环节。AGENTS.md 的兴起,类似于早期代码编辑器中 `.editorconfig` 的标准化,但针对的是 AI 代理。 对于 Anthropic 而言,支持 AGENTS.md 不仅是满足用户需求,更是在战略上顺应生态发展。如果 Claude Code 固守 CLAUDE.md,可能在协作场景中处于劣势,尤其是在团队采用多工具混合工作流的情况下。 ## 未来展望 目前,该问题仍处于开放状态,Anthropic 尚未回应。但鉴于社区呼声高涨,我们有理由期待 Claude Code 将在未来版本中考虑支持 AGENTS.md,或至少提供某种兼容机制。 对于开发者而言,无论工具如何演进,拥抱开放标准总是明智之举。AGENTS.md 或许就是下一个你需要在项目中加入的文件。
**Opus 5.0** 的发布在 AI 社区引发了激烈讨论,Hacker News 上迅速积累 143 分和 125 条评论,显示出开发者与研究人员的高度关注。然而,与通常围绕性能提升或创新功能的赞誉不同,这次讨论的核心却是一个令人意外的关键词:**“不连贯性”**。 从标题“Opus 5.0 drives incoherence into the stratosphere”来看,用户似乎认为该模型在生成内容时出现了严重的逻辑断裂或上下文不一致问题。尽管具体细节尚不明确,但社区反馈暗示,Opus 5.0 可能在长文本生成、多轮对话或复杂推理任务中产生了更多“幻觉”或自相矛盾的输出。 这一现象值得深思。通常,模型迭代会追求更高的连贯性和准确性,但 Opus 5.0 却可能因过度优化某些指标(如创造性或多样性)而牺牲了逻辑一致性。这并非孤例——近年来,随着生成式 AI 的爆发,如何在**创造性与可靠性**之间取得平衡,始终是行业的核心挑战。 对于开发者而言,这一反馈意味着在依赖 Opus 5.0 构建应用时,需要更谨慎地设计提示词或引入外部验证机制,以规避潜在的风险。同时,这也提醒我们,**模型评测不能仅依赖基准分数**,真实场景中的用户反馈同样至关重要。 目前,官方尚未对相关讨论做出正式回应,我们无法确认问题的具体成因或范围。但可以预见,这一事件将促使更多团队关注模型的可控性,并可能推动后续版本的针对性优化。 在 AI 快速迭代的今天,**每一次发布都是一次实验**,而社区的声音正是推动进步的重要力量。Opus 5.0 的争议,或许正是下一次突破的契机。
随着 AI 代理的广泛应用,一个长期被忽视的安全隐患正浮出水面:许多开发者直接将原始 API 密钥硬编码或明文传递给这些代理,导致密钥泄露、滥用和成本失控的风险急剧上升。最近在 Hacker News 上亮相的 **OneCLI**,正是为了解决这一痛点而生——它是一个用 **Rust** 编写的开源网关,旨在让 AI 代理能够安全访问外部资源,而无需直接暴露敏感密钥。 ### 为什么 AI 代理需要专门的密钥管理? AI 代理(如自动化助手、代码生成工具或数据分析机器人)通常需要调用第三方 API(如 OpenAI、GitHub 或云服务)来执行任务。传统做法是将 API 密钥嵌入代码或环境变量中,但这带来了多重风险: - **安全漏洞**:代理可能意外泄露密钥,尤其是在日志记录或错误报告中。 - **权限滥用**:代理一旦获得密钥,就可能执行超出预期范围的操作,比如删除数据或发起高成本请求。 - **可追溯性差**:难以监控密钥的使用情况,导致审计和故障排查困难。 OneCLI 的核心理念是 **“给予访问权限,但不给予秘密”**。它作为一个中间层,代理通过 OneCLI 发起请求,而 OneCLI 负责安全地管理和注入密钥,确保代理本身永远不会接触到原始密钥。 ### OneCLI 如何工作? OneCLI 设计为一个轻量级命令行工具,易于集成到现有工作流中。其主要功能包括: - **密钥保险库**:集中存储和管理 API 密钥,支持加密和访问控制。 - **请求代理**:拦截 AI 代理的 API 调用,自动附加所需密钥,同时隐藏密钥细节。 - **审计日志**:记录所有密钥使用事件,便于监控和合规检查。 - **开源与 Rust 实现**:基于 Rust 语言开发,强调性能、内存安全和跨平台兼容性;开源模式鼓励社区贡献和透明审计。 ### 对 AI 行业的意义 OneCLI 的出现反映了 AI 生态从“快速原型”向“生产就绪”的演进。随着企业级 AI 代理部署增多,安全性和可管理性成为关键考量。类似工具(如 HashiCorp Vault 的 AI 扩展)虽存在,但 OneCLI 专注于 AI 代理场景,提供了更针对性的解决方案。 **潜在优势**: - 降低安全风险,防止密钥泄露导致的财务或数据损失。 - 提升运维效率,通过集中化管理简化密钥轮换和权限调整。 - 促进 AI 代理的规模化应用,为复杂自动化任务铺平道路。 **挑战与不确定性**: - 目前公开信息有限,具体性能指标、集成难度和社区支持情况尚待观察。 - 如何平衡便利性与安全性,避免成为单点故障,是未来发展的关键。 ### 小结 OneCLI 代表了 AI 工具链中一个新兴的细分领域——代理安全基础设施。它提醒开发者:在追求 AI 能力的同时,绝不能忽视基础的安全实践。随着项目开源和社区参与,它有望成为 AI 代理生态中的重要一环,推动更安全、可靠的自动化进程。 *注:基于现有摘要,OneCLI 的具体功能细节和发布日期等信息可能不完整,建议关注其 GitHub 仓库以获取最新动态。*
人工智能的发展速度已远超制度的应对能力。当一项变革性技术即将冲击资本主义政治经济体系时,我们面临的是生存、自主与民主秩序的多重风险。硅谷精英们轻描淡写地谈论着“永久底层阶级”,而他们显然希望你成为其中一员。随着大多数工作——最终可能是所有工作——被自动化,人类将面临前所未有的技术性失业危机,而基于全人类数据训练出来的技术成果,却可能集中到少数股东手中。 大型语言模型并非凭空产生。它们建立在海量的互联网文本、图像和代码之上,本质上是对人类集体智慧的衍生。这些模型还依赖于公共资金支持的基础设施:互联网本身、培养AI研究者的公立大学、资助基础研究的政府拨款、推动早期突破的公共数据集。DARPA资助了神经网络研究,公立大学培养了博士,而数据则来自我们所有人。这是一场公共资源的圈占运动。 鉴于AI公司对人类整体福祉缺乏兴趣,它们一直抗拒公民社会与政府的监管压力,即便自身也承认存在灾难性风险。显然,自农业以来最具变革性的技术不应掌握在私人手中。默认的发展轨迹是“收益极度集中,风险社会化”。因此,**挪威政府全球养老基金(GPFG)应当收购OpenAI,并为国际社会共同利益进行管理**。 GPFG规模超过2万亿美元,而OpenAI的估值约为8000亿美元。OpenAI原本是一家非营利组织,设有利润上限和“风落条款”,承诺智力爆炸将惠及全人类。但在加州总检察长的批准下,这一承诺被废除,非营利资产被剥夺,OpenAI转型为营利性企业。 **收购的可行性**:从财务角度看,GPFG完全有能力支付这笔交易,且不会显著影响其多元化投资组合。收购后,OpenAI的模型可以作为全球公共产品,免费或低成本开放给所有人,收益则用于资助全球教育、医疗和基础设施。这不仅能避免财富过度集中,还能确保AI发展方向符合公共利益。 **潜在挑战**:首先是政治阻力,美国可能出于国家安全考虑阻止外国实体收购其关键AI企业;其次,OpenAI的估值可能继续攀升,增加收购成本;最后,管理全球性的AI系统需要全新的国际合作机制,这远超单一主权基金的范畴。 然而,历史表明,社会民主制度正是在资本主义危机中逐步建立的。19世纪的童工法、20世纪的社会保障体系,都是在市场失灵后人类做出的集体回应。AI时代同样需要这样的制度创新。挪威作为全球最富有的国家之一,有责任也有能力引领这一变革。 当然,这一构想面临巨大的现实障碍,但它至少提供了一个思考方向:在超级智能可能颠覆一切之前,我们如何确保技术红利惠及每一个人,而不是沦为少数人的特权?这不仅是挪威的问题,更是全人类必须面对的抉择。
过去几周,两个事件凸显了日益强大的 AI 系统带来的风险:OpenAI-Hugging Face 事件,以及初步证据表明我们即将推出的模型 Astra 可能达到我们准备框架下的“关键网络安全能力”阈值。这些事件,加上内部研究的快速进展,使得我们加强监控、对齐和遏制保障的工作变得更加紧迫。 随着模型能力的增强,内部开发与测试的风险也随之上升。我们的监控、对齐和安全标准必须领先于这些风险。为了确保达到标准,我们暂时放缓了扩展速度,包括暂停了面向部署的最新模型的强化学习训练两周,同时进一步加固和红队测试研究环境,并扩大监控系统的覆盖范围。我们最大的前沿 RL 运行仍处于暂停状态,先进行小规模训练和评估,以观察模型行为,验证保障措施,并建立对齐证据。 对齐——让 AI 系统按预期行为并接受人类监督——一直是我们研究的核心。我们现在要求在整个训练过程中有更强的对齐证据,基于已有的研究和评估。保持日益强大的系统对齐是整个领域需要解决的挑战。 我们认为,透明地说明我们方法的改变非常重要。以下是我们已经对研究流程和基础设施所做的改变,以及正在进行的工作。我们开发更强大模型的方法依赖于三个相互加强的保障:监控(检测并响应异常行为)、对齐(减少有害或未经授权行为的可能性)以及安全措施(保护模型和基础设施)。 在监控方面,我们扩展了监控系统,以更早地检测到危险能力或越狱行为。在对齐方面,我们实施了新的对齐验证步骤,包括更严格的评估和红队测试。在安全方面,我们加强了研究环境的安全,限制了内部访问,并改进了遏制协议。 这些变化意味着我们正在调整模型开发的节奏。我们相信,在推进能力的同时,确保安全是负责任的做法。我们的目标是在安全与进步之间取得平衡。 我们认识到,这些措施可能会影响部署时间表,但安全必须是首要任务。我们致力于与更广泛的社区分享经验,共同应对这些挑战。未来,我们将继续评估和调整我们的方法,以确保我们的模型安全可靠。
今年夏天,许多亚马逊用户发现订单确认邮件变得异常简洁,不再列出具体商品名称,而是仅显示商品类别,如“您的美容用品已确认!”或“已订购:1件硬件商品”。这种变化引发了大量用户抱怨,认为这增加了追踪订单的难度,甚至看起来像垃圾邮件或钓鱼邮件。 这一变化可能与AI技术有关。近年来,科技公司大力推广AI代理概念,希望它们能替用户完成各种任务,包括购物。谷歌等公司已推出多项AI购物功能,例如Gemini Spark能从邮件中提取信息,构建旅行行程。亚马逊此次调整邮件内容,或许是为AI代理处理订单时提供更简化的信息格式,但当前体验却让用户感到困惑。 尽管亚马逊历史上多次调整邮件格式,但此次改变幅度较大,且缺乏明确解释。用户希望亚马逊能恢复具体商品信息,或提供更清晰的说明,以维持信任和便利性。这一事件也反映出AI在电商领域的应用仍面临用户体验与效率之间的平衡挑战。
OpenAI 近期完成了 70 亿美元的股票回购,但与此同时,COO 和 CRO 相继离职,其中 CRO Denise Dresser 任职仅八个月便离开,甚至放弃了可能价值数千万美元的股票期权。这一系列事件引发了外界对 OpenAI 生存能力的质疑。本文分析了 OpenAI 面临的内忧外患,包括人才流失、IPO 不确定性以及来自 Anthropic 的竞争压力,并探讨了如果 OpenAI 倒闭,AI 行业将面临怎样的冲击。