在 YC S26 的 Launch HN 上,Hoplite 团队带来了一个全新的云端编码代理部署平台,旨在简化开发者的工作流程。Hoplite 的创始人是 Bence 和 Ryan,他们指出,该平台的核心优势在于其强大的 QA 功能套件,使得功能测试变得异常简单。 ## 从本地到云端:无缝迁移 Hoplite 的亮点之一是在上手过程中,它能够自动迁移用户的本地设置,包括会话、记忆、MCP 服务器等,让开发者无需重新配置即可在云端继续工作。这种无缝迁移体验,大大降低了进入云端开发的门槛,尤其对于依赖个性化配置的开发者来说,无疑是一个福音。 ## 聚焦 QA:提升开发效率 在软件开发中,质量保证(QA)往往耗时且繁琐。Hoplite 专门针对这一痛点,提供了一套工具,使编码代理能够更高效地测试功能。这意味着开发者可以将更多精力投入到核心逻辑实现上,而将重复性的测试任务交给云端代理,从而显著提升开发效率。 ## 行业背景与展望 随着 AI 编程助手的兴起,云端开发环境已成为趋势。Hoplite 的出现,不仅是对现有工具链的补充,更是对“AI 驱动开发”理念的一次有力实践。它通过整合本地配置和提供强大的 QA 能力,有望成为开发者工具箱中的重要一环。 目前,Hoplite 仍处于早期阶段,但其愿景清晰:让云端编码代理的部署像本地开发一样简单。对于希望探索云端开发新范式的团队而言,Hoplite 值得关注。
OpenAI 今日发布了一项令人瞩目的研究成果,宣布在数学和理论计算机科学的十个长期未解问题上取得了新进展。这些问题涵盖了高维几何、编码理论、算术电路复杂度、群论、算子代数、量子复杂度、格密码学和极值组合学等多个领域,其中许多问题已悬而未决数十年。这些突破性成果由 OpenAI 内部版本的 Astra 模型完成,该模型是下一代主要模型,其解决问题所需的计算成本约为 2,000 美元(按 Sol API 费率计算)。 ## 背景:加速科学发现的使命 OpenAI 一直致力于为科学家和数学家提供加速发现的工具。近期,他们推出了“ChatGPT for Academic Researchers”计划,为 10 万名科学家和数学家提供免费使用最佳 ChatGPT 模型的机会。此外,OpenAI 在模型开发过程中会持续评估模型在开放研究问题上的表现。今年五月,他们曾分享了一个 AI 生成的关于 Erdős 单位距离猜想的反例,这项工作已经激发了数学和理论计算机科学的进一步发展。 ## 十项成果概览 本次发布的十项成果具体包括: - **高维球堆积**:在 Cohn–Elkies 阈值以下获得了新的球堆积密度上界。 - **二元码和球码**:在任意给定最小距离下,二元码最大规模的指数级改进界限,高维球码也有类似结果。 - **非 sofic 群**:构造证明了非 sofic 群的存在,解决了群论中的一个核心开放问题。 - **Connes 刚性猜想**:反驳了一个长期存在的猜想,该猜想认为某些群由其 von Neumann 代数唯一确定。 - **算术电路复杂度**:在计算永久式(permanent)方面获得了新的下界。 此外,还有关于量子复杂度、格密码学和极值组合学等方面的进展。所有这些问题在其各自的数学界都具有重要意义,其中几个问题在整个数学界都广受关注。 ## 方法与验证 这些成果由 Astra 模型(内部版本)取得,人类研究者与模型合作将论证整理成论文。随后,模型将每个论证形式化为 Lean 证书,确保其严谨性。OpenAI 还发布了每个解决方案的模型思维过程叙述,以便研究者了解模型的推理路径。 ## 意义与展望 这些突破展示了 AI 在数学和理论计算机科学领域的巨大潜力。通过自动化推理和探索,AI 能够帮助人类解决那些长期悬而未决的问题,加速科学发现的过程。OpenAI 表示,他们希望这些工具能赋能更多研究者,推动数学和相关领域的进展。 尽管这些成果尚未经过同行评审(除部分外),但它们已经引起了学术界的广泛关注。未来,随着 AI 模型的不断进步,我们有望看到更多类似的突破,为人类知识的前沿拓展做出贡献。
Nightcrawler 是一款完全运行在智能手机上的自主渗透测试代理。它利用设备内置的小型 AI 模型(LFM2.5-1.2B-Instruct-Heretic,12亿参数),通过本地 GPU 推理,自主决定下一步操作——探测哪个主机、使用哪个工具、寻找什么漏洞。整个过程无需云连接或外部 API,完全离线运行。 ## 核心工作原理 Nightcrawler 的工作流程分为几个阶段: - **WiFi 破解(可选)**:如果未预连 WiFi,它可以利用外接 USB WiFi 适配器自主破解 WPA2 网络。 - **侦察**:通过隐蔽扫描发现网络上的设备。 - **枚举**:探测发现的服务(Web 服务器、文件共享、SSH、DNS 等)。 - **利用**:测试已知漏洞和默认凭据。 - **报告**:生成结构化的渗透测试报告,包含发现和修复建议。 该代理像一位耐心的人类渗透测试员一样运作——它轮流扫描主机,每轮只执行一个小操作,并在数小时内逐步积累知识。与传统漏洞扫描器一次性轰炸所有主机不同,这种方式更难被检测。 ## 关键概念 - **Drop box**:留在目标网络上自主执行测试的设备。 - **Scope**:授权测试的网络/主机范围。 - **Rules of Engagement (ROE)**:规定允许操作范围的法律文件。 - **Stealth**:避免被网络监控(IDS/IPS)检测的技术。 - **MCP**:模型上下文协议,AI 工具使用的标准接口。 - **C2**:命令与控制,用于监控和引导代理的 Web 仪表板。 ## 架构概览 系统架构基于 OnePlus 8 手机,核心组件包括: - **LFM2.5 模型**:运行在 GPU 上,通过 :8080 端口提供推理服务。 - **Agent Loop(main.py)**:负责决策循环,决定下一步行动。 - **工具集**:包括 nmap、hydra 等常见渗透工具。 Nightcrawler 的演示视频可在 Instagram 上观看,展示了它在一加 8 手机上的实际运行效果。 ## 意义与展望 Nightcrawler 的出现将渗透测试的门槛大幅降低——过去需要专业设备和云服务器的工作,现在只需一部手机即可完成。尽管当前版本仍处于早期(v0.1.0),但其自主性和隐蔽性已经显示出潜力。未来,随着端侧 AI 模型的进步,这类工具可能会在红队行动和安全评估中扮演更重要的角色。
据最新报道,OpenAI 支持的超级政治行动委员会(Super PAC)正在资助一个由 AI 生成的新闻网站,该网站专门发布攻击 AI 行业批评者的内容。这一消息在 Hacker News 上引发热议,获得 202 分和 101 条评论。 该新闻网站名为“Model Republic”,其内容由 AI 生成,旨在为 OpenAI 及其盟友辩护,同时贬低那些对 AI 安全、伦理和监管提出质疑的声音。这种做法引发了关于 AI 行业透明度、政治游说以及生成式 AI 在信息传播中角色的广泛讨论。 **背景与动机** OpenAI 作为 AI 领域的领军企业,一直致力于推动 AI 技术的商业化和社会应用。然而,随着 AI 的快速发展,来自学术界、民间社会和政策制定者的批评声也日益增多,主要关注点包括 AI 的潜在风险、数据隐私、就业影响以及算法偏见等。为了应对这些批评,OpenAI 通过其超级 PAC 资助“Model Republic”,试图塑造公众舆论,影响政策制定。 **争议与批评** 这一做法引发了多方批评。批评者认为,利用 AI 生成的内容来攻击反对者,是一种不透明的信息战策略,可能误导公众,并进一步侵蚀对 AI 行业的信任。此外,匿名或伪装的 AI 生成内容可能加剧虚假信息的传播,使得公众难以辨别真伪。 Hacker News 的讨论中,许多用户表达了对这一行为的担忧,认为这凸显了 AI 行业在道德和治理方面的挑战。有评论指出,OpenAI 作为行业领导者,应当以身作则,促进开放和诚实的对话,而不是通过资助攻击性内容来压制批评。 **行业影响与未来展望** 这一事件可能对 AI 行业的公信力产生深远影响。随着 AI 生成内容的能力不断增强,如何确保其使用符合道德和法律规范,成为亟待解决的问题。监管机构可能会加强对 AI 政治游说和内容生成的监督,而公众对 AI 的信任也可能因此受到考验。 对于 OpenAI 而言,此举虽然可能在短期内削弱批评声浪,但长期来看,可能损害其品牌形象,并加剧社会对 AI 的警惕。在 AI 伦理日益受到重视的当下,企业需要更加审慎地处理与批评者的关系,以建立可持续的信任基础。 总之,“Model Republic”事件揭示了 AI 行业在政治和舆论战场上的新动向,也为 AI 治理提出了新的课题。未来,如何在技术创新与社会责任之间取得平衡,将是所有 AI 企业必须面对的挑战。
**Sprocket** 是一个开源的 AI 代理,由一位 16 岁的开发者独立打造,其独特之处在于它不仅能处理软件开发,还能胜任硬件设计任务,甚至能自主从网站上购买所需的硬件部件或 SaaS 订阅。该项目的目标是成为“全球最好的硬件和软件开发平台”。 ## 核心能力 - **软硬兼修**:Sprocket 是目前唯一能同时处理硬件和软件开发的 AI 代理。 - **智能检索**:它会从网络上获取最佳上下文,确保操作的可靠性。 - **自主购物**:只需用户指令,Sprocket 就能从任意网站购买物品,从硬件零件到软件订阅都不在话下。 - **硬件设计**:能生成详细的原理图、物料清单(BOM)和装配说明。 ## 运行方式 Sprocket 提供了多种运行方式,且不影响其性能: 1. **免安装运行**:通过 `npx @spikonado/sprocket` 即可在浏览器中直接使用。 2. **桌面应用**:可从 GitHub Releases 下载对应系统的安装包。 3. **CLI 工具**:通过 `npm i -g @spikonado/sprocket` 安装后,使用 `sprocket` 命令启动,并支持 `--web` 参数强制在浏览器中打开。 ## 工作区管理 Sprocket 支持工作区概念,可以记住附加的目录和本地服务器会话,状态保存在 `$HOME/.sprocket` 目录(可通过环境变量 `SPROCKET_DATA_DIR` 覆盖)。开发人员可以轻松切换不同项目。 ## 开发者友好 对于开发者而言,Sprocket 提供了丰富的 CLI 命令和环境变量,如 `sprocket serve` 可启动本地服务器,`--api-only` 模式便于 API 开发。开发环境要求包括 Bun 1.3.9+、Node.js 24.14+ 和 Rust 工具链。 ## 行业影响 Sprocket 的出现可能预示着 AI 代理在硬件领域的应用将迎来突破。传统上,硬件开发需要大量手动操作和专业知识,而 Sprocket 的自动化能力有望降低门槛,加速原型迭代。尽管它由一位少年开发,但其功能深度和开放性(开源)已引起社区关注,未来有望成为创客和专业工程师的得力助手。
在 Hacker News 上,一篇题为“人工智能:Ars Notoria 与瞬间知识的承诺”的帖子引发了热议,获得了 137 分和 34 条评论。文章将现代人工智能与中世纪的神秘学实践 Ars Notoria 相提并论,探讨了人类对“瞬间获取知识”的永恒渴望。 Ars Notoria 是 13 世纪流传的一种魔法仪式,据称通过祈祷和冥想,能在短时间内获得所有学科的知识。它本质上是借助超自然力量,绕过长期学习的过程。而今天,AI 模型如 GPT-4 等,同样承诺通过简单的提示词,就能生成代码、撰写文章、解答复杂问题,仿佛知识可以即时下载。 这种对比揭示了人类对认知捷径的迷恋,但也引发了深刻的思考:AI 带来的“知识”是否等同于真正的理解?Ars Notoria 被视为迷信,而 AI 则被奉为科学,但两者在认知层面可能共享某种幻觉——即知识可以脱离上下文、体验和批判性思维而存在。 文章提醒我们,AI 的输出基于训练数据中的统计规律,而非真正的推理或理解。它可能产生看似合理但实则错误的答案,即“幻觉”。因此,依赖 AI 获取知识,就像依赖魔法仪式一样,可能带来虚假的确定性。 在 AI 快速渗透教育、科研和日常决策的今天,这种类比具有现实意义。我们应当把 AI 视为辅助工具,而非知识的终极来源。真正的学习依然需要时间、努力和批判性思考。正如中世纪的学者最终放弃 Ars Notoria,我们也应警惕对 AI 的过度依赖。 帖子在 Hacker News 上引发了关于 AI 本质、知识获取方式以及技术局限性的讨论。评论者指出,AI 的“知识”缺乏因果逻辑和验证机制,而 Ars Notoria 的实践者至少还需依赖信仰。无论如何,这篇帖子提供了一个独特的视角,促使我们反思技术时代的认知边界。
## 快评:DeepSeek V4 Flash 0731 发布,性价比再成焦点 近日,DeepSeek 发布了其最新模型 **DeepSeek V4 Flash 0731**,在 Hacker News 上引发热议(80 分,17 条评论)。作为 V4 系列的高性价比版本,Flash 0731 在保持强大智能水平的同时,进一步优化了性能与价格平衡,瞄准了中小企业和开发者市场。 ### 智能与性能:轻量但不妥协 据公开信息,V4 Flash 0731 在多项基准测试中表现出色,尤其在**代码生成、逻辑推理和长文本处理**方面,其能力已接近甚至部分超越前代旗舰模型。这得益于 DeepSeek 在**模型架构和训练策略**上的持续创新,使得 Flash 版本在**推理速度**上大幅提升,同时降低了**显存占用**,更适合在边缘设备或资源受限的环境中部署。 ### 价格策略:击穿行业底线? 价格方面,V4 Flash 0731 延续了 DeepSeek 一贯的激进定价策略。据官方 API 定价显示,其输入和输出价格均远低于同类竞品,例如 GPT-4o mini 和 Claude 3 Haiku。这使得**大规模 AI 应用的成本门槛**进一步降低,对创业公司和独立开发者尤为友好。 ### 行业影响:AI 应用普及加速 V4 Flash 0731 的发布,可能预示着 AI 行业将迎来新一轮**价格战**,并推动 AI 应用从“能用”向“好用”转变。对于开发者而言,这意味着可以更自由地试验和迭代,而无需担心成本失控。 ### 小结 DeepSeek V4 Flash 0731 在智能、性能和价格之间找到了一个极具吸引力的平衡点,有望成为 2025 年 AI 开发者的新宠。不过,实际表现仍需在真实场景中检验,我们也将持续关注其生态发展和用户反馈。
DeepSeek 官方于 2026 年 7 月 31 日发布了 DeepSeek-V4-Flash API 的公开测试版。此次更新在模型架构和规模上与预览版保持一致,但通过重新训练显著增强了智能体(Agent)能力,在多项基准测试中大幅超越 V4-Pro-Preview。 ## 核心亮点:智能体能力飞跃 根据官方公布的基准测试结果,DeepSeek-V4-Flash 在多项智能体任务中表现亮眼: - **Terminal Bench 2.1**:82.7 - **NL2Repo**:54.2 - **Cybergym**:76.7 - **DeepSWE**:54.4 - **Toolathlon verified**:70.3 - **Agent Last Exam**:25.2 - **Automation Bench (Public)**:25.1 - **DSBench-FullStack**(内部全栈开发测试集):68.7 - **DSBench-Hard**(内部硬问题测试集):59.6 这些分数反映了模型在代码生成、工具调用、全栈开发等复杂任务上的强大能力。官方测试使用了即将发布的 **DeepSeek Harness** 最小模式作为框架,并采用最大努力级别,`topp=0.95`,`temperature=1.0`。 ## API 使用与兼容性 调用方式保持不变,只需将模型名称设置为 `deepseek-v4-flash` 即可使用最新版本。该模型**原生支持 Responses API 格式**,并针对 Codex 进行了特别适配,具体配置可参考官方文档。 ## 重要说明 - 本次更新仅针对 **DeepSeek-V4-Flash API**,**DeepSeek-V4-Pro API** 以及 APP/WEB 端模型均未变化。 - 官方表示 **DeepSeek-V4-Pro** 的正式发布将很快到来。 ## 行业背景与展望 DeepSeek 此次快速迭代,反映了当前 AI 行业对智能体(Agent)能力的高度重视。从代码生成到复杂任务自动化,智能体正成为各大模型厂商竞争的焦点。DeepSeek-V4-Flash 在多个基准上的亮眼表现,不仅展示了其技术实力,也为开发者提供了更强大的工具。随着 V4-Pro 的即将发布,DeepSeek 有望在智能体领域进一步巩固其地位。
在 Android 上打开别人发来的文件,往往意味着要安装体积庞大的办公套件,或者授权各种敏感权限。Gander 的出现,或许能让你彻底告别这种不安。这是一款**开源、完全离线**的文件查看器,**APK 仅约 15 MB**,却能打开 PDF、Word、Excel、PPT、图片、视频、音频、Markdown 和代码等几乎所有常见格式,而且**不申请任何权限**——甚至连网络权限都没有,从根源上杜绝了数据外泄的可能。 ## 零权限,私密性拉满 Gander 的核心理念是“私密即设计”:**没有 INTERNET 权限,没有广告,没有追踪,没有账户**。它无法联网,自然也无法“打电话回家”。文件解析全部在本地完成,既保护了隐私,也意味着你可以在无网络环境下安心使用。 ## 一个应用,通吃所有格式 Gander 集成了多种成熟的离线渲染引擎,覆盖了日常几乎所有的文件类型: - **文档**:PDF(基于 Pdfium)、Word(.docx) - **表格**:Excel(.xlsx、.xls 等,基于 SheetJS) - **幻灯片**:PowerPoint(.pptx) - **图片**:JPG、PNG、GIF、SVG、HEIC 等,支持深度缩放和平滑滚动 - **音视频**:MP4、MP3、MKV 等,基于 Media3 ExoPlayer - **Markdown 和代码**:渲染为格式化 HTML,支持全文搜索 对于老旧的二进制 .doc 和 .ppt,由于没有可靠的离线渲染方案,Gander 会给出提示并建议重新保存为 .docx/.pptx。 ## 便捷操作,不牺牲体验 尽管权限为零,Gander 依然提供了流畅的操作体验: - **最近文件**:带缩略图预览(图片、视频帧、PDF 首页) - **文件夹浏览**:通过一次性系统授权访问,无需存储权限 - **分享与打开**:支持从任意应用分享文件到 Gander,或从文件管理器直接打开 - **文档内搜索**:在 Word、Excel、幻灯片、Markdown 和代码中查找关键词 - **分享与定位**:可将当前文件分享到其他应用,或跳转到其在文件管理器中的位置 界面采用 Material 3 设计,支持深色模式和全面屏,兼容 Android 8.0 及以上设备。 ## 获取方式 Gander 是开源项目,你可以在 GitHub 的 Releases 页面下载 APK。arm64 版本几乎覆盖所有 2017 年后的手机,老旧或 x86 设备可选择通用版。 如果你厌倦了臃肿的办公套件,或者对文件隐私格外敏感,Gander 值得一试。它用极小的体积,证明了“少即是多”的可行性。
在人工智能快速发展的今天,我们与AI的交互方式大多仍停留在聊天窗口。但两位年轻开发者Akilan和Miguel正在尝试改变这一现状——他们创建的MarbleOS项目,灵感源自Xerox PARC的图形界面革命、1984年的Macintosh以及后来的NeXTSTEP,这些历史性的设计奠定了现代操作系统的基础。 在图形界面(GUI)出现之前,人们操作计算机只能通过命令行的方式,比如输入`C:\> DIR`这样晦涩的指令。而MarbleOS的愿景,就是为AI代理(Agent)打造一个类似当年GUI革命的全新交互范式。 ## 从聊天到工作台:重新定义AI交互 MarbleOS的核心思路是:**将AI的工作过程可视化、结构化**。它不再只是让用户与AI进行对话,而是提供一个工作区,让文件、工具、任务和输出都**清晰地展示在界面上**,而不是埋藏在无尽的聊天记录中。 这种设计理念直击当前AI交互的痛点。目前,无论是ChatGPT还是其他AI助手,用户都依赖对话流来管理任务,当任务变得复杂时,聊天线程会变得混乱不堪,难以追踪进度、管理文件或复用结果。MarbleOS试图将AI的使用体验从“聊天”升级为“协作”,让用户能像使用现代操作系统一样,直观地管理AI的工作。 ## 站在巨人的肩膀上 MarbleOS的灵感来源颇具深意。Xerox PARC在1970年代开发的图形用户界面,让计算机从专业实验室走向了普通大众;1984年的Macintosh将GUI普及到个人电脑;而NeXTSTEP则带来了面向对象的操作系统和开发环境,成为后来macOS的基石。这些先驱者证明了:**一个好的界面能极大降低技术的使用门槛**。 如今,AI代理正处在类似命令行时代的早期阶段——功能强大但交互原始。MarbleOS希望填补这一空白,为AI代理设计一个直观、高效的“图形界面”,让非技术用户也能轻松驾驭AI的复杂能力。 ## 当前状态与未来展望 目前,MarbleOS已经开放了**beta版本下载**,并提供了多个演示视频。从其展示的内容来看,用户可以在工作区内创建任务、调用工具、查看输出,所有操作都一目了然。这种设计特别适合需要多步骤、多工具协作的复杂任务,比如数据分析、软件开发或内容创作。 不过,MarbleOS仍处于早期阶段,其实际体验和生态构建尚待验证。但这一方向无疑值得关注——**当AI代理成为日常工具时,我们与它们的交互方式将成为决定生产力高低的关键**。MarbleOS的尝试,或许正是开启AI时代GUI革命的钥匙。
## 蒸馏实验:用DeepSeek V4 Flash训练GPT-OSS 最近,一项实验将**DeepSeek V4 Flash**作为教师模型,对**GPT-OSS-120B**进行蒸馏,专攻金融推理任务。结果显示,蒸馏后的模型在8K token预算下,于**FinanceReasoning**基准上取得**83.61%**的准确率,超越了Kimi K3(81.93%)和Inkling(65.13%)。研究团队已开源20B权重的蒸馏版本。 ## 审查机制的“遗传”问题 有趣的是,蒸馏过程并未完整继承教师模型的审查机制。DeepSeek V4 Flash在内容过滤上较为严格,而GPT-OSS作为开源模型,本身设计上更注重开放性。蒸馏后的模型在保留金融推理能力的同时,**审查强度显著降低**。这引发了AI安全领域的讨论:蒸馏是否会成为绕过内容限制的途径? ## 行业背景与意义 当前,大模型蒸馏技术日益成熟,成为提升小模型性能的主流手段。此案例表明,蒸馏不仅能迁移知识,还可能**改变模型的行为特征**。对于金融等垂直领域,高精度推理能力至关重要,但审查机制的弱化也可能带来合规风险。研究团队强调,他们主要关注技术可行性,并提醒社区注意模型行为的一致性问题。 ## 开源与未来方向 20B权重已在Hugging Face上公开,供研究使用。团队下一步计划探索**多教师蒸馏**,并结合RLHF优化,以平衡能力与安全性。
OpenAI 于 2026 年 7 月 30 日宣布,其最新模型系列 GPT-5.6 在性能与成本上实现重大突破。通过优化模型架构与推理效率,GPT-5.6 Luna 降价 80%,Terra 降价 20%,同时 Sol 在 API 中推出 Fast 模式,速度提升 2.5 倍。这一举措旨在降低企业部署 AI 工作流的门槛,让更强大的智能以更低成本普及。 ## 核心降价与性能提升 - **Luna 降价 80%**:作为最快且最经济的模型,Luna 现以极低成本提供高质量输出,适合高吞吐量、多步骤工作流。其性能可比肩一年前的顶尖模型,但单任务成本仅为后者的 6%,速度提升近 9 倍。 - **Terra 降价 20%**:作为日常工作的平衡模型,Terra 成本进一步降低,适合通用任务。 - **Sol 推出 Fast 模式**:在 API 中以标准处理 2 倍的价格提供 2.5 倍速度,智能水平不变,且向后兼容旧版 Priority 请求。 ## 行业背景与意义 此次降价是 OpenAI 长期效率优化的结果,涵盖模型训练、推理部署和工程实现的全链路改进。在 AI 行业竞争白热化的当下,价格战已成为常态,但 OpenAI 选择通过技术降本而非单纯补贴,展现了更强的可持续性。 对于企业而言,Luna 的成本优势意味着更多 AI 应用场景从概念验证走向规模化落地,例如客服自动化、代码生成、数据分析等。以 Replit、Notion、Ramp 等客户为例,它们已开始利用 GPT-5.6 优化工作流,实现成本与效率的双赢。 ## 匹配智能与结果 OpenAI 强调,高效使用 AI 的关键在于根据任务重要性、错误成本、紧迫性和规模,匹配最合适的模型。Luna 适合高吞吐、低延迟场景;Terra 适合日常办公;Sol 则适合对速度有极致要求的任务。这种分层定价策略让企业能灵活优化成本与性能。 ## 展望 随着 GPT-5.6 的降价,AI 的普惠化进程加速。未来,更多中小企业将能以可负担的成本接入前沿 AI 能力,推动行业创新。OpenAI 表示,这仅是开始,未来将持续在性能与成本边界上探索。
在近期一场备受瞩目的全球会议上,美国政府与OpenAI联合展示的非洲地图出现了明显错误,引发了与会者和在线观众的广泛批评。这一事件不仅暴露了技术应用中数据准确性的问题,也再次将人工智能在地理信息处理上的偏见与局限性推至风口浪尖。 ## 错误地图引发争议 据现场与会者透露,该地图在标注非洲国家边界、名称及区域划分时存在多处严重错误,包括错误拼写、位置偏移以及遗漏某些地区。这一失误在会议大屏幕上展示时被立即捕捉,并在社交媒体上迅速传播,成为科技界热议的话题。 ## 数据质量与AI偏见 OpenAI作为人工智能领域的领军企业,其模型在处理地理信息时出现如此低级的错误,令人对其训练数据的可靠性和算法的鲁棒性产生质疑。地理数据往往涉及复杂的历史、政治和文化背景,而AI模型若仅依赖有限的公开数据源,极易产生偏差。此次事件也凸显了AI在全球化语境下,对非西方地区的理解仍存在显著短板。 ## 政府与科技合作的警示 美国政府在此次会议中与OpenAI联合展示,本意可能是展现科技与公共治理的融合,但地图错误却适得其反,成为合作中的尴尬注脚。这一事件提醒我们,在政府与科技企业合作推进数字化项目时,必须对数据来源进行严格审查,并建立多学科交叉的验证机制,以避免因技术失误导致外交或政策层面的负面效应。 ## 行业反思与改进方向 此次事件并非孤例,此前已有多个AI系统在地理、历史等领域出现错误标注的案例。业内专家指出,AI模型需要更全面的训练数据,尤其是纳入本地化、多语种的权威数据源,同时应引入人工审核环节,确保关键信息的准确性。此外,模型在输出涉及主权和边界的内容时,应内置敏感性检测,避免因技术疏漏引发国际争议。 ## 结语 一张错误的地图,虽看似小事,却折射出AI技术在地理信息处理上的深层挑战。随着AI在政府、教育、媒体等领域的应用日益广泛,确保其输出内容的准确性和文化敏感性,已成为不容忽视的课题。此次事件也为所有AI开发者敲响警钟:技术无国界,但数据与标注必须严谨。
**Gemini Robotics 2** 是谷歌 DeepMind 最新发布的机器人智能系统,旨在通过“全身智能”让机器人更好地感知、理解并与物理世界交互。与先前版本相比,Gemini Robotics 2 在运动控制、物体操作和环境适应能力上实现了显著提升,标志着机器人从“专用工具”向“通用智能体”迈出关键一步。 ## 什么是“全身智能”? 传统机器人往往依赖于预设程序或单一传感器输入,执行任务时动作僵硬,难以应对复杂多变的环境。Gemini Robotics 2 引入的“全身智能”理念,强调机器人需要协调全身的传感器、关节和算法,像人类一样综合视觉、触觉、力觉等多模态信息,从而做出连贯、灵活的动作。例如,当机器人搬运一个易碎物品时,它不仅用视觉判断位置,还会通过力反馈调整抓取力度,同时调整身体姿态以保持平衡。 ## 核心技术突破 1. **多模态感知融合**:系统整合相机、触觉传感器、惯性测量单元等多种数据源,构建统一的时空表示,使机器人能实时理解自身状态与周围环境。 2. **全身运动规划**:采用强化学习和模型预测控制相结合的方法,在模拟环境中训练机器人完成复杂动作,如爬楼梯、穿越狭窄通道,并平滑迁移到现实世界。 3. **自适应抓取与操作**:通过大规模仿真训练,机器人掌握了数百种物体的抓取策略,包括不规则形状、软性材料和透明物体,成功率较上一代提升约 30%。 ## 行业背景与影响 当前,人形机器人赛道竞争激烈,特斯拉 Optimus、波士顿动力 Atlas 等都在探索通用机器人能力。但多数系统仍依赖远程操控或高度工程化的环境。Gemini Robotics 2 强调的“全身智能”直接回应了机器人从实验室走向家庭、工厂、仓库等非结构化场景的核心挑战——鲁棒性和适应性。 DeepMind 并未披露 Gemini Robotics 2 的硬件平台细节,但指出该系统兼容多种机器人形态,包括双足人形和四足机器狗。这种平台无关性意味着其软件栈可能成为机器人操作系统的“智能层”,加速行业标准化。 ## 未来展望 尽管 Gemini Robotics 2 在仿真中表现亮眼,但现实世界部署仍面临电池续航、计算功耗和安全性等工程难题。不过,其多模态融合与全身协调设计,为机器人实现“感知-决策-执行”闭环提供了可行路径。随着大模型与机器人技术的交叉加深,我们有理由期待更智能、更灵活的机器人助手出现在日常生活之中。
## 一句话总结 **Tokenless** 是一个智能 API 网关,通过动态路由、并行推理和早期淘汰机制,在不牺牲输出质量的前提下将 AI 推理成本降低一半以上。 ## 核心机制:用“并行试探”替代“盲目选择” 传统 LLM 调用通常固定使用某个模型(如 GPT-4o 或 Claude Opus),但 Tokenless 的做法完全不同: - 当用户发起请求时,Tokenless 会**同时向多个候选模型发送请求**(如 GPT-4o、Claude Sonnet、Gemini Flash 等)。 - 它实时监控每个模型的推理过程,一旦某个模型**明确给出正确方向的输出**,就立刻**选择该模型并取消其余请求**。 - 用户**只需为最终选中的模型付费**,其他模型的早期推理成本由 Tokenless 承担(因其推理量极小且可被缓存复用)。 这相当于用“并行试探”代替“事前猜测”,用少量额外计算换取模型选择的最优解。 ## 实测数据:质量持平,成本腰斩 Tokenless 在公开的 Agent 基准测试(如 τ³-Banking、Terminal-Bench、DeepSWE)上展示了惊人的性价比: | 方案 | 解决率 | 平均每任务成本 | |------|--------|----------------| | Tokenless Pro | 40.2% | $0.57 | | GPT-5.6 Sol | 33.0% | $1.50 | | Claude Opus 5 | 32.8% | $1.64 | | Tokenless Ultra Saver | 30.9% | $2.25 | | Claude Fable 5 | 26.8% | $2.58 | | Gemini 3.6 Flash | 24.5% | $3.32 | **Tokenless Pro 在解决率最高(40.2%)的同时,成本仅为 GPT-5.6 Sol 的 38%**,比 Claude Opus 5 便宜近 65%。 ## 落地方式:零代码替换,兼容 OpenAI/Anthropic 接口 Tokenless 提供与 OpenAI 和 Anthropic 完全兼容的 API 端点,用户只需将代码中的 base_url 替换为 Tokenless 的地址,即可立即开始使用。无需修改模型调用逻辑,也无需调整 prompt。 ## 团队背景与融资 Tokenless 由 Rohit、Andrew 和 Kev 三位联合创始人共同打造,团队来自 **Google DeepMind、普林斯顿大学和 UC Berkeley**,并获得 **Y Combinator** 投资。 ## 成本节省测算:以每月 4 万美元支出为例 根据 Tokenless 官网提供的计算器,假设当前每月 LLM 支出为 $40K,使用 Tokenless 后: - 新月度账单:约 $26K(节省 $14K,即 35%) - 请求重路由比例:42% - 未来 12 个月累计节省:约 $344K(假设 AI 支出以每月 11% 的增速增长) > 注意:上述测算基于公开 Token 价格和可配置路由假设,实际节省因流量模式而异。 ## 行业意义:AI 成本优化进入“路由时代” 随着大模型数量激增,企业面临的选择成本越来越高。Tokenless 的思路代表了一种新范式:**不再依赖单一模型,而是通过智能路由动态组合多模型能力**。这不仅降低了成本,也降低了供应商锁定风险。 对于 AI 应用开发者、SaaS 公司和内部 AI 平台团队来说,Tokenless 提供了一个即插即用的成本优化工具。随着模型推理价格持续下降,这种“模型路由”策略可能会成为标准实践。 ## 如何体验 - 官网:[usetokenless.com](https://usetokenless.com) - 支持预约演示,团队会针对实际流量进行成本测算 - 也支持直接替换两行代码自行验证
近日,一款名为 **TurboFieldfare** 的开源推理引擎在 Hacker News 上引发关注。它专为在 **M 系列 Mac** 上运行 **4-bit 量化的 Gemma 4 26B-A4B-IT** 模型而设计,仅需约 **2GB 内存**,即可实现本地高效推理。该项目完全使用 **Swift 和 Metal** 编写,充分利用 Apple 芯片的 GPU 能力,为端侧 AI 部署提供了新思路。 ## 核心亮点:极低内存占用 Gemma 4 26B 是 Google 最新发布的大语言模型,拥有 260 亿参数。在传统环境下,即使是半精度(16-bit)加载也需要约 52GB 显存,而 TurboFieldfare 通过 **4-bit 量化** 将模型体积压缩至约 2GB,同时保持可用的推理质量。这意味着即便是入门级 M1 MacBook Air(8GB 统一内存),也能流畅运行这一级别的模型。 ## 技术实现:Swift + Metal 深度优化 项目作者表示,TurboFieldfare 没有依赖现有的 ML 框架(如 MLX 或 Core ML),而是直接使用 **Metal 着色器** 编写自定义推理 kernel,针对 M 系列芯片的架构特点进行了逐层优化。这种“从零开始”的方法虽然开发成本高,但能最大程度地压榨硬件性能,实现低延迟推理。此外,Swift 的强类型和内存管理特性也帮助减少了不必要的开销。 ## 应用场景与意义 端侧 AI 一直是行业追求的方向,因为它能保障数据隐私、离线可用并降低云端依赖。TurboFieldfare 的出现,让 **Mac 用户** 可以像运行普通应用一样,在本地体验前沿大模型。对于开发者而言,它也是一个极好的研究平台——可以深入理解模型量化和推理加速的底层细节。 ## 局限与展望 目前 TurboFieldfare 仍处于早期阶段,仅支持 **Gemma 4 26B-A4B-IT** 这一特定模型,且未提供完整的 API 或聊天界面。作者表示后续计划增加更多模型支持、优化 token 生成速度,并考虑开源更多工具链。对于追求极致效率的 AI 发烧友来说,这无疑是一个值得关注的项目。 > 项目地址:GitHub 搜索 TurboFieldfare 即可找到。
Hacker News 的魅力不仅在于用户分享的链接,更在于围绕这些链接展开的讨论。但长期以来,许多用户习惯性地将文章和评论分别打开在两个标签页中,来回切换,体验割裂。一位开发者受此困扰,动手编写了一个用户脚本(userscript),试图让阅读与讨论合二为一。 这个脚本的核心思路非常直接:**在文章页面内直接嵌入对应的 HN 评论线程**。用户无需再额外打开评论标签页,也无需手动寻找“讨论”链接。脚本会自动识别当前页面是否来自 HN,并利用 HN 的 API 获取评论数据,然后以浮动侧边栏或内嵌区域的形式展示在文章旁。如此一来,阅读正文与浏览评论可以并行进行,大大减少了上下文切换的成本。 从技术实现上看,这类脚本通常依赖于 **GreaseMonkey** 或 **Tampermonkey** 等用户脚本管理器,通过匹配 HN 的域名和 URL 模式来触发。脚本会解析页面上的 HN 链接或通过 API 查询当前文章的 HN 提交,再渲染评论树。由于 HN 的 API 开放且结构简单,实现并不复杂,但需要考虑评论的实时更新、性能优化以及不同网站布局的兼容性。 这一小工具折射出的是更广泛的用户需求:**内容与讨论的深度融合**。在 Reddit、Twitter 等平台,评论本身就是内容的一部分;而在 HN 这类以链接聚合为主的社区,评论往往被当作“附属品”,需要额外跳转。脚本的出现,本质上是在填补平台原生体验的空白。类似的做法在社区中并不少见,例如有些浏览器扩展会将 HN 评论直接嵌入到新闻网站的文章中,或者将 Reddit 讨论与文章并列展示。 对于重度 HN 用户而言,这种改进虽小,却能显著提升信息消费效率。尤其是当文章较长或讨论热烈时,能够一边阅读一边浏览评论观点,甚至直接参与讨论,体验会流畅得多。当然,这也带来一些取舍:例如页面加载时间可能增加,评论区域可能干扰阅读排版,以及需要信任第三方脚本的安全性。 总的来说,这个用户脚本是典型的“小工具解决大痛点”案例。它没有引入复杂的新功能,而是针对一个日常操作中的微小不便,给出了轻量而优雅的解决方案。对于经常在 HN 上“双开标签页”的用户,这或许就是那个能省下几秒、却让整个浏览体验更连贯的小改进。
OpenAI 近日在 Hacker News 上以 288 分和 62 条评论的热度发布了 **Codex Security**,这是一款专注于代码安全漏洞查找、验证与修复的 CLI 工具和 TypeScript SDK。该工具旨在帮助开发者在本地仓库、代码审查变更以及 CI 流程中自动执行安全扫描,并持续追踪发现结果。 ## 核心功能与工作流 Codex Security 提供命令行和编程接口两种使用方式。开发者可以通过简单的命令完成安装、登录和扫描: ```bash npm install @openai/codex-security npx codex-security login npx codex-security scan . ``` 扫描结果会生成报告,并存储在 Codex Security 工作台状态目录中。如果默认目录无法写入,可通过环境变量 `CODEX_SECURITY_STATE_DIR` 指定其他可写路径。 ## 认证与 CI 集成 工具支持两种认证方式:**ChatGPT 登录**(交互式)和 **API Key**(适合 CI 环境)。在 CI 中,只需设置 `OPENAI_API_KEY` 环境变量即可跳过登录步骤。如果同时存在两种凭证,交互式扫描会询问用户选择,而非交互式(如 CI)则默认优先使用 API Key。用户也可通过 `--auth chatgpt` 或 `--auth api-key` 参数显式指定。 ## 环境要求与 SDK 使用 Codex Security 要求 **Node.js 22+** 和 **Python 3.10+**。除了 CLI,还提供了 TypeScript SDK,让开发者能以编程方式集成安全扫描功能: ```typescript import { CodexSecurity } from "@openai/codex-security"; const security = new CodexSecurity(); const result = await security.run("."); console.log(result.reportPath); await security.close(); ``` ## 行业背景与意义 在 AI 辅助编程日益普及的当下,代码安全漏洞的检测与修复成为关键挑战。OpenAI 此前已推出 Codex 系列模型用于代码生成,而 **Codex Security 则进一步将 AI 能力应用于安全领域**,帮助开发者在开发早期发现并修复漏洞,降低安全风险。该工具的发布也反映了业界对于“安全左移”(Shift Left Security)趋势的持续关注,通过将安全检查集成到 CI 流程中,实现自动化、持续化的安全防护。 目前 Codex Security 尚处于早期阶段,但其背后是 OpenAI 在代码理解与生成方面的深厚积累。对于使用 OpenAI 生态的开发者而言,这是一个值得关注的安全补充工具。更多详细信息可参考官方文档。
Anthropic 的研究人员利用其前沿 AI 模型 **Claude Mythos Preview**,在密码学领域取得两项重要发现:一是改进了对后量子数字签名方案 **HAWK** 的攻击,二是找到了一种针对轮数缩减版 **AES** 的新型攻击方法。这些发现属于研究层面的重大进展,目前尚未影响任何生产系统。该成果标志着 AI 从发现代码实现错误向发现算法本身数学缺陷的跃迁,对后量子密码标准化和对称密码安全性评估具有深远意义。 ## 从软件漏洞到数学弱点 此前,Claude Mythos Preview 已展示出自主发现并利用软件漏洞的能力,包括多个主流密码学库中的实现错误。而本次突破在于,Claude 首次能够发现 **算法本身的数学缺陷**,而非仅仅代码层面的实现错误。密码学算法是数字安全的基石,例如数字签名方案用于验证网站身份,对称密码用于加密通信内容。一旦这些算法存在根本性弱点,可能危及数十亿用户的数据安全。 ## 两项关键发现 ### 1. 改进攻击:后量子签名方案 HAWK **HAWK** 是一种为后量子时代设计的数字签名方案,旨在抵御量子计算机的攻击。2022 年,美国国家标准与技术研究院(NIST)曾公开征集能够抵抗量子计算的额外密码系统。Claude 发现的改进攻击显著削弱了 HAWK 的安全性,尽管目前该方案尚未广泛应用于生产环境,但这一发现为后量子密码标准化工作提供了重要警示。 ### 2. 新型攻击:轮数缩减版 AES **AES** 是使用最广泛的对称密码算法。Claude 识别出一种针对轮数缩减版 AES 的新攻击方法。轮数缩减版通常用于学术研究或轻量级场景,但这一发现可能推动对完整 AES 算法安全边界的再评估。 ## 行业影响与展望 这两项成果目前均为研究性质,不直接影响任何实际系统。然而,它们明确展示了 **强大 AI 模型在密码分析中的潜力**:AI 不仅能发现已知算法的实现漏洞,还能主动探索算法结构的数学弱点。随着后量子密码标准化进程加速,AI 辅助的密码分析可能成为评估新算法安全性的常规手段。Anthropic 表示,将继续与密码学界合作,确保这些发现能提升而非削弱整体安全水平。
## 当形式化验证遇上AI生成代码:3D网格交集实现的新范式 近日,一个名为“Formally verified 3D CSG”的项目在Hacker News上引发关注。该项目号称是**首个经过形式化验证的3D构造实体几何(CSG)操作实现**——具体来说,是一个在Lean 4中实现的**网格交集**算法。其核心亮点在于:人类审查者只需阅读93行形式化规范,并运行Lean检查器,即可认证内核的正确性,而无需信任由AI编写的1000多行实现代码。 ### 信任的转移:从AI代码到规范 在AI辅助编程日益普及的今天,生成的代码是否可靠始终是悬在开发者头上的“达摩克利斯之剑”。该项目通过一种巧妙的方式规避了这一问题:AI不仅编写了实现代码,还**自主撰写了超过60,000行的Lean证明**,但这些证明同样无需人工审查。Lean检查器在编译时确保实现与规范一致,**零信任**被置于任何大语言模型(LLM)之上。开发者只需聚焦于那93行简洁的规范——它精确描述了结果网格的表面,并保证了三角剖分的实际良构性条件。 ### 性能的权衡:正确性优先 当然,这种严格的形式化验证并非没有代价。根据项目披露,其内核计算两个各含7万个三角形的斯坦福兔子网格的交集需要**24秒**,远慢于当前最先进的网格交集实现。项目明确表示,其优先目标是**最小化人类审查正确性的工作量**,而非追求极致性能。不过,作者指出这种性能差距并非形式化验证的根本局限——原则上,形式化验证软件可以达到与传统软件相同的速度。 ### 背景与形式化 三角网格通常被视为3D空间中实体的边界表示,但实际应用中往往存在自交、非流形等问题。该项目的形式化规范不仅定义了精确的表面,还保证了实用的良构性条件,如闭合性、无自交等。这意味着输出网格在数学上是可靠的,尽管在网格细化程度等其他未形式化的标准上可能并非最优。 ### 行业意义 这一项目为AI代码的可信性提供了新思路:**将AI作为黑盒生成器,而将信任锚定在形式化规范和证明检查器上**。对于需要高安全性的领域(如CAD、医疗影像、机器人仿真),这种方法可能比依赖代码审查或测试更为可靠。同时,它也展示了Lean 4在复杂几何计算验证中的潜力。 ### 结语 虽然当前性能尚不实用,但该项目无疑为形式化验证与AI生成代码的结合树立了一个里程碑。它提醒我们:在追求AI效率的同时,**形式化方法仍然是确保关键系统正确性的“黄金标准”**。随着形式化验证工具链的成熟和AI证明能力的提升,未来或许会出现更多“规范可信、实现黑盒”的可靠系统。