OpenAI 于 2026 年 7 月 9 日宣布,其 GPT-5.5 Bio Bug Bounty 计划将升级为一项持续性的私密项目——OpenAI Bio Bounty Program。该计划旨在通过悬赏方式,寻找能够突破 OpenAI 前沿模型(从 GPT-5.6 开始)预设生物安全防御的通用越狱方法。 ## 关键更新 最引人注目的变化是**奖励金额大幅提升**:针对 GPT-5.6 和 GPT-5.5 的通用越狱奖励从原先的 **25,000 美元翻倍至 50,000 美元**。对于部分成功的提交,OpenAI 保留酌情颁发小额奖励的权利。 ## 时间线与范围调整 - **GPT-5.5 测试截止日期**:2026 年 7 月 27 日。在此日期之后,该模型的测试将完全结束。 - **未来聚焦**:此后,该计划仅针对 GPT-5.6 及后续模型。OpenAI 承诺会及时与研究人员沟通后续范围变更。 ## 参与方式 感兴趣的研究人员可通过滚动申请流程提交简短申请(包含姓名、所属机构、相关经验)。入选者需拥有现有的 ChatGPT 账户,并签署保密协议(NDA)。此前已申请 GPT-5.5 计划的研究人员无需重新申请。 ## 行业背景 这一举措是 OpenAI 持续强化高级 AI 生物安全能力的一部分。随着模型能力的快速迭代,确保其不被恶意用于生物风险领域已成为行业共识。通过将赏金计划升级为长期项目,OpenAI 意在建立一个稳定的外部安全研究社区,以应对日益复杂的越狱攻击。 此外,OpenAI 还运营着更广泛的 **Safety Bug Bounty** 和 **Security Bug Bounty** 计划,覆盖其他安全漏洞类别。
OpenAI 于2026年7月8日发布《国家安全原则》,首次系统阐述其与政府及国家安全机构合作的指导方针。随着前沿AI系统越来越多地被用于国防、网络安全、生物安全等敏感领域,OpenAI 强调,民主社会应能利用AI保护公民、捍卫关键基础设施、提供公共服务并应对新兴威胁,但必须确保部署方式符合民主问责、人类判断和法治原则。 ## 核心原则与背景 OpenAI 指出,AI在网络安全和生物防御等领域的防御性应用具有显著优势,能够有效增强防御者能力。然而,日益强大的AI系统必须在强化民主制度、防止权力集中的框架下使用。为此,公司制定了这套原则,旨在为政府合作提供透明度,并平衡技术创新与公共安全。 原则的制定过程涉及公司内部跨团队协作,包括研究、安全、政策和政府合作等部门,并邀请了国家安全专家 David Kris 提供独立意见。OpenAI 表示,这些原则将适用于当前及未来的国家安全与执法合作,包括已有的与“战争部”的合作项目。 ## 近期合作进展 在发布原则的同时,OpenAI 还披露了多项与盟国政府的安全合作成果: - **Daybreak 网络防御计划**:已与澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰等国家,以及欧盟网络安全局(ENISA)建立了“可信访问”伙伴关系。 - **与英国政府的合作**:在网络安全测试与评估领域,OpenAI 与英国政府建立了持续深化的信任关系。 - **生物安全领域**:上个月,OpenAI 宣布扩大对美国及盟国政府机构的 **GPT‑Rosalind 模型** 可信访问,以支持公共卫生和生物防御任务。 ## 行业意义与挑战 OpenAI 此举正值全球各国政府加速将AI纳入国家安全体系的关键时期。一方面,AI在威胁检测、漏洞分析、生物风险预警等方面展现出巨大潜力;另一方面,技术滥用、算法偏见、决策黑箱等问题也引发公众担忧。OpenAI 主动发布原则,意在为行业树立标杆,表明其愿意在民主监督下与政府合作,而非单纯追求技术授权。 不过,原则的实际执行仍面临挑战:如何界定“防御性”与“进攻性”用途?如何确保人类判断不被算法替代?尤其是在与“战争部”等军事机构的合作中,透明度和问责机制能否落实仍有待观察。 OpenAI 表示,未来将持续更新原则,并邀请更多民间社会力量参与讨论,共同塑造AI在国家安全领域的负责任使用范式。
## 基准测试的信任危机:SWE-Bench Pro 被曝约三成任务“有问题” OpenAI 近日发布的一项详细审计报告指出,业界广泛使用的 AI 编码能力基准测试 **SWE-Bench Pro** 存在严重任务缺陷,约 **30%** 的任务被判定为“有问题”。这并非孤立事件——此前 OpenAI 已发现其前身 SWE-bench Verified 存在根本性设计与污染问题,并呼吁社区转向 SWE-Bench Pro。如今,连这个“下一代”基准也未能幸免。 ### 四大问题类型:什么在“作弊”? 审计团队通过自动化管道筛查、多轮 AI 审查以及五名资深工程师的独立复核,将问题归纳为四类: 1. **过于严苛的测试**:测试代码强制要求特定的实现细节,而这些细节在任务描述中并未提及,导致许多功能正确的提交被判定失败。 2. **描述不充分的 prompt**:任务描述遗漏了隐藏测试所强制要求的关键需求,且这些需求无法通过常识合理推断。 3. **低覆盖率测试**:测试用例未能充分覆盖所要求的功能,使得不完整的修复也能通过。 4. **误导性 prompt**:任务描述指向错误的行为方向,或与测试实际要求相矛盾。 ### 从“已验证”到“专业版”:问题为何依旧? SWE-Bench Pro 本是为了解决前代基准 SWE-bench Verified 的缺陷而设计,它通过更长期、更现实的编码任务来追踪 AI 的“代理编码能力”。在 731 个公开任务中,前沿模型在八个月内通过率从 **23.3%** 飙升至 **80.3%**——这一惊人进步如今看来部分可能是水分。OpenAI 强调,当评估存在影响结果的缺陷时,它们会扭曲对能力的理解,误导安全决策与研究优先级。 ### 影响与启示:AI 评估的“测不准”困境 这一发现对 AI 行业具有双重警示: - **对研发方向**:如果基准测试本身不可靠,模型开发者可能针对“错误的目标”进行优化,而非真正提升编码能力。 - **对安全评估**:OpenAI 将准确度量模型能力视为安全部署的关键,尤其是在其“准备框架”下。有缺陷的评估可能导致对模型风险的低估或高估。 OpenAI 此次审计并非全盘否定 SWE-Bench Pro,而是呼吁社区共同改进评估方法。他们建议研究者在使用该基准时,对结果持审慎态度,并考虑结合其他评估维度。 ### 小结 基准测试是 AI 进步的“标尺”,但尺子本身也需要校准。SWE-Bench Pro 的审计结果再次提醒我们:在追逐更高分数时,必须警惕“噪声”混入“信号”。对于从业者而言,一个更健康的态度是——**不迷信单一基准,多维度交叉验证**。
OpenAI Academy与沃尔顿家族基金会合作,将于今年夏天举办首届面向K-12教育工作者的AI技能实战工作坊(AI Skills Jam)。该活动旨在帮助教师和管理人员将AI融入日常教学、规划、沟通等场景,提升效率并推动AI素养普及。 根据沃尔顿家族基金会与盖洛普联合发布的《为明天而教:弥合期望差距报告》,每周至少使用一次AI工具的教师平均每周节省5.9小时,相当于每学年约六周的时间。节省下来的时间被用于学生反馈、个性化备课、家长沟通等更有价值的活动。 本次工作坊将在美国多个城市举行,预计吸引超过1600名教师、学校管理者和学区领导参与。参与者将在OpenAI导师的指导下,进行实践操作,学习如何将AI应用于备课、行政沟通、家长联络等真实场景。工作坊注重动手实践与信任建立,鼓励提问、分享顾虑并积累信心。 活动结束后,参与者还将获得OpenAI Academy免费在线平台的持续支持,该平台提供AI应用资源与最佳实践指南,帮助教育工作者持续提升AI技能。 此次合作标志着AI教育从理论走向实践的重要一步,也为解决教师时间紧张、资源不均等挑战提供了新思路。
澳大利亚支付与身份基础设施公司 **Australian Payments Plus(AP+)** 近日分享了其利用 **ChatGPT Enterprise** 和 **Codex** 提升团队效率的实践成果。作为连接数百万用户日常支付的核心枢纽,AP+ 面临着规则、技术规范、运营流程、网络安全及监管合规等多重复杂挑战,准确性与问责制至关重要。 ### 效率提升:从数据到行动 AP+ 在全公司范围内推广 ChatGPT Enterprise,帮助员工快速合成大量上下文信息,将技术性内容转化为清晰的决策、文档和面向成员的指导。调查显示,**77% 的受访员工每周节省超过 2 小时**,**80% 的员工报告创造力或工作质量有所提升**。 ### Codex 加速技术调查 对于产品、工程和技术团队,**Codex** 成为下一阶段的关键工具。在一次对账实例中,团队利用 Codex 追踪系统日志与对账数据中微妙的时间戳不一致问题,将原本需要数天的调查缩短至 **30 分钟**。此前类似问题通常需要 **4 小时** 手动排查。此外,Codex 还被用于构建工作模拟,**原来需数天至数周的任务,现在一天内即可完成**。 ### 安全与风险:AI 辅助而非替代 AP+ 还在探索 Codex 在安全团队中的应用,包括威胁建模、漏洞分析、警报分类以及跨系统可见性。公司强调,**AI 的目标不仅是提高效率,更是帮助员工发挥最佳水平**,同时保持人类专家对风险决策的最终责任。 ### 行业启示 在支付行业,速度与准确性并重。AP+ 的实践表明,大型语言模型(LLM)和代码生成工具能够显著降低重复性认知负荷,使技术人员专注于更高价值的判断工作。随着金融监管日益严格,这种“人机协作”模式或将成为行业标配。
日本最大金融集团之一三菱日联金融集团(MUFG)正通过部署ChatGPT Enterprise,加速向AI原生企业转型。截至2026年5月,已有约35,000名三菱UFJ银行员工在日常工作中使用该工具。MUFG集团CDTO山田忠史表示,AI将从根本上改变金融的本质,而OpenAI的技术与协作让这一愿景成为可能。从2024年10月起,双方开始合作,计划通过生成式AI实现运营现代化、提升效率,并创造全新的客户体验。MUFG不仅将AI视为效率工具,更将其视为拓展人类思维与创造力的方式,致力于构建员工与AI共同学习的文化。 ## 从试点到规模化:35,000名员工的AI实践 2024年10月,MUFG与OpenAI启动合作,探索生成式AI在金融业务中的应用。2026年初,三菱UFJ银行开始分阶段部署ChatGPT Enterprise,目标覆盖约35,000名员工。这一规模在金融行业属于前列,体现了MUFG对AI落地的决心。 MUFG集团CDTO山田忠史强调:“我相信AI将从根本上改变金融的本质。要让AI快速融入组织,关键在于营造一个每位员工都能自然使用AI的环境和文化。”为此,MUFG采取了自上而下的领导承诺与自下而上的员工赋能相结合的策略。 ## OpenAI:从设计到落地的深度伙伴 在选择AI合作伙伴时,MUFG看重的是OpenAI的前沿技术与协作精神。山田忠史评价道:“OpenAI与我们共享成为AI原生公司的愿景。凭借其前沿技术和模型,我们看到了一个能将愿景变为现实的合作伙伴。”OpenAI不仅在技术层面提供支持,更从服务设计到实施落地全程参与,帮助MUFG同时推进客户服务创新和银行业务转型。 ## AI原生:超越效率工具的战略定位 MUFG对AI的定位远不止于提升效率。集团认为,AI是延伸人类思维和创造力的方式,员工与AI可以相互学习,共同构建更好的金融服务。这种理念体现在三个方面: - **运营转型**:通过ChatGPT Enterprise优化内部流程,降低重复性工作耗时。 - **客户体验创新**:利用AI提供个性化、智能化的金融服务,例如智能客服、投资建议等。 - **文化变革**:培养“AI原生”思维,让每位员工都能在日常工作中自然使用AI,形成人机协作的新工作模式。 ## 金融业的AI竞赛:MUFG的先行者优势 在全球金融业,AI已成为竞争焦点。MUFG的大规模部署不仅提升了内部效率,更可能在客户服务、风险控制等领域形成差异化优势。通过OpenAI的先进模型,MUFG有望在零售银行、财富管理、信贷审批等场景中率先推出AI驱动的创新服务。 值得注意的是,MUFG的转型并非一蹴而就。从2024年10月开始探索,到2026年初的规模化部署,整个过程体现了金融机构在技术应用上的谨慎与稳健。随着35,000名员工的逐步接入,MUFG正从“使用AI”迈向“成为AI原生”的新阶段。 ## 未来展望 MUFG的案例为金融行业提供了重要参考:AI原生不是简单的工具部署,而是涉及战略、文化、流程的系统性变革。随着更多员工熟悉AI工具,MUFG有望在内部创新和外部服务上释放更大价值。OpenAI与MUFG的合作也表明,前沿AI技术正在深入垂直行业,推动传统金融服务的重构。
OpenAI 最新发布的 Signals 数据显示,ChatGPT 的全球采用正在经历一场从“广度”到“深度”的深刻转变。用户不仅数量激增,使用行为也发生了质变:他们使用更频繁、任务更多样,且用户群体在地域和性别上均变得更加多元。 ## 深度使用:六个月后的用户画像 数据显示,用户注册 ChatGPT 六个月后,**日均发送消息数量比刚注册时增加了 50%**。更重要的是,他们尝试的**不同任务类型数量翻了一番**。这表明,用户并非浅尝辄止,而是逐渐将 ChatGPT 融入工作、学习和生活的核心流程中,从简单的问答扩展到编程、写作、头脑风暴、数据分析等复杂场景。这种“越用越深”的模式,是 AI 工具从新奇玩具演变为生产力平台的关键标志。 ## 全球版图:非洲与亚洲领跑增长 自 2023 年 7 月以来,ChatGPT 的周活跃用户在各大洲均呈现强劲增长。其中,**非洲和亚洲的相对增速最快**。按人类发展指数(HDI)分组来看,**低 HDI 国家的周活跃用户增长最为迅猛**。OpenAI 通过免费版和 Go 计划提供的低成本访问,是推动这一趋势的重要因素,使 AI 工具跨越了经济门槛。 ## 性别均衡化:女性用户占比显著提升 一个值得注意的社会趋势是,**使用 ChatGPT 的女性用户比例正在上升**,目前已占全球使用量的多数。在巴西、哥伦比亚、波兰和纳米比亚等国家,女性用户的活跃度甚至显著超过男性。而在巴基斯坦、孟加拉国、安哥拉、刚果(金)和马里等国家,男性用户仍占主导。这种地域差异反映了不同社会文化背景下,AI 工具在性别普及上的复杂图景。 ## 行业视角:AI 普及进入新阶段 这些数据共同描绘了 AI 普及的下一阶段:**从早期采用者走向大众市场,从单一场景走向多任务渗透,从精英工具走向普惠技术**。对于企业和开发者而言,这意味着需要重新思考产品设计——如何服务一个更庞大、更多样、使用更深入的用户群体?对于政策制定者,则提示了数字鸿沟的新维度:不仅关乎接入,更关乎不同人群如何有效利用 AI 的能力。
## 核心转储流行病学:修复一个18年的老Bug OpenAI 的工程师最近通过大规模核心转储(core dump)分析,成功定位并修复了其数据基础设施中两个看似不可能的错误——其中一个竟然是来自底层库 **GNU libunwind** 中潜伏了 **18年** 的竞态条件。 ### 奇怪的崩溃现象 故事始于 OpenAI 的 **Rockset** 服务(ChatGPT 数据基础设施的关键组件)出现一系列崩溃。崩溃表现为:一个正常的 C++ 函数执行完毕后,返回到一个无效地址,导致程序被内核终止。有时返回地址是 NULL,有时栈指针寄存器 `%rsp` 莫名其妙地偏移了 8 字节。这些异常模式在常规应用代码中几乎不可能出现。 团队尝试了所有常规调试手段,甚至借助 ChatGPT 分析,但每个假设都被证据推翻。这个 Bug 看起来“不可能”。 ### 流行病学方法 传统调试依赖对少数核心转储的深入检查,但面对这种罕见且诡异的崩溃,团队改变了策略——**像流行病学家一样思考**。他们收集了所有崩溃的核心转储,构建了一个高质量的全量数据集,从统计模式中寻找线索。 通过大规模分析,他们发现崩溃其实源于两个完全独立的问题,只是恰好在同一时间被发现: 1. **硬件故障**:某个 Azure 主机上的 CPU 存在静默计算错误,导致指令执行异常。 2. **软件 Bug**:GNU libunwind 中一个存在了 18 年的竞态条件。该库用于栈回溯,在特定并发场景下会破坏栈帧,导致返回地址被覆盖。 ### 修复与启示 硬件问题通过更换主机解决;软件 Bug 则提交了补丁给上游社区。这个案例展示了**大规模崩溃数据分析**在定位极低概率 Bug 上的威力——当单点检查失效时,全量统计能揭示隐藏的规律。 OpenAI 的工程师强调,随着 AI 系统对底层基础设施依赖加深,**C++ 的内存安全问题**与**硬件可靠性**将成为持续挑战。而“核心转储流行病学”这种跨领域方法,或许会成为未来大型系统调试的标配。
OpenAI 今日正式发布 **GeneBench-Pro**,一个面向计算生物学领域、专为评估 AI 系统在真实科研场景中高阶判断能力而设计的基准测试。该基准在原有 GeneBench 基础上大幅升级,覆盖基因组学、定量生物学与转化医学中更具挑战性的任务,旨在衡量模型处理模糊性、迭代修正分析路径以及做出关键科研决策的能力。 ## 为何需要新的基准? 科研数据很少自带“说明书”。研究人员必须自行判断:某个模式是生物学信号还是噪声?现有数据能否支撑待解答的问题?每一个结果又该如何指导下一步行动?尽管当前 AI 模型已能熟练执行复杂的数据分析流程,但真实的科学研究还依赖于更高层次的判断——这正是 GeneBench-Pro 试图量化的核心能力。 OpenAI 指出,此前业界缺乏令人信服的评估手段来衡量这类“系统性判断”,包括处理歧义、修正假设、选择正确分析路径,以及判断结果是否已具备决策条件。这些能力难以形式化,因此也难以严格评估,但恰恰成为制约 AI 在科研领域整体表现的关键瓶颈。 ## “科研品味”的可量化评估 GeneBench-Pro 引入了一个独特概念——**“科研品味”**(research taste),将其定义为塑造整个分析过程的判断链条:数据能回答哪些问题?早期诊断结果应如何改变模型或估计目标?初始计划何时需要修订? 每个问题都会提供给模型一个真实且杂乱的数据集、简要的实验背景,以及一个与下游决策直接关联的目标估计量。模型必须主动探索数据、选择恰当的分析方法、进行迭代实验,并最终给出答案——整个过程模拟了科研中从数据到结论的完整推理路径。 ## 数据构造与行业背景 在生物学领域,数据生成成本(如基因组测序)已大幅下降。一些研究人员甚至认为,当前科研的瓶颈已不再是样本采集,而是下游分析。GeneBench-Pro 正是为应对这一转变而设计——它要求 AI 不仅要会“跑流程”,更要会“做判断”。 该基准的推出,标志着 AI 在科学发现领域的评估标准从“能否执行任务”向“能否像科学家一样思考”迈进。对于从事计算生物学、精准医学以及 AI for Science 的团队而言,GeneBench-Pro 提供了一套可复用的、高难度的能力检验框架。 ## 影响与展望 GeneBench-Pro 的发布不仅为模型开发者提供了更清晰的优化方向,也为科研社区如何信任和使用 AI 辅助工具设立了新的标尺。未来,具备高阶判断能力的 AI 有望在药物发现、基因功能解读、疾病机制探索等场景中发挥更大价值。 论文已同步公开,详细介绍了基准设计、数据集构建与评估方法。
2026年6月30日,OpenAI发布了Genebench-Pro基准测试的详细案例研究,揭示了10个具有代表性的问题及其背后的数据集与支撑材料。这些案例覆盖了从体细胞肿瘤学到药物基因组学等关键领域,旨在评估AI模型在复杂生物医学推理任务中的表现。 ## 案例一:体细胞肿瘤学中的结构变异引导治疗决策 第一个案例聚焦于**结构变异驱动的肿瘤靶向治疗**。模型需要基于长读长测序、基因表达、肿瘤质量和药物基因组学证据,判断一个合成的TXR1导向抑制剂在特定肿瘤亚群中的临床效用。任务要求模型估算治疗获益、毒性风险,并计算净临床效用值,最终以JSON格式输出决策代码和推理过程。 该案例强调**多模态数据整合与因果推断**——模型必须从分散的证据中恢复靶点激活状态,再评估治疗干预的边际效应。这不仅是数值计算,更考验模型的**分析推理质量**。 ## 基准设计的深层意图 Genebench-Pro的设计体现了对AI能力的更高要求: - **数据复杂性**:每个问题都附带真实实验数据,包括患者ID、基因组变异、表达谱等,要求模型具备处理异构数据的能力。 - **推理透明度**:模型不仅需要给出答案,还必须提供详细的推理过程(如方法描述与质量控制),以评估其逻辑严谨性。 - **领域特异性**:问题涉及合成生物学标记(如TXR1、DLR1),模拟了真实研究中因隐私或专利原因而脱敏的数据场景。 ## 行业意义与启示 此次发布的案例研究对AI在精准医学中的应用具有重要参考价值: 1. **从预测到决策**:Genebench-Pro超越了简单的分类或回归任务,要求模型在不确定条件下做出治疗决策,这与临床实践中“权衡获益与风险”的思维高度一致。 2. **基准的实用性**:通过公开提示词与数据集,研究社区可以复现、验证并改进模型的表现,推动可重复性AI的发展。 3. **人机协作的边界**:尽管AI在数据整合方面展现出潜力,但案例中明确的“不尝试走捷径”的指令表明,当前模型仍需在推理质量上追赶人类专家。 ## 小结 Genebench-Pro的案例研究不仅是一次技术展示,更是对AI生物医学推理能力的一次“压力测试”。它揭示了当前模型的优势与局限,为未来研究方向提供了清晰的路标。随着更多案例的发布,我们有望看到AI在基因组学、药物研发和个性化治疗中扮演更核心的角色。
OpenAI经济研究团队发布《欧盟AI就业转型框架》报告,首次将此前用于美国的分析框架应用于欧洲劳动力市场。报告基于欧盟官方职业分类(ESCO)和Eurostat就业数据,将职业分为四大转型类型:AI可能促进增长的岗位、自动化潜力较高的岗位、工作流程可能重组的岗位以及短期内变化较小的岗位。结果显示,欧盟约12%的就业岗位可能因AI而增长,14%面临较高自动化风险,27%将经历工作重组,其余47%短期内变化不大。各国差异显著:卢森堡、瑞典、荷兰在增长型岗位中占比更高,而东欧部分国家自动化风险相对突出。报告强调,这些分类并非预测,而是为政策制定者和劳动者提供调整压力与机遇的规划地图。 ## 四大转型类型:从增长到重组 报告将职业划分为四种类型,每种类型对应不同的AI影响路径: - **增长型岗位(约12%)**:AI通过降低服务成本或提升项目可行性,可能增加对这些职业的需求。例如,AI辅助医疗诊断可能扩大医疗影像分析师的就业机会。 - **高自动化潜力岗位(约14%)**:这些职业的核心任务可能被AI直接替代,如数据录入、基础翻译等重复性工作。 - **重组型岗位(约27%)**:AI改变工作流程和技能需求,但人类仍处于核心地位。例如,律师使用AI进行法律检索,但最终决策仍需人完成。 - **低影响岗位(约47%)**:涉及复杂人际互动、手工操作或高度定制化服务的职业,如心理治疗师、手工艺人等。 ## 欧盟vs美国:结构差异带来不同挑战 与2026年4月发布的美国版分析相比,欧盟在高自动化潜力岗位中的就业占比更低。这反映了欧盟经济结构中服务业与制造业的独特比例,以及更严格的职业许可制度对劳动力流动的限制。例如,德国和法国的职业认证体系可能减缓AI对某些岗位的替代速度。 ## 国家差异:北欧领先,东欧承压 报告显示,卢森堡、瑞典和荷兰在增长型岗位中占比较高,这些国家的数字经济基础更好,且拥有更多高技能知识型岗位。相比之下,罗马尼亚、保加利亚等东欧国家在自动化潜力较高的岗位中占比更大,主要涉及制造业和行政支持类工作。 ## 政策启示:规划比预测更重要 OpenAI强调,该框架并非就业预测,而是帮助各方提前识别调整点。报告建议: - 加大对重组型岗位的再培训投资,例如为教师提供AI教学工具培训。 - 对于高自动化潜力岗位,建立社会保障网络和转岗机制。 - 在增长型岗位领域,通过教育体系培养AI协作能力。 这份报告为欧洲应对AI劳动力转型提供了数据驱动的讨论基础,但最终效果取决于各国政策执行与社会协作。
惠普公司(HP Inc.)近日宣布,将正式启动与OpenAI的**前沿战略合作**(Frontier strategic partnership),在成功完成多项试点项目后,计划将AI能力规模化部署到客户体验、软件开发和企业运营等核心领域。 ## 从试点到规模化:AI如何改变工作流 惠普自2026年2月开始测试OpenAI Frontier平台,早期成果显著。一名工程师借助OpenAI模型在数周内处理了**122个拉取请求**,覆盖43个项目;安全团队则用一天时间修复了多个软件漏洞,而传统流程可能需要**一个月**。这些试点证明,AI不仅能加速代码开发,还能优化跨工具、跨团队的协作节奏。 惠普工程师表示:“这是一个不可思议的工具,我每天都在使用它。”从个人效率的提升到团队协作的压缩,OpenAI工具正在将原本分散的测试、审查、安全检查和交接流程整合为更流畅的闭环。 ## Frontier平台:统一管理与治理 随着试点范围扩大,惠普计划从单一AI工具转向**更广泛的智能体(Agent)和AI工作流组合**。Frontier将作为统一平台,负责监控运行状态、管理上下文、控制操作权限并评估输出结果。这种集中式治理架构意味着企业可以安全地让AI介入更多敏感任务,同时保持合规与可审计性。 ## 行业意义:企业AI落地的“惠普样本” 惠普的案例为传统科技巨头提供了可复用的AI转型模板:**先在小团队验证,再通过统一平台规模化**。不同于初创公司的激进部署,惠普强调“渐进式信任”——从开发工具链到客户服务,每一步都基于实际效果评估。 此次合作也标志着OpenAI从面向个人的ChatGPT向**企业级平台服务**的进一步扩展。Frontier提供的不仅是模型能力,更是企业所需的治理、监控与集成工具。对于正在探索AI落地的组织而言,惠普的经验表明:真正的变革来自“小步快跑+统一治理”的组合。 ## 小结 惠普与OpenAI的战略合作并非简单的技术采购,而是传统企业利用前沿AI重构核心流程的典型案例。未来,随着更多类似惠普的“传统巨头”加入,AI在企业中的角色将从“辅助工具”演变为“运营基础设施”。
OpenAI 近日预览了其下一代模型 **GPT-5.6 Sol**,这款模型在编码、科学研究和网络安全方面展现出更强大的能力,同时配备了迄今为止最先进的安全防护体系。 ## 核心亮点 - **编码能力显著提升**:Sol 在代码生成、调试和理解复杂逻辑方面表现优异,有望大幅提升开发效率。 - **科学研究突破**:模型能够辅助研究人员进行文献分析、实验设计甚至初步的数据建模,加速科学发现进程。 - **网络安全强化**:针对日益严峻的网络威胁,Sol 内置了多层防御机制,可主动识别并抵御恶意攻击。 - **最先进的安全栈**:OpenAI 强调,Sol 集成了其史上最全面的安全架构,包括伦理审查、隐私保护和内容过滤等模块。 ## 行业背景与影响 GPT-5.6 Sol 的发布正值 AI 行业竞争白热化阶段。各大厂商纷纷推出更大参数、更专业的模型,而 OpenAI 选择在安全性和垂直领域能力上发力,试图在“能力提升”与“风险控制”之间找到平衡。 - 对开发者而言,更强的编码能力意味着更低的门槛和更高的产出; - 对科研人员来说,AI 助手正在从“工具”演变为“协作者”; - 而网络安全领域的增强,则回应了业界对 AI 系统本身可能被滥用的担忧。 ## 关于命名与定位 “Sol”在拉丁语中意为“太阳”,暗示该模型如同太阳一般,为 AI 应用提供核心驱动力。不过,OpenAI 并未透露 Sol 的具体参数规模,也未公布正式发布日期。目前该模型仍处于预览阶段,后续可能根据反馈进行调整。 ## 小结 GPT-5.6 Sol 代表了 OpenAI 在追求高性能与高安全性之间的一次重要尝试。对于关注 AI 前沿动态的用户来说,这款模型值得持续跟踪——它不仅可能改变开发与科研的范式,也可能为整个行业树立新的安全标准。
OpenAI最新经济研究论文显示,AI代理(Agent)正从根本上改变知识工作的方式——从简单的单次交互演变为可独立执行长达数小时甚至数天任务的“数字员工”。论文以OpenAI内部工具Codex为样本,追踪了过去一年中用户行为与生产力模式的深刻转变。 ## 从聊天机器人到自主代理:工作单元的重定义 传统AI助手(如ChatGPT)的交互模式通常是短促且自包含的:用户提问,模型回答,任务即告完成。但代理型AI完全不同。**Codex能够自主运行数分钟甚至数小时,期间协调多种工具调用、与环境交互并反复迭代,直至找到解决方案**。这种能力将知识工作的基本单元从“单次问答”升级为“委托式长周期任务”。 论文指出,OpenAI内部员工的使用模式佐证了这一转变。在Codex发布后的最初几个月(2025年8月前),ChatGPT仍是公司内部首选AI工具,平均每位员工仅将不到10%的token消耗在Codex上。而到2026年,**包括法务、财务、招聘等非技术部门在内的所有团队,均已将Codex作为主要AI工作工具**。Codex目前占OpenAI内部每周输出token的99.8%。 ## 四大关键趋势 基于对个人用户、组织用户及OpenAI员工的追踪,论文归纳出四个显著趋势: 1. **更长周期的工作委托**:到2026年5月,80.6%的个人用户至少提交过一次估计相当于人类30分钟工作量的Codex请求,70.2%的用户提交过超过1小时的任务,25.6%的用户甚至委托过超过8小时的任务。这表明用户对代理的信任和依赖正在快速深化。 2. **全部门渗透**:工程部门率先迁移,但法务、财务和招聘等部门也在2026年4月左右跨越了“Codex为主要AI工具”的门槛。对于OpenAI普通员工,Codex的token使用占比已超过85%。 3. **非开发者增长迅猛**:自2025年8月以来,个人非开发者用户增长了**137倍**,组织用户增长了**189倍**,OpenAI内部非开发人员的使用量也增长了12倍。代理工具的易用性正在打破编程技能壁垒。 4. **跨岗位能力扩展**:Codex使OpenAI员工能够完成原本不属于其职责描述的任务。例如,非技术人员也能编写脚本或分析数据,而工程师则能更专注于架构设计。 ## 行业影响与未来展望 这份研究为AI代理的商业价值提供了量化证据。**当AI从“问答工具”进化为“任务执行者”,企业的生产力边界将被重新定义**。代理不仅节省时间,更实现了“能力外溢”——让员工突破原有技能限制,承担更复杂的跨职能工作。 不过,论文也隐含了重要挑战:如何确保代理在长时间自主运行中的可靠性?如何管理多代理协作的复杂性?以及,当代理取代部分重复性知识劳动后,人类角色的重新定位将成为一个社会议题。 OpenAI认为,这代表了未来工作的方向:**人类负责设定目标和决策,而AI代理负责执行和迭代**。随着模型能力的增强和产品功能的完善,这一趋势将加速渗透到更多行业和岗位。
OpenAI 与博通(Broadcom)今日联合发布首款自研 AI 推理芯片 **Jalapeño**,这是一款专为大规模语言模型(LLM)推理设计的加速器,旨在提升性能、能效与系统扩展性。 ## 从设计到生产仅用九个月 Jalapeño 由 OpenAI 从零开始设计,基于其对 LLM 底层原理的深刻理解,结合模型、内核、服务系统及产品需求的全栈洞察。博通与 Celestica 负责芯片实现、板级与机架系统集成、高性能网络及可量产方案。整个流程从设计到生产仅耗时 **九个月**,其间 OpenAI 的 AI 模型也加速了开发过程。 ## 性能与能效显著超越现有方案 工程样品已在实验室中运行 GPT-5.3-Codex-Spark 等工作负载,达到生产目标频率与功耗。早期测试表明,Jalapeño 的 **每瓦性能** 将大幅优于当前最先进的解决方案。其架构通过减少数据搬运并平衡计算、存储与网络资源,使实际利用率更接近理论峰值。 ## 面向全行业 LLM 的灵活设计 Jalapeño 并非仅服务于 OpenAI 自家模型,而是设计为具备灵活性,可适配当前及未来各类 LLM。OpenAI 计划将其部署在 **千兆瓦级** 的数据中心中,并与合作伙伴共同推进多代平台演进。 ## 全栈战略的关键一环 Jalapeño 的发布标志着 OpenAI 从产品、模型到芯片的全栈平台战略迈出实质一步。OpenAI CEO Sam Altman 与总裁 Greg Brockman 从博通 CEO Hock Tan 手中接收了芯片样品。OpenAI 表示,该芯片将让先进 AI 更快、更可靠且更易获取。未来数月将公布详细技术报告。 > 小结:Jalapeño 的诞生不仅是一次芯片发布,更预示着 AI 基础设施从通用 GPU 向专用推理芯片的转折。对于行业而言,这意味着推理成本有望大幅下降,而 OpenAI 通过掌控芯片层,将进一步巩固其从模型到算力的完整生态优势。
免疫学家 Derya Unutmaz 借助 GPT-5 Pro 破解了一个困扰其团队三年的免疫学谜题,揭示了葡萄糖如何影响 T 细胞的特化过程。这一突破可能对癌症、自身免疫疾病和感染研究产生深远影响。 ## 谜题背景:T 细胞与葡萄糖的关系 T 细胞是人体免疫系统的关键组成部分,负责对抗病毒、杀死癌细胞、应对细菌和寄生虫,并区分健康细胞与威胁。在发育过程中,T 细胞会分化为不同亚型,各自承担特定功能,而这些分化方向直接影响癌症、自身免疫疾病和感染的进程。2022 年,Unutmaz 教授进行了一项实验,试图理解葡萄糖——一种单糖——如何影响 T 细胞的早期发育。T 细胞不仅以葡萄糖为能量来源,还用它来构建蛋白质和执行其他细胞功能。实验将早期 T 细胞分别置于低葡萄糖环境和含有脱氧葡萄糖(一种干扰葡萄糖利用的分子)的环境中,结果出现了令人困惑的现象:两种条件下 T 细胞的行为差异显著,但团队无法解释其背后的机制。 ## GPT-5 的介入:从数据到洞察 直到 2025 年底,Unutmaz 开始使用 **GPT-5 Pro** 重新审视这批数据。他并非简单地将问题抛给模型,而是结合自己的专业知识与 AI 的分析能力,进行迭代式探索。GPT-5 Pro 帮助他识别出之前被忽略的基因表达模式,并提出了新的假设:葡萄糖不仅作为燃料,还可能通过特定的信号通路直接调控 T 细胞的分化程序。模型能够整合海量文献和实验数据,生成可验证的预测,从而加速了研究进程。Unutmaz 形容,没有 AI 的科研“就像失去了双手或半个大脑”。 ## 意义与展望:AI 驱动的免疫学新范式 这一发现不仅解答了一个基础生物学问题,更展示了 **AI 增强人类专业能力** 的潜力。传统的免疫学研究往往依赖试错法,而 GPT-5 这样的模型能通过模式识别和知识关联,大幅缩短从数据到结论的周期。对于癌症免疫疗法、自身免疫疾病调控和抗感染策略,理解 T 细胞分化的精确机制意味着可能开发出更靶向的治疗方案。Unutmaz 的案例表明,AI 不再是替代科学家,而是成为科研中不可或缺的“协作者”,尤其在处理复杂生物系统和高维数据时,其价值尤为突出。
OpenAI helps build shared standards for advanced AI, supporting evaluation frameworks, safety practices, and global cooperation through the Appia Foundation.
## 从搜索到对话:Omio 的 AI 转型之路 全球领先的多模式旅行平台 **Omio**,连接着超过 **3000 家** 交通服务提供商,覆盖 **47 个国家** 的火车、巴士、渡轮和航班。随着消费者习惯向对话式界面迁移,Omio 正借助 OpenAI 技术,重新定义旅行发现与预订的方式。 传统旅行规划往往需要在多个网站间切换,对比不同交通方式,再拼凑出完整的行程。Omio 认为 AI 能够创造一种截然不同的体验——用户只需描述想去哪里,就能获得个性化、可预订的旅程方案。 作为 OpenAI 的早期客户与合作伙伴,Omio 成为首批尝试基于实时交通数据的对话式旅行体验的旅行公司之一。同时,公司也意识到,重塑客户体验的同一技术同样可以改变内部工作方式。 ### 对话式旅行的落地 2023 年,Omio 通过 **ChatGPT** 推出了最早的旅行体验之一,将 OpenAI 模型直接连接到 Omio 的交通库存和预订系统。这一集成让旅行者可以用自然语言提问,例如“从罗马到佛罗伦萨最快的路线是什么?”或“从巴黎到巴塞罗那,坐火车还是飞机更好?” ### 加速产品开发 借助 OpenAI 的 **Codex** 和 **API**,Omio 将新产品的开发周期从 **3 个月** 缩短至 **1 个月**,所需开发人力从多个开发者一个季度减少到 **一个开发者一个月**——仅为以往开发工作量的 **20%**。这种效率提升使团队能够快速迭代,推出更多 AI 驱动的功能。 ### 成为 AI 原生公司 Omio 的转型不止于客户界面。公司正全面拥抱 AI,从客服自动化到内部运营优化,逐步将 AI 嵌入每一个业务环节。CTO **Tomas Vocetka** 表示,与 OpenAI 的合作不仅加速了创新,更帮助 Omio 朝着“AI 原生”公司的目标迈进。 ### 行业启示 在旅行行业,AI 正在从辅助工具演变为核心体验。Omio 的案例表明,将大语言模型与实时数据、预订系统深度整合,能够创造真正的商业价值——不仅提升用户体验,还显著降低开发成本与周期。对于希望抓住 AI 浪潮的企业而言,关键在于找到技术与场景的最佳结合点,并敢于从实验走向规模化。 随着对话式 AI 的成熟,旅行规划或许将彻底告别“搜索–比较–选择”的繁琐流程,进入一个“描述–获得–出发”的流畅时代。
OpenAI 于 2026 年 6 月 22 日宣布推出 **Patch the Planet**,这是一项由 Daybreak 计划资助、与 Trail of Bits 合作的新倡议,旨在帮助开源维护者发现、验证并修复关键开源软件中的安全漏洞。该计划将 **AI 辅助的安全研究**(使用 OpenAI 最先进的网络安全模型)与 **专家人工审查** 相结合,不仅识别漏洞,还直接参与补丁开发。 ## 背景与痛点 AI 正在加速漏洞发现,但仅发现漏洞并不能保护用户。许多开源维护者面临 **报告激增** 的压力,而时间和资源有限。Patch the Planet 旨在减轻这一负担:安全工程师在报告到达维护者之前先行审查,与项目合作开发补丁和测试,并建立可复用的工作流,帮助团队在首次修复后持续提升安全性。 ## 运作方式 每个合作从与维护者的咨询开始。安全工程师了解项目需求、偏好以及最需要安全投入的领域:漏洞验证、补丁开发、CI/CD 改进或长期安全工程。达成一致后,研究人员调查潜在漏洞,验证有效问题,开发或完善补丁,支持测试,并通过项目既定渠道协调披露。 ## 首批参与项目 初始参与者包括 **cURL**、**NATS Server**、**pyca/cryptography**、**Sigstore**、**aiohttp**、**Go 项目**、**freenginx**、**Python** 和 **python.org**。这些项目支撑着广泛使用的网络、密码学、软件供应链和语言基础设施,加强其安全性可惠及大量下游产品和服务。更多项目将在未来轮次中加入。 ## 合作伙伴 - **Trail of Bits** 已投入全部安全研究团队参与初始冲刺,直接与维护者合作进行调查、验证、补丁开发和披露协调。 - **HackerOne** 和 **Calif** 将协助漏洞分类、协调披露以及额外的针对性发现工作。 ## 意义 Patch the Planet 体现了 **AI 安全从“发现”到“修复”的闭环**。通过将 AI 效率与人工专业判断结合,该计划有望缓解开源社区长期存在的安全资源不足问题,为整个软件供应链带来实质性的安全提升。
OpenAI 于 2026 年 6 月 22 日发布了 Daybreak 安全工具集,旨在帮助组织以机器速度发现、验证并修复漏洞。核心更新包括:**Codex Security** 插件升级,可自动预防新漏洞进入生产环境;**GPT-5.5-Cyber** 完整版发布,在 CyberGym 基准上达到 **85.6%** 的业界最佳性能;**Daybreak 网络合作伙伴计划** 允许合作伙伴将模型能力集成到自身产品中;以及 **Patch the Planet** 倡议,联合 Trail of Bits、HackerOne 等机构,帮助 30 多个开源项目(如 cURL、Go、Python)从发现漏洞转向自动生成补丁。 OpenAI 指出,AI 已改变网络安全格局:漏洞发现不再是瓶颈,**修补漏洞** 才是当前最大挑战。Daybreak 旨在民主化补丁自动化,让更多组织受益于前沿 AI 的防御能力。