OpenAI GPT-6 Astra 发布,首次达到“关键”级网络安全能力门槛 - IT之家 首页 IT圈 最会买 设置 日夜间 随系统 浅色 深色 主题色 黑色 投稿 订阅 RSS订阅 收藏IT之家 软媒应用 App客户端 要知App 软媒魔方 业界 手机 电脑 测评 视频 AI 苹果 iPhone 鸿蒙 软件 智车 数码 学院 游戏 直播 5G 微软 Win10 Win11 专题 搜索 首页 > 智能时代 > 人工智能 OpenAI GPT-6 Astra 发布,首次达到“关键”级网络安全能力门槛 2026/9/4 6:28:07 来源: IT之家 作者: 问舟 责编: 问舟 评论: 感谢IT之家网友 南琴梨 、 简纸Paper 、 苹果笔会梦到乔布斯吗 、 未央 、 AlanMac 、 愚公骑马 、 汪汪的主人是喵喵 、 软媒新友1970583 、 软媒新友2203184 、 华南吴彦祖 、 凉 、 软媒用户1053564 、 勇者阿帽 、 不甜的砂糖 、 Stephen_233 、 火瓶座 、 乌蝇哥的左手 、 棒槌 的线索投递! IT之家 9 月 4 日消息,当地时间 9 月 3 日,OpenAI 宣布推出新一代 GPT-6 Astra 模型,这是该公司迄今为止最强大、部署最广泛的大语言模型。 据介绍,Astra 是 OpenAI 旗下首个达到其“准备框架”(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的模型。 据 OpenAI 介绍,Astra 在网络安全能力上实现了显著跃升。在提供适当工具和访问权限的情况下,该模型能够在无人指导的条件下,发现许多防护严密的系统中此前未知的安全漏洞,并开发新的利用方式。 针对网络安全能力提升,OpenAI 进一步加强了 GPT-6 Astra 的安全防护,包括强化内部开发和部署环境隔离、加密模型检查点,以及对完整运行轨迹进行统一监控。 OpenAI 还引入了在内部使用前必须通过的阻断式对齐评估流程,并针对模型可能因滥用或自身偏差采取有害网络操作的风险增加防护措施。 与 GPT-5.6 Sol 相比,GPT-6 Astra 的抗越狱能力也有所提升。OpenAI 称,该模型通过新的鲁棒性(指模型在面对被破坏的、异常的、有恶意的输入时,能否做到“临危不乱”)安全训练技术,在较长运行轨迹中的表现同样更加稳定。 在具体应用场景中,Astra 在面对提示词注入攻击的鲁棒性显著优于 GPT-5.6 Sol,在真实浏览和专业计算机环境中的不对齐及潜在破坏性行为(如未经授权的交易、数据丢失、过度访问或规避控制)也大幅减少。此外,Astra 在高风险场景中的响应更为安全,且在 18 岁以下用户的年龄适配安全边界应用上更为一致。 IT之家注:提示词注入攻击(Prompt Injection)是指通过特定输入诱导 AI 系统偏离原有指令或安全约束的攻击方式。 OpenAI 表示,公司通过离线测试,以及内部和外部越狱测试与修复计划,对 GPT-6 Astra 进行了验证。针对被标记为潜在高风险的用户,模型还接受了更保守拒答边界方面的训练。 此外,OpenAI 采用回归测试确保 GPT-6 Astra 能够抵御此前测试阶段发现的越狱方式,并使用最新的内部自动化红队攻击模型进行了新一轮测试。 在模型对齐方面,OpenAI 称 GPT-6 Astra 相较 GPT-5.6 Sol 也有所改进,涉及预训练数据构成以及强化学习阶段的评估机制。 根据 OpenAI 公布的一组对齐评估结果,GPT-6 Astra 在遵守安全与安全边界、以及保持在获授权范围内执行任务方面表现更好。 OpenAI 还利用超过 5.4 万项内部 Codex 任务开展部署模拟。在这项测试中,GPT-6 Astra 被标记为高严重程度失配行为的次数约为 GPT-5.6 Sol 的一半。 OpenAI 同时扩大了失配监控系统的部署范围,将其加入 GPT-6 Astra 对外部署过程中涉及工具调用的推理流程。该监控系统需要消耗大量计算资源,其架构与 OpenAI 内部使用的监控方案相似。 不过,OpenAI 也指出,GPT-6 Astra 的可监控性较 GPT-5.6 Sol 有所下降。相关研究显示,Astra 更有能力控制自身思维链(CoT),并且更不容易在其中留下可能暴露问题的信息。 在对抗性测试中,OpenAI 要求模型主动规避监控,发现 GPT-6 Astra 在评估中故意降低表现时可以保持不被发现;在执行部分破坏性任务时,它有时也能够规避内部监控。 OpenAI 称,目前尚未发现 GPT-6 Astra 存在思维链隐写推理的证据,即通过普通且看似无关的文本隐藏推理信息。因此,现阶段观察到的规避风险可能主要局限于较低难度的推理任务。 OpenAI 强调,这些结果主要来自要求模型主动规避监控的对抗性评估,而整体对齐测试仍显示,GPT-6 Astra 违反安全限制的可能性低于 GPT-5.6 Sol。 OpenAI 表示,公司将继续研究上述趋势及其对模型可监控性的影响,并把保持和利用思维链监控能力作为相关研究计划的核心目标。同时,公司认为,仅依靠检查模型思维链并不足以完成对齐审计,还需要发展其他审计技术。 在浏览和办公环境中,GPT-6 Astra 同样针对提示注入进行了强化。OpenAI 在真实浏览及专业计算机环境中测试发现,该模型执行未授权交易、造成数据丢失、过度访问权限或绕过控制措施等潜在破坏性行为的可能性低于 GPT-5.6 Sol。 在智能体场景中,GPT-6 Astra 处理高风险请求时也更加谨慎。例如,对于涉及暴力攻击策划或实施欺诈的请求,其行为安全性均有所提升。 OpenAI 最后表示,GPT-6 Astra 在来自实际生产环境及人工红队测试的高风险请求中,相较 GPT-5.6 Sol 能够更安全地完成允许处理的任务,同时减少对无害请求的不必要拒答。 OpenAI 首席科学家 Jakub Pachocki 在 9 月 3 日上午的简报会上表示:“随着模型能力增强,准确理解它们能做什么变得更困难了。这并不保证随着智能持续提升,我们的方法仍然足够有效,因为智能的进步并不能保证对齐的进步。” 投诉水文 我要纠错 下载IT之家APP,签到赚金币兑豪礼 相关文章 关键词: OpenAI , GPT6 Astra OpenAI 将召集约 300 名安全领域负责人,筹备网络安全相关公告 OpenAI、Anthropic 等科技公司安保人员获准罢工,要求提高薪资待遇 奥尔特曼:OpenAI Astra 模型参与了美政府自愿审查 奥尔特曼:OpenAI 肯定会研发人形机器人 OpenAI 首席科学家回应“AI 推理不透明”争议:复杂度未跳跃增长 遏制智能体失控,消息称 OpenAI 正开发 AI 自动终止功能 软媒旗下网站: IT之家 最会买 - 返利返现优惠券 iPhone之家 Win7之家 Win10之家 Win11之家 软媒旗下软件: 软媒手机APP应用 魔方 最会买 要知
OpenAI GPT-6 Astra 发布,首次达到“关键”级网络安全能力门槛 - IT之家 首页 IT圈 最会买 设置 日夜间 随系统 浅
OpenAI GPT-6 Astra 发布,首次达到“关键”级网络安全能力门槛 - IT之家 首页 IT圈 最会买 设置 日夜间 随系统 浅色 深色 主题色 黑色 投稿 订阅 RSS订阅 收藏IT之家 软媒应用 App客户端 要知App 软媒魔方 业界 手机 电脑 测评 视频 AI 苹果 iPhone 鸿蒙 软件 智车 数码 学院 游戏 直播 5G 微软 Win10 Win11 专题 搜索 首页 > 智能时代 > 人工智能 OpenAI GPT-6 Astra 发布,首次达到“关键”级网络安全能力门槛 2026/9
这条信息对 FDE 的直接价值在于提醒交付人员持续关注模型、智能体与企业流程之间的变化。面对类似项目,应先确认客户的真实业务目标、数据边界、权限条件和验收指标,再选择工具并用最小场景验证结果,避免只追逐功能更新。