Your current location:Home > 秀米 text

古剑奇谭

GPT-5.6-Sol在网络攻防能力上,超越了Mythos!开源模型也排好了_我的网站

杨澜访谈录

一 |     

[ 行业] 本周行业事件较多,新势力方面,蔚来1季报:现金水平大幅下滑,留给蔚来的时间不到1年。

二 | 不过Q2销量指引不错,边际改善的确定性非常强,但也仅限Q2。    新智元报道                    GPT-5.6-Sol 的攻防能力超越了 Claude Mythos 5!                    英国 AI 安全研究所(AISI)7 月 17 日发布了一份评估报告,第一次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。尊界S800让华为回到舒适的高端市场,不过尊界未来有非常大的可能会在品牌立住后,价格下探,未来当门面使用尚界会挑起销量基本盘的大梁

三 | 传闻较久的东风和长安合并落空,内部阻力大,国资委把它们留给市场。国资委提出合并时机恰当,但阻力大。

四 |                    https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber                    去年同类内部测试中,这个差距是 6 到 10 个月。中汽协和工信部接连反对无序“价格战”,我们从美国历史3次价格战反观中国当下价格战。商务部关注“零公里二手车” 产能过剩是根本原因。魏建军点名批评“零公里二手车”怪象,扰乱市场秩序。                   防御窗口在收缩,而攻击前沿在加速。

2025年6月3日美股盘前,蔚来汽车发布2025年一季度财报,披露上述数据。                   今年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 的评估中制造了自 2023 年开始测试以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。北京时间6月3日晚,蔚来公布2025年第一季度财报。公司一季度交付42094台,同比增长超40%;一季度营收超120亿元,同比增长超21%;一季度整车毛利率10%;二季度交付指引7.2万台至7.5万台,同比增长25.5%至30.7%,二季度交付预计环比大增71%—78%。汽车销量未完成一季度目标一季度,蔚来汽车交付4.2万辆,同比增加40.1%、环比42.1%;同期,汽车销售额同比增长18.6%、环比减少43.1%。蔚来汽车为2025年设立的销量目标是44万辆,一季度仅完成不到1/10。汽车收入:再次低于市场预期单车收入本季度23.6万,环比下滑0.4万元,又来到了历史新低,且低于市场预期的24.1万,但蔚来一季度由于对老款库存车折扣加大+L60占比环比提升的车型结构的负面拖累,可以理解。

五 |

本季度在手现金大幅下滑,速度之快令人惊讶本季度蔚来在手现金仅260亿,环比上季度下滑了有159亿元,这种下滑幅度如此之快超出市场预期。

六 |                    开源模型还没有复现这次跳跃,但它们追赶的脚步比去年更快了。                             4 到 7 个月:怎么测的,差在哪                    AISI 用两套体系评估模型的网络攻击能力。短评:在没有新一轮融资的支持下,蔚来在手现金已经不够支持公司运营一年。                   第一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度分四级,从「有技术背景的非专业人士」到「十年以上经验的专家」。虽然二季度是有边际改善的确定期,但过了2季度,蔚来销量维稳又面临新一轮问题,尤其在5566改款力度很小,蔚来的毛利率能支撑降价空间有限,而乐道L90+L80显然也不是走量车型,但蔚来已经没有再试错的机会。                             第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力。一旦蔚来销量在三季度又开始呈现继续下滑趋势,乐道L系列再失败,如果没有外部输血,股东自发融资等手段,卖车力度不足以自救的话,资金流有断裂的风险。其中一个名为「The Last Ones」的测试场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。

。                             两套体系给出了一致的结论:                    GLM-5.2(2026 年 6 月发布)在窄任务上的表现与 Opus 4.6(2 月发布)相当,差距 4 个月;                    在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。                   DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。                   两个差距都比 2025 年内部评估中测到的 6 到 10 个月更窄。                   成本差距比能力差距更大。

七 |                    同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。                   在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元;                    Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。

八 |                    同等攻击能力,开源便宜一到两个数量级。                   闭源模型的安全护栏也没能拉开差距。

九 |                    AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。                   Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。                   Amazon 研究员随后独立报告了另一种绕过方法。                   这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。                   闭源并不自动等于安全。                             防御窗口收窄     防御工具也在加速                    AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。                   英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。                   同一代 AI 工具确实也在加速防御端的工作。

十 |                    游戏网络编程领域的资深开发者 Glenn Fiedler,是在游戏网络编程领域写了二十年教科书级文章的大佬,最近用 Claude Code 对自己维护的四个开源网络库(yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star,在游戏领域已属相当有影响力的老牌开源大库)做了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。                   Glenn Fiedler                    两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。                             最严重的是 yojimbo 中一个自 2019 年就存在的远程堆溢出——恶意客户端可以通过构造特定数据包触发它。

十一 |                              整个审计的 Token 成本约 2500 美元。                             攻防两端都在被 AI 加速,但加速方式不对称。

十二 |                    攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。                   而防御工具的部署需要每个团队主动投入时间和成本。                   AISI 报告中有一句话点明了这个结构:「一旦开源释出,这些选项永久丧失。」                    这组数据对 AGI 格局的影响比数字本身更深远。                   开源与闭源的能力差距收窄到半年以内,「用闭源独占期充当安全缓冲」的默认策略快要失效了。

十三 |                    闭源模型的护栏在 Fable 5 事件中被证明同样脆弱。

十四 |                    下一阶段对于全球的决策者而言,政策博弈的核心问题已经变得更尖锐:什么能力级别以上的模型不应开放权重。                   AISI 宣布将继续评估 Kimi K3 等下一批开源模型——上面这条线画在哪里,很可能取决于接下来几个月的测试结果。                   参考资料:          https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber          https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md          https://www.patreon.com/MasBandwidth/posts/important-news-164199395          编辑:马可。

十五 |

Current article:http://6xd.choumaimuwogenkuzhainuan.bond/mk98k/20260826/51730.html

Published on:13:23:02


 Live broadcast Hall
·比特币“鲸鱼”的复苏引发了恐慌:市场正面临剧烈波动。
·一文讲透Agent的底层逻辑
·网易互娱连走三人?丁磊对广州藩王的精准切割
·逛西湖这么多年,真没发现这个“彩蛋”
·微软抢占了诺基亚?
 Press release
·欧洲运营商:华为设备更贵,但更好
·辣榜 | i9-12900H+3070 Ti :Redmi G Pro 游戏本 2022 酷睿版 9999 元开售_品质_京东商城
·雷俊伟询问下一代红米新机的改进建议
·日照港焦炭市场动态
·【循足迹看变化】曹妃甸港区:逐梦深蓝 建设绿色智慧大港
 Collection of municipal and local releases
·2022年下半年全国大学英语四、六级考试报名工作启动
·小鹏版“库里南”谍照 超级增程纯电续航或达430km 或售20万以上
·换季式降温来了!冷空气预约“国庆档”
·Inflation held steady in September, running hotter than expected
·《促进网信企业高质量发展行动计划(2026-2030年)》答记者问

 

Copyright © 2020-2099 古剑奇谭 All Rights Reserved 古剑奇谭 Copyright