8月14日,智谱(2513.HK)发布GLM-5.3,发布与GLM-5.2相比,编程基座模型没变,源模但通过极致的型接后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的智谱最强全球领先外汇交易平台环境类型、超长的发布后训练时间。智谱表示,编程在多项主流基准测试中GLM-5.3是源模当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5,型接编程体感超过其他国产模型。智谱最强
智谱称,发布相比前代,编程GLM-5.3的源模新能力包括:更强的编程能力、网络安全能力、型接后训练Scaling以及开源。
根据智谱介绍,在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的EC Markets交易平台DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam上,得分从23.8提升至28.5。在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中得分1769,展现基于编程能力涌现的专业任务执行能力。

在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5。“从任务链条看,EC Markets交易官网网络安全能力大致包括代码审查、漏洞验证、漏洞利用以及真实环境中的攻防闭环。我们选取了覆盖漏洞分析、验证和利用不同阶段的三个基准,对GLM-5.3的网络安全能力进行了全面评估,GLM-5.3当前优势主要集中在前半段。”智谱表示,在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。
近期,大模型领域频频上新。
8月13日凌晨,DeepSeek V4 Pro正式推出,并已更新至API,模型版本为DeepSeek-V4-Pro-0813,新版本增强了Agent能力。根据DeepSeek给出的模式测试对比成绩,与此前V4-Pro-Preview版本相比,V4-Pro-0813已经全面提升,例如在AI编程智能体基准测试DeepSWE中,得分从Preview的7.3,大幅提升至62.7,甚至超越了Claude Opus 4.8。在AI安全智能体基准测试Cybergym、智能体基准测试AutomationBench中甚至超越目前公认最强大的Claude Fable 5。
随后,DeepSeek首款智能体也开放测试,13日晚间,DeepSeek宣布,DeepSeek Harness的开发者预览版(v0.1 版本)面向全球 Harness开发者开放测试,并同步以 MIT 协议开放源代码。DeepSeek Harness 采取“一切皆插件”的设计思路。我们采用插件式开放架构来构建 Agent Harness:模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。
与此同时,SpaceXAI发布Grok 4.6。SpaceXAI表示,新模型是在Grok 4.5基础上进一步升级,重点提升长流程任务中的表现,以及处理更复杂的交互式、视觉和知识工作任务的能力。
截至发稿时,智谱跌超4%。


图文所示:24小时节奏预期一句话看懂黄金Gold:短线保持相对高位持稳,有助于本周继续震荡上行。预计今日波幅:85美元空头阻力价2:4425.00空头阻力价1:4400.00多空均衡价:4370.00

美国上周初请失业金人数为20.6万人,预估21万人,前值20.9万人。

中信证券:回归常态,调整预期北美AI链经过半个月的修复,涨价链条的赔率明显下降,近期AI叙事上有一些边际变化,但尚不足以带动整个板块重估,还需要耐心等远期新叙事的出现。非美市场出海方面,中欧贸易争端在
周三航运港口板块逆势走强,南京港涨停,连云港、中谷物流、国航远洋等个股跟涨。全球核心航道运费集体冲高消息面上,全球能源大宗商品价格评估机构Argus近日发布的数据显示,地缘冲突持续发酵,叠加欧洲与拉美

悬壶金翁:9.21黄金日内看上涨,关注4345分水岭成功是一种观念,致富是一种义务,快乐是一种权力。黄金上周整体走势探底回升,我们也是操作很稳健,虽有损单,但只要思路明确,严格执行,结果都不会差,所以
8月21日晚间,国内“矿茅”紫金矿业601899.SH/2899.HK)发布2026年半年度报告。报告期内,该公司实现营业收入1941.78亿元,和上年同期相比同比)增长15.78%;归属于上市公司股