爸爸去哪儿

Qwen3.8,登顶英伟达榜单!_我的网站

幸福魔方

一 |     

     阿里云优惠券 先领券再下单        紧急!618 红包最后5天!京东「红包 588」每日 3 次领最高 25618 元,6 月 20 日过期;淘宝「好运红包 8811」每日 1 次抽 25888 元,6 月 20 日截止。    智东西(公众号:zhidxcom)     作者 | 程茜     编辑 | 云鹏          智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。

二 | 双平台红包可叠加跨店满减、会员补贴,6 月 17 日晚 8 点至 18 日为价格冰点期,京东每满 299 减 50、淘宝每满 300 减 50。         榜单中SOL得分指的是GPU的峰值算力与HBM带宽共同决定的理论性能极限。模型这一分数越接近1,代表其生成和优化GPU算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。速搜口令收藏历史记录,新人领专属红包,有概率加码时段(每天10点,每晚 8 点)蹲大额福利,错过再等一年!    首先,划重点!今年京东的618最新红包口令是「红包588」,淘宝618最新红包口令是「好运红包8811」要记住!    京东APP搜:红包588 (每天领三次!)    淘宝APP搜:好运红包8811    每天领!一直到6月18日!红包最高25888元!每晚8点还能有机会额外领取一次记的查看!    秘诀:先在app搜一下口令,以后每天点历史搜索记录就可以了!    

    最新口令:红包588    活动周期:2025年5月13日-6月18日    参与方式:每日打开京东APP,在搜索栏输入口令「红包588」,直达活动页面即可抽取最高25618元无门槛红包。         这一榜单中排名第二的是腾讯混元Hyra、排名第四的是人类开发者Amir M. Mir、排名第六的是美国AI创企doubleAI的全自动GPU内核生成智能体系统、排名第十的是AI编程独角兽Cursor,其他项目暂未找到公开打榜记录。首次搜索后,可通过历史记录快速复领,省时又便捷。         SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。    淘宝天猫超级红包    最新口令:好运红包8811    活动周期:2025年5月15日-6月18日    参与方式:打开手机淘宝,搜索框输入「好运红包8811」,进入活动页领取最高25888元超级红包,每日1次领取机会,首搜后可通过搜索历史快速复领。    京东618京享红包    每日任务福利    好友助力计划:邀请好友助力,每成功邀请1人可获最高0.5元红包+20点火力值,累计1000点火力值可额外兑换10.7元红包。         7月19日,阿里千问大模型团队宣布将很快发布并开源Qwen3.8。    签到打卡奖励:累计打卡5天可领10元红包,在加码时段(如5月31日)打卡可额外参与抽奖,赢取实物奖品或金币。    天降惊喜彩蛋:抽奖后随机触发限时任务,12小时内邀请1名好友助力,可解锁黄金积存金、实物试用品等隐藏权益。

三 | 该模型参数2.4T,可能是除了Fable 5外最强大的模型。

四 | 昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表现更好。

五 |         京东618红包玩法升级:互动任务+新人福利双重惊喜    新人专属权益    新注册用户首次参与活动,可直接解锁新人红包,无门槛抵扣订单金额,下单即享优惠。         一、从124个模型中提取,共235项CUDA内核优化任务          随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。

六 |     红包膨胀机制    每日抽奖后有机会触发红包升级权益,最低0.01元红包可置换为大额品类券或无门槛券,提升福利价值。         基于此,英伟达提出了SOL-ExecBench基准套件。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。         与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。    趣味互动任务    猜拳夺红包:6月13日等加码节点,每日3次挑战机会,获胜即可解锁额外红包或品类券,连续获胜可使奖励倍数递增。    锦鲤数字竞猜:6月16日指定日期,每日3次猜数字机会,猜中当日锦鲤数字可抽取大额红包,猜错后系统将提示范围缩小,提升中奖概率。    骰子猜大小:6月12日加码时段,每日5次参与机会,猜对骰子点数大小即可领取奖励,连续猜中奖励翻倍。    618 省钱小贴士    红包每日必领:京东搜「红包 588」每日 3 次,淘宝搜「好运红包 8811」每日 1 次,加码时段(每晚 8 点)奖池翻倍,历史记录可快速复领。    满减叠加技巧:京东每满 299 减 50、淘宝每满 300 减 50,搭配品类券和红包,高价值商品(如家电、手机)省 30%-50%。其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限。         英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。         具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。    会员特权加码:京东 PLUS 领满 6000 返 600 京豆,淘宝 88VIP 叠加满 5000 减 40」,部分商品再享 95 折。    价保防套路:京东一键价保 30 天,淘宝 88VIP 秒退差价,下单前用历史价查询工具避坑。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。    爆发期精准蹲守:6 月 17 日 20:00-18 日 24 时为价格冰点,优先抢购 iPhone、戴森等爆款,70% 未付款库存会二次释放。         为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。        剩余活动时间有限,每日搜索口令领红包、完成互动任务攒福利,叠加会员特权与品类券,轻松省下一半预算!6 月 17 日 - 18 日终极爆发期即将到来,提前加购心仪好物,开启省钱狂欢!后续更多爆品攻略与隐藏福利持续更新,别错过每一份超值惊喜! 后续还将更新更多平台玩法与爆品攻略,敬请关注~

        
    

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!。         此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。         该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。         该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。         根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。         二、榜单排名靠前,意味模型具备闭环自我改进潜力          Kernel优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一:          反馈明确:运行时间、吞吐量、带宽利用率可以精确测量;     标准客观:距离硬件理论极限还有多远,没有歧义;     迭代自然:每一轮优化都可以作为下一轮的起点。         这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。         在SOL-ExecBench FlashInfer-Bench子集上表现靠前,就意味着模型在下面几项能力上具有优势:          长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。

七 |     工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。    稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。

八 |     系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。

九 |          这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。         三、训练侧搭建真实GPU环境,推理侧引入阿里智能体框架          智东西从千问团队获悉,在训练、推理方面,千问团队均针对Kernel Self-Evolving进行了优化。

十 |          首先在训练侧,为了让模型真正具备kernel优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实GPU环境的大规模强化学习体系。         1、研究人员搭建了基于沙盒的真实GPU训练环境:          为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。这可以确保每一个训练信号都有真实的物理意义。         2、真实Kernel仓库作为训练数据          研究人员系统性收集了大规模真实的工程级kernel优化代码,以这些真实世界的kernel作为训练query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。         3、RL基础设施的针对性优化          Kernel优化任务的一个显著特点是需要超长的工具调用序列,单次优化过程可能涉及数十乃至数百轮的编译-执行-分析循环。         为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。         在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。         ▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub)          在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29354轮工具调用的持续迭代,在每一轮循环中对kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。         这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。         结语:从手写算子到AI生成、调优,Qwen3.8刷新自动化算子生成能力上限          Qwen3.8此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。         自动化GPU算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。

十一 | 长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。

十二 |

Current article:http://w1a407.rangzhuanhoujuedu.cyou/6moh/20260826/5040422.html

Published on:05:56:19