北京时间3月6日凌晨,通义千问在官方公号上发文称,推出最新的推理模型 QwQ-32B。这是一款拥有320亿参数的模型,其性能可与具备6710亿参数(其中370亿被激活)的 DeepSeek-R1媲美。
通义千问表示,强化学习可以显著提高模型的推理能力。例如,DeepSeek-R1 通过整合冷启动数据和多阶段训练,实现了最先进的性能,使其能够进行深度思考和复杂推理。而QwQ-32B突显了将强化学习应用于经过大规模预训练的强大基础模型的有效性。
其在文章中展示了在一系列基准测试中与DeepSeek-R1、o1-mini等模型的功能对比,如在测试数学能力的 AIME24 评测集上,以及评估代码能力的LiveCodeBench 中,千问 QwQ-32B 表现与DeepSeek-R1相当,胜于 o1-mini 及相同尺寸的R1 蒸馏模型。
目前,QwQ-32B 已在 Hugging Face 和 ModelScope 开源,并采用了 Apache 2.0 开源协议。
7月6日,上交所官网显示,宇树科技股份有限公司(以下简称“宇树科技”)科创板IPO审核状态于7月2日变更为“注册生效”。据中国证监会官网消息,7月2日,中国证监会发布《关于同意宇树科技股...[详细]
7月6日晚间,苏州锦富技术股份有限公司(以下简称“锦富技术”)发布公告称,公司拟使用自有或自筹资金4000万元参与认购嘉兴磐数股权投资合伙企业(有限合伙)(以下简称“嘉兴磐数”)份额...[详细]
7月6日,辉羲智能宣布,公司近日与世界模型驱动的城市场景具身智能全栈方案商酷哇科技(Coowa)正式达成战略合作。双方将基于光至 R1芯片与酷哇科技自研的COOWAM(Co-Optimized World Action...[详细]