123,123

阿里云开源首个AI推理模型QwQ

推理水平对标OpenAI o1 数学、编程尤为出色

日期： 2024-11-29

來源：IT之家

關(guān)鍵詞： 阿里云 QwQ AI推理模型

11月28日消息，今天，阿里云通義團隊宣布推出并同步開源了全新的AI推理模型——QwQ-32B-Preview。

評測顯示，預(yù)覽版本的QwQ（Qwen with Questions）在科學(xué)推理能力上展現(xiàn)出研究生水平，尤其在數(shù)學(xué)和編程領(lǐng)域表現(xiàn)卓越，其整體推理能力可與OpenAI的o1相媲美。

據(jù)介紹，QwQ是通義千問Qwen大模型最新推出的實驗性研究模型，也是阿里云首個開源的AI推理模型。

阿里云通義千問團隊研究發(fā)現(xiàn)，當(dāng)模型有足夠的時間思考、質(zhì)疑和反思時，其對數(shù)學(xué)和編程的理解就會深化，基于此QwQ取得了解決復(fù)雜問題的突破性進展。

在衡量科學(xué)問題解決能力的GPQA評測集中，QwQ達到了65.2%的準(zhǔn)確率，顯示出其研究生水平的科學(xué)推理能力；在AIME評測中，QwQ以50%的勝率證明了其解決數(shù)學(xué)問題的能力。

在MATH-500評測中，QwQ以90.6%的高分超越了o1-preview和o1-mini。在評估高難度代碼生成的LiveCodeBench評測中，QwQ答對了一半的題目，在編程競賽題場景中也有出色表現(xiàn)。

不僅如此，QwQ在面對復(fù)雜問題時，能夠進行深度自省，質(zhì)疑自身假設(shè)，并通過深思熟慮的自我對話，仔細審視其推理過程的每一步。

例如，在解決經(jīng)典智力題“猜牌問題”時，QwQ通過梳理對話和推演，像個擅長思考的人一樣，并最終得出正確答案。

目前，QwQ-32B-Preview已在魔搭社區(qū)和HuggingFace等平臺上開源，發(fā)布短短幾小時，引起全球開發(fā)者熱情體驗。

有開發(fā)者認為該模型“是完全沒有預(yù)料到的瘋狂的躍進”、“今年開源領(lǐng)域最重大的突破”、“讓中國在開源大模型和AI推理上占據(jù)先機”。

不過通義團隊也表示，雖然QwQ展現(xiàn)了強大的分析能力，但其仍是個供研究的實驗型模型，存在不同語言的混合使用、偶有不恰當(dāng)偏見、對專業(yè)領(lǐng)域問題不了解等局限，未來隨著研究深入模型迭代，這些問題將逐步得到解決。

官方訂閱.jpg

版權(quán)聲明：本站內(nèi)容除特別聲明的原創(chuàng)文章之外，轉(zhuǎn)載內(nèi)容只為傳遞更多信息，并不代表本網(wǎng)站贊同其觀點。轉(zhuǎn)載的所有的文章、圖片、音/視頻文件等資料的版權(quán)歸版權(quán)所有權(quán)人所有。本站采用的非本站原創(chuàng)文章及圖片等內(nèi)容無法一一聯(lián)系確認版權(quán)者。如涉及作品內(nèi)容、版權(quán)和其它問題，請及時通過電子郵件或電話通知我們，以便迅速采取適當(dāng)措施，避免給雙方造成不必要的經(jīng)濟損失。聯(lián)系電話：010-82306118；郵箱：aet@chinaaet.com。

阿里云开源首个AI推理模型QwQ

日期： 2024-11-29

來源：IT之家

相關(guān)內(nèi)容