操欧美大逼-操榴视频-操操网址-不卡一区二区在线观看-亚洲人成在线中文字幕-亚洲人成在线免费观看

首頁 > 汽車技巧 > 汽車技巧 > 復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍

復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍

發布時間:2024-09-16 16:25:38來源: 13041198719

平安證券近日發布AI動態跟蹤系列(三):復雜推理大模型OpenAI o1亮相,數學與代碼能力飛躍。

以下為研究報告摘要:

9月13日,OpenAI正式發布并上線o1系列模型o1-preview和o1-mini。

平安觀點:

OpenAI計數器重置回1,o1系列開啟復雜推理序幕。本次OpenAI發布的是o1-preview(預覽版)和o1-mini(擅長STEM、更快、更便宜)兩個版本,ChatGPT付費用戶和API用戶可以使用。根據OpenAI官網介紹,o1系列被定位為用于解決難題的推理模型。對于復雜的推理任務來說,OpenAI認為o1是一個重大進步,代表了AI能力的新水平,鑒于此,OpenAI將計數器重置回1并將此系列模型命名為OpenAI o1。OpenAI研究發現,隨著強化學習(訓練時計算)和思考時間(測試時計算)的增加,o1的性能會不斷提高。因此在體驗上,與此前模型不同點在于,OpenAIo1在作出反應之前,需要像人類一樣,花更多時間思考問題。

o1基準表現明顯優于GPT-4o,數學與編碼能力實現飛躍。OpenAI實驗結果表明,在絕大多數推理任務中,o1的表現明顯優于GPT-4o。尤其是在具有挑戰性的推理基準上,o1實現了能力飛躍,1)數學能力:在美國數學奧林匹克(AIME2024)預選賽題目中,GPT-4o平均只能解決12%的問題,o1正式版達到平均74%的準確率,在使用學習評分函數重新排名1000個樣本后準確率達到93%,相當于美國排名前500的學生水平。2)編碼能力:在競爭性編程問題(Codeforces)比賽中,o1-preview、o1分別超越了62%、89%的人類競爭者,而對比GPT-4o僅超過11%。3)特定專業領域能力:GPQA diamond測試(專門用于評估模型在化學、物理和生物學等領域的專業知識水平)中,o1不僅成功完成了測試,更是超越了人類專家的表現,成為首個在GPQA diamond基準上擊敗人類專家的AI模型。

o1引入思維鏈優化邏輯推理,助力模型性能與安全提升。o1優越能力的背后,核心突破在于運用思維鏈(chain of thought)方法來處理復雜任務,OpenAI介紹到,類似于人類在回答困難問題之前可能會思考很長時間,o1在嘗試解決問題時會使用思維鏈。通過強化學習,o1學會打磨其思維鏈并改進它所使用的策略。o1學會了識別和糾正錯誤,學會了將棘手的步驟分解為更簡單的步驟,學會了在當前方法不起作用時嘗試不同的方法,此過程顯著提高了模型的推理能力。在OpenAI的一個官方演示中展示了o1-preview解答復雜問題的邏輯推理過程,o1-preview在過程中逐步顯示思考、翻譯問題、定義變量、理解問題、構建方程、解方程等與人類推理相似的步驟,最終輸出結論。同時,OpenAI認為思維鏈推理也為大模型安全性的提升提供了新思路,o1-preview在關鍵越獄評估和用于評估模型安全拒絕邊界的最嚴格內部基準上取得了顯著的改進。

投資建議:OpenAI推出專攻難題的o1系列大模型,應對復雜推理任務,o1引入思維鏈(Chain of Thought)提升邏輯推理能力,絕大多數基準表現不僅明顯超越GPT-4o,而且在數學與編碼能力上實現了重要飛躍,在理化生等專業領域的知識水平也達到新高度。OpenAI的動向始終引領全球大模型的發展,我們認為o1的正式亮相有望開啟復雜推理大模型的序幕,一方面對算力提出了更大需求,同時也將賦能下游AI應用(如編程、教育)的快速迭代。我們堅定看好AI主題的投資機會:1)算力方面,推薦工業富聯、浪潮信息、中科曙光、紫光股份、神州數碼、海光信息、龍芯中科,建議關注寒武紀、景嘉微、軟通動力;2)算法方面,推薦科大訊飛;3)應用場景方面,強烈推薦中科創達、恒生電子、盛視科技,推薦金山辦公,建議關注萬興科技、福昕軟件、同花順、彩訊股份;4)網絡安全方面,強烈推薦啟明星辰。

汽車技巧更多>>

Gartner預測:2025年電動汽車出貨量將增長 17% 奇瑞風云A9即將盲訂:超5米混動四驅中大型車 加拿大電動汽車退稅計劃提前終止,資金耗盡促車企自補 騰勢Z9GT第1萬輛正式交付:最快交付破萬的新能源豪華轎車 委員談AI+教育,“不怕學生用得多,怕他們不會用” 運動與生活早已密不可分,他是身體力行的“體育人” 春運開啟,昆明長水機場應對即將到來的出入境客流高峰 深圳二手房交易量重新站上6萬套關口,樓市新政后連現5個“日光盤” 點燃數字引擎,加大場景創新,蘇州工行打造數字人民幣生態體系新篇章 他從上海到西藏定日,希望一點點平息孩子們心中的“余震” 比亞迪唐L插混版的全新升級,如何重新定義家用SUV? 小米YU7純電SUV來襲,3040萬價位能否引領新潮流? 堅守駕駛樂趣 進階數字智能 寶馬集團以堅實市場表現邁向新世代 阿斯頓·馬丁Vantage Roadster來襲,6.8秒敞篷開合,性能與顏值并存! 換裝新發動機并增加ABS,新大洲本田NS125LA升級 多項功能升級 長安啟源E07迎1.1版本OTA升級 比亞迪夏入局MPV,GL8、塞納、夢想家等曾經的優勢車型該如何應對 敞篷開/關只要6.8s?兄弟們先看看!沒準今年就開上了! 2025年溫州市財稅會計學校招聘公告 2025年杭州市第三人民醫院招聘工作人員公告 2025年江蘇鑫財國有資產運營有限公司招聘工作人員公告 2025年辰溪縣潭灣鎮潭灣社區關于招聘城鎮公益性崗位的公告(1人) 2025年玉林市福綿區農業機械化服務中心招聘見習生的公告(2人) 2025年貴港市覃塘區財政信息中心就業見習人員招募公告(2人) 2025年東莞市樟木頭實業控股集團有限公司招聘工程師的公告(1人) 2025年湛江市坡頭區社會保險基金管理局面向社會招聘編外工作人員公告(1人) 16年前“未完待續”的話劇《鹿鼎記》,有了全新版本 踏上幸福回家路!2025年春運今日開啟 時間淘洗經典,湖南文藝出版社“原創之春”走過二十周年 東南亞旅游降溫:游客“虧錢”退訂泰國旅游產品,春節期間上海往返曼谷機票降價近四成
主站蜘蛛池模板: 国产亚洲精品成人久久网站 | 久久精品国产99国产精品免费看 | 2022国产成人精彩在线视频 | 欧美精品黑人 | 亚洲综合中文 | 在线观看视频高清视频 | 中文福利视频 | 国产一级毛片夜一级毛片 | 射在线 | 高清视频在线免费 | 色偷偷97| 国产91区 | 最新国产一区二区精品久久 | 免费毛片在线 | 日本国产最新一区二区三区 | 第一福利精品老司机导航 | 91视频麻豆 | 伊人久久大香线蕉综合高清 | 国产精品视频一区二区三区w | 日本高清www视频在线观看 | 亚洲免费福利视频 | 五月婷婷在线免费观看 | 欧美成人aaa大片 | 免费人成黄页网站在线观看国产 | 亚洲区精品久久一区二区三区 | 亚洲国产综合网 | 亚洲视频免费一区 | 美腿丝袜亚洲综合 | 天天干网 | 孕交videosgratis孕妇视频 | 亚洲黄色小说图片 | 波多野结衣高清在线播放 | 一区二区三区免费视频 www | 国产精品5| 亚洲欧美高清在线 | 最新国产精品视频免费看 | 91秦先生在线播放 | 4huh34四虎最新久 | 欧美在线视频一区二区 | 国产精品久久久久久久久久久久久久 | 爱福利广场 |