我們希望在 GPT-5 發佈時看到的一些新功能

OpenAI 的 GPT-4 是目前市面上最好的生成式 AI 模型,但這並不代表我們不能展望未來。 OpenAI 執行長 Sam Altman 經常暗示 GPT-5 即將問世,看來我們很快就會看到一個全新、升級、更先進的 AI 模型。

至少,我們希望如此。 GPT-5 目前還沒有具體的發布日期,我們自認為了解的資訊大多來自於拼湊其他信息,並試圖將各個線索串聯起來。查看 開始使用 Claude 3 而不是 ChatGPT 的原因.

然而,無論交付日期為何,我們都希望在 GPT-5 發佈時看到一些關鍵功能。

OpenAI 的 GPT-5 是什麼?

GPT-5 是 OpenAI GPT-4 AI 模型的預期繼任者,後者被廣泛預期將成為市場上最強大的生成模型。雖然目前尚未確定 GPT-5 的正式發布日期,但有跡象表明它最早可能在 2024 年夏季發布。目前關於該模型的細節知之甚少,但有幾點可以肯定。可以肯定的是:

  1. OpenAI 已向商標局申請該名稱的商標 專利和商標 在美國。
  2. 幾位 OpenAI 主管已經討論或暗示了該模型的潛在能力。
  3. OpenAI 執行長 Sam Altman 在接受採訪時多次提到該模型 YouTube 2024 年 3 月與 Lex Friedman 一起。

所有這些都指向一個令人興奮的事實:GPT-5 即將到來!然而,目前很多都只是猜測。但我們希望看到一些特性,並且對此模型充滿信心。以下是其中一些:

1.支援更多多媒體

GPT 系列 AI 模型最令人興奮的改進之一是多模態性。確切地說,多模態性是指 AI 模型不僅能夠處理文字輸入,還能處理其他類型的輸入,例如影像、音訊和視訊。多模態性將成為未來 GPT 模型的重要基準。

鑑於 GPT-4 已經能夠熟練處理影像輸入和輸出,OpenAI 的下一個重點是音訊和視訊處理的改進,而 GPT-5 是一個很好的起點。谷歌已經憑藉其模型在這類多媒體領域取得了重大進展 雙子座人工智慧 這是它自己的。 OpenAI 不回應才怪。不過,當然,不要輕信我們的話。在它的播客中 解除我的困惑 [PDF 版本] 比爾蓋茲問 OpenAI 執行長薩姆奧特曼,他預計 GPT 在未來兩年內會實現哪些重大里程碑。他的第一個答案是?視訊處理。

因此,對於 GPT-5,我們期望能夠處理影片——上傳影片作為提示、即時創建影片、使用文字提示編輯影片、從影片中提取片段以及從大型影片檔案中尋找特定場景。我們希望能夠對音訊檔案執行類似的操作。這確實是一個很大的要求。但考慮到人工智慧的快速發展,這是一個非常合理的期望。

2. 更大、更有效率的上下文窗口

儘管 GPT 系列 AI 模型是市面上最先進的 AI 模型之一,但它的上下文視窗卻是最小的一個。例如,Anthropic 的 Claude 3 的上下文視窗只有 200.000 萬個 token,而Google的 Gemini 則能處理驚人的 1.000.000 萬個 token(標準使用情況下為 128.000 萬個)。相較之下,GPT-4 的上下文視窗相對較小,只有 128.000 萬個 token,在 ChatGPT 等介面中實際可用的 token 大約只有 32.000 萬個甚至更少。

隨著高級多媒體技術的出現,上下文視窗的改進幾乎是不可避免的。或許增加兩倍或四倍就足夠了,但我們希望看到十倍左右的提升。這將使 GPT-5 能夠更有效率地處理更多資訊。然而,更大的上下文視窗並不總是意味著更好。因此,我們更希望看到上下文處理的效率提升,而不是簡單地增加上下文視窗。

如你所見,一個模型可能擁有 1.000.000 個詞條(約 700.000 個單字)的上下文窗口,但當被要求總結一本 500.000 字的書時,它卻無法產生全面的摘要,因為它無法充分處理整個上下文,儘管理論上它有能力做到這一點。僅僅因為你能讀完一本 500.000 萬字的書,並不代表你能記住裡面的所有內容,或能夠很好地處理它。查看 為什麼 Gemini 1.5 的百萬代幣上下文視窗會改變遊戲規則.

3. GPT代理

GPT-5 發布最令人興奮的前景之一可能是 GPT 代理商的首次亮相。雖然「遊戲規則改變者」這個詞在人工智慧領域可能被過度使用,但 GPT 代理的加入將真正改變遊戲規則。但這種潛在的改變究竟有多重要呢?

目前,像 GPT-4 這樣的 AI 模型可以幫你完成一項任務。它們可以幫你寫電子郵件、講笑話、解數學題,或是為你寫部落格文章。然而,它們只能執行特定的任務,無法完成你工作所需的一系列相關任務。

假設你是一名 Web 開發者。你的工作職責包括設計、編碼、故障排除等等。目前,你一次只能將部分任務委託給 AI 模型。或許你可以讓 GPT-4 模型寫程式設定主頁,然後讓它寫聯絡頁面、「關於」頁面等等。你需要反覆完成這些任務。而且,有些任務是模型無法完成的。

這種觸發 AI 模型執行特定子任務的迭代過程既耗時又低效。在這種情況下,您(Web 開發者)需要充當人工代理,負責協調和觸發 AI 模型,一次執行一個任務,直到它們完成所有相關任務。

GPT 代理人承諾打造由 GPT-5 協調的專用機器人,能夠自我引導並自主處理複雜任務的所有子集。重點在於「自我激勵」和「自主性」。

因此,如果 GPT-5 配備了 GPT 代理,你可以讓它“為 Maxwell Timothy 的作品集建立網站”,而不僅僅是“編寫主頁程式碼”。然後,理論上,GPT-5 可以自行發起提示,呼叫專業的 AI 代理來處理建立網站所需的各種子任務。它可能會調用一個 GPT 來瀏覽網頁查找關於 Maxwell Timothy 的信息,調用另一個 GPT 來編寫各種頁面代碼,調用另一個 GPT 來創建和優化圖像,甚至調用另一個 AI 代理來發佈網站——所有這些都無需通過提示反復進行人工幹預。查看 如果沒有 GPT-4,是否值得使用 Auto-GPT?

4. 幻覺減少

儘管 OpenAI 在解決其 AI 模型中的幻覺問題方面取得了重大進展,但 GPT-5 的真正考驗在於它能否解決幻覺這一長期存在的問題。幻覺問題因其高風險而阻礙了 AI 的廣泛應用,尤其是在醫療、航空和網路安全等安全關鍵領域。這些領域原本可以從 AI 的廣泛應用中受益匪淺,但目前尚未實現大規模應用。

為了清晰起見,本文中的幻覺指的是人工智慧模型產生並呈現看似合理但實際上完全是虛構的訊息,且可信度極高。查看 防止人工智慧模型出現幻覺的方法.

想像一下這樣一個場景:GPT-4 被整合到診斷系統中,用於分析患者的症狀和醫療報告。幻覺可能會導致 AI 根據想像的事實和錯誤的邏輯,自信地做出錯誤的診斷,或推薦潛在的危險治療方案。這種錯誤在醫療領域造成的後果可能是災難性的。

類似的保留意見也適用於其他至關重要的領域,例如航空、核能、海軍作戰和網路安全。我們不指望 GPT-5 能夠徹底解決幻覺問題,但我們確實希望它能顯著降低此類事件發生的可能性。

在我們熱切期盼這款期待已久的 AI 模型正式發布之際,有一件事是肯定的:GPT-5 有潛力重新定義 AI 的邊界,開啟人機協作與創新的新時代。現在就可以體驗一下。 適用於任何人工智慧模型的最佳智慧索賠產生器.

轉到頂部按鈕