人工智慧搜尋引擎:它們值得你花時間嗎? (ChatGPT、Perplexity、Gemini)

研究表明,您最喜歡的聊天機器人在搜尋中表現不佳。

我們都知道,如今的人工智慧工具功能強大。但是這些工具在網路搜尋方面表現如何呢?

這是一個重要的問題,而且意義重大。根據 Future(TechRadar 出版商)的研究,近三分之一的美國受訪者表示,他們現在使用人工智慧取代谷歌等傳統搜尋引擎。

有些人會使用 ChatGPT 和其他聊天機器人。另一些人則使用專為研究和調查而設計的人工智慧工具,例如 Perplexity。即使我們沒有主動選擇人工智慧工具,人工智慧也會出現在我們的搜尋中,就像現在出現在搜尋結果頂部的谷歌小摘要一樣。

簡而言之,人工智慧搜尋無所不在。但真正的問題依然存在:它真的好用嗎?這正是研究者開始質疑的,而且,初步評價並不令人印象深刻。

人工智慧技術,一位商人展示了連接到 ChatGPT 的全球網路虛擬圖。與人工智慧聊天。

ChatGPT 會成為新的 Google 嗎?先別急著下結論…

人們可能會使用人工智慧工具進行研究,但這並不意味著他們應該這樣做。

在我們最近的測試中,我們將四個最好的人工智慧聊天機器人相互比較,以了解它們處理搜尋的能力:OpenAI 的 ChatGPT、Google的 Gemini、Anthropic 的 Claude 和 Perplexity AI。

結果……好壞參半。還不算徹底失敗——他們都檢索到了一些相關資訊——但準確率不高。至於他們總結資訊的方式呢?常讓人困惑,或者根本沒用。

這些結果支持由 Tow 數位新聞中心進行的更全面的測試,正如 哥倫比亞新聞評論他們的團隊測試了八種主要的人工智慧模型——包括 ChatGPT、Perplexity、Copilot、Grok 和 Gemini——並發現了反覆出現的問題:「自信地呈現不正確的資訊、對共享內容的歸因具有誤導性以及資訊檢索實踐不一致。」哦,我的天哪。

總體而言,AI 模型對超過 60% 的查詢給出了錯誤答案。 Perplexity 的準確率最高(這與其作為研究工具的宣傳一致),但錯誤率仍高達 37%。 Grok 的表現最差,錯誤率高達 94%。無可奉告。

道中心對結果進行了評估,範圍從完全正確到完全錯誤(或根本沒有答案)。一些最糟糕的例子是明顯的幻覺,AI 只是…編造了一些內容。但即使答案並非完全錯誤,這些工具在重新填充新聞和搜尋結果方面仍然存在重大問題。

沒有來源的研究根本不是研究。

根本問題在於以這種方式重新建構資訊。即使人工智慧技術不提供虛假訊息,它們仍然會以無益且常常具有誤導性的方式總結和重塑內容。正如托爾中心所解釋的:

“雖然傳統搜尋引擎通常充當中間人,將用戶引導至新聞網站和高品質內容,但生成搜尋工具會自行分析和重新包裝信息,從而切斷流向原始來源的流量。”

這些機器人的聊天輸出常常掩蓋與資訊品質相關的嚴重潛在問題。我們迫切需要評估這些系統如何存取、呈現和引用新聞內容。

最明顯的問題之一是AI工具引用來源的糟糕表現。例如,ChatGPT經常連結到錯誤的文章,將使用者引導至網站主頁,或乾脆跳過引用。

這個問題主要有兩個原因。首先,即使內容被使用,出版商也會失去流量。

其次,事實查核變得困難。驗證人工智慧結果的唯一方法之一是參考原始來源——如果沒有提供,驗證將更加困難。

那麼,如果人工智慧為你提供信息,但沒有明確的來源,它真的值得用來做研究嗎——尤其是如果你最終還是要通過谷歌來查所有信息的話?可能不值得。

是的,人工智慧工具一直在不斷改進。有些工具,例如Perplexity,確實比其他工具表現更好。但即使是最好的工具,仍然需要人工監督。目前,在研究方面,機器人還沒有準備好自主操作。

轉到頂部按鈕