什麼是 GTBot,它的風險是什麼,為什麼網站會封鎖它?

2023 年 8 月,因開發 ChatGPT 和許多其他先進模型而備受讚譽的強大人工智慧公司 OpenAI 宣布推出 GTBot,這是一款旨在抓取網路並收集資料的網路爬蟲。

公告發布後不久,一些大型網路網站就封鎖了這款爬蟲機器人。但原因何在? OpenAI 的 GTBot 是什麼?各大網站為何懼怕它?又為何試圖屏蔽它?查看 如何創建完美的 Robots.txt 檔案以促進 SEO:它是什麼以及如何詳細使用它.

OpenAI 的 GTBot 是什麼?

GTBot 是由 OpenAI 開發的一款網路爬蟲,用於搜尋互聯網並收集信息,以開發 OpenAI 的 AI 模型。它被設計用來爬取公共網站,並將收集到的資料傳送到 OpenAI 的伺服器。 OpenAI 隨後利用這些數據來訓練和改進其 AI 模型,目標是建立日益先進且精細的 AI 系統。網路爬蟲機器人對於存取 GPT-4 及其衍生產品(例如 ChatGPT)等先進技術幾乎不可或缺。

訓練人工智慧模型需要大量數據,而收集這些數據的最有效方法之一是部署像 GTBot 這樣的工具,它可以系統地瀏覽網頁,追蹤連結以索引大量網頁,並提取與預定義模式匹配的重要數據,例如文字、圖像和元數據。

然後,這些數據可以整理並輸入到人工智慧模型中,用於訓練其自然語言處理、圖像生成或其他人工智慧任務。為了簡化流程,網路爬蟲會收集數據,以便諸如此類的工具能夠使用。 ChatGPT أو DALL-E 做你該做的事。

網路爬蟲並非新鮮事。如今,網路上可能已經有數百萬個這樣的機器人在爬取數十億個網站。它們至少從 20 世紀 90 年代初就已出現。 GTBot 就是這樣一個爬蟲機器人,由 OpenAI 擁有。那麼,圍繞著這個網路爬蟲的爭議究竟是什麼呢?

為什麼各大科技網站都封鎖了 GTBot?

根據網站 商業內幕一些大型網站正在封鎖 OpenAI 的爬蟲,以阻止存取其內容。那麼,如果 GTTBot 的最終目標是促進人工智慧的發展,那麼為什麼網路上一些大型網站(其中一些網站以某種方式從人工智慧中受益)會反對它呢?

事情是這樣的。早在2022年,隨著生成式人工智慧技術的興起,人們就人工智慧公司幾乎無限制地使用網路資料的權利展開了大量討論,其中大部分資料都受到版權的保護。目前還沒有明確的法律來規範這些公司如何收集和使用資料以謀取私利。查看 誰擁有人工智慧創作的版權?這些藝術作品的版權是如何運作的?

因此,基本上,像 GTBot 這樣的爬蟲程式會存取網路上可用的信息,以文字、圖像或其他媒體形式獲取人們的創意作品,並將其用於商業目的,而無需獲得原創者的任何許可、授權或補償。

這就是叢林法則,弱肉強食,人工智慧公司不擇手段。 Quora、CNN、《紐約時報》、Business Insider 和亞馬遜等主流網站都對它們的版權內容被這些爬蟲程式抓取感到不滿,而 OpenAI 卻可以從中牟取暴利,卻無需支付任何費用。

這就是為什麼這些網站使用「robots.txt」檔案來阻止它,這是一種已有數十年歷史的阻止網路爬蟲的方法。根據 OpenAIGTBot 會根據 robots.txt 檔案中包含的規則,遵循您的網站抓取指示或避免抓取您的網站。 robots.txt 檔案是一個小型文字文件,用於指示抓取工具如何在您的網站上執行操作。如果您擁有自己的網站,並且想要阻止 GTBot 抓取您的數據,請按以下步驟操作: 如何防止 OpenAI 的爬蟲機器人竊取你的網站內容.

網站真的可以封鎖 GTBot 嗎?

雖然像 GTBot 這樣的爬蟲對於收集訓練高階人工智慧系統所需的大量資料至關重要,但人們對版權和合理使用方面的擔憂不容忽視。

當然,有一些簡單的工具,例如 robots.txt 文件,可以用來防範這些潛在威脅,但 GTBot 是否遵守該文件中的指令完全由 OpenAI 自行決定。沒有人能保證它會遵守,也沒有立即、萬無一失的方法可以知道它是否遵守了。在阻止 GTBot 接觸受版權保護的資料的鬥爭中,OpenAI 已做好一切準備,確保資料的完整性和對版權的尊重,至少目前是如此。您可以立即查看。 如何抓取網站並提取其數據.

轉到頂部按鈕