
▲模型訓練人員以 AI 建立資料衍生品質問題。(圖/示意圖/達志影像)
記者吳立言/綜合報導
AI 公司近年積極投入大量人力建立訓練資料,希望提升聊天機器人的能力,但如今卻出現意想不到的問題。有外包工作者坦言,自己會直接利用 AI 生成工作內容,再經過簡單修改後交件,形成 AI 訓練 AI 的情況,也讓資料品質再度引發討論。
原始資料愈來愈少 企業轉向人工建立資料
根據《New Scientist》報導,隨著可用於訓練大型語言模型(LLM)的原始資料逐漸減少,科技公司開始聘請大量外包人員,協助產生新的訓練資料,包括撰寫特定情境、建立對話內容,甚至拍攝執行日常工作的影片,作為 AI 學習素材。然而,多名受訪外包人員透露,使用 AI 工具協助完成工作已相當普遍,即使多數公司明文禁止,也很難完全杜絕。
外包人員:幾乎每家公司都有類似情況
一名化名為 Alice 的 AI 外包工作者表示,每一家合作過的公司都有禁止使用 AI 的規定,也會設法檢查,但實際上仍有不少人使用 AI 完成工作。她指出,只要將 ChatGPT 等工具生成的內容稍作修改,去除常見的 AI 語句特徵,就不容易被辨識。
另一名受訪者則表示,自己最初使用 AI,是因為擔心工作出錯而失去收入來源,後來逐漸演變成工作流程的一部分,例如先利用一套大型語言模型建立情境,再使用另一套模型產生相關文件,以提升效率。
專家憂 AI 內容反覆訓練 恐降低模型品質
近年已有多項研究警告,如果 AI 模型持續以 AI 生成內容作為主要訓練資料,可能造成所謂的「模型崩潰(Model Collapse)」現象,使模型逐漸失去多樣性、錯誤資訊增加,最終影響回答品質與可靠性。
當越來越多真人工作開始依賴 AI 完成,而這些內容又回流成為下一代 AI 的訓練資料,將使資料品質控管變得更加困難,也可能成為未來 AI 發展的重要挑戰。
