很多企業導入生成式 AI 的起手式,通常是發個帳號、辦一場提示詞工作坊,接著交代同仁「有空多試試看」。幾個月過去,主管開始追問:所以大家到底省下多少時間?產出有沒有變好?還是同仁只是變得更擅長叫 AI 代筆寫信和整理會議紀錄?

2026 年發表於《Organization Science》的一項寶潔(P&G)研究,提供了一個相當珍貴的企業現場實證。這篇題為〈The Cybernetic Teammate〉的研究,核心探討非常務實:AI 能不能承擔原本由人類隊友負責的功能?包括拉高成果品質、補足跨領域專業,以及提升同仁在工作過程中的投入程度 (PubsOnline)。

研究團隊找來 791 名寶潔內部的研發與商務同仁,讓大家花上一整天,實際解決各事業單位現存的產品創新難題。任務涵蓋新產品開發、包裝設計、行銷溝通與通路執行等面向,並將人員隨機分配至四種工作模式:

  1. 單兵作戰,不使用 AI
  2. 研發搭配商務的跨部門雙人組,不使用 AI
  3. 單兵作戰,搭配 AI
  4. 研發搭配商務的跨部門雙人組,搭配 AI

雙人組固定由一位研發人員與一位商務人員搭檔。AI 系統架設在 Microsoft Azure 上,主要串接 GPT-4,部分組別使用 GPT-4o;有配置 AI 的同仁在事前接受了一小時訓練。最終成果由不知情分組與作者背景的專家進行盲評,每份提案平均經過三次以上的獨立評分,指標包含整體品質、新穎性、可行性、影響力與商業潛力。

這項實驗設計的價值,在於它並非找學生寫課堂模擬報告,也不是單純發問卷問員工「覺得 AI 好不好用」。參與者處理的是公司內部正在發生的真實挑戰,評選出的優秀提案甚至有機會直接進入寶潔後續的創新孵化流程。

發現一:一人加 AI,平均成果能追平傳統雙人團隊

如果以「完全不碰 AI 的單兵作業」為基準,傳統跨部門雙人組的產出品質提升了約 6.3%;單人搭配 AI 則提升了約 9.6%;若是跨部門雙人組再配上 AI,提升幅度來到 10.2%。

從平均表現來看,單人搭配 AI 的產出水準,已經相當於未配置 AI 的雙人團隊。換句話說,在範疇明確、時間有限且偏向前置發想的知識工作中,AI 確實能頂替一部分原本需要人類隊友才能提供的腦力支援。

但是,主管千萬別急著得出「以後一人配 AI 就可以精簡人力」的結論。

因為看平均值與看頂尖成果,會得出截然不同的答案。

當研究團隊聚焦在所有提案中排名前 10% 的頂尖成果時,表現最搶眼的組合依然是「雙人團隊加上 AI」。未配置 AI 的個人組,擠進前 10% 的比例約為 5.8%;雙人團隊加 AI 則接近 15%,機率直接翻了將近三倍。個人搭配 AI 雖然拉高了平均品質,但在擠進前 10% 頂尖成果的機率上,並未達到統計顯著差異。

這給經理人的訊號相當明確:

若要追求快速交付與穩定的基準品質,一位承辦人搭配 AI 是相當高效率的編制。然而,若要攻堅突破性的新產品、關鍵策略決策或追求前 10% 的創新亮點,維持跨專業的人類協作再導入 AI,依然是無可取代的做法。

平均效率與頂尖突破,本來就是兩種不同的管理課題,不能混在同一張「節省工時人力」的試算表裡一概而論。

發現二:AI 能扮演暫時的跨部門轉譯橋樑

在沒有 AI 協助時,研發人員的提案自然偏重技術規格,商務人員則傾向鎖定市場與營收。這是人之常情,大家往往習慣從自己擅長的專業出發。

一旦加入 AI,兩派人馬的切入角度開始往中間靠攏。商務人員能提出更多技術可行性考量,研發人員也學會納入商業模式思維。甚至對產品開發流程較生疏的新進同仁,搭配 AI 後,也能交出接近資深團隊的提案表現。

這對部門分工嚴謹的企業尤其具有參考價值。跨部門會議最大的障礙,往往不是大家缺乏想法,而是彼此都在講各自部門的「黑話」。AI 可以在初期提供另一個專業的視角,協助同仁看見自己原先容易忽略的盲點。

不過,AI 提供的大多屬於「當下即用型的跨域視角」。這並不表示商務同仁已經變成工程專家,也不代表研發工程師就此精通通路運作。研究並未證明同仁因此培養出長期且可轉移的跨領域硬實力。

因此,AI 能夠幫忙跨越部門溝通門檻,但最終的專業決策與落實責任,仍必須由真正懂行的人來把關。

發現三:AI 擅長產出好點子,卻常讓團隊挑錯重點

這是整篇研究中最值得經理人深思的洞察。

實驗要求參與者先發想出五個提案構想,再從中挑選最看好的一個深入發展。數據顯示,有 AI 輔助的組別,最初提出的五個構想在平均品質上明顯較高。AI 帶來的效益不是單純把字數灌水或修飾詞彙,而是端出來的初始原料品質確實更好。

然而,當進展到「挑選最佳方案」的關鍵環節時,沒有 AI 輔助的人類團隊表現反而最好。他們挑中五個構想中最佳解的機率約為 50%;反觀使用 AI 的組別,挑中最佳解的機率只有 37% 左右。

究其原因,大型語言模型天生具備「順從與討好」的傾向。AI 通常很樂意沿著你的想法往下鋪陳,極少像資深同事那樣直接潑冷水:「這個前提本身就站不住腳,我們要不要退回第一步重想?」

同仁在跟 AI 對話時往往覺得互動極佳、思路順暢,構想也越寫越像一回事;但眼前這份提案是不是五個方案中最值得投入資源的選項,依然需要獨立客觀的批判思考。

這意味著企業不該讓同一位同仁、在同一個 AI 對話視窗中,一路從構想發想包辦到最終決策。更穩當的工作流程設計,應該將任務拆分為兩個階段:

第一階段善用 AI 擴充選項、補足視角、發展多組可行架構。第二階段則回歸預先設定的評選標準,交由未參與生成過程的第三方進行獨立審核,必要時引入反方辯證、盲評機制或第二套 AI 進行交叉檢驗。

AI 適合用來提升原料品質,但能不能挑對方向,終究考驗著人類的判斷力、質疑精神與承擔風險的肩膀。

發現四:工作過程少一點挫折,不見得全是好事

使用 AI 的同仁在自我評估中,普遍表達出更多的興奮感、活力與投入度,焦慮和挫折感也大幅降低。單人搭配 AI 所獲得的正向情緒回饋,甚至超越了未配置 AI 的雙人團隊。

對剛推動導入的企業而言,這當然是個好現象。同仁如果覺得 AI 有問必答、態度友善,不會嫌問題太淺顯,自然更願意持續探索工具。

但研究團隊也提醒,團隊協作中的摩擦與負面情緒並非毫無價值。適度的不同觀點、質疑與觀念拉扯,往往是深度檢視盲點的重要防線。AI 雖然讓工作流程變得更順暢舒適,卻也可能悄悄磨掉了那些必不可少的批判性挑戰。

主管不能只將員工「喜不喜歡用 AI」當成唯一的驗收指標。良好的使用體驗固然重要,但實質的決策品質仍需要另外建立驗證機制。

給經理人的四項實戰建議

一、 依據目標成果區分任務編組
例行性分析、初稿撰寫、資料彙整與標準提案,適合由單一負責人搭配 AI 快速交付;面對重大投資、新事業探索與高度不確定的決策議題,仍應維持跨領域團隊協作,再輔以 AI 強化產出。

二、 明確切分「發想擴張」與「決策篩選」
讓 AI 在前期發想階段全力輸出;但進入評選階段時,必須交由具備獨立判斷力的負責人進行查核與辯證,建立清楚的當責機制。

三、 結合真實業務情境培訓,拒絕提示詞背誦
研究中的受試者雖然接受了一小時的提示詞訓練,但僅有 38% 的同仁在實戰中採用了建議模板,且是否照抄模板對最終表現並沒有顯著影響。這並非代表培訓無用,而是培訓重點應該轉向問題定義、資料邊界釐清、人機協作方式、成果查核程序與責任歸屬。

四、 導入成效看實質產出,別只計算登入次數
評估 AI 效益時,建議透過盲評機制檢視導入前後的成果品質、處理時效、錯誤率、視角完整度與實際落地率。系統開啟了幾次、丟了多少指令,都不等於組織真正獲得了實質價值。

這項研究的觀察仍有其情境邊界:它來自單一大型跨國消費品企業、為期單日的工作坊,且鎖定在早期創新發想階段,使用特定版本的 GPT-4 與 GPT-4o;研究並未追蹤構想最終落地後的市場表現,臨時成軍的雙人組也無法完全等同於磨合多年的固定團隊。

但這項實證非常適合用來重新設計組織的工作流程,而非拿來當成單純的裁員計算器。

企業推動 AI 的思考重心,應該逐步從「員工有沒有開始用」,轉向「任務該如何重新編組」。

哪些流程只需一人搭配 AI 就能穩定維持 80 分的水準?哪些核心挑戰值得讓跨專業同仁搭配 AI,合力搶進前 10% 的頂尖格局?發想到了哪個關卡,必須由人接手負責篩選、否決與承擔結果?

能夠理清這三道題目的企業,才算真正把 AI 融入組織設計;否則只發帳號,本質上也不過是替同仁多買了一套個人軟體而已。