Kirkpatrick 四層次評估怎麼做?從講師視角拆解台灣內訓的驗收現場

工作坊的最後十五分鐘,投影機還亮著,承辦人拿著一疊問卷走進教室,請大家花三分鐘填完再走。題目大同小異:講師是否清楚說明重點、時間安排是否合宜、實作練習是否有幫助、整體是否滿意。

鉛筆刷刷地劃過紙面,有人邊填邊收拾筆電。十分鐘後問卷收齊,承辦人道謝,教室的燈關掉,這場訓練在行政流程上就算完成了。

這幾年在台前,我收過非常多這樣的問卷,分數大部分都很好看,平均多半落在 4.9 上下。但每一次拿到那張漂亮的統計表,我心裡浮現的都是同一個問題:這張表證明的是他們當下很滿意,還是他們回去以後真的用得上

Kirkpatrick 四層次評估之所以到今天還被反覆引用,正是因為它早就把這件事講清楚了。麻煩的是,多數遇過的工作坊驗收流程,實際上可能只跑了第一層。

重點速答

Kirkpatrick 四層次依序是反應、學習、行為、成果。內訓現場真正做完的幾乎只有第一層的滿意度問卷,因為它最便宜、最快、也最好看。要跨到行為層不必先建龐大的追蹤系統,指定一個課後必須交付的成果任務,是成本最低而且真的做得起來的做法。

內訓驗收的現場:滿意度問卷的高分背後真正發生的事

先把我自己的資料攤開來講,這是我作為被評估的那一方才拿得到的視角。多數談 Kirkpatrick 的文章都站在評估者那一側寫,他們看到的是彙整後的報表,我看到的是那疊問卷還帶著體溫的樣子。

先看數字。一場簡報進階工作坊,在「我非常滿意此次講座的表現」這題上,選「非常同意」的佔了壓倒性的多數,其餘全部落在「同意」。另一場簡報設計工作坊的量化題目也在同一個水準。

  • 4.95講師能清楚說明重點,內容容易理解
  • 4.92課程安排時間合宜,節奏恰當
  • 4.90實作練習幫助我更理解課程內容

文字回饋同樣正面。有學員寫下這次學到了非常實用的 AI 應用方式,也有人說自己終於理解如何有系統地把文字轉成視覺,再用數位工具快速完成簡報。

這些都是真的。但我必須誠實地說:滿意度只回答了現場體驗好不好,回答不了回去以後有沒有改變。同一批問卷裡,也有學員寫下「新的嘗試和新功能,需要不斷練習」,還有人寫「Canva 剛開始很難,學會後就很好用」。這兩句指向的是第二層與第三層,而那兩層,問卷量不到。

Kirkpatrick 四層次的正式定義,以及培訓現場的現實考量

Kirkpatrick 模型由 Donald Kirkpatrick 在 1950 年代提出,後續由其子 Jim Kirkpatrick 與 Wendy Kayser Kirkpatrick 提出新版(New World Kirkpatrick Model),Donald 本人已於 2014 年過世。四個層次依序是:

  • Level 1 反應

    REACTION

    官方定義為三個面向:顧客滿意度、投入程度(engagement)與相關性(relevance),其中相關性最能預測學員回去後會不會真的用。實務上多半只做成一張課後滿意度問卷,但官方其實不主張只在結束時發問卷。

  • Level 2 學習

    LEARNING

    學員在知識、技能、態度、信心與承諾五個面向上的實際獲得。需要測驗、實作評分或前後測才量得到。

  • Level 3 行為

    BEHAVIOR

    學員回到崗位後,是否確實做出那幾個關鍵行為(critical behaviors),以及組織有沒有給出必要的驅動因子(required drivers)去撐住它:主管跟催、工作輔助表、複核機制與獎勵。官方明確說量測不能等到課後九十天才開始。

  • Level 4 成果

    RESULTS

    訓練與後續強化最終對組織核心目標造成的影響。官方強調每個組織只有一個真正的成果層,判準是問「這是不是這個組織存在的理由」。效率、品質、成本與營收在新版被歸類為領先指標,是連接訓練與最終成果的橋樑,不等於成果本身。

(作者觀察)這四層的排序與其說是難度,不如說是成本與時間跨度的排序。第一層在下課前十五分鐘就能收完,第四層可能要半年後才看得出來,而且很難排除其他變因的干擾。所以在資源有限的現實裡,大家自然全部擠在第一層

  • 常見做法

    用第一層代表全部

    課後發問卷、算平均分、歸檔結案。分數漂亮,行政流程完整,但完全沒有觸及學員回去有沒有用。

  • 該有的做法

    至少讓第三層有一個出口

    在課前就約定一項課後必須交付的成果,讓行為層有一個可被看見的落點,不必等到建立完整追蹤系統才開始。

TTQS 評核表第 17 項如何把四層次拆成 17a 至 17d

在台灣談內訓評估,繞不開 TTQS(人才發展品質管理系統)。它的評核指標採用 PDDRO 架構(計畫、設計、執行、查核、成果),而第 17 項「訓練成果評估的多元性和完整性」屬於最後一段的成果(Outcome)構面,底下細分 17a 至 17d,正是直接對應 Kirkpatrick 四層次的部分。這等於告訴所有申請單位,四層都要有交代。

實務上會發生的狀況是,17a 的佐證資料最好準備,問卷影本一交就有;17b 還能靠測驗卷或實作作品補上;17c 與 17d 則常常變成用制度文件、主管訪談紀錄或計畫書上的一段敘述來滿足形式要求。

我不認為這是誰在偷懶。問題出在內訓型態撐不起行為層的觀察條件。一次性的工作坊、外部講師來了又走,沒有人被指派去追蹤後續的實際應用狀況,也沒有人有權限去改變學員回到崗位後的工作流程。要求這樣的訓練交出行為層證據,是在要求它做超出設計範圍的事。

一句話的判準

評估做不到第三層,通常不是評估方法的問題,而是訓練的設計本來就沒有把第三層放進去。

講師視角:分數高或低,通常會是什麼原因

分數會好看,多半不是因為那天講得特別精彩,而是因為期待在開始之前就對上了。承辦單位事前說明得越清楚,當天的教材配置就越貼近真正的需求;反過來,如果進場前對學員的工具使用習慣與能力落點一無所知,同一份教材對半數人太淺、對另外半數太深,分數自然會反映出來。第一層測的是內容與期待之間的距離,這件事在開場前就決定了一大半。

但分數好看不等於所有人都學會了。AI 工具的操作要在幾個小時內真正上手,受限於設備、時間與熟悉度,本來就不可能人人做到。能補的不是課堂時間,是課後還能不能繼續往下走:留下客製化的教材與可以自己練習的講義,讓學習在課程結束之後還有接續的地方。

分數偏低的時候,原因通常也不難辨認。對數位工具本來就不熟、甚至對 AI 帶有戒心的學員,容易覺得課堂上談的東西太理想化、爭議太多。講得更直接一點,有些人真正在意的是導入這些工具之後,自己手上的工作還剩下多少。這個焦慮如果沒有在課堂上被正面接住,它不會消失,只會轉成問卷上的一個分數。AI 會取代我的工作嗎那篇之所以堅持把「被換掉的是任務不是職業」講得很具體,就是因為這個焦慮在現場是真的存在。

多數內訓停在第一層:制度誘因才是真正的卡點

如果評估方法的架構早在 1950 年代就大致成形,為什麼七十多年後大家還是停在第一層?我的答案是:這不是知識問題,是誘因問題。這個觀察跟我在企業導入 AI 工具時遇到的狀況幾乎完全一樣,多數企業早就買了 AI 工具的企業版,真正在用的卻仍是最基本的功能。表面上看起來是不熟悉,往下挖就會發現是誘因結構出了問題。

站在員工的角度,這個計算其實很清楚。

員工心裡的那道算式

用 5 天做完 5 天的工作,跟用 2 天做完 5 天的工作,對個人的回報沒有差別,後者甚至還要多接省下來那 3 天被塞進來的新任務。

當組織沒有把效率提升轉換成對個人有意義的回報,主動實作就不會發生。訓練成效卡住的地方往往不在教室裡,而在教室外。同樣的邏輯放回評估:承辦人只做第一層,是因為第一層的分數可以結案、可以呈報,而做到第三層需要跨部門協調、需要主管配合觀察、需要過一段時間後還有人記得這件事,這些成本全部落在承辦人身上,回報卻不一定屬於他。

這也是為什麼在企業現場,SOP 往往比工具教學更關鍵:把哪些流程該用 AI、怎麼用寫成規則,同時讓擔心資料能不能上傳的同仁清楚知道界線在哪。這件事跟工具怎麼操作是兩回事,但它決定了學完之後有沒有辦法用。想先盤點自己公司該從哪些工具開始的人,可以看 知識工作者的 AI 工具地圖;牽涉到對外產出的合規標示,則可以參考 AI 生成內容的著作權與標示規範

一條鏈子中間斷了一環,旁邊是空椅子與闔上的筆電
卡住的往往不在教室裡,而在教室外那一段。

行為層的最小可行做法:指標任務 vs 追蹤表單

這一節我要講一件很多講師不會講的事:我目前沒有在做課後行動計畫,而且我認為以現在的服務型態來說,這是合理的判斷。我承接的多半是最長 3 到 5 天的工作坊,而不是為期半年的常態性訓練。要做到真正有效的課後行動計畫,前提是必須先有良好的追蹤機制,否則交出去的行動計畫表只會變成另一份沒有人回收的紙本。在沒有長期陪跑的架構下,硬做追蹤是為了交差,不是為了成效

不過,如果組織確實需要把驗收往行為層推,成本未必要一路墊高。多數行為層做不起來,不是因為承辦人不懂方法,而是因為標準做法要跨部門協調、要主管持續配合觀察、還要有人在三十天後記得回來收表,這些成本都落在同一個人身上。與其追蹤過程,不如驗收一次交付:指定一項必須完成的成果任務,取代自評追蹤表。例如運用課程所學實際完成一份新的提案簡報、報名一場競賽,或交付一個具體的專案成品。

  • 課前就把任務講清楚

    STEP 01

    在課程開始前,與承辦單位一起確認課後要交付什麼。學員知道這件事會被驗收,聽課的方式就會不一樣。

  • 任務要落在真實工作上

    STEP 02

    交付物必須是本來就要做的東西,例如下一季的提案簡報。額外出一份練習題,只會變成另一件負擔。

  • 設一個明確的交付時點

    STEP 03

    給一個具體日期,不要用「有空再交」。時點明確,承辦人才有依據可以追,也才不必每週提醒。

  • 用成品本身當作證據

    STEP 04

    交出來的東西就是行為層的佐證,不需要再補一份自評表。這也讓 TTQS 的佐證資料變得有實質內容。

這套做法的價值在於,它把行為層的驗收成本從「持續追蹤」壓縮成「一次交付」。有一位學員在回饋裡寫下,未來製作簡報或規劃計畫表時可以運用這些工具,選對工具就能事半功倍;另一位則寫得更準確,說工具像 ChatGPT、Gamma、Canva 都很好用,但最重要的還是懂得如何使用工具,以及自己的想法與思考能力。這兩句話已經指出行為層真正該驗收的東西

桌面上一份問卷與一份完成的提案簡報並列,象徵滿意度評估與行為層成果的差異
滿意度問卷驗收的是當下的感受,交付出來的成品才驗收得到行為的改變。

六個帶得走的重點

六個帶得走的重點

  • 四層次是成本排序不是難度排序:反應、學習、行為、成果,越往下時間跨度越長、干擾變因越多,所以大家自然停在最便宜的第一層。
  • 滿意度高不等於會用:問卷分數證明的是課程設計得夠清楚好跟,它是必要條件而不是充分條件,回到崗位有沒有改變是另一件事。
  • TTQS 第 17 項把四層次寫進了評核:17a 至 17d 分別對應反應、學習、行為、成果,但行為與成果兩層常常只能用制度文件交代。
  • 做不到第三層通常不是評估方法的問題:一次性的工作坊型態本來就沒有把行為層的觀察條件設計進去,硬要交證據是在超出設計範圍。
  • 卡住的是誘因不是知識:當驗收成本由承辦人獨力承擔、好處由組織分享,驗收就會退回最便宜的那一層,這跟員工不願意主動用 AI 提效是同一種結構。
  • 指標任務是行為層最低成本的入口:指定課後交付一份新提案、一場競賽或一個專案成品,比發追蹤表單實際,成品本身就是佐證。

關於作者

  • 525+場企業與組織培訓
  • 19,500+位學員
  • 150+家教育培訓場域
廖文碩 Kevin

廖文碩 Kevin

簡報培訓講師・網站顧問

廖文碩(Kevin),簡報培訓講師與網站顧問,專注把生成式 AI 接進真正的工作流程,而不是停在工具嘗鮮。教學與顧問範圍涵蓋簡報技巧培訓、網站架設顧問、套裝網站方案與生成式 AI 整合,並經營簡報教學社群 PPT.note 簡報仙貝。長年在企業與校園授課,把判斷標準與工作流程講到學員回去就能自己跑一次。

專業領域

簡報技巧培訓、網站架設顧問、生成式 AI 整合應用

授課時數

累積 1,550 小時以上

延伸閱讀

重點整理

最後回到趨勢。AI 讓一個人可以在極短的時間內,用視覺化的方式做出過去需要一整個團隊才做得出來的成果,這是我這幾年在教室裡看到最大的變化。但也正因為產出變得這麼快、這麼漂亮,驗收如果還停在「大家覺得這堂課好不好」,就會越來越測不出真正的差距。

真正拉開距離的,不是誰把工具操作得比較熟,而是誰在用完工具之後還保有自己的判斷與思考。這件事問卷問不出來,只有讓學員真的交出一份東西,才看得見。

Kirkpatrick 四層次評估到底是哪四層?

依序是 Level 1 反應、Level 2 學習、Level 3 行為、Level 4 成果。反應指學員對訓練的參與度與滿意度,通常用課後問卷收集;學習指知識、技能、態度、信心與承諾的實際獲得,需要測驗或實作評分;行為指回到工作崗位後是否真的把所學用出來,必須隔一段時間觀察;成果指訓練對組織目標造成的影響,例如效率、品質或成本指標的變化。這四層是成本與時間跨度的排序,不是難度排序。

為什麼多數企業內訓只做到第一層?

主要是誘因結構的問題,不是知識不足。第一層在下課前十五分鐘就能收完問卷、算出平均分並結案呈報;第三層則需要跨部門協調、主管配合觀察,而且要在一段時間之後還有人記得這件事。當驗收的成本由承辦人獨力承擔、好處卻由整個組織分享,驗收自然會退回到最便宜的那一層。

滿意度問卷分數高,是不是就代表訓練有效?

不是。滿意度證明的是課程被設計得夠清楚、夠好跟,這是必要條件而不是充分條件。實務上經常出現分數很高、但仍有相當多學員當場沒有完全上手的情況,這其實非常正常,因為短時間內要同時克服設備差異、時間壓力與工具陌生度本來就不切實際。要判斷訓練是否有效,必須看學員回到崗位後有沒有實際應用,那是第三層的事。

TTQS 評核表的第 17 項跟四層次有什麼關係?

TTQS 採用 PDDRO 架構,第 17 項直接對應 Kirkpatrick 四層次:17a 對應反應評估、17b 對應學習評估、17c 對應行為評估、17d 對應成果評估。實務上 17a 最好準備佐證,問卷影本即可;17b 可用測驗卷或實作作品補足;17c 與 17d 則常常只能用制度文件、主管訪談紀錄或計畫書敘述來滿足形式要求,這也是多數單位在評核時最吃力的兩項。

課後行動計畫一定要做嗎?

要看訓練型態。如果是最長 3 到 5 天的工作坊,而不是為期半年或一年的常態性企業訓練,硬做課後行動計畫的意義有限,因為有效的行動計畫必須搭配良好的追蹤機制,否則只會變成另一份沒有人回收的表單。在沒有長期陪跑架構的情況下,與其做形式上的行動計畫,不如把資源放在課後可以自行練習的教材上。

如果真的要做到行為層,最簡單的做法是什麼?

指定一個課後必須交付的成果任務,會比發放自評追蹤表單實際得多。例如要求學員運用課程所學完成一份新的提案簡報、報名參加一場競賽,或交付一個具體的專案成品。做法上分四步:課前就把任務講清楚、讓任務落在他本來就要做的真實工作上、設定課後兩到四週的交付時點、最後用交出來的成品本身當作行為層佐證。這樣就不需要主管每週填表。

Kirkpatrick 官方提到的 85% 與 15% 是什麼意思?

這組數字指的是訓練後的工作應用率:具備問責與支持機制的組織,訓練內容的實際應用率可達約 85%;而只是辦一場課、課後沒有任何後續機制的,大約只有 15%。要特別注意的是,它跟課後滿意度問卷上出現的百分比是完全不同的兩件事,一個衡量的是回到崗位之後的實際應用,一個衡量的是當天下課前的主觀感受,兩者之間沒有因果關係。

本文更新於 2026 年 8 月。AI 與數位工具改版快速,實際功能與名稱可能已有變動,建議以官方文件為準。