內容目錄
Toggle本文重點
- 醫療 AI Agent 是工作系統,模型只是其中一項工具。
- 五個引擎分別負責蒐集、整理、製作、輸出與統籌,交接點都要能驗收。
- 來源、權限、版本、紀錄、審核與追溯應貫穿整條流程。
- 先從低風險、單一產物與人工核准開始,再逐步擴充自動化。
- 上線標準要包含失敗處理與持續監測,不能只看一次生成效果。
- 醫療 AI Agent 和一般聊天機器人差在哪裡?
- 聊天機器人通常完成一次問答,Agent 會依狀態呼叫資料與工具,連續完成多個步驟。多做一步,就要多定義一個權限、驗收點與失敗處理方式。
- 五個引擎一定要使用五個不同模型嗎?
- 不用。五個引擎代表五種責任,可以共用模型,也可以完全不用生成模型。關鍵是輸入、輸出、權限與紀錄彼此分開,方便檢查和替換。
- 有人工審稿就可以讓 Agent 自動找資料嗎?
- 可以從核准來源開始,但蒐集規則仍要限制網站、日期與文件類型。人工審稿時間有限,若前端混入大量低品質資料,後面很容易漏看。
想用醫療 AI Agent 自動產出衛教文章,第一個問題不該是「哪個模型最強」,而是這套系統到底要負責哪些工作。找資料、讀研究、寫稿、做圖、發布與排程,看似都能交給 AI,風險卻完全不同。
把全部任務塞進一段很長的提示詞,就像把買菜、洗菜、切菜、烹調、擺盤與外送交給同一個人,只留下一句「幫忙弄一桌好的」。偶爾會端出好菜,醫療內容卻承受不起偶爾失手。
較容易管理的做法,是把醫療內容流程拆成五個可獨立檢查的引擎:蒐集、整理、製作、輸出、統籌。這是一套工作設計框架,並非單一產品或通用標準。模型只是其中的工具,責任邊界、人工審核與可追溯紀錄才決定它能不能長期使用。

一、什麼是醫療 AI Agent?先定義任務邊界
**你可以把醫療 AI Agent 理解為一套會依規則呼叫資料、模型與工具,並把任務往下一步推進的工作系統。**它不等同聊天機器人,也不代表能自行承擔醫療責任。
一般聊天工具多半接收一次提問,再生成一次回答。Agent 則會依工作狀態執行多個動作,例如搜尋指定資料庫、擷取文章內容、檢查必填欄位、送交審核,通過後再轉換格式。每一步都要知道輸入從哪裡來、輸出交給誰,以及失敗時停在哪裡。
醫療情境尤其要先寫清楚「用途」。協助整理公開衛教資料、草擬文章與處理排程,和根據個人病歷提供診斷建議,風險不是同一級。WHO 2024 年針對大型多模態模型的指引,也要求開發者把任務界定清楚,並以所需的準確性與可靠性設計系統(註1)。
因此,第一版規格可以先回答四件事:服務誰、使用哪些資料、產出會去哪裡、最後由誰核准。只寫「自動生成高品質醫療內容」,像菜單只印「好吃」,廚房仍不知道該備什麼料。
二、五個引擎各自做什麼?
**拆成五個引擎後,你能分別限制資料來源、設定驗收條件,也能在單一步驟出錯時停機。**局部重做比整條流程重跑更容易追查問題。
| 引擎 | 核心工作 | 主要輸入 | 最低驗收條件 |
|---|---|---|---|
| 蒐集 | 找到並擷取候選來源 | 核准網站、資料庫、關鍵字 | URL、日期與原文可讀 |
| 整理 | 去重、分類、抽取證據 | 原文、研究摘要、來源資料 | 主張能對回原始段落 |
| 製作 | 形成文字、圖像腳本與衍生內容 | 已核對的證據與編輯規格 | 不超出來源、格式完整 |
| 輸出 | 轉檔、排版、發布與回報 | 已核准內容、平台欄位 | 預覽通過、發布結果可驗證 |
| 統籌 | 排程、派工、重試、告警與狀態管理 | 任務規則、各引擎回傳狀態 | 不跳關、錯誤可恢復 |
蒐集引擎的重點是「找到原料」,不急著下結論。它可以限制只抓政府機關、專業學會與同儕審查文獻,並保存網址、發布日期、作者與擷取時間。若來源打不開或只有二手轉述,就標示缺口,不能悄悄補上一段看似合理的文字。
整理引擎像備料台。它把重複資料合併,區分研究結果、官方建議與專家意見,也標出研究對象、證據層級及限制。最重要的產物是「主張與證據的對照表」,漂亮摘要排在後面。寫作引擎才有機會知道哪一句能寫、哪一句只能保留疑問。
製作引擎負責把已核對的材料轉成文章、社群短文、圖表腳本或影片分鏡。這一層可以使用不同模型,但提示詞應鎖定讀者、語氣、長度、禁語與引用格式。它能組織表達,不能擅自升高療效、替讀者診斷,或把動物研究寫成人體定論。
輸出引擎處理 Markdown、HTML、圖片尺寸、欄位映射與發布 API。它還要在送出後確認頁面真的上線,避免「API 回傳成功」被誤認為讀者已看得到。統籌引擎則像廚房的出菜口,記住每篇進度,控制重試次數,遇到審核失敗就退回指定步驟。
三、為什麼一個模型加長提示詞不夠?
**你可以用它做原型,但不宜把搜尋、判讀、寫作與發布的責任全綁在同一次生成。**提示詞越長,不代表來源更可靠,也不會自動留下完整稽核紀錄。
醫療內容的錯誤不只是一個錯字。來源可能過期,摘要可能漏掉研究限制,模型可能生成不存在的引用,發布工具也可能把草稿送到正式網站。這些失誤需要不同的偵測方法:連結檢查抓不到誇大推論,醫療審稿也未必發現發布權限設得太寬。
Bedi 等人回顧 519 項醫療大型語言模型評估研究後發現,只有 5% 使用真實病人照護資料;研究團隊並指出,現有評估在任務與衡量方法上缺乏共識(註2)。這提醒你,模型在考題或模擬案例表現亮眼,仍不能直接推定整套真實工作流程安全。
Bedi 等人的系統性回顧指出,醫療大型語言模型需要更貼近真實照護情境的測試、標準化評估,以及公開失敗模式,才能形成可靠的技術與政策判斷(註2)。
較實用的原則是讓每個引擎只拿到完成任務所需的最低權限。蒐集器可以讀公開資料,但不必擁有發布權;製作器可以產生草稿,但不能自行核准;發布器只接受已簽核版本,也不應看到無關的病人資料。這樣即使某一層出錯,影響範圍仍有邊界。
四、五個引擎外還需要哪些護欄?

**你至少要管理來源、權限、版本、紀錄、審核與追溯六件事。**護欄應橫跨五個引擎,不能等內容寫完才補一次檢查。
「來源」要求每個關鍵主張回到原文;「權限」限定誰能看資料、呼叫工具與發布;「版本」記錄模型、提示詞、知識庫與文章的變更;「紀錄」保存每一步輸入、輸出與錯誤;「審核」指定醫療、法規及編輯負責人;「追溯」則讓團隊能從上線文字一路查回證據與核准者。
NIST 的 AI 風險管理框架把工作整理為治理、情境描繪、衡量與管理四項功能,並強調治理要貫穿其他功能,風險管理也要持續涵蓋整個生命週期(註3)。套用到醫療內容時,護欄應存在於蒐集、製作、發布與上線後監測,而非只有結案前的一張勾選表。
WHO 也提醒,大型多模態模型可能產出錯誤、不完整或帶偏誤的陳述,還可能造成自動化偏誤,讓使用者忽略原本看得出的錯誤(註1)。人工審核因此不能只問「讀起來順不順」,還要核對來源、適用族群、數值、禁忌與結論強度。
五、怎麼做出能驗收的最小版本?
**先選一種低風險、可重複的內容,跑通一條有人工核准的最短流程。**你要先證明每一步可查、可停、可退回,再增加圖片、影音或自動發布。
適合起步的任務,可以是把指定政府衛教頁與已核准研究整理成固定格式的草稿。先避開個人診斷、即時醫囑、藥物劑量與未去識別的病歷資料。正式測試時,除了正確案例,也要放入過期來源、衝突證據、缺欄位與發布失敗等情境。
你現在就能做的事
你現在就能做的事
- 選定單一讀者與單一產物,例如「一般民眾的 1,500 字公開衛教草稿」。
- 為五個引擎各寫一句責任邊界,列出允許與禁止的輸入、輸出及工具。
- 在每個交接點設定可判定的門檻,例如引用 URL 全數可開啟、數字可對回原文。
- 指定人工核准者,讓高風險主張與正式發布都必須經過明確簽核。
- 用十到二十個固定案例回歸測試,保留失敗紀錄,模型或提示詞更新後再跑一次。
《金匱要略》所說的「上工治未病」,常被用來說明及早辨識風險、在問題擴大前介入的觀念(註4)。放到 AI 系統設計裡,它適合作為治理比喻:先設停損、權限與檢查點,再追求速度。這段傳統觀點不構成 AI 安全性的科學證據,技術驗證仍要依測試資料、風險指標與實際使用紀錄判斷。
「上工治未病」提醒人們重視問題發生前的辨識與準備。用在醫療 AI Agent 上,可以理解為先布置護欄,再讓自動化進入工作現場(註4)。
六、醫療 AI Agent 的驗收重點
**你要看的不只是文章品質,還包括來源可追、權限受控、錯誤能攔、版本可回復,以及上線後有人監測。**任何高風險環節無法說明負責人,都不適合直接全自動化。
一套可工作的系統,不必一開始就包辦所有媒介。穩定完成公開資料蒐集、證據整理與草稿製作,往往比同時做文章、圖卡、短影音與排程更有價值。每增加一種輸出,就多一組格式、版權、內容失真與發布權限風險。
重點摘要
- 醫療 AI Agent 是工作系統,模型只是其中一項工具。
- 五個引擎分別負責蒐集、整理、製作、輸出與統籌,交接點都要能驗收。
- 來源、權限、版本、紀錄、審核與追溯應貫穿整條流程。
- 先從低風險、單一產物與人工核准開始,再逐步擴充自動化。
- 上線標準要包含失敗處理與持續監測,不能只看一次生成效果。
醫療 AI Agent 和一般聊天機器人差在哪裡?
聊天機器人通常完成一次問答,Agent 會依狀態呼叫資料與工具,連續完成多個步驟。多做一步,就要多定義一個權限、驗收點與失敗處理方式。
五個引擎一定要使用五個不同模型嗎?
不用。五個引擎代表五種責任,可以共用模型,也可以完全不用生成模型。關鍵是輸入、輸出、權限與紀錄彼此分開,方便檢查和替換。
有人工審稿就可以讓 Agent 自動找資料嗎?
可以從核准來源開始,但蒐集規則仍要限制網站、日期與文件類型。人工審稿時間有限,若前端混入大量低品質資料,後面很容易漏看。
哪些醫療內容不適合第一版就自動化?
個人診斷、用藥調整、急症分流、未去識別病歷,以及會直接影響處置的建議,都屬高風險。第一版宜選公開、通則性且有固定來源的衛教內容。
模型更新後,舊流程還能直接沿用嗎?
不建議直接沿用。模型、提示詞或知識庫改版後,都應用固定案例重新測試引用正確性、遺漏、偏誤與格式,確認結果仍在可接受範圍。
參考文獻
**本文以 WHO、NIST、同儕審查系統性回顧與政府公開的中醫文獻說明為依據。**五引擎是依這些治理原則整理出的實務框架,並非上述機構共同制定的標準。
- World Health Organization. (2024). WHO releases AI ethics and governance guidance for large multi-modal models. https://www.who.int/news/item/18-01-2024-who-releases-ai-ethics-and-governance-guidance-for-large-multi-modal-models
- Bedi S, et al. (2025). Testing and Evaluation of Health Care Applications of Large Language Models: A Systematic Review. JAMA, 333(4), 319–328. https://pmc.ncbi.nlm.nih.gov/articles/PMC11480901/
- Tabassi E. (2023). Artificial Intelligence Risk Management Framework (AI RMF 1.0). National Institute of Standards and Technology. https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-ai-rmf-10
- 涂榮珍(2010,2024 更新)。藥膳之養生與藥膳土雞。農業部農業知識入口網。https://kmweb.moa.gov.tw/subject/subject.php?id=9404
