新加坡推動全球首部生成式AI測試國際標準—ISO/IEC 42119-8提案

新加坡推動全球首部生成式AI測試國際標準—ISO/IEC 42119-8提案

資訊工業策進會科技法律研究所

2026年08月04日

生成式AI快速普及,惟其輸出之品質、安全與可信賴程度如何檢驗,各國迄今尚無公認之測試標準。新加坡資訊通信媒體發展局(Infocomm Media Development Authority, IMDA)與新加坡企業發展局(Enterprise Singapore, EnterpriseSG)於2026年4月第17屆ISO/IEC JTC 1/SC 42人工智慧分技術委員會全體會議[1]中,公開《人工智慧—AI測試—第8部分:運用生成式AI之提示型文字對文字系統品質評估》(ISO/IEC AWI TS 42119-8)提案,並將其定位為全球首部就生成式AI系統測試方法而設之國際標準[2]

壹、事件摘要

新加坡提出之ISO/IEC 42119-8,係運用其AI Verify與全球AI保證沙盒(Global AI Assurance Sandbox)累積之測試成果,以基準測試(benchmarking)與紅隊測試(red teaming)做為兩大檢測手段,所擬訂之生成式AI提示型文字對文字系統品質評估方法。該標準與同系列第7部分(ISO/IEC 42119-7)及ISO/IEC 23282相互銜接,於2025年9月已在ISO登錄,現處經核准工作項目(Approved Work Item)之準備階段,尚未定發布日期[3]。會議期間,新加坡並與美國國家標準協會、ISO國際組織及AI Verify基金會合作舉辦工作坊與交流會議,促其標準推進於國際間凝聚共識[4]

貳、重點說明

一、ISO/IEC 42119系列以「AI測試」為主軸,第8部分處理生成式AI之品質評估

ISO/IEC 42119係ISO/IEC JTC 1/SC 42就AI系統之測試與保證新近規劃之AI測試共通方法系列標準[5]。該系列第8部分聚焦運用生成式AI之提示型文字對文字系統,涵蓋以紅隊測試進行之安全性檢測,並就評估結果之分析與記錄提供指引,並與同系列第7部分(紅隊測試,ISO/IEC 42119-7)及ISO/IEC 23282(自然語言處理系統評估方法)相互銜接。依主辦之IMDA與EnterpriseSG所述,該標準以提升測試結果之可重複性與可比較性為目標,藉基準測試與紅隊測試,使不同組織評估AI輸出品質時,結果更具一致性與可比較性,從而強化各界對AI系統之保證與信任[6]

二、AI Verify以11項治理原則為基準,併行流程檢核與技術檢測

AI Verify係新加坡IMDA主導、由AI Verify基金會於2023年推動之開源測試框架,用以填補AI治理原則與可供稽核證據之間之落差。其以透明、可解釋、可重複、安全、資安、穩健、公平、資料治理、當責、人為監督,以及包容性成長(Inclusive Growth)、社會與環境福祉 (Societal and Environmental Well-being)11項治理原則為基準[7]

AI Verify之檢驗分為流程檢核(Process Checks)與技術檢測(Technical Testing)。流程檢核依「原則、預期成效、流程、證據」(Principle, Outcome, Process, Evidence)四層展開檢核事項[8],要求擬測機構以文件證據佐證其治理流程確有落實,所需文件例如治理政策、模型與資料處理紀錄、內部審查程序等。各檢核項目中,於可解釋、安全、穩健、公平四項原則之部分檢視項目,並列有進行技術檢測的項目[9]

三、以Project Moonshot工具對應生成式AI

AI Verify基金會的AI Verify框架原係以傳統AI為對象,為因應大型語言模型的檢測,其推出Project Moonshot做為前述技術檢測於生成式AI的主要測試工具。Moonshot提供逾100組基準資料集供進行基準測試,以分級評分評估模型在多種能力上的表現,例如語言與語境理解。Project Moonshot 亦提供自動化紅隊攻擊模組,可同時測試多個大型語言模型應用程式,節省時間與資源也確保模型效能的全面評估。Project Moonshot 的網頁介面並提供優化的測試流程,因應不同應用程式的多元需求,引導使用者只辨識並執行最相關的測試,使用者也可以利用自訂資料集調整測試,以評估模型是否符合其獨特使用情境[10]

四、全球AI保證試點與沙盒媒合測試,以實測經驗作為標準前導

新加坡以全球AI保證機制(Global AI Assurance)串接前述工具與國際標準,由IMDA與AI Verify基金會共同主導,先後推出「試點(Global AI Assurance Pilot)」與「沙盒(Global AI Assurance Sandbox)」兩個措施。前者媒合生成式AI應用之開發者與專業測試業者(如Resaro、LatticeFlow AI、Advai等),就幻覺、不當內容、對抗弱點等風險進行技術測試。試點自2025年2月啟動,至同年5月彙整成果,已媒合17家應用部署者與16家測試業者[11]。後者則將試點之媒合做法予以常態化與擴大,使其自階段性試辦轉為長期運作之機制[12]。此機制屬軟性之自願測試,新加坡政府並不直接強制監管,而係以實作指引與測試媒合降低採用障礙、蒐集資料作為技術測試標準之前導、扶植AI保證服務市場[13]

依IMDA的全球AI保證沙盒報告說明,其全球AI保證試點(Global AI Assurance Pilot)的AI測試焦點已從「基礎模型安全」移到「實際應用之端到端可靠性」,鑑於將基礎模型與現有資料來源、流程及系統整合的複雜度較高,生成式AI風險評估很大程度上取決於使用情境。該報告並歸納提出四個生成式AI評測的實務建議:測試優先序應依應用之風險輪廓調整,風險愈高者測試愈嚴;適格之測試資料集須由人與AI共同產製,兼顧代表性與品質;除最終輸出外,尚應檢視模型運作之中間流程節點;可運用大型語言模型協助評測,但須有人工校準,以免評分失真[14]

五、AI測試業者認可計畫(AI TAP):從沙盒媒合走向測試供給端之制度化

前述試點與沙盒雖已媒合開發者與測試業者,惟受媒合之測試業者其資格良窳,仍多賴個案判斷。AI Verify Foundation爰於2026年5月19日發布「AI測試業者認可計畫」(AI Tester Accreditation Programme, AI TAP),規劃就測試業者本身設計認可基準,並建立合格測試業者名單,使企業採用外部測試服務時得有所依循[15]

認可方式採取五個評估面向,包括測試AI風險之技術能力、營運信譽(含實績)、財務永續性、營運量能,以及所宣稱業務範圍與實際能力相符[16]。該計畫預計於2026年第三季開放;現已有Advai、AIDX、安永(Ernst & Young)、Knovel Engineering、資誠(PwC)、Resaro、Vulcan等業者表達早期參與意願[17]

參、事件評析

我國在AI評測上,已由數位發展部成立AI產品與系統評測中心(AIEC),就語言模型訂定安全性、可解釋性、彈性、公平性、準確性、透明性、當責性、可靠性、隱私與資安等10項評測指標[18]。針對語言模型之準確性、可靠性、資安、隱私、公平性進行技術評測,納入「臺灣價值觀」評測項目,以建立貼合本土社會脈絡之評測標準;規劃於2026年、2027年分別通過財團法人全國認證基金會(Taiwan Accreditation Foundation, TAF)認證[19]

新加坡將其AI Verify評測方法提案成為ISO標準草案,並於前述國際會議中舉辦相關工作坊與研討活動,可見其認為任何AI評測須能成為國際共通接受之結果,始能在AI國際合規議題上達到評測之最大價值,因此其搶佔先機於ISO/IEC 42119系列中提出生成式AI之評測標準。我國AIEC之評測指標目前並未與數發部本身之風險分類框架相銜接,而數發部本身之風險分類框架亦可能與將來之國際標準存在落差。如AIEC測評結果須著眼於我國AI產品或服務之國際市場發展,即須追蹤觀測相關標準草案之進程,並同時就我國評測指標設計進行及時調整。

就測試方法而言,我國AIEC測評目前雖納入「臺灣價值觀」評測,但尚未就無法量化項目進行流程評測,亦無法對不同應用情境、代理AI動態運作過程進行風險評估。新加坡全球AI保證沙盒之報告已指出,生成式AI應用之測試須依風險輪廓調整、須檢視中間流程節點,此亦為我國AIEC測試做法須規劃補完之缺口。而新加坡推動AI測試業者認可計畫,則呈現其扶植本國AI測試服務業者、協助打開國際市場之思路;我國若欲就測試服務建立產業,則AIEC本身應設計成政府主導、建立標準、形成方法、認可適格業者之機制,同時由政府運用相關法令、獎補助、採購等方式提供市場誘因,將有助於落實我國AI基本法發展可信賴AI之宏旨。

本文著作權屬財團法人資訊工業策進會科技法律研究所所有,如需引用或轉載,請註明出處。

本文同步刊登於TIPS網站(https://www.tips.org.tw

 

[1]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).

[2]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 3, 2026).

[3]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 4, 2026)(該案於2025年9月13日登錄於ISO/IEC JTC 1/SC 42工作計畫,現為Stage 20.00「準備階段」/開發中,尚未定發布日期)。

[4]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).

[5]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 4, 2026)(42119-8屬ISO/IEC 42119「AI測試」系列,並銜接同系列42119-7與ISO/IEC 23282)。

[6]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).

[7]AI Verify Testing Framework: For Traditional and Generative AI, AI VERIFY FOUNDATION, https://file.go.gov.sg/aivtf-pdf.pdf (last visited Aug. 4, 2026)(該框架第2頁明列前開11項治理原則)。

[8]What Is AI Verify, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/what-is-ai-verify/ (last visited Aug. 3, 2026).

[9]AI Verify Testing Framework: For Traditional and Generative AI, AI VERIFY FOUNDATION, https://file.go.gov.sg/aivtf-pdf.pdf (last visited Aug. 4, 2026)。其中標示「Technical Testing」者計五項流程,分屬可解釋(第14頁)、安全(第29頁)、穩健(第61頁)、公平(第71、72頁)四原則;框架本身未另作總結性列舉。

[10]Project Moonshot, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/project-moonshot/ (last visited Aug. 3, 2026).

[11]Singapore Unveils Insights from the World's First Technical Testing of Real-World Applications of GenAI, IMDA, May 29, 2025, https://www.imda.gov.sg/resources/press-releases-factsheets-and-speeches/press-releases/2025/sg-unveils-insights-from-worlds-first-technical-testing-of-real-world-applications-of-genai (last visited Aug. 3, 2026);Global AI Assurance Pilot, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/ai-assurance-pilot/ (last visited Aug. 3, 2026).

[12]Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/ai-assurance/ (last visited Aug. 3, 2026).

[13]Executive Summary, Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://assurance.aiverifyfoundation.sg/main-report/ (last visited Aug. 3, 2026).

[14]Executive Summary, Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://assurance.aiverifyfoundation.sg/main-report/ (last visited Aug. 3, 2026).

[15]Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)。

[16]AI Tester Accreditation Programme, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/tester-accreditation/ (last visited Aug. 4, 2026);Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)(該計畫就技術能力、營運信譽、財務永續、營運量能、業務範圍相符五面向評估測試業者)。

[17]AI Tester Accreditation Programme, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/tester-accreditation/ (last visited Aug. 4, 2026);Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, 但截至 2026/8/4 仍尚未見開放,https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)。

[18]〈數位發展部「AI產品與系統評測中心」啟動 推動我國AI評測制度與可信任AI環境發展〉,數位發展部數位產業署,2023年12月6日,https://moda.gov.tw/ADI/news/latest-news/9295(最後瀏覽日:2026/07/16);〈數位部AI評測中心啟動 語言模型納10項目評分〉,中央社,2023年12月6日,https://www.cna.com.tw/news/ait/202312060129.aspx(最後瀏覽日:2026/07/16)。

[19]〈AIEC首創「臺灣價值觀」評測指標 42款模型競爭揭示AI在地化關鍵〉,資安人科技網,2025年10月,https://www.informationsecurity.com.tw/article/article_detail.aspx?aid=12311(最後瀏覽日:2026/07/16)。

你可能會想參加
※ 新加坡推動全球首部生成式AI測試國際標準—ISO/IEC 42119-8提案, 資訊工業策進會科技法律研究所, https://stli.iii.org.tw/article-detail.aspx?d=9521&no=0&tp=1 (最後瀏覽日:2026/08/11)
引註此篇文章
你可能還會想看
美國病歷健康資訊科技化政策可望於10年內節省220億美元用藥支出

  美國「2009年經濟復甦暨再投資法」(America Recovery and Reinvestment Act, ARRA),將醫療產業中的醫療資訊科技列為重點發展項目之ㄧ。以國內全面採行「電子病歷健康記錄」(electronic health records, EHRs)系統為目標,共挹注190億美元的經費,透過聯邦醫療保險或醫療補助計畫的機制支付獎勵金,鼓勵醫師或醫療院所採購並建置院內的電子醫療資訊系統。自2011年至2015年,醫師或醫療院所符合實質EHR使用者(meaningful EHR user)的標準,至多可獲得44000美元的獎勵金;倘於2015年後,其尚未成為實質EHR使用者,則將以每年多1%的比例,逐年減少其醫療保險補助額,直至2019年將減少5%。為了施行此政策,ARRA規定主管機關須於2009年12月31日前確立EHR的標準,包含了相互運用性(interoperability)、臨床功能性(clinical functionality)及安全性等標準。   EHR系統的基礎,也就是電子醫囑(e-prescribing)所涵蓋的功能,能提供臨床及藥費的即時資訊,供醫師判斷何種藥物(包含學名藥)最為安全,且可符合病患經濟負擔;亦可顯示該病患用藥紀錄,及其他醫生曾開立的處方,供醫師比對並觀察病患潛在的藥物過敏現象,若系統偵測出藥物間相斥的情形,亦將自動發出安全警示。此外,以電腦輸入處方並自動傳送至領藥處的模式,不僅可省卻病患冗長的等候領藥時間,亦能減少藥劑師因難以判讀字跡所導致的配藥錯誤。 一項由美國藥物照顧管理協會(Pharmaceutical Care Management Association, PCMA)所贊助的調查研究指出,ARRA中的病歷健康資訊科技化措施,將使e-prescribing的運用率,在未來五年內增加75%;而在往後10年,此將減少約3500萬筆的用藥指示錯誤,消弭因服藥錯誤導致的死亡事件,並能節省220億的用藥支出;其所帶來的效益實遠超過政府所挹注的經費。

歐盟對中小型生技公司提供藥政管理之費用優惠及專業協助

  中小型公司是生技產業發展的主力,然藥物研究發展模式風險及資金需求甚高,對資金不豐沛的中小型公司來說,無疑是一大負擔,因此,各國政府於促進生技醫藥產業發展之同時,相當重視如何減輕這些生技製藥公司的營運壓力,進而協助其順利茁壯。   現今歐盟境內至少有1500家中小型生技公司,為減輕這類研發導向的中小型製藥公司之財務負擔,並提供一些藥政管理上的專門協助,歐盟於去2005年12月15日通過了〝歐盟醫藥品管理局協助中小型公司發展規則(COMMISSION REGULATION (EC) No 2049/2005 laying down, pursuant to Regulation (EC) No 726/2004 of the European Parliament and of the Council, rules regarding the payment of fees to, and the receipt of administrative assistance from, the European Medicines Agency by micro, small and medium-sized enterprises,以下簡稱本規則)〞。   本規則主要是希望EMA(European Medicines Agency, 即歐盟醫藥品管理局)能透過相關規費之減免及提供科學諮詢的方式,降低中小型公司新藥上市申請費用(一般而言,人類用新藥於歐盟上市需支付14 萬歐元的申請費用),進而促進技術創新及新藥研發。另為協助中小型公司能更快速及方便地利用到這些優惠,本規則特要求EMA應於其內部建立〝中小企業辦公室(SME Office)〞,並製作詳細之使用者手冊(User Guide)供中小型公司參考。   台灣大部分的生技製藥公司亦屬中小型,故政府應思考如何幫助這些公司成長茁壯。雖然我國對生技製藥產業相關已提供投資抵減優惠,但卻無特別針對中小型生技製藥公司的藥政管理法規,歐盟前述立法及其精神值得我國借鏡。

輝瑞在中國獲得威而鋼專利戰爭的勝利 Pfizer Emerges Victorious in China Viagra Patent Battle

  在未來三年,中國藥品市場將以每年20-25%的成長率快速成長,並且預估可在2010年成為世界第五大藥品市場。在中國加入世界貿易組織(World Trade Organization, WTO)之後,其廣大的市場以及商機吸引了許多海外藥品製造商的興趣。然而,因為中國對智慧財產保護的社會環境非常複雜,使得本土製造的學名藥以及複製產品仍然主宰其藥品市場。   在歷經六年的法律戰爭後,輝瑞終於在中國成功地捍衛其關於陽痿治療藥物Viagra的專利權。根據報導,北京高等人民法院已駁回來自12家本土製藥廠所提出的專利異議案,並且同意授予輝瑞對於Viagra的專利保護至2014年為止。   輝瑞於1994年提出以Sildenafil (Viagra)治療陽痿的專利申請。歷經七年的審查,中國知識產權局於2001年核准該專利申請案。隨後,12家本土製藥廠提出了該專利的異議案,而中國知識產權局的專利檢定所於2004年判定此專利無效。輝瑞很快地對此決議提出異議,2006年,北京中級人民法院作出對輝瑞有利的判決。雖然前述之本土製藥廠商針對此判決向北京高等人民法院提出訴願,但北京高等人民法院於週四正式駁回訴願,並指示SIPO撤銷先前的專利無效判定。   這個判決結果應有助於Viagra站穩中國的陽痿治療藥物市場。然而,輝瑞在中國仍然面臨許多挑戰。今年初,該公司輸掉一個關於Viagra的商標侵權官司。而輝瑞目前正上訴中。

川普簽署行政命令以促進美國AI領域的發展

  美國總統川普於2019年2月11日簽署一項行政命令,發布「美國AI倡議」(American AI Initiative),旨在確保美國在AI領域的領導地位,川普並說道:「美國在AI領域的領導地位對於維護美國的經濟和國家安全至關重要」。「美國AI倡議」從五大方面來促進美國在AI領域的領導地位,包括: (一) 投資AI的開發   指示聯邦機構在研發任務及編排預算時,將AI作為優先投資項,確保美國對於AI基礎研發的長遠重視,此外,政府機構並應說明如何將預算用於AI研發開支,以增進對於AI投資的評估。 (二) 數據和資源共享   將聯邦政府中所擁有的統計數據資料、運算模型及運算資源提供給AI研發人員,促進交通和醫療保健等領域的AI發展。 (三) 建立政府標準及監管   白宮科技政策辦公室和美國國家與技術研究院(NIST)制定標準,以提升AI系統的「可靠、穩健、值得信賴、安全、可移轉和具協同性」。透過為不同技術和產業的AI制定使用指南,確保AI的使用安全和適當監管。 (四) 人才培訓   要求各機構為AI進步形成的就業市場變化做好準備,並考慮透過技能培訓課程、獎學金和學徒制度,因應市場人力產生之變化。 (五) 國際參與   與其他國家制定合作策略,協同AI技術的開發,同時確保AI領域之開發符合和不損及美國人的價值觀和利益。   此項倡議雖提及許多面向之發展,但仍然缺少發展細節,亦未提及計畫新資金的投入,因此,許多人對此倡議皆提出質疑。曾協助歐巴馬政府制定AI報告的哈佛大學教授Jason Furman即表示,此「倡議」雖令人鼓舞,但僅是邁出第一步,關鍵的考驗將在於是否能以強而有力的方式確實貫徹執行倡議中的內容,此倡議仍欠缺細節及執行面之部分。

TOP