新加坡推動全球首部生成式AI測試國際標準—ISO/IEC 42119-8提案
資訊工業策進會科技法律研究所
2026年08月04日
生成式AI快速普及,惟其輸出之品質、安全與可信賴程度如何檢驗,各國迄今尚無公認之測試標準。新加坡資訊通信媒體發展局(Infocomm Media Development Authority, IMDA)與新加坡企業發展局(Enterprise Singapore, EnterpriseSG)於2026年4月第17屆ISO/IEC JTC 1/SC 42人工智慧分技術委員會全體會議[1]中,公開《人工智慧—AI測試—第8部分:運用生成式AI之提示型文字對文字系統品質評估》(ISO/IEC AWI TS 42119-8)提案,並將其定位為全球首部就生成式AI系統測試方法而設之國際標準[2]。
壹、事件摘要
新加坡提出之ISO/IEC 42119-8,係運用其AI Verify與全球AI保證沙盒(Global AI Assurance Sandbox)累積之測試成果,以基準測試(benchmarking)與紅隊測試(red teaming)做為兩大檢測手段,所擬訂之生成式AI提示型文字對文字系統品質評估方法。該標準與同系列第7部分(ISO/IEC 42119-7)及ISO/IEC 23282相互銜接,於2025年9月已在ISO登錄,現處經核准工作項目(Approved Work Item)之準備階段,尚未定發布日期[3]。會議期間,新加坡並與美國國家標準協會、ISO國際組織及AI Verify基金會合作舉辦工作坊與交流會議,促其標準推進於國際間凝聚共識[4]。
貳、重點說明
一、ISO/IEC 42119系列以「AI測試」為主軸,第8部分處理生成式AI之品質評估
ISO/IEC 42119係ISO/IEC JTC 1/SC 42就AI系統之測試與保證新近規劃之AI測試共通方法系列標準[5]。該系列第8部分聚焦運用生成式AI之提示型文字對文字系統,涵蓋以紅隊測試進行之安全性檢測,並就評估結果之分析與記錄提供指引,並與同系列第7部分(紅隊測試,ISO/IEC 42119-7)及ISO/IEC 23282(自然語言處理系統評估方法)相互銜接。依主辦之IMDA與EnterpriseSG所述,該標準以提升測試結果之可重複性與可比較性為目標,藉基準測試與紅隊測試,使不同組織評估AI輸出品質時,結果更具一致性與可比較性,從而強化各界對AI系統之保證與信任[6]。
二、AI Verify以11項治理原則為基準,併行流程檢核與技術檢測
AI Verify係新加坡IMDA主導、由AI Verify基金會於2023年推動之開源測試框架,用以填補AI治理原則與可供稽核證據之間之落差。其以透明、可解釋、可重複、安全、資安、穩健、公平、資料治理、當責、人為監督,以及包容性成長(Inclusive Growth)、社會與環境福祉 (Societal and Environmental Well-being)11項治理原則為基準[7]。
AI Verify之檢驗分為流程檢核(Process Checks)與技術檢測(Technical Testing)。流程檢核依「原則、預期成效、流程、證據」(Principle, Outcome, Process, Evidence)四層展開檢核事項[8],要求擬測機構以文件證據佐證其治理流程確有落實,所需文件例如治理政策、模型與資料處理紀錄、內部審查程序等。各檢核項目中,於可解釋、安全、穩健、公平四項原則之部分檢視項目,並列有進行技術檢測的項目[9]。
三、以Project Moonshot工具對應生成式AI
AI Verify基金會的AI Verify框架原係以傳統AI為對象,為因應大型語言模型的檢測,其推出Project Moonshot做為前述技術檢測於生成式AI的主要測試工具。Moonshot提供逾100組基準資料集供進行基準測試,以分級評分評估模型在多種能力上的表現,例如語言與語境理解。Project Moonshot 亦提供自動化紅隊攻擊模組,可同時測試多個大型語言模型應用程式,節省時間與資源也確保模型效能的全面評估。Project Moonshot 的網頁介面並提供優化的測試流程,因應不同應用程式的多元需求,引導使用者只辨識並執行最相關的測試,使用者也可以利用自訂資料集調整測試,以評估模型是否符合其獨特使用情境[10]。
四、全球AI保證試點與沙盒媒合測試,以實測經驗作為標準前導
新加坡以全球AI保證機制(Global AI Assurance)串接前述工具與國際標準,由IMDA與AI Verify基金會共同主導,先後推出「試點(Global AI Assurance Pilot)」與「沙盒(Global AI Assurance Sandbox)」兩個措施。前者媒合生成式AI應用之開發者與專業測試業者(如Resaro、LatticeFlow AI、Advai等),就幻覺、不當內容、對抗弱點等風險進行技術測試。試點自2025年2月啟動,至同年5月彙整成果,已媒合17家應用部署者與16家測試業者[11]。後者則將試點之媒合做法予以常態化與擴大,使其自階段性試辦轉為長期運作之機制[12]。此機制屬軟性之自願測試,新加坡政府並不直接強制監管,而係以實作指引與測試媒合降低採用障礙、蒐集資料作為技術測試標準之前導、扶植AI保證服務市場[13]。
依IMDA的全球AI保證沙盒報告說明,其全球AI保證試點(Global AI Assurance Pilot)的AI測試焦點已從「基礎模型安全」移到「實際應用之端到端可靠性」,鑑於將基礎模型與現有資料來源、流程及系統整合的複雜度較高,生成式AI風險評估很大程度上取決於使用情境。該報告並歸納提出四個生成式AI評測的實務建議:測試優先序應依應用之風險輪廓調整,風險愈高者測試愈嚴;適格之測試資料集須由人與AI共同產製,兼顧代表性與品質;除最終輸出外,尚應檢視模型運作之中間流程節點;可運用大型語言模型協助評測,但須有人工校準,以免評分失真[14]。
五、AI測試業者認可計畫(AI TAP):從沙盒媒合走向測試供給端之制度化
前述試點與沙盒雖已媒合開發者與測試業者,惟受媒合之測試業者其資格良窳,仍多賴個案判斷。AI Verify Foundation爰於2026年5月19日發布「AI測試業者認可計畫」(AI Tester Accreditation Programme, AI TAP),規劃就測試業者本身設計認可基準,並建立合格測試業者名單,使企業採用外部測試服務時得有所依循[15]。
認可方式採取五個評估面向,包括測試AI風險之技術能力、營運信譽(含實績)、財務永續性、營運量能,以及所宣稱業務範圍與實際能力相符[16]。該計畫預計於2026年第三季開放;現已有Advai、AIDX、安永(Ernst & Young)、Knovel Engineering、資誠(PwC)、Resaro、Vulcan等業者表達早期參與意願[17]。
參、事件評析
我國在AI評測上,已由數位發展部成立AI產品與系統評測中心(AIEC),就語言模型訂定安全性、可解釋性、彈性、公平性、準確性、透明性、當責性、可靠性、隱私與資安等10項評測指標[18]。針對語言模型之準確性、可靠性、資安、隱私、公平性進行技術評測,納入「臺灣價值觀」評測項目,以建立貼合本土社會脈絡之評測標準;規劃於2026年、2027年分別通過財團法人全國認證基金會(Taiwan Accreditation Foundation, TAF)認證[19]。
新加坡將其AI Verify評測方法提案成為ISO標準草案,並於前述國際會議中舉辦相關工作坊與研討活動,可見其認為任何AI評測須能成為國際共通接受之結果,始能在AI國際合規議題上達到評測之最大價值,因此其搶佔先機於ISO/IEC 42119系列中提出生成式AI之評測標準。我國AIEC之評測指標目前並未與數發部本身之風險分類框架相銜接,而數發部本身之風險分類框架亦可能與將來之國際標準存在落差。如AIEC測評結果須著眼於我國AI產品或服務之國際市場發展,即須追蹤觀測相關標準草案之進程,並同時就我國評測指標設計進行及時調整。
就測試方法而言,我國AIEC測評目前雖納入「臺灣價值觀」評測,但尚未就無法量化項目進行流程評測,亦無法對不同應用情境、代理AI動態運作過程進行風險評估。新加坡全球AI保證沙盒之報告已指出,生成式AI應用之測試須依風險輪廓調整、須檢視中間流程節點,此亦為我國AIEC測試做法須規劃補完之缺口。而新加坡推動AI測試業者認可計畫,則呈現其扶植本國AI測試服務業者、協助打開國際市場之思路;我國若欲就測試服務建立產業,則AIEC本身應設計成政府主導、建立標準、形成方法、認可適格業者之機制,同時由政府運用相關法令、獎補助、採購等方式提供市場誘因,將有助於落實我國AI基本法發展可信賴AI之宏旨。
本文著作權屬財團法人資訊工業策進會科技法律研究所所有,如需引用或轉載,請註明出處。
本文同步刊登於TIPS網站(https://www.tips.org.tw)
[1]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).
[2]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 3, 2026).
[3]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 4, 2026)(該案於2025年9月13日登錄於ISO/IEC JTC 1/SC 42工作計畫,現為Stage 20.00「準備階段」/開發中,尚未定發布日期)。
[4]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).
[5]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 4, 2026)(42119-8屬ISO/IEC 42119「AI測試」系列,並銜接同系列42119-7與ISO/IEC 23282)。
[6]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).
[7]AI Verify Testing Framework: For Traditional and Generative AI, AI VERIFY FOUNDATION, https://file.go.gov.sg/aivtf-pdf.pdf (last visited Aug. 4, 2026)(該框架第2頁明列前開11項治理原則)。
[8]What Is AI Verify, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/what-is-ai-verify/ (last visited Aug. 3, 2026).
[9]AI Verify Testing Framework: For Traditional and Generative AI, AI VERIFY FOUNDATION, https://file.go.gov.sg/aivtf-pdf.pdf (last visited Aug. 4, 2026)。其中標示「Technical Testing」者計五項流程,分屬可解釋(第14頁)、安全(第29頁)、穩健(第61頁)、公平(第71、72頁)四原則;框架本身未另作總結性列舉。
[10]Project Moonshot, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/project-moonshot/ (last visited Aug. 3, 2026).
[11]Singapore Unveils Insights from the World's First Technical Testing of Real-World Applications of GenAI, IMDA, May 29, 2025, https://www.imda.gov.sg/resources/press-releases-factsheets-and-speeches/press-releases/2025/sg-unveils-insights-from-worlds-first-technical-testing-of-real-world-applications-of-genai (last visited Aug. 3, 2026);Global AI Assurance Pilot, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/ai-assurance-pilot/ (last visited Aug. 3, 2026).
[12]Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/ai-assurance/ (last visited Aug. 3, 2026).
[13]Executive Summary, Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://assurance.aiverifyfoundation.sg/main-report/ (last visited Aug. 3, 2026).
[14]Executive Summary, Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://assurance.aiverifyfoundation.sg/main-report/ (last visited Aug. 3, 2026).
[15]Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)。
[16]AI Tester Accreditation Programme, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/tester-accreditation/ (last visited Aug. 4, 2026);Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)(該計畫就技術能力、營運信譽、財務永續、營運量能、業務範圍相符五面向評估測試業者)。
[17]AI Tester Accreditation Programme, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/tester-accreditation/ (last visited Aug. 4, 2026);Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, 但截至 2026/8/4 仍尚未見開放,https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)。
[18]〈數位發展部「AI產品與系統評測中心」啟動 推動我國AI評測制度與可信任AI環境發展〉,數位發展部數位產業署,2023年12月6日,https://moda.gov.tw/ADI/news/latest-news/9295(最後瀏覽日:2026/07/16);〈數位部AI評測中心啟動 語言模型納10項目評分〉,中央社,2023年12月6日,https://www.cna.com.tw/news/ait/202312060129.aspx(最後瀏覽日:2026/07/16)。
[19]〈AIEC首創「臺灣價值觀」評測指標 42款模型競爭揭示AI在地化關鍵〉,資安人科技網,2025年10月,https://www.informationsecurity.com.tw/article/article_detail.aspx?aid=12311(最後瀏覽日:2026/07/16)。
美國司法部(Department of Justice, DOJ)於2025年1月8日發布「防止受關注國家或個人近用美國敏感個人資料與政府相關資料」(Preventing Access to U.S. Sensitive Personal Data and Government-Related Data by Countries of Concern or Covered Persons)之最終規則。該規則旨在避免特定國家或個人獲取大量國民敏感個人資料及政府相關資料,以降低國安威脅。 最終規則指出,去識別化敏感個人資料若經大量蒐集,仍可能被重新識別,因此原則上禁止或限制任何美國人在知情的情況下,與受關注的國家或個人進行該等資料的大量交易。其將敏感個人資料定義為社會安全碼、精確地理位置、車輛遙測資訊(vehicle telemetry information)、基因組以及個人健康、財務資料或其他足資識別個人之資料,並定義禁止及限制交易的型態。同時,最終規則除設有若干豁免交易類型外,也定有一般及特別許可交易規定,並授權司法部得核發、修改或撤銷前述許可。一般許可交易的類型將由總檢察長另行公布;特別許可則由總檢察長依個案酌情例外核准。 該規則課予交易方持續報告(reporting)、盡職調查(due diligence)、稽核(audit)、紀錄留存(recordkeeping)等義務,並針對涉及政府相關資訊或美國國民大量敏感個人資訊之商業交易,例如投資、雇傭、資料仲介(data brokerage)及供應商契約,提出資安要求,以降低受關注國家或個人獲取該類特定資訊的風險。最後,該規則定有民事罰款(37萬美金以下)、刑事處罰(100萬美金以下或20年以下徒刑),並設立申訴之救濟措施。
澳洲競爭及消費者委員會(ACCC)就大型數位平臺對於消費者權益和市場競爭的問題提出建言澳洲競爭及消費者委員會(Australian Competition and Consumer Commission, ACCC)於2022年11月發佈了數位平臺第五份調查報告。該報告係ACCC受澳洲政府委託,於2020年起對數位平臺相關的消費者權益和市場競爭問題的調查,本次報告將重點放在監管如何改革。主要提供的建議和警示可分為五個方向: 1.反競爭行為 大型數位平臺擁有巨大的市場力量和重要的財政資源,佔據主導地位的數位平臺公司有能力和動機透過排他性行為和收購潛在競爭對手,以維持其在市場中的優勢地位。 2.消費者和中小企業保護不足 ACCC於2022年所發佈的最新報告與其自2017年開始進行數位平臺研究起所發布的其他報告一致,皆指出數位平臺的服務有以下潛在危害: ● 利用消費者偏見或引導消費者的方式向消費者提供服務。 ● 數位平臺上的詐騙明顯且持續增加。 ● 來自應用程式商店提供的不當和欺詐性應用程式的危害。 ● 創建、購買和銷售虛假評論以及以其他方式操縱評論的做法。 ● 欠缺救濟和爭議解決的途徑。 3.保護消費者的新措施 澳洲現有的競爭和消費者法律已難以因應數位平臺市場所面臨的消費者權益侵害和競爭危害等問題。該報告建議進行立法改革,具體如下: ● 商業市場中的消費者保護措施,包括禁止不公平交易行為和不公平契約條款。 ● 針對數位平臺的消費者爭議措施,包括強制規定內部和外部的爭議解決流程,以及平臺對詐騙、有害程式和虛假評論的預防和刪除義務。 ● 建立新的競爭框架,使受指定的數位平臺提供服務時受到適用於此一領域的強制性法規拘束。 ● 受指定數位平臺將應遵循之新框架和守則,以遵守競爭義務,避免其在市場中的反競爭行為,如競爭行為中的自我偏好(self-preference)等。 4.管轄 該調查報告亦指出適當且明確的管轄權限劃分對於新的監管框架來說非常重要,應在考慮到其專業知識和權責範圍的前提下,將監管責任分配給正確的管理機構,並且這些監管在流程中的各個環節都應受到適當的監督。 對於新的競爭框架及監管措施,ACCC建議可以參考英國當前的制度設計;英國政府成立了數位市場部門(Digital Markets Unit, DMU),該部門隸屬於競爭與市場管理局(Competition and Markets Authority),DMU負責監督受指定數位平臺,並在符合公平貿易、選擇開放、透明及信任等前提之下,DMU得視各個公司不同的情況對其進行特定的要求,如建立面對非法內容、對成人或未成年人有害內容時的應對措施等。 5.與國際方針的一致性 過去,澳洲在數位平臺監管策略採取了領先國際的創新行動,透過實施《新聞媒體議價法》(News Media Bargaining Code),要求數位平臺為新聞內容付費。但未來澳洲政府最終採用的策略將可能仿效他國經驗或是依循國際間共通模式,如英國推行中的《網路安全法》(Online Safety Bill)或歐盟的《數位市場法》(Digital Market Act)和《數位服務法》(Digital Services Act),而非獨樹一幟。 澳洲數位平臺監管策略之後續變化與進展值得持續追蹤,以做為我國數位平臺治理政策之借鏡。
美國FDA將整合區塊鏈等新興技術於電子協同運作系統之開發,以提升藥物供應鏈的安全性依據2013年11月27日通過之藥物供應鏈安全法(Drug Supply Chain Security Act, DSCSA),美國食品與藥物管理局(US Food and Drug Administration, FDA)於2019年2月7日公布新的領航計畫(Pilot Program)。此計畫主要的目標在於發展電子協同運作系統(electronic, interoperable system)以降低不合規範的藥物於市場流通的可能性,並提升患者的用藥安全。 此運作系統預計於2023年開始正式實施,其主要的功能包含辨識(identify)或追蹤處方藥物(prescription drugs)於供應鏈中的流通狀態,以及排除非法藥物進入供應鏈。於後者的情形,此運作系統將同時協助相關主管機關在非法藥物於市場中流通時迅速反應。FDA進一步指出,為達到這些目的,將引入區塊鏈(blockchain)等已使用在全球食品供應鏈(global food supply chains)的管理技術,以促進系統運作過程中的可追蹤性(traceability)及準確性。 此計畫於2019年2月8日到3月11日間接受加入申請,FDA鼓勵供應鏈中的相關人員,包含製造商(manufacturers)、再包裝商(repackagers)及其他利害關係人(other stakeholders)加入並試行計畫中開發的運作系統等技術,以加強產品使用狀況的管理。此外,FDA未來將持續公布相關的指引草案,如藥物辨識指標(product identifiers)等,以提升產業利用性及藥物使用的安全性。
新加坡國家研究基金會推出AI.SG計畫,促進人工智慧技術發展新加坡國家研究基金會(National Research Foundation,以下簡稱NRF)於2017年5月3日宣布AI.SG倡議,並將啟動國家級AI計畫。NRF將於五年內投資新加坡幣1.5億元,整合NRF,智慧國家與數位政府辦公室(Smart Nation and Digital Government),經濟發展委會(Economic Development Board),資通訊媒體發展局(Infocomm Media Development Authority),新加坡創新機構(SGInnovate)及整合健康資訊系統(Integrated Health Information Systems)等數個政府部門,以及位於新加坡的研究機構、AI新創公司與發展AI產品的企業等共同投入。計畫三大目標如下: 利用人工智慧來解決影響社會和產業的重大挑戰 這些應用包括利用人工智慧解決交通尖峰時段壅塞問題,或應付人口老齡化帶來的醫療保健挑戰。IHiS執行長兼衛生部資訊長Mr.Bruce Liang表示:「醫療照護是需要高度知識及人性化的行業。多年來從新加坡在醫療照護數位化的發展中,可預見AI未來對於提升新加坡人民健康有很大幫助。例如在疾病預防、診斷、治療計畫、藥物治療、精準醫療、藥品開發等方面皆可發揮作用。醫護人員再加上AI工具,可以更完善解決未來對於醫療照護需求的增加。」 投入並深化技術能力,以掌握下一波科技創新 其中包括可展現更多人類學習能力的下一代「可解釋的人工智慧」 (Explainable Artificial Intelligence,XAI),以及相關技術,例如電腦系統架構(軟體、韌體、硬體整合)和認知科學(Cognitive Science)。NRF獎助金和研究計畫將會支持相關科學活動。當地人才也將透過參與AI深度功能的開發進行培訓。 擴大產業對於AI和機器學習的使用 AI.SG將與公司合作,利用AI來提高生產力,創造新產品,並輔導相關解決方案從實驗室進入市場。目標將支持100個AI研發項目和概念驗證,以利用戶能快速解決實際問題。並預計針對金融,醫療照護和城市管理解決方案領域具有特殊的潛力者先著手進行。 AI.SG計畫此項推動工作,未來不僅將可激發新加坡的研究人員和用戶利用AI解決社會重大問題,也將影響全世界渴望利用人工智慧技術帶來更便利的生活,值得我國相關機關推動政策之參考依據。