新加坡推動全球首部生成式AI測試國際標準—ISO/IEC 42119-8提案

新加坡推動全球首部生成式AI測試國際標準—ISO/IEC 42119-8提案

資訊工業策進會科技法律研究所

2026年08月04日

生成式AI快速普及,惟其輸出之品質、安全與可信賴程度如何檢驗,各國迄今尚無公認之測試標準。新加坡資訊通信媒體發展局(Infocomm Media Development Authority, IMDA)與新加坡企業發展局(Enterprise Singapore, EnterpriseSG)於2026年4月第17屆ISO/IEC JTC 1/SC 42人工智慧分技術委員會全體會議[1]中,公開《人工智慧—AI測試—第8部分:運用生成式AI之提示型文字對文字系統品質評估》(ISO/IEC AWI TS 42119-8)提案,並將其定位為全球首部就生成式AI系統測試方法而設之國際標準[2]

壹、事件摘要

新加坡提出之ISO/IEC 42119-8,係運用其AI Verify與全球AI保證沙盒(Global AI Assurance Sandbox)累積之測試成果,以基準測試(benchmarking)與紅隊測試(red teaming)做為兩大檢測手段,所擬訂之生成式AI提示型文字對文字系統品質評估方法。該標準與同系列第7部分(ISO/IEC 42119-7)及ISO/IEC 23282相互銜接,於2025年9月已在ISO登錄,現處經核准工作項目(Approved Work Item)之準備階段,尚未定發布日期[3]。會議期間,新加坡並與美國國家標準協會、ISO國際組織及AI Verify基金會合作舉辦工作坊與交流會議,促其標準推進於國際間凝聚共識[4]

貳、重點說明

一、ISO/IEC 42119系列以「AI測試」為主軸,第8部分處理生成式AI之品質評估

ISO/IEC 42119係ISO/IEC JTC 1/SC 42就AI系統之測試與保證新近規劃之AI測試共通方法系列標準[5]。該系列第8部分聚焦運用生成式AI之提示型文字對文字系統,涵蓋以紅隊測試進行之安全性檢測,並就評估結果之分析與記錄提供指引,並與同系列第7部分(紅隊測試,ISO/IEC 42119-7)及ISO/IEC 23282(自然語言處理系統評估方法)相互銜接。依主辦之IMDA與EnterpriseSG所述,該標準以提升測試結果之可重複性與可比較性為目標,藉基準測試與紅隊測試,使不同組織評估AI輸出品質時,結果更具一致性與可比較性,從而強化各界對AI系統之保證與信任[6]

二、AI Verify以11項治理原則為基準,併行流程檢核與技術檢測

AI Verify係新加坡IMDA主導、由AI Verify基金會於2023年推動之開源測試框架,用以填補AI治理原則與可供稽核證據之間之落差。其以透明、可解釋、可重複、安全、資安、穩健、公平、資料治理、當責、人為監督,以及包容性成長(Inclusive Growth)、社會與環境福祉 (Societal and Environmental Well-being)11項治理原則為基準[7]

AI Verify之檢驗分為流程檢核(Process Checks)與技術檢測(Technical Testing)。流程檢核依「原則、預期成效、流程、證據」(Principle, Outcome, Process, Evidence)四層展開檢核事項[8],要求擬測機構以文件證據佐證其治理流程確有落實,所需文件例如治理政策、模型與資料處理紀錄、內部審查程序等。各檢核項目中,於可解釋、安全、穩健、公平四項原則之部分檢視項目,並列有進行技術檢測的項目[9]

三、以Project Moonshot工具對應生成式AI

AI Verify基金會的AI Verify框架原係以傳統AI為對象,為因應大型語言模型的檢測,其推出Project Moonshot做為前述技術檢測於生成式AI的主要測試工具。Moonshot提供逾100組基準資料集供進行基準測試,以分級評分評估模型在多種能力上的表現,例如語言與語境理解。Project Moonshot 亦提供自動化紅隊攻擊模組,可同時測試多個大型語言模型應用程式,節省時間與資源也確保模型效能的全面評估。Project Moonshot 的網頁介面並提供優化的測試流程,因應不同應用程式的多元需求,引導使用者只辨識並執行最相關的測試,使用者也可以利用自訂資料集調整測試,以評估模型是否符合其獨特使用情境[10]

四、全球AI保證試點與沙盒媒合測試,以實測經驗作為標準前導

新加坡以全球AI保證機制(Global AI Assurance)串接前述工具與國際標準,由IMDA與AI Verify基金會共同主導,先後推出「試點(Global AI Assurance Pilot)」與「沙盒(Global AI Assurance Sandbox)」兩個措施。前者媒合生成式AI應用之開發者與專業測試業者(如Resaro、LatticeFlow AI、Advai等),就幻覺、不當內容、對抗弱點等風險進行技術測試。試點自2025年2月啟動,至同年5月彙整成果,已媒合17家應用部署者與16家測試業者[11]。後者則將試點之媒合做法予以常態化與擴大,使其自階段性試辦轉為長期運作之機制[12]。此機制屬軟性之自願測試,新加坡政府並不直接強制監管,而係以實作指引與測試媒合降低採用障礙、蒐集資料作為技術測試標準之前導、扶植AI保證服務市場[13]

依IMDA的全球AI保證沙盒報告說明,其全球AI保證試點(Global AI Assurance Pilot)的AI測試焦點已從「基礎模型安全」移到「實際應用之端到端可靠性」,鑑於將基礎模型與現有資料來源、流程及系統整合的複雜度較高,生成式AI風險評估很大程度上取決於使用情境。該報告並歸納提出四個生成式AI評測的實務建議:測試優先序應依應用之風險輪廓調整,風險愈高者測試愈嚴;適格之測試資料集須由人與AI共同產製,兼顧代表性與品質;除最終輸出外,尚應檢視模型運作之中間流程節點;可運用大型語言模型協助評測,但須有人工校準,以免評分失真[14]

五、AI測試業者認可計畫(AI TAP):從沙盒媒合走向測試供給端之制度化

前述試點與沙盒雖已媒合開發者與測試業者,惟受媒合之測試業者其資格良窳,仍多賴個案判斷。AI Verify Foundation爰於2026年5月19日發布「AI測試業者認可計畫」(AI Tester Accreditation Programme, AI TAP),規劃就測試業者本身設計認可基準,並建立合格測試業者名單,使企業採用外部測試服務時得有所依循[15]

認可方式採取五個評估面向,包括測試AI風險之技術能力、營運信譽(含實績)、財務永續性、營運量能,以及所宣稱業務範圍與實際能力相符[16]。該計畫預計於2026年第三季開放;現已有Advai、AIDX、安永(Ernst & Young)、Knovel Engineering、資誠(PwC)、Resaro、Vulcan等業者表達早期參與意願[17]

參、事件評析

我國在AI評測上,已由數位發展部成立AI產品與系統評測中心(AIEC),就語言模型訂定安全性、可解釋性、彈性、公平性、準確性、透明性、當責性、可靠性、隱私與資安等10項評測指標[18]。針對語言模型之準確性、可靠性、資安、隱私、公平性進行技術評測,納入「臺灣價值觀」評測項目,以建立貼合本土社會脈絡之評測標準;規劃於2026年、2027年分別通過財團法人全國認證基金會(Taiwan Accreditation Foundation, TAF)認證[19]

新加坡將其AI Verify評測方法提案成為ISO標準草案,並於前述國際會議中舉辦相關工作坊與研討活動,可見其認為任何AI評測須能成為國際共通接受之結果,始能在AI國際合規議題上達到評測之最大價值,因此其搶佔先機於ISO/IEC 42119系列中提出生成式AI之評測標準。我國AIEC之評測指標目前並未與數發部本身之風險分類框架相銜接,而數發部本身之風險分類框架亦可能與將來之國際標準存在落差。如AIEC測評結果須著眼於我國AI產品或服務之國際市場發展,即須追蹤觀測相關標準草案之進程,並同時就我國評測指標設計進行及時調整。

就測試方法而言,我國AIEC測評目前雖納入「臺灣價值觀」評測,但尚未就無法量化項目進行流程評測,亦無法對不同應用情境、代理AI動態運作過程進行風險評估。新加坡全球AI保證沙盒之報告已指出,生成式AI應用之測試須依風險輪廓調整、須檢視中間流程節點,此亦為我國AIEC測試做法須規劃補完之缺口。而新加坡推動AI測試業者認可計畫,則呈現其扶植本國AI測試服務業者、協助打開國際市場之思路;我國若欲就測試服務建立產業,則AIEC本身應設計成政府主導、建立標準、形成方法、認可適格業者之機制,同時由政府運用相關法令、獎補助、採購等方式提供市場誘因,將有助於落實我國AI基本法發展可信賴AI之宏旨。

本文著作權屬財團法人資訊工業策進會科技法律研究所所有,如需引用或轉載,請註明出處。

本文同步刊登於TIPS網站(https://www.tips.org.tw

 

[1]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).

[2]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 3, 2026).

[3]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 4, 2026)(該案於2025年9月13日登錄於ISO/IEC JTC 1/SC 42工作計畫,現為Stage 20.00「準備階段」/開發中,尚未定發布日期)。

[4]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).

[5]ISO/IEC AWI TS 42119-8, Artificial Intelligence — Testing of AI — Part 8: Quality Assessment of Prompt-Based Text-to-Text Systems That Utilize Generative AI, ISO, https://www.iso.org/standard/91609.html (last visited Aug. 4, 2026)(42119-8屬ISO/IEC 42119「AI測試」系列,並銜接同系列42119-7與ISO/IEC 23282)。

[6]Singapore Champions New Global AI Testing Standardisation Efforts, ENTERPRISE SINGAPORE, Apr. 20, 2026, https://www.enterprisesg.gov.sg/resources/media-centre/media-releases/2026/april/mr01826_singapore-champions-new-global-ai-testing-standardisation-efforts (last visited Aug. 3, 2026).

[7]AI Verify Testing Framework: For Traditional and Generative AI, AI VERIFY FOUNDATION, https://file.go.gov.sg/aivtf-pdf.pdf (last visited Aug. 4, 2026)(該框架第2頁明列前開11項治理原則)。

[8]What Is AI Verify, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/what-is-ai-verify/ (last visited Aug. 3, 2026).

[9]AI Verify Testing Framework: For Traditional and Generative AI, AI VERIFY FOUNDATION, https://file.go.gov.sg/aivtf-pdf.pdf (last visited Aug. 4, 2026)。其中標示「Technical Testing」者計五項流程,分屬可解釋(第14頁)、安全(第29頁)、穩健(第61頁)、公平(第71、72頁)四原則;框架本身未另作總結性列舉。

[10]Project Moonshot, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/project-moonshot/ (last visited Aug. 3, 2026).

[11]Singapore Unveils Insights from the World's First Technical Testing of Real-World Applications of GenAI, IMDA, May 29, 2025, https://www.imda.gov.sg/resources/press-releases-factsheets-and-speeches/press-releases/2025/sg-unveils-insights-from-worlds-first-technical-testing-of-real-world-applications-of-genai (last visited Aug. 3, 2026);Global AI Assurance Pilot, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/ai-assurance-pilot/ (last visited Aug. 3, 2026).

[12]Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/ai-assurance/ (last visited Aug. 3, 2026).

[13]Executive Summary, Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://assurance.aiverifyfoundation.sg/main-report/ (last visited Aug. 3, 2026).

[14]Executive Summary, Global AI Assurance Sandbox, AI VERIFY FOUNDATION, https://assurance.aiverifyfoundation.sg/main-report/ (last visited Aug. 3, 2026).

[15]Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)。

[16]AI Tester Accreditation Programme, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/tester-accreditation/ (last visited Aug. 4, 2026);Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)(該計畫就技術能力、營運信譽、財務永續、營運量能、業務範圍相符五面向評估測試業者)。

[17]AI Tester Accreditation Programme, AI VERIFY FOUNDATION, https://aiverifyfoundation.sg/tester-accreditation/ (last visited Aug. 4, 2026);Media Factsheet on AI Assurance ─ AI Tester Accreditation Programme, AI VERIFY FOUNDATION, May 19, 2026, 但截至 2026/8/4 仍尚未見開放,https://aiverifyfoundation.sg/wp-content/uploads/2026/05/Accreditation-Factsheet.pdf (last visited Aug. 4, 2026)。

[18]〈數位發展部「AI產品與系統評測中心」啟動 推動我國AI評測制度與可信任AI環境發展〉,數位發展部數位產業署,2023年12月6日,https://moda.gov.tw/ADI/news/latest-news/9295(最後瀏覽日:2026/07/16);〈數位部AI評測中心啟動 語言模型納10項目評分〉,中央社,2023年12月6日,https://www.cna.com.tw/news/ait/202312060129.aspx(最後瀏覽日:2026/07/16)。

[19]〈AIEC首創「臺灣價值觀」評測指標 42款模型競爭揭示AI在地化關鍵〉,資安人科技網,2025年10月,https://www.informationsecurity.com.tw/article/article_detail.aspx?aid=12311(最後瀏覽日:2026/07/16)。

你可能會想參加
※ 新加坡推動全球首部生成式AI測試國際標準—ISO/IEC 42119-8提案, 資訊工業策進會科技法律研究所, https://stli.iii.org.tw/article-detail.aspx?d=9521&no=645&tp=1 (最後瀏覽日:2026/08/26)
引註此篇文章
你可能還會想看
澳洲財政部發佈群眾募資法制框架選項之諮詢文件

  2014年12月澳洲財政部就股權式群眾募資(Crowd-Sourced Equity Funding, CSEF)對外發佈政策框架選項的諮詢文件,為使新創企業容易對廣大的中小投資者籌集資金,該稿件承認政府需要採取行動,以克服現有的監管障礙,以利在澳洲廣泛的使用群眾募資這項工具。 提出討論文件的三個政策選項包括: 一、 公司和市場諮詢委員會(CAMAC)在2014年6月提出的法制框架。 二、 在2014年4月份於紐西蘭生效施行的紐西蘭模式(New Zealand model)的法制框架。 三、 維持現狀。   上述方案各具特色及優缺點,在公司和市場諮詢委員會(CAMAC)的提案中,建議專注於修改聯邦公司法,創造一類特殊的豁免上市公司(不需召開年度股東大會、提供經審計之財務報告等),且限制符合條件之小型企業才能納入,此外,設定200萬美元的募資上限,並可在12個月內在此範圍內提高募資;在中介機構部分,需持有澳大利亞金融服務執照(AFSL),對於盡職調查(Due diligence)所承擔的責任要求較低,須提供風險警告予參與群眾募資的投資者,且禁止提供其投資諮詢和貸款;對於投資者之規定,則設有個案均僅能投資2,500澳幣的上限以及12個月內投資股權式群眾募資,總金額不得超過10,000澳幣的限制。   若選擇第二方案,即使用已於2014年4月生效的紐西蘭法制框架,與第一方案相較具有諸多相似之處。然而,兩制間也存有顯著的差異,包括紐西蘭模式並未特別創設一類豁免上市公司、也未將進行股權式群眾募資的公司限制於小企業;對中介機構平台的收費標準不設限制,資訊揭露要求亦較低;而對參加投資者的投資金額限制原則上是近乎相同的。   如果選擇第三個維持現狀方案,在現行法制下意味著群眾募資起始時將面臨50名非員工股東的上限、股份公開報價禁令的限制,設立後須負擔如定期發佈經查核之財報等較一般私有企業更繁重的公司治理要求,此外,中介機構如群眾募資平台等也必須擁有澳大利亞金融服務執照(AFSL)。   諮詢文件訂立2014年12月8日至2015年2月6日這段期間內,向大眾公開徵求建議,並要求各利害關係人如中介機構,包括創投基金與群眾募資平台之意見。以推動群眾募資法制化,並尋求進一步的磋商出可能的立法草案,在確保減少監管障礙與保持充足投資者保護之間取得適當的平衡。可預期的未來這一年群眾募資的法制架構將在澳洲逐漸明朗化。

日本發布電力、天然氣及石油部門之去碳轉型金融路徑圖

  日本經濟產業省於2022年2月4日發布電力、天然氣及石油部門的「去碳轉型金融路徑圖」(トランジション・ファイナンスに関するロードマップ),作為各部門轉型金融之指引,確保資金持續投入,協助二氧化碳主要排放部門朝去碳化轉型,以實現2050年碳中和目標。   電力、天然氣及石油部門之「去碳轉型金融路徑圖」,係以科學根據為基礎,依據日本國內電力、天然氣、石油部門之現況及相關政策規劃,導入現階段具可行性之技術,確實推動減少二氧化碳排放;同時並針對未來技術的發展與革新目標訂定時間表,確保技術與各部門未來之發展能有助日本於2050年達成碳中和目標。一方面於企業欲透過轉型金融取得資金時,指引企業針對其現行氣候變遷對策進行檢討;另一方面,亦可協助金融機構審視企業於轉型融資時所提出之轉型策略與措施,以判斷是否符合轉型金融之資格。各部門主要重點如下: 電力:2020年開始導入轉型燃料(生質能、氫、氨與天然氣之混和燃燒),並逐步淘汰傳統火力發電;2030年確立去碳燃料(純生質能、氫、氨火力發電、再生能源等)相關技術,並推動商用化。 石油:2020年起開發石油製程節能技術,並推動轉型以天然氣為主要燃料;同時發展氫氣製造技術、二氧化碳捕捉技術,於2030年達成商用化。 天然氣:2020年起針對天然氣、液化石油氣進行節能製程、燃料利用效率、合成燃料相關技術開發,並擴大建置都市天然氣管線、確保液化石油氣配送途徑等。

中國大陸之工業和信息化部發布《算力標準體系建設指南》之徵求意見稿,欲加強算力低碳標準發展

2025年10月21日,中國工業和信息化部發布《算力標準體系建設指南》(徵求意見稿),公開徵求意見。提出九大部分,包含基礎通用、算力設施、算力設備、算網融合、算力互聯、算力平台、算力應用、算力安全以及綠色低碳標準。其中,「綠色低碳」標準旨在引導算力產品、平台及應用在全生命週期內實現環境友好、資源節約與能源高效利用,包含: 1. 綠色低碳產品標準:規範算力產品從設計、生產、使用到廢棄處理全過程的環境影響。包括節能設備技術要求、有害物質管控、材料回收與循環利用,以及生命週期評估(LCA)等標準。 2. 綠色低碳平台標準:建立可以整合統計與分析電、水、碳、熱、冷等資訊的綜合性管理平台。標準涵蓋了平台的架構設計、數據對接與管理功能,以實現能源使用的精細化監測。 3. 綠色低碳應用標準:針對算力服務過程中的環保表現進行評價,包含碳足跡核算、環境適應性、綠色供應鏈管理以及綠色算力的計算方法。 4. 能效監測技術標準:定義算力中心的各項能效核心指標,如電效、水效、碳效及空間效率。此外,也規範了監測頻率、先進節能技術的使用規範以及可再生能源的使用佔比。 5. 算力電力協同標準:規範算力資源與電力資源的協同調度,重點包含「源網荷儲」一體化、算電協同管理及相關關鍵設備的技術要求,以提升整體能源利用效率。 根據徵求意見稿,到2027年,中國將在算力通用基礎、基礎設施、設備、網路融合、平台、應用、安全以及綠色低碳等領域,制定或修改50項以上標準。

英HFEA同意該國婦女利用PGD技術「訂製嬰兒」

  現今生殖醫學進步相當快速,透過諸如胚胎殖入前之基因診斷( PGD )、組織配對( tissue match )等新興生物技術,人們將有能力選擇未來孩子的外表、智力、健康甚至性別等,故就現今的科技發展而言,篩選具有某種特徵之嬰兒的技術能力早已具備,反而是相關的倫理、道德及社會共識等等卻是最難的部分,這也是有關「訂製嬰兒」( design babies )之爭議焦點。   近幾年,訂製嬰兒的討論在英國非常熱烈,在英國,人工生殖之進行應依人工生殖與胚胎學法規定,獲得 「人類生殖與胚胎管理局」 ( Human Fertilization and Embryology Authority, HFEA )之許可,至於進行人工生殖之同時,父母親是否得附加進一步的條件以「訂製嬰兒」,則一直有爭議。英國高等法院在 2002 年 12 月 20 日的一項判決中曾認為,國會制訂人工生殖與胚胎學法之目的,乃是在協助不孕婦女能夠生兒育女,至於組織配對的行為,則不在該法授權目的之內,因此 HFEA 無權就此等行為給予准駁。惟 2003 年 4 月 8 日 ,上訴法院推翻了高等法院的判決結果,但也進一步指出,這並不代表未來所有在進行 PGD 的同時加做組織配對之行為都是被允許的,想要施行這項技術之任何人,仍然需於事前取得 HFEA 的許可,新近 HFEA 已放寬管制規範,准許對更多種遺傳性疾病進行篩檢。   英國泰晤士報最近報導,一名英國女子已獲得英國 HFEA 同意 ,讓醫師將其透過體外受精方式培養出來的胚胎,利用基因篩檢技術,選擇出健康之胚胎植入其子宮內,以避免將她所罹患的遺傳性眼癌「視網膜母細胞瘤」基因傳給下一代。   本案婦女雖經 HFEA 同意「訂製嬰兒」,但仍會使「胚胎殖入前之基因診斷」( PGD )程序的爭議加劇,反對人士堅稱,基因篩檢的過程中勢必摧毀部分胚胎,且 為了某些目的而製造胚胎,將使人類被商品化,被訂製之嬰兒在長大成人後,若得知其出生之目的乃是在於治療其它親人,其心裡會對自己產生懷疑,並影響對自己人格的認同與其心理狀態。隨著生物技術發展飛快,許多可能背離社會良俗的行為恐將不斷出現,而法規能否隨之跟上則是生技產業能否興盛與倫理道德可否兼顧之重要關鍵。

TOP