https://flic.kr/p/2ssjjep
前兩天在 #kubeconjp 上聽到 grafana lab 的人發表「大疑」,在開發 grafana assistant 的過程中,因模型的「亂性」(stochasticity,我故意亂翻譯的)而就是會有一定比例的歪樓發生,所有對語言模型行為進行驗證的過程都是 flacky test。而當驗證過程中,考官跟考生都是 LLM 時,你必須意識到考生跟考官都會作弊。
這正好呼應到 @au@g0v.social 在《當考場關不住考生》一文中所點出的:「真正該守住的,是多元、分散、願意交互驗證的社會——它從來不會輸給單一的答案。」
這有意思的地方是,能「亂」,其實是 LLM 的一大優點。若人類專家能夠對一群來自複雜系統中成千上萬項的讀數說出三套故事,那 LLM 能再多說個五套,其實或許能成為補完故事缺口的關鍵也說不定。
於此,我總是想到怪醫豪斯中的診斷過程,每次幾乎都是從腦力激盪開始,醫生先直接「作弊」,從症狀直接給答案,略過理論,再互相否定。
可惜現在對話型 AI 模型上,老是在說「你說得沒錯!」,看得我都得到你說得沒錯疲勞症了。
https://flic.kr/p/2ssjjep
https://flic.kr/p/2ssjjep