突然覺得我的專欄有救了。

突然覺得我的專欄有救了。每週生成個200篇5,000字文章,應該沒有問題~

Willie Yang

推薦學弟最新寫的自然語言處理好文,內容介紹GPT-2「給定越多參數以及越多樣、越大量的文本,無監督訓練一個語言模型或許就可讓該模型具備更強的自然語言理解能力,並在沒有任何監督的情況下開始學會解決不同類型的 NLP 任務。 」意思是只要有足夠的語料,直接由上下文關係的學習,就可以解決非常多的自然語言任務,而不需要再額外做什麼事。(GPT-2 原論文標題Language Models are Unsupervised Multitask Learners )

學弟在文章中透過視覺化的方法,看到attention機制甚至學到了代名詞關係,傳統的指代消解問題,看來也不用特別處理了

這符合了我20年前就深信的想法!會這樣說「馬後炮」是因為當年我們就是少數做中文搜尋引擎而擁有極大量語料的團隊。看到了方向但礙於計算能力與算法的限制,只能用統計方法算出很近的關係,效果有限。近年來最大的突破,在我看來,可說是deep learning解決了降維的問題、使得詞向量能夠具體被算出、attention又解決了一詞多義的問題。

在學術上,造成巨大突破的往往是很簡單的概念,但要支撐這樣的概念,需經過無數的實驗和證明。如今看到這樣的研究成果,就像歷經艱難、尋幽探訪後,終於站在開闊壯偉的山河前:心中充滿欣慰、讚嘆,一方面感覺到渺小,但又受到激發、鼓舞,想再挑戰更遠大的目標,這就是研究的樂趣。

值得一提,假文章必定更加普及。不出十年,人人都會有AI書僮,老師拿到的作業報告,不再是搜尋剪貼的、而是AI書僮生成的,這樣好或不好呢?這是哲學問題,也是一場如同virus/anti-virus無止盡的戰爭,是商機也是文明病。

LEEMENG.TW

直觀理解 GPT-2 語言模型並生成金庸武俠小說