|
|
外語教學與研究
發表內容:自然語言處理技術的三個里程碑
《外語教學與研究》,2002/03,180~187頁
黃昌寧、張小鳳 撰(微軟亞洲研究院)
通訊地址:100080 北京知春路49號希格瑪中心五層微軟亞洲
研究院〈cnhuang@microsoft‧ com〉
-------------------
【內容提要】
半世紀以來自然語言處理(NLP )研究取得兩點重要認識和
三大重要成果,即認識到:(1)對於句法分析, 基於單一
標記的短語結構規則是不充分的;(2)短語結構規則在真
實文本中的分佈呈現嚴重扭曲。換言之,有限數目的短語結
構規則不能覆蓋大規模語料中的語法現象。這與原先的預期
大相徑庭。NLP 技術的發展在很大程度上受到這兩個事實的
影響。從這個意義上說,本領域中稱得上里程碑式的成果是
:(1)複雜特徵集和合一語法;(2)語言學研究中的詞匯
主義;(3)語料庫方法和統計語言模型。大規模語言知識
的開發和自動獲取是NLP 技術的瓶頸問題。因此,語料庫建
設和統計學理論將成為該領域中的關鍵課題。
1‧ 引言
從50年代的機器翻譯和人工智能研究算起,NLP
(NaturalLanguage Processing,自然語言處理)已有長達半個
世紀的歷史。在這個進程中,學術界曾提出許多重要的理論
和方法,取得了豐富的成果。筆者認為,近二十年在這一領
域中堪稱里程碑式的貢獻有如下三個:(1)複雜特徵集和
合一語法;(2)語言學研究中的詞匯主義;( 3)語料庫方
法和統計語言模型。這三個成果將繼續對語言學、計算語言
學和NLP研究產生深遠影響。為了更好地理解這些成果的意
義, 先介紹與此相關的兩個事實。
2‧ 兩個事實
2‧1
事實之一──短語結構語法不能有效地描寫自然語言
在自然語言處理中,為了識別一個輸入句子的句法結構
,首先要把句子中的詞一個一個地切分出來,然後去查詞典
,給句子中的每個詞指派一個合適的詞性(part of speech)
;之後再用句法規則把句子裏包含的句法成分,如名詞短語
、動詞短語、小句等,逐個地識別出來。進而判斷每個短語
的句法功能,如主語、謂語、賓語等,及其語義角色,最終
得到句子的意義表示,如邏輯語義表達式。這就是一個句法
分析的全過程。
本文要提到的第一個事實是:短語結構語法(Phrase
StructureGrammar,簡稱PSG)不能有效地描寫自然語言。
PSG在Chomsky語言學理論中佔有重要地位,並且在自然語言
的句法描寫中擔當舉足輕重的角色。但是它有一些根本性的
弱點,主要表現為,它使用的是像詞類和短語類那樣的單一
標記,因而不能有效地指明和解釋自然語言中的結構歧義問
題。請看漢語中“V+N”組合。假如我們把“打擊、委托
、調查”等詞指派為動詞(V);把“力度、方式、盜版、
甲方”等詞視為名詞(N),並同意“打擊力度”、“委托
方式”是名詞短語(NP),“打擊盜版”、“委托甲方”
是動詞短語(VP),那麼就會產生如下兩條有歧義的句法
規則:
(1)NP→VN
(2)VP→VN
換句話講,當計算機觀察到文本中相鄰出現的“V+N”詞
類序列時,仍不能確定它們組成的究竟是NP還是VP。我們
把這樣的歧義叫做“短語類型歧義”。例如:
‧該公司正在招聘﹝銷售V人員N﹞NP。
‧地球在不斷﹝改變V形狀N﹞VP。
下面再來看“N+V”的組合,也同樣會產生帶有短語
類型歧義的規則對,如:
(3)NP→NV 例:市場調查;政治影響。
(4)S→NV 例:價格攀升;局勢穩定。其中標記S代表
小句。
不僅如此,有時當機器觀察到相鄰出現的“N+V”詞
類序列時,甚至不能判斷它們是不是在同一個短語中。也就
是說,“N+V”詞類序列可能組成名詞短語NP或小句S,也
有可能根本就不在同一個短語裏。後面這種歧義稱為“短語
邊界歧義”。下面是兩個相關的例句:
‧中國的﹝鐵路N建設V﹞NP發展很快。
‧﹝中國的鐵路N﹞NP建設V得很快。
前一個例句中,“鐵路 建設”組成一個NP;而在後一個例
句中,這兩個相鄰的詞卻分屬於兩個不同的短語。 這足以
說明,基於單一標記的PSG不能充分地描述自然語言中的句
法歧義現象。下面再看一些這樣的例子。
(5)NP→V N1 de N2
(6)VP→V N1 de N2
其中de代表結構助詞“的”。例如,“﹝削 蘋果﹞VP的刀”
是NP;而“削﹝蘋果 的 皮﹞NP”則是VP。這裏既有短語類
型歧義,又有短語邊界歧義。比如,“削V蘋果N”這兩個
相鄰的詞,可能構成一個VP,也可能分處於兩個相鄰的短語
中。
(7)NP→P N1 de N2
(8)PP→P N1 de N2
規則中P和PP分別表示介詞和介詞短語。例如,“﹝對 上海
﹞PP 的印象”是NP;而“對﹝上海的 學生﹞NP”則是PP。
相鄰詞“對P上海N”可能組成一個PP,也可能分處於兩個短
語中。
(9)NP→NumP N1 de N2其中NumP表示數量短語。
規則(9)雖然表示的是一個NP, 但可分別代表兩種結構意
義:
(9a)NumP﹝N1 de N2﹞NP 如:五個﹝公司的職員﹞NP
(9b)﹝NumP N1﹞NP de N2 如:﹝五個公司﹞NP的職員
(10)NP→N1 N2 N3規則
(10)表示的也是一個NP,但“N1+N2”先結合,還是“
N2+N3”先結合,會出現兩種不同的結構方式和意義,即:
(10a)﹝N1 N2﹞NP N3 如:﹝現代 漢語﹞NP詞典
(10b)N1﹝N2 N3﹞NP 如:新版﹝漢語詞典﹞NP
以上討論的第一個事實說明:
‧由於約束力不夠,單一標記的PSG 規則不能充分消解
短語類型和短語邊界的歧義。用數學的語言講,PSG規則是
必要的,卻不是充分的。因此,機器僅僅根據規則右邊的一
個詞類序列來判斷它是不是一個短語,或者是什麼短語,都
有某種不確定性。
‧採用複雜特徵集和詞匯主義方法來重建自然語言的語
法系統,是近二十年來全球語言學界對此作出的最重要的努
力。
2‧2
事實之二──短語結構規則的覆蓋有限
通過大規模語料的調查,人們發現一種語言的短語規則
的分佈符合齊夫率(Zipf's Law)。Zipf是一個統計學家和語
言學家。他提出,如果對某個語言單位(不論是字母還是詞
)進行統計,把這個語言單位在一個語料庫裏出現的頻度
(frequency)記作F,而且根據頻度的降序對每個單元指派
一個整數的階次(rank)R。結果發現R和F 的乘積近似為一
個常數。即
FR≒const(常數)
或者說,被觀察的語言單元的階次R與其頻度F成反比關係。
在詞頻的統計方面,齊夫律顯示,不管被考察的語料僅僅是
一本長篇小說,還是一個大規模的語料庫,最常出現的100
個詞的出現次數就會佔到語料庫總詞次數(tokens)的近一
半。假如語料庫的規模是100萬詞次,那麼其中頻度最高的
100個詞的累計出現次數大概是50萬詞次。如果整個語料庫含
有5萬詞型(types),那麼其中的一半(也就是2‧5 萬條左
右)在該語料庫中只出現過一次。即使把語料庫的規模加大
十倍,變成1000萬詞次,統計規律大體不變。
有趣的是,80年代Sampson對英語語料庫中的PSG規則進
行統計,發現它們的分佈同樣是扭曲的,大體表現為齊夫率
(Aarts et al‧ 1990)。也就是說,一方面經常遇到的語法
規則只有幾十條左右,它們的出現頻度極高;另一方面,規
則庫中大約一半左右的規則在語料庫中只出現過一次。隨著
語料庫規模的擴大,新的規則仍不斷呈現。Chomsky 曾提出
過這樣的假設,認為對一種自然語言來說,其語法規則的數
目是有限的,而據此生成的句子數目是無限的。但語料庫調
查的結果不是這樣。這個發現至少說明,單純依靠語言學家
的語感來編寫語法規則不可能勝任大規模真實文本處理的需
求,我們必須尋找可以從語料庫中直接獲取大規模語言知識
的新方法。
幾十年來,NLP學界發表過大量燦爛成果,有詞法學、
語法學、語義學的,有句法分析算法的,還有許多著名的自
然語言應用系統。而對該領域影響最大的、里程碑式的成果
應數下面三個。
3‧ 三個里程碑
3‧1
里程碑之一:複雜特徵集
複雜特徵集(complex feature set)又叫多重屬性
(multiplefeatures)描寫。在語言學裏,這種描寫方法最早
出現在語音學中,後來被Chomsky學派採用來擴展PSG的描
寫能力。現在無論是在語言學界還是計算語言學界,幾乎所
有語法系統在詞匯層的描寫中均採用複雜特徵集,並利用這
些屬性來強化句法規則的約束力。一個複雜特徵集F 包含任
意多個特徵名f[,i]和特徵值v[,i]對。其形式如:
F={…,fi=vi,…},i=1,…,n
特徵值v[,i]既可以是一個簡單的數字或符號,也可以是另
外一個複雜特徵集。這種遞歸式的定義使複雜特徵集獲得了
強大的表現能力。如北京大學俞士汶等(1998)開發的《現
代漢語語法信息詞典詳解》,對一個動詞界定了約40項屬性
描寫,對一個名詞界定了約27項屬性描寫。
一條含有詞匯和短語屬性約束的句法規則具有如下的一
般形式:
〈PSG規則〉:〈屬性約束〉
:〈屬性傳遞〉
一般來說,PSG 規則包括右部(條件:符號序列的匹配模式
)和左部(動作:短語歸並結果)。詞語的“屬性約束”直
接來自系統的詞庫,而短語的“屬性約束”則是在自底向上
的短語歸並過程中從其構成成分的中心語(head)那裏繼承
過來的。在Chomsky的理論中這叫做X─bar 理論。X─bar代
表某個詞類X所構成的、仍具有該詞類屬性的一個成分。如
果X=N,就是一個具有名詞特性的N─bar。當一條PSG 規則
的右部匹配成功,且“屬性約束”部分得到滿足,這條規則
才能被執行。此時,規則左部所命名的短語被生成,該短語
的複雜特徵集通過“屬性傳遞”部分動態生成。
20世紀80年代末、90年代初學術界提出了一系列新的語
法,如廣義短語結構語法(GPSG)、中心語驅動的短語結
構語法(HPSG)、詞匯功能語法(LFG)等等。這些形式語
法其實都是在詞匯和短語的複雜特徵集描寫背景下產生的。
合一(unification )算法則是針對複雜特徵集的運算而提出
來的。“合一”是實現屬性匹配和賦值的一種算法,所以上
述這些新語法又統稱為“基於合一的語法”。 |
|