|
|
ruiaijun君说:
“我的自然语言理解是建立在信息提取的意义上的。自然语言携带着有用信息和多余信息,我认为自然语言理解就是要除去多余信息,提取有用信息,因此我常常把理解叫做信息提取。这是另一条路。好像也不太时髦!
这片老帖子是典型的智能型信息提取的例子。几秒钟看几百个字,显然对人脑来说是较高的处理速度,把这种理解编人计算机中显然比用语义语法逻辑等方式速度要快,这就是我的看法。
在计算机上,信息提取法是用词库反向检索语句,因此根本不用费事去分词,也不用考虑词汇的位置。如果是专业交流,可以采用有目的的反向检索(用目的压缩词量),检索会更快。在复杂的多学科交流中,可以采用分学科词库,交替检索,每个词库都不要很大,这与wychy先生的语义域不知有没有关系?上下文的关系用来确定语言交流的范围,用于按范围取库。用不着的词汇库就保存在硬盘上,不用读到内存中。占据内存也一定会很小。”(引自《人工智能研究者俱乐部》《自然语言》栏目)
我曾经说过:
“我认为人理解事物是一个思维过程。人看到或听到一句或几句话,或是经历了某件事后,在脑子里必须进行综合、分析和推理,才能理解和得到认识(即认知)。这个过程就是思维过程。语言是思维的工具。人脑里存储的信息有图象,也有类似于语言符号表示的东西。它们是相互关联的。在想一件事时脑海里是图象,而对这件事进行分析推理时就是用语言符号。”
而ruiaijun君说,“自然语言理解是建立在信息提取的意义上的”。
就是说,我们之间对“理解”的理解南辕北辙。争论也就毫无意义。他的方法是“在计算机上,信息提取法是用词库反向检索语句”。这是信息检索,跟自然语言理解不是一码事。信息检索属于处理技术,而自然语言理解则属于人工智能,不能混起来谈。
著名自然语言处理专家黄昌宁认为统计法是自然语言处理的方向,也只是说,用于信息检索速度快,效率高。最近一次人工智能学会年会他就没参加,以前好象也没参加过,他似乎也没有担任人工智能学会的任何职务(他给我的名片上就没有任何学会职务名称)。好象也没人称他为人工智能专家。
教计算机加法就和加法运算程序一样不需要语法我相信。如果要教计算机解四则应用题,那就非用语法和推理不可。我的方法在书面演算时可以解带羊、狼和菜过河和解四则应用问题。而信息检索的方法则不可能办到。我有一篇《计算机解人工智能问题示例》(尚未发表),哪位编程高手承诺把它变成演示程序,我可以发去,并详细说明实现技术,作为合作成果。
ruiaijun君的帖子让我恍然大悟:为什么他把他的方法作为信念看待。由词汇库检索句子用数据库就行。台湾图书馆就是采用统计关键词出现频度确定关键词实现多语言检索的。何必搞什么机器学习?教计算机用疑问词给词分类就是以语法为基础,虽然这种分类不可靠,我也曾指出过。这正好说明,离开语法谈不上理解。
由此我们也看出,做学问不可以急功近利,也不能异想天开,把问题看得太简单。凡做学问,就必须老老实实多看点书,尤其不要以为做学问的会说汉语就可以不学习汉语语法,不必学习逻辑。有人主张大学把逻辑学作为必修课也不是没有道理的,因为现在的大学毕业生不少说话不清不楚,写文章错漏百出。 |
|