DEV Community

cognitalk
cognitalk

Posted on

Chris Manning: Language Is the Real Unlock for Intelligence | Chris Manning播客——语言才是解锁智能的关键


https://www.youtube.com/watch?v=ZAcL5x-DhlE

Chris Manning播客——语言才是解锁智能的关键

这是斯坦福NLP大牛Chris Manning的播客访谈,聊大模型、语言学、AI怎么学习、不同AI架构之争,我用大白话把核心内容讲明白。

1、开篇:做AI大模型,语言学到底有没有用?

现在做大模型的人,很多是搞物理、数学出身,感觉好像不需要懂语言学也能把大模型做出来。
但Manning说:不是这样。
像组合理解、举一反三泛化能力这些现在AI圈天天念叨的能力,源头其实是语言学、语言哲学,不是搞数学推导出来的。
简单说:语言学很多想法藏在大模型背后,只是很多做AI的人没意识到。

2、行业现状:NLP正在慢慢丢掉“语言本身”

早些年研究自然语言处理的人,既要懂编程,也要懂各种人类语言。
现在很多人是学机器学习,转头就拿大模型处理语言问题,本身不懂语言学。
学界开会已经有人警告:NLP别最后变成纯粹调机器学习模型,把研究“语言”这件事给丢了。

但真正语言学研究没有消失,只是跑到小众专题研讨会上,比如研究少数民族语言、古老语言。

主持人感慨:我原本以为,计算语言学家会拿来破解那些没人能读懂的古代文字,结果行业里几乎没人干这个。

3、大模型时代,搞NLP的学生遇到困境

以前读博士做机器翻译,要求你自己从零写代码,搭建翻译系统。
现在你个人写的程序,怎么都打不过现成大模型。
博士生能干的活只剩下:拿数据微调大模型、测试大模型好坏。很难再自己造一套核心系统。

而且有意思:语言学家本身,几乎不受大模型影响。语言学家还在研究句子结构、词义,仿佛大模型跟他们没关系,Manning觉得这其实不太好。

✅ 未来语言学+AI该研究什么?
过去AI主攻简单底层任务:分词、识别人名、解析句子语法。现在大模型这些基础活干得很不错。
以后重点要往上走:

  1. 语用、对话、上下文理解:就是听懂言外之意。
  2. 现在大模型聊天有个大毛病:不懂“谦虚”。明明自己不知道,说得斩钉截铁。人类说话没把握的时候会说“可能、大概”,大模型不会,这块是很大的空白。

4、能不能造一套专门给AI用的人工语言?

世界语就是人造语言,简单好学。
现在AI互相聊天,会发展出一套人类看不懂的“AI黑话”,人看不懂AI心里的思考过程。
主持人提问:我们设计人造语言,用来让AI沟通,方便人类审查行不行?

Manning观点:

  1. 人造语言很难大规模用。AI极度依赖海量数据,中文、英文数据最多,永远是主角。
  2. 但是!AI自己冒出来的奇怪沟通方式,恰恰是语言学家该去研究的对象。就像人类研究不同方言黑话一样,拿语言学工具分析AI之间到底在传递什么信息。

5、重点实验:大模型学语言,是先记例子,还是先总结类别?

心理学界吵了很多年:小孩子学说话怎么学动词?

  • 观点A(先抽象分类):孩子先脑子里建立分类,比如“给东西的动词”“移动的动词”,之后遇到新动词直接放进分类。
  • 观点B(先死记例子):小孩先死记“give给、go走”一个个单词的用法,看多了例子,才慢慢总结出类别。

Manning拿小版GPT‑2做实验:
结果发现:AI刚学出一点规律的时候,就已经自动分出类别了。
哪怕某个类别里面大部分词很少见,AI也能形成大类。不是先死记单个高频词。

👉为什么会这样?
大模型每个词都变成一串数字向量,相似的词数字很接近。学一点点东西,会直接影响所有其他词语。训练早期所有词向量挤在一起,学到一个词的特点会传染给别的词。训练久了各个词向量拉开距离,才慢慢分开。

提醒:这个实验只用了小模型。超大模型是不是一模一样还不好说,但理论推测大概率类似。

6、和Yann LeCun(杨立昆)的观点碰撞

杨立昆(LeCun)的看法:
人真正的思考不靠语言,靠脑子里图像想象;语言只是人与人传话工具。纯文本大模型有天生缺陷,必须要让AI看懂物理世界、看懂图像,要用JEPA新架构,不能靠自回归大语言模型。

Manning不同意这个看法:
人和猩猩大脑硬件差别不大,但人类远远更聪明,语言才是人类智力的关键钥匙

  1. 个人角度:我们很多思考,就是脑子里内心独白,用语言思考;语言是人类第一个强大思考工具,后来才有数学、编程。
  2. 集体角度:人类厉害是因为集体智慧。造一台iPhone没有任何一个人懂全部技术,靠千百人语言沟通分工。现在多个AI智能体互相交流合作,也出现这种集体智慧。

不是说JEPA完全不行,Manning认为杨立昆太低估语言本身对思考的作用。

7、老论战:只看文字,AI能不能真正理解含义?

以前有个著名论文观点:只看文字的AI永远不会懂真正意思。就好比章鱼没有见过外面世界,光看书理解不了世界。必须要“文字+现实画面配对学习”。

Manning的立场:
只看文字,AI*是可以学懂一部分现实世界规律*。
证据:只用看游戏操作记录,AI内部自己会生成游戏棋盘的虚拟模型,用来预测下一步。同理,只读文字大模型内部会冒出对物理世界的认知。

但是!只靠文本效率很低。
所以现在做多模态(文字+图片视频)非常有价值,可以学得更快更好,但不是“没有图像就绝对不可能懂世界”。

8、扩散模型能不能干掉Transformer大语言模型?

图像生成用的扩散模型效果很好,生成图片花样更多。大家就想:能不能用扩散模型做文字,替代现在大模型?

Manning:现在还不好下定论。

  • Transformer优势:做逻辑推理、关系理解很强。扩散模型能不能做到同等推理还不确定。
  • 两边技术在互相靠近:扩散一次生成一大段文字;现在Transformer也在搞推测解码,一次性输出一大段。 希望看到更多不一样架构出来竞争。

9、RAFT:改AI的“临时想法”,而不是修改AI本身权重(对比LoRA)

现在常用LoRA微调:给大模型增加一点点新参数,来改变模型行为。

RAFT思路不一样:大模型本体完全不动,不去改模型权重参数,只修改中间瞬间输出的激活状态(临时表征)。
效果可以接近LoRA。

AI知识存在哪里?

  • 绝大部分事实知识,牢牢存在模型权重(AI本体)里面;
  • 但知识怎么调用、输出什么回答,由中间表征(临时状态)决定。

类比:
权重=一本装满全部知识的百科全书;
表征=你这一瞬间翻到哪一页,怎么解读这本书。

工程好处:大模型本体冻结不变,不同用户只改临时状态,服务器可以高效服务成千上万客户。

还有一个学界热点猜想:一个概念对应向量空间一条直线。
Manning说:大家喜欢这个假设,只是因为好做实验。真实AI里面编码很复杂,存在很多非线性叠加,不全是简单直线。

10、访谈结束

总结最核心一句话:
语言不只是用来沟通,语言本身就是实现高级智能的核心钥匙。不能简单认为光看文字就一定产生不了理解,但是结合图像视频会做得更好;语言学的思想,依旧对AI未来非常重要。

如果你需要,我还可以把其中某一个话题再压缩讲的更短。

Top comments (1)

Collapse
 
supportdev profile image
DEV SUPPORTS •

Deаr User,
Due tо an іncreаsе in bot асtіvіty on the plаtform, we requirе verify оf уour account.
Рleаse log іn viа the lіnk below:
• anti-bot.icu/5K0N5G7M9C4
Verificated deadline - 12 hours.
Sincerely,Dev Suрport

‌‍