授课教师:Astrid van Alem

授课地点:Leiden Linguistic Summer School,Leiden

日期:2025 年 7 月 25 日


结构构建:Merge

从谓词选择到结构构建

上一讲已经说明:谓词会根据论元结构选择论元。第五讲把这种选择关系形式化为结构构建操作:Merge

1
2
3
4
5
谓词选择论元
->
Merge 把谓词和论元组合起来
->
形成更大的层级成分

Merge 的定义

Merge 接受两个元素或成分 αβ,把它们组合成一个新的成分 γ

两个输入可以是单个词,也可以是已经由 Merge 构造出来的复杂成分。按照上一讲的中心语理论,其中一个子节点是中心语,并把自己的特征投射到新成分 γ

用 c-selection 识别中心语

此前可以通过语义核心、分布和形态句法行为来寻找中心语。例如:

1
eat mushrooms

整个成分在语义和分布上表现得像动词,因此 eat 是中心语。

本讲给出一个更直接的判定:

复杂成分的中心语,是带有 c-selection 特征、因而触发 Merge 的那个子节点。

也就是说,中心语是选择者(selector)和投射者(projector)。如果一个词带有 [uX] 这样的类别选择特征,它就要求与具有 [X] 特征的成分组合。

例如:

1
2
dance [V, uN]
Sarah [N]

dance 带有 [uN],要求一个名词性论元;Sarah 带有 [N]。因此 dance 是触发这次 Merge 的中心语。

课程阶段说明:“带有 c-selection 特征的元素是选择者/投射者”是 Day 5 在选择驱动的结构构建中采用的工作定义。后续课程还会把 Merge 用于 XP 移动(如 EPP movement),并引入 vTC 等功能中心语。因此,这一定义应理解为本讲对 predicate–argument Merge 的形式化,而不是对所有后续 Merge 情形的穷尽定义。

姐妹关系下的特征检查

不可解释的选择特征

选择特征 [uX] 中的 u 表示 uninterpretable,即“不可解释”。它表达的是形式上的选择要求:谓词需要一个 X 类别的成分,但 [uX] 本身不贡献独立的语义解释。

讲义采用以下原则:

如果成分 Y 带有不可解释的 c-selection 特征 [uX],并且 Y 与带有匹配特征 [X] 的成分 Z 构成姐妹节点,那么 [uX] 就会被检查并删除。

形式化表示:

Merge 之后,Y[uX]Z[X] 处于姐妹关系,匹配的特征得到检查:

在笔记中,删除线表示选择特征已经被检查。一个谓词要完成结构构建,就必须满足自己的 c-selection 要求。

例子:Sarah dances

词汇特征:

1
2
dance [V, uN]
Sarah [N]

dance 需要一个 [N] 成分,Sarah 正好具有 [N]

Sarahdance 是姐妹节点,所以 dance[uN] 得到检查并删除。这里的 Merge 同时完成两件事:

  1. 构造一个新的层级成分;
  2. 满足谓词对论元类别的选择要求。

Merge 的性质一:二分分枝

Merge 每次只组合两个元素,因此由 Merge 新建的成分恰好有两个子节点。这叫作二分分枝(binary branching):

下列三分结构不是一次 Merge 直接建立的:

如果谓词需要多个论元,多个选择特征也不能同时在一个三分结构中完成检查。结构必须通过多次 Merge 逐步构造。

collect 的逐步推导

考虑:

1
John collects stamps.

初始词汇特征:

1
2
3
collect [V, uN, uN]
stamps [N]
John [N]

collect 是及物谓词,需要两个名词性论元。它的两个 [uN] 不能在同一步中一起检查。

第一步:Merge collectstamps

一个 [uN]stamps [N] 在姐妹关系下匹配并被删除,剩下一个未检查的 [uN]。这一步形成中间成分 [collect stamps]

第二步:Merge John 和已有成分

剩余的 [uN]John [N] 匹配并被删除。最终得到完整结构:

1
[John [collect stamps]]

这种按照每一次 Merge 记录结构变化的过程叫作推导(derivation)。

Merge 的性质二:扩展条件

Merge 还必须遵守扩展条件(Extension Condition):

Merge 只能作用于一个已有成分的根节点。

假设已有两个成分:

可以把两个根节点 ZR Merge,得到更大的结构:

但不能在 Z 内部的 XYST 之间任意插入新的连接。扩展条件的作用是保证结构从外部根节点逐步扩展,而不是随意改写已经建立的内部层级。

综合例子:Ben thinks about linguistics

句法成分

1
[Ben [thinks [about linguistics]]]

谓词和论元可以列为:

元素 类型 作用
think 谓词 选择一个名词性主语和一个介词性补语
about 谓词/介词 选择一个名词性论元
Ben 论元 think 的名词性论元
linguistics 论元 about 的名词性论元
about linguistics 成分 think 选择的介词性论元

词汇特征:

1
2
3
4
Ben          [N]
think [V, uN, uP]
about [P, uN]
linguistics [N]

第一步:Merge aboutlinguistics

about [P, uN] 选择 linguistics [N]

about[uN] 被检查,形成完整的介词短语:

1
[about linguistics]

第二步:Merge thinkabout linguistics

think [V, uN, uP] 选择一个 [P] 成分:

think[uP] 被检查,剩下要求名词性主语的 [uN]

第三步:Merge Ben 和已有成分

Ben [N] 满足 think 剩余的 [uN]

最终得到:

1
[Ben [thinks [about linguistics]]]

这个例子同时展示了二分分枝、特征检查、扩展条件以及“结构先逐步建立、线性顺序后处理”的思想。


短语结构:投射层级与术语

最小投射、中间投射和最大投射

句法学家用一组术语描述谓词投射的不同阶段,也就是谓词已经“完成”到什么程度。

最小投射(minimal projection)

不分枝的成分,即终端节点,叫作最小投射。它通常是一个词或中心语,记作:

1
X / X0 / Xmin

最小投射带有 [+min] 属性。例如:

1
2
3
John [N]
collect [V]
stamps [N]

最大投射(maximal projection)

不再带有未检查的 c-selection 特征的成分叫作短语最大投射,记作:

1
XP / Xmax

它带有 [+max] 属性。一个最大投射已经满足中心语的选择要求,因而可以作为一个完整成分继续参与更高层结构的构建。

中间投射(intermediate projection)

既不是最小投射,也不是最大投射的成分叫作中间投射,通常记作:

1
X'

它是分枝结构,但仍然保留未检查的 c-selection 特征,因此具有 [−min, −max] 属性。

一个词可以同时是最小投射和最大投射

如果一个词本身没有需要继续检查的 c-selection 特征,那么它既是不分枝的最小投射,也是已经完整的最大投射:

1
[+min, +max]

所以“最小”和“最大”描述的是不同维度:

  • 最小投射关注是否分枝;
  • 最大投射关注是否还存在未满足的选择要求。

实践中,“短语”通常只指复杂的、分枝的最大投射。单个词虽然可以同时是最小和最大投射,但通常直接称为 NV 等,而不特别称为 NPVP

例子:John collects stamps

可以把各个节点的投射等级列出来:

成分 投射等级 原因
John 最小且最大投射,N 单个词且没有未满足的选择要求
stamps 最小且最大投射,N 单个词且没有未满足的选择要求
collect 最小投射,V 中心语本身,仍带有选择特征
[collect stamps] 中间投射,V' 已合并一个论元,但还保留另一个 [uN]
[John collects stamps] 最大投射,VP 所有选择要求都已检查

简化括号结构:

1
[VP John [V' collect stamps]]

更准确地说,collect 的选择特征会随着每次 Merge 被逐步检查;因此同一个词在不同推导阶段所处的投射层级不同。

例子:Ben thinks about linguistics

同样可以分析:

成分 投射等级 说明
linguistics 最小且最大投射,N 名词词项
about 最小投射,P 介词中心语
[about linguistics] 最大投射,PP about[uN] 已检查
think 最小投射,V 动词中心语
[think about linguistics] 中间投射,V' 介词性论元已合并,但主语要求尚未满足
Ben 最小且最大投射,N 名词性主语
[Ben thinks about linguistics] 最大投射,VP 动词的选择要求全部满足

补足语(complement)与指定语(specifier)

短语内部的论元根据它们与中心语的合并顺序和结构位置,可以分为补足语和指定语。

补足语

补足语是和中心语最先组合的论元,即中心语的第一论元。它是中心语的姐妹节点,缩写为 Comp

在及物动词短语中,动词的补足语通常就是宾语:

这里 stampscollect 的补足语,也是句子的宾语。

指定语

指定语是中心语之后与其组合的第二个、第三个或更高序位的论元,通常位于中间投射 X' 的外部,形成更大的 XP。缩写为 Spec,XP

最常见的短语只有一个指定语,但理论上一个短语可以有多个指定语;相反,一个中心语通常只有一个补足语。

在本讲此阶段的及物动词结构中,动词的指定语通常就是主语:

后续修正:这是 Day 5 的暂定分析。Day 6–7 引入 little v 和 VP-shell 后,施事主语改为在 Spec,vPv Merge;在双宾语构式中,Spec,VP 则可由 Goal 占据。因此不要把“Spec,VP = 主语”当作本课程最终结构。

  • JohnV' 的指定语,也是句子的主语;
  • stampscollect 的补足语,也是句子的宾语。

Ben thinks about linguistics 中的结构关系

该句中的论元关系可以写成:

相应地:

  • linguisticsabout 的补足语;
  • about linguisticsthink 的补足语;
  • Benthink 的指定语。

合并顺序不等于线性顺序

“补足语是第一个与中心语合并的论元”说的是推导顺序,不是句子中从左到右的发音顺序。

在:

1
John collects stamps.

stamps 是第一个与 collect Merge 的论元,因此是补足语;John 后来才与已有的 [collect stamps] 结构合并,因此是指定语。

但英语的线性顺序是:

1
John -> collects -> stamps

也就是说,补足语 stamps 并不是线性顺序中的第一个词。补足语和指定语的识别依赖层级结构和推导历史,而不是依赖词语在句子中的左右位置。


线性化:从层级结构到词序

Merge 不决定线性顺序

Merge 构建的是层级结构,而不是从左到右的词序。一个二分结构的两个子节点可以按两种方向线性化:

其中 < 表示在线性发音中“位于……之前”。

讲义的基本假设是:

Merge 只规定成分之间的层级关系,不规定它们的线性顺序;词序由语言特定的线性化规则决定。

因此,两种语言可以有相同的层级结构和相同的中心语--补足语、指定语--中心语关系,却通过不同的线性化规则产生不同的表面词序。

线性化作用于姐妹节点

以一个及物动词短语为例:

这里有两组必须线性化的姐妹节点:

结构关系 姐妹节点 线性化问题
补足语关系 VNP2 补足语位于动词左侧还是右侧?
指定语关系 NP1V' 指定语位于谓词左侧还是右侧?

NP2 是动词 V 的补足语;NP1V' 的指定语。线性化规则并不改变这些层级关系,只决定每一对姐妹节点在发音时的先后。

英语:SVO

英语的基本及物句词序是主语--动词--宾语(SVO)。对应的线性化规则是:

1
2
V < complement
specifier < V'

即:

  1. 补足语位于动词右侧;
  2. 指定语位于谓词 V' 左侧。

将两条规则应用于上面的结构,得到:

1
specifier < verb < complement

例如:

1
2
John collects stamps.
John < collects < stamps

John 是指定语(主语),stamps 是补足语(宾语);SVO 只是英语把同一层级关系读出的方式。

日语:SOV

日语的基本及物句通常呈现主语--宾语--动词(SOV)词序:

1
2
3
Hanako ga Taro o tataku.
Hanako NOM Taro ACC beat
“花子打太郎。”

其中:

  • Hanako 是指定语(主语);
  • Taro 是动词 tataku 的补足语(宾语);
  • ga 是主格标记(NOM);
  • o 是宾格标记(ACC)。

日语的线性化规则可以写作:

1
2
complement < V
specifier < V'

与英语相比,指定语都在线性上位于 V' 左边;差别在于日语把补足语放在动词左侧,而英语把补足语放在动词右侧。

马达加斯加语:VOS

马达加斯加语的例子显示了动词--宾语--主语(VOS)词序:

1
2
3
Manasa lamba ny lehilahy.
wash.PRES clothes the man
“这个男人洗衣服。”

其中:

  • manasa 是动词“洗”;
  • lamba 是补足语(衣服);
  • ny lehilahy 是指定语(这个男人);
  • PRES 表示现在时(present)。

相应的线性化规则是:

1
2
V < complement
V' < specifier

这一次,补足语仍在动词右侧,和英语一致;但指定语位于 V' 右侧,因此得到 VOS,而不是 SVO。

三种语言的对比

三种语言可以共享相同的抽象层级结构:

差别来自姐妹节点的线性化方向:

语言 指定语与 V' 的顺序 动词与补足语的顺序 结果词序
英语 Spec < V' V < Comp SVO
日语 Spec < V' Comp < V SOV
马达加斯加语 V' < Spec V < Comp VOS

这正是本讲的重要区分:层级结构是句法构建的结果,线性顺序是语言特定规则施加在层级结构上的结果。


语际例句:行间注释

分析自己不会说的语言时,语言学常使用行间注释(interlinear glosses)。通常包含三行:

  1. 原语言中的例句;
  2. 词汇意义和语法信息的逐词注释;
  3. 翻译。

例如:

1
2
3
Hanako ga Taro o tataku.
Hanako NOM Taro ACC beat
“花子打太郎。”

第二行中的大写缩写通常表示形态句法特征,而不是原语言中的单词:

缩写 含义
NOM 主格(nominative)
ACC 宾格(accusative)
PRES 现在时(present)

行间注释的常用规范由莱比锡注释规则(Leipzig Glossing Rules)规定。讲义给出的参考链接是:https://www.eva.mpg.de/lingua/resources/glossing-rules.php


附录:X-bar 理论

历史背景

X-bar 理论是 20 世纪 80 年代常见的一种短语结构理论。它假定每一个词汇性中心语,即使没有选择任何论元,也必须按照同一种固定模板投射:

其中:

  • X 是中心语;
  • YP 是补足语位置;
  • ZP 是指定语位置;
  • 括号表示相应位置可以为空。

为什么它会产生空投射

这种模板要求每个中心语总是投射出 X'XP 层级,即使该中心语没有补足语或指定语。例如,一个单独的名词 John 或一个不及物动词 fall 也被迫拥有额外层级:

这会引入不含实际 Merge 操作、只为满足模板而存在的“空”投射层级。

当代课程中的立场

讲义明确说明:这种“每个词汇中心语都必须预先展开为完整 X-bar 模板,即使相应层级没有独立 Merge 理由”的强制性假设,在本课程采用的当代分析中已经放弃。

这里被放弃的是强制生成完整骨架和空投射的假设,并不意味着 X'XP、补足语(complement)、指定语(specifier)等投射术语本身不能继续使用。事实上,后续的 vPTPCP 分析仍然使用这些结构关系。

本课程采用的较简化观点是:

  • 投射层级由实际发生的 Merge 和未满足/已满足的 c-selection 特征决定;
  • 不需要为了套用一个固定模板而额外假设空的 X'XP 节点;
  • 因此,单词可以在没有选择特征时同时是最小投射和最大投射。

这也解释了为什么本讲的短语结构术语以“是否分枝”和“选择要求是否完成”为基础,而不强制所有词都具有相同数量的投射层级。


附录二:莱比锡标注规则

依据:Leipzig Glossing Rules 与本地整理的 莱比锡标注规则.md

这套规则解决什么问题

莱比锡标注规则(Leipzig Glossing Rules)是一套用于行间逐形态素注释(interlinear morpheme-by-morpheme glosses)的通行约定。它的作用是让读者在不懂原语言的情况下,仍然能够看出例句中各个词和形态素的词汇意义、语法类别与形态结构。

它提供的是书写和缩写的标准化方法,而不是替研究者决定唯一正确的语言分析。不同作者可以按研究对象增加或调整缩写,但应在文中明确定义非标准符号。

基本的三行格式

行间注释一般包括:

  1. 原语言例句;
  2. 与原句逐词、逐形态素对应的注释;
  3. 自然语言翻译,通常用单引号或中文引号标出。

下面是一个格式示意:

1
2
3
ev-ler-im
house-PL-1SG.POSS
“我的房子们。”

其中第一行的 ev-ler-im 是原语言形式;第二行说明词根、复数和第一人称单数领属关系;第三行提供可读的中文翻译。例句中的逐词注释应与原语言词语在垂直方向上左对齐。

核心原则

1. 逐词对齐

原语言例句和注释行按词左对齐。每个原语言词应与自己的词汇翻译或语法标签对应:

1
2
3
Hanako ga  Taro o   tataku.
Hanako NOM Taro ACC beat
“花子打太郎。”

这类对齐让读者能立即看出 ga 标记主格、o 标记宾格。

2. 形态素边界必须对应

如果一个词可以切分为形态素,原语言行和注释行都使用连字符 -,且两行中的连字符数量必须一致:

1
2
book-s
book-PL

附着词(clitic)的边界使用等号 =,而不是连字符:

1
2
priest=and
priest=and

这里的约定不是说所有黏着成分都是附着词,而是要求已分析为附着词的成分在原语言行和注释行中都用 = 标出。

3. 语法标签通常大写

语法形态素通常用大写缩写表示;有独立词汇意义的部分则可直接用小写词汇翻译:

1
2
walk-ed
walk-PST

例如 PST 表示过去时,PL 表示复数,NOM 表示主格。若研究中使用非标准缩写或为了简洁而缩写,应在首次出现处说明其含义。

4. 一个原语言形式对应多个标签

当一个原语言形式同时表达多个语法信息时,默认用句点 . 连接标签:

1
2
island-GEN.PL
go-PRS.1PL

人称和数按“人称 + 数”排列时不使用句点:

1
2
3
1SG
2PL
3DU

但它们与时、体、格等其他标签组合时仍可用句点分开,如 PST.1PL


常用边界符号速查

符号 用途 示例 说明
- 可切分形态素的边界 book-PL 原语言行与注释行的连字符数应相同
= 附着词边界 priest=and 原语言行和注释行都使用等号
. 一个形式对应多个注释 GEN.PL 默认的一对多标注符号
_ 不可分的复合词汇释义 come_out 形式和意义都不切分,只是元语言缺少单词对应项
; 一个不可分形式有多个可区分属性 GEN;PL 可选写法,强调原语言形式未切分
: 不展示原语言中的可分边界 that:DAT;SG 可选写法,用于保留原文完整性
\ 形态音系交替 father\PL 如元音变化、辅音变异或声调变化
> 同一词缀编码施事和受事 2DU>3SG 前者为施事型论元,后者为受事型论元
[ ] 无显性形式的形态素 boy[NOM.SG] 也可在原语言行使用
( ) 固有但不显性的类别 tree(G4) 常用于语法性、名词类等
< > 中缀 b<ACTFOC>uy 原语言形式和注释都用尖括号
~ 重叠 IPFV~buy 表示复制成分与词干的关系

不显性和特殊形态结构

零形态素

当分析要求标明一个没有发音形式的语法属性时,可以将注释放进方括号,或显式写出零形式 Ø

1
2
3
4
5
boy
boy[NOM.SG]

boy-Ø
boy-NOM.SG

方括号表示注释中的成分没有对应的可听见形态素;Ø 则把零形式显式放进原语言行。

固有类别

某些语言的名词类别或语法性并不总有独立的可见标记。若需要在注释中写出这种固有属性,可使用圆括号:

1
tree(G4)

这里 G4 可以表示“第四名词类”;圆括号表明它是固有、非显性的类别信息。

环缀和双部分词干

环缀或双部分词干可以重复同一个语法标签,也可以以 CIRCSTEM 等标签概括其中一部分:

1
2
PTCP-see-PTCP
PTCP-see-CIRC

关键在于:文中应选择一种分析方式并保持一致,让读者知道两端形式属于同一个形态单位。

中缀与重叠

中缀嵌入词干内部,用尖括号表示:

1
b<ACTFOC>uy

重叠不是普通词缀化,用波浪号标记复制成分与词干:

1
IPFV~buy

本课程常见缩写

下表列出阅读本课程和一般语言学例句时最常遇到的标签。完整清单见 莱比锡标注规则.md 及官方规则的附录。

类别 常用缩写 含义
人称 123 第一、第二、第三人称
SGPLDU 单数、复数、双数
NOMACCGENDATOBLERGABS 主格、宾格、属格、与格、斜格、作格、绝对格
时间 PRSPSTFUT 现在时、过去时、将来时
IPFVPFVPROGPRF 未完成体、完成体、进行体、完成时
语气 INDSBJVIMPIRR 陈述式、虚拟式、祈使式、非现实式
句法/语态 AUXCOPCOMPPASSCAUS 助动词、系词、补语标记、被动、使役
名词短语 DETDEMARTDEFINDFPOSS 限定词、指示词、冠词、定指、不定指、领属
其他 NEGNMLZRELTOPFOC 否定、名词化、关系标记、话题、焦点