返回首页

新闻改写中的风格语调:规则限制

本文分析自动新闻改写的方面方法的限制。测试显示精确结构,但通过词汇的语调传达较弱。基于示例提出流水线改进。

改写限制:为什么 'Boy' 而非 'Teenager' 未被编码
Advertisement 728x90

改写中的风格之声:为何规则无法捕捉语调

自动化新闻改写系统将风格分解为多个方面:结构、语调、词汇、标题及其他组成部分。每个方面都会分析目标媒体的样本文本,并生成规则描述。这些规则被编译成提示生成配置文件。这种方法能准确复制形式特征,但在传达文本的“声音”——即创造情感影响的隐含词汇选择——方面却有所不足。

这个问题在测试一个具有鲜明特色的出版物时显现出来。系统能生成正确的新闻报道,但缺乏特色语调。

真实案例测试

我们基于“丰坦卡”的风格训练了模型。输入文本:乌法一名16岁青少年因计划在教堂实施恐怖袭击并招募高中生而被拘留。来自调查委员会的原文:

Google AdInline article slot

在乌法,一名青少年被拘留,他招募了高中生并计划在东正教教堂实施恐怖袭击。联邦安全局拘留了来自巴什科尔托斯坦的一名16岁男孩……

系统生成:

在乌法,一名16岁青少年因计划在东正教教堂实施恐怖袭击而被拘留。联邦安全局拘留了来自巴什科尔托斯坦的一名16岁男孩。据调查委员会称,该青少年招募了高中生……

Google AdInline article slot

原始“丰坦卡”报道:

在乌法,一名学生被拘留;他涉嫌受指使者命令准备在教堂实施恐怖袭击。据执法部门称,这名男孩已被招募。

改写版本在结构和事实上是正确的,但失去了关键效果:用“男孩”而非“青少年”创造了儿童形象与恐怖威胁之间的对比。这不是风格规则,而是上下文词汇选择。

Google AdInline article slot

方面捕捉了什么,遗漏了什么

方面描述:

  • 句子长度和导语结构。
  • 被动语态频率。
  • 来源归属规则。
  • 基于频率的词汇偏好。

它们未捕捉:

  • 用于情感对比的同义词选择(“男孩”与“青少年”)。
  • 嵌入式距离(“据调查称”作为不引人注目的信号)。
  • 冲突语域以增强语调。

语调方面输出“中性信息性带对话元素”——形式上正确但缺乏细微差别。

规则在传达声音方面的局限性

规则适用于约束条件:“用彼得堡而非圣彼得堡”,每文本归属一次。它们设定结构:以事实开头,标题带结果。但声音关乎局部决策:句子上下文中的一个词。

尝试形式化(“高正式性旁降低正式性”)失败:这取决于主题和上下文。通用指令不存在——声音无法打包成规则。

解决方案与流程改进

完全的声音传递无法实现。当前措施:

  • 将示例增加到每个主题10-15个(从犯罪到犯罪)。
  • 检查风格禁令(先前被忽略)。
  • 控制事实提取完整性(验证所有事实)。
  • 按标签而非随机选择示例。

这些修复显著改善了结构和准确性。声音通过示例模仿但无法保证。

对于MVP:准确结构+近似声音优于完全的身份幻觉。

关键要点

  • 方面方法对于没有强烈“声音”的中层出版物是理想的——它们的风格简化为规则。
  • 具有身份特色的顶级出版物(如“丰坦卡”)揭示了上限:模仿而非复制。
  • 示例比抽象描述对词汇细微差别更有效。
  • 声音是编辑直觉,经多年发展;模型复制但不理解。
  • 流程正在演变:从规则到主题样本演示。

最终结论

改写系统已在结构和事实上达到准确性。转向“与原文一模一样”需要不同方法:专注于示例而非规则。在复杂风格上测试立即显示了限制,从而调整了产品预期。

— Editorial Team

Advertisement 728x90

继续阅读