改写中的风格之声:为何规则无法捕捉语调
自动化新闻改写系统将风格分解为多个方面:结构、语调、词汇、标题及其他组成部分。每个方面都会分析目标媒体的样本文本,并生成规则描述。这些规则被编译成提示生成配置文件。这种方法能准确复制形式特征,但在传达文本的“声音”——即创造情感影响的隐含词汇选择——方面却有所不足。
这个问题在测试一个具有鲜明特色的出版物时显现出来。系统能生成正确的新闻报道,但缺乏特色语调。
真实案例测试
我们基于“丰坦卡”的风格训练了模型。输入文本:乌法一名16岁青少年因计划在教堂实施恐怖袭击并招募高中生而被拘留。来自调查委员会的原文:
在乌法,一名青少年被拘留,他招募了高中生并计划在东正教教堂实施恐怖袭击。联邦安全局拘留了来自巴什科尔托斯坦的一名16岁男孩……
系统生成:
在乌法,一名16岁青少年因计划在东正教教堂实施恐怖袭击而被拘留。联邦安全局拘留了来自巴什科尔托斯坦的一名16岁男孩。据调查委员会称,该青少年招募了高中生……
Google AdInline article slot
原始“丰坦卡”报道:
在乌法,一名学生被拘留;他涉嫌受指使者命令准备在教堂实施恐怖袭击。据执法部门称,这名男孩已被招募。
改写版本在结构和事实上是正确的,但失去了关键效果:用“男孩”而非“青少年”创造了儿童形象与恐怖威胁之间的对比。这不是风格规则,而是上下文词汇选择。
方面捕捉了什么,遗漏了什么
方面描述:
- 句子长度和导语结构。
- 被动语态频率。
- 来源归属规则。
- 基于频率的词汇偏好。
它们未捕捉:
- 用于情感对比的同义词选择(“男孩”与“青少年”)。
- 嵌入式距离(“据调查称”作为不引人注目的信号)。
- 冲突语域以增强语调。
语调方面输出“中性信息性带对话元素”——形式上正确但缺乏细微差别。
规则在传达声音方面的局限性
规则适用于约束条件:“用彼得堡而非圣彼得堡”,每文本归属一次。它们设定结构:以事实开头,标题带结果。但声音关乎局部决策:句子上下文中的一个词。
尝试形式化(“高正式性旁降低正式性”)失败:这取决于主题和上下文。通用指令不存在——声音无法打包成规则。
解决方案与流程改进
完全的声音传递无法实现。当前措施:
- 将示例增加到每个主题10-15个(从犯罪到犯罪)。
- 检查风格禁令(先前被忽略)。
- 控制事实提取完整性(验证所有事实)。
- 按标签而非随机选择示例。
这些修复显著改善了结构和准确性。声音通过示例模仿但无法保证。
对于MVP:准确结构+近似声音优于完全的身份幻觉。
关键要点
- 方面方法对于没有强烈“声音”的中层出版物是理想的——它们的风格简化为规则。
- 具有身份特色的顶级出版物(如“丰坦卡”)揭示了上限:模仿而非复制。
- 示例比抽象描述对词汇细微差别更有效。
- 声音是编辑直觉,经多年发展;模型复制但不理解。
- 流程正在演变:从规则到主题样本演示。
最终结论
改写系统已在结构和事实上达到准确性。转向“与原文一模一样”需要不同方法:专注于示例而非规则。在复杂风格上测试立即显示了限制,从而调整了产品预期。
— Editorial Team
暂无评论。