抽取式与生成式

wen IT资讯 25

本文目录导读:

抽取式与生成式

  1. 核心对比表
  2. 更直观的例子
  3. 风险对比:幻觉 vs 忠实
  4. 实际应用对比
  5. 总结:如何选择?

这是一个非常核心的自然语言处理(NLP)概念区分。

  • 抽取式是从原文中复制出已有的片段。
  • 生成式是根据理解重新写出

下面从多个角度为你详细对比。

核心对比表

特征 抽取式 (Extractive) 生成式 (Abstractive)
工作原理 从源文本中选择最重要的句子或短语,直接拼接。 理解源文本的语义,然后用新的词汇和句式进行总结或改写。
完全由原文中的词语组成。 可能包含原文中不存在的词语、同义词或全新的句子结构。
忠实度 严格忠于原文,不会添加或歪曲事实。 中到高,意图忠于原文,但可能存在“幻觉”(生成原文没有的信息),或改变细微含义。
流畅度 低到中,只是句子拼接,可能缺乏连贯性、逻辑跳跃、代词指代不清。 ,语法正确,句子通顺,逻辑连贯,更像人写的总结。
多样性 ,对于同一段文本,输出结果相对固定。 ,可以生成多种不同的、同样准确的总结。
计算资源 ,算法相对简单,速度较快。 ,需要复杂的深度学习模型(如Transformer/GPT/PaLM),训练和推理成本高。
核心风险 无法进行高级推理、总结或信息重组。 可能“幻觉”,编造事实;可能包含偏见;控制难度更高。
适用数据 适合事实性、关键信息明确、结构清晰的文本。 适合需要理解、概括、改写或创意性表达的文本。

更直观的例子

假设原文是:“昨天下午,清华大学的王明教授在人工智能大会上,展示了他们团队研发的最新语音识别模型,该模型在噪音环境下准确率比之前提升15%。”

  • 抽取式摘要

    • “清华大学的王明教授在人工智能大会上,展示了他们团队研发的最新语音识别模型。”
    • 特点:句子直接从原文复制,准确但可能不连贯(比如只取第一句就丢失了关键性能指标)。
  • 生成式摘要

    • “清华王明教授展示的AI语音模型,在噪音下识别准确率提高了15%。”
    • 特点:将两句话信息压缩、重组,使用了“AI”、“提高了”等新词,更简洁、流畅。
    • 另一个可能的生成式摘要: “王明团队的新语音模型在AI大会上亮相,抗噪能力取得突破性进展。”
    • 注意:像“突破性进展”这种概括性描述,是“抽取式”无法做到的。

风险对比:幻觉 vs 忠实

  • 抽取式的风险是忠实但低效,比如抓取了一些琐碎或不重要的句子,导致摘要看起来像关键词堆砌,或者把“不是A而是B”这种否定关系直接截断,变成“是A”。
  • 生成式的风险是流畅但错误(幻觉),这是最需要警惕的。
    • 原文:“王明教授展示了语音识别模型。”
    • 生成式幻觉:“王明教授展示了最新的图像识别模型。”(张冠李戴)
    • 生成式幻觉:“王明教授在会上宣布该模型将于下月商用。”(凭空捏造)

实际应用对比

应用场景 推荐用抽取式 推荐用生成式
新闻摘要 金融快讯、法律判例、科研论文摘要 娱乐新闻、博客总结、个性化新闻简报
文档处理 法律合同关键条款提取、医疗报告结论提取 邮件自动回复、聊天机器人回答、创意写作辅助
问答系统 事实型问答(“苹果的CEO是谁?” -> 从维基百科复制) 解释型问答(“什么是相对论?” -> 用易懂的话重新解释)
对话系统 客服FAQ检索(直接返回标准答案) 开放式聊天(不仅回答,还能引伸话题、表达情感)

如何选择?

  1. 当需要高准确性、可追溯、信息不能出错时,选抽取式

    法律、医疗、金融等领域的文档摘要、事实核查。

  2. 当需要流畅、自然、易于理解、能呈现更高层次的概括时,选生成式

    面向大众的新闻摘要、智能助手、聊天机器人、创意内容生成。

  3. 最佳实践:很多现代应用(如ChatGPT、New Bing)实际采用混合策略(Hybrid Approach)
    • 先用抽取式方法找出最关键的句子或片段(检索)。
    • 再将这些片段作为上下文,交给生成式模型去进行理解、改写和总结(生成)。
    • 这样既利用抽取式的准确性来减少幻觉,又利用了生成式的流畅性来提升可读性。

抱歉,评论功能暂时关闭!