尽管大语言模型在人工智能多个领域显示出极强的通用性,但理解其内部机理仍缺乏可规模化的手段和理论,这给下一代大模型的设计和优化带来了挑战。自2023年以来,机理可解释性为大语言模型的规模化可解释性带来全新的活力,为分析大模型的行为和机理提供了很好的工具。报告将介绍我们在大语言模型可解释性方面的研究进展,并展望可解释性技术对大模型训练数据、幻觉、安全性等重要问题的结合点。
多模态虚假信息是指通过文本、图像等多种渠道传播的虚假内容。此类信息在社交媒体平台上尤为猖獗,因其制作成本低且能快速触达海量受众。现有检测方法普遍存在鲁棒性不足、可解释性欠缺等问题,而这些特性恰恰是人工智能系统成功应用于虚假信息检测实践的关键要素。本报告介绍若干基于深度学习的新型解决方案。所提出的方法植根于两大基础研究:通过神经符号算法设计的可解释人工智能,以及大语言模型(LLM)技术。此外,深入探讨多模态虚假信息检测在泛化能力与可迁移性方面的未来研究方向。
虽然近年来神经网络的可解释性研究得到了广泛的关注,但是大部分可解释性研究依然停留在工程技术层面,尚缺少相对严谨的理论体系从根本机理层面统一解释神经网络的知识表达和其表征性能。本报告介绍张拳石团队所提出的基于等效交互的可解释性理论体系,以及如何在等效交互理论体系下严谨地量化神经网络所建模的“交互概念”表征,如何理论证明解释的严谨性,如何实现对大模型精细决策逻辑的评测,如何对大模型安全性进行量化评估。
大模型通过学习大量数据获得强大的生成能力,但由于数据的复杂性,模型会产生看似真实却实质上错误的信息,也就是“幻觉”问题。本报告介绍图算一体的大模型的可信增强技术,使大模型在应用中具有更强的可靠性与可解释性。同时报告还将进一步分析大模型在碎片化信息整合、事件脉络分析等一系列应用中的技术模式,并进一步探讨以大模型为智能底座的应用框架与标准体系。