近日,国际数据库领域顶级学术会议——SIGMOD 2026 在印度班加罗尔召开。平凯星辰与华东师范大学、西北农林科技大学合作的最新研究成果《TiInsight: A SQL-based Automated Exploratory Data Analysis System through Large Language Models》正式在大会发表。
该研究提出了一套基于大语言模型的端到端自动化探索性数据分析(EDA)系统 TiInsight,用户只需用自然语言提问,系统即可自动完成从意图理解到 SQL 生成再到可视化图表输出的全流程。
研究背景:数据探索的三大痛点
探索性数据分析(EDA)是企业数据洞察的核心环节,但实际操作中存在三大痛点:
- SQL 能力门槛高。 数据分析师需要根据复杂的数据库 Schema 手动编写 SQL 查询语句,不仅要求扎实的数据库知识,还需要对业务数据结构有深入理解。
- 可视化选型难。 编写完 SQL 后,还需要为查询结果选择合适的可视化图表类型——柱状图、折线图、散点图、热力图……选对了事半功倍,选错了可能完全误导决策。
- 跨领域泛化能力弱。 现有的 Text-to-SQL 系统大多针对特定领域的数据集训练,一旦切换到不同行业的数据库,性能往往大幅下降。现有方法通常需要针对不同数据领域微调大模型,耗时且成本高昂。
- 用户意图不明确。 在真实业务场景中,用户面对不熟悉的数据集时,往往难以精确表达分析需求。比如用户问"增长率是多少?"——缺少时间参数,需要系统自动澄清和补全。
核心突破:TiInsight 的自动化分析架构
TiInsight 是一套基于大语言模型的端到端自动化跨领域 EDA 系统,其核心理念是:让 LLM 理解数据结构,让系统自动完成从提问到图表的全流程。 用户无需具备专业 SQL 能力,即可完成复杂的数据探索。
TiInsight 的系统架构包含五个核心组件:
- HDC(分层上下文):让 LLM "读懂"数据库
面对复杂的数据库 Schema,TiInsight 提出了分层上下文(Hierarchical Data Context,HDC)机制。通过 LLM 自动生成数据库的多层次语义描述——从列摘要、表描述、表间关系到数据库整体摘要,将数百张表、上千个字段的关系凝练为结构化语义信息。HDC 采用并行分组策略处理列摘要,并利用向量数据库加速表间关系发现,实现了高效的跨领域数据理解。
- 问题澄清与分解:把模糊问题变精准
用户提问往往不够明确。TiInsight 通过 LLM 对用户意图进行澄清和分解——识别问题中的歧义,提供可能的解释,并判断是否需要将问题拆解为多个子任务。比如"增长率是多少?"会被自动补全为"今年的增长率是多少?"。
- TiSQL:从自然语言到精准 SQL
TiSQL 是 TiInsight 的核心查询引擎。基于 HDC 提供的上下文信息,TiSQL 采用粗粒度到细粒度的两阶段 schema 映射方法,将用户问题精准关联到相关表和字段,再通过 LLM 生成 SQL 语句。生成的 SQL 还会经过自修正链(self-refinement chain),通过 EXPLAIN 和实际执行反馈进行多轮迭代优化,确保最终输出的 SQL 准确可执行。
- TiChart:自动生成可视化图表
查询结果出来后,TiChart 结合规则方法与 LLM,根据数据特征自动选择最合适的可视化类型——趋势分析用折线图、占比分析用饼图、多维对比用柱状图。针对复杂的子任务场景,TiChart 能灵活推荐多种可视化方案,用户可自由切换。
- 交互式 Web 界面
TiInsight 提供了直观的对话式 Web 界面(https://www.tiinsight.chat),用户可以导入数据集、用自然语言提问、查看 HDC 分析结果、书签保存和对比不同探索结果,并支持在不同 LLM 之间灵活切换。
真实场景验证
TiInsight 已在平凯星辰的生产环境中部署运行。论文展示了两个代表性场景:
- 金融数据集: 分析美国联邦基金利率对经济指标的影响,验证了系统在 PoC 阶段业务场景中的实用性
- BIRD 数据集: 验证了系统在标准 Text-to-SQL 基准上的跨领域能力
这意味着,TiInsight 能够让不具备专业 SQL 能力的业务人员,也能像数据分析师一样完成复杂的数据探索和分析工作。
产学研深度融合,推动数据分析智能化
此次合作论文入选 SIGMOD 2026 Companion,展现了平凯星辰在"AI + 数据库"领域的持续探索。从 TiDB 分布式数据库到 TiInsight 智能分析系统,平凯星辰正在构建从数据存储到数据洞察的完整技术链条。
未来,平凯星辰将继续深化与高校的产学研合作,推动大语言模型与数据库技术的深度融合,为用户带来更智能、更高效的数据分析体验。