IndicBankBench:评估印度零售银行业务中语言模型助手的安全性和可靠性


研究人员发布了IndicBankBench基准,包含799个案例,用于评估印度零售银行业务中语言模型助手的安全性和可靠性。该基准涵盖五个运营领域,旨在检测助手在处理账户特定信息时的错误,如重复询问已有信息、依赖过时上下文、选择错误账户或提供无效值。这一工具将帮助开发者识别和改进模型在银行业务中的表现

研究人员发布了IndicBankBench基准,包含799个案例,用于评估印度零售银行业务中语言模型助手的安全性和可靠性。该基准涵盖五个运营领域,旨在检测助手在处理账户特定信息时的错误,如重复询问已有信息、依赖过时上下文、选择错误账户或提供无效值。这一工具将帮助开发者识别和改进模型在银行业务中的表现,提升用户体验和系统安全性。

推荐理由:为印度零售银行业务提供首个大规模评估基准,填补了语言模型在特定行业应用中的评测空白。

来源:arXiv cs.AI|原文时间:2026-09-25

原文链接:https://arxiv.org/abs/2609.29167

原题:IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking



扫描二维码,在手机上阅读

Google推出Gemini 3.8实时虚拟形象功能

比尔·盖茨呼吁立法监管AI开发

评 论
评论已关闭