sql-llm-benchmark
sql-llm-benchmark项目是一个测评大模型 SQL 能力的脚本工具和排行榜列表,旨在评估大型语言模型 (LLM) 在 SQL 相关任务方面的能力。它支持对 LLM 的 SQL 理解、方言转换和 SQL 优...
标签:AI大模型 sql-llm-benchmarksql-llm-benchmark项目是一个测评大模型 SQL 能力的脚本工具和排行榜列表,旨在评估大型语言模型 (LLM) 在 SQL 相关任务方面的能力。它支持对 LLM 的 SQL 理解、方言转换和 SQL 优化能力进行深入测评,集成了 MCP (Model Context Protocol) 网络搜索功能来增强裁判模型的判断准确性,并最终生成详细的测评报告,通过前端界面直观展示。
可以在sql-llm-benchmark的网站上查看排行榜和详细测评报告
- sql-llm-benchmark官网入口网址:https://sql-llm-leaderboard.com/
- sql-llm-benchmark开源项目地址:https://github.com/actiontech/sql-llm-benchmark
- sql-llm-benchmark中文介绍:链接
特性
- 多维度评估: 支持 SQL 理解、方言转换和 SQL 优化三大核心能力。
- 智能裁判增强: 集成 MCP 网络搜索功能,裁判模型可实时搜索数据库文档和最佳实践,显著提升判断准确性。
- 灵活的数据集: 允许用户自定义和扩展测评数据集。
- 可配置的 LLM: 支持集成多种大模型作为被测对象和裁判模型。
- 自动化报告生成: 自动生成详细的测评报告,包括总分、案例详情和交互日志。
- 直观的前端展示: 提供排行榜列表和详细报告页面,方便用户查看和分析结果。
- 可扩展架构: 易于添加新的 LLM 接口、HTTP 接口和测试用例。
sql-llm-benchmark项目旨在通过科学、严谨的测评体系,全面评估大语言模型(LLM)在SQL处理方面的核心能力。项目聚焦于三大关键维度:SQL优化能力、方言转换能力以及SQL深度理解能力。通过构建多维度、多指标的综合测评体系,并采用不同难度等级的真实案例进行测试,以科学加权评分的方式,评估模型在数据库操作中的实际表现。
sql-llm-benchmark项目旨在为开发者、数据库管理员及企业技术决策者提供权威、客观的参考依据,推动大模型在数据库智能化应用中的技术发展与选型落地。
sql-llm-benchmark项目旨在通过科学、严谨的测评方法,全面评估大语言模型在SQL处理方面的能力,为相关领域的技术发展和应用提供参考。
数据统计
相关导航
LLM Price Tracker 是一个专为 AI 开发者、CTO 及技术极客打造的旗舰级大模型 API 价格比价工具,为AI开发者、CTO及技术决策者提供一个高效、透明的模型成本比较工具。它汇聚了 OpenAI、Anthropic、Google、DeepSeek、阿里云通义千问等全球顶级 AI 厂商的最新定价数据,致力于解决跨国比价难题。 LLM Price Tracker官网入口网址:https://llm.minprices.com/ 其主要功能和特点包括: 全球视野与统一计价单位:网站聚合了包括OpenAI、Anthropic、Google、DeepSeek、阿里云通义千问等全球顶级厂商的最新定价数据。为了打破货币壁垒,实现直观对比,它将所有复杂的人民币、美元定价统一转换为“美元/百万词元(USD/1M Tokens)”这一标准单位。智能排序与成本优化:用户可以通过点击表格的输入(Input)或输出(Output)价格表头进行一键排序,快速找到处理长文本任务或即时问答等场景下性价比最高的模型选项。关键信息聚合:除了价格,网站还整理了每个模型的关键规格,如上下文窗口大小(Context Window)和功能标签(Tags),后者用于快速识别模型在代码(Coding)、推理(Reasoning)等领域的特长,或是否提供免费额度(Free Tier)。便捷的检索与最新数据:网站内置实时搜索功能,可以快速过滤出特定模型(如DeepSeek或Flash)。其数据也紧跟行业步伐,收录了如GPT-5系列、Claude 4.5系列以及DeepSeek V3/V3.2等2025年的最新一代旗舰模型信息,确保决策基于最新市场行情。 适用人群:该工具主要面向需要控制API成本的独立开发者、正在进行模型选型的企业技术负责人,以及关注AI行业动态的研究人员与分析师。 LLM Price Tracker旨在通过提供一个标准化、可视化的比价平台,帮助用户在几秒钟内完成复杂的成本分析,从而优化其AI解决方案的预算和选型决策。
Moondream 是一个由开发者 vikhyat 开发的开源视觉语言模型,旨在提供高效、灵活的图像理解和文本生成能力。该模型基于 SigLIP、Phi-1.5 和 LLaVa 训练数据集构建,并遵循宽松的 Apache 2.0 许可证,允许商用 。Moondream 的设计目标是能够在各种设备上运行,包括本地计算机、移动设备和 Raspberry Pi,从而实现高性能的视觉处理能力 。 Moondream官网入口网址:https://moondream.ai/Moondream开源项目地址:https://github.com/vikhyat/moondream模型特点 Moondream 的参数量相对较小,Moondream1 为 16 亿参数,Moondream2 为 18.6 亿参数,但其在多个基准测试中表现出色。例如,在 VQAv2、GQA、TextVQA 和 TallyQA 数据集上的表现如下: Moondream1: 74.7 (VQAv2), 57.9 (GQA), 35.6 (TextVQA)Moondream2: 79.4 (VQAv2), 63.1 (GQA), 57.2 (TextVQA) Moondream 支持多种功能,包括图像描述、视觉问答、目标检测和对象定位等。用户可以通过 Python 客户端库或 Gradio 界面与模型进行交互 。此外,Moondream 还提供了批量推理功能,允许用户一次性处理多张图像并生成相应的描述或回答 。 应用场景 Moondream 的应用场景非常广泛,包括但不限于: 安全监控:通过在本地部署 Moondream,可以实现实时监控系统,识别可疑行为,确保数据和隐私的安全性 。艺术创作与设计:设计师和艺术家可以利用 Moondream 识别和分析艺术作品的风格,辅助创作新的视觉艺术作品 。零售与购物:Moondream 可用于顾客行为分析、商品识别等,帮助优化店铺布局和促销策略 。教育辅助:Moondream 可以帮助学生理解图像内容,提供详细的图像描述和解释,增强学习体验 。医疗诊断:在医疗领域,Moondream 可以用于分析医学图像,提供诊断建议,提高诊断效率和准确性 。安装与使用 Moondream 的安装和使用非常简单。用户可以通过以下步骤进行安装: 创建虚拟环境:python -m venv venv,然后激活虚拟环境。安装依赖项:pip install transformers einops。克隆仓库并安装依赖:git clone [https://github.com/vikhyat/moondream.git ],然后进入仓库目录并安装依赖项:./venv/bin/pip install -r requirements.txt。运行模型:用户可以选择在命令行界面或通过 Gradio 界面与模型交互。例如,启动 Gradio 应用程序:./venv/bin/python gradio_demo.py ,然后在浏览器中打开 [http://127.0.0.1:7860 ]。局限性尽管 Moondream 在多个方面表现出色,但它也存在一些局限性。例如,Moondream 可能在处理复杂或微妙的指令时遇到困难,生成的描述可能不够准确。此外,Moondream 主要是为理解英语而设计的,对非英语语言和非正式英语的支持有限 。用户在使用时应了解这些局限性,并根据自己的需求和预期调整使用方式。 Moondream 是一个强大且灵活的视觉语言模型,能够在各种设备上运行,提供高性能的视觉处理能力。它不仅在多个基准测试中表现出色,而且在多个应用场景中展现出巨大的潜力。用户可以通过简单的安装和配置步骤开始使用 Moondream,并根据自己的需求调整使用方式。尽管存在一些局限性,但 Moondream 仍然是一个非常有用的工具,特别是在需要快速理解和描述图像内容的项目中 。
商汤日日新开放平台(SenseNova)是商汤科技推出的一个综合性人工智能生成内容(AIGC)平台,旨在为用户提供多样化的AI服务和工具,以实现高效、创新的解决方案。该平台基于商汤科技的“日日新”大模型体系,整合了多种生成式AI技术,包括自然语言处理、图像生成、语音识别与合成等多模态能力,并提供丰富的API接口供企业和开发者使用。 商汤日日新开放平台官网入口网址:https://platform.sensenova.cn/ 平台核心功能与特点 多模态生成能力:办公人导航分享的商汤日日新开放平台支持文本、对话、代码、图像、语音等多种模态的输入和输出,能够满足不同场景下的需求。例如,其大语言模型“商量”具备强大的中文理解能力,可进行长文本理解、内容创作、情感分析等功能;而“秒画”则专注于文生图的创作,支持用户快速生成高质量图像。 多样化应用场景: 平台覆盖了多个行业和领域,包括但不限于: 自然语言处理:如对话生成、代码生成、文本摘要等。图像生成:如“秒画”支持文生图创作,适用于艺术创作、广告设计等。语音合成与识别:如语音大模型支持高保真语音合成和情感识别。3D生成与编辑:如数字人视频生成平台“如影”,支持三维场景构建和数字人嵌入。 开放API与商业化模式: 商汤日日新开放平台提供丰富的API接口,支持企业根据需求调用模型功能,同时推出多种商业化服务,如调用、迁徙、训练等免费服务包。此外,平台还为从OpenAI迁移到商汤平台的企业提供培训支持。 技术优势与创新: 商汤日日新开放平台依托商汤AI大装置(SenseCore)的强大算力支持,具备高效率、低成本和规模化的特点。其最新版本“日日新5.5”在知识覆盖、推理能力、长文本理解等方面均有显著提升,部分功能已达到或超越GPT-4水平。 平台优势与市场影响 技术自主可控:商汤坚持AI原创,强调技术自主可控,避免对国外技术的依赖。这不仅提升了安全性,也增强了国内企业在AI领域的竞争力。广泛的应用生态:商汤日日新开放平台已应用于多个行业,包括医疗问诊、教育、智慧城市等。例如,“商量”大语言模型被用于在线问诊,“秒画”则被用于内容创作和广告设计。面向未来的AGI战略:商汤通过“日日新”大模型体系,逐步迈向通用人工智能(AGI)的目标。这一战略不仅推动了AI技术的商业化落地,也为未来的技术发展奠定了基础。 商汤日日新开放平台是商汤科技在AIGC领域的重要布局,通过整合先进的AI技术和丰富的应用场景,为用户提供高效、多样化的解决方案。其强大的多模态生成能力和开放的API接口使其在国内外市场中具有显著的竞争优势,并为推动人工智能技术的商业化应用和产业升级提供了重要支持。
IndexTTS2 是一个突破性的自回归语音合成模型,由 Bilibili(哔哩哔哩)开发,旨在解决大规模文本到语音(TTS)系统中精确时长控制和情感表达的挑战。该模型在多个方面实现了创新,包括情感与音色的解耦、精确的时长控制、以及基于自然语言的情感控制等。 IndexTTS2官网入口网址:https://github.com/index-tts/index-ttsIndexTTS2中文介绍:链接 IndexTTS2 的核心优势在于其能够实现情感与说话人身份的解耦,用户可以独立控制音色和情感,从而实现更灵活、细腻的语音合成。此外,该模型支持多种情感控制方式,包括使用情感参考音频、情感向量控制、情感描述文本控制等。在技术实现上,IndexTTS2 采用了自回归架构,并结合了 GPT 潜在表示和三阶段训练策略,以提升语音生成的稳定性和情感表达的准确性。 IndexTTS2 在多个基准测试中表现出色,包括词错误率、说话人相似度和情感保真度等方面均优于现有模型。该模型还支持多种生成模式,包括固定时长模式和自由时长模式,以满足不同应用场景的需求。 IndexTTS2 是一个在语音合成领域具有重要突破的模型,其在情感表达、时长控制和可控性方面均达到了高水平,为 AI 配音和语音合成技术的发展提供了重要支持。
九天人工智能平台是中国移动倾力打造的国家级人工智能平台,旨在构建面向通用智能的大模型体系。作为国家新一代人工智能开放创新平台的重要组成部分,九天不仅承载着中国移动智慧运营转型的重任,更致力于赋能千行百业的数智化升级。 九天人工智能平台官网入口网址:https://jiutian.10086.cn/ 核心架构:全链路的大模型生态体系 平台构建了一体化的“大模型+平台”架构,涵盖了从底层算力到上层应用的完整闭环: 九天基础大模型:这是平台的“大脑”,具备强大的理解能力、生成能力和知识集成能力。它能够处理复杂的语言逻辑和多模态信息,为上层应用提供通用的智能底座。大模型生产平台:提供全链路的服务,包括多样化的算力支持、训推加速技术,极大地降低了大模型的开发门槛,让企业能够快速完成模型的训练和部署。大模型应用平台:这是连接AI与业务场景的桥梁。通过智能体(Agent)、插件集成、知识库和推理服务,平台支持开发者构建针对特定场景的AI应用,实现从“通用智能”到“专用智能”的落地。技术实力与创新成果 九天平台在技术研发上保持高频更新,紧跟全球AI前沿趋势。 前沿研究:九天团队在语音理解(如基于动态图卷积网络的多轮口语理解建模)、结构化数据处理等领域取得了突破性进展。其多项研究成果被INTERSPEECH、ACL等国际顶级学术会议录用。标准化建设:平台牵头编制的《人工智能 大规模预训练模型总体技术要求及评估方法》团体标准已正式发布,这标志着九天在推动行业规范化发展方面发挥了引领作用。产品迭代:平台持续发布高性能模型版本,如支持8K上下文的“九天语言大模型-13.9b-8k-chat v3”,显著提升了模型在长文本处理和复杂对话场景下的表现。生态合作与开放共享 九天平台秉持开放共赢的理念,构建了广泛的产业生态圈: 国际合作:作为中日韩三方运营商战略合作(SCFA)的一部分,九天与韩国电信(KT)等国际伙伴开展深度合作,致力于让全球用户都能轻松体验和利用人工智能。产教融合:平台积极与高校合作,例如与南京大学签署合作协议,并将“九天大模型应用实战课程”上线至国家高等教育智慧教育平台,为国家培养未来AI人才提供实战教学资源。算力与算法开放:作为一个开放平台,九天向社会开放算力、算法、数据和网络环境,旨在构建“通信+AI”的行业新生态,降低中小企业和科研机构的AI研发成本。 九天人工智能平台不仅仅是一个技术工具集,它更是一个推动产业升级的引擎。通过携手产业、科研机构及各类组织,九天致力于实现大模型的供给、汇聚及运营,让人工智能技术像水电一样普及,为数字经济的高质量发展注入澎湃动力。
左医医疗大语言模型是由北京左医科技有限公司开发的一款专注于医疗健康领域的大型语言模型,旨在通过先进的AI技术为医疗行业提供高效、精准的智能服务。该模型基于深度学习中的Transformer架构,结合自注意力机制和多头注意力等技术,能够有效捕捉文本语义信息,适用于复杂的医学文本分析任务。 左医医疗大语言模型官网入口网址:https://ai.zuoshouyisheng.com/ 办公人导航分享的左医医疗大语言模型的核心功能包括智能问诊、智能导诊、病历书写、结构化抽取、智能诊断以及患者随访等。这些功能覆盖了医疗场景中的多个关键环节,为医生和医疗机构提供了全面的辅助支持。例如,智能问诊功能可以模拟医生与患者的对话,快速识别患者的症状并给出初步诊断建议;智能导诊则能够根据患者的具体情况推荐合适的科室和医生。 在数据方面,左医医疗大语言模型依托于海量权威的医学数据,包括医学论文、临床指南、电子病历和医学知识库等,确保了模型的准确性和权威性。这些数据经过预训练和微调策略处理,使其能够更好地适应医学术语的理解和临床分析需求。 左医医疗大语言模型还支持多任务处理能力,能够同时处理问诊、导诊、病历书写等多种医疗任务。此外,该模型支持API接入或私有化部署,方便医疗机构将其集成到现有的系统中,从而提升工作效率和服务质量。 左医医疗大语言模型不仅在技术上具有领先优势,还通过开放平台为开发者和医疗机构提供支持。用户可以通过API接口快速集成模型功能,实现个性化定制和应用开发。 左医医疗大语言模型凭借其强大的技术基础、丰富的医学数据资源和多样化的应用场景,正在逐步改变传统医疗服务模式,为医疗健康行业注入新的活力。未来,随着技术的进一步发展,它有望在疾病预测、用药指导、医学教育等领域发挥更大的作用,为患者提供更优质的医疗服务。
