驾驭工程
AI 编排、可观测、护栏与模型运维工具,帮助工程团队驾驭大模型(共收录 46 个工具)
- CrewAI — 热门多智能体编排框架与企业平台(官网)
- Semantic Kernel — Semantic Kernel 是一款面向智能体与自动化场景的AI 智能体工具,适合工作流编排、系统集成与任务自动执行。(定价:Open Source)(官网)
- Swagger/OpenAPI — Swagger/OpenAPI 是一款面向编程开发场景的API 开发工具,适合代码生成、测试与开发协作。(定价:Freemium)(官网)
- Zenable — Zenable 是一款AI 编程方向的 AI 工具,适合AI 代码生成、补全与编程辅助工具。(官网)
- Mcp Servers — Mcp Servers 是一款面向AI 开发平台场景的 AI 工具,适合搭建、管理和发布 AI 应用与模型服务。(官网)
- Arize — Arize 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(官网)
- Opik — Opik 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(官网)
- Phoenix — Phoenix 是一款模型评测方向的 AI 工具,适合大模型评测基准与排行榜。(官网)
- Whylabs AI Observatory — Whylabs AI Observatory 是一款面向模型评测场景的 AI 工具,适合评估模型质量、性能、安全性与输出效果。(官网)
- DSPy — 斯坦福出品,用编程而非提示词构建 LLM 系统(官网)
- Giskard — 法国开源 LLM 与机器学习测试框架,用于评估模型质量与风险。(官网)
- Haystack — deepset 开源 LLM 编排框架,生产级 RAG(官网)
- LlamaIndex — 数据连接 LLM 的框架,RAG 应用首选(官网)
- LM Studio — 桌面端本地大模型运行器,图形界面友好(官网)
- MLflow — 开源机器学习生命周期管理平台(官网)
- Weights & Biases — 机器学习实验跟踪与 LLM 应用可观测平台(官网)
- Agent Card — Agent Card 是一种开放的 AI Agent 元数据规范,用标准化的 JSON 描述 Agent 的能力、接口与信任属性,便于发现与协作。(官网)
- Agent Protocol — Agent Protocol 是由 AI Engineer Foundation 推动的开放标准,为 AI Agent 提供统一的 HTTP API 接口规范,实现跨框架互操作。(官网)
- Anthropic Tool Use — Anthropic Tool Use 是 Claude 模型的函数调用规范,定义了模型与外部工具交互的标准化接口,支撑 Agent 生态构建。(官网)
- Braintrust — Braintrust 是面向 AI 产品团队的评估与可观测平台,提供 Prompt 实验、评测打分与日志追踪,加速 LLM 应用迭代。(官网)
- DeepEval — DeepEval 是开源 LLM 评估框架,内置 30+ 评测指标,覆盖 Agent、RAG 与对话场景的质量与安全检查。(官网)
- Guardrails AI — Guardrails AI 是开源的 AI 护栏框架,为 LLM 输出添加结构化校验、幻觉检测与安全过滤,保障生产环境下的模型可靠性。(官网)
- Guidance — Guidance 是微软推出的 LLM 生成控制语言,通过模板与约束语法精确编排模型输出结构,适合复杂推理链路。(官网)
- LangSmith — LangSmith 是 LangChain 推出的 LLM 应用开发平台,提供调试、测试、评估和监控能力,帮助团队从原型走向生产。(官网)
- Llama Guard — Llama Guard 是 Meta 推出的安全分类模型,用于对 LLM 输入输出进行内容审核与安全过滤。(官网)
- Model Context Protocol (MCP) — MCP 是 Anthropic 推出的开放协议,为 LLM 应用提供标准化的上下文集成方式,连接模型与外部数据源和工具。(官网)
- NeMo Guardrails — NeMo Guardrails 是 NVIDIA 推出的开源工具包,用于为对话式 AI 应用添加可编程的安全护栏与主题管控。(官网)
- OpenSpec — OpenSpec 是一个开放的 AI 工程规范框架,用结构化的变更提案管理 AI 系统的架构演进、规范同步与代码交付。(官网)
- Outlines — Outlines 是开源的 LLM 结构化输出框架,通过约束解码保证模型输出符合 JSON Schema 或正则表达式。(官网)
- Patronus AI — Patronus AI 是企业级 AI 评估平台,提供幻觉检测、自动化评测与模型安全验证,帮助团队安全部署 LLM。(官网)
- Prompt Flow — Prompt Flow 是微软推出的 LLM 应用开发工具,提供可视化编排、调试与评估能力,集成于 Azure AI Studio。(官网)
- RAGAS — RAGAS 是开源的 RAG 管道评估框架,提供忠实度、相关性与上下文质量等指标,量化检索增强生成效果。(官网)
- SGLang — SGLang 是高性能 LLM 推理框架,支持多模态模型,已在 40 万+ GPU 上部署,吞吐量领先 vLLM。(官网)
- Spec Kit — Spec Kit 是面向 AI 工程的规范工具包,帮助团队定义、管理与同步 AI 系统的接口规范与配置协议。(官网)
- TGI (Text Generation Inference) — TGI 是 Hugging Face 推出的生产级 LLM 推理服务器,支持连续批处理与量化推理,为模型部署而生。(官网)
- TruLens — TruLens 是 TruEra 推出的开源 LLM 评估与追踪框架,通过反馈函数衡量 RAG 检索质量、幻觉率与对话安全性。(官网)
- vLLM — vLLM 是高吞吐量、低延迟的 LLM 推理引擎,支持 PagedAttention 等内存优化技术,广泛用于生产环境模型部署。(官网)
- Helicone — Helicone 是一款面向AI 模型场景的 AI 工具,适合使用、比较和探索大语言模型与多模态模型。(官网)
- Litellm — Litellm 是一款面向AI 模型场景的 AI 工具,适合使用、比较和探索大语言模型与多模态模型。(官网)
- Parea — Parea 是一款面向AI 模型场景的 AI 工具,适合使用、比较和探索大语言模型与多模态模型。(官网)
- Aporia — Aporia 是一款面向安全与合规场景的 AI 工具,适合威胁检测、漏洞分析、隐私保护与合规治理。(官网)
- Manageprompt — Manageprompt 是一款面向安全与合规场景的 AI 工具,适合威胁检测、漏洞分析、隐私保护与合规治理。(官网)
- Langfuse — Langfuse 是一款提示词方向的 AI 工具,适合Prompt 提示词资源与工程工具。(官网)
- LMQL — 大型模型的自然语言查询。(官网)
- Promptfoo — Promptfoo 是一款提示词方向的 AI 工具,适合Prompt 提示词资源与工程工具。(官网)
- Portkey — Portkey 是一款面向效率工具场景的 AI 工具,适合提升个人工作效率、组织信息并辅助日常任务。(官网)