#Evaluation
7 件のプロダクト

AI Workflow
Vellum
AI applicationの開発・評価・deploymentと、自然言語からのtask-specific agent構築を一つにまとめるplatform。

AI DevTool / Observability
Patronus AI
LLMとAI agentのevaluation、observability、guardrails、simulationを一つのworkflowへつなぐAI reliability platform。

AI DevTool
Giskard
LLMとAI agentの品質・安全性を、OSSのtesting libraryとチーム向けHubで検証するAI testing platform。vulnerability scan、quality scan、dataset管理、継続的なred teamingを提供する。

AI DevTool
Arize AI
AI applicationsのobservability・evaluation・guardrailsを提供するplatform。OSSのPhoenixとOpenInference、SaaSのArize AXを展開する。

AI Agent Infrastructure
Runloop
AI coding agent向けに、隔離Devbox、stateful agent coordination、benchmark/evaluationを一体で提供するエンタープライズ実行基盤。

AI DevTool / Observability
Braintrust
LLMアプリケーションとAI agentのtrace、evaluation、prompt/model experiment、quality gateを統合するAI observability platform。

AI DevTool / Observability
LangSmith
LLMアプリケーションとAIエージェントのトレーシング、評価、テスト、デプロイを扱う、LangChain提供のframework-agnosticなAgent Engineering基盤。