Use Cases
Evaluate Agent Behavior
3 projects
Rag Retrieval
2 projects
Rerank Retrieval Candidates For Rag
2 projects
Retrieval Augmented Generation (rag)
2 projects
Add Evals, Observability And Human-in-the-loop To Agents
1 project
Add Rag And Vector Knowledge Retrieval
1 project
Adding Pdf Retrieval To Claude Code, Cursor, VS Code Or Codex Cli Via Mcp
1 project
Agent Benchmarking And Evaluation
1 project
Agent Evals And Observability Setup
1 project
Agent Evaluation And Benchmarking
1 project
Agent Memory Storage And Retrieval
1 project
Agentic Rag With Corrective Retrieval
1 project
Agentic Retrieval Over Heterogeneous Data Sources
1 project
Ask Typed Evaluation Questions
1 project
Attach And Query A Local Knowledge Base With Full-text And Vector Retrieval
1 project
Audio Generation Evaluation Metrics
1 project
Auto-tune Retrieval Hyperparameters Via Self-evolution Loop
1 project
Autonomous App Scaffolding With Build-evaluate-evolve Loops
1 project
Autonomous React Agent Doing Multi-step Retrieval + Tool Use
1 project
Backward Root-cause Retrieval From A Failure To The Earlier Decision That Caused
1 project
Batch-mode Evaluation Of Coding Agents
1 project
Benchmark Agent Memory Against Longmemeval
1 project
Benchmark Agent Memory With Locomo And Longmemeval
1 project
Benchmark And Evaluate Agent Performance
1 project
Benchmark And Evaluate Computer-use Agents
1 project
Benchmark And Evaluate Open Models On Vertex AI
1 project
Benchmark Draft Models On Gsm8k, Math500, Aime, Humaneval, Mbpp, Livecodebench,
1 project
Benchmark Long-term Memory Retrieval (longmemeval, Locomo, Membench)
1 project
Benchmark Memory Retrieval With Public Locomo-style Datasets
1 project
Benchmark Retrieval Quality On Knowledge-vault Datasets
1 project
Benchmark Retrieval Quality With IR Metrics And Llm-judged Scores
1 project
Benchmarking Decision Models Against Frozen Eval Suites
1 project
Benchmarking Retrieval Quality And Context Savings
1 project
Book Material Import And Rag-style Reference Retrieval
1 project
Build Chunked Multi-turn Datasets For Memory Evaluation
1 project
Build Custom AI Training Or Evaluation Datasets From The Web
1 project
Build Custom Training And Evaluation Environments
1 project
Build Evaluation Sets And Run Automated Multi-dimensional Evals On Prompts And A
1 project
Build Rag Pipelines With Retrieval Modules
1 project
Building A Controllable Retrieval Agent With Deterministic Langgraph Flow
1 project
Calibrate Llm Evaluators From Pinned Human Judgments On Traces
1 project
Chess Position Evaluation And Move Selection
1 project
Citation-backed Retrieval For Agents
1 project
Compose Map-reduce, Orchestrator, Router And Evaluator-optimizer Patterns
1 project
Contextual Retrieval
1 project
Crawl Whole Sites Into Structured Datasets For Training Or Retrieval
1 project
Create Rag Retrieval Pipelines On Postgresql
1 project
Create Training And Evaluation Data For Llm Fine-tuning
1 project
Deploy Mcp Servers With Observability And Evals
1 project
Deterministic Top-k Vector Retrieval Over Parsed Sections
1 project
Drive The Eval Loop From Claude Code, Codex, Cursor, Or Windsurf Via Mcp And Ski
1 project
Drone Control Simulation And Evaluation
1 project
Embedding And Retrieval Model Serving For Rag
1 project
Embedding-based Context Retrieval
1 project
Enterprise Knowledge Base Retrieval
1 project
Enterprise QA And Customer Support Retrieval
1 project
Entity Extraction And Tag-scoped Retrieval Per Agent
1 project
Eval And Replay Pruning Decisions With Labeled Judge Data
1 project
Eval-driven Policy-lock Generation With Git-reviewable Diffs
1 project
Evaluate AI Task Outputs
1 project
Evaluate Accurate Retrieval (ar) Performance
1 project
Evaluate Agent Behavior And Traces
1 project
Evaluate Agent Behavior With Recorded Test Cases
1 project
Evaluate Agent Changes Against Recorded Evidence
1 project
Evaluate Agent Harnesses Across Benchmarks
1 project
Evaluate Agent Memory Recall With Included Harnesses
1 project
Evaluate Agent Performance And Behavior
1 project
Evaluate Agent Quality With Eval Sets
1 project
Evaluate Agent Responses
1 project
Evaluate Agent Responses And Tool Use
1 project
Evaluate Agent Task Completion And Tool Use
1 project
Evaluate Agent Traces In Arize Phoenix Or Arize AX
1 project
Evaluate Agents In Stateful Task Environments
1 project
Evaluate Agents With Metrics And Statistical Significance
1 project
Evaluate Agents With Swe-bench Tasks
1 project
Evaluate And Benchmark LM Programs
1 project
Evaluate And Certify Agent Plugin And Skill Quality
1 project
Evaluate And Evolve Agent Outputs Across Generations
1 project
Evaluate And Experiment On Prompts From Production Data
1 project
Evaluate And Guardrail Agent Behavior
1 project
Evaluate And Modify Variables During A Session
1 project
Evaluate And Monitor AI Application Conversations
1 project
Evaluate And Observe Llm Agents In Production
1 project
Evaluate And Observe Llm Apps
1 project
Evaluate And Observe Rag Pipelines Via Langfuse Tracing
1 project
Evaluate And Observe Rag/agent Systems
1 project
Evaluate And Test Agent Behaviour With Evals
1 project
Evaluate And Test Agent Workflows
1 project
Evaluate And Test Llm Outputs
1 project
Evaluate Api Documentation For AI Readiness
1 project
Evaluate Batches Of Records
1 project
Evaluate Conflict Resolution (cr) On Contradictory Facts
1 project
Evaluate Existing Creative Ideas On Demand
1 project
Evaluate Graph Rag, Self-rag, And Raptor Retrievers
1 project
Evaluate Hallucinations And Reasoning Failures
1 project
Evaluate Ingestion And Retrieval Quality With An Eval Harness
1 project
Evaluate Job Postings Against A Candidate Profile
1 project
Evaluate Llm Capabilities On Benchmark Datasets
1 project
Evaluate Llm Prompts And Outputs With Promptfoo
1 project
Evaluate Mcp Endpoint Health And Tool-definition Quality Via Glama Connectors
1 project