Vibe Coding Discover

Use Cases

310 use cases for “Eval”

Evaluate Agent Behavior

3 projects

Rag Retrieval

2 projects

Rerank Retrieval Candidates For Rag

2 projects

Retrieval Augmented Generation (rag)

2 projects

Add Evals, Observability And Human-in-the-loop To Agents

1 project

Add Rag And Vector Knowledge Retrieval

1 project

Adding Pdf Retrieval To Claude Code, Cursor, VS Code Or Codex Cli Via Mcp

1 project

Agent Benchmarking And Evaluation

1 project

Agent Evals And Observability Setup

1 project

Agent Evaluation And Benchmarking

1 project

Agent Memory Storage And Retrieval

1 project

Agentic Rag With Corrective Retrieval

1 project

Agentic Retrieval Over Heterogeneous Data Sources

1 project

Ask Typed Evaluation Questions

1 project

Attach And Query A Local Knowledge Base With Full-text And Vector Retrieval

1 project

Audio Generation Evaluation Metrics

1 project

Auto-tune Retrieval Hyperparameters Via Self-evolution Loop

1 project

Autonomous App Scaffolding With Build-evaluate-evolve Loops

1 project

Autonomous React Agent Doing Multi-step Retrieval + Tool Use

1 project

Backward Root-cause Retrieval From A Failure To The Earlier Decision That Caused

1 project

Batch-mode Evaluation Of Coding Agents

1 project

Benchmark Agent Memory Against Longmemeval

1 project

Benchmark Agent Memory With Locomo And Longmemeval

1 project

Benchmark And Evaluate Agent Performance

1 project

Benchmark And Evaluate Computer-use Agents

1 project

Benchmark And Evaluate Open Models On Vertex AI

1 project

Benchmark Draft Models On Gsm8k, Math500, Aime, Humaneval, Mbpp, Livecodebench,

1 project

Benchmark Long-term Memory Retrieval (longmemeval, Locomo, Membench)

1 project

Benchmark Memory Retrieval With Public Locomo-style Datasets

1 project

Benchmark Retrieval Quality On Knowledge-vault Datasets

1 project

Benchmark Retrieval Quality With IR Metrics And Llm-judged Scores

1 project

Benchmarking Decision Models Against Frozen Eval Suites

1 project

Benchmarking Retrieval Quality And Context Savings

1 project

Book Material Import And Rag-style Reference Retrieval

1 project

Build Chunked Multi-turn Datasets For Memory Evaluation

1 project

Build Custom AI Training Or Evaluation Datasets From The Web

1 project

Build Custom Training And Evaluation Environments

1 project

Build Evaluation Sets And Run Automated Multi-dimensional Evals On Prompts And A

1 project

Build Rag Pipelines With Retrieval Modules

1 project

Building A Controllable Retrieval Agent With Deterministic Langgraph Flow

1 project

Calibrate Llm Evaluators From Pinned Human Judgments On Traces

1 project

Chess Position Evaluation And Move Selection

1 project

Citation-backed Retrieval For Agents

1 project

Compose Map-reduce, Orchestrator, Router And Evaluator-optimizer Patterns

1 project

Contextual Retrieval

1 project

Crawl Whole Sites Into Structured Datasets For Training Or Retrieval

1 project

Create Rag Retrieval Pipelines On Postgresql

1 project

Create Training And Evaluation Data For Llm Fine-tuning

1 project

Deploy Mcp Servers With Observability And Evals

1 project

Deterministic Top-k Vector Retrieval Over Parsed Sections

1 project

Drive The Eval Loop From Claude Code, Codex, Cursor, Or Windsurf Via Mcp And Ski

1 project

Drone Control Simulation And Evaluation

1 project

Embedding And Retrieval Model Serving For Rag

1 project

Embedding-based Context Retrieval

1 project

Enterprise Knowledge Base Retrieval

1 project

Enterprise QA And Customer Support Retrieval

1 project

Entity Extraction And Tag-scoped Retrieval Per Agent

1 project

Eval And Replay Pruning Decisions With Labeled Judge Data

1 project

Eval-driven Policy-lock Generation With Git-reviewable Diffs

1 project

Evaluate AI Task Outputs

1 project

Evaluate Accurate Retrieval (ar) Performance

1 project

Evaluate Agent Behavior And Traces

1 project

Evaluate Agent Behavior With Recorded Test Cases

1 project

Evaluate Agent Changes Against Recorded Evidence

1 project

Evaluate Agent Harnesses Across Benchmarks

1 project

Evaluate Agent Memory Recall With Included Harnesses

1 project

Evaluate Agent Performance And Behavior

1 project

Evaluate Agent Quality With Eval Sets

1 project

Evaluate Agent Responses

1 project

Evaluate Agent Responses And Tool Use

1 project

Evaluate Agent Task Completion And Tool Use

1 project

Evaluate Agent Traces In Arize Phoenix Or Arize AX

1 project

Evaluate Agents In Stateful Task Environments

1 project

Evaluate Agents With Metrics And Statistical Significance

1 project

Evaluate Agents With Swe-bench Tasks

1 project

Evaluate And Benchmark LM Programs

1 project

Evaluate And Certify Agent Plugin And Skill Quality

1 project

Evaluate And Evolve Agent Outputs Across Generations

1 project

Evaluate And Experiment On Prompts From Production Data

1 project

Evaluate And Guardrail Agent Behavior

1 project

Evaluate And Modify Variables During A Session

1 project

Evaluate And Monitor AI Application Conversations

1 project

Evaluate And Observe Llm Agents In Production

1 project

Evaluate And Observe Llm Apps

1 project

Evaluate And Observe Rag Pipelines Via Langfuse Tracing

1 project

Evaluate And Observe Rag/agent Systems

1 project

Evaluate And Test Agent Behaviour With Evals

1 project

Evaluate And Test Agent Workflows

1 project

Evaluate And Test Llm Outputs

1 project

Evaluate Api Documentation For AI Readiness

1 project

Evaluate Batches Of Records

1 project

Evaluate Conflict Resolution (cr) On Contradictory Facts

1 project

Evaluate Existing Creative Ideas On Demand

1 project

Evaluate Graph Rag, Self-rag, And Raptor Retrievers

1 project

Evaluate Hallucinations And Reasoning Failures

1 project

Evaluate Ingestion And Retrieval Quality With An Eval Harness

1 project

Evaluate Job Postings Against A Candidate Profile

1 project

Evaluate Llm Capabilities On Benchmark Datasets

1 project

Evaluate Llm Prompts And Outputs With Promptfoo

1 project

Evaluate Mcp Endpoint Health And Tool-definition Quality Via Glama Connectors

1 project