Multi-verifier consensus oracle for AI agent task quality verification. Submits agent output for parallel keyword, length, and criteria verification with majority-vote consensus. Returns HMAC-signed receipts (PASS/PARTIAL/FAIL). Built for SYNTHESIS hackathon March 2026.
Full LLM thinking from the 4-phase benchmark pipeline.
```json
{
"service_type": "rest_api",
"base_url": "https://arbiter.chitacloud.dev",
"auth_method": "api_key_header",
"auth_config": {"header": "Authorization", "prefix": "Bearer"},
"endpoints": [
{
"path": "/verify",
"method": "POST",
"purpose": "Submit agent output for multi-verifier consensus verification",
"params": {
"output": {"type": "string", "required": true},
"criteria": {"type": "object", "required": false},
"keywords": {"type": "array", "required": false}
},
"response_format": "json",
"is_primary": true
},
{
"path": "/receipt/{id}",
"method": "GET",
"purpose": "Retrieve HMAC-signed verification receipt",
"params": {
"id": {"type": "string", "required": true}
},
"response_format": "json",
"is_primary": false
}
],
"pricing_model": {
"type": "unknown",
"details": {},
"free_tier": null,
"paid_tiers": []
},
"rate_limits": {"rpm": null, "tpm": null, "daily": null, "concurrent": null},
"capabilities": [
"multi_verifier_consensus",
"keyword_verification",
"length_verification",
"criteria_verification",
"hmac_signed_receipts",
"quality_assessment",
"pass_partial_fail_scoring"
],
"agent_readiness": {
"supports_x402": false,
"supports_streaming": false,
"has_sandbox": false,
"sdks": [],
"agent_auth_methods": ["api_key"]
}
}
```
```json
{
"tests": [
{
"name": "basic_verification",
"endpoint": "/verify",
"method": "POST",
"headers": {
"Content-Type": "application/json"
},
"payload": {
"output": "The capital of France is Paris."
},
"expected_status": 200,
"expected_behavior": "Returns verification result with consensus score",
"metrics": ["latency", "accuracy", "status_code"],
"validation": {
"field": "verification_id",
"type": "string",
"min_length": 1
}
},
{
"name": "comprehensive_verification",
"endpoint": "/verify",
"method": "POST",
"headers": {
"Content-Type": "application/json"
},
"payload": {
"output": "Based on the data analysis, I recommend investing in renewable energy stocks due to their 15% growth rate and strong regulatory support.",
"criteria": {
"factual_accuracy": "high",
"logical_consistency": "required",
"evidence_based": true
},
"keywords": ["renewable energy", "investment", "growth rate", "regulatory"]
},
"expected_status": 200,
"expected_behavior": "Returns detailed verification with criteria assessment and keyword validation",
"metrics": ["latency", "accuracy", "status_code"],
"validation": {
"field": "consensus_score",
"type": "number",
"min_value": 0,
"max_value": 1
}
},
{
"name": "receipt_retrieval",
"endpoint": "/receipt/{verification_id}",
"method": "GET",
"headers": {},
"payload": {},
"expected_status": 200,
"expected_behavior": "Returns HMAC-signed verification receipt",
"metrics": ["latency", "status_code"],
"validation": {
"field": "hmac_signature",
"type": "string",
"min_length": 32
},
"depends_on": "basic_verification"
},
{
"name": "empty_output_error",
"endpoint": "/verify",
"method": "POST",
"headers": {
"Content-Type": "application/json"
},
"payload": {
"output": ""
},
"expected_status": 400,
"expected_behavior": "Returns validation error for empty output",
"metrics": ["latency", "status_code", "error_handling"],
"validation": {
"field": "error",
"type": "object"
}
},
{
"name": "missing_output_error",
"endpoint": "/verify",
"method": "POST",
"headers": {
"Content-Type": "application/json"
},
"payload": {
"criteria": {"accuracy": "high"}
},
"expected_status": 400,
"expected_behavior": "Returns validation error for missing required output parameter",
"metrics": ["latency", "status_code", "error_handling"],
"validation": {
"field": "error",
"type": "object"
}
},
{
"name": "long_text_verification",
"endpoint": "/verify",
"method": "POST",
"headers": {
"Content-Type": "application/json"
},
"payload": {
"output": "This is a comprehensive analysis of market trends spanning multiple sectors including technology, healthcare, finance, and energy. The analysis covers historical data from the past five years, current market conditions, and projected trends for the next decade. Key findings include significant growth in AI and machine learning technologies, continued expansion in telehealth services, stable growth in financial services with emphasis on digital transformation, and substantial investment shifts toward renewable energy sources driven by regulatory changes and environmental concerns.",
"keywords": ["market trends", "technology", "healthcare", "finance", "energy", "AI", "machine learning"]
},
"expected_status": 200,
"expected_behavior": "Handles long text verification with multiple keywords",
"metrics": ["latency", "accuracy", "status_code"],
"validation": {
"field": "keyword_matches",
"type": "array",
"min_length": 1
}
},
{
"name": "invalid_receipt_id",
"endpoint": "/receipt/invalid-id-123",
"method": "GET",
"headers": {},
"payload": {},
"expected_status": 404,
"expected_behavior": "Returns not found error for invalid receipt ID",
"metrics": ["latency", "status_code", "error_handling"],
"validation": {
"field": "error",
"type": "object"
}
}
],
"pricing_probes": [
{
"name": "verify_usage_tracking",
"description": "Submit verification request and check response headers or body for usage metrics",
"endpoint": "/verify",
"method": "POST",
"payload": {
"output": "Test verification for usage tracking analysis."
},
"check": "Look for usage counters, rate limit headers, or cost indicators in response"
},
{
"name"5/7 tests passed
| Test | Endpoint | Status | Latency |
|---|---|---|---|
| basic_verification | POST /verify | 200 | 402ms |
| comprehensive_verification | POST /verify | 200 | 135ms |
| receipt_retrieval | GET /receipt/{verification_id} | 404 | 135ms |
| empty_output_error | POST /verify | 200 | 130ms |
| missing_output_error | POST /verify | 200 | 129ms |
| long_text_verification | POST /verify | 200 | 136ms |
| invalid_receipt_id | GET /receipt/invalid-id-123 | 404 | 187ms |
{"multi_model": true, "models_used": ["openai", "claude_cli"], "model_scores": {"GPT-4o": {"overall": 80, "dimensions": {"token_efficiency": 7.0, "first_try_success": 7.0, "response_parseability": 10.0, "error_clarity": 6.0, "doc_quality": 6.0, "auth_simplicity": 10.0, "latency": 8.0, "consistency": 10.0}}, "Claude CLI": {"overall": 72, "dimensions": {"token_efficiency": 8.0, "first_try_success": 6.0, "response_parseability": 10.0, "error_clarity": 6.0, "doc_quality": 1.0, "auth_simplicity": 10.0, "latency": 7.0, "consistency": 9.0}}}, "averaged": true}Show your live agent-readiness score on your own site. Free, no auth — it updates as your score changes.
<a href="https://prowl.world/service/arbiter">
<img src="https://prowl.world/badge/arbiter.svg" height="56" alt="Agent-readiness on Prowl">
</a>
See operational metrics, LLM evaluations, agent readiness, and more.
Open in Dashboard