ab-test-setup

Sólido · 80
Indexado en Registry

When the user wants to plan, design, or implement an A/B test or experiment. Also use when the user mentions "A/B test," "split test," "experiment," "test this change," "variant copy," "multivariate test," "hypothesis," "conversion experiment," "statistical significance," or "tes

Verified installs0
Estrellas24.8K
Versión1.0.0
Calidad91/100 · Excelente
Confianza80/100 · Revisar antes de instalar
Auditoría89/100 · Seguro para probar

Perfil del activo

Investigación y trabajo de conocimiento

Deep research, source comparison, literature review, RAG, knowledge search, and reports.

Ver categoría

Escenario

Agents de investigación

I need my agent to research a topic, compare sources, and produce a concise report.

Afinidad con Agent

Claude Code + CLI + Codex

Funciona con Codex, Claude Code, Cursor, CLI o Agents personalizados.

Instalar

Listo

npx skills add alirezarezvani/claude-skills --skill ab-test-setup

Mantenimiento

Actual

Actualizado hoy

Riesgo

Seguro para probar

Quality score needs review

Calidad de GitHub

25K

91/100 Calidad · 85/100 Confianza

Etiquetas de cobertura

InvestigaciónAgents de investigaciónDiseño y creatividadagent-skill

Notas de revisión

Quality score needs review

Tarjeta de adopción del Agent

Confianza, auditoría y preparación de instalación de un vistazo

Estas puntuaciones combinan metadatos públicos del repositorio, señales de revisión de OpenAgentSkill, actualidad de mantenimiento y preparación de instalación. Sirven para preseleccionar; no sustituyen la revisión humana.

Calidad

Excelente
91

High-confidence pick with strong adoption and healthy maintenance signals.

Confianza

Revisar antes de instalar
80

Buena señal para la preselección, pero el Agent debe revisar las notas de auditoría, la política de instalación y la evidencia de resultados antes de ejecutarlo.

Auditoría

Seguro para probar
89

Revisión legible por máquina de la preparación de instalación, los metadatos de seguridad, el mantenimiento y el riesgo de adopción.

Trust Score de OpenAgentSkill v5

Revisión humana antes de instalar

Úsalo como candidato principal tras revisión humana o en sandbox.

CodexClaude CodeCursorOpenAgentSkill CLI

Estrellas

25K estrellas de GitHub

Actividad del repositorio

25K estrellas y 3.5K forks

Mantenimiento

Actualizado hoy

Licencia

MIT

Instalar

npx skills add alirezarezvani/claude-skills --skill ab-test-setup

Seguridad de instalación

Ruta estándar de paquete o instalación en tiempo de ejecución

Superficie de permisos

shell or command execution, filesystem or document access

Resultados del Agent

Aún no hay datos de resultados del Agent

Documentación

Contexto sólido de README/SKILL.md

Resumen de riesgo

Riesgo de metadatos bajo

  • Quality score needs review

Preparación de instalación

Ruta de instalación disponible

  • La ruta de instalación está disponible
  • La evidencia del repositorio está disponible
  • La licencia está declarada
  • Aún no hay evidencia de resultados Agent-Proven

Metadatos legibles por Agent

Datos de decisión legibles por máquina para este skill.

Usa este bloque o el JSON integrado para decidir si un Agent debe instalar este skill, elegir una alternativa o pedir revisión humana primero.

Abrir JSON

Tareas adecuadas

  • Flujos de Agents de investigación
  • Equipos de Claude Code
  • Equipos que valoran señales de adopción de GitHub
  • Fuentes de búsqueda

Agents adecuados

CodexClaude CodeCursorOpenAgentSkill CLICLI

Decisión de instalación

Comando
npx skills add alirezarezvani/claude-skills --skill ab-test-setup
Política
Revisar
Revisión humana

Confianza y riesgo

Confianza
80/100
Auditoría
89/100
Nivel de riesgo
Seguro para probar

Ciclo de resultados

Endpoint
/api/agent/outcome
ID del evento
resolve
Resultados
5

Comando de instalación

npx skills add alirezarezvani/claude-skills --skill ab-test-setup

No usar cuando

  • Equipos que necesitan un SLA con soporte del proveedor
  • Entornos de alta conformidad sin revisión interna de seguridad
  • No OpenAgentSkill engagement data yet
  • Indicios de permisos de alto riesgo: ejecución de shell o comandos
  • Quality score needs review

Seguridad de Agent v2

61/100 · Revisar antes de instalar

Revisado con notas de permisosRevisar

Candidato utilizable, pero el Agent debe mostrar las notas de permisos y auditoría antes de instalar.

Requiere aprobación humana antes de instalar en un espacio de trabajo real.

Resolver con API

Alto

Ejecución de shell o comandos

Los metadatos del skill hacen referencia a terminal, CLI, shell, subprocesos o flujos de ejecución de comandos.

Medio

Acceso a red

El skill probablemente consulta páginas remotas, API, repositorios o servicios externos.

Medio

Acceso al sistema de archivos

El skill puede leer o escribir archivos de proyecto, documentos, artefactos generados o estado local.

  • Indicios de permisos de alto riesgo: ejecución de shell o comandos
  • Quality score needs review

Destinos de instalación

Instala este skill en tu flujo de Agent

Usa el endpoint público para obtener el comando, la lista de seguridad, prompts y enlaces canónicos.

skill install

OpenAgentSkill CLI

Resolve policy, run the source installer safely, and report a verified install receipt.

$ npx --yes https://github.com/Leon-Drq/openagentskill/releases/download/cli-v0.2.1/openagentskill-0.2.1.tgz install alirezarezvani-ab-test-setup

Plan de resolución de Agent

Deja que un Agent valide el ajuste antes de instalar.

La API Resolve devuelve la skill elegida, alternativas, política de seguridad, notas de auditoría, destino de instalación y un prompt listo para usar.

Abrir plan de texto

Agent debe revisar

  • Task fit and alternatives from Resolve API.
  • Audit score, trust score, and safety policy warnings.
  • Install target compatibility for Codex, Claude Code, Cursor, or CLI.

Copiar prompt

Task: Use ab-test-setup in this workspace.
Resolve first: https://www.openagentskill.com/api/agent/resolve?task=Use%20ab-test-setup%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Review install handoff: https://www.openagentskill.com/api/skills/alirezarezvani-ab-test-setup/install
Install command: npx skills add alirezarezvani/claude-skills --skill ab-test-setup
Before running it, summarize audit warnings, required permissions, and the fallback skill if install is risky.

Traspaso de Agent

Da al Agent la ruta de instalación, no otro directorio.

Usa el endpoint público para obtener el comando, la lista de seguridad, prompts y enlaces canónicos.

Abrir API de instalación

Prompt de Agent

Use ab-test-setup for this task. Review https://www.openagentskill.com/api/skills/alirezarezvani-ab-test-setup/install, then install with: npx skills add alirezarezvani/claude-skills --skill ab-test-setup

Metadatos del Registry

Perfil legible por Agent para seleccionar skills automáticamente.

La API Registry expone señales de decisión, confianza, auditoría, casos de uso e instalación sin raspar la interfaz.

Abrir Manifest

Afinidad con Agent

100/100

Agents de investigación

Plataformas

Claude Code

Informe de auditoría

Seguro para probar · 89/100

Revisión legible por máquina de la preparación de instalación, los metadatos de seguridad, el mantenimiento y el riesgo de adopción.

Ver informe de auditoríaVer informe de evaluación

Panel de decisión de Agent

Elección principal para Agents de investigación

Use this as a leading candidate, then validate the README and install path in your own agent stack.

100
Preparación
Adoptar
Etapa

Rol en la pila

Elección principal

Ajuste principal

Agents de investigación

Etiqueta de confianza

Listo para producción

Ruta de instalación

Comando listo

Úsalo cuando

  • Flujos de Agents de investigación
  • Equipos de Claude Code
  • Equipos que valoran señales de adopción de GitHub

Evidencia

  • 24,795 estrellas de GitHub
  • recent repository activity
  • install command or GitHub repo available
  • perfil de calidad 91/100

revisar primero

  • No OpenAgentSkill engagement data yet

Ruta de implementación

  1. 1Instálalo en un Agent de sandbox y ejecuta una tarea de Agents de investigación de principio a fin.
  2. 2Compare output quality, latency, and failure behavior against at least one alternative.
  3. 3Promote it into production only after reviewing repository permissions, license, and maintenance signals.

Perfil de confianza

Revisar antes de instalar

Buena señal para la preselección, pero el Agent debe revisar las notas de auditoría, la política de instalación y la evidencia de resultados antes de ejecutarlo.

80
Trust Score de OpenAgentSkill

Adopción en GitHub

Aprobado

25K estrellas de GitHub

Actividad de stars/forks

Aprobado

25K estrellas y 3.5K forks; la actividad de issues no está disponible en los metadatos actuales

Mantenimiento reciente

Aprobado

Actualizado hoy

Claridad de licencia

Aprobado

MIT

Señales positivas

  • Revisión de IA aprobada
  • La ruta de instalación está disponible
  • La evidencia del repositorio está disponible
  • Repositorio mantenido recientemente
  • Large GitHub adoption signal
  • El comando de instalación no muestra un patrón de alto riesgo evidente
  • El ciclo de resultados está listo, pero necesita la primera ejecución real de Agent

Revisar antes de instalar

  • Quality score needs review
  • Aún no hay informes reales de resultados del Agent
  • Se requiere revisión humana antes de una instalación desatendida

Acción recomendada

Úsalo como candidato principal tras revisión humana o en sandbox.

Perfil de calidad

Excelente candidato para flujos de Agent

High-confidence pick with strong adoption and healthy maintenance signals.

91
Estrellas de GitHub
25K
Actualidad
Hoy
Listo para instalar
Licencia
MIT

Ajuste de flujo

Usa esta skill en estos escenarios

Ajuste de flujo

Añadir a un flujo completo

Lista de alternativas

Compara antes de instalar

Similar skills that may fit this task.

Comparar todo

Resumen

--- name: "ab-test-setup" description: When the user wants to plan, design, or implement an A/B test or experiment. Also use when the user mentions "A/B test," "split test," "experiment," "test this change," "variant copy," "multivariate test," "hypothesis," "conversion experiment," "statistical significance," or "test this." For tracking implementation, see analytics-tracking. license: MIT metadata: version: 1.0.0 author: Alireza Rezvani category: marketing updated: 2026-03-06 ---

# A/B Test Setup

You are an expert in experimentation and A/B testing. Your goal is to help design tests that produce statistically valid, actionable results.

## Initial Assessment

**Check for product marketing context first:** If `.claude/product-marketing-context.md` exists, read it before asking questions. Use that context and only ask for information not already covered or specific to this task.

Before designing a test, understand:

1. **Test Context** - What are you trying to improve? What change are you considering? 2. **Current State** - Baseline conversion rate? Current traffic volume? 3. **Constraints** - Technical complexity? Timeline? Tools available?

---

## Core Principles

### 1. Start with a Hypothesis - Not just "let's see what happens" - Specific prediction of outcome - Based on reasoning or data

### 2. Test One Thing - Single variable per test - Otherwise you don't know what worked

### 3. Statistical Rigor - Pre-determine sample size - Don't peek and stop early - Commit to the methodology

### 4. Measure What Matters - Primary metric tied to business value - Secondary metrics for context - Guardrail metrics to prevent harm

---

## Hypothesis Framework

### Structure

``` Because [observation/data], we believe [change] will cause [expected outcome] for [audience]. We'll know this is true when [metrics]. ```

### Example

**Weak**: "Changing the button color might increase clicks."

**Strong**: "Because users report difficulty finding the CTA (per heatmaps and feedback), we believe making the button larger and using contrasting color will increase CTA clicks by 15%+ for new visitors. We'll measure click-through rate from page view to signup start."

---

## Test Types

| Type | Description | Traffic Needed | |------|-------------|----------------| | A/B | Two versions, single change | Moderate | | A/B/n | Multiple variants | Higher | | MVT | Multiple changes in combinations | Very high | | Split URL | Different URLs for variants | Moderate |

---

## Sample Size

### Calculate It (bundled tool)

Use this skill's own calculator — don't eyeball it:

```bash python3 scripts/sample_size_calculator.py --baseline 0.05 --mde 0.20 # human-readable python3 scripts/sample_size_calculator.py --baseline 0.05 --mde 0.20 --json # for pipelines python3 scripts/sample_size_calculator.py --baseline 0.05 --mde 0.20 --daily-traffic 2000 # adds test-duration estimate ```

Paste `sample_size_per_variation` and the duration estimate directly into the test plan's "Sample size + duration" row before any test is approved to run.

### Quick Reference

Generated by `sample_size_calculator.py` (two-proportion z-test, α=0.05 two-tailed, 80% power; relative MDE):

| Baseline | 10% Lift | 20% Lift | 50% Lift | |----------|----------|----------|----------| | 1% | 163k/variant | 43k/variant | 7.7k/variant | | 3% | 53k/variant | 14k/variant | 2.5k/variant | | 5% | 31k/variant | 8.2k/variant | 1.5k/variant | | 10% | 15k/variant | 3.8k/variant | 683/variant |

**Cross-check calculators** (should agree with the script within rounding): - [Evan Miller's](https://www.evanmiller.org/ab-testing/sample-size.html) - [Optimizely's](https://www.optimizely.com/sample-size-calculator/)

**For detailed sample size tables and duration calculations**: See [references/sample-size-guide.md](references/sample-size-guide.md)

---

## Metrics Selection

### Primary Metric - Single metric that matters most - Directly tied to hypothesis - What you'll use to call the test

### Secondary Metrics - Support primary metric interpretation - Explain why/how the change worked

### Guardrail Metrics - Things that shouldn't get worse - Stop test if significantly negative

### Example: Pricing Page Test - **Primary**: Plan selection rate - **Secondary**: Time on page, plan distribution - **Guardrail**: Support tickets, refund rate

---

## Designing Variants

### What to Vary

| Category | Examples | |----------|----------| | Headlines/Copy | Message angle, value prop, specificity, tone | | Visual Design | Layout, color, images, hierarchy | | CTA | Button copy, size, placement, number | | Content | Information included, order, amount, social proof |

### Best Practices - Single, meaningful change - Bold enough to make a difference - True to the hypothesis

---

## Traffic Allocation

| Approach | Split | When to Use | |----------|-------|-------------| | Standard | 50/50 | Default for A/B | | Conservative | 90/10, 80/20 | Limit risk of bad variant | | Ramping | Start small, increase | Technical risk mitigation |

**Considerations:** - Consistency: Users see same variant on return - Balanced exposure across time of day/week

---

## Implementation

### Client-Side - JavaScript modifies page after load - Quick to implement, can cause flicker - Tools: PostHog, Optimizely, VWO

### Server-Side - Variant determined before render - No flicker, requires dev work - Tools: PostHog, LaunchDarkly, Split

---

## Running the Test

### Pre-Launch Checklist - [ ] Hypothesis documented - [ ] Primary metric defined - [ ] Sample size calculated - [ ] Variants implemented correctly - [ ] Tracking verified - [ ] QA completed on all variants

### During the Test

**DO:** - Monitor for technical issues - Check segment quality - Document external factors

**DON'T:** - Peek at results and stop early - Make changes to variants - Add traffic from new sources

### The Peeking Problem Looking at results before reaching sample size and stopping early leads to false positives and wrong decisions. Pre-commit to sample size and trust the process.

---

## Analyzing Results

### Statistical Significance - 95% confidence = p-value < 0.05 - Means <5% chance result is random - Not a guarantee—just a threshold

### Analysis Checklist

1. **Reach sample size?** If not, result is preliminary 2. **Statistically significant?** Check confidence intervals 3. **Effect size meaningful?** Compare to MDE, project impact 4. **Secondary metrics consistent?** Support the primary? 5. **Guardrail concerns?** Anything get worse? 6. **Segment differences?** Mobile vs. desktop? New vs. returning?

### Interpreting Results

| Result | Conclusion | |--------|------------| | Significant winner | Implement variant | | Significant loser | Keep control, learn why | | No significant difference | Need more traffic or bolder test | | Mixed signals | Dig deeper, maybe segment |

---

## Documentation

Document every test with: - Hypothesis - Variants (with screenshots) - Results (sample, metrics, significance) - Decision and learnings

**For templates**: See [references/test-templates.md](references/test-templates.md)

---

## Common Mistakes

### Test Design - Testing too small a change (undetectable) - Testing too many things (can't isolate) - No clear hypothesis

### Execution - Stopping early - Changing things mid-test - Not checking implementation

### Analysis - Ignoring confidence intervals - Cherry-picking segments - Over-interpreting inconclusive results

---

## Task-Specific Questions

1. What's your current conversion rate? 2. How much traffic does this page get? 3. What change are you considering and why? 4. What's the smallest improvement worth detecting? 5. What tools do you have for testing? 6. Have you tested this area before?

---

## Proactive Triggers

Proactively offer A/B test design when:

1. **Conversion rate mentioned** — User shares a conversion rate and asks how to improve it; suggest designing a test rather than guessing at solutions. 2. **Copy or design decision is unclear** — When two variants of a headline, CTA, or layout are being debated, propose testing instead of opinionating. 3. **Campaign underperformance** — User reports a landing page or email performing below expectations; offer a structured test plan. 4. **Pricing page discussion** — Any mention of pricing page changes should trigger an offer to design a pricing test with guardrail metrics. 5. **Post-launch review** — After a feature or campaign goes live, propose follow-up experiments to optimize the result.

---

## Output Artifacts

| Artifact | Format | Description | |----------|--------|-------------| | Experiment Brief | Markdown doc | Hypothesis, variants, metrics, sample size, duration, owner | | Sample Size Calculator Input | Table | Baseline rate, MDE, confidence level, power | | Pre-Launch QA Checklist | Checklist | Implementation, tracking, variant rendering verification | | Results Analysis Report | Markdown doc | Statistical significance, effect size, segment breakdown, decision | | Test Backlog | Prioritized list | Ranked experiments by expected impact and feasibility |

---

## Communication

All outputs should meet the quality standard: clear hypothesis, pre-registered metrics, and documented decisions. Avoid presenting inconclusive results as wins. Every test should produce a learning, even if the variant loses. Reference `marketing-context` for product and audience framing before designing experiments.

---

## Related Skills

- **page-cro** — USE when you need ideas for *what* to test; NOT when you already have a hypothesis and just need test design. - **analytics-tracking** — USE to set up measurement infrastructure before running tests; NOT as a substitute for defining primary metrics upfront. - **campaign-analytics** — USE after tests conclude to fold results into broader campaign attribution; NOT during the test itself. - **pricing-strategy** — USE when test results affect pricing decisions; NOT to replace a controlled test with pure strategic reasoning. - **marketing-context** — USE as foundation before any test design to ensure hypotheses align with ICP and positioning; always load first.

Detalles técnicos

Versión
1.0.0
Licencia
MIT
Última actualización
22 ago 2026
Publicado
22 ago 2026

Resumen de decisión

Elección principal

100
Listo
Adoptar
Etapa

24,795 estrellas de GitHub

Auditoría

Revisión de instalación

Revisión de instalación y adopción

89
Seguro para probar
Seguridad
84/100
Mantenimiento
100/100
Instalar
92/100
Abrir auditoría completaVer informe de evaluación

Evidencia probada por Agent

Evidencia probada por Agent

Informes de resultados tras resolver, revisar, instalar y una ejecución limitada.

0
Probado
Needs first agent runAuto-instalación: revisar primeroÚltimo: Desconocido
Tasa de éxito
Fallo reciente
Resultados
0
Calidad de salida
Fallidos
0
No relevante
0
Instalaciones
0
Bloqueado por riesgo
0
Configuración necesaria
0
Producción
0

Aún no hay datos de resultados de Agent. La primera ejecución puede informar éxito, configuración necesaria, bloqueos de riesgo, fallo o irrelevancia mediante /api/agent/outcome.

Instalar

Añadir al flujo de Agent

Gratis y de código abierto. Revisa el informe antes de instalar en Agents de producción.

Bucle de crecimiento

Kit para compartir

X

Borrador basado en un caso para ab-test-setup, listo para publicar manualmente en X.

Nota del curador
ab-test-setup: When the user wants to plan, design, or implement an A/B test or experiment. Also use when th...

24.8K stars

https://www.openagentskill.com/skills/alirezarezvani-ab-test-setup?ref=x
Abrir borrador de X
Respuesta opcional con comando de instalación
Listing + install path for ab-test-setup:
https://www.openagentskill.com/skills/alirezarezvani-ab-test-setup?ref=x

Install: npx skills add alirezarezvani/claude-skills --skill ab-test-setup

Fuente de la ficha

Indexado por Registry

Reclamable

Esta ficha se indexó desde fuentes públicas y no está marcada como oficial hasta que se apruebe una reclamación de mantenedor.

Indexado por
Índice comunitario de OpenAgentSkill

La atribución enlaza al repositorio público o al perfil del creador. Los creadores pueden reclamar la ficha para actualizar las señales de propiedad.

Reclamar este skill

Reclamación del propietario

Reclamar esta ficha de skill

Esta ficha Indexado por Registry se atribuye a alirezarezvani, pero aún no está marcada como oficial. Reclámala para añadir una señal de propietario verificado y hacer más fiables futuras actualizaciones de lanzamiento, instalación y auditoría.

Kit de enlaces para creadores

Añade las insignias de evidencia a tu README

Muestra la ficha canónica, las señales actuales de confianza y auditoría, y evidencia real de Agent-Proven donde los desarrolladores evalúan el repositorio.

[![Listed on OpenAgentSkill](https://www.openagentskill.com/api/badge/alirezarezvani-ab-test-setup?metric=listed&label=Listed)](https://www.openagentskill.com/skills/alirezarezvani-ab-test-setup)
[![OpenAgentSkill Trust](https://www.openagentskill.com/api/badge/alirezarezvani-ab-test-setup?metric=trust&label=Trust)](https://www.openagentskill.com/skills/alirezarezvani-ab-test-setup)
[![OpenAgentSkill Audit](https://www.openagentskill.com/api/badge/alirezarezvani-ab-test-setup?metric=audit&label=Audit)](https://www.openagentskill.com/skills/alirezarezvani-ab-test-setup/audit)
[![Agent Proven](https://www.openagentskill.com/api/badge/alirezarezvani-ab-test-setup?metric=proven&label=Agent%20Proven)](https://www.openagentskill.com/skills/alirezarezvani-ab-test-setup)

Autor

A

alirezarezvani

@alirezarezvani

Etiquetas

Afinidad con plataforma

Señales de salud

Estrellas de GitHub
24.8K
Puntuación de calidad
54/100
Último push de GitHub
22 ago 2026
Pistas del framework
Desconocido
Vistas de OpenAgentSkill
0
Copias de instalación
0
Clics externos
0

Señal de comunidad

Comparte si este skill resulta útil para tu flujo de Agent. Los comentarios agregados mejoran la clasificación con el tiempo.

Confianza y seguridad

Revisar antes de instalar

80
  • Adopción en GitHub25K estrellas de GitHubAprobado
  • Actividad de stars/forks25K estrellas y 3.5K forks; la actividad de issues no está disponible en los metadatos actualesAprobado
  • Mantenimiento recienteActualizado hoyAprobado
  • Claridad de licenciaMITAprobado
  • Completitud de README/SKILL.mdLos metadatos incluyen suficiente contexto de uso y flujo de trabajoAprobado
  • Riesgo de dependencias/runtimeSuperficie de ejecución de comandosInfo