Harness de revisão sem contexto
Ferramentas que iniciam um agente revisor sem contexto de implementação e comparam as conclusões com a revisão humana. A medir onde a independência realmente compensa.
Inacabado por desenho. As experiências abandonadas permanecem visíveis. Saber quando parar faz parte do método.
Ferramentas que iniciam um agente revisor sem contexto de implementação e comparam as conclusões com a revisão humana. A medir onde a independência realmente compensa.
Transforma uma longa sessão de agente num documento mínimo de contexto a partir do qual uma sessão nova consegue retomar. A parte difícil é decidir o que esquecer.
Como páginas locais programáticas surgem nos motores de resposta de IA face à pesquisa clássica. Fase inicial, sobretudo desenho de medição.
Um agente a operar um navegador para verificações de regressão. Em pausa: um script de comparação de capturas faz 90% do trabalho por 5% do custo.
Abandonado depois de dois quase-incidentes. Actualizações que passam os testes podem alterar comportamentos nunca cobertos. Agora são preparadas pelo agente e integradas pelo humano.
Um único script que valida uma configuração local completa e indica exactamente o que falta. Aborrecido e usado todas as semanas.