31주차는 AI-assisted engineering에서 오래 남는 부분이 model 주위의 harness라는 점을 보여 줍니다. Shopify의 Dispatch는 대규모 application을 partition하고 전문 hunter를 병렬 실행한 뒤, developer에게 보여 주기 전에 다른 model이 integration test로 각 candidate를 입증하게 합니다. 80개가 넘는 application에서 300개 이상의 finding을 만들었으며 full scan은 대략 50~300달러, incremental scan은 5~50달러가 들었고 두 finding은 Critical 등급에 해당했습니다.
GitHub의 실용 workflow도 일상 개발에서 비슷한 결론에 도달합니다. Prototype으로 모호함을 드러내고, 대화형으로 plan을 세우고, 취향을 적용해 반복한 뒤 merge 전에 다른 model family의 review를 요청합니다. 새 MCP 명세는 server를 stateless HTTP workload로 만들고 Apps와 Tasks를 extension으로 공식화해 기반 infrastructure를 단순화합니다. Model 품질은 중요하지만 반복 가능한 context, deterministic tool, 격리된 실행, 독립 검증이 model output을 신뢰할 수 있는 software로 만들 수 있는지를 결정합니다.
Cloudflare와 Den Odell은 AI 밖의 infrastructure 교훈을 제공합니다. cdnjs는 pinned SRI hash를 바꿀 파일 재생성 없이 하루 90억 request를 R2, KV, Workers, Workflows, Queues, Containers, Durable Objects로 옮겼습니다. Long-lived SPA에서는 Playwright soak test가 하나의 왕복 flow를 단일 browser context에서 수백 번 반복하고 garbage collection 뒤 DOM node와 listener count를 비교할 수 있습니다. Fake clock과 mocked network로 여러 시간의 timer 활동을 nightly test에 압축할 수 있습니다.
Roman Zhukov는 들어오는 AI code에 harness 원칙을 적용합니다. 짧은 policy를 게시하고 secure prompting을 교육하며 deterministic quality gate를 추가하고 vulnerability triage를 가속해야 합니다. Project CodeGuard부터 31개 check anti-slop filter까지의 예시는 AI를 최종 권한으로 만들지 않으면서 reviewer 부담을 줄입니다. 운영 원칙은 간단합니다. AI는 assistant이고 책임지는 인간과 재현 가능한 check가 merge 여부를 결정합니다.