Specyfikacja przed kodem zamienia jedną dużą decyzję modelu na kilka małych, które da się sprawdzić. Pokazuję, co mówią badania, jak robią to Spec Kit i Kiro i kiedy ten narzut się nie zwraca.
AGENTS.md ma już pomiar w recenzowanym badaniu: agenci pracują szybciej i taniej. Za to skuteczność zostaje ta sama. Rozbieram, co z tego wynika dla treści takiego pliku i dlaczego popularne szablony szkodzą.
Agenta nie da się sprawdzić przez assert, bo poprawnych odpowiedzi jest wiele. Opisuję, czym ADK to zastępuje, dlaczego wielostopniowy pipeline wywala AgentEvaluator i jak to obejść bez rezygnacji z testów.
W randomizowanym badaniu programiści z AI pracowali 19% wolniej, a byli przekonani, że 20% szybciej. METR zaktualizował ten wynik. Pokazuję, co z niego zostało i co mówią dane GitClear oraz DORA.
Chroma przetestowała 18 czołowych modeli i pokazała, że jakość odpowiedzi spada wraz z długością wejścia, nawet przy prostych zadaniach. Co to znaczy dla sposobu, w jaki Twój zespół buduje prompty.