<OpenRouter model slug> Bắt buộc Model slug
Identifier vendor/model chính xác trên OpenRouter cần đánh giá bằng DeepSWE. Skill xác minh trước khi tiêu token; đây không phải mục trong catalog do AgentKit sở hữu.
/ak:deep-swe openai/gpt-4o-mini Tóm tắt nhanh / Lệnh
Bộ Engineer
/ak:deep-swe
Chạy benchmark coding-agent bên ngoài trên DeepSWE qua Pier và OpenRouter, có thiết lập an toàn, smoke một task, kiểm soát subset/full run và báo cáo chính xác.
Chốt phạm vi
Kiểm điều kiện
Cài runner
Xác minh model slug
Nguyên tắc 01
Đây là benchmark bên ngoài, không phải tối ưu repo local.
Nguyên tắc 02
Không bao giờ in, lưu, commit hoặc đưa OPENROUTER_API_KEY vào artifact.
Nguyên tắc 03
Đọc help Pier hiện tại trước khi tin vào flag.
Nguyên tắc 04
Một task trước subset; xác nhận rõ trước corpus đầy đủ.
Nguyên tắc 05
Không nộp kết quả leaderboard nếu người dùng chưa yêu cầu.
Các nhánh chính từ đầu vào đến kết quả, bám theo cách command chạy khi dùng thật.
Khởi động
Đầu vào, phạm vi, route
Xử lý
Agent / skill thực thi
Kiểm chứng
Gate, review, xác thực
Đóng
Báo cáo, bàn giao, artifact
Cách gọi skill: cú pháp, đối số vị trí, option dùng chung, rồi từng subcommand với cú pháp và kết quả riêng.
Cú pháp
/ak:deep-swe <OpenRouter model slug> [benchmark request]<OpenRouter model slug> Bắt buộc Model slug
Identifier vendor/model chính xác trên OpenRouter cần đánh giá bằng DeepSWE. Skill xác minh trước khi tiêu token; đây không phải mục trong catalog do AgentKit sở hữu.
/ak:deep-swe openai/gpt-4o-mini [benchmark request] Yêu cầu benchmark
Ranh giới tùy chọn bằng ngôn ngữ tự nhiên, ví dụ một task smoke cụ thể, subset xác định hoặc xác minh job Pier đã có. Mặc định không cho phép chạy toàn bộ corpus hoặc nộp kết quả.
/ak:deep-swe openai/gpt-4o-mini "Chạy một task DeepSWE được đặt tên như smoke test. Stop sau task và không submit kết quả." Ví dụ gọi command theo từng flag, subcommand, mode hoặc route dùng được trong workflow thực tế.
/ak:deep-swe openai/gpt-4o-mini "Chạy một task DeepSWE có tên như smoke test. Hiện đúng lệnh Pier và ước tính spend exposure trước khi thực thi. Dừng sau task và không submit kết quả." /ak:deep-sweopenai/gpt-4o-mini "Sau khi smoke task thành công, chuẩn bị subset 10 task mang tính deterministic với--n-tasks10 và--sample-seed0 chỉ khi pier run--helphiện tại xác nhận các flag đó."
/ak:deep-swe xác minh kết quả job Pier cho openai/gpt-4o-mini