Language
<< 返回文章列表

把神级Skill「grill-me」带入Mopheus:让智能体学会“自我拷问”与对抗审查

2026年9月3日
M
o
p
h
e
u
s
,
,
s
k
i
l
l
s
,
A
I
,
Kamus
4

代码写完了,方案定好了,但你心里真的有底吗?当海量流量涌入、网络闪断或边缘极端场景发生时,你的系统会崩溃在哪里?我们往往不缺写代码的双手,而是缺少一个严苛、专业、毫不留情的“审查官”。

01什么是grill-me?区区60词的神级Prompt究竟神在哪里?

在日常使用AI辅助编程和方案设计的开发者实践中,有一个被许多一线研发同学视为“秘密武器”的实用Skill——grill-me(字面意思是“把我放在火上烤”)。

这个技能最早由知名工程师与开发者导师Matt Pocock创作并开源于GitHub:

原版开源仓库https://github.com/mattpocock/skills   

原始Skill链接(Matt已经重构了这个skill,真正的指示放到了grilling里,grill-me作为兼容指示指向了grilling)https://github.com/mattpocock/skills/tree/main/skills/productivity/grill-me  

这个在开发者中备受推崇的技能,其核心定义文件(SKILL.md)极其简短(尽管Matt已经扩充了grilling提示词,但是曾经原版的grill-me只有60多个英文单词,已然非常好用):

Interview me relentlessly about every aspect of this plan until we reach a shared understanding. Walk down each branch of the design tree, resolving dependencies between decisions one-by-one. You MUST provide your recommended answer for every single question — never ask a question without also giving your own recommendation. This is mandatory, not optional. Ask the questions one at a time. If a question can be answered by exploring the codebase, explore the codebase instead.

【中文对照翻译】对我这个方案的每一个细节进行毫不留情的严密质询,直到我们达成共识。沿着设计决策树的每一个分支向下深挖,逐一解决决策之间的依赖关系。你必须为提出的每一个问题同时给出你的推荐答案——严禁只提问而不给建议。这是强制要求,没有例外。每次只提一个问题如果一个问题可以通过阅读代码库找到答案,直接去读代码,不要来问我。

1为什么这么短的一个Skill,威力却如此惊人?

很多刚接触Prompt Engineering的人会以为:越强大的能力,Prompt越要写得像老太婆的裹脚布一样冗长复杂。grill-me展现了极简设计的巅峰:

1.“毫不留情直到达成共识(Relentlessly until shared understanding)”

从底层彻底扭转了普通大模型“讨好人类、敷衍夸赞”的温和倾向,将Agent的姿态直接锚定在顶级首席架构师或苛刻面试官的频段上。   

2.“决策树深搜(Walk down each branch of the design tree)”

强制大模型进行系统化的深度优先搜索,逐个击破决策依赖,而不是东一榔头西一棒槌地泛泛而谈。   

3.最灵魂的核心约束——“提问必须自带推荐方案(Must provide recommendation)”

这是整篇Prompt的点睛之笔!如果只让AI提问,它很容易沦为一个只抛出抽象问题的“杠精”;但一旦强制它必须给出推荐解,大模型在提问的同一瞬间就必须完成深度推演与权衡,给出专业级判断。这不仅极大地减轻了被拷问者的思考成本,还直接给出了高质量的参考基准。   

4.“每次只问一个(One at a time)”与“能读代码绝不废话(Explore codebase first)”

前者避免了让用户面对长篇大论产生认知过载;后者则让AI保持务实,绝不在已有的代码事实上浪费人类的时间。   

●━━━━━━━━━━━━━━━●

02为什么Mopheus已经支持了技能,还要把grill-me锻造为工单的原生机制?

Mopheus天然支持Agent的Skill扩展体系。那么,为什么我们还要花大力气,在工单评论区专门打造一套原生的Griller追问审查机制?

1真实的人机拷问体验:极其值得,但也极其煎熬

原版的grill-me本质是“Agent拷问人类”。人类工程师坐在屏幕前,打字跟Agent进行交互式对答。

一次标准的grill-me通常需要进行10~20轮深度质询,完整过一遍大概要花30分钟。

在真实的体验中,这种过程是非常震撼却又令人神经紧绷的:当被连续追问到第10个以上直击痛处的尖锐问题时,人真的会开始感到焦躁,就像真的被架在火上烤一样。

但毫无疑问,这极其值得——特别是对于一个核心功能的设计、一次精密的数据库在线升级或复杂数据迁移策划来说,这种拷问往往能在代码写下之前,把灾难性的隐患扼杀在摇篮里。

2痛点与诉求:如何在保证高质量的前提下“更快一轮”?

质询审查如此关键,我们绝不能因为过程充满挑战就降低标准。但在快节奏的日常研发流中,我们更希望能以极高的速度跑完一轮Grill,在最短时间内把代码和设计中潜藏的隐患彻底挖出来。

更何况,在AI-Native的协同体系下,很多技术方案与代码本身就是由负责执行的Agent编写的。如果让同一个Agent审自己的代码,天然存在“自证偏见”;而如果每新增一段代码、每讨论一个细节都要等待人类排期进行30分钟的同步对答,整体迭代节奏就会被阻塞。

我们希望严苛的审查能够自动化、高频次、持续不断地发生

这时候,一个自然的灵感诞生了:如果我们能派出另一个专职挑刺的智能体,来“自己问自己”,在后台全自动跑完这20轮深度推演呢?

3核心解法:让智能体学会“自我拷问”与“对抗审查”

让独立的专职Agent(如DBA专家、安全审查官、高并发架构师)以客座专家的身份介入,针对现有的方案或代码讨论串开展全自动多轮自问自答(Self-Q&A)

图1:Mopheus中的工作流升级

这意味着:人类工程师只需在工单里轻轻一点,智能体便在后台快速完成整套对抗审查,几分钟后将一份条理分明的压力测试报告呈现在讨论串下方,供团队快速拍板定案。

图2:工单评论区生成的Grill-Me自问自答审查报告

●━━━━━━━━━━━━━━━●

03如果人类仍然想亲自接受拷问?当然完全支持!

必须强调的是:将Griller做成工单原生机制,绝不意味着剥夺人类亲自接受挑战的乐趣与价值。

如果作为技术负责人或架构师的你,正在设计一套极其关键的全新架构方案,希望亲自接受AI的地狱级严酷质询,在Mopheus中同样易如反掌:

1.导入或创建经典Skill:在Mopheus技能中心直接创建或导入原始的grill-me,或者导入进阶版的grill-with-docs(它不仅拷问你的方案,还会一边拷问一边直接根据讨论共识自动更新项目的CONTEXT.md术语表与ADR架构决策记录);   

2.随心开启人机对决:     
    在Chat对话中:直接与绑定的架构师智能体开聊,输入/grill-me,开启一对一实时压力测试;     
    在Ticket工单中:新开一张需求/设计工单,在描述中附上方案,@你的智能体并附带指令,让它在工单评论区对你展开逐轮公开质询。   

图3:Mopheus双轨并行的审查体系

●━━━━━━━━━━━━━━━●

04我们是怎么落地的?极简、优雅与实用的工程设计

把质询审查深度融入日常协同,我们在底层做到了极简与克制:

1智能体变身Griller:无侵入的角色专精继承

在Mopheus中,我们没有引入复杂的配置项。只要在智能体设置里开启is_griller(或在CLI加上--is-griller),这个智能体就自动拥有了“审查官”资格。

它会天然继承已有的专业指令与技能:

DBA Griller:专挑慢查询、死锁、索引失效与大事务风险;   

架构Griller:专挑微服务依赖解耦、高可用降级与状态机闭环问题;   

前端Griller:专挑响应式适配、无障碍访问与渲染竞态问题。   

无论工单原本是由人类经办还是由其他Agent负责,用户都能随时以“客座专家”的身份召唤他们,完全不打乱工单原有的责任归属。

2精密的Prompt编排与回帖闭环

为了让Agent在自问自答时不跑题、不产生幻觉,我们在Prompt层面确立了三大铁律:

上下文强收敛(Thread Scoping):Griller严格以被追问的那条评论及其上下文讨论作为事实来源,不随意发散;   

语种自适应(Language Matching):被审查的讨论是中文,自问自答与输出报告全程保持中文;英文讨论则输出英文,严丝合缝融入团队交流;   

线程化子回复(Thread Reply):审查报告生成后,自动通过--parent挂载到被质询的评论下方,讨论脉络如GitHub PR Review般清晰整洁。   

3CLI优先(CLI-First)与多端毫秒级感知

开发者既可以在Web界面评论卡片右上角下拉菜单一键召唤:

图4:Mopheus Web评论区一键召唤Griller审查

也可以在终端或自动化流水线中直接执行:

# 对指定工单正文发起Grill深度质询,指派专属审查智能体
mopheus ticket grill <ticket-id> [--agent-id <griller-id>
# 对指定评论发起Grill深度质询,指派专属审查智能体
mopheus ticket comment grill <comment-id> --agent-id <griller-id>

配合后端的实时WebSocket广播与浏览器Tab休眠唤醒重连机制,无论你是在前台守候还是切走去忙别的,审查任务的生成与回帖都会毫秒级自刷新呈现在页面上。

●━━━━━━━━━━━━━━━●

05未来演进:从单智能体自问自答走向“智能体对抗竞技场(Arena Topic)”

目前的Griller机制,是由专职审查官智能体在后台沙箱中模拟极端场景进行“自问自答(Self-Q&A)”。这已经为团队带来了巨大的质量与效率收益,但这只是多智能体对抗协作的序章。

我们下一步的计划,是让两个真正独立的智能体在真实场景中面对面交锋

让专职审查官智能体,去直接拷问即将编写代码的开发智能体;   

让安全与高可用审查智能体,去轮番质询即将执行线上复杂数据迁移或高危运维操作的DBA智能体。   

为了实现这一愿景,我们计划将Agent对抗场(Agent Arena)深度引入Mopheus现有的Topic(主题研讨)体系:

图5:Mopheus未来演进路线——智能体对抗竞技场(Agent Arena Topic)

通过将工单评论一键升维为Arena Topic,人类工程师不仅可以作为“观众”实时围观两个顶级AI专家的硬核思辨与逻辑交锋,更能直接获得经过最严密逻辑推演与极限压力测试的坚固方案。

●━━━━━━━━━━━━━━━●

06结语:让软件工程走向“AI相互对抗与自我进化”

大模型写代码的速度越来越快,但工程质量的核心防线在于审查与把关

grill-me引入Mopheus,是我们探索“多智能体对抗协作”的重要一步:

既保留了人类亲自接受AI深度质询的“练兵场”;   

又开启了Agent异步自问自答、为人类方案与代码自动挑刺的“质检站”;   

更铺就了未来双Agent在Arena Topic中展开真刀真枪对抗审查的广阔空间。

想让严苛专业的Griller智能体
为你的团队方案把关吗?
立即上手探索Mopheus,为你的工作空间配置专属的架构与质量审查官扫码添加云和恩墨小助手