这是一份用于评估任何自动化黄金交易系统的公开方法论,共 12 项。它评估的是证据的质量与完整性,而不是给产品打分。每一项都给出:衡量什么、为什么重要、警示信号、什么算更强的证据,以及不能据此得出的结论。
市面上评估黄金EA的方式通常只有两个指标:收益率和胜率。这两个数字恰恰是最容易被包装的。下面这 12 项针对的是那些不容易被包装、但真正决定长期结果的维度。
本框架的基本原则
本框架评估的是证据质量,而不是给产品打分。这一区分很重要:
- 证据缺失不等于表现不佳。无法获得某项数据,只说明目前无法判断,并不构成该系统有问题的证据。
- 历史表现良好也不等于稳健。一段漂亮的历史记录能证明这些成交确实发生过,但不能证明该结果可以延续到不同的行情、不同的经纪商或更长的时间尺度。
因此本框架不给出综合评分。这 12 项衡量的是性质完全不同的事物(统计显著性、风险结构、执行成本、基础设施依赖),把它们加权成一个数字需要人为设定权重,而任何权重的选择都无法从数据中推导出来。一个看起来精确的综合评分,实际上只是把主观判断隐藏在小数点后面。
12 项审查
1. 实盘 vs 回测
| 衡量什么 | 该记录是真实成交,还是历史模拟? |
| 为什么重要 | 回测可以被反复优化直到好看;实盘不能。这是所有其他指标的前提——如果基础是回测,后面十一项的意义都要打折。 |
| 警示信号 | 只提供回测报告;提供的实盘无第三方平台记录;截图而非可核验链接。 |
| 更强的证据 | 第三方平台(如 MyFxBook、FX Blue、经纪商官方)连续记录,且记录起点早于你看到它的时间。 |
| 不能据此得出 | 实盘记录本身不能证明策略未来有效,只能证明这些成交确实发生过。 |
2. 已验证记录时长
| 衡量什么 | 被第三方独立记录的时间有多长?(注意:不是账户存在多久) |
| 为什么重要 | 很多记录会把接入验证平台之前的历史一并显示。那段数据是账户自报的,与验证后的数据不是同一性质。 |
| 警示信号 | 曲线起点远早于验证起点,却不加区分地统计成一个收益率。 |
| 更强的证据 | 验证期覆盖多种行情环境,并明确标注验证起始日期。 |
| 不能据此得出 | 时长本身不代表质量;但时长不足时,任何回撤与胜率统计都不具代表性。 |
3. 样本量
| 衡量什么 | 已完成多少笔交易? |
| 为什么重要 | 样本越小,运气与优势越难区分。几十笔交易的高胜率没有统计意义。 |
| 警示信号 | 以极少笔数宣传高胜率;用总收益率掩盖笔数。 |
| 更强的证据 | 数百笔以上,且分布在不同月份而非集中于某一段行情。 |
| 不能据此得出 | 笔数多不等于策略好;只是让其他统计量变得可读。 |
4. 盈利因子与期望值
| 衡量什么 | 总盈利÷总亏损;平均每笔的净期望。 |
| 为什么重要 | 它把胜率和盈亏比合成一个数。单看胜率会被“绝不止损”的策略欺骗。 |
| 警示信号 | 盈利因子极高但样本极小;或盈利集中于个别几笔。 |
| 更强的证据 | 盈利因子在足够样本下稳定,且每笔期望值明显大于交易成本。 |
| 不能据此得出 | 盈利因子不揭示风险结构——马丁策略在爆仓前也有漂亮的盈利因子。 |
5. 最大回撤
| 衡量什么 | 净值自峰值回落的最大幅度,以及它发生的时间与持续长度。 |
| 为什么重要 | 这是你实际需要承受的痛苦,决定你会不会在最坏的时候放弃。 |
| 警示信号 | 只给一个百分比而不说测量窗口;窗口内从未出现不利行情。 |
| 更强的证据 | 回撤数值 + 发生日期 + 恢复所需时间 + 记录覆盖的行情类型。 |
| 不能据此得出 | 历史最大回撤不是未来亏损的上限,只是已观察到的下限。 |
6. 单笔风险一致性
| 衡量什么 | 每笔交易的风险占净值比例是否稳定? |
| 为什么重要 | 稳定的单笔风险是纪律的证据;不稳定往往意味着存在加仓或情绪化调整。 |
| 警示信号 | 亏损之后手数明显放大;不同时期风险水平差异巨大。 |
| 更强的证据 | 完整成交记录显示手数与净值大致成比例。 |
| 不能据此得出 | 一致的风险不代表风险低,只代表它是可预期的。 |
7. 点差敏感度
| 衡量什么 | 策略的平均每笔盈利与实际点差相比是什么量级? |
| 为什么重要 | 短周期黄金策略的利润空间窄。若平均盈利与点差同量级,优势可能只存在于特定账户类型。 |
| 警示信号 | 回测使用固定低点差;不披露测试所用的点差假设。 |
| 更强的证据 | 在不同点差假设下重跑并披露结果衰减程度。 |
| 不能据此得出 | 低点差环境下的表现无法外推到你自己的账户。 |
8. 滑点敏感度
| 衡量什么 | 在真实成交条件下,成交价与信号价的差异有多大? |
| 为什么重要 | 常规历史回测未必能完整重现真实成交中的滑点与执行延迟。持仓时间越短,这类执行差异占策略利润的比例通常越高。 |
| 警示信号 | 完全不提滑点;实盘与回测的每笔平均盈利差距很大却无解释。 |
| 更强的证据 | 披露实盘平均滑点,或提供滑点敏感度测试。 |
| 不能据此得出 | 滑点小不代表在快速行情中也小。 |
9. 马丁格尔检测
| 衡量什么 | 亏损之后仓位是否成倍增加? |
| 为什么重要 | 马丁格尔通过在亏损后扩大仓位,把较高频的小额盈利与较低频但更大的尾部亏损风险交换。在有限资金与保证金约束下,连续不利行情会使仓位和保证金需求快速放大,并可能最终超过账户可承受的范围。 |
| 警示信号 | 长期几乎没有亏损记录;亏损后手数翻倍;净值曲线异常平滑然后突然断崖。 |
| 更强的证据 | 完整成交记录显示亏损后手数不变或缩小。 |
| 不能据此得出 | 没有检测到马丁不代表风险低,只是排除了这一种特定失败模式。 |
10. 网格/加仓结构
| 衡量什么 | 是否同时持有多张同向、按固定间距分布的仓位? |
| 为什么重要 | 网格在震荡中表现优异,在单边行情中浮亏持续累积,风险随价格走远而非线性上升。 |
| 警示信号 | 同时持仓数量随价格远离而增加;从不平掉浮亏单。 |
| 更强的证据 | 持仓数量有硬上限,且有明确的整体止损。 |
| 不能据此得出 | 网格本身不必然是骗局,但它的风险分布与常规策略完全不同,不能用同一套指标比较。 |
11. 新闻与执行依赖
| 衡量什么 | 在美联储决议、CPI、非农等时点如何处理? |
| 为什么重要 | 这些时段点差扩大、滑点显著,是回测与实盘差距最大的地方。 |
| 警示信号 | 完全不说明;或声称在数据行情中表现更好却无证据。 |
| 更强的证据 | 明确的事件规避规则,或披露事件时段的单独统计。 |
| 不能据此得出 | 回避新闻不代表安全,只代表移除了一类已知风险。 |
12. 经纪商与基础设施依赖
| 衡量什么 | 该记录在哪家经纪商产生?换一家还成立吗? |
| 为什么重要 | 报价源、点差结构、执行模式与服务器位置都会改变结果。同一套系统在不同平台可能完全不同。 |
| 警示信号 | 只在单一经纪商有记录,却宣称普适;不披露账户类型。 |
| 更强的证据 | 在多家经纪商或多种账户类型下都有记录。 |
| 不能据此得出 | 单一平台的良好记录不能推断到你的平台。 |
将框架应用于 Gold Scalper 的公开参考账户证据
关于数据来源的说明:以下评估依据的是与该策略关联的第三方参考账户(记录区间 2026年4月20日–8月6日),并非 KenMacro 自有账户。仅凭公开数据,无法独立确认该账户的代码、参数、账户类型与风险设置与 KenMacro 的实现完全一致。因此下列内容描述的是该公开参考记录,而不是 KenMacro 自有的已验证实盘业绩。
下表不给出“通过/不通过”,而是分三列列出:公开证据确实能确立什么、还缺少什么,以及仅在存在正面证据时才标注的风险信号。多数行没有风险信号——这本身就是有意义的信息。
| 审查项 | 已核实事实 | 仍缺少的证据 | 风险信号 |
|---|---|---|---|
| 1. 实盘 vs 回测 | 该公开参考记录来自一个真实交易账户,而非历史回测。 | 公开证据无法独立确认其代码、参数、账户类型与风险设置与 KenMacro 的实现完全一致。 | — |
| 2. 已验证记录时长 | 记录共显示 108 天(2026年4月20日–8月6日);截至评估日,其中约 43 天(自2026年6月24日起)由平台独立验证。 | 覆盖不同黄金行情环境的、更长的独立验证期。 | 所显示的 +133.64% 中,约 66 个百分点产生于独立验证开始之前,属账户自报区间。 |
| 3. 样本量 | 该记录显示 217 笔已完成交易。 | 在明显不同的市场环境下产生的更多交易。 | — |
| 4. 盈利因子与期望值 | 该记录显示盈利因子 2.48、胜率 71%。 | 更长的独立验证历史,以及逐笔成交层面的证据。 | — |
| 5. 最大回撤 | 该记录区间内观察到的最大回撤为 4.88%。 | 覆盖不利行情的、更长的独立验证期。 | 4.88% 是该记录窗口内已观察到的历史最大回撤,不是未来亏损的上限;更长、跨越不同市场环境的记录可能产生不同的回撤结果。 |
| 6. 单笔风险一致性 | 记录显示总交易 217 笔、总手数 3.06。 | 逐笔成交记录,以确认手数与净值之间是否保持稳定比例。 | — |
| 7. 点差敏感度 | 记录显示平均每笔约 131.9 点。 | 该记录所处账户的实际点差水平,以及不同点差假设下的结果衰减测试。 | — |
| 8. 滑点敏感度 | 记录显示平均持仓时间约 2 分钟。 | 实盘平均滑点数据,或滑点敏感度测试结果。 | 2 分钟的平均持仓属于对执行成本高度敏感的类型;此类策略的实盘结果通常最容易偏离理想成交假设。 |
| 9. 马丁格尔检测 | 公开摘要未显示逐笔手数序列。 | 完整成交记录,以观察亏损之后的下一笔手数是否放大。 | — |
| 10. 网格/加仓结构 | 公开摘要未显示同时持仓数量。 | 完整持仓记录,以观察持仓数量是否随价格走远而增加。 | — |
| 11. 新闻与执行依赖 | 公开材料未说明该策略在 FOMC、CPI、非农等时段的处理方式。 | 明确的事件处理规则,或事件时段的单独统计。 | — |
| 12. 经纪商与基础设施依赖 | 该记录来自单一平台上的单一账户。 | 在其他经纪商或其他账户类型下产生的对照记录。 | 同一套系统在不同经纪商的报价、点差与执行条件下结果可能明显不同,因此单一平台的记录不能直接外推。 |
上表可以确立的是:这是一个真实账户、217 笔交易、盈利因子 2.48、观测最大回撤 4.88%、记录 108 天且其中约 43 天经过独立验证。上表无法确立的是:该结果在更长时间、不同行情与不同经纪商条件下是否稳健。四项风险信号已单独列出。要让更多行从“仍缺少证据”转为“已核实”,需要公开逐笔成交记录、更长的独立验证时长,以及点差与滑点假设。
如何使用这份框架
拿到任何一套黄金EA或跟单策略时,逐项问对方这 12 个问题,并把答案填进上面的三列。对方答不上来的项目,如实记为“仍缺少的证据”,不要默认它通过,也不要因此断定它有问题。
当“仍缺少的证据”占绝大多数时,你评估的其实不是一套策略的质量,而是一份证据的完整度——这两者需要分开判断。
延伸阅读:黄金EA是什么?AI黄金自动交易机器人的原理、风险与选择指南,其中详细解释了本框架涉及的各项技术概念。
本页为教育与信息内容,不构成投资建议,也不推荐任何特定产品。杠杆产品风险极高,可能导致本金全部亏损。
KENMACRO SYSTEMS
想看看我们如何把这套框架应用到一个真实的黄金系统?
查看 KenMacro Gold Scalper 的公开参考记录、历史表现与风险数据——上表就是用本框架对它做的评估。
商业披露:Gold Scalper 通过合作券商的跟单平台连接,KenMacro 可能因此获得报酬。过往表现不代表未来收益,杠杆产品可能导致本金全部亏损。
数据来源
- MQL5 Reference — Expert Advisors 与事件处理
- MetaTrader 5 帮助 — 策略测试器
- MetaTrader 5 帮助 — 跳价生成与建模质量
- MetaTrader 5 帮助 — 优化类型与过度拟合
- LBMA — 伦敦金定盘价
技术概念部分依据 MetaQuotes 官方文档;黄金基准价格依据 LBMA。参考账户数据取自该策略公开展示的跟单平台记录。本页不引用二手 SEO 内容作为依据。
作者:Ken Chigbo — KenMacro 创始人
最后核实日期:2026年8月8日
风险提示:本页面仅供教育与信息参考,不构成任何投资、交易建议或买卖任何金融产品的推荐。外汇、黄金等杠杆产品风险极高,可能导致本金全部亏损,并不适合所有投资者。请只用您可以承受损失的资金交易,并在需要时咨询持牌的专业顾问。过往表现不代表未来收益。