赛道与路线 · 把规则翻译成技术约束

赛道与路线

4 条技术路线4 种参赛目标评分驱动的投入分配风险预案

本页小节

为什么单独做这一页:官方通知只写「大模型提示词 + 大小模型协同」,没有规定怎么实现。同样一句规则,至少能长出四种投入完全不同的技术路线,而选错路线的代价通常要到预赛大组晋级赛才会暴露。这一页把「可能的走法」摊开,方便先选路、再开工。

01先确定:这到底是哪一类赛题

同一个赛项,可以被理解成三种不同性质的题目。三种理解会导致完全不同的训练方法,先对齐:

理解 A:提示词工程赛

官方要求提交「含大模型提示词的红蓝双方博弈智能体及设计报告」,评分维度里「提示词设计与指令执行效率」占 15 分。把重心放在提示词与知识库设计上,符合官方表述。

理解 B:多智能体系统赛

决策点横跨红蓝双方各 6 类(发射车状态、航路、目标分配、波次、队形、拦截分层),且要求大小模型协同。按分布式决策系统来做,重心在角色分工、通信与状态机。

理解 C:运筹优化赛

得分公式明确含经济惩罚(成本比超阈值扣分)与毁伤得分,目标分配、拦截分配本质是武器-目标分配(WTA)与资源调度问题。按优化问题建模,大模型只做上层规划。

建议口径:把它当成 A + B + C 的叠加——大模型做目标分解与方案生成(A),多智能体分工执行(B),小模型/求解器负责目标分配与成本控制(C)。这正好对应评分维度中「战术决策适配性 30 分 + 协同机制 25 分 + 提示词 15 分」的结构。

02四条技术路线对比

投入、风险与适配队伍各不相同;「推荐」指在该类约束下相对稳妥,不代表官方立场。
路线核心做法适配队伍投入主要风险
路线一
提示词优先
用一个效果较好的大模型,把绝大部分功夫花在提示词、知识库(RAG)与输出格式约束上;小模型只做格式校验与简单计算 算法储备薄、但有人懂任务本身;首次参赛 上限受模型能力限制;遇到强对手时策略深度不足;提示词微小改动易引起成绩大幅波动
路线二
大小模型协同
大模型负责战略目标拆解与战术规划,小模型/规则模型负责路径规划、火力分配、拦截分配等实时计算;两者之间定数据契约 有工程能力、能做系统集成的队伍 接口延迟与错误传播;若协同设计讲不清楚,「协同机制」25 分拿不满
路线三
求解器驱动
把目标分配、波次组织、拦截分配建模为优化问题(WTA / 背包 / 调度),用求解器或启发式搜索出解,大模型负责意图理解与方案解释 有运筹优化或强化学习背景 中高 模型与真实裁决规则存在偏差时会系统性失准;创新性维度(20 分)可能被认为「沿用传统规则」
路线四
离线进化 + 在线推理
赛前用大量自对局/自演化搜索出策略库或参数,赛中只做检索与轻量化推理 有算力、有仿真自对局条件 过拟合到自己的自对局分布;官方平台版本变化会失效;赛事对模型调用词元/响应时间有限制
组合建议:路线二为骨架(因为评分细则明确考核「大小模型协同机制」25 分),在关键子问题上用路线三的求解器(目标分配、拦截分配),提示词与知识库按路线一的标准打磨。路线四作为有余力时的增强手段,不建议作为唯一路线。

03四种参赛目标,四条不同的精力分配

目标评判标准精力分配建议
冲名次机机对抗得分(占 70%)把 70% 以上时间投入自对局与策略调优;设计报告保证完整但不追求篇幅;必须建立可复现的评测流水线
保二等奖 / 一等奖Z = X + Y 总分对抗能力与报告并重;优先把「协同机制 25 分 + 提示词 15 分 + 文档规范 10 分」这些可控分拿满
拿专项奖(优秀创意奖 / 优秀算法奖)按代码与设计报告从设计思路、训练效率、策略分析等维度评判,原则上不超过参赛队的 50%把创新性当作主线:提出可命名的机制、给出消融实验与对照,明确说明「为什么这样设计」
学习 / 复现能完整跑通两阶段、理解赛制按「资源与路径」页的八周计划推进,重点是把官方附件读透,而不是追求成绩

04评分结构倒推的投入分配

官方把 30% 的分数(Y)给了「代码 + 设计报告」,且公布了 5 个维度的分值。据此可以把不可控的「胜负」之外的分数逐项拆出来:

可控得分项分值要交付什么证据
大模型与小模型协同机制25代码里有清晰的大小模型接口与数据交互模块;文档里专门有一节讲协同架构与分工边界
大模型提示词设计与指令执行效率15提示词模板与版本记录;说明如何约束输出格式、如何降低指令转换歧义与延迟
大模型相关代码与文档规范性10模块化代码 + 注释说明输入输出;文档讲清「态势输入 → 决策输出」全流程
大模型战术决策与场景适配性30态势解析模块;红蓝双方角色切换时决策逻辑自洽的验证记录
大模型策略生成的创新性20设计文档中的创新点章节;多轮对抗中的迭代优化记录

上表为 B 卷(满分 100)内部的分值,最终按 30% 折算计入 Y。数值来自官方附件《预赛评分标准与细则》。

05对手的几种可能,与对应的预案

机机对抗的 70% 取决于对手。公开渠道拿不到对手名单,但可以按可能出现的对手类型准备预案:

对手类型

  • 强攻型:不计成本饱和打击,追求高毁伤
  • 消耗型:用低成本弹群消耗拦截资源
  • 龟缩型:雷达静默、保守机动,等你犯错
  • 规则利用型:卡冷却时间、卡暴露窗口、卡评分阈值

准备方式

  • 自建对手池:至少实现 2–3 种基线策略,轮换训练,避免只适应一种对手
  • 为每种对手类型准备可切换的策略参数而不是重写代码
  • 记录每种对手下的成本比(C_red / C_blue),避免赢了场面却触发经济惩罚
  • 把「对手类型识别」做成赛中可执行的判断逻辑,而不是事后分析

06风险与失分预案

风险影响预案
平台版本变化 / 接口字段调整把平台调用收敛到一个适配层,业务代码只依赖自己的内部 schema;每次拿到新版本先跑一遍回归用例
模型响应超时或词元超限设置三级降级:大模型超时 → 用缓存方案 → 退回规则基线;把每一步的最坏耗时测出来
输出格式不合规导致指令被丢弃在发送前做 schema 校验,校验失败自动重试一次并降级;记录被丢弃指令的数量作为监控指标
经济惩罚触发在成本比接近阈值(红 1.5 / 蓝 1.2)时主动收敛;把成本比做成实时的决策约束而非事后统计
只准备了一方(红或蓝)官方要求提交红蓝双方智能体,且每场分两局分别执红蓝;两侧都要有可用基线
设计报告与代码不一致报告写完后按报告逐条对照代码自查;评审看的是「代码里的协同模块 + 文档里的协同架构」是否对得上
只顾自对局,忽略文档把报告写作排进计划并留出固定时间;30% 的分数在这里

07选定路线之后下一步

  1. 读官方附件:把当届《智能体开发指南》《评分标准与细则》各读一遍,把字段与阈值抄进自己的 schema(赛事页已给出要点,仍需以 PDF 原文为准)。
  2. 定路线与分工:按本页第 02 节选路线,按「备赛清单」页分角色。
  3. 先跑通最小闭环:一次 Step → 一次 GetCurrentStatus → 一次 Act,能在平台上产生可见变化,再谈策略。
  4. 建评测:先有可复现的自对局与指标,再做优化;否则无法判断改动是否有用。
  5. 补文献:按「学术文献」页按主题检索,重点看大小模型协同与多智能体协作两类。