主题
编纂口径:只收录公开可检索的论文、预印本与赛事公告;每条给出原文标题、作者、年份、发表处与链接。无法在公开来源核实的字段显式标注。
§0 赛事公开信息锚点(作为后续文献的落点)
-
中国指挥与控制学会(主办方) | 2025 | 中国指挥与控制学会官网 | h-nd-2096.html文号「兵棋赛组字〔2025〕02 号」,明确专项赛下设四个分赛道,面向军地高校、科研院所、军工企业公开报名。本赛道的制度性来源,规定了赛道划分与参赛资格。
-
大赛组委会 | 2026 站点(含 2025 赛季信息) | hiai.ciccwargame.com | hiai.ciccwargame.com官网「大赛介绍」原文——远程协同(赛道四):远程协同打击攻防博弈挑战赛专项赛依托「决胜千里」智能博弈推演平台,面向远程协同精确打击典型红蓝博弈场景设置比赛,聚焦复杂动态态势认知、作战方案高效制定和临机智能辅助决策需求。平台、想定类型、能力诉求(态势认知 / 方案制定 / 临机辅助决策)的第一手公开表述,是全文所有技术主题的锚点。
-
南京大学智能科学与技术学院 | 2025-12-19 发布 | 学院新闻 | is.nju.edu.cn大赛由中国指挥与控制学会主办,南京大学智能科学与技术学院、CICC 智能博弈与兵棋推演专委会、国防科技大学系统工程学院等承办;12 月 2—5 日在南京大学苏州校区举行(12 月 4 日全部比赛结束);设人人对抗主体赛、智能算法挑战赛、手工推演比赛三大赛道共 6 个子赛项,依托「墨子未来指挥官」「灵弈智能推演系统」「智空」「城池攻略」「决胜千里」等平台,覆盖联合作战、空中作战、城市作战、远程导弹攻防博弈等领域;全国 25 个省、2.3 万名选手报名。核实了时间(2025-12-02~05)、地点(南京大学苏州校区)、平台(决胜千里)三项关键事实;同期举办「首届兵棋开发者研讨会」。
-
大赛组委会/平台方 | 2025 | hiai.ciccwargame.com 资料专区 | 智能体开发指南.pdf公开检索摘要显示,该指南提供含 jsqlsim Python SDK、JSQLSceneTool、JSQLEngine 的工具包,用于智能体开发接入。工程接入口径的唯一公开依据——赛道要求的是「通过 SDK 接入的智能体」,而非纯文本博弈。
-
大赛组委会 | 2025 | hiai.ciccwargame.com | 预赛评分标准与细则.pdf公开摘要片段提到「在 X 分钟内重创蓝方旗舰/巡洋舰/驱逐舰」一类由作战意图输入参数化的评分表述。说明评分是目标达成度 + 时限驱动的量化口径,直接对应 §7 的评测设计。
-
中国运载火箭技术研究院(火箭院,航天一院) | 2024 | 航天科技集团官网 | calt.spacechina.com火箭院(航天一院)研发中心自办「弈起进化」系列智能博弈挑战赛,2024 年为第六届。说明本赛道是企业内部赛事的公开化延伸,其评测传统(对抗性、算法接入)先于本届大赛存在。
§1 LLM 与兵棋/桌游推演
-
Wenyue Hua, Lizhou Fan, Lingyao Li, Kai Mei, Jianchao Ji, Yingqiang Ge, Libby Hemphill, Yongfeng Zhang | 2023(ICML 2024) | arXiv:2311.17227 | arxiv.org/abs/2311.17227用 LLM 多智能体复现一战、二战与战国历史场景,观察联盟形成、冲突升级与开战决策的涌现模式。
-
Meta Fundamental AI Research Diplomacy Team (Bakhtin et al.) | 2022 | Science 378(6624): 1067–1074;arXiv:2210.05492 | doi:10.1126/science.ade9097 · arXiv把对话语言模型(谈判)与规划引擎(动作选择)解耦再耦合,在《Diplomacy》中达到人类水平。
-
Julien Perolat, Bart De Vylder, Daniel Hennes, et al.(DeepMind) | 2022 | Science 378(6622): 990–996;arXiv:2206.15378 | arXiv · Science在不完全信息、含欺骗的二人零和博弈上,用无模型多智能体 RL 达到人类专家水平,无需搜索或人工启发式。
-
Dan Hogan, Andrea Brennen 等 | 2024 | arXiv:2404.11446 | arXiv在开放式(无固定胜负判据)兵棋中评估 LLM 生成想定、裁定与行动方案的能力,讨论 LLM 在推演中承担"裁判/参谋"角色的可行性与局限。
-
Juan-Pablo Rivera, Gabriel Mukobi, Anka Reuel, Max Lamparth, Chandler Smith, Jacquelyn Schneider | 2024 | ACM FAccT 2024;arXiv:2402.08797 | arXiv · FAccT PDF以《Snow Globe》类兵棋模拟实验,发现多款前沿 LLM 在军事/外交场景中表现出升级倾向与不可预测性。
-
Joon Sung Park, Joseph C. O'Brien, Carrie J. Cai, Meredith Ringel Morris, Percy Liang, Michael S. Bernstein | 2023 | UIST 2023;arXiv:2304.03442 | arXiv提出「记忆流 + 反思 + 计划」三件套的智能体架构,让 25 个智能体在小镇中涌现出可信的群体行为。
-
Lei Wang, Chen Ma, Xueyang Feng, et al. | 2024 | Frontiers of Computer Science 18: 186345 | Springer从规划、记忆、工具、行动四个模块系统梳理 LLM 智能体的构建范式。
-
IEEE SMC eNewsletter 特约文章 | 2025 | IEEE Systems, Man, and Cybernetics Society | PDF综述 LLM 与多智能体系统的架构结合方式、协同机制与开放问题。
§2 决策智能与智能博弈
-
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm (AlphaZero) 2.1David Silver, Thomas Hubert, Julian Schrittwieser, et al. | 2017/2018 | Science 362(6419): 1140–1144;arXiv:1712.01815 | arXiv以「深度网络先验 + MCTS 搜索 + 自博弈」三要素,从零学会国际象棋与将棋并超越人类。
-
Oriol Vinyals, Igor Babuschkin, Wojciech M. Czarnecki, et al. | 2019 | Nature 575: 350–354 | doi:10.1038/s41586-019-1724-z在部分可观测、实时、大动作空间的 RTS 环境中达到宗师级水平,关键在联盟训练与模仿-强化混合。
-
Julian Schrittwieser, Ioannis Antonoglou, Thomas Hubert, et al. | 2019/2020 | Nature 588: 604–609;arXiv:1911.08265 | arXiv不依赖规则、只学隐式环境模型即可做前瞻搜索。
-
Cameron B. Browne, Edward Powley, Daniel Whitehouse, et al. | 2012 | IEEE Transactions on Computational Intelligence and AI in Games 4(1): 1–43 | doi:10.1109/TCIAIG.2012.2186810MCTS 的经典综述,给出选择/扩展/模拟/回传四阶段的统一表述与变体分类。
-
Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao | 2022/2023 | ICLR 2023;arXiv:2210.03629 | arXiv交替生成"思考轨迹"与"动作",让 LLM 与外部环境闭环交互。
-
Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan | 2023 | NeurIPS 2023;arXiv:2305.10601 | arXiv把 LLM 生成组织为树状搜索,支持前瞻、回溯与多路径评估。
-
Shibo Hao, Yi Gu, Haodi Ma, Joshua J. Hong, Zhen Wang, Daisy Zhe Wang, Zhiting Hu | 2023 | EMNLP 2023;arXiv:2305.14992 | arXiv把 LLM 同时当作世界模型与推理智能体,用 MCTS 在其内部做规划。
-
Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang, Yu-Xiong Wang | 2023/2024 | ICML 2024;arXiv:2310.04406 | arXiv在树搜索中融合 ReAct、反思与价值模型,在 WebShop 等决策环境显著优于无搜索基线。
-
Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan, Shunyu Yao | 2023 | NeurIPS 2023;arXiv:2303.11366 | arXiv用语言化"复盘"写入记忆,替代梯度更新来改进后续决策。
-
Aman Madaan, Niket Tandon, Prakhar Gupta, et al. | 2023 | NeurIPS 2023;arXiv:2303.17651 | arXiv同一模型生成 → 自评 → 修订的迭代回路,无需额外训练即提升输出质量。
§3 多智能体协作与工具调用
-
Qingyun Wu, Gagan Bansal, Jieyu Zhang, et al.(Microsoft) | 2023 | arXiv:2308.08155 | arXiv以"可对话智能体 + 可编程会话"为抽象,支持多角色协作与人工介入。
-
Guohao Li, Hasan Abed Al Kader Hammoud, Hani Itani, Dmitrii Khizbullin, Bernard Ghanem | 2023 | NeurIPS 2023;arXiv:2303.17760 | arXiv用"角色扮演 + 初始指令"驱动两个智能体自主对话完成任务,并提出角色翻转等失效模式。
-
Sirui Hong, Mingchen Zhuge, Jonathan Chen, et al. | 2023/2024 | ICLR 2024;arXiv:2308.00352 | arXiv把标准作业流程(SOP)编码为智能体流水线,让"产品经理/架构师/工程师"协同产出。
-
Chen Qian, Wei Liu, Hongzhang Liu, et al. | 2023/2024 | ACL 2024;arXiv:2307.07924 | arXiv以"聊天链 + 阶段性角色"实现端到端软件开发,并提出"通信幻觉"等缺陷分析。
-
Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, et al. | 2023 | NeurIPS 2023;arXiv:2302.04761 | arXiv模型自监督学习"何时调用哪个 API"。
-
Shishir G. Patil, Tianjun Zhang, Xin Wang, Joseph E. Gonzalez | 2023 | NeurIPS 2024;arXiv:2305.15334 | arXiv面向大规模真实 API 的调用生成与检索增强,显著降低"幻觉调用"。
-
Yujia Qin, Shihao Liang, Yining Ye, et al. | 2023/2024 | ICLR 2024;arXiv:2307.16789 | arXiv构建 16000+ API 的指令数据集与 DFSDT 多路径决策搜索算法。
-
Tianle Cai, Xuezhi Wang, Tengyu Ma, Xinyun Chen, Denny Zhou | 2023 | arXiv:2305.17126 | arXiv强模型"造工具"(生成 Python 函数),弱模型"用工具",把一次性推理固化为可复用工件。
-
Kutluhan Erol, James Hendler, Dana S. Nau | 1994 | AAAI-94 | aaai.org确立分层任务网络(HTN)规划的复杂度与表达力边界,是"任务分解"的形式化起点。
-
Anthropic | 2024 | Anthropic 官方公告 + 规范站点 | anthropic.com · modelcontextprotocol.io提出模型与外部工具/数据源之间的标准上下文协议(MCP),统一资源、工具与提示模板的暴露方式。
§4 大小模型协同(赛道核心机制)
-
Lingjiao Chen, Matei Zaharia, James Zou | 2023 | arXiv:2305.05176 | ar5iv · arXiv把多个 LLM 串成级联/路由,在给定预算下达到接近最强模型的质量。
-
Q. J. Hu, Jacob Bieker, et al. | 2024 | arXiv:2403.12031 | arXiv为多模型路由提供统一基准与评价口径(质量-成本曲线)。
-
Dujian Ding, Ankur Mallick, Chi Wang, Robert Sim, Subhabrata Mukherjee, Victor Rühle, Laks V. S. Lakshmanan, Ahmed Hassan Awadallah | 2024 | arXiv:2404.14618 | ar5iv · arXiv训练路由模型预测"小模型是否够用",并给出质量感知的路由阈值。
-
Isaac Ong, Amjad Almahairi, Vincent Wu, et al.(LMSYS) | 2024 | arXiv:2406.18665 | arXiv用人类偏好数据训练路由器,在保持响应质量的同时大幅降低调用成本。
-
Yaniv Leviathan, Matan Kalman, Yossi Matias | 2022/2023 | ICML 2023;arXiv:2211.17192 | arXiv小模型快速起草、大模型并行校验,理论加速且不改变输出分布。
-
Charlie Chen, Sebastian Borgeaud, Geoffrey Irving, Jean-Baptiste Lespiau, Laurent Sifre, John Jumper | 2023 | arXiv:2302.01318 | arXiv给出投机采样的严格形式与无偏性证明,将加速显式化。
-
Patrick Lewis, Ethan Perez, Aleksandra Piktus, et al. | 2020 | NeurIPS 2020;arXiv:2005.11401 | arXiv把参数化模型与外部可检索记忆结合,RAG 的奠基论文。
-
Yunfan Gao, Yun Xiong, Xinyu Gao, et al. | 2023/2024 | arXiv:2312.10997 | arXiv把 RAG 划分为朴素/进阶/模块化三代,梳理检索、生成、增强三支柱。
§5 军事/国防 AI 公开研究(均为公开发表,非涉密)
-
公开论文(IEEE Xplore 收录) | 2026 | IEEE | ieeexplore.ieee.org/document/11336231用优化后的 LLM 评分智能体对兵棋推演策略打分,追求稳定性与专家一致性。
-
Open-Ended Wargames with LLMs(见 1.4)与 Escalation Risks(见 1.5) 5.2已在 §1 收录,此处不重复计数。二者共同构成"LLM 进入兵棋回路"的公开研究主线。
-
联合空中力量能力中心(JAPCC)与 NATO C2COE | 公开研究 | JAPCC | japcc.org梳理人机编队中的信任、职责分配、可解释性与训练需求。
-
Meaningful Human Control in Multi-Agent Systems Through AI-Based Dynamic Task Allocation Strategies 5.4NATO Science and Technology Organization | 公开会议论文 | NATO STO | sto.nato.int研究多智能体系统中通过动态任务分配来保持"有意义的人类控制"。
-
美国陆军《Army Communicator》2025 秋冬刊 | 2025 | 美国陆军公开发行刊物 | lineofdeparture.army.mil讨论 AI 在任务式指挥(mission command)中聚合信息、降低认知负荷的公开实践。
-
Elise Annett, James Giordano | 公开研究简报 | 美国国防大学 Strategic Insights | digitalcommons.ndu.edu从伦理与治理角度讨论智能体化数据系统进入军事指挥的问题。
-
DVIDS(美国国防部视觉信息分发服务)公开新闻 | 公开报道 | dvidshub.net公开报道的 AI 辅助战场管理(battle management)实验,强调速度与准确率提升。
-
Military Operations Research Society (MORS) | 公开会议报告 | MORS PDF兵棋推演的裁定(adjudication)、团队配置、数据采集等方法学讨论。
-
RAND Corporation | 公开学位论文(RAND RGSD 系列) | RAND PDFRAND 兵棋/仿真相关公开学位论文,涉及行为体建模与推演设计。
§6 优化与运筹
-
公开综述(Engineering Applications of Artificial Intelligence, Vol. 137) | 2024 | EAAI | doi:10.1016/j.engappai.2024.109212系统梳理 WTA 的模型族(静态/动态、单/多目标)、算法族(精确、启发式、元启发、RL)与应用。
-
公开综述(KCI 收录) | 2024/2025 | KCI | kci.go.kr面向贴近实战环境的 WTA,比较精确算法与深度强化学习路线。
-
公开预印本 | 2024 | arXiv:2405.20740 | arXiv离散化 Lanchester 消耗模型,并引入"预防性投降"行为。
-
公开综述 | 2024 | arXiv:2404.13954 | arXiv · ADS梳理机器学习在空战行为建模中的方法、数据与验证方式。
-
公开发表综述(Chinese Journal of Aeronautics) | 2026 | Elsevier | sciencedirect.com总结深度强化学习在智能空战自主决策中的挑战、突破与展望。
-
公开论文(IEEE Xplore) | 2025/2026 | IEEE | ieeexplore.ieee.org/document/11288184用多目标竞争性协同进化优化两方陆战兵棋策略。
-
公开发表论文(Swarm and Evolutionary Computation) | 2026 | Elsevier | sciencedirect.com以能力需求为引导的并行进化算法求解武器体系部署位置。
-
公开论文(KCI 收录) | 公开来源 | KCI | kci.go.kr公开期刊论文,讨论舰队防空体系下多类资产的运用概念建模。
§7 评测与基准
-
Xiao Liu, Hao Yu, Hanchen Zhang, et al. | 2023/2024 | ICLR 2024;arXiv:2308.03688 | arXiv · ICLR PDF跨 8 类交互环境评测 LLM 作为智能体的能力,揭示"对话强 ≠ 智能体强"。
-
Shunyu Yao, Noah Shinn, Pedram Razavi, Karthik Narasimhan | 2024 | arXiv:2406.12045 | arXiv在真实业务域中评测"工具调用 + 用户交互 + 规则遵循",强调 pass^k 一致性指标。
-
Grégoire Mialon, Clémentine Fourrier, Craig Swift, et al. | 2023 | arXiv:2311.12983 | arXiv面向真实世界助理任务的基准,含多步推理、工具使用与多模态。
-
Percy Liang, Rishi Bommasani, Tony Lee, et al.(Stanford CRFM) | 2022/2023 | arXiv:2211.09110 | arXiv提出"多维场景 × 多维指标"的整体评估框架(准确率、校准、鲁棒性、公平性、效率等)。
-
Asaf Yehudai, Lilach Eden, Alan Li, et al. | 2025 | arXiv:2503.16416 | arXiv系统梳理智能体评测的维度:核心能力、应用基准、通用智能体、开发框架评测。
-
Mahmoud Mohammadi, Yipeng Zhang, Yixin Diao, et al. | 2025 | arXiv:2507.21504 | arXiv · HF Papers提出智能体评测的分类法,区分评测目标与评测过程两个维度。
-
Dawei Li, Bohan Jiang, Liangjie Huang, et al. | 2024 | arXiv:2411.16594 | arXiv综述 LLM 作为评判者的方法族与偏差(位置偏差、自偏好、长度偏差)。
-
Jiawei Gu, Xuhui Jiang, Zhichao Shi, et al. | 2024/2025 | New Astronomy Reviews / Elsevier(公开综述) | sciencedirect.com给出提升 LLM 评判一致性、可靠性与可解释性的路线图。
-
Stable and Expert-Aligned Evaluation of Wargaming Strategies(同 5.1) 7.9见 5.1,此处不重复计数;其"专家对齐"指标是本赛道最有针对性的评测参照。
§8 中文文献(公开摘要级)
-
孙宇祥、赵俊杰、解宇轩、喻车澄、周献中(南京大学工程管理学院) | 2024 | 《控制与决策》2024, 39(12): 3927–3936;DOI: 10.13195/j.kzyjc.2023.1497 | kzyjc.alljournals.cn针对 ChatGPT 类大语言模型在兵棋环境中的应用,提出双层 Agent 任务规划框架,让 LLM 在兵棋环境中生成决策。
-
刘银钢、马明、张荣华(天津工业大学) | 2026 | 《系统仿真学报》2026, 38(5): 1187–1204;DOI: 10.16182/j.issn1004731x.joss.25-1096 | china-simulation.com公开摘要明确提出「基于大小模型协同的分层 Agent 协作决策框架」:多层级结构实现战场任务层级解耦与动态协同;构建记忆管理模块与 LLM 驱动的查询优化机制(语义重构、上下文补全);时间驱动的双阶段任务规划(全局任务规划 → 原始任务评估 → 动态任务更新);实验以 DeepSeek-V3 为核心决策模型,验证任务规划与指令遵循能力。
-
《国防科技大学学报》(公开网页,期刊 2026 年第 3 期栏目) | 2026 | 国防科技大学学报 | journal.nudt.edu.cn综述大模型用于计算机生成兵力(CGF)决策行为建模的方法与挑战(以期刊公开页面为准)。
-
任涛、吴晶、易亮、郑晓颖(海军工程大学作战运筹与规划系) | 2024 | 《计算机仿真》2024 年第 12 期 | CNKI公开摘要指出,武器目标分配需依据作战目的、武器资源、目标威胁等级等约束,结合战场态势信息求取最佳方案,是作战指挥决策的关键环节;重点评述如何在尽量短的计算时间内获得最优分配方案的智能优化算法。
-
公开综述(维普收录,作者/期刊以检索页为准) | 年份以检索页为准 | 维普中文期刊服务平台 | cqvip.com对战役战术级兵棋推演中的智能决策博弈方法进行综述(详见检索页摘要)。
-
公开综述(可检索全文) | 公开年份 | 公开数据库收录 | ouci.dntb.gov.ua 记录页梳理人机博弈中的技术、挑战与机会。
-
公开期刊论文 | 公开年份 | 《系统仿真学报》 | dc-china-simulation.researchcommons.org公开全文片段显示,其决策步长的驱动力量由三部分组成:①LLM 本身;②在 LLM 调遣下提供智力支撑的知识图谱、动态规则库、历史推演库、工具集;③行为树(BT)、启发式搜索等常规决策 Agent 建模方法。
-
公开期刊论文 | 公开年份 | 《控制与决策》 | kzyjc.alljournals.cn公开片段指出"生成式兵棋 AI 旨在为兵棋环境中的智能决策提供一种新的决策框架"。
没有匹配的条目,换个关键词或切回「全部主题」。