一、会议基本信息
- 汇报时间:2026年6月10日
- 汇报主题:方差分析智能体阶段成果、多智能体准自然实验、对话式智能体开发及后续工作方向
- 核心主线:以方差分析智能体演示为本次汇报重点,验证科研方法智能体的产品形态、开发效率和业务可行性
二、本次会议核心结论
- 方差分析智能体整体流程和产品形态基本可行,可以进入专家校验和业务试用阶段。
- 方差分析不能只验证工作流程,还必须由3至5名量化专家实际跑一遍,检查统计方法、参数、报告和图表是否专业可靠。
- 需要核算单次分析及大模型交互成本,重新分析、参数调整后重跑等行为必须纳入收费或额度机制。
- 产品上线前应展示多个完整案例,让用户在付费前看到智能体能处理什么数据、形成什么结果。
- 多智能体社会模拟具有较高价值,可继续基于AgentSociety等开源框架探索,但必须重点评估准确性、资源消耗、并发、模型成本和商业化使用门槛。
- 对话式开发智能体已经可行,当前采用自然语言驱动编码的方式效率更高;待团队调整完成后,再推动技术研发部门全面采用AI开发方式。
- 近期工作形成三条主线:科研方法智能体、多智能体社会模拟、公司内部AI提效。
- 当前执行顺序明确:先推动方差分析试用;继续探索多智能体方案;跨部门内部提效暂不着急。
- 科研方法智能体不负责生成整篇论文,主要输出可靠的数据分析结果、图表和可供用户放入论文的结果材料。
- 在业务标准流程、参考模板和业务校验机制明确后,继续验证科研方法智能体开发技能的复用效率。
三、方差分析智能体阶段成果
(一)已覆盖的分析能力
当前智能体已覆盖6类方差分析及相关分析流程,包括单因素、双因素、多因素、重复测量、混合设计、协方差等类型。不同类型的具体检验步骤和报告结构会根据数据及方法自动调整。
现有使用流程为:
- 用户上传数据文件。
- AI自动识别数据结构并推荐适合的方差分析类型。
- 系统展示识别出的自变量、因变量、推荐方法及判别原因。
- 用户查看数据预览、字段类型和缺失情况。
- 用户检查或手动调整分析类型、变量、事后比较方法和显著性水平。
- 系统按照对应方法的标准流程执行分析。
- 生成统计结果、图表和分析报告。
- 用户导出Word结果,或继续通过智能助手追问、润色和调整参数。
(二)AI自动判别与人工修正
系统能够根据上传数据自动判断方差分析类型,并说明判断依据。考虑到自动识别可能与用户研究目的不完全一致,系统保留人工调整入口。
用户可以手动修改:
- 方差分析类型。
- 自变量、因变量及分组变量。
- 事后多重比较方法。
- 显著性水平,默认值为0.05。
- 其他与具体分析类型相关的配置。
对于方差齐性与不齐性等不同情况,系统会自动推荐相应的事后比较方式,但用户仍可根据研究要求修改。
(三)标准分析过程与报告
单因素方差分析当前按照约6个步骤执行,包括描述性统计、方差齐性检验、方差分析、逐变量结果、图表和AI总结。双因素、多因素、重复测量、协方差等类型根据方法要求增加交互效应、简单效应、斜率齐性等相应步骤。
最终报告包含:
- 统计方法说明。
- 描述性统计。
- 前提条件检验。
- 方差分析结果。
- 逐变量或逐因素解释。
- 效应量及相关统计量。
- 图表。
- 结果总结。
报告可导出为Word。产品目标不是代替用户生成整篇论文,而是提供可信的数据分析结果、图表和结果表述材料,供用户选择后放入自己的论文。
(四)“悟空同学”智能助手
当前智能助手主要承担三类任务:
- 追问统计结论,对均值、显著性、效应量等结果进行解释。
- 按照用户要求润色某一段或全文,用户可选择采纳或拒绝修改。
- 根据自然语言调整分析参数,并在用户确认后重新运行分析。
参数调整时,系统会先展示配置变更预览,例如将显著性水平由0.05调整为0.01。用户确认后才重新分析。全部对话和操作记录可以保存,并支持回看历史任务。
四、领导对方差分析智能体的明确要求
(一)核算成本与收费机制
当前方差分析智能体与唐刚此前开发的智能体调用模型不同,因此需要单独测算成本。
成本测算至少应包括:
- 首次数据分析的大模型调用成本。
- 智能助手问答和报告润色成本。
- 参数调整后重新分析的成本。
- 不同方差分析类型的调用差异。
- 单次完整任务的总成本。
收费机制需要与平台后续统一。可研究的方式包括单次购买、次数额度和充值积分扣减。无论采用哪种方式,重新运行分析都不能无限免费,应计为新的分析次数或扣减相应积分。
需要同步了解唐刚现有两个智能体的成本与收费机制,再统一研究平台采用哪种方式更合适。
(二)开展量化专家校验
目前流程主要依据开发者理解、门博士提供的单因素参考框架以及AI整理结果形成,多因素等类型仍缺少稳定的业务模板。
领导要求联系量化专家开展实际测试:
- 找3至5名量化专家。
- 每位专家完整跑一遍方差分析智能体。
- 检查类型判别、变量选择、统计流程、参数、图表及报告表达。
- 汇总专家意见后统一修改。
- 修改完成后再进入更广泛试用。
校验不能只看界面流程是否顺畅,重点是结果是否符合真实研究和论文使用要求。
(三)增加付费前案例展示
方差分析及其他科研方法智能体都应准备若干完整案例,展示:
- 输入数据大致是什么样。
- 系统如何判断方法。
- 分析过程包含哪些步骤。
- 最终报告、图表和数据结果是什么样。
- 用户可以直接获得什么价值。
案例的作用是让用户在购买或使用前判断产品是否可靠、是否适合自己的研究问题。
五、多智能体社会模拟与准自然实验探索
(一)前期调研情况
围绕多智能体协同模拟准自然实验,已调研多个国内外开源框架,并从能力范围、更新时间、开源许可、商业化可能性和技术成熟度进行比较。
当前重点关注AgentSociety及另一套较成熟的国际框架。AgentSociety由清华相关团队开发,开源项目和论文材料较完整,具备大规模智能体并发、复杂社会交互和多类实证研究能力。后续还需进一步了解清华团队和实验室情况。
(二)已完成的实验验证
已下载AgentSociety开源代码并跑通一个“社交媒体信息茧房与过滤气泡效应”实验,同时自行封装了前端页面。
实验流程包括:
- 输入研究问题。
- 开展相关文献检索,判断研究价值和已有成果。
- 设置研究假设。
- 设置实验组与对照组。
- 配置智能体数量、实验步数等参数。
- 运行多智能体社会交互。
- 记录发帖、评论、点赞、关注等事件流。
- 形成分析报告、数据表和图表。
- 生成论文式结果材料。
现有框架理论上可以将多个智能体作为不同社会角色,也可以支撑较大样本量的调查或问卷场景。但其效果是否能够替代或逼近真实样本,必须通过论文中的对照实验、已有案例和后续验证确认。
(三)领导重点关注的问题
- 用户是否可以只通过自然语言输入研究问题和必要参数,后续由系统自动完成。
- 自动生成大量智能体后的准确性和有效性如何验证。
- 不同大模型是否会明显影响实验结果。
- 成千上万个智能体运行时,对CPU、存储、并发和大模型调用量的要求有多高。
- 如果大量用户同时使用,整体资源和成本如何测算。
- 是否采用用户自行填写模型API Key、平台统一购买模型服务或公司自建模型。
- 是否需要与云服务厂商合作,为每个实验动态准备运行环境。
- 后续是否有必要与清华团队开展合作。
(四)当前决定
该方向有较高价值,可以继续做。近期先在开源框架基础上形成一个简单可用版本,重点验证核心流程和效果。
前期不急于与清华团队合作。先独立探索,只有发现升级、算法或关键能力确实无法绕过原团队时,再考虑合作。
调研问卷可以作为该框架的一种应用,但简单问卷调查也可以单独形成产品,不必全部并入复杂的社会模拟系统。
六、对话式智能体开发方式
本次汇报验证了两种主要方式。
(一)自然语言生成工作流
可以通过Coze、Dify等工具,根据自然语言生成智能体工作流,再把工作流集成到网页。
优点是工作过程可视化、业务流程容易展示;不足是需要增加一层集成转换,复杂任务需要多轮沟通,实际运行延迟也可能高于直接编码。
(二)自然语言驱动编码
当前方差分析智能体和本次演示页面主要通过自然语言与编程工具交互完成,开发者没有手工逐行编写代码。
该方式具有以下特点:
- 代码控制更明确。
- 复杂交互更容易实现。
- 性能和响应速度更好。
- 开发效率明显提高。
- 模板形成后可以快速复用。
领导认可该方向。待高辉小组及相关团队调整完成后,再推进技术研发部门全面采用AI辅助开发方式。
未来还可以探索让业务人员直接通过自然语言生成简单智能体,但当前先以技术人员提高开发效率为主。
七、后续工作主线
会议确定近期主要围绕三条线开展工作。
(一)科研方法智能体
这是近期最主要的产品开发任务。先通过方差分析再验证一至两个方法,形成稳定的开发模式后,再增加人员或兼职团队,争取在较短时间内完成一批科研方法智能体。
(二)多智能体社会模拟
继续研究AgentSociety等框架,形成可由普通科研人员使用的简化产品,重点解决用户操作、准确性、资源、模型和成本问题。
(三)公司内部AI提效
后续可深入各部门,梳理交付、运营、直播、学员服务等工作流程,识别适合使用AI的节点。例如自动收集直播间或学员群问题、形成标准应答材料等。
该事项涉及不同部门的详细业务,当前不作为最紧急任务,待团队和前两条主线稳定后再推进。
八、科研方法智能体复用机制
汇报中提出,智能体快速复制依赖三项业务基础:
- 该研究方法的标准操作流程。
- 高质量参考模板和真实案例。
- 业务人员或专家的校验。
技术上已开始沉淀名为Research Method Agent的开发技能,将现有界面风格、代码规范和开发过程整理为可复用能力。
下一步应再选择两个研究方法进行验证。如果验证后能够稳定复用,后续可能只需增加1至2名开发人员,即可显著提高方法智能体的产出速度。
开发速度的预期需要通过实际项目验证,不能仅按理想情况估算。没有业务标准和真实案例时,AI快速生成的结果仍可能存在专业偏差。
九、明确待办任务
| 优先级 | 待办任务 | 完成标准 |
|---|---|---|
| P0 | 对接相关业务负责人,安排方差分析智能体试用 | 形成试用人员、时间及反馈记录 |
| P0 | 找3至5名量化专家完整测试方差分析智能体 | 覆盖方法判断、统计流程、参数、图表和报告 |
| P0 | 根据专家意见修改方差分析智能体 | 专业问题关闭并完成复测 |
| P0 | 测算方差分析单次完整运行成本 | 覆盖首次分析、问答、润色和重新分析 |
| P0 | 研究统一收费机制 | 明确单次购买、次数额度或积分扣减方式 |
| P1 | 为方差分析准备多个完整展示案例 | 用户付费前可查看输入、过程和结果 |
| P1 | 继续完善AgentSociety简单可用版本 | 普通用户可输入研究问题和必要参数后运行 |
| P1 | 调研AgentSociety论文、案例及准确性验证 | 形成有效性和对照实验结论 |
| P1 | 评估多智能体运行资源及模型成本 | 明确不同规模下的CPU、存储、并发和模型费用 |
| P1 | 比较主流模型对模拟结果的影响 | 形成模型选择建议 |
| P1 | 用另外两个科研方法验证开发技能 | 验证标准流程、模板和技术复用效率 |
| P1 | 同步推进科研方法智能体人员或兼职资源准备 | 根据验证后的实际效率确定人员规模 |
| P2 | 待团队调整后推动技术研发AI化 | 形成研发团队AI辅助开发规范 |
| P2 | 后续开展各部门内部提效调研 | 先梳理业务流程,再决定具体智能体 |
十、执行顺序
- 第一优先:方差分析智能体进入专家测试和业务试用,完成成本、收费与案例展示。
- 第二优先:继续探索多智能体社会模拟,先形成简单可用版本并验证效果与资源。
- 第三优先:验证科研方法智能体开发技能的复用效率,并据此推进人员配置。
- 后续事项:跨部门内部AI提效暂不着急,待团队和主要产品方向稳定后再开展。