- 汇报时间:2026年6月26日
一、会议核心结论
本次汇报主要围绕八项工作展开:调研问卷智能体演示及调整、科研方法智能体范围梳理、开发工作量评估、业务驱动的开发流程、研发规范建设、人员与服务器资源、大模型选型、悟空科研平台集成。
领导明确的总体方向是:
- 科研方法智能体不是从零设计研究流程,而是先研究论文中已经成熟的人工操作流程,再将其转化为智能体。
- 每开发一个智能体,必须先阅读相关论文,必要时向专家确认,不能仅凭开发人员自身理解设计。
- 每个智能体应指定业务负责人,由业务和技术共同完成流程设计、测试和验收。
- 科研方法清单需要重新调研,区分独立研究方法与其他方法中的操作环节,最终由领导确认范围及优先级。
- 智能体与悟空科研平台的最终目标是标准化对接并实现“一键发布”。
- 现有智能体不等待新架构完成,继续使用已跑通的原架构,完成一个上线一个。
- 当前优先理顺人员、服务器、唐刚既有工作和平台对接,再修改方差分析智能体。
- 调研问卷智能体工作量较大,当前暂缓,不列入近期开发任务。
二、调研问卷智能体演示及领导意见
(一)当前原型情况
现有原型按照七个阶段顺序执行,阶段之间不能随意跳转。当前覆盖的主要环节包括:
- 研究设计。
- 构念及变量设计。
- 问卷编制。
- 抽样及样本画像。
- 多智能体仿真作答。
- 调研质量监控。
- 结果及分析报告生成。
原型目前可以根据研究主题生成构念、维度和题目,可以设置题目数量、开放题和背景题,可以生成受访者画像、开展多智能体仿真、查看单个受访者作答情况,并生成结果报告。
(二)构念及变量设计调整
- 当前预设的七个维度不能作为唯一固定标准。
- 系统应提供多个主流标准体系,由用户选择A、B、C等不同标准。
- 不同标准体系可以对应不同维度。
- 除预设标准外,还要允许用户根据特殊研究问题自行增加维度。
- 每个维度下面的变量名称必须允许编辑,因为同一概念在不同论文中的表述可能不同。
- 页面上的标准名称应明确标注用途,如“维度设置参考标准”,不能只展示标准名称。
- 具体标准体系和维度不能凭经验确定,需要通过高质量论文进一步梳理。
(三)问卷及量表开发流程调整
领导指出,当前模型直接依据构念生成题目的方式过于简单。变量不能直接成为正式问卷或量表,必须经过成熟、科学的人工操作流程。
后续研究方向包括:
- 调研问卷编制和量表开发的经典操作流程。
- 调研德尔菲法在题目论证和筛选中的具体用法。
- 调研因子分析在变量筛选、权重判断和量表开发中的作用。
- 调研小样本预测试以及信度、效度检验的标准流程。
- 研究是否可以让大模型模拟多位专家进行多轮论证。
- 支持用户选择论证方式、论证轮数、每轮保留题目数等参数。
- 问卷质量不能只检查构念覆盖情况,重点应检查信度和效度。
资料来源应优先选择知网中的“问卷编制”“量表开发”相关高质量期刊论文,不能主要依据网上零散材料。
(四)抽样与样本画像调整
- 样本人群必须先按照人口统计学的规范分类进行设置。
- 在规范分类基础上,可以增加与具体研究问题相关的个性化画像。
- 画像不能完全由用户随意输入,也不能完全固定,要同时支持规范约束和个性化描述。
- 样本量不能任意填写,应依据科学计算公式确定。
- 系统需要支持分层抽样等规范抽样方法。
- 页面应展示样本量计算公式、抽样方法及对应依据。
- 腾讯画像库等现有画像资源可以保留为后续补充选项,但不能替代论文中成熟的抽样流程。
(五)仿真调查流程调整
- 焦点小组讨论和独立作答不应简单设计为两个并列模式。
- 标准顺序应为:先进行答题前培训或形成基本共识,再开始独立作答。
- 对智能体而言,可以通过统一提示或规则约束实现“培训和共识”。
- 并发数量应与样本规模关联,并形成不同的资源限制和收费标准。
- 大样本并发会大量消耗Token和服务器资源,应设置相应限制。
- 查看单个受访者作答逻辑并继续追问属于附加功能,可以单独收费,不作为必经环节。
(六)质量监控及输出调整
- 增加“有效问卷率”指标。
- 有效问卷率需要依据论文中的标准判断,不能默认全部样本都有效。
- 应识别漏答、未完成、答案异常等无效问卷情况。
- 继续保留画像一致性、缺失回答率等质量指标。
- 可以引入少量真人问卷,与智能体回答进行对照验证。
- 最终核心交付物不是一份概括性报告,而是全部样本的原始数据。
- 原始样本数据应支持导出Excel,每个样本的各项变量和回答均应完整展示。
- 研究设计、构念形成、问卷生成等过程信息仍有价值,可作为论文写作材料输出。
- 对样本数据进行回归、结构方程等分析,属于后续数据分析智能体的职责。
(七)产品拆分意见
领导指出,当前原型实际混合了多个独立项目。后续应从研究流程角度拆分理解:
- 量表开发是一个独立项目。
- 问卷调查是一个独立的数据收集项目。
- 深度访谈与问卷调查并列,分别收集质性数据和量化数据。
- 更复杂的社会实验或准自然实验属于另一个项目。
- 数据收集完成后,再进入回归分析、结构方程等数据分析项目。
以上是产品边界判断,不代表这些项目全部进入当前开发计划。调研问卷智能体本轮已明确暂缓。
三、科研方法清单与开发优先级
(一)现有工作
- 当前规划暂时基于唐刚前期整理的27个智能体。
- 已从使用频率、跨学科覆盖度和AI辅助价值三个维度进行初步评分。
- 方差分析智能体已部署并进入专家测试。
(二)领导要求
- 不能直接依据现有27项确定开发清单。
- 需要区分哪些是独立研究方法,哪些只是量化研究中的基础环节。
- 描述性统计、信度效度等不作为独立智能体列入清单,应放入相应研究方法内部。
- 找三位专家确认各方法是否能够独立构成研究。
- 可向相关销售人员或课程人员收集实际使用频率。
- 结合论文数据库检索量、相关研究综述和网站数据进行交叉验证。
- 形成完整调研结果后,由领导最终确认“做哪些、不做哪些、先做哪些”。
四、单智能体标准开发流程
领导明确,所有科研方法都有成熟的人工操作流程,智能体开发主要包含三项工作:
- 搞清楚现有人工操作流程。
- 通过技术手段把流程实现为智能体。
- 测试智能体是否达到相应业务效果。
建议形成以下标准流程:
- 调研与方法设计:阅读论文、咨询专家、明确用户场景、适用条件、操作步骤、工具、输入输出及判断标准。
- 原型及技术开发:将业务流程转化为智能体交互和技术流程,形成第一版代码。
- 测试与功能完善:由业务人员和测试人员验证,按照问题反馈持续修改。
- 业务验收与上线:业务负责人先验收,再向领导演示确认。
- 上线后迭代:根据真实用户反馈持续更新。
每个研究方法还应继续拆分成多个具体步骤,每一步都要设置对应标准,避免只实现表面流程。
当前对单智能体开发周期的初步估算为1至2人月,即20至40人天,中间值暂按1.5人月计算。该数字仅用于人员规划,最终仍需根据确定后的方法清单及实际复杂度调整。
五、业务负责人、测试与验收机制
- 每个智能体按独立产品推进,并指定一名业务负责人。
- 业务负责人负责梳理真实研究场景、人工流程、适用条件、工具及输出规范。
- 业务负责人应从项目开始一直参与到最终验收。
- 必要时可增加两至三名辅助业务人员补充意见。
- 开发前必须增加论文学习环节,专家意见不能代替论文调研。
- 测试人员原则上应在三天内反馈。
- 测试必须形成标准交付物,不能只进行简单试用或口头反馈。
- 内部人员负责深度测试,外部学员或培训营老师可作为补充测试力量。
- 对外部测试人员需要建立激励机制,可考虑礼品、会员、积分或按有效问题给予现金奖励。
- 测试问题需要分级,按照问题有效性和质量确定奖励。
- 智能体结果应与SPSS等成熟工具形成Benchmark对照。
- 上线标准不要求绝对完美,但明显低于成熟人工工具的产品不能上线。
- 验收标准必须下沉到每个具体步骤和细节,不能只验收总体框架。
六、研发规范与基础设施
- 当前已将方差分析代码集成到唐刚的现有架构中,现阶段能够运行。
- 后续仍需评估和优化统一架构。
- 已使用GitHub开展多人代码协作。
- 需要解决新增人员只能访问其负责代码范围的权限控制问题。
- 调研GitHub付费权限方案,并与曲总团队现有代码管理平台进行比较。
- 规划持续集成和自动发布能力。
- 继续优化科研方法Agent开发技能,逐步沉淀可复用的开发能力。
- 后续可研究测试智能体,用于按钮、流程、并发和基础功能测试;业务效果仍由业务人员测试。
- 服务器优先与曲总沟通,通过现有云服务器扩容解决。
- 如沟通或资源协调无法满足项目需要,可独立租用云服务器。
- AI相关工作原则上由本团队负责,非AI基础平台工作原则上由曲总团队负责,具体接口协作不能简单一刀切。
七、人员安排
- 高辉等人员是否调整到新团队,尊重个人选择。
- 即使原团队人员暂时不过来,也不影响启动外部招聘。
- 立即向人力资源部门提交招聘需求,对齐岗位要求和薪资标准。
- 人员进入后需要较快形成成果,不能按照三个月至六个月才见效的节奏推进。
- 可以给予必要学习时间,但期望一个月内看到阶段性变化。
- 原团队人员如继续承担已有AI项目,可以先完成阶段性成果,再讨论后续安排。
- 当前组建新部门的重要目标之一,是改变原有技术项目周期过长、效率偏低的问题。
- 人员、服务器和跨部门协作能通过沟通解决的优先沟通;无法有效解决时,采用独立招聘或独立资源方案。
八、大模型选型与采购
- 当前全部基于豆包开展测试,长期只依赖单一模型体系不够稳妥。
- 已初步调研DeepSeek、通义千问、Kimi等主流模型及企业套餐。
- 后续可同时评估开源模型和其他商业模型。
- 模型确定后向领导报告即可。
- 购买企业模型服务应走公司采购流程,提交行政部门办理,不采用个人购买后报销的方式。
九、悟空科研平台集成
(一)职责边界
悟空科研平台负责:
- 统一入口和导航。
- 用户登录及身份体系。
- 会员、积分、充值和支付。
- 平台网关及基础框架。
- 向智能体系统提供用户、余额和扣费相关接口。
智能体团队负责:
- 科研方法智能体产品及页面。
- 智能体内部业务流程。
- 智能体运行状态及结果。
- 向平台提供任务状态、执行成功与否等接口。
双方通过标准接口完成用户校验、积分查询、扣费、任务执行、部署、测试、验收和上线。
(二)领导决定
- 将现有约10至20页的详细技术方案打印成纸质版提交。
- 领导签字后直接转给曲总团队,要求其按职责完成平台侧工作。
- 方案的主要作用是确认双方职责和边界,具体技术细节可以继续协商修改。
- 最终目标是实现标准化“一键发布”。
- 一键发布需要三个前提:智能体侧标准化、平台侧标准化、双方接口打通。
- 该能力应一次建设、后续反复复用,减少跨部门沟通和重复对接。
十、近期执行顺序
| 优先级 | 待办任务 | 责任方向 | 完成标准 |
|---|---|---|---|
| P0 | 打印并提交悟空科研集成技术方案 | 汇报人 | 领导签字并转交曲总团队 |
| P0 | 继续推进现有智能体上线 | 智能体团队 | 使用原架构,完成一个上线一个 |
| P0 | 理顺人员、服务器、唐刚既有工作及平台协作 | 汇报人 | 形成明确人员、资源和职责安排 |
| P0 | 根据专家反馈修改方差分析智能体 | 汇报人 | 完成问题整改并重新验证 |
| P0 | 启动招聘 | 汇报人、人力资源 | 提交岗位需求并开始招聘 |
| P1 | 重新调研科研方法完整清单 | 汇报人 | 区分独立方法与内部环节 |
| P1 | 找三位专家确认方法边界 | 汇报人 | 形成专家确认意见 |
| P1 | 将论文检索量、跨学科覆盖度和AI价值纳入排序 | 汇报人 | 形成可供领导确认的排序表 |
| P1 | 制定单智能体业务、开发、测试和验收标准 | 汇报人、业务负责人 | 形成标准流程及交付物模板 |
| P1 | 建立测试人员及激励机制 | 汇报人 | 明确人员、时限、问题分级和奖励 |
| P1 | 与曲总确认服务器扩容及代码平台方案 | 汇报人、曲总团队 | 明确服务器和代码权限方案 |
| P2 | 完成多模型选型并按采购流程申请 | 汇报人 | 明确模型、套餐和采购方式 |
十一、暂缓及边界事项
- 调研问卷智能体暂缓,当前不继续投入主要开发资源。
- 不等待新架构完成再发布已有智能体,原架构继续使用。
- 不要求多个智能体同时发布,完成一个即可发布一个。
- 不把描述性统计、信度效度等基础环节作为独立智能体列入正式开发清单。
- 群内文章自动整理和价值分析智能体仅为设想,本次未确定启动。
- 测试智能体属于后续效率工具,本次未确定开发时间。
- 腾讯画像库只能作为补充选项,不能替代规范抽样及画像流程。
十二、下次汇报应重点反馈
- 悟空科研集成方案是否已提交、签字并转交。
- 曲总团队对职责边界、接口和一键发布目标的反馈。
- 现有智能体分别处于修改、测试、发布的哪个阶段。
- 方差分析智能体问题整改结果。
- 招聘需求提交及候选人进展。
- 科研方法清单重新调研结果及三位专家意见。
- 单智能体标准流程、业务负责人机制和测试激励方案。
- 服务器扩容、代码权限及研发协作方案。
以上已按原文梳理,并把第二次汇报纳入现有汇报序列。当前已掌握第一次、第二次、第三次、3.5次、第四次和第五次,共六份相关汇报。