RESEARCH METHOD AGENT · WORK REPORT

第二次工作汇报
会议纪要

问卷智能体深化、研发规范与平台协同

2026年6月26日

进一步明确业务负责人、测试激励、标准开发流程、团队资源、大模型采购及悟空科研一键发布方向。

业务驱动测试机制研发规范平台集成
整理口径遵循原交流内容,重点保留领导明确要求、执行边界、待办任务及后续开展方式。

一、会议核心结论

本次汇报主要围绕八项工作展开:调研问卷智能体演示及调整、科研方法智能体范围梳理、开发工作量评估、业务驱动的开发流程、研发规范建设、人员与服务器资源、大模型选型、悟空科研平台集成。

领导明确的总体方向是:

  1. 科研方法智能体不是从零设计研究流程,而是先研究论文中已经成熟的人工操作流程,再将其转化为智能体。
  2. 每开发一个智能体,必须先阅读相关论文,必要时向专家确认,不能仅凭开发人员自身理解设计。
  3. 每个智能体应指定业务负责人,由业务和技术共同完成流程设计、测试和验收。
  4. 科研方法清单需要重新调研,区分独立研究方法与其他方法中的操作环节,最终由领导确认范围及优先级。
  5. 智能体与悟空科研平台的最终目标是标准化对接并实现“一键发布”。
  6. 现有智能体不等待新架构完成,继续使用已跑通的原架构,完成一个上线一个。
  7. 当前优先理顺人员、服务器、唐刚既有工作和平台对接,再修改方差分析智能体。
  8. 调研问卷智能体工作量较大,当前暂缓,不列入近期开发任务。

二、调研问卷智能体演示及领导意见

(一)当前原型情况

现有原型按照七个阶段顺序执行,阶段之间不能随意跳转。当前覆盖的主要环节包括:

  1. 研究设计。
  2. 构念及变量设计。
  3. 问卷编制。
  4. 抽样及样本画像。
  5. 多智能体仿真作答。
  6. 调研质量监控。
  7. 结果及分析报告生成。

原型目前可以根据研究主题生成构念、维度和题目,可以设置题目数量、开放题和背景题,可以生成受访者画像、开展多智能体仿真、查看单个受访者作答情况,并生成结果报告。

(二)构念及变量设计调整

  1. 当前预设的七个维度不能作为唯一固定标准。
  2. 系统应提供多个主流标准体系,由用户选择A、B、C等不同标准。
  3. 不同标准体系可以对应不同维度。
  4. 除预设标准外,还要允许用户根据特殊研究问题自行增加维度。
  5. 每个维度下面的变量名称必须允许编辑,因为同一概念在不同论文中的表述可能不同。
  6. 页面上的标准名称应明确标注用途,如“维度设置参考标准”,不能只展示标准名称。
  7. 具体标准体系和维度不能凭经验确定,需要通过高质量论文进一步梳理。

(三)问卷及量表开发流程调整

领导指出,当前模型直接依据构念生成题目的方式过于简单。变量不能直接成为正式问卷或量表,必须经过成熟、科学的人工操作流程。

后续研究方向包括:

  1. 调研问卷编制和量表开发的经典操作流程。
  2. 调研德尔菲法在题目论证和筛选中的具体用法。
  3. 调研因子分析在变量筛选、权重判断和量表开发中的作用。
  4. 调研小样本预测试以及信度、效度检验的标准流程。
  5. 研究是否可以让大模型模拟多位专家进行多轮论证。
  6. 支持用户选择论证方式、论证轮数、每轮保留题目数等参数。
  7. 问卷质量不能只检查构念覆盖情况,重点应检查信度和效度。

资料来源应优先选择知网中的“问卷编制”“量表开发”相关高质量期刊论文,不能主要依据网上零散材料。

(四)抽样与样本画像调整

  1. 样本人群必须先按照人口统计学的规范分类进行设置。
  2. 在规范分类基础上,可以增加与具体研究问题相关的个性化画像。
  3. 画像不能完全由用户随意输入,也不能完全固定,要同时支持规范约束和个性化描述。
  4. 样本量不能任意填写,应依据科学计算公式确定。
  5. 系统需要支持分层抽样等规范抽样方法。
  6. 页面应展示样本量计算公式、抽样方法及对应依据。
  7. 腾讯画像库等现有画像资源可以保留为后续补充选项,但不能替代论文中成熟的抽样流程。

(五)仿真调查流程调整

  1. 焦点小组讨论和独立作答不应简单设计为两个并列模式。
  2. 标准顺序应为:先进行答题前培训或形成基本共识,再开始独立作答。
  3. 对智能体而言,可以通过统一提示或规则约束实现“培训和共识”。
  4. 并发数量应与样本规模关联,并形成不同的资源限制和收费标准。
  5. 大样本并发会大量消耗Token和服务器资源,应设置相应限制。
  6. 查看单个受访者作答逻辑并继续追问属于附加功能,可以单独收费,不作为必经环节。

(六)质量监控及输出调整

  1. 增加“有效问卷率”指标。
  2. 有效问卷率需要依据论文中的标准判断,不能默认全部样本都有效。
  3. 应识别漏答、未完成、答案异常等无效问卷情况。
  4. 继续保留画像一致性、缺失回答率等质量指标。
  5. 可以引入少量真人问卷,与智能体回答进行对照验证。
  6. 最终核心交付物不是一份概括性报告,而是全部样本的原始数据。
  7. 原始样本数据应支持导出Excel,每个样本的各项变量和回答均应完整展示。
  8. 研究设计、构念形成、问卷生成等过程信息仍有价值,可作为论文写作材料输出。
  9. 对样本数据进行回归、结构方程等分析,属于后续数据分析智能体的职责。

(七)产品拆分意见

领导指出,当前原型实际混合了多个独立项目。后续应从研究流程角度拆分理解:

  1. 量表开发是一个独立项目。
  2. 问卷调查是一个独立的数据收集项目。
  3. 深度访谈与问卷调查并列,分别收集质性数据和量化数据。
  4. 更复杂的社会实验或准自然实验属于另一个项目。
  5. 数据收集完成后,再进入回归分析、结构方程等数据分析项目。

以上是产品边界判断,不代表这些项目全部进入当前开发计划。调研问卷智能体本轮已明确暂缓。

三、科研方法清单与开发优先级

(一)现有工作

  1. 当前规划暂时基于唐刚前期整理的27个智能体。
  2. 已从使用频率、跨学科覆盖度和AI辅助价值三个维度进行初步评分。
  3. 方差分析智能体已部署并进入专家测试。

(二)领导要求

  1. 不能直接依据现有27项确定开发清单。
  2. 需要区分哪些是独立研究方法,哪些只是量化研究中的基础环节。
  3. 描述性统计、信度效度等不作为独立智能体列入清单,应放入相应研究方法内部。
  4. 找三位专家确认各方法是否能够独立构成研究。
  5. 可向相关销售人员或课程人员收集实际使用频率。
  6. 结合论文数据库检索量、相关研究综述和网站数据进行交叉验证。
  7. 形成完整调研结果后,由领导最终确认“做哪些、不做哪些、先做哪些”。

四、单智能体标准开发流程

领导明确,所有科研方法都有成熟的人工操作流程,智能体开发主要包含三项工作:

  1. 搞清楚现有人工操作流程。
  2. 通过技术手段把流程实现为智能体。
  3. 测试智能体是否达到相应业务效果。

建议形成以下标准流程:

  1. 调研与方法设计:阅读论文、咨询专家、明确用户场景、适用条件、操作步骤、工具、输入输出及判断标准。
  2. 原型及技术开发:将业务流程转化为智能体交互和技术流程,形成第一版代码。
  3. 测试与功能完善:由业务人员和测试人员验证,按照问题反馈持续修改。
  4. 业务验收与上线:业务负责人先验收,再向领导演示确认。
  5. 上线后迭代:根据真实用户反馈持续更新。

每个研究方法还应继续拆分成多个具体步骤,每一步都要设置对应标准,避免只实现表面流程。

当前对单智能体开发周期的初步估算为1至2人月,即20至40人天,中间值暂按1.5人月计算。该数字仅用于人员规划,最终仍需根据确定后的方法清单及实际复杂度调整。

五、业务负责人、测试与验收机制

  1. 每个智能体按独立产品推进,并指定一名业务负责人。
  2. 业务负责人负责梳理真实研究场景、人工流程、适用条件、工具及输出规范。
  3. 业务负责人应从项目开始一直参与到最终验收。
  4. 必要时可增加两至三名辅助业务人员补充意见。
  5. 开发前必须增加论文学习环节,专家意见不能代替论文调研。
  6. 测试人员原则上应在三天内反馈。
  7. 测试必须形成标准交付物,不能只进行简单试用或口头反馈。
  8. 内部人员负责深度测试,外部学员或培训营老师可作为补充测试力量。
  9. 对外部测试人员需要建立激励机制,可考虑礼品、会员、积分或按有效问题给予现金奖励。
  10. 测试问题需要分级,按照问题有效性和质量确定奖励。
  11. 智能体结果应与SPSS等成熟工具形成Benchmark对照。
  12. 上线标准不要求绝对完美,但明显低于成熟人工工具的产品不能上线。
  13. 验收标准必须下沉到每个具体步骤和细节,不能只验收总体框架。

六、研发规范与基础设施

  1. 当前已将方差分析代码集成到唐刚的现有架构中,现阶段能够运行。
  2. 后续仍需评估和优化统一架构。
  3. 已使用GitHub开展多人代码协作。
  4. 需要解决新增人员只能访问其负责代码范围的权限控制问题。
  5. 调研GitHub付费权限方案,并与曲总团队现有代码管理平台进行比较。
  6. 规划持续集成和自动发布能力。
  7. 继续优化科研方法Agent开发技能,逐步沉淀可复用的开发能力。
  8. 后续可研究测试智能体,用于按钮、流程、并发和基础功能测试;业务效果仍由业务人员测试。
  9. 服务器优先与曲总沟通,通过现有云服务器扩容解决。
  10. 如沟通或资源协调无法满足项目需要,可独立租用云服务器。
  11. AI相关工作原则上由本团队负责,非AI基础平台工作原则上由曲总团队负责,具体接口协作不能简单一刀切。

七、人员安排

  1. 高辉等人员是否调整到新团队,尊重个人选择。
  2. 即使原团队人员暂时不过来,也不影响启动外部招聘。
  3. 立即向人力资源部门提交招聘需求,对齐岗位要求和薪资标准。
  4. 人员进入后需要较快形成成果,不能按照三个月至六个月才见效的节奏推进。
  5. 可以给予必要学习时间,但期望一个月内看到阶段性变化。
  6. 原团队人员如继续承担已有AI项目,可以先完成阶段性成果,再讨论后续安排。
  7. 当前组建新部门的重要目标之一,是改变原有技术项目周期过长、效率偏低的问题。
  8. 人员、服务器和跨部门协作能通过沟通解决的优先沟通;无法有效解决时,采用独立招聘或独立资源方案。

八、大模型选型与采购

  1. 当前全部基于豆包开展测试,长期只依赖单一模型体系不够稳妥。
  2. 已初步调研DeepSeek、通义千问、Kimi等主流模型及企业套餐。
  3. 后续可同时评估开源模型和其他商业模型。
  4. 模型确定后向领导报告即可。
  5. 购买企业模型服务应走公司采购流程,提交行政部门办理,不采用个人购买后报销的方式。

九、悟空科研平台集成

(一)职责边界

悟空科研平台负责:

  1. 统一入口和导航。
  2. 用户登录及身份体系。
  3. 会员、积分、充值和支付。
  4. 平台网关及基础框架。
  5. 向智能体系统提供用户、余额和扣费相关接口。

智能体团队负责:

  1. 科研方法智能体产品及页面。
  2. 智能体内部业务流程。
  3. 智能体运行状态及结果。
  4. 向平台提供任务状态、执行成功与否等接口。

双方通过标准接口完成用户校验、积分查询、扣费、任务执行、部署、测试、验收和上线。

(二)领导决定

  1. 将现有约10至20页的详细技术方案打印成纸质版提交。
  2. 领导签字后直接转给曲总团队,要求其按职责完成平台侧工作。
  3. 方案的主要作用是确认双方职责和边界,具体技术细节可以继续协商修改。
  4. 最终目标是实现标准化“一键发布”。
  5. 一键发布需要三个前提:智能体侧标准化、平台侧标准化、双方接口打通。
  6. 该能力应一次建设、后续反复复用,减少跨部门沟通和重复对接。

十、近期执行顺序

优先级待办任务责任方向完成标准
P0打印并提交悟空科研集成技术方案汇报人领导签字并转交曲总团队
P0继续推进现有智能体上线智能体团队使用原架构,完成一个上线一个
P0理顺人员、服务器、唐刚既有工作及平台协作汇报人形成明确人员、资源和职责安排
P0根据专家反馈修改方差分析智能体汇报人完成问题整改并重新验证
P0启动招聘汇报人、人力资源提交岗位需求并开始招聘
P1重新调研科研方法完整清单汇报人区分独立方法与内部环节
P1找三位专家确认方法边界汇报人形成专家确认意见
P1将论文检索量、跨学科覆盖度和AI价值纳入排序汇报人形成可供领导确认的排序表
P1制定单智能体业务、开发、测试和验收标准汇报人、业务负责人形成标准流程及交付物模板
P1建立测试人员及激励机制汇报人明确人员、时限、问题分级和奖励
P1与曲总确认服务器扩容及代码平台方案汇报人、曲总团队明确服务器和代码权限方案
P2完成多模型选型并按采购流程申请汇报人明确模型、套餐和采购方式

十一、暂缓及边界事项

  1. 调研问卷智能体暂缓,当前不继续投入主要开发资源。
  2. 不等待新架构完成再发布已有智能体,原架构继续使用。
  3. 不要求多个智能体同时发布,完成一个即可发布一个。
  4. 不把描述性统计、信度效度等基础环节作为独立智能体列入正式开发清单。
  5. 群内文章自动整理和价值分析智能体仅为设想,本次未确定启动。
  6. 测试智能体属于后续效率工具,本次未确定开发时间。
  7. 腾讯画像库只能作为补充选项,不能替代规范抽样及画像流程。

十二、下次汇报应重点反馈

  1. 悟空科研集成方案是否已提交、签字并转交。
  2. 曲总团队对职责边界、接口和一键发布目标的反馈。
  3. 现有智能体分别处于修改、测试、发布的哪个阶段。
  4. 方差分析智能体问题整改结果。
  5. 招聘需求提交及候选人进展。
  6. 科研方法清单重新调研结果及三位专家意见。
  7. 单智能体标准流程、业务负责人机制和测试激励方案。
  8. 服务器扩容、代码权限及研发协作方案。

以上已按原文梳理,并把第二次汇报纳入现有汇报序列。当前已掌握第一次、第二次、第三次、3.5次、第四次和第五次,共六份相关汇报。