=== 调试股东名称提取问题 === 模拟OCR文本行(包含自然人股东描述): [1] 股东及出资信息 [2] 股东名称 [3] 证照/证件类型 [4] 证照/证件号码 [5] 股东类型 [6] 1 [7] 张三 [8] 自然人股东 [9] 身份证 [10] 123456789012345678 [11] 自然人 [12] 主要人员信息 [13] 姓名 [14] 职位 === 测试当前逻辑 === 找到股东类型标记,位置: 5 找到序号: 1,位置: 6 检查行 7: '张三' 收集股东名称部分: '张三' 检查行 8: '自然人股东' 收集股东名称部分: '自然人股东' 检查行 9: '身份证' 收集股东名称部分: '身份证' 检查行 10: '123456789012345678' 收集股东名称部分: '123456789012345678' 检查行 11: '自然人' 收集股东名称部分: '自然人' 检查行 12: '主要人员信息' 遇到主要人员信息,停止收集 收集到的所有部分: [张三, 自然人股东, 身份证, 123456789012345678, 自然人] 去掉最后3个信息前: 5 个部分 去掉最后3个信息后: 2 个部分 剩余部分: [张三, 自然人股东] 提取结果: '张三自然人股东' ❌ 问题确认:结果包含了'自然人股东'描述文字 === 修复建议 === 需要在收集股东名称时过滤掉以下描述性文字: - '自然人股东' - '法人股东' - '企业股东' - '机构股东' - 其他类似的描述性文字 === 修复后的逻辑测试 === 收集股东名称部分: '张三' 跳过股东描述文字: '自然人股东' 跳过证件信息: '身份证' 跳过证件信息: '123456789012345678' 跳过股东描述文字: '自然人' 修复后结果: '张三' ✅ 修复成功:已过滤掉描述文字 === 调试完成 ===