北京版秒过分数线可行性报告.md 15 KB

“秒过分数线”北京版可行性报告

研究日期:2026 年 8 月 13 日
研究范围:北京普通高中招生计划、指标分配、统一招生、分数段、历史录取信息、数据获取和产品落地

一、结论

结论:可行,建议立项,但不能按上海版原样复制。

综合可行性评分约 7.2/10,建议采用“有条件推进(Conditional Go)”:

  1. 计划查询能力可以较快复制。 北京的学校名单、年度招生计划、初中校额到校名额、区分数段等都有官方来源,覆盖面和权威性足够。
  2. 录取线能力必须换一种做法。 北京市级官方渠道没有提供一张可直接下载的“各高中、各区、各专业实际最低录取分数线总表”。官方填报指引反而建议考生联系学校了解往年最低线;官方录取查询也要求输入考生信息并完成验证。因此不能把非官方汇总值包装成“官方分数线”。
  3. 真正适合北京的核心产品不是“查一个分数”,而是“按考生所在区,查询能报哪些学校和专业,再用区排名、计划变化和可信录取样本辅助排 8+12 个志愿”。

建议北京版首期定位为:

北京中招计划与位次工具:查可报学校、校额到校、市级统筹、统招专业、住宿/走读限制、区排名和志愿梯度。

“精确分数线”只对有可靠来源的数据开放,并明确标注来源等级;其余显示“参考位次区间”或“已验证录取样本最低值”。

二、北京市场和政策基础

1. 用户规模足够

2026 年北京普通高中招生规模约 9.5 万人,中等职业教育招生规模约 3.3 万人;普通高中计划比 2025 年的约 8.5 万人增加约 1 万人。中招对应十万家庭量级、决策时间高度集中的年度需求。北京市教委 2026 年中招意见 北京市教委 2025 年中招意见

海淀区 2026 年首次面向全区开展官方中招志愿直播,在线观看超过 5 万人,也说明家长对志愿解释和辅助工具存在明确需求。海淀区官方志愿辅导情况

2. 北京录取结构与上海不同

2026 年北京中招按以下顺序录取:

  1. 提前招生;
  2. 指标分配招生:市级统筹 + 校额到校;
  3. 统一招生;
  4. 统一招生征集志愿。

指标分配共设 8 个志愿,每个学校可填 2 个专业;统一招生共设 12 个志愿,每个学校可填 2 个专业。指标分配要求总分达到 430 分、综合素质评价达到 B 等,并且通常要求在同一初中连续三年学籍;统一招生还存在专业加试、第一志愿第一专业、男女计划、住宿/走读等规则。北京教育考试院志愿填报问答

与上海现有能力的对应关系如下:

上海版能力 北京最接近的环节 是否能直接复用
自主招生 提前招生中的部分类型 只能复用展示框架,规则不同
名额到区 市级统筹 概念接近,但不是一一对应
名额到校 校额到校 最接近,可复用“初中—高中—名额”模型
1-15 志愿 统一招生 不能直接复用;北京是 12 个学校志愿 × 每校 2 个专业

三、数据可获得性评估

数据 官方来源 完整性 处理难度 结论
当年招生资格学校 市教委名单 可稳定获得
高中统招计划 考试院招生计划 中高 可获得,但需 OCR 和人工复核
市级统筹、校额到校计划 考试院招生计划 中高 可获得,适合结构化
初中校分配名额 考试院招生计划 中高 可获得,是差异化价值点
各区一分一段 考试院分数段统计 可稳定获得
逐校实际最低录取线 学校、家长样本、第三方汇总 中低 不能默认视为官方数据
个人录取结果 官方个人查询 仅本人 不宜自动采集 不能批量抓取或代查

1. 学校和计划数据基础较好

北京市教委公开了 2026 年具有招生资格的普通高中名单。按附件逐区汇总,本次统计为 356 所,可作为学校主数据的官方基线。2026 年招生资格学校名单

北京教育考试院把 2026 年计划拆成普通高中提前招生、市级统筹一/二、初中校市级统筹名额、优质高中校额到校、初中校校额到校名额、普通高中统招等文件,分类清楚。2026 年北京市高级中等学校招生计划

本次实际下载检查了普通高中统招、优质高中校额到校、初中校校额到校、初中校市级统筹四份核心数据 PDF,合计 95 页。它们是清晰的表格图像,但基本没有可直接抽取的文字层。现有上海项目的 PDF 渲染、OCR、坐标和人工审计经验可以复用;OCR 对学校代码、学校名和大部分数字识别效果较好,但表格列关联仍需程序和人工双重校验。

北京官方文件普遍提供 6 位学校代码,统招还提供 2 位专业代码,这是比仅靠学校简称匹配更可靠的主键。但数据维度更多,包括招生地区、专业、住宿、性别、学费、校区、加试和特殊说明,不能只沿用当前 MPS_Score 的“区 + 高中 + 计划数”结构。

2. 分数段数据质量很好

北京教育考试院按 18 个中招统计地区发布分数段:16 个行政区外,燕山和经开区单列。数据包含每分人数和累计人数,可以直接换算区排名。2026 年各区分数段统计

这应该成为北京版的核心比较口径。2024 年中招满分为 670 分,2025 年起调整为 510 分,旧年份原始分数不能直接相减,必须转换为“区排名/区百分位”后再比较。2024 年总分构成 2026 年总分构成

对 2027 届而言,2025 和 2026 已经有两年同为 510 分制的数据,正好可以开始建立可比较基线。

3. 逐校录取线是核心短板,也是竞争壁垒

北京官方计划解读明确建议考生通过学校联系方式了解“往年在本区的招生人数、最低录取分数线”。这说明最低线通常掌握在学校或由社会渠道汇总,而不是市级统一公开数据表。官方“读懂招生简章”指引

官方录取结果页面要求准考证号或身份证号后六位、报名号和滑块验证,只适合考生本人查询,不应尝试批量采集。官方中招录取结果查询

社会上已经有大量“家长分享版”录取线,说明需求存在,也说明数据真实性参差不齐。例如公开汇总页面会明确写明数据来自热心家长分享、以官方为准。家长分享数据示例

因此,北京版必须把以下四类值分开:

  • 官方或学校确认最低线;
  • 多份去标识化录取结果交叉验证后的参考线;
  • 单份已验证录取样本最低值;
  • 模型估计位次区间。

不能把后三类统一叫“官方录取分数线”。

四、产品应如何改造

1. 北京版首期必做功能

  1. 按考生区筛选可报学校/专业:如果学校在考生所在区没有计划,直接判定不可填报。
  2. 区排名换算:输入分数后显示区累计排名和百分位,并把往年学校线转换成对应年份区排名。
  3. 计划变化对比:展示学校、专业、考生区的计划增减,而不是只看学校总计划。
  4. 校额到校查询:输入初中,展示该初中获得的优质高中校额和市级统筹名额。
  5. 12 志愿 × 2 专业编辑器:校验招生区、专业加试、住宿/走读、性别、第一志愿第一专业等硬性条件。
  6. 数据可信度标签:每一个历史线或参考区间显示来源、年份、样本数、最近核验时间。
  7. 政策和计划变更提醒:官方计划发布后仍可能调整。2026 年 7 月的调整就涉及学校计划、学费、专业和住宿条件。2026 年招生简章调整通知

2. 数据库不能直接照搬现表

建议保留上海数据不动,为北京新增城市化、版本化结构,至少增加以下维度:

  • 中招地区代码:含燕山、经开;
  • 招生批次:提前、指标分配、统一、征集;
  • 计划类型:市级统筹、校额到校等;
  • 学校代码、专业代码、校区;
  • 考生所在区、目标学校、毕业初中;
  • 住宿/走读、男女限制、加试、资格规则;
  • 来源链接、来源发布日期、修订版本;
  • 分数数据类型、样本数和可信等级。

建议的核心表为:学校、专业、年度计划、初中指标名额、区分数段、录取样本、参考线、政策规则、来源版本。不要把所有字段继续压进单张 MPS_Score

3. 推荐模型应以位次为主

建议模型输出“冲、稳、保参考区间”,但必须解释依据:

本年区排名 + 往年同区录取位次 + 本年该区计划变化 + 项目/住宿条件 + 数据可信度

首期不要承诺“录取概率 87%”这类过度精确结果。北京的直升、登记入学、校额到校、专业、跨区名额和计划变化都会改变统招池,精确概率在样本不足时容易误导。

五、数据生产方案

官方数据流水线

  1. 每年 5 月更新招生资格学校名单;
  2. 6 月底抓取并留存招生计划原文件;
  3. PDF 渲染 + OCR + 表格坐标解析;
  4. 以学校代码、专业代码为主键,生成逐区计划;
  5. 做“专业合计—学校合计—地区合计”三层验算;
  6. 7 月抓取分数段并生成区排名;
  7. 志愿期持续监控官方更正通知;
  8. 录取结束后导入征集志愿剩余计划,反向检查未录满项目。2026 年征集志愿名单本身就是结构化 HTML,适合自动导入。2026 年征集志愿名单

录取数据采集

建议同步走三条线:

  • 联系学校招生办,获取本校按区、专业、住宿口径的最低线;
  • 与北京本地升学社群或学校合作,获得去标识化汇总;
  • 在小程序内让家长自愿提交录取结果,但上传前自动遮盖姓名、准考证号、报名号、身份证信息,原图完成核验后及时删除。

可信度建议:

等级 来源 展示名称
A 考试院、区招办、学校正式确认 官方/学校确认线
B 多份独立录取结果一致,且完成电话或学校交叉核验 高可信参考线
C 单份录取结果或可靠第三方整理 已验证样本,不称分数线
D 仅模型推算 参考位次区间

六、合规边界

北京版会接触未成年人分数和录取结果,必须采用数据最小化设计:

  • 不收集或代保管官方报名密码;
  • 不代替用户批量查询官方录取结果;
  • 非必要不收集姓名、学校班级、准考证号、身份证号;
  • 上传截图先在端侧或受控环境遮盖身份字段;
  • 录取结果结构化后删除原图,提供撤回和删除入口;
  • 个性化推荐说明主要依据和限制,允许用户不使用个性化推荐。

《个人信息保护法》将不满 14 周岁未成年人的个人信息列为敏感个人信息,处理时需要监护人同意并制定专门规则;自动化决策还要保证透明、公平、公正。个人信息保护法 《未成年人网络保护条例》还要求不得强制收集非必要信息,并规定未成年人个人信息合规审计等义务。未成年人网络保护条例

七、投入和落地节奏

在现有上海代码和导数经验可复用的前提下,建议按以下节奏推进:

第一阶段:2 周,验证数据

  • 建北京学校、专业、地区和批次模型;
  • 完成东城、西城、海淀三个区的统招与校额到校样本;
  • 完成 OCR、逐行校验和区排名换算;
  • 产出可查询原型。

验收条件:计划数与官方合计一致;抽检字段错误率低于 0.2%;所有值能追溯到来源页和版本。

第二阶段:4-6 周,完成 MVP

  • 城市范围官方计划和分数段上线;
  • 上线按区筛选、初中校额、学校对比、12 志愿编辑器;
  • 导入 2025、2026 两年同口径位次数据;
  • 首批只覆盖东城、西城、海淀、朝阳重点学校的高可信录取参考。

第三阶段:一个招生周期,建立数据壁垒

  • 扩大到全市学校;
  • 建学校合作和家长核验机制;
  • 积累按“考生区 + 学校 + 专业 + 住宿方式”拆分的录取样本;
  • 根据实际命中情况校准“冲稳保”区间。

人员估算:1 名产品/业务负责人、1 名全栈开发、1 名数据工程/运营可以完成 MVP;志愿季需要额外 1-2 名短期数据审核人员。若现有前端、登录、支付、学校页和数据库组件可复用,MVP 总周期约 6-8 周。

八、商业判断与最终建议

有利因素

  • 年度用户规模大,需求集中且付费动机明确;
  • 官方计划和分数段虽完整,但以 PDF、分散页面为主,查询体验存在明显改进空间;
  • 北京规则更复杂,家长需要的不只是资讯,而是资格校验和志愿排序;
  • 2025、2026 已形成两年同口径成绩,为 2027 产品启动创造了好时点。

不利因素

  • 使用高峰集中在 5-7 月,季节性强;
  • 历史线的官方公开度低,早期可信数据会不完整;
  • 政策、学校专业和计划会临时调整,必须保留版本和变更提醒;
  • 市面已有大量公众号、社群和咨询机构,单纯“汇总文章”很难形成优势。

建议的决策门槛

建议现在启动,不等到 2027 出分前再做。 当前刚结束 2026 录取,是收集 2026 录取样本、联系学校和建立两年位次基线的最佳窗口。

投入正式市场推广前,先通过以下三个门槛:

  1. 全市官方计划结构化覆盖率达到 99.5% 以上;
  2. 东城、西城、海淀、朝阳至少 20-30 所重点学校形成 A/B 级参考数据;
  3. 志愿规则校验经过北京本地中招老师或熟悉政策的运营人员复核。

如果三项达成,北京版不仅可行,而且会比上海版更有工具价值;如果拿不到可靠录取结果数据,也仍可上线“招生计划 + 校额到校 + 区排名 + 志愿规则校验”版本,但不应把产品继续命名或宣传成单纯的“精确分数线查询”。