中古屋估价 · 误差率分布与优化优先级 · 2026-10-10

误差集中在「没有这套房自己挂牌」的房子上

全台平均误差率 10.41%,但这是两群难度完全不同的房子混在一起的结果: 有这套房自己挂牌记录的 7.2%;没有挂牌记录的 18.2%,其中连同社区成交也找不到的高达 23.8%。 没有挂牌的这批合计只占 28% 的房子,却贡献了 49% 的总误差。

当前 · 全台平均误差率
—
3,288 套固定测试样本 · 2026-05-20 至 07-08
补齐挂牌信息后 · 对标测算
—
按「同房型 + 有挂牌」水平对标的上限估计
可回收空间
—
相当于当前误差的 30%,集中在 921 套房子上
一句话结论:下一步性价比最高的事,是把全网历史售房 / 租房挂牌抓全,并准确关联到具体房屋。 这件事覆盖 28% 的房子、49% 的误差;其次是透天的土地与临路信息专项。 已经估得准的那 65% 房子,整体改造的边际收益很低,建议只做异常个案维护。
01 / 为什么不能只看平均值

一半的房子误差率低于 5.6%,平均值是被右边的长尾拉高的

把 3,288 套房子按误差率从低到高铺开,形状是「左边一大堆、右边拖一条尾巴」。 真正拉高平均值的,是右侧那 406 套(12.3%)误差率超过 20% 的房子 —— 它们贡献了 50.7% 的总误差。 所以「把平均值降下来」的实际含义是 把右边这条尾巴变短,而不是让本来已经很准的房子再准一点。

全部 3,288 套的误差率分布

横轴为误差率档位(每 2 个百分点一档),纵轴为该档房子占全部样本的比例
看数字表
误差率 = |估价 − 实际成交价| ÷ 实际成交价。逐笔等权,不裁尾、不剔除样本。

把同一批房子按「有没有这套房自己的挂牌记录」分开,会得到两条形状完全不同的曲线。 这说明高误差不是随机波动,而是集中在一类可识别的房子上 —— 这类房子是可以被定位、也可以被补数据的。

同一批房子,按有无自身挂牌拆成两条分布

两条曲线各自以本组样本数为分母,因此可以直接比形状
「无可用自身挂牌」同时检查过站内与站外价格:有挂牌记录但价格无效、以及没有任何价格记录,都会落入这一组。
02 / 一眼看高低 · 核心图

按「这套房我们掌握多少信息」分层,误差率一级一级往上走

四层互不重叠,合计 3,287 套(1 套挂牌状态无法判定,未计入)。 从第一层到第四层,我们对这套房的了解越来越少,误差率从 7.2% 升到 23.8%,相差 3.3 倍。 每一条横条展示的是该层房子的误差率分布,不只是平均值。

信息完备度阶梯

横条按误差率分段着色:颜色越深代表误差越大
这套房我们掌握的信息误差率分布(该层内占比)平均误差率误差贡献
看数字表
「误差贡献」= 该层所有房子的误差率之和 ÷ 全部 3,288 套,再换算成占总误差的比例;四层相加约等于 100%。 它衡量的是对平均值的影响,不是金额损失。
这张图要记住的一件事:第三、四层合计 921 套(28% 的房子),贡献了 49% 的总误差。 它们的共同特征只有一个 —— 没有这套房自己的挂牌记录。第四层里有 28.1% 的房子误差率超过 30%,第一层只有 2.0%。
03 / 换维度验证

换任何一个维度切,最差的一端都是「缺自身挂牌」的房子

切换下面的维度,横条会按平均误差率从高到低重排,一眼就能看出哪些群体高、哪些低。 注意看房型:透天整体 15.5% 最差,但透天里有挂牌的只有 8.8%、无挂牌的高达 25.8% —— 房型本身的差异,远小于挂牌信息的差异。

按房型看误差率分布

每条横条内的比例以该组样本数为分母;仅显示样本数不少于 25 套的分组
分组误差率分布(组内占比)平均误差率误差贡献
看数字表
参考成交 = 系统为这套房选出的可比成交案例。各维度下分组的样本构成不同,组间差异不能直接当作该维度的独立影响。
04 / 哪里有机会 · 哪里空间不大

把「房型 × 挂牌情况」摊到同一张图上,优先级自己就浮出来了

纵轴是这一格的平均误差率(越高越难估),横轴是它对全台总误差的贡献(越右越值得动), 圆圈大小代表房子数量。右上角 = 又大又差 = 先改这里。

机会矩阵:房型 × 挂牌情况

仅显示样本数不少于 100 套的 9 个组合
看数字表(含全部 12 个组合)
分界线:横线为全台平均误差率 10.41%,竖线为 12 个组合的平均贡献 8.3%。分界线只用于分区阅读,不是业务合格标准。

再把「有机会」量化成一个数:假设这些房子补齐信息后,能做到同房型、有挂牌那一档的误差率水平, 全台平均误差率能下降多少?这是上限估计 —— 实际效果取决于抓到的挂牌质量和关联准确率。

可回收空间:对标「同房型 + 有挂牌」后,全台平均误差率能降多少

单位为百分点;合计 3.13 个百分点,即 10.41% → 约 7.3%
看数字表
单格可回收 = 该格房子数 × (该格误差率 − 同房型有挂牌组误差率) ÷ 3,288。 按房型分别对标,避免把房型结构差异误记为挂牌信息的功劳。
05 / 原因与解决方案

四件事,按性价比排序

每张卡片都标了证据强度:已观察到是数据直接支持的事实, 待核验是需要进一步验证的推断。

06 / 建议不要投入的方向

这几件看起来合理的事,数据显示收益很小

列出来是为了避免把资源投到看不见回报的地方。

07 / 这个结论靠不靠得住

三个角度的交叉检验

① 不是地区造成的假象

在七都内部、非七都内部分别重算,阶梯都成立

② 不是房型造成的假象

只看住宅大楼,阶梯同样成立

③ 换一个时间段,方向一致

验证期 2026-04-01 至 05-19,共 10,777 套,整体平均误差率 9.60%
两期模型各自按训练窗口保存,样本构成不同,这里只用于确认方向,不把两期数据混合比较。

口径说明。测试样本:2026-05-20 至 2026-07-08,共 3,288 套,全台逐笔等权,不裁尾、不删样本。 「误差率」= |估价 − 实际成交价| ÷ 实际成交价(技术文档中称 MAPE / 平均绝对百分比误差)。 「误差贡献」= 该组误差率之和占全部样本误差率之和的比例,反映对平均值的影响,不是金额损失。

解读边界。各分组的房型、城市与交易性质构成不同,组间差距不能全部归因于单一因素; 「可回收空间」是按同房型有挂牌组对标的上限估计,需要先在小范围回溯验证。 实际成交价只用于事后切片,估价时不可预先知道,因此不能据此制定「见到低价就修正」的上线规则。 样本构成不代表台湾市场的实际房源占比。

数据来源:实价登录成交 + 站内外挂牌 / 租赁记录 · 版本 v-2026-10-10