
(来源:尔乐量化)在线开户流程
- 报告摘要 -SUMMARY
]article_adlist-->➤ 财报披露频率较低且存在时滞,基本面变化往往会先在分析师报告、投资者关系问答和招聘记录中留下线索。
本文研究三类高频文本,分别观察市场预期如何修正、企业经营能否得到验证,以及企业资源正在投向哪些方向。我们将关键词方法与大语言模型相结合,把不同形式的文本信息转化为分析师文本因子、问答文本因子和招聘经营风向策略,并分别检验其横截面选股能力、传统因子增量与策略应用价值。
➤ 分析师标题:从浓缩观点中捕捉预期修正。
本文将基本面变量与变化方向组合为关键词事件,兼顾方法透明度与标题覆盖率;同时利用LLM识别否定、转折、因果关系和预期强度,并通过公司身份匿名化、原文证据复核和异常样本复跑,提高评分的可复现性。分析师文本与传统预期上修信号相关性有限,二者复合后,自2015年12月31日至2026年6月30日,沪深300、中证500和中证1000内的多头年化超额分别达到8.51%、8.78%和10.36%。
➤投资者关系问答:从管理层回应中提取经营验证信息。
投资者关系问答包含订单、需求、价格、产能、成本、现金流和经营计划等细节,但文本较长、表达方式不统一。本文通过结构化LLM把问答拆分为可核验的经营证据,识别经营动能、盈利质量、经营兑现、风险压力和回答质量。自2015年12月31日至2026年6月30日,投资者关系问答综合因子在全市场文本覆盖域的Rank IC为3.24%、年化ICIR为2.80,多头年化超额为6.77%。
➤招聘记录:把企业资源投向转化为经营风向。
基础招聘变量和岗位主题因子的Alpha强度相对有限,但不同岗位上的扩张与收缩能够反映企业资源配置方向。本文将招聘信息定位为经营风向的Beta指标,先识别市场正在定价的岗位主题,再通过基本面验证筛选Top100,并利用传统因子构建Top30组合。在基本面验证和多因子增强保持一致的对照中,加入经营风向筛选后,自2016年12月31日至2026年4月30日,Top30组合年化超额由24.30%提高至25.70%,信息比由1.73提高至1.98,且相对最大回撤明显收窄。
01
财报之外,寻找基本面变化的先声CHAPTER
]article_adlist-->1.1AI发展提升高频基本面信息量化空间
财务报表是基本面研究最重要的数据来源之一,但较低的披露频率使其难以及时反映企业经营变化。与此同时,随着信息获取成本下降、传递速度加快,市场对财务数据的消化更加充分,传统基本面信号的收益空间也在收窄。以SUE为代表的传统超预期因子,其过去12个月滚动Rank IC中枢相较早期有所回落,也反映出财务信息正在被市场更快定价。因此,投资者需要从更高频的信息中寻找企业经营变化与盈利预期调整的前瞻线索。
财报之外的高频基本面线索因此更具研究价值。分析师报告反映卖方对盈利和经营变化的判断,对应市场预期的形成与修正;上市公司投资者关系问答将投资者关注的问题与管理层回应联系起来,用于观察经营变化能否得到验证;招聘信息则体现企业对不同类型岗位和经营方向的资源配置,更接近经营投入与未来发展方向。三类文本分别从预期修正、经营验证和资源投向三个角度补充财务报表。
文本量化方法逐步从词频统计走向语境理解。早期的词袋模型和TF-IDF通过分词与词频加权提取文本特征,计算稳定,但难以识别词序、否定和转折;关键词与规则方法进一步引入基本面主题和方向判断,具有较强可解释性,但依赖人工词典,对复杂表达的覆盖有限;BERT等预训练模型改善了上下文理解能力,但通常需要人工标注和针对金融任务进行微调,输出结果也不天然对应清晰的经济含义。
LLM的进化进一步推动文本量化从“识别词语”走向“理解信息”。LLM能够在统一提示词和评分标准下,同时识别语义方向、信号强度、确定性、量化证据与回避表达,把过去难以结构化的复杂信息转化为可横向比较的连续分数。相比依赖固定词典或大量人工标注的模型,大语言模型具有更强的语境迁移能力,能够适应短标题、长问答和招聘信息等不同文本结构,也便于在同一经济含义下统一比较不同表述。通过固定模型参数、约束输出格式并进行重复性检验,这一方法可以进一步形成稳定、可扩展的文本因子生产流程。
从词频统计到语义评分的方法演进,也体现在模型处理复杂语境的能力上。为直观比较不同代际模型,本文选取一条同时包含否定、原因归属、成本抵消和未来兑现的匿名化标题。在相同提示词下,要求模型只依据标题原文完成三项任务:一是判断需求是否转弱、业绩偏弱属于一次性影响还是持续性压力、提价是否覆盖成本以及订单是否已经转化为收入;二是分别判断当期经营状态和未来1至3个月的基本面方向;三是摘录支持判断的原文证据,并列出无法由原文直接支持的推断。测试标题如下:“业绩低于预期并非需求转弱,主因一次性减值;订单保持增长,提价已覆盖成本上行,但扩产延后或推迟收入确认。”
四个模型对基础事实的识别基本一致,但综合判断存在明显差异。早期模型倾向于直接给出当期和短期方向;Kimi K3将一次性损失与经营状态分开,并对扩产延期给出短期负面判断;GLM 5.2则在信息不足时保留“未知”。当前模型也更重视完整引用否定证据,并主动标注原文没有提供的信息,说明模型升级的价值更多体现在判断边界和结果可核验性。
1.2三类高频文本分别观察什么
三类高频文本分别对应预期修正、经营验证和资源投向,具有不同的信息属性与研究价值。分析师标题、投资者关系问答与招聘信息各自服务于不同的研究问题,也分别面临短文本信息稀疏、长问答证据分散以及招聘数据季节性明显等难点。本文围绕每类数据最有价值的经济含义独立构建和检验信号;方法上以关键词提供透明、可追溯的语义基线,并用LLM理解复杂语境和连续强度,再将报告或事件层面的信息转化为可回测的选股因子。
第一,分析师文本用于捕捉市场预期的形成与修正。公司研究标题篇幅短、时点清晰,集中表达盈利预测、经营变化和风险判断。本文将关键词识别与LLM连续评分结合,构建分析师文本因子,并检验其相对传统盈利预测上修因子的增量价值。
第二,投资者关系问答用于检验经营变化是否得到企业端验证。问答文本同时包含投资者关注的问题和管理层回应,信息更接近经营一线,但证据分散在较长的问答结构中。本文利用LLM识别经营动能、盈利质量、量化证据、回答直接度和回避表达,提取能够反映经营兑现程度的投资者关系问答信号。
第三,招聘数据用于观察企业资源投向与市场经营风向。企业在不同岗位主题上的扩张与收缩,反映其对技术研发、产能制造、供应链与质量、出海外贸、销售渠道和服务交付等经营方向的资源配置。本文主要依据岗位名称和职位描述中的关键词识别经营主题,观察不同经营方向的招聘变化与市场定价,并将经营风向筛选、盈利验证和多因子增强依次串联,形成主动量化选股流程。
三类文本从不同角度扩展传统基本面量化的信息边界。后续章节将依次介绍各类数据的结构特征、信息提取方法、细分信号与复合因子表现,并检验文本信息对传统因子的增量。通过深入研究分析师观点、上市公司投资者关系活动和招聘活动中蕴含的另类基本面信息,本文尝试为基本面量化提供新的观察视角和选股线索。
02
分析师文本中的预期修正AlphaCHAPTER
]article_adlist-->分析师标题能够在传统分析师因子的基础上补充语义信息。一致预期盈利上调、预期估值等结构化信号本身就是Alpha模型的重要组成部分,标题则进一步记录分析师如何解释业绩变化、经营拐点与风险压力。标题历史覆盖较长、披露时点明确、信息高度浓缩。本章以公司研报标题为主要对象,研究其中蕴含的预期修正、经营变化和风险判断。
2.1分析师标题的筛选与处理
为保证不同时间和股票之间的标题信息具有可比性,本文从报告筛选、记录去重、可用日期和观点去重四个环节统一处理口径。首先仅保留A股公司研究报告,并以公告日期作为信息可用时点;同一报告涉及多个预测期时只保留一条记录。标题评分前删除公司全称、简称和股票代码等身份前缀,再在回看窗口内保留同一股票、同一分析师的最新观点,减少身份格式和重复跟踪对评分结果的影响。具体处理口径见下表。
2.2短标题仍然承载了密集的业绩与经营信息
分析师标题“短小精悍”,但其表达方式也在持续变化。下面从报告数量、标题长度、信息密度和高频词四个方面观察分析师标题画像。

公司研究标题已经形成长期、稳定的覆盖。样本期内报告数量总体充足,剔除公司身份前缀后,标题正文长度仍逐步增加,说明分析师正在标题中纳入更具体的业绩数字、经营变化与预期判断,短标题承载的信息并未因格式日趋标准化而减弱。
分析师标题的信息密度随市场环境呈现阶段性变化。本文使用后文介绍的LLM语义评分方法,从标题中识别具体的业绩、订单、价格、成本和客户等信息,并将信息密度评价为0—5分;分值越高,表明标题包含的经营事实和量化证据越丰富。2018年末至2019年中有所回落,2020年明显回升;2021年至2022年初小幅下降,此后在2022—2023年间波动。2024—2025年总体抬升,2026年1—5月虽有所回落,但仍处于历史较高水平。图中同时展示了中证800内分析师大类因子的过去12个月多头累计超额,两者在部分阶段走势较为接近。
词频结构统计进一步说明,分析师标题的核心内容仍围绕业绩、增长、盈利与经营改善展开。这些高频表达不仅与盈利预期修正较为一致,也隐含分析师对公司成长空间、经营趋势和行业景气变化的判断。因此,标题文本能够补充结构化预测数据难以完整刻画的成长与趋势信息,可作为传统分析师因子的有效增强。
2.3关键词将标题转化为可横向比较的基本面事件因子
关键词方法通过预先设定词典和规则,将分析师标题转化为可比较的文本信号。传统方法通常统计标题是否出现某些正面或负面词,但单独识别某个词容易忽略其描述的基本面对象。例如,“收入上升”和“成本上升”都包含“上升”,但对公司基本面的含义并不相同。正则表达式可以更准确地识别完整短语,但通常只区分规则是否命中,产生的信号较为稀疏;如果进一步为大量关键词分别设置不同权重,又容易引入较强的主观性和样本内过拟合。
本文将基本面变量与变化方向组合为具有明确含义的基本面事件,并根据普通变化和较强预期变化设置不同分值,在减少信息损失的同时控制规则复杂度。
2.3.1 从基本面事件识别到股票月度因子
关键词因子的识别与打分不依赖训练模型,而是由预设词典和匹配规则直接完成。具体而言,先识别标题中的基本面变量和变化方向,再将两者组合为基本面事件;报告级得分刻画单篇标题传递的基本面变化,股票层级的聚合则汇总不同分析师在回看窗口内的最新观点。
1、识别基本面事件。标题先按标点分句,在同一分句内识别业绩收入、盈利质量、现金流、订单需求、份额渠道、产能价格、成本费用、库存减值和竞争风险等基本面变量,并匹配同一语义单元内距离最近的方向词。
2、校正事件方向。收入增长、订单改善等记为正向事件,成本上升、费用增加等记为负向事件;同时处理“不再下滑”、“未见改善”等否定表达和转折结构,避免只按单个情绪词判断方向。
3、计算报告级得分。本文依据基本面变量词典、方向词典以及否定、转折和预期强度规则,对标题中的每项基本面事件进行打分。普通事件记为±1;若同一事件带有“超预期”、“不及预期”等较强预期表达,则绝对分值提高至3。单篇报告得分取标题内全部事件得分的均值;若分句范围内未形成完整事件,则在整条标题范围内使用相同的变量词典和方向规则进行补充识别。
4、保留分析师最新观点。同一股票、同一分析师在回看窗口内只保留最新一篇公司研究报告,减少高产分析师和重复跟踪对股票得分的影响。
5、按量化证据优先原则聚合股票月度信号。若窗口内存在含同比、环比、百分比、金额或产销量等量化证据的报告,则优先聚合这些报告;否则使用全部有效事件报告,再按发布时间进行衰减加权。
2.3.2 关键词因子的选股有效性
本节在统一的股票池处理和回测框架下,检验关键词因子的横截面选股能力。其中,全市场、沪深300、中证500和中证1000均先在各自股票池内填充缺失值,再进行缩尾、标准化和行业市值中性化;全市场分十组,指数域分五组。本文后续章节若无特殊说明,沿用这一处理标准。
不同回看窗口反映信息时效性与覆盖度之间的取舍。30日窗口响应最快,但填充前覆盖率较低;90日窗口兼顾时效性与覆盖度;180日窗口提供更稳定的中期信号;365日窗口覆盖更广,但信息强度有所衰减。复合因子按20%和80%的权重合成90日与180日信号,使近期变化与中期验证同时进入同一因子。
关键词基本面事件因子在不同股票池内均表现出稳定的选股能力,在中小盘股票域内尤为突出。自2015年12月31日至2026年6月30日,90日窗口较好地兼顾了信息时效性与股票覆盖度,中证1000内Rank IC达到4.08%。进一步结合90日与180日信号后,全市场Rank IC和年化ICIR分别为3.26%和1.94,多头年化超额达到7.86%,说明不同期限的信息相互补充,有助于提升因子的收益表现与稳定性。
分年度来看,复合窗口因子的多头超额来自跨年度积累,而非由个别月份的表现驱动。样本期内各年均取得正超额,2022—2023年策略表现相对偏弱,2024年以来超额修复,2026年前六个月仍保持正超额。
2.3.3 关键词规则透明,但复杂语境仍会造成信息损失
关键词规则在以下三类情形下容易损失信息。
1、多个基本面事件的方向不一致。例如“收入回升、毛利率承压、现金流好转”同时包含正向和负向变化,简单平均可能弱化真正主导预期修正的信息。
元股证券:ygzq.hk
2、当期表现与远期预期同时出现。例如“业绩低于预期,待扩建带来业绩释放”既反映当期业绩承压,也包含未来改善预期,关键词规则难以准确区分不同时间层次。
3、文本含有因果关系或隐含表达。例如“钢价上升覆盖成本上升”需要理解价格与成本之间的抵消关系;“拐点已至、穿越周期”没有明确的基本面变量与方向词,严格匹配容易遗漏。
关键词规则具有透明、稳定和便于追溯的优点,但在处理上述复杂表达时,仍需要更强的上下文理解能力。
2.4LLM提升复杂语境识别能力
LLM拓展了短标题语义识别的能力边界。与依赖固定词表的关键词方法相比,LLM能够同时理解事件对象、变化方向、预期强弱、否定转折和因果关系,并把“订单加速”、“需求回暖”、“毛利修复”等不同表述映射到统一的连续分数,因此更适合处理表达方式较为分散的分析师标题。
在未对证据来源和评分边界作进一步约束、仅通过提示词要求大模型连续打分时,初步结果暴露出过度解读和少数标题重复评分不一致的问题。例如,“行业浪潮再起,见证服务器龙头腾飞”没有明确的业绩超预期或盈利预测调整证据,模型仍给出3.5分的预期修正;“XX金融帝国的战略性布局”没有明确的经营变量和变化方向,初始模型仍给出3.0分的经营基本面评分。这说明模型可能将积极措辞或行业叙事延伸为标题并未表达的经营事实;对于证据不够明确的标题,同一文本多次评分时也可能出现方向或强度差异。
因此,本文从标题匿名化、连续评分、证据复核等环节规范LLM输出。
1、标题匿名化。输入模型前删除公司名称和股票代码,降低模型根据公司身份和预训练记忆补充标题外信息的可能。
2、报告级连续评分。本文采用DeepSeek-V4-Flash模型完成标题评分,并要求模型按照统一的JSON格式输出。模型对预期修正、经营基本面和盈利质量三类核心方向进行连续评分;初始连续评分还输出整体方向、观点确定性和长期价值等补充信息。其中,观点确定性衡量标题表述是否明确、相关变化是否已经发生或得到验证;长期价值衡量竞争壁垒、行业格局、长期成长、治理改善和股东回报等信息。标题没有明确表达的维度记为0,不根据积极措辞或行业常识补充评分。
3、证据复核与异常样本复跑。同一模型进一步返回各维度是否适用、变化方向、证据强度和对应原文。全部标题先运行一次,仅对证据缺失、方向冲突或绝对分值较高但缺乏原文支持的样本追加两次评分,并取三次结果的中位数。原文证据复核主要用于约束预期修正、经营基本面和盈利质量三类核心方向,长期价值与观点确定性保留初始连续评分结果。
4、聚合为股票因子。得到报告级得分后,对同一股票、同一分析师的重复观点进行处理,再结合回看窗口和发布时间衰减,将报告得分汇总为股票因子。具体构建流程与核心提示词见下表。
扩大样本后的重复实验仍显示,三类核心方向评分具有较好的可复现性。在1000条分层标题上独立运行5次,预期修正、经营基本面和盈利质量的平均秩相关分别为0.92、0.94和0.87,方向一致率分别为95.6%、99.7%和94.0%。
初始连续评分在三类核心语义维度上的选股表现整体略强,证据复核后仍保留了大部分有效信息。自2015年12月31日至2026年6月30日,在全市场90日窗口内,初始连续评分的预期修正、经营基本面和盈利质量因子Rank IC分别为3.20%、2.83%和3.32%,证据复核评分分别为2.90%、2.69%和2.99%;对应的多头年化超额均保持在6%以上。其中,证据复核后的预期修正因子年化ICIR由1.91提高至1.95,说明减少缺乏原文依据的评分,并未明显削弱因子的时序稳定性。补充维度中,长期价值和观点确信度的Rank IC分别为2.90%和3.01%,多头年化超额分别为7.13%和8.62%,同样具有一定的收益区分能力。
两类评分在语义信息保留与评分可靠性方面各有侧重,因此本文将其共同用于LLM大类因子的构建。初始连续评分能够更充分地识别标题中的方向和强度差异,证据复核评分则有助于减少过度解读,提高评分依据的可核验性和多次运行的一致性。本文先在每个语义维度内合并两类评分,再将预期修正、经营基本面和盈利质量三个维度等权合成为LLM大类因子。长期价值和观点确信度作为补充维度单独展示,不参与后续LLM大类因子及分指数域测试。
关键词与LLM均用于识别标题语义,但两种方法关注的信息并不完全相同。自2015年12月31日至2026年6月30日,三类核心LLM因子之间的相关性为0.78至0.84,关键词复合窗口因子与三类核心LLM因子的相关性约为0.63至0.65,说明基于明确事件匹配的关键词信号仍能提供一定的差异化信息。长期价值与三类核心因子的相关性为0.56至0.84;观点确信度与经营基本面的相关性达到0.97,表明该因子主要强化方向明确且表述确定的经营信号,独立性相对有限。因此,后文将关键词因子与三类核心LLM因子共同纳入分析师文本大类因子。
LLM大类因子的多头超额具有较好的跨年度持续性。自2015年12月31日至2026年6月30日,除2023年外,其余年份均取得正超额,2020年和2026年上半年表现较为突出。截至6月30日,今年以来超额收益达9.8%;2022年超额较弱,但长期相对净值仍保持上行。
2.5文本信息对分析师预期上修因子形成稳定增量
为考察分析师文本对传统分析师预期上修因子的增量,本文将文本大类与预期上修因子进行二次复合,并在沪深300、中证500和中证1000中分别比较预期上修、文本与组合因子的选股表现。分析师预期上修大类由FY3 ROE和EPS一致预期变化、近3个月净利润预测净上调比例等权合成。
文本因子与传统分析师预期上修因子结合后,三个指数域的多头收益均有改善。沪深300的多头年化超额由6.95%提高至8.51%,中证500由6.86%提高至8.78%,中证1000由5.87%提高至10.36%,对应增量分别为1.56%、1.93%和4.49%。分年度看,组合在大部分年份能够跑赢预期上修因子,中小盘股票域的增量相对更稳定。
分析师文本不是传统风格因子的简单映射。全市场文本覆盖域内,文本大类与成长、动量存在一定正相关,但与市值、波动率、流动性、Beta等多数Barra风格的相关性较低,说明其主要捕捉的是卖方预期与信息质量变化。
03
投资者关系问答中的经营验证Alpha
CHAPTER
3.1通联投资者关系问答形成高频经营验证窗口
问答文本将投资者关注的问题与管理层的即时回应一一对应,是观察企业经营变化的重要高频信息。投资者通常围绕订单与需求、产品价格、产能利用、成本费用、现金流、客户渠道和经营计划等问题展开提问,管理层则通过经营数据、趋势判断和未来安排作出回应。相较定期报告,问答内容时点更灵活、经营细节更丰富,但文本较长、表达方式不统一,需要进一步提取其中真正影响基本面预期的信息。
在通联明细中,一次披露的投资者关系活动记为一条活动记录;除股票、活动日期、活动类型和参与机构等事件信息外,记录中还可能包含一组或多组“问题—回答”文本。本文将至少包含一组完整问题及对应回答的记录称为“包含问答文本的活动记录”,将包含两组及以上问答的记录称为“多轮问答事件”。下图展示了2014年1月1日至2026年6月30日期间通联问答的数据结构特征。
本文使用通联A股投资者关系活动明细,将披露日期作为信息可用日,并剔除披露滞后超过60天的记录。
问答文本的覆盖度在2021年后明显扩张。高频月份的活动记录数达到3000—4000次,覆盖股票数同步抬升;截至2026年6月30日,过去180自然日窗口下沪深300、中证500和中证1000的文本覆盖率分别为69.7%、80.4%和79.5%。从股票覆盖结构看,问答文本主要覆盖中小市值股票。
活动记录覆盖全部申万一级行业,但行业间覆盖差异明显。机械设备、电子、医药生物、基础化工、计算机、电力设备的活动记录数量居前,反映机构投资者更重视景气变化、订单兑现和产业链验证;金融、能源等行业的文本覆盖相对较低。
3.2结构化LLM把长文本拆解为可核验经营证据
投资者关系问答直接记录机构提问与管理层回答,文本通常同时包含经营进展、量化证据和前瞻表述。下表展示一则典型问答:问题聚焦项目投产、成本与毛利率,回答则给出项目时点、推进状态及可能影响,为后续结构化评分提供了较完整的原始文本数据。
长篇投资者关系问答若整篇一次性评分,关键问答容易被其余内容稀释。本文按照“文本拆分—证据评分—事件聚合—股票因子”的顺序处理投资者关系问答。
1、拆分投资者关系问答。按照问题与回答的对应关系将单次投资者关系活动拆分为多个问答块,较长回答进一步切分为语义完整的文本片段,避免整篇输入造成关键信息被平均或截断。
2、提取经营证据。LLM只根据当前问答块识别经营动能、盈利质量、经营兑现、风险压力、回答直接度、量化证据和回避模糊度七个维度,并同时输出该维度是否适用、变化方向、证据强度和对应原文。没有明确证据的维度不赋分。
3、形成单次活动得分。经营动能、盈利质量、经营兑现和风险压力只在明确涉及该主题的文本块中聚合;回答直接度、量化证据和回避模糊度则综合全部问答块,衡量管理层整体回答质量。
4、聚合为股票因子。将同一场活动的经营信息与回答质量汇总为事件得分,再以披露日期作为可用时点,按照信息时效进行衰减,在回看窗口内聚合为股票月度因子,并进行后续因子检验。
七个语义维度分别刻画经营变化与管理层回答质量。经营动能、盈利质量、经营兑现和风险压力用于识别企业基本面的变化方向,只在问答内容明确涉及相应主题时评分;回答直接度、量化证据和回避模糊度用于评价管理层回应的清晰程度与信息含量,并结合整场活动中的全部问答进行判断。具体维度及其含义见下表。
结构化抽取使每一项投资者关系问答评分都能在原文中找到依据。本文将拆分后的问答块或经营陈述块输入模型,要求模型逐块判断是否涉及某一经营维度、信息方向是正面还是负面、信号强度如何,并摘录支持该判断的原文。适用率反映某一维度在问答文本中出现的频率;证据有效率则衡量模型引用的依据能否在输入原文中逐字找到。具体而言,在模型判定为“适用”的结果中,能够完成原文逐字匹配的证据占比即为证据有效率。因此,较高的证据有效率说明大多数评分来自文本明确表达的信息,而不是模型对原文之外内容的延伸判断。
3.3投资者关系问答LLM综合因子的选股表现
综合因子在事件层面汇总经营变化和回答质量,再按信息时效形成股票月度得分。正向经营变化、盈利质量改善、经营计划兑现以及清晰的量化回答提高事件得分,风险压力和回避模糊表达降低事件得分。每场活动先按照统一规则形成事件得分,再根据披露日期距月末的时间进行衰减,将窗口内多次活动聚合为股票因子。综合因子使用的底层语义信息见下表。
投资者关系问答LLM综合因子具有较稳定的横截面排序能力,多头端表现尤其突出。自2015年12月31日至2026年6月30日,全市场覆盖域的Rank IC均值为3.24%,年化Rank ICIR为2.80,Rank IC月胜率达到80.16%。十组收益整体随因子值上升而改善,虽然中间组别存在小幅波动,但第九组和第十组的多头年化超额分别达到3.70%和6.77%,说明因子的收益主要集中在高分股票。
分股票池看,问答文本在中小市值股票中的选股效果更为明显。自2015年12月31日至2026年6月30日,中证1000内的Rank IC为2.51%、年化ICIR为2.17,多头年化超额为3.85%;中证500的Rank IC为2.18%、多头年化超额为3.28%。相比之下,沪深300内的Rank IC为1.04%,多头超额接近于零,表明问答文本对中小市值公司的经营变化具有更强的区分能力。
投资者关系问答LLM综合因子的多头超额具有较好的年度稳定性。自2015年12月31日至2026年6月30日,所有年份的多头收益均跑赢全市场覆盖域等权基准,其中2020年的超额收益达到19.83%,其他多数年份也保持正向贡献。截至2026年6月30日,因子今年以来的多头收益为10.78%,较基准跑赢7.16%;全样本多头年化超额为6.77%,信息比为1.48。
04
招聘数据中的经营风向策略CHAPTER
]article_adlist-->4.1招聘记录勾勒企业资源投向
企业招聘是经营计划落实到人员和组织资源上的具体行动。新增岗位通常意味着企业准备在研发、生产、销售、出海或服务等环节投入更多资源,岗位数量和结构的变化因而可以帮助观察企业当前的经营重点。每条招聘记录还包含招聘主体、关联股票、发布日期、岗位名称、工作地点、薪酬、学历经验和职位描述等字段,为刻画招聘规模、人才结构与岗位主题提供基础。本文以招聘发布日期作为信息可用日,并将子公司、联营企业等招聘主体统一映射至关联上市公司。
招聘数据自2016年起形成较稳定的覆盖。岗位记录数在不同年份波动较大,2016年覆盖股票已接近3000只,2023—2025年均超过4000只。
招聘记录同时包含企业扩张方向和人才结构信息。自2014年1月7日至2026年3月10日,北京、上海、深圳和广州合计约占35%的岗位,更多岗位分布于其他城市;本科及以上岗位接近一半,硕士和博士岗位数量较少但更能反映高层次人才需求;从招聘主体看,上市公司子公司贡献约一半记录,因此后续因子计算需将招聘主体统一映射回上市公司。
4.2从基础招聘变量到岗位主题因子
岗位数量和人才门槛是招聘数据中直观、易于构建选股因子的信息。本文分别统计过去180自然日的岗位总量、计划招聘人数、薪资、学历和工作经验,并以当前90日招聘人数相对上年同期的变化刻画动态扩张。
基础招聘变量具有直观含义,但单独使用时横截面区分度有限。自2016年12月31日至2026年4月30日,计划招聘人数和岗位总量的Rank IC分别为1.49%和1.11%;薪资、学历与工作经验的排序能力相对较弱,90日招聘人数同比也未具有显著选股能力。原始招聘规模同时受到人员替换、平台覆盖和季节性影响,仅观察企业“招了多少人”,还不足以判断资源具体投向哪类经营活动。
岗位名称和职位描述能够进一步识别企业资源投向的经营主题。本文根据招聘文本的长期词频和岗位职责,将岗位归为技术研发、产能制造、供应链与质量、出海外贸、销售渠道和服务交付六类主题;薪资、学历和城市等人才属性不参与主题定义,只用于判断岗位信息质量。
固定岗位主题的识别结果主要由明确的岗位词和职责词决定。抽样比较显示,对类似“海外销售经理”、“研发工程师”、“大区销售总监”等边界清晰的岗位,关键词和LLM给出的主题判断基本一致;两者的差异主要出现在职责较杂或表述模糊的岗位。由于招聘数据需要对数百万条记录进行主题分类,关键词方法计算成本更低、规则可追溯,也更便于增量更新,因此因子采用关键词识别主题,并将LLM作为抽样复核工具。
岗位主题因子用于刻画企业正在向哪些经营方向配置人员资源。对每只股票,本文在月末汇总过去90日或180自然日内由关键词识别出的各类主题岗位数量,并进行对数化处理,以衡量企业在相应经营主题上的招聘暴露。岗位质量分由本科及以上岗位占比、月薪中位数不低于2万元的岗位占比、要求三年以上经验的岗位占比和职位描述非空占比经横截面标准化后等权合成。90日主题因子保留岗位质量不低于当月截面中位数的股票;180日出海外贸因子则以岗位质量的截面分位数对主题暴露进行加权。
部分产业主题岗位具有一定的横截面收益区分能力。自2016年12月31日至2026年4月30日,90日出海外贸、产能制造和技术研发岗位因子的Rank IC分别为1.91%、1.82%和1.62%,供应链与质量相关岗位也呈现正向排序能力。拉长观察窗口能够提高股票覆盖,其中180日出海外贸岗位因子的覆盖占比达到82.6%,多头年化超额为3.06%。
4.3招聘经营风向与主动选股策略
前文的因子检验表明,单个招聘主题信号的Alpha强度相对有限,招聘数据更适合作为识别经营风向的Beta指标。岗位主题暴露能够反映企业正在向哪些经营方向配置资源,并据此缩小主动选股范围。在经营风向的基础上,进一步结合基本面指标验证招聘扩张的可靠性,再利用少量含义清楚的传统因子改善多头排序。因此,招聘信息在策略中主要承担风向识别和候选池筛选的作用。
基于上述定位,策略依次完成经营风向识别、基本面验证和多因子增强:
1、每月末,将过去180日主题岗位数量及其占全部岗位的比例分别进行横截面标准化并等权合成,得到每只股票在六类经营主题上的暴露度。并由各主题暴露排名前20%的股票构建主题股票篮子;比较各主题篮子过去12个月相对全市场的超额表现,选择得分最高的两类主题,再合并其中主题暴露排名前30%的股票形成经营风向候选池;
2、利用财务和分析师预期指标,检验相关企业的招聘扩张是否得到基本面支持,并从中筛选Top100;
3、在Top100内,使用财报跳空、资本开支、营业收入预期调整、估值、量价、盈利预测上修、资金流和股东户数等因子进一步优化排序,构建Top30组合。
经营主题在样本期内呈现持续轮动。自2016年12月31日至2026年3月31日,出海外贸和产能制造入选次数较多,技术研发、服务交付、销售渠道以及供应链与质量也在不同阶段进入前两名,说明候选池并非长期固定在单一主题上。
为检验经营风向筛选是否提供独立增量,本文设置不使用招聘信息的对照组。对照组直接在全市场有效股票中使用相同的基本面验证规则筛选Top100,并在Top100内使用完全相同的八项因子构建Top30;两组仅在是否先经过经营风向候选池这一环节上存在差异。
经营风向筛选主要改善组合稳定性,并在多因子增强后形成正向收益增量。自2016年12月31日至2026年4月30日,与不使用招聘信息的对照组相比,经营风向Top100的年化超额由13.15%小幅降至12.24%,但信息比由1.29提高至1.31,相对最大回撤由24.85%收窄至20.31%;使用完全相同的八项因子构建Top30后,年化超额由24.30%提高至25.70%,信息比由1.73提高至1.98,相对最大回撤由30.51%显著收窄至12.69%。这说明招聘数据的贡献并非简单抬高基本面验证组合收益,而是通过经营主题筛选改变候选股票结构,并在精细化排序中提高超额收益风险比。
招聘数据具有刻画经营主题Beta、辅助主动选股提前布局的潜力。企业通常会在新业务扩张、产能建设和渠道投入形成财务结果之前,率先调整人才需求和岗位结构,因此招聘变化能够较早反映资源正在流向哪些经营方向。本章据此识别市场关注的经营主题,构建风向候选池,再结合基本面验证与多因子排序筛选个股。这样的研究框架将招聘信息的前瞻性与传统因子的稳健性结合起来,有助于在经营变化得到财务数据充分确认之前,寻找具有基本面支持的左侧布局机会。
05
总结与思考CHAPTER
]article_adlist-->本文围绕“如何在财报披露前观察基本面变化”这一问题,分别研究分析师研报标题、投资者关系问答和招聘记录。三类文本的信息属性和适用方式并不相同:分析师标题主要刻画市场预期修正,投资者关系问答主要验证企业经营变化,招聘记录则反映企业资源投向。本文据此构建分析师文本因子、问答文本因子和招聘经营风向策略。核心结论如下:
1)分析师标题:关键词与LLM共同提取预期修正信息
分析师标题能够在传统盈利预测调整之外,补充业绩变化和经营趋势的语义信息。分析师标题历史覆盖较长、披露时点明确。关键词方法将基本面变量与变化方向组合为事件,并根据预期强度区分事件得分;LLM则进一步识别否定、转折、因果关系和隐含的预期变化。针对大模型可能出现的过度解读和多次输出差异,本文加入公司身份匿名化、原文证据复核和异常样本复跑,使评分更多来自标题本身。
关键词与LLM保留了不同的信息,二者结合能够形成更完整的分析师文本信号。将二者合成分析师文本大类因子后,文本因子在不同宽基股票池内均具有正向选股能力;进一步与传统分析师预期上修因子复合,自2015年12月31日至2026年6月30日,沪深300、中证500和中证1000的多头年化超额分别达到8.51%、8.78%和10.36%,其中中小盘股票域的增量更为明显。
2)投资者关系问答:经营方向与回答质量共同形成验证信号
投资者关系问答能够补充定期报告尚未充分披露的经营信息,为判断基本面变化是否得到验证提供依据。投资者关系问答连接了投资者关注的问题和管理层的即时回应,涵盖订单、需求、价格、产能、成本和现金流等经营细节。针对问答文本较长、不同问题信息含量差异较大的特点,本文先拆分问答内容,再由结构化LLM判断语义维度是否适用,并提取方向、强度和原文证据,减少整篇文本直接评分造成的信息稀释。
手机股票配资投资者关系问答综合因子具有较为稳定的收益区分能力,多头端表现相对突出。该因子同时考虑经营动能、盈利质量、经营兑现、风险压力和回答质量,自2015年12月31日至2026年6月30日,在全市场文本覆盖域的Rank IC为3.24%、年化ICIR为2.80,多头年化超额为6.77%。因子的分组收益具有较好的单调性,说明问答文本不仅能够描述企业经营状态,也能够形成有效的经营验证信号。
3)招聘数据:经营风向比单一横截面因子更能体现数据价值
招聘数据更适合作为识别经营风向的Beta指标,而非单独替代传统基本面因子。岗位数量、人才要求和岗位主题能够反映企业资源配置方向,但招聘数据受行业属性、招聘周期和企业披露习惯影响较大,单个招聘主题信号的Alpha强度相对有限。将其用于识别市场正在关注的经营方向,更能发挥招聘信息的前瞻价值。
经营风向识别、基本面验证和多因子增强相结合,能够将招聘信息落实到主动选股。本文先根据主题股票篮子的历史表现识别市场正在定价的经营方向,并以岗位主题暴露形成候选池;随后利用财务和分析师预期指标验证招聘扩张是否得到基本面支持,筛选Top100;最后使用少量含义清楚的传统因子优化多头排序,形成Top30组合。对照测试显示,自2016年12月31日至2026年4月30日,经营风向筛选在Top100层面主要改善组合稳定性;在使用相同八项因子增强后,Top30组合年化超额由24.30%提高至25.70%,信息比由1.73提高至1.98,相对最大回撤由30.51%收窄至12.69%。这说明招聘数据能够通过改善候选池结构,为主动选股提供可验证的增量价值。
未来展望:
第一,继续扩展高频文本的内容深度与数据来源。分析师标题具有较长历史和较稳定的时点,但信息容量有限,后续可以进一步引入研报摘要、官方电话业绩会和公告文本,补充盈利质量、风险压力和经营细节。同时,需要持续跟踪词典覆盖率、模型版本和文本表达方式的变化,降低因子随数据口径变化产生的漂移。
第二,研究不同文本信息之间的确认、分歧与领先关系。分析师文本和投资者关系问答分别反映市场预期与企业经营验证。后续可以重点研究“分析师观点已经上修且问答反映的经营情况同步改善”的确认信号、“分析师乐观但投资者关系问答反馈偏弱”的分歧信号,以及“问答反映的经营情况率先改善而盈利预测尚未上修”的领先信号,检验多类文本能否提供超越单一数据源的增量信息。
第三,加强样本外检验与策略化应用。文本因子的有效性会受到市场环境、模型版本和数据覆盖变化的影响。后续应固定提示词和模型版本,建立持续的评分质量监控,并通过滚动样本外回测和实盘跟踪检验因子稳定性。招聘策略还可以进一步改进经营主题的自适应识别、拥挤度控制和交易约束,使高频文本研究从历史有效性验证走向更加稳定、可复用的主动量化工具。
06风险提示
CHAPTER
]article_adlist-->1)量化结论基于历史统计,未来市场环境变化可能导致因子失效。本文对分析师报告、投资者关系问答和招聘信息的因子检验及策略回测均基于历史数据。当市场定价逻辑、投资者结构或基本面驱动因素发生显著变化时,文本信号的预测能力和组合表现可能下降。
2)文本数据存在覆盖偏差与信息时点识别风险。不同数据源在历史覆盖、记录完整性、披露频率和字段口径方面可能存在差异;分析师报告、投资者关系活动记录和招聘信息也可能出现延迟披露、内容修订或重复记录。尽管本文按照信息可得日期进行处理,仍不能完全排除数据缺失与时间错位对回测结果的影响。
3)关键词与大模型的语义识别结果存在不确定性。关键词方法可能遗漏隐含表达、复杂语境和词典之外的新表述;大模型评分可能受到模型版本、提示词、运行参数及预训练语料的影响,并存在过度解读、输出波动和事实幻觉等问题。本文采用匿名化、证据复核和异常样本复跑等方法降低相关影响,但无法完全消除模型风险及预训练语料带来的未来信息争议。
4)因子筛选、参数设定与策略回测存在样本依赖和执行偏差。本文部分语义维度、回看窗口、组合权重及招聘经营主题由历史样本研究确定,可能存在样本内选择偏差。回测中的交易成本、流动性和成交价格等假设也可能与实际交易存在差异,实盘组合表现可能受到交易延迟、冲击成本、停牌及涨跌停等因素影响。
报告信息:叶尔乐 S0590525110059 yeerle@glms.com.cn
吴正宇S0590526030002 wuzhengyu@glms.com.cn
]article_adlist-->本文来自国联民生证券研究所于2026年9月8日发布的报告《量化专题报告:基本面先声:高频文本中的前瞻Alpha》, ]article_adlist--> ]article_adlist-->
重要提示 ]article_adlist-->《证券期货投资者适当性管理办法》于2017年7月1日起正式实施,通过本微信订阅号/本账号发布的观点和信息仅供民生证券的专业投资者参考,完整的投资观点应以国联民生证券股份有限公司(下称“国联民生证券”)发布的完整报告为准。若您并非国联民生证券客户中的专业投资者,为控制投资风险,请取消订阅、接收或使用本订阅号/本账号中的任何信息。本订阅号/本账号难以设置访问权限,若给您造成不便,敬请谅解。国联民生证券不会因为关注、收到或阅读本订阅号/本账号推送内容而视相关人员为客户;市场有风险,投资需谨慎。
免责声明
国联民生证券股份有限公司(下称“国联民生证券”)已获中国证监会许可的证券投资咨询业务资格,本平台推送观点和信息仅供国联民生证券研究服务客户参考,完整的投资观点应以国联民生证券研究所发布的完整报告为准。若您非国联民生证券研究服务客户,为控制投资风险,请勿订阅、接受、转载或使用本平台中的任何信息,若给您造成不便,敬请谅解。国联民生证券不会因订阅本平台的行为或者收到、阅读本平台推送内容而视相关人员为客户。任何未经国联民生证券同意或授权而对本平台内容进行复制、转发或其他类似不当行为均被严格禁止。对于使用本平台包含信息所引起的后果,国联民生证券概不承担任何责任。
本平台及国联民生证券研究报告所载资料的来源及观点的出处皆被国联民生证券认为可靠,但国联民生证券不对其可靠性、准确性、时效性或完整性做出任何保证。本平台推送内容仅反映国联民生证券研究人员于发出完整报告当日的判断,本平台所载的资料、意见及推测有可能因发布日后的各种因素变化而不再准确或失效,国联民生证券不承担更新不准确或过时的资料、意见及推测的义务,在对相关信息进行更新时亦不会另行通知。在任何情况下,本平台所载信息、意见不构成对任何人的投资建议,所述证券或金融工具买卖的出价或征价,评级、目标价、估值、盈利预测等分析判断亦不构成对具体证券或金融工具在具体价位、具体时点、具体市场表现的投资建议。本平台所包含的观点及建议并未考虑获取本平台包含信息的机构及个人的具体投资目的、财务状况、特殊状况、目标或需要,客户应当充分考虑自身特定状况,进行独立评估,并应同时考量自身的投资目的、财务状况和特定需求,必要时就法律、商业、财务、税收等方面咨询专家的意见,不应单纯依靠本报告所载的内容而取代自身的独立判断。在法律允许的情况下,国联民生证券及其关联方可能持有本平台推送内容中提及的公司所发行证券的头寸并进行交易,也可能为这些公司提供或正在争取提供投资银行、财务顾问、咨询服务等相关服务。客户应充分考虑可能存在的利益冲突,勿将本平台推送内容作为投资决策的唯一参考依据。对任何直接或间接使用本平台所载信息和内容或者据此进行投资所造成的任何一切后果或损失,国联民生证券及/或其关联人员均不承担任何形式的法律责任。
法律声明
本微信号及其推送内容的版权归国联民生证券所有,国联民生证券对本微信号及其推送内容保留一切法律权利。未经国联民生证券事先书面许可,任何机构或个人不得以任何形式转载、翻版、复制、刊登、发表、修改、仿制或引用本订阅号中的内容。任何订阅人如引用或转载本平台所载内容,务必注明出处为国联民生证券研究所,且转载应保持完整性,不得对内容进行有悖原意的引用和删改。转载者需严格依据法律法规使用该文章,转载者单方非法违规行为与我司无关,由此给我司造成的损失,我司保留法律追究权利。 ]article_adlist-->元股证券APP-港股服务站提示:本文来自互联网,不代表本网站观点。