透過網路聊天室中的對話紀錄進行人物畫像
將每個發言人映射到平面以確定誰比較接近,因此這可能算是種clustering問題
- 如何設計資料?
- 如何設計loss function
- 如何衡量效果
-
timestamp (類型: 日期時間)
- 消息的發送時間。
-
sender (類型: 字串)
- 發送消息的使用者名稱。
-
message_content (類型: 字串)
- 消息的具體內容。
-
context (類型: 字串列表)
- 該消息的上下文,通常包括該消息之前的若干條消息,以幫助理解消息的背景或參照。
-
message_id (類型: 唯一識別碼)
- 每條消息的唯一識別碼。
-
replies_to (類型: 唯一識別碼, 可選)
- 如果該消息是回覆其他消息,這裡會包含那條消息的
message_id。
- 如果該消息是回覆其他消息,這裡會包含那條消息的
聊天對話紀錄也有順序關係與回文關係,可以視為一種網狀結構,也就是說每一筆message可以視為image中的一個資料點,而相鄰的也可以視為連接的資料點