日韩精品一区二区三区在线视频放-无码中文字幕V?一区二区-成年片免费观看视频-国内少妇人妻丰满av-国产精品中文字幕免费观看-亚洲成人久久一区二区三区-国内少妇偷人精品视频无缓冲-一区二区国产精品日本一区二区三区在线网

ARTICLE DETAIL

資訊詳情

深耕商務建站與企業(yè)官網(wǎng)運營的一線實戰(zhàn)洞察。

只改Harness不換模型:提升LLM編碼能力的工程實踐

只改Harness不換模型:提升LLM編碼能力的工程實踐 在實際的 LLM Coding 評測和 Agent 開發(fā)中有一個很反直覺的現(xiàn)象模型權(quán)重完全沒動提示詞也沒改只是把模型外層的執(zhí)行腳手架從“單次生成答案”改成“生成代碼 - 運行測試 - 返回報錯 - 讓模型修改”的閉環(huán)許多不同模型的編碼指標會同時上升。標題里的 “Only the harness changed” 說的就是這個場景。harness 在這里不是模型參數(shù)也不是 prompt 模板而是包裹在模型之外負責輸入構(gòu)造、工具調(diào)用、代碼執(zhí)行、結(jié)果反饋和重試策略的一整套工程系統(tǒng)。這篇文章會圍繞 harness 展開先說明它是什么為什么能影響 15 個模型的編碼表現(xiàn)再一步步實現(xiàn)一個最小可復現(xiàn)的 coding harness并用它批量評估多個 LLM。適合正在做模型評測、編碼 Agent、AI 編程工具鏈的工程師閱讀。讀完以后你可以把這套方案復制到自己的項目里用同一套 harness 橫向?qū)Ρ炔煌P鸵材芾斫鉃槭裁础皳Q模型不如換 harness”。1. Harness 到底是什么模型之外的執(zhí)行與評測系統(tǒng)1.1 從一個“模型集體變強”的現(xiàn)象說起如果只看結(jié)果很多人會以為某個新版本模型“一夜之間變強了”。但標題里的現(xiàn)象并不是模型參數(shù)升級而是推理時的運行方式變了??梢赃@樣理解同樣是做一張數(shù)學卷子之前要求直接寫答案現(xiàn)在允許在草稿紙上演算、檢查、改正最后再上交。草稿紙沒有改變考生大腦里的知識但確實提高了最終得分。LLM 也一樣。同一個模型在同樣的權(quán)重下如果外部系統(tǒng)允許它先執(zhí)行代碼、看到報錯、再修改答案它的 coding 指標就可能明顯提升。這就是 harness 的作用它不是一個更大的模型也不是更長的 prompt而是把“推理一次”擴展成“推理、執(zhí)行、反饋、再推理”的完整循環(huán)。這里要特別說明不同評測集、不同模型供應商、不同任務難度下harness 帶來的提升幅度并不一樣。不要把這個現(xiàn)象理解成“任何模型都能被 harness 救活”。模型本身的能力仍然是上限harness 負責把已經(jīng)存在但未被充分利用的能力釋放出來。1.2 Harness 在 LLM Coding 場景中的技術(shù)定位在 LLM coding 場景里harness 通常包含幾個核心部分輸入構(gòu)造把題目、代碼模板、歷史錯誤、測試結(jié)果組裝成模型能理解的上下文。動作執(zhí)行讓模型有機會運行代碼、執(zhí)行命令、讀取文件而不是只輸出靜態(tài)文本。環(huán)境反饋把執(zhí)行后的 stdout、stderr、退出碼、測試斷言結(jié)果返回給模型。迭代控制決定最大嘗試次數(shù)、何時停止、何時切換策略。結(jié)果評估用隱藏測試、靜態(tài)檢查、人工規(guī)則判斷最終答案是否真正正確。模型、prompt、harness 是三個不同層面的東西。用一張表可以看得更清楚層面決定因素典型改動影響范圍模型權(quán)重和架構(gòu)換模型、微調(diào)基礎(chǔ)語言理解、代碼生成能力Prompt輸入文本和示例改任務描述、Few-shot 示例模型對當前任務的理解方式Harness外部執(zhí)行和反饋循環(huán)增加測試執(zhí)行、工具調(diào)用、重試模型能否利用執(zhí)行結(jié)果自我修正很多團隊在優(yōu)化 coding 效果時第一反應是換更大模型或?qū)懜?prompt 示例。實際上如果模型生成的代碼經(jīng)常只差一個邊界條件harness 里加一輪“跑測試再修復”通常更便宜、更穩(wěn)定。1.3 Harness 與 Agent 的關(guān)系A(chǔ)gent 是 harness 的高級形態(tài)但二者不是一回事。最小可用的 coding harness 可以只有四步生成、執(zhí)行、反饋、重試。Agent 則在此基礎(chǔ)上增加了更復雜的規(guī)劃、記憶、多工具選擇和長期目標維護。換句話說Agent 框架本質(zhì)上是一套加強版 harness。理解 harness 的底層邏輯再去看 LangChain、自研 Agent、MCP 等工具時會更容易抓住核心它們都在解決“模型如何觀察外部世界、如何行動、如何根據(jù)反饋調(diào)整”的問題。所以這篇文章先從一個最小 harness 開始。它不需要復雜的 Agent 框架也能實驗出“只改 harness 就能提升多個模型”的效果。2. 為什么只改 Harness 就能提升多個 LLM 的編碼能力2.1 單次生成的盲區(qū)模型看不到運行結(jié)果不接 harness 時LLM 編碼是單向過程用戶給題目模型給代碼結(jié)束。如果代碼有語法錯誤、邊界條件錯誤、邏輯缺陷模型完全沒有機會看見。它只能依賴訓練時見過的相似問題模式來推斷。這種模式適合“短答案生成”但不適合“程序必須可運行”的場景。一個函數(shù)能否通過所有測試用例不取決于生成時看起來是否合理而取決于在真實 Python 環(huán)境中的執(zhí)行結(jié)果。模型無法運行代碼就無法獲得這一關(guān)鍵信息。2.2 反饋回路讓“試錯”成為推理的一部分接入 harness 后模型的每次錯誤都不是終點而是下一步推理的輸入。舉個例子模型第一次生成def two_sum(nums, target): for i in range(len(nums)): for j in range(len(nums)): if i ! j and nums[i] nums[j] target: return [i, j]用樣例測試[2, 7, 11, 15], 9可以通過但用邊界測試[3, 2, 4], 6會失敗因為正確答案是[1, 2]而雙重循環(huán)可能先返回[0, 0]這種非法組合。如果不執(zhí)行測試模型永遠不知道這個問題。加了 harness 后反饋信息里會包含斷言失敗assert res [1, 2] failed: expected [1, 2], got [0, 0]模型看到這個反饋后通常會在下一次生成時修正邏輯讓內(nèi)層循環(huán)從i 1開始。這個過程非常接近人類工程師調(diào)試代碼。2.3 工具調(diào)用擴展了模型的信息邊界更強的 harness 不只是運行代碼還可以讓模型讀取文件、執(zhí)行 shell 命令、查詢 API 文檔、搜索代碼倉庫。模型訓練數(shù)據(jù)里沒有的依賴版本、內(nèi)部 API 簽名、最新框架用法都可以通過工具調(diào)用即時獲取。這也解釋了為什么 15 個模型都能從 harness 改動中受益它們不需要共享同一套秘密技巧只需要共用同一個能執(zhí)行、能反饋、能搜索的外部系統(tǒng)。每個模型都會根據(jù)自己的能力從反饋中提取信息最終整體通過率上升。2.4 更合理的評判標準交付前先驗證很多模型在 benchmark 上得分高但實際交付時仍然需要工程師修改。原因之一是評測只檢查“模型輸出是否看起來對”而不檢查“代碼是否真的能運行通過”。harness 改變了評判方式不是模型生成完就交卷而是生成后先進入沙箱執(zhí)行測試測試通過后才算完成。如果失敗就繼續(xù)反饋和重試。這樣最終產(chǎn)物是經(jīng)過執(zhí)行驗證的代碼而不是一段沒有運行過的字符串。對于 Coding 類任務這種“執(zhí)行優(yōu)先”的評判思路比單純比較生成文本相似度可靠得多。3. 動手實現(xiàn)一個最小可復現(xiàn)的 Coding Harness3.1 場景與工作機制我們要實現(xiàn)一個最小但有完整閉環(huán)的 harness。它接收一個編程題目和若干測試用例調(diào)用任意 OpenAI 兼容接口的 LLM 生成 Python 代碼在本地沙箱中執(zhí)行測試。如果測試失敗就把錯誤信息返回給模型讓模型繼續(xù)修復最多重試若干次。技術(shù)棧選擇Python 3.10 以上openaiPython SDK用于調(diào)用 OpenAI 兼容接口PyYAML用于讀取配置文件subprocesstempfile用于隔離運行模型生成的代碼學習環(huán)境下使用subprocess加超時已經(jīng)足夠。生產(chǎn)環(huán)境要換成 Docker 容器或云沙箱不要直接在本機執(zhí)行不受信任的模型代碼。3.2 環(huán)境準備與依賴安裝先創(chuàng)建虛擬環(huán)境并安裝依賴python -m venv .venv source .venv/bin/activate pip install openai pyyamlOpenAI 兼容接口的模型可以通過環(huán)境變量配置export OPENAI_API_KEY替換為你的 API Key export OPENAI_BASE_URLhttps://api.deepseek.com/v1這里使用OPENAI_BASE_URL的好處是可以平滑切換到任意兼容 OpenAI 協(xié)議的網(wǎng)關(guān)。模型名在配置文件中單獨指定例如deepseek-chat、qwen-plus、gpt-4o-mini等。實際運行時要把密鑰和域名替換成自己環(huán)境對應的值。3.3 數(shù)據(jù)模型與配置文件為了讓評測可重復先用配置文件管理模型參數(shù)和 sandbox 參數(shù)# config.yaml model: deepseek-chat temperature: 0.2 max_tokens: 2048 max_attempts: 3 sandbox_timeout: 10 test_timeout: 5 truncate_feedback: 2000字段含義參數(shù)默認值示例作用modeldeepseek-chat指定要調(diào)用的模型名temperature0.2控制生成隨機性越低越穩(wěn)定max_tokens2048限制單次輸出長度max_attempts3允許模型修復代碼的最大輪數(shù)sandbox_timeout10每次運行測試腳本的超時時間單位秒truncate_feedback2000截斷返回給模型的錯誤信息長度避免上下文膨脹任務文件用 JSON 保存題目和測試用例{ id: two-sum, instruction: 實現(xiàn)函數(shù) two_sum(nums, target)返回兩個下標組成的列表使兩個數(shù)之和等于 target。, entry_point: two_sum, tests: [ {args: [[2, 7, 11, 15], 9], expected: [0, 1]}, {args: [[3, 2, 4], 6], expected: [1, 2]}, {args: [[0, 4, 3, 0], 0], expected: [0, 3]} ] }這里測試用例不僅僅是樣例。[0, 4, 3, 0], 0這種邊界測試會暴露“返回相同下標”的錯誤是評測 harness 必須覆蓋的場景。3.4 核心代碼實現(xiàn)先定義數(shù)據(jù)類# harness.py import argparse import json import os import subprocess import sys import tempfile import textwrap from dataclasses import dataclass from openai import OpenAI import yaml dataclass class TestCase: args: list expected: object dataclass class Task: id: str instruction: str entry_point: str tests: list[TestCase] dataclass class HarnessConfig: model: str temperature: float 0.2 max_tokens: int 2048 max_attempts: int 3 sandbox_timeout: int 10 test_timeout: int 5 truncate_feedback: int 2000加載任務和配置def load_task(path: str) - Task: with open(path, r, encodingutf-8) as f: data json.load(f) tests [TestCase(argst[args], expectedt[expected]) for t in data[tests]] return Task( iddata[id], instructiondata[instruction], entry_pointdata[entry_point], teststests, ) def load_config(path: str) - HarnessConfig: with open(path, r, encodingutf-8) as f: data yaml.safe_load(f) return HarnessConfig(**data)構(gòu)造測試腳本。這里把用戶代碼和斷言拼成一個獨立腳本通過subprocess執(zhí)行def build_test_script(user_code: str, task: Task) - str: parts [user_code, ] for idx, t in enumerate(task.tests): args_repr , .join(json.dumps(arg) for arg in t.args) expected_repr json.dumps(t.expected, ensure_asciiFalse) parts.append(fres {task.entry_point}({args_repr})) parts.append( fassert res {expected_repr}, fcase {idx} failed: expected {expected_repr}, got repr(res) ) parts.append(print(PASS)) parts.append(print(ALL_PASS)) return \n.join(parts) def run_tests(user_code: str, task: Task, timeout: int) - dict: test_script build_test_script(user_code, task) with tempfile.TemporaryDirectory() as tmpdir: try: proc subprocess.run( [sys.executable, -I, -c, test_script], capture_outputTrue, textTrue, timeouttimeout, cwdtmpdir, ) except subprocess.TimeoutExpired: return { passed: False, stdout: , stderr: TimeoutExpired: 代碼運行超時, } if proc.returncode 0 and ALL_PASS in proc.stdout: return {passed: True, stdout: proc.stdout, stderr: proc.stderr} stderr proc.stderr or proc.stdout return {passed: False, stdout: proc.stdout, stderr: stderr}從模型輸出中提取代碼。為保證兼容性允許模型輸出 Markdown 代碼塊import re def extract_code(raw_output: str) - str: pattern r(?:python)?\s*(.*?) match re.search(pattern, raw_output, re.S) if match: return match.group(1).strip() return raw_output.strip()核心重試循環(huán)def solve_task(client: OpenAI, config: HarnessConfig, task: Task) - dict: messages [ { role: system, content: 你是一個 Python 編程助手。只輸出可運行的 Python 代碼不要添加多余解釋。, }, {role: user, content: task.instruction}, ] attempts [] for attempt in range(1, config.max_attempts 1): resp client.chat.completions.create( modelconfig.model, messagesmessages, temperatureconfig.temperature, max_tokensconfig.max_tokens, ) raw_output resp.choices[0].message.content or code extract_code(raw_output) result run_tests(code, task, config.sandbox_timeout) attempts.append( { attempt: attempt, code: code, passed: result[passed], stderr: result[stderr][-config.truncate_feedback :], } ) if result[passed]: return {status: solved, attempts: attempts, final_code: code} feedback f第 {attempt} 次運行失敗請修復代碼\n{result[stderr][-config.truncate_feedback:]} messages.append({role: assistant, content: code}) messages.append({role: user, content: feedback}) return {status: failed, attempts: attempts, final_code: None}最后是命令行入口def main(): parser argparse.ArgumentParser() parser.add_argument(--task, requiredTrue, help任務 JSON 文件路徑) parser.add_argument(--config, defaultconfig.yaml, helpharness 配置文件路徑) args parser.parse_args() config load_config(args.config) task load_task(args.task) client OpenAI( api_keyos.getenv(OPENAI_API_KEY), base_urlos.getenv(OPENAI_BASE_URL), ) result solve_task(client, config, task) print(json.dumps(result, ensure_asciiFalse, indent2)) if __name__ __main__: main()這段代碼有幾個關(guān)鍵點需要解釋模型輸出先經(jīng)過extract_code再進入沙箱執(zhí)行避免模型在代碼塊外添加解釋導致運行失敗。每次失敗后把模型自己的代碼和報錯一起追加到對話歷史中讓模型在同一上下文里繼續(xù)修改。truncate_feedback防止巨型 traceback 撐爆上下文。-I參數(shù)讓 Python 以隔離模式運行忽略當前 PYTHONPATH 影響降低環(huán)境干擾。3.5 運行與驗證保存好config.yaml、task.json、harness.py后執(zhí)行python harness.py --task task.json --config config.yaml如果一切正常會輸出類似下面的 JSON{ status: solved, attempts: [ { attempt: 1, passed: false, stderr: assert res [1, 2] failed: expected [1, 2], got [0, 0] }, { attempt: 2, passed: true, stderr: } ], final_code: def two_sum(nums, target):\n seen {}\n for i, n in enumerate(nums):\n if target - n in seen:\n return [seen[target - n], i]\n seen[n] i\n }注意status是solved只代表模型通過了任務里配置的測試用例。它不能證明代碼在所有情況下都正確。這個區(qū)分很重要后面專門講。4. 用同一套 Harness 評估 15 個 LLM 的流程設(shè)計4.1 為什么必須使用同一套 Harness如果你要橫向?qū)Ρ榷鄠€模型必須讓 harness 完全一致。因為不同的重試次數(shù)、不同的測試用例、不同的沙箱超時都會直接影響最終得分。有些模型在 1 次嘗試內(nèi)表現(xiàn)不佳但如果在 3 次嘗試中能通過最終排名就會不一樣?!爸桓?harness 就提升 15 個 LLM”的場景里提升幅度并不只屬于某一個模型。所有模型共享同一個改進后的執(zhí)行反饋機制。如果你在評測時給 A 模型 5 次重試給 B 模型 1 次重試那結(jié)果沒有可比性。統(tǒng)一內(nèi)容至少包括同一個任務集和測試用例。同一個max_attempts。同一個temperature。同一個沙箱超時時間。同一個反饋截斷長度。同一個系統(tǒng)提示詞。任何一項不一致都應視為不同 harness而不是不同模型的真實對比。4.2 評測集與判定規(guī)則評測集不能只有公開樣例還要包含隱藏測試用例。最簡單的方式是像前面task.json一樣把每個任務拆成“展示給模型的 instruction”和“模型看不到的 tests”兩部分。模型自己不能提前看到全部測試否則它可能生成專門針對測試用例的硬編碼。更完整的評測集應該覆蓋基礎(chǔ)功能正常輸入。邊界條件空數(shù)組、最小值、最大值、重復元素。異常輸入不符合題目約束的數(shù)據(jù)是否被合理處理。性能約束大數(shù)據(jù)量下是否超時。不同難度的題目混合在一起能看出模型在不同復雜度下的表現(xiàn)差異。如果只有一個簡單樣例15 個模型可能全都滿分無法區(qū)分 harness 的作用。4.3 批量評估與指標輸出批量評估腳本可以循環(huán)遍歷任務文件和模型列表。為了控制成本建議把配置參數(shù)單獨抽取出來python evaluate.py \ --task-dir tasks/ \ --models deepseek-chat qwen-plus gpt-4o-mini \ --config config.yaml \ --concurrency 4 \ --output report.jsonl評估腳本內(nèi)部可以這樣組織def evaluate_one(client, config, task, model): result solve_task(client, config, task) return { task_id: task.id, model: model, status: result[status], attempt_count: len(result[attempts]), token_usage_estimate: estimate_tokens(result[attempts]), } def evaluate_all(client, config, tasks, models): records [] for model in models: for task in tasks: cfg HarnessConfig(**{**config.__dict__, model: model}) records.append(evaluate_one(client, cfg, task, model)) return records收集完記錄后可以統(tǒng)計每個模型的首次通過率、最終通過率和平均嘗試次數(shù)指標計算方式首次通過率第 1 次嘗試即通過的任務數(shù) / 總?cè)蝿諗?shù)最終通過率在max_attempts內(nèi)通過的任務數(shù) / 總?cè)蝿諗?shù)平均嘗試次數(shù)所有已通過任務的嘗試次數(shù)平均值平均耗時單任務從開始到結(jié)束的墻鐘時間平均值注意這里展示的表格結(jié)構(gòu)是通用指標設(shè)計不是任何特定模型的真實分數(shù)。你在自己的評測集上得到的結(jié)果可以作為內(nèi)部選型依據(jù)。4.4 成本與并發(fā)控制批量評估 15 個模型時token 消耗會迅速增加。每個失敗嘗試都會額外消耗一次模型調(diào)用和一次反饋上下文??刂瞥杀究梢詮膸追矫嫒胧窒拗苖ax_attempts一般 3 到 5 次足夠。對相同請求做緩存相同模型、相同任務、相同重試不必重復調(diào)用。使用并發(fā)時控制請求速率避免觸發(fā)限流。記錄每次調(diào)用的 prompt token 和 completion token便于核算成本。并發(fā)不是越高越好。限流和超時會導致評測結(jié)果不穩(wěn)定最終浪費更多重試。更穩(wěn)妥的做法是先單線程跑通一個小樣本確認流程穩(wěn)定后再加大并發(fā)。5. Harness 關(guān)鍵參數(shù)與調(diào)優(yōu)5.1 重試次數(shù)、溫度與最大 token這幾個參數(shù)直接影響評測結(jié)果和成本。參數(shù)取值范圍參考調(diào)小的影響調(diào)大的影響max_attempts1 - 5成本低但模型沒有自糾機會成本高可能在簡單錯誤上反復打轉(zhuǎn)temperature0 - 0.7輸出穩(wěn)定但容易重復相同錯誤探索更多但可能引入隨機錯誤max_tokens512 - 4096代碼較長時容易被截斷輸出更完整但可能生成多余內(nèi)容sandbox_timeout5 - 30 秒快速失敗但誤殺復雜計算減少誤殺但死循環(huán)會拖慢評測在實際調(diào)優(yōu)中不要一開始就追求高重試次數(shù)。先把max_attempts設(shè)為 1看模型在不自糾時的基線水平再逐步增加到 3 和 5觀察通過率提升和成本增長曲線。如果 3 次到 5 次的通過率提升很小說明繼續(xù)增加重試的意義不大。5.2 測試用例生成策略測試用例來源有三種人工編寫質(zhì)量最高但覆蓋不全成本高。從題目約束自動生成用枚舉、隨機、邊界值生成覆蓋性好。讓另一個 LLM 生成速度快但可能出現(xiàn)錯誤斷言。更推薦先人工寫題目和核心邊界再用腳本補充隨機測試。模型生成的測試用例可以作為補充但必須經(jīng)過人工審查。絕不能把 LLM 生成的測試直接當成 ground truth否則可能出現(xiàn)“錯誤測試認定正確代碼”的情況。5.3 反饋信息的長度控制多輪重試時上下文會越來越長。如果每次都把完整 traceback 塞給模型幾輪之后 prompt 會膨脹模型容易丟失最早的任務描述。推薦做法只保留最后一次異常的最后 1000 到 2000 字符。把重復出現(xiàn)的相同錯誤去重避免模型反復看同一個 traceback。在反饋中明確告訴模型當前是第幾次嘗試避免它生成“這是第一次”的回答。如果上下文仍然過長可以把歷史反饋壓縮成“之前嘗試過的修改摘要”。5.4 沙箱安全與資源限制模型生成的代碼不可信。學習環(huán)境里用subprocess和超時只是為了快速驗證思路生產(chǎn)環(huán)境必須做更強的隔離。生產(chǎn)環(huán)境至少做到使用 Docker 容器運行模型代碼限制 CPU、內(nèi)存和網(wǎng)絡(luò)。設(shè)置timeout和內(nèi)存上限避免死循環(huán)和內(nèi)存耗盡。模型代碼沒有網(wǎng)絡(luò)訪問權(quán)限除非任務明確需要。所有執(zhí)行結(jié)果先落盤再決定是否返回給模型。不要用宿主機的高權(quán)限賬號運行任意生成代碼。注意如果你的 harness 會執(zhí)行模型生成的代碼安全性是第一優(yōu)先級。寧可犧牲一點執(zhí)行速度也不要讓不可信代碼直接接觸宿主機。6. 常見問題與排錯路徑6.1 模型輸出不是合法代碼現(xiàn)象run_tests報錯 NameError 或者無法解析。可能原因模型沒有按“只輸出代碼”的要求返回。模型把代碼放在 Markdown 代碼塊中但extract_code沒匹配到。模型返回了 JSON 包裝的字符串。檢查方式打印raw_output確認模型實際返回內(nèi)容。處理建議增強解析函數(shù)。支持去掉python標記如果模型返回 JSON先嘗試解析code字段如果仍然失敗可以讓模型輸出固定格式例如BEGIN_CODE ... END_CODE6.2 同一個錯誤反復重試現(xiàn)象max_attempts用完但每次錯誤相同??赡茉蚍答佇畔⒈唤財嗟酵耆珱]有錯誤細節(jié)。temperature0導致模型每次都輸出相同結(jié)果。模型沒有真正“看到”反饋因為消息順序或角色設(shè)置錯誤。檢查方式查看attempts中每一輪返回給模型的stderr。處理建議把temperature提高到 0.2 到 0.4確認反饋中保留最后一行錯誤類型和斷言信息如果錯誤信息過長只保留后半段。6.3 公開測試通過但隱藏測試失敗現(xiàn)象harness 輸出solved但人工復測時發(fā)現(xiàn)代碼不正確??赡茉驕y試用例太少模型恰好通過了所有用例。模型學會了針對測試樣例硬編碼。測試用例只有正常輸入沒有邊界。檢查方式把模型生成的final_code放到更大的隱藏測試集上執(zhí)行。處理建議評測集必須分離公開樣例和隱藏測試。最終指標以隱藏測試為準一次評測同時加入邊界、隨機、性能三類用例。6.4 API 調(diào)用超時或限流現(xiàn)象批量評估時大量請求報錯??赡茉虿l(fā)過高觸發(fā) API 限流。部分模型響應慢超過客戶端默認超時。網(wǎng)絡(luò)抖動。檢查方式查看client.chat.completions.create拋出的異常類型和錯誤碼。處理建議加入指數(shù)退避重試降低并發(fā)數(shù)為每次調(diào)用設(shè)置合理 timeout對相同請求做緩存避免重復調(diào)用。6.5 沙箱卡死與資源耗盡現(xiàn)象單個任務執(zhí)行時間特別長甚至整機變卡??赡茉蚰P蜕伤姥h(huán)代碼。代碼創(chuàng)建超大列表或遞歸無終止。subprocess的timeout沒有覆蓋到子進程內(nèi)部再創(chuàng)建的子進程。檢查方式檢查 sandbox 日志確認是否出現(xiàn)TimeoutExpired。處理建議在subprocess.run中設(shè)置嚴格 timeout生產(chǎn)環(huán)境用 Docker 的--memory和--pids-limit限制資源不要相信模型生成的代碼天然安全。排錯路徑可以按這個順序走先檢查輸入任務文件、測試數(shù)據(jù)、配置格式。再檢查解析模型輸出是否正確提取。再檢查執(zhí)行沙箱能否運行最簡單的腳本。再檢查反饋模型是否收到了完整報錯。再檢查限制超時、token、并發(fā)是否導致假失敗。最后檢查評測集測試用例本身是否可靠。7. 生產(chǎn)環(huán)境 Harness 的最佳實踐與擴展方向7.1 從評測腳本走向在線編碼 Agent最小 harness 是評測工具但它的核心結(jié)構(gòu)可以直接擴展成生產(chǎn)級的編碼 Agent。區(qū)別在于生產(chǎn)系統(tǒng)需要更多工程能力支持多文件倉庫模型可以讀取目錄、打開文件、修改文件。支持工具協(xié)議模型能調(diào)用格式檢查、靜態(tài)分析、測試運行、git 操作。支持持久記憶保存模型已經(jīng)嘗試過的方案避免重復犯錯。支持人工介入在自動修復多次失敗后把任務轉(zhuǎn)給工程師處理。支持版本回滾模型對代碼庫的所有修改都記錄 diff異常時可以回滾。這些能力本質(zhì)上都是“在模型外面加 harness”。模型還是那個模型但外部系統(tǒng)越完善它能完成的任務越復雜。7.2 評測前檢查清單把下面這份清單當作可復用模板每次開始新的評測前過一遍測試用例是否包含隱藏用例而不是只給模型公開樣例。所有模型是否使用完全相同的max_attempts、溫度、超時和系統(tǒng)提示詞。反饋信息是否保留異常類型和關(guān)鍵斷言而不是只返回“失敗”。錯誤信息是否做了長度截斷防止上下文膨脹。沙箱是否設(shè)置了超時、內(nèi)存和 CPU 限制。是否記錄每輪 attempt 的原始輸出、最終代碼和錯誤日志。是否固定依賴版本和模型版本保證結(jié)果可復現(xiàn)。是否使用passk多次采樣而不是只跑一次。是否區(qū)分“通過公開測試”和“通過隱藏測試”兩個指標。是否把隨機種子、并發(fā)數(shù)、API 端點寫入實驗記錄。這十項做完你的評測結(jié)果才有橫向?qū)Ρ葍r值。7.3 擴展方向MCP、RAG 與更豐富的工具層再往前走harness 可以連接 MCP 協(xié)議、向量檢索、內(nèi)部文檔庫和外部 API。模型在編碼時不再只依靠訓練記憶而是能實時獲取依賴文檔、歷史代碼、團隊規(guī)范和安全策略。例如harness 里增加一個search_code工具模型在寫某個函數(shù)前先搜索項目里已有的相似實現(xiàn)再生成代碼。另一個read_docs工具讓模型在不確定某個 SDK 參數(shù)時先查官方文檔。這些能力都會影響編碼結(jié)果而它們?nèi)匀粚儆凇澳P椭獾南到y(tǒng)”。學習建議是先把這個最小 harness 跑通再逐步加入一個工具、一個記憶模塊觀察每次改動對多個模型的影響。你會慢慢理解為什么“只改 harness”能提升 15 個模型——因為 harness 改變的不是參數(shù)而是模型與外部世界互動的方式。這種工程能力比單純追新模型版本更可控也更值得長期投入。
返回列表
PREV
查看更多資訊
NEXT
返回資訊列表
久久久精品网| 蜜臀久久99精品久久久久电影| 先锋精品av色鲁| 国产男女无套视频免费观看| 日本午夜福利视频| 天天综合站| 久久中文字幕一区不卡| 婷婷丁香在线| 东北女人被操| 欧洲久久一二线| 91精品啪在线观看国产城中村| 国产又黄又猛又粗又爽的网站| 日韩八十路老熟女| 影音先锋中文字幕日本好一区二区| 久久思思热| 拍拍拍拍大尺度黄色三级片拍拍拍拍拍照| 偷窥自拍A片| 色婷婷99| 91殴美| 日本三级A片网站com| 国产SV一线| 99色网| 91丨九色丨大屁股| 东京热AV男人的天堂| 国产Aα| 天美传媒av一区二区| 欧美日韩性爱电影在线| 久久爽爽精品| 青青草天天亲夜夜操网| 日本一区二区中文字幕久久| 好看的久久不射无码影视影院| 五月婷亚洲精品天堂| 亚洲aw毛茸茸在线| 自拍偷拍第26| 青娱乐亚洲自拍| 少妇蜜汁| 99性爱视频| 色汉综合| 久久视频少妇美女| 成人日韩欧美| 亚洲国产欧美另类自拍| 亚洲资源站| 99九九久久| 日本一级真人黄色性爱视频| 婷婷探花久久精品一区| 好好的日:com久久九九| 欧美日不卡| 摸奶性爱视频网站在线免费播放| 一本久久久精品| 狠插 制服 自拍| 新婚人妻扶着粗大强行坐下| 中文字幕后石码三区四区| 精品人妻一区二区三区-国产精品 一个人在线看的黄色电影网站 | 国产成人精品日本视频| 东京热视频网| 日本一级特级毛片视频| 91色亚洲| 青青青草原| 偷拍亚洲高清图片| 97香焦色区| 开心五月深爱五月| 色婷婷网| 蜜臀久久99精品久久久久久久久| 日韩欧美一级特黄大片| 夜嗨影院| 另类小色呦| 日韩不卡在线一区二区| 上海一级黄片| 欧美亚涩| 91久精品| 蜜桃臀 后入 一区 二区 三区 在线| 无码少妇精品一区二区60岁老人 | 日韩精品亚洲一二三| 好爽,再快点啊哈嗯嗯嗯嗯| 偷窥自拍A片| 久草视频在线视频在线视频在线观看| gogogo免费高清看中国国语 | 91久久婷婷| 青青久日| 久久久蜜桃臀无码视频| 人妻丝袜一区二区三区在线| 東南亚性呦成人伦理资源在线视频| 亚洲电影91| 另类专区加勒比| 日本不卡中文| 蜜乳AV.COM| 国内毛片免费h片在线| 成视频在线观看免费看| 成人AV素股で擦久久| 精品一久久久| 色五月AV| 视频黄色国产一级| 日本 欧美 亚中文字幕| 大干人妻| 性色av网站| 高清无码网址| avav青青草久久夜| 视频二区美腿制服人妻欧美| 国内毛片无遮挡国产| 日韩国产乱子伦App| 亚洲天堂电影精品一区| 好好的日:com久久九九| 中文字幕熟女人妻丝袜丝| 欧美,日韩,中文,另类| 九九热精品视频六| 91动漫操逼视频| 午夜男人一级A片7777| 肥臀熟女福利视频一区二区| 九九超碰综合网| 久久久555| 亚洲精品天堂久久A∨51成人漫 | 蜜桃在线观看一区二区三区 | 色噜噜婷婷| 91夜色chaopeng| 久久超碰com| 日韩999| 久久久久9999精品九九九| 亚洲福利影院一区久久| 五月婷婷综合在线| 亚洲操逼视频网站| 九九九九日本| 草莓精品视频在线免费观看| 性做久久久久久免费观看软件| 91色综| 精品久久97观看在线视频| 国产精品久久久久无码Av网曝门| 精品无人区麻豆乱码久久久| 性爱乱伦网址| 91美女视频在线观看| 国产精品交换一区二区| 国产三级在线现体验区| 亚洲熟久久| 伊人色综合网电影| 农村女一级毛卡片| 啊啊啊啊一区| 亚洲精品国产无码高清| www欧美91| 色婷婷综合久久中文字幕雪峰| 色吧5亚洲| 午夜毛片高清免费不卡| 婷婷五月天激情网| 午夜国产综合视频在线观看| 91综合网站| 天天射,天天操,天天爽-国内精品一区二区三区-成人AV | 大香蕉欧美伊| 男人天堂.AB| 思思性爱| 黄色操人| 亚洲**2021在线观看| 国产成人99久久亚洲综合| 夜夜久久| 六六久久日韩不卡| 久99热| 黄色av一区二区在线| 久久久精品91八戒| 国产又黄又粗又猛大片| 久久精品女同亚洲女同13| 欧美永久激情一区二区| 超碰在线974| 欧美日韩国产中文超碰| 性爱久久| 国产亚洲人妻综合日韩 久久| 国产精品麻豆免费视频| 亚洲巨爆乳一区二区三区四季网| 91bbbbbb| 91亚洲青青草原精品1区| 97免费在线观看视频| 插插综合网天天影视网| 久久久久久中文| 色踪合AV| 精品妇操一区二区三区| 人妻素股| 97视频在线观看免费高清| 久久美国毛片| 啊啊啊啊免费视频| 天天操狠狠日夜夜干超大胆开放com大香蕉视频在线观看 | 国产区性爱在线视频秋霞豆| 黄色AAAAA欧美| 岛国网址国产| 日本天天操| 在线观看一卡二卡| 美欧老女人97| 97精品一区二区视频在线观看| 婷婷在线精品| 欧美色图片91| 日韩无码人妻中字久久三区四区| 日韩性色| 国语精品内射在线观看| 夜夜操二区| 蜜桃臀 后入 一区 二区 三区 在线| 亚洲国产综合久久久性感熟妇| 亚洲日韩av一区二区三区百合| 伊人久久大香线蕉亚洲五月天,青草青草欧美日本一区二区,欧美日产欧美日产国产 | 欧美日韩性爱精品| 99热18| 国产熟女少妇一区| 综合97亚洲| 中日韩久久久免费看| 成人性交午夜免费片| 天天夜躁日日躁狠狠2002| 一区二区三区黄色片a| 日韩中文字幕在线视频观看| 中文字幕女同在线| 九九九偷拍| 一级二级三级黑人无码| 免费精品人妻一区二区三| 久久婷婷亚洲| 久久在肏| 久久综合亚洲色1080p| 久久性爱视频| 亚洲久久久| 三级特黄60分钟播放| 天天干天天做| 人妻91少妇| 欧美综合天天| 啊啊啊好爽快点啊啊啊嗯嗯| www.acm成人黄色毛片| 亚洲欧洲av影音| 色婷婷在线视频精品导航| 亚洲系列欧美| 国产福利影视| 日本亚洲嫩草影院啪啪| 人夜夜精品网站香蕉嫩草| 男人天堂东京热| 婷婷色在线| 日本男人插女人的逼黄色| 熟妇综合一区二区三区| 99色婷婷中文字幕乱色| 麻豆天美91| 95精品在线| 看全色黄大色大片免费视频| 天天爽夜夜欢视| 国产区在线| 伊人五月天| 精品人妻一区二区三区鲁大师| 国内精品伊人久久久久影院会| 69精品| 久草午夜| 一本一道vs波多野结衣| 凹凸视频在线一区二区| m欧洲一级午老| 国产精品视频91久久| 欧美青青视频| 女色视频社区| 国产白丝AV| 中文无码一二三区| 精品中文字幕一区二区| 在线天堂资源亚洲| 亚州色图欧美| 欧美色图自拍| 欧美精品偷拍| 极品色社| 人人摸人人摸人人干| 大香蕉中文在线| 九九九精品一区二区无码| 日本护士高潮| 日本欧美不卡| 91在线免费观看处女| 国产精品99久久久www| 欧美天天射| 国产精品国产| 国产白丝在线| 国产精品视频播放| 婷婷综合五月| 亚洲一区二区三区播放在线| 日韩性爱啪啪视频| 91精品久久久久久77777| 欧洲无码一区二区| 97干在线| 久久黄色性爱视频| 日本506070| 三级特黄60分钟播放| 黄色高清无码无码破解免费暗网| 在线播放欧洲免费av| 日韩乱码av| 欧美亚洲| 夜夜春夜夜操| 操狠狠| 美国一区二区三区视频| 思思热国产高清| 亚洲综合 欧美| 五月婷婷激情网| 成人精品久久久午夜福利| 嫩草影院永久在线制服丝袜| 东北黄色电影| 婷婷五月天社区| 日本精品网站在线中文| 久久岛国| 九99久久| 中文字幕片| 激情五月婷婷| 韩日无码在线观看| 在线观看无码三级少妇| 久久产精品一区二区三区电影| 后入式五六区| 加勒比五月天| 久久內射| 亚洲第一页欧美| 一级黄色影片| 色色香蕉| 免费看国产曰批40分钟怎么下载| 久久日韩精品一区二区| 家庭乱伦麻豆| 亚洲欧美成人网站AAA| 热热色91| 久久二| 美女上床网站| 人人澡人人干| 男人的天堂日韩| AV99热18这里只有精品| 久久秀这里有精品| 日韩伦理久 久久 清纯| 精品一区二区三区蜜桃臀赵总 | 亚洲欧美国产中文视频| 欧美人体性爱互联网第一页婷婷日本| 一级乱伦网站| 思思热在线视频在线| 亚洲欧美日韩国产丝袜自拍中文| 精品四五区| 性色一线| 综合 青草 伊久久 影院 综合 | 天天噜| 男人的天堂免费| 97视频在线免费播放| 99国产精品久久久在线播放| 欧美一区二区成人一卡| 日韩欧美天天爽爽爽天天爽爽| 欧美日韩婷婷中文| AV久日| 色天使AV天堂| 在线黄色污污网站| 亚洲AV人人澡人人爱| 欧美日韩亚洲国产中文永久天天看 | 国产五码丝袜屁眼| 龙兴卡官方查询| 黑人粗大V S日韩女优视频| 最新9久久久9免费视频| 操亚州| 国产suv精品一区二区四| 欧美久久伊人| 蜜臀精品1区2区| 成人热久久精品| 高清肉丝中文无码| 久久在肏| 精品国产av一区二区三区四区入口| 欧美一级A一级a爱片久久| 亚洲国产一级黄色视频| 一本一道vs波多野结衣| 免费a v| 91美女小视频| 欧美精品23| 国产69精品久久久久99尤物| 亚州国产精品乱| 刺激性视频黄页| SUV一区二区在线看| 精品美女少妇一区二区三区| 天天天干977| 最新日本中文字幕| 亚洲黄色网址视频| 视频二区美腿丝袜制服人妻欧美| 亚洲综合婷婷| 丰满搜索结果 -第18页- 久久高清无码 | 立川理惠被中出无码| 欧美日韩亚洲一区二区在线观看| 亚乱色| 青青草密桃在线播放| 九九热精品在线| 色哟哟精品1精品2| 国产一区自拍欧美日韩 | 97在线亚洲| 免费观看成人www精品视频| 久久欲| 丁香六月啪啪| 啊啊啊啊啊啊啊啊要喷了| 91人妻少妇| 欧美丰满少妇xx高潮| 啊灬啊灬啊灬好深灬快高潮了动漫-国产字幕国产在线观看-B049AV | 精品少妇人妻| 波多野结衣AV无码一区| 国产伦精品一区二区三区在线观 | 国产午夜福利电影免费在线观看| 激情色色| 五月天色图| 东京男人天堂| 美女国产一区二区久久| 亚洲欧洲无码97久久精品| 99re6在线视频播放免费精品| 欧美日韩国产一区二区小黄片大全| 成片免费播放| 夜夜做夜夜爽精品视频| 色就色综合| 婷婷五月天综合网| 人人爽夜夜玩视频| 可以在线观看的黄色网址| 午夜呻吟欧美| 久草尤物| 婷婷五月天伊人| 日本国产二线女色| 性爱av网站| 97超碰超欧美。| 久 久无码人妻AV| 亚洲精品国产精品乱码不99| 蜜桃臀一区二区aV| 嫩草一区二区在线观看| 天美传媒av在线| 熟妇xxxxx性春色| 少妇同性| 亚洲国产成人福利在线观看| 超碰人妻中文在线| 老子午夜伦不卡影院| 中日无幕一二三四区| 日韩在线电影| 色色色色色色色色色色色色色色综合| 国产精品乱码久久久| 久久露脸国产老熟女| 国产日韩中文字幕欧美| 国产欧美日韩一区二区三区| 国产又大又粗又色生活片亚洲国产精品成人久久久综合免费 | 国产精品ww久久| 五月丁香网站| 亚欧美色| 夜夜高潮夜夜爽高清视频一| 国产99热| 国产精品久久发布| 青草一区二区| 日韩中文字幕熟妇人妻| 成年人三级黄色片视频| 伊人久久久日韩一区| 免费亚洲黄色视频在线观看| 国内外毛片在线观看| 日本午夜久久电影| 亚洲欧美色图| 中出91| 99色网| yazhousetuoumei| www.伪伪| 九九九九九九九九九国产精品 | 青青操轻轻| 欧美综合中文| 99.色网| 尤物网址| 五月天伊人网| 日韩99神马视频片| 91干熟女| 人妻少妇久久中文字幕一区二区 麻豆| 97一区二区蜜臀| 日本天天操| 人妻丝袜一区二区三区在线| 国产av白丝| 高清成年美女黄网站免费大全 | 婷婷五月天成人网| 自拍偷拍第26| 亚洲天堂一二| 99操| 免费人成在线观看网站品爱网| 鲁鲁色综合网| 亚洲第一狼人丝袜美女另类| 麻豆美女丝袜人妻中文| 亚州高清av| www.色五月| 色汉综合| 欧美,亚洲,日韩,v,天堂,手机在线观看 | 天天内射| 日韩有码一区三区| 日本亚洲vr欧美不卡高清专区| 在线女人91| 国产成人午夜视频网址| 好吊色综合| 久久男人网| 91日韩在线| 少妇厨房愉情理伦片bd在线观看| 亚州成人a∨| 1禁看欧美黄片免费看| 欧美激情激情xxxx欧美专区| 日韩精品三级| 9久久9综合| 久久一区二区高清免费| 97干在线| 国产日韩怡红院| 亚洲精品 欧美精品| 女人的久久久| 久久婷综合| 久操91视频| 精品天堂| 日韩综合97p| 亚洲欧美综合网站| 久久久久久91香蕉国产| 婷婷月色| 亚洲五月丁香花狠狠干一区二区三区| 久久久9999| 国产sv美女内射| 欧美综合色站| 青苹果影院男人的天堂| 91精品大奶人妻| 一起草日韩| 美国精品国产精品| 久久精品日韩| 干婷婷综合网| 色五月第四色| 伊人久久国产免费观看视频| 激情丁香五月| 欧美极度丰满熟妇hd| 中国国产精品一区视频| 51久久夜色精品国产麻豆| 91网站18| 超碰97人妻自拍| 婷婷10月天青娱乐| 天天插夜夜爽| 色综合99999| 日韩丝袜高跟制服在线观看| 午夜后入| 激情亚洲天堂| 天天躁狠狠躁av| 亚洲婷婷丁香在线| 久久午夜伦| 九九成人| 久久久久久久九九九九九九| 欧美性爱一内片一区二区三区| 国产av高清版| 第二页中文字幕| 天天综和| 91操人| 亚洲十八禁止| 日韩精品人妻中文字幕有码午| 中文字幕在线观看AV| 91殴美大片| 日噜夜夜夜夜夜夜夜夜夜夜爽爽爽爽爽爽爽爽爽爽爽爽 | 久久一二区四| 亚洲免费97免费| 天天看高清麻豆| 激情久久日韩精品中文字幕麻豆| 中文熟女五十乱码在线| 亚洲综合图色在线| 嗯嗯啊啊好大好爽| 欧美精品系列| 青青草这里只有精品| 资源新线在线天堂| 岛国大片国产| av中文在线| 99re这里只有精品中心播放| 伊人久久亚洲中文字幕| 色区久久| 亚洲成人综合在线| 国产超碰在线一区| 日韩资源网| 欧洲亚洲人人爽爽视频| 99re视频在线播放青草| 98人妻精品一区二区色欲| 色色色色色色色色综合| 5252色欧美在线| 91无码人妻| 国产精品噜噜噜日日日| 中文字幕中文字幕一区二区| 密乳无码| 日韩av乱伦| 九九热免费在线国产视频伊人五月| 国产精品视频在线播放| 人人妻人人色一区二区三区| 欧美丝袜亚洲| 国产毛片毛片4p懂色| 岛国在线一区二区三区| 观看免费区二区三区二| 人妖欧美一区二区| 国产精品一区二区亚洲人成毛片| 丁香婷婷大香蕉| 素人美腿视频网站| 欧美性爱超碰97| 婷婷五月天色网| 热的中文 热的有码 热的国产| 亚洲男人天堂网站| 天堂无码精品国产久| 97舔舔| 青青草华人在线欧美在线| 人妻干天天| 日韩免费人妻色情网站| 超碰吊日色| 成人a大片在线观看| 伊人久久国产免费观看视频| BBBBB97COM| 午夜无码精品免费看性色| 日本精品人妻少妇一区二区| 91n处女在线观看| 两女互慰AV高潮喷水在线观看| 97操碰| 麻豆一区二区三区在线看| 日本激情免费大片| 不卡码视频| 中文字幕欧美日韩三级| 欧美特大黄一级片片免费| 淫乱图区 | 午夜传煤十二区精品| 亚洲高清色综合| 欧美日韩亚洲一区二区在线观看| 97色婷| 日本一卡二区在线| 免费一级a毛片久久久久久鸭绿欲| 天天干一区二区| 青青草公开在线免费不卡视频| 操www| 大香蕉天天看妹子| 亚洲熟妇A V黑人| 五月婷婷综合网| 欧美日韩制服| 亚洲天堂,男人| 亚洲中文字幕熟女少妇一区二区| 日本久久99| 国内一级精品| 最新欧美色网| 久久成人国产精品| 久久精品国产99国产精品亚洲| 人人操人人舒服| 97综合在线观看| 女性喷水高潮在线观看| 国产刺激视频| av激情亚洲五月天| 亚洲一区中文字幕久久,果冻传媒一区二区天美传媒 | 超碰97最新人妻| 国产午夜福利专区综合| 国产精品情侣啪啪| 亚洲一二三精品久久网 | 超碰97人人cao| 天美国产精品| 久久精品中文字幕观看| 亚洲操逼视频网站| 97久久超碰亚洲| 欧美一级黄片免费播放| 欧美东京热青青草| 激情综合五月| 国产1024在线播放| 9久精品视频在线观看| 久久精品国产亚洲AV无码电影| 欧美色图亚洲色,麻豆| 亚洲综合色网| 日本熟妇人妻一区二区三区| 欧美老熟另类| 久久久久久国产手机AV| 嗯嗯嗯嗯啊啊啊好紧好大| 深夜激情| 青苹果影院男人的天堂| 欧美日韩操操操| 97在线免费看视频| 大香蕉琪琪日本女优不卡| 99性视频| 影音先锋日本乱伦| 精品人妻一区二区免费看| 日欧美色| 欧差乱伦二三| 97超级欧美| 婷婷伊人綜合中文字幕| 成人无遮挡毛片免费看| 日韩欧视频| AV色天香在线| 国产成人精品日本亚洲语言| 日韩精品人妻| 国产久9| 最新日日夜夜天天干干| 亚洲 在线| 亚洲乱码国产乱码精网站| 91亚洲电影| 青青欧洲黑| 久热大香蕉| 国产又大又粗又长视频| 欧美 亚洲 另类 综合| 日韩久久激情精品| 欧美亚洲丝袜人妻制服中文99| 综合亚洲欧美精品日韩?v| 99性爱视频| 无码137片内射在线影院| 成人av影院在线观看| 欧美久久九九| 96久久精品一二三区色欲| 秋霞色色影院| 精品夜夜澡人妻无码AV| 亚洲图片 激情小说| 99re6久热只有精品6在线直播| 无码聚合| 国产粉嫩蜜臀av一区二区三区| 亚洲日本大香蕉1| 看看小穴| 色欲日韩欧美在线一区| 精品人妻免费观看| 国产久久久| 超碰久久.com| 国产精品视频播放| 特级大荫道BBwBBwBBW| www.99热| 免费观看啪视频| 色色香蕉| 人人操人人摸人人看人人干| 亚洲欧美黄| 97天天| 亚洲图片视频小说| 久久人妻一区二区三区高清 | 亚洲国产福利视频| www.四虎在线| 欧美精品在线观看| 91丝袜美女| 国产a级午夜毛片| 大香网站| 岛国在线免费视频| 五月婷婷丁香六月丁香| 成人五级久久| 无码高清少妇久久| 欧美日韩不卡a片| 成人免费看吃奶视频网站| 美国日韩黄片| 免费自拍三级综合| 思思热国产在线视频| 亚洲天天操| 男人天堂网站| 欧美片第一页| 午夜精品久久久久久久久久蜜桃| 草草影院最新网址| 青娱乐国产盛宴视频| 91人妻做a观看视频| 国产乱人伦AVA麻豆软件.| 国产多人在线观看视频| 欧美色视频在线| 岛国黄色短视频| 日韩AV一起草| 五月花婷婷| 99自拍视频在线| 色五月亚洲| 天天看少妇| 性色一线| 天美精品一区二区三区四区在线观看| 97露脸精品丝袜| 色女免费在线观看视频网址| 超碰97极品9| 色97干| 亚洲A曰本VA欧美VA视频| 精品999999| 一区二区三区高清天码| 日本高清加勒比| 免费9 1久久| 怡春苑东京热| 极品出轨视频网站| 亚洲熟女一区| 精品美女少妇一区二区| 婷婷av在线中文字幕| 日本久久99| 一二三区操逼国产91| 亚洲不卡AV在线| 国产中文字幕在线观看| 人人操人人uiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiiii | 亚洲国产激情国产av| 欧美黄色片AAAAA| 中文字幕 码精品视频网站| 高潮内射在线| 成人精品水蜜桃久久久久久久| 欧美综合第一页| 成·人免费午夜在线观看| 午夜性生活av免费在线看| 乱伦av麻豆| 欧美另类色图片| 天天超级碰碰碰| 蜜桃久久一区二区| 免费观看的黄色的网站| 日欧操屄视频| 性性欧美| 九九九九精品| 亚洲国产欧美中日韩成人综合视频| 国产视频一区二区三区久久亚洲天堂| 大香蕉青青9| 碰碰97| 国产一区二区视频在线播放| 三级三级三级日本99| 亚洲综合贴图91| 精品久久艹| 中文字幕精品一区二| 精品乱码久久久久| 性色av蜜臀av色欲aV| 亚洲,日韩,欧美,成人播放| 中文字幕日韩电影人妻| 99re9在线| 麻豆色约约| 国产精品一区av在线| 91 亚洲 欧洲| 91四海无码日韩欧美| 亚洲AV噜噜狠狠网址蜜桃动漫| 国产少妇与亚洲av| 日本精品久久久久久久| 亚洲97成人在线观看| 国产精品爽爽va在线观看98| 9超碰免费| 91狠狠综| 立川理惠加勒比无码| SUV一区二区在线看| 中文字幕精品码亚洲| 国产无马av| 999九九九九国产动| 草草草视频在线免费看| 91九九九馒头| 老女人综合网| 超碰97精品在线| 中文久久久| 天天影视网综合少妇| 日韩99999| 99自拍视频| 校园春色中文字幕AV| 男女激烈网站最新| 97看操| 亚洲精品免费中文字幕| 国产视频一区二区免费| 啊啊啊97视频| 蜜乳AV一区| 天天综合网在线| 大香蕉免费3| 99精品人人爽| 日韩一级特黄av毛片| 2019午夜福利视频| 91小视频| 中文字幕第23区| 日韩视频啪啪| 欧美亚洲涩涩| 色综合久久88色综合久久天天| 男女香蕉一区二区| 天天操天天干一区二区 | 五月天社区| 美女t无毒不卡不卡| 黑人操一区二区| 色综合加勒比四四季| 亚洲麻豆av一区二区| 91美女在线看| 国产精品成人无码a v毛片| 天天干天天日天天射黄色大片| 欧美爱三级日韩久久| 亚洲色图 欧美热图 清纯唯美 另类自拍 | 久久亚洲欧美中文字幕国语| 色色色99| 日本超碰在线国产一区| 啊啊啊啊啊在线观看网址 | 中文字幕乱亚洲美女精品一区| 一本大道久| 亚洲日本大香蕉1| 草草草视频| 国产主播福利| 欧美三级中文字幕hd| 国产男人又猛又粗又爽| 精品视频97| 91欧美少妇| 岛国激情视频软件| 69一区二区| 亚洲av国产av综合av卡| 综合久久中文字幕综合日韩精品| 色翁荡息又大又硬又粗又爽| 日韩免费性爱视频在线观看| 欧美色图亚洲激情| 日本天天操| 国产AV色黄看到爽| 91美女精品| 久久精品免视看国产成人﹣蜜臀av一区. 久久精品免视看国产成人,蜜臀av一区 | 中文欧丝袜诱惑| 日韩操人| 日日摸日日碰夜夜爽视频| 天天日天天射天天干| 国产女人成人精品视频| 亚洲成人在线乱码色午夜| 熟女天天干| 99自拍视频在线观看| 大香蕉专区| 免费a v| 狠狠爱夜夜干| 日韩 人妻 精品| 亚洲精品日日夜夜52| 成全动漫视频观看免费下载| 91操熟女视频| 国产精品久久久久久久久久久久久久久久久久| 性色av婷婷久久一区二区点复制| 乱伦一二三区| 91第一页| 热热色国产一二区AV| 亚洲一区二区三区四区视频| 乱伦熟女论坛| AV天堂因数| 蜜桃久久久久久久久久久久| 99视频只有精品| 国产小黄片在线免费观看| 日本孕妇一区二区视频操逼免费看 | 五月丁香综合激情| 欧美综合国产精品久久丁香| 欧美黑人与女人91| 日韩中文9| 亚洲天堂第一页| 99啪| 欧美淫穴| 九九在线精品| 日韩人妻少妇 一区二区三区| 午夜福利免费精品视频| 中文一区在线视频| 蜜乳av一区二区| 国产精品分类在线观看| 天天日天天看| 人妻久久| 国语精品对白| 精品对白久久不卡| 好一吊区二区| 超碰导航97| 亚洲骚男同com| 欧美色图人妻| 日韩黄色小说| 久久是精品| 亚州欧美总和| 国产精品国产| 插入粉嫩少妇视频| 色噜噜日韩精品| 干b网| 偷拍盗拍亚洲色图图片 | 天天干夜夜一操| 三级网色| 精品一区二区人妖| 免费AV播放| 性爱综合网| 久久一区无码| 黄色高清久久无码依人| 久久免费看高潮毛片韩国| 嗯嗯啊啊亚欧精品| 日韩少妇丰满亚洲| 成人精品欧洲亚洲| 色综合 加勒比| 蜜臀中文无码午夜| 亚洲情色欧美| 欧美片第一页| 国产精品白丝在线播放| 蜜乳Av成人片网站| 免费观看的黄色的网站| 婷婷伊人网| 免费观看欧美日韩操逼视频| 国产欧美第五页| 日本精品免费一区二区三区四区| 日韩 成人 有码| 超碰97久| 久久人爽| 91综合国产精品| 欧美色图91p| 国偷自 一区| 亚洲精品九九九| 国产精品国产亚洲区艳妇糸列| 日韩欧美午夜一区二区| 天天激清| 国产人妖视频一区在线观看| 丰满人妻一区二区三区| julia在线观看久久| 欧美日韩亚洲五月天婷婷| 日本在线伊人啪啪| 色哟哟 日韩精品| 少妇xx精品| 丁香六月天| 欧美72网页| 美女黄站| 色色毛片| 综合网色| 东京热一区二区三区四区五区六区| 久艹伊人精品综合在线| 欧美国产成人在线| 亚洲中文sv| 美国人人操人人操| 色综合五月天| 日韩钢筋无码高清啾啾啾| 亚洲不卡一| 自拍偷拍 日韩欧美| 自偷自拍的亚洲视频| 插插综合网天天影视网| 丝袜 中出 制服 人妻 美腿 中文字幕| 校园春色AV天堂| 欧美色亚洲| 日本理论在线| 超AV色女| 久久久久幕乱码| 26uuu最新| 无码少妇精品一区二区60岁老人| 久久婷婷色综合一区二区三区| 高潮嗯啊性感美女久久久| 伊人精品国产| 欧美福利视频啊啊啊啊| 国产激情av女片自拍| 97这里只精品| 97国产|免费| 约操熟妇| 91色女| 69久久久久久久久久久久久| 97欧美日韩综合| 欧亚在线视频| 秋霞成人一级在线观看| 日本欧美一区二区三区视频麻豆| 国产三级多多影院2022国产AA一级毛片无码| 日韩三级久久久| 丝袜美腿91| 日va操| 九九英色视频| 婷婷丁香激情| 亚洲 欧美都市激情| 久热精品在线| 九九综合久久| 青草影院内射高潮| 日本色色色网站免费看不卡| 日日干夜夜干| 久久99久久99精品天美传媒棢·纸:. | 成人国产视频在线观看| 精品人妻伦一二三区久久| 99re在线视频国产| 色色香蕉| 久操在97| 美女一区二区国产精品| 欧美国产有色电影| 国产精品视频一区二区三区八戒| 97视频7| 亚洲美女精品九九视频| 男人的天堂2019AV| 97碰碰色| 日韩人妻资源网| 蜜臀一区二区三区亚洲最新章节在线观看 - 高清蜜臀一区二区三区亚洲全集播放 | 色欲日韩欧美在线一区| 91处女在线视频| 日韩激情小说一区二区| 日韩中文字幕av在线播放| 黄色免费网| 可以在线观看AV的网站| 91成人久久| 久久亚洲AV无码白度| 欧美精品人妻视频| 天天网综合| 亚洲激情 欧美色图| 自拍偷拍第26| 人妻天天操天天爽视频免费| 国产毛片毛片4p懂色| 少妇诱惑视频| 极品尤物自安慰| 丝袜狂射91| 五月丁香婷婷综合| 久久国产乱子伦精品免费女,网站| 五月色丁香| 性猛交| 久久久婷| 久久久久久国产手机AV| 久偷拍欧美日韩三区| 天天搞在线综合网| 天天舔天天日天天射| av久日| 精品国产99| 精品然女一区二区| 欧美日韩情色一区二区| 97在线免费看| 91丝袜美腿网站| 大香蕉啪啪啪| 丁香五月AV| 强奸乱伦Av网| 人人看欧美性爱| 在线免费观看日韩一区| 国产精品69人妻无码久久久| 久久精品国产99精品亚洲蜜...| 91P0RNY大屁股人妻| 立川理惠被中出无码| 国产美女在线精品免费看| 精品欧美不卡在线播放| 美女视频尤物网在线看| 日本人人操人人操| 五月天激情网站| 96AV久久久| 日本好吊色视频| rion磁力链接| 久操com| 亚洲午夜AV| 自拍丝袜美腿人妻| 久久是精品| 91在线欧美| 久热大香蕉| 亚州中文字幕超碰97| 清纯唯美亚洲综合| 国产丝袜欧美在线视频| 一区二区三区精品视频| 夜夜高潮夜夜爽| 精品女同一区| 成人av福利在线观看| 中文一区在线视频| 97干com| 日韩欧无码一区二区三区免费不卡| 精品性爱| 精品国产91av一区二区三区| 大胆91| 中文精品少妇天堂| 亚洲国产精品成人综合| 欧美后进式| 欧美综合综合| 男人高清无码一区二区| 亚洲无码99| 老司机香蕉久久久久| www.91理论| 一区二区三区四区在线不卡| 性爱视频无打码在线观看| 嗯嗯嗯,草死我| 日韩在线观看三级电影| 男人天堂一区二区| 婷婷丁香人妻 | 怡红院亚洲怡春院av| 九九aV| 91N综合网| 精品v1区| 人妻干天天| 日产123区精品免费观看| 妇女性内射冈站HDWWWCOM| 超碰在线974| 日韩精品碰碰| 好屌色综合| 中文字幕 码 自拍 视频 区| 欧美色图亚洲色,麻豆| 婷婷五月av| 成人毛片免费| 国内精品久久国产,www香蕉久久五月丁香,亚洲欧美日韩精品永久在线,日本精品一 | 操高情无码| AV99热18这里只有精品| 日韩操p| 色五月婷婷五月天| 天天欧美色| 一级毛片久久久久久久女人18| 亚洲国产一区二区三区在线| 久久一区二区蜜桃| 伊人色综合超碰| 国产无码三级视频在线观看| 97国产精品久久久久| 欧美日韩高潮喷水91| 亚洲色图欧美视频| 亚洲色婷婷久久91| 另类专区加勒比| 97超碰色五月| xxxx网站亚洲精品| 香蕉99秘 一区精品蜜桃臀| 亚洲AV高潮| 黄色污污污污污污网站| www.久久制服糖| 欧美性暴力猛交| 亚洲综合嫩| 国产性感在线观看| 亚洲AV成人在线| 国产精品宅男免费| 情趣丝袜无码操逼视频| 欧美日韩人妻精品一区二区三区 | aV中亚| 男人天堂东京热| 色综合 加勒比| 亚洲激情欧美色图| 亚洲限制级在线| 啊啊啊 在线观看| 欧美色图天堂在线| 婷婷丁香五月综合| 色香色欲天天综合网天天来吧| 性久久久| 人人 操人人 操人人| 91视频精品| 丁香色狠狠色综合久久小说| 羞涩视频| 亚洲欧洲成人在线电影| 国产在线强奸视频| 综合在线导航一区| 亚洲色啪| 黄污污污污| 亚洲城人男人的天堂| 激情露脸爱| 黄日韩| 精品无人区麻豆乱码1区2区图片|